跳到正文

全部动态

今日 53 条
9月30日周三
  1. METR:Blog(网页)48

    METR:独立研究者如何调查 AI 失准事件背后的行为倾向

    METR 提出一套第三方独立调查框架,用于在 AI 智能体出现失准事件后查明其行为动机。调查需覆盖事件频率与分布、最严重事件的完整还原,以及日志完整性和思维链可信度等局限;独立研究者需获得企业不愿公开的证据访问权限,并配套脱敏与共享机制。METR 表示正建设更系统化的调查能力,并愿与 AI 公司合作调查重大事件。

  2. LlamaIndex:产品、工程与评测65

    LlamaIndex:文档 OCR 不会被前沿模型商品化

    LlamaIndex 发文反驳「文档解析终将被模型 API 免费覆盖」的观点,认为文档 OCR 的帕累托前沿远高于最新前沿模型。其开源基准 ParseBench(约 2,000 页人工核验企业文档、167,000+ 条测试规则)显示,从 GPT-4o 到 GPT-5.5 三代模型解析准确率提升约 24 分但每页成本约涨 4 倍,最好的前沿模型仍比专用引擎低 20 分。

    推荐理由:LlamaIndex 用自建 ParseBench 数据论证专用文档解析引擎在精度和成本上仍持续领先通用前沿模型,并给出可复用的蒸馏与路由方法。

  3. Stanford HAI News(网页)52

    斯坦福 HAI 发布政策简报探讨世界模型治理为何是 AI 下一个政策挑战

    斯坦福 HAI 发布政策简报,探讨为何治理世界模型是比大语言模型更复杂的政策挑战。简报将世界模型分为渲染器、模拟器和规划器三类,指出其带来物理风险、国家安全影响和数据集中问题;李飞飞等人建议资助测量科学、以采购要求独立测试、投资共享数据基础设施,并强调当前没有基准足以支持安全关键部署审批。

  4. Stanford HAI News(网页)34

    斯坦福 HAI:AI 如何加速科学发现,从 Evo 2 到虚拟细胞

    斯坦福 HAI 发文梳理 AI 加速科学发现的进展:Brian Hie 团队打造的 Evo 2 是迄今最大的生物学 DNA 语言模型,基于 9 万亿碱基对、400 亿参数训练,可像聊天机器人一样补全基因序列。Emma Lundberg 团队则正构建模拟人类细胞的基础模型,用于加速药物发现与个性化医疗,并为此开发了 Biomni 供生物学家交互分析数据。

  5. Fireworks AI(网页)50

    Fireworks AI:从租用闭源前沿模型到训练自有模型,企业迈向专业化智能的三阶段路径

    Fireworks AI 发文梳理企业迈向专业化智能的三阶段路径:先租用闭源前沿模型并围绕其搭建提示词、上下文与 harness 工程,再引入更便宜的开源模型优化成本与延迟,最终为真正属于自己的问题训练定制模型。文中以 Kimi K3 与 GPT 5.6 Sol 在 OSWorld 2.0、UIPad 上的对比为例,说明基准只能用于初筛,自建评测才是性能的最佳指标。

  6. Epoch AI:研究、数据与评测27

    Epoch AI 探讨 AI 未来:并行化限制、智能爆炸与推理基准

    Epoch AI 发布系列研究探讨 AI 未来走向,其中报告指出即使自动化 AI 研发能产出数百万虚拟研究员,进展仍可能受限于拆分、协调与重组工作的并行化能力。EBR-Bench 结果显示前沿模型在桌游 Earthborne Rangers 的 30 次通关中毫无进步,得分远低于人类专家。另一项研究考察四项能力指标,其中三项显示 AI 能力近期加速的强证据,驱动力来自推理模型。

  7. Augment Code 博客(网页)44

    Augment Code:AI 原生转型的四个阶段,从智能体采纳到智能体编排

    Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。

  8. Augment Code 博客(网页)46

    Augment Code:单模型工程时代已经结束

    Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。

  9. Tomer Tunguz 博客(VC 分析)49

    AI 的迷你钢厂:本地分类器分流让 Mac 承担 78% 的 AI 工作

    把后台 AI 工作先交给设备端小型分类器判断难易,只将最难任务上送云端,单台 Mac 的吞吐量提升约 25%,队列等待从 73 秒降至 4 秒。过去七天该 Mac 承担了 78% 的 AI 工作、日峰值达 88%,平均任务时长从 47 秒降到 19 秒。作者将其类比 Nucor 的迷你钢厂,认为配备蒸馏模型的笔记本、手机与边缘设备将成为企业内的“迷你钢厂”,只按云端价格支付最难的那五分之一。

  10. Tomer Tunguz 博客(VC 分析)69

    Tomer Tunguz 分析 AI 领域的开源模型替代潮

    Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。

    推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。

  11. Tomer Tunguz 博客(VC 分析)65

    Tomer Tunguz 谈 Anthropic Fable 带来的 AI 玻璃天花板

    Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。

    推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。

  12. Tomer Tunguz 博客(VC 分析)43

    AI 应用的黄金时代:从 Fable 下架、Nadella 生态论到 Salesforce 收购 Fin

    AI 应用正进入黄金时代,三件事印证了这一判断:美国政府下令下架 Fable、Nadella 提出生态护城河不在模型本身、Salesforce 以 36 亿美元收购 Fin。构建 AI 应用需掌握三项新能力:挑选合适模型、设计爬坡循环、评估模型与循环的组合表现,核心是每 token 预算能榨出多少智能。

  13. Tomer Tunguz 博客(VC 分析)31

    Glean CISO Sunil Agrawal 谈如何防御 AI 驱动的攻击者

    Glean CISO Sunil Agrawal 将做客 Office Hours,讨论攻击者使用前沿模型进行侦察、钓鱼、深度伪造和漏洞生成时的安全准备。对话于太平洋时间 7 月 9 日周四上午 9 点举行,聚焦 AI 压缩目标理解与攻击面测绘时间、攻击语法与语气线索消失、深度伪造通话改变审批与支付信任控制面等议题。

  14. Anthropic:Research(发表成果 · 网页)81

    Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

    Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。

    推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。

  15. Tomer Tunguz 博客(VC 分析)37

    Theory Ventures 成立三周年:AI 压缩时间如何重塑风投与推理市场

    Theory Ventures 在成立三周年回顾中提出,AI 正在压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 的主导市场。该机构认为 seed 轮规模已从 100 万美元延伸至 5 亿美元,传统融资阶段分类不再代表公司成熟度;闭源与开源、云端与本地模型的差距也在收窄,本地运行可降低成本、改善延迟并减少数据治理顾虑。

  16. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  17. ARC Prize:官方博客38

    ARC Prize 基金会就美国 AI 行动计划发表声明

    ARC Prize 基金会称其 3 月向白宫 OSTP 提交的三项建议——建立独立 AI 评估组织生态、设立联邦 AI 基准测试中心、确保美国主导全球 AI 标准——全部被纳入白宫 AI 行动计划。OSTP 已责成 NIST、CAISI、DOE 和 NSF 牵头评估科学、建设测试平台并召集社区。该基金会同时发布首个"交互推理"评测 ARC-AGI-3,用于衡量模型在陌生环境中的技能获取效率。

  18. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz 分析 AI 工程效率三档分布:均值 20-46%、前沿 3x、工厂级 8x+

    Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。

    推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。

  19. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz:OpenRouter 上 GPT-OSS-120b 仍占 Claude Opus 4.8 三分之一流量,token 市场加速分层

    Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。

    推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。