跳到正文

#Agent

今日 14 条
9月30日周三
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 收购 The Interaction Company,Poke 团队加入

    Cognition 宣布收购 The Interaction Company of California,即个人智能体应用 Poke 的开发团队。Poke 是一款通过短信主动与用户互动的个人智能体,近三个月用户与它交换了超过 1 亿条消息,也是唯一获准在 Apple Messages 上原生发短信的 AI 智能体。

  2. Baseten 工程博客(网页)13

    Baseten 解读 Compound AI:用多模型组合替代单体大模型

    Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。

  3. Augment Code 博客(网页)44

    Augment Code:AI 原生转型的四个阶段,从智能体采纳到智能体编排

    Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。

  4. Augment Code 博客(网页)46

    Augment Code:单模型工程时代已经结束

    Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。

  5. Augment Code 博客(网页)65

    Augment 发布 Prism 模型路由,按任务分流降低成本

    Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。

    推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。

  6. Augment Code 博客(网页)48

    Cosmos 让智能体跑通完整 SDLC,工程师的角色变成什么?

    Augment Code 的 Cosmos 平台让智能体串联代码审查与事故响应等环节,大型 PR 的人工审查时间从六七小时降到 45 分钟,周产出提升至三倍。事故响应中智能体已处理 81.3% 的告警,值班工程师每周合并的 PR 增加 44%,首次 RCA 时间从约 30 分钟降至 6 分钟。人类仍负责设计判断、风险把控与最终决策。

  7. Augment Code 博客(网页)52

    Augment Code 构建 Verifier 智能体自动验证 Agent 代码的端到端表现

    Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。

  8. Tomer Tunguz 博客(VC 分析)49

    AI 的迷你钢厂:本地分类器分流让 Mac 承担 78% 的 AI 工作

    把后台 AI 工作先交给设备端小型分类器判断难易,只将最难任务上送云端,单台 Mac 的吞吐量提升约 25%,队列等待从 73 秒降至 4 秒。过去七天该 Mac 承担了 78% 的 AI 工作、日峰值达 88%,平均任务时长从 47 秒降到 19 秒。作者将其类比 Nucor 的迷你钢厂,认为配备蒸馏模型的笔记本、手机与边缘设备将成为企业内的“迷你钢厂”,只按云端价格支付最难的那五分之一。

  9. Tomer Tunguz 博客(VC 分析)43

    AI 应用的黄金时代:从 Fable 下架、Nadella 生态论到 Salesforce 收购 Fin

    AI 应用正进入黄金时代,三件事印证了这一判断:美国政府下令下架 Fable、Nadella 提出生态护城河不在模型本身、Salesforce 以 36 亿美元收购 Fin。构建 AI 应用需掌握三项新能力:挑选合适模型、设计爬坡循环、评估模型与循环的组合表现,核心是每 token 预算能榨出多少智能。

  10. Anthropic:The Institute(旗舰研究长文 · 网页)25

    Anthropic 发布 Claude 应用案例清单:覆盖编程、安全与数据分析

    Anthropic 整理了一份使用 Claude 构建产品的企业清单,涵盖编程工具、网络安全、商业智能与数据分析等类别。清单收录了 Cursor、Devin、Bolt.new、Databricks、Elastic 等产品,其中 Blitzy 用 Claude 关系映射整个代码库并调度数千个专用智能体,Ellipsis 已安装于超 67,000 个代码仓库、平均提升工程效率 20%。

  11. Anthropic:Research(发表成果 · 网页)78

    Anthropic 报告:Claude 自动化对齐研究可靠缓解十类对齐失败

    Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。

    推荐理由:报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。

  12. Anthropic:Research(发表成果 · 网页)81

    Anthropic:Claude 用11天自主完成费马大定理的 Lean 计算机验证证明

    Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。

    推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。

  13. ARC Prize:官方博客44

    ARC Prize 推出 SnakeBench:50 个 LLM 贪吃蛇对战基准

    ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。

  14. Anthropic:The Institute(旗舰研究长文 · 网页)23

    Anthropic 如何为 Claude 各产品构建隔离与管控机制

    Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。

  15. Tomer Tunguz 博客(VC 分析)37

    Theory Ventures 成立三周年:AI 压缩时间如何重塑风投与推理市场

    Theory Ventures 在成立三周年回顾中提出,AI 正在压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 的主导市场。该机构认为 seed 轮规模已从 100 万美元延伸至 5 亿美元,传统融资阶段分类不再代表公司成熟度;闭源与开源、云端与本地模型的差距也在收窄,本地运行可降低成本、改善延迟并减少数据治理顾虑。

  16. ARC Prize:官方博客66

    ARC Prize 发布 ARC-AGI-3 Preview 30 天总结:人类轻松通关,AI 智能体进展艰难

    ARC Prize 基金会总结 ARC-AGI-3 Preview 上线 30 天的发现,首个交互式推理基准显示人类大多能通关游戏,AI 智能体则难以高效推进。竞赛收到 12 份提交,冠军 StochasticGoose 得分 12.58%,完成 18 个关卡,团队还提出以行动效率衡量智能,并计划增加撤销、离线引擎等改进。

    推荐理由:原文给出了人类与 AI 在交互式推理基准上的行动效率差距和评分框架,读者可以据此理解智能评测的新方向。

  17. Anthropic:The Institute(旗舰研究长文 · 网页)67

    Claude 正式登陆 Microsoft Foundry,可通过 Azure 账单计费并计入 MACC

    Claude 现已在 Microsoft Foundry 正式可用,企业可用现有 Azure 认证、计费与治理体系构建生产应用和企业智能体,用量计入 Azure 账单,符合条件的支出可计入 MACC。

    推荐理由:原文说明 Claude 在 Microsoft Foundry 正式可用后的计费、合规与部署方式,读者可据此评估接入 Azure 工作流的可行性。

  18. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz 分析 AI 工程效率三档分布:均值 20-46%、前沿 3x、工厂级 8x+

    Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。

    推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。

  19. Anthropic:The Institute(旗舰研究长文 · 网页)32

    Claude 登陆 Google Cloud:用 Anthropic 模型构建高级 AI 智能体

    Anthropic 的 Claude 模型现可在 Google Cloud 上运行,支持 MCP、提示词缓存与专用容量,并可在无服务器基础设施上按负载扩展。该组合将 Anthropic 的安全模型与 Google Cloud 的基础设施、统一治理和安全控制结合,用于构建和部署生产级 AI 智能体。官方称有团队借此将代码开发速度提升 20% 至 30%。