跳到正文

#编码

今日 5 条
9月30日周三
  1. Cognition 模型 / Devin 博客(网页)56

    Cognition 发布测量 Devin 等效工程工时的估算系统

    Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。

  2. Cognition 模型 / Devin 博客(网页)68

    Cognition 发布 Devin Fusion:混合模型架构以最高 60% 更低成本保持前沿编码性能

    Cognition 推出 Devin Fusion 预览,一个混合模型 harness,通过并行前沿模型与低成本 sidekick 智能体、以及基于轻量分类器在上下文压缩时动态切换模型。

    推荐理由:官方披露了 sidekick 双智能体与中途动态路由两类可参考的降本架构,并给出 FrontierCode 上的成本与性能数据。

  3. Cognition 模型 / Devin 博客(网页)53

    Cognition 发布 Devin Security Swarm

    Cognition 发布 Devin Security Swarm,可扫描代码库发现漏洞、在运行时验证可利用性并提交修复 PR。它用并行 Agent 跨文件推理业务逻辑缺陷和链式攻击路径,在隔离沙箱中复现后开 PR。

  4. Cognition 模型 / Devin 博客(网页)49

    FrontierCode 1.1 发布:区分合法与不公平的互联网使用

    Cognition 发布 FrontierCode 1.1,通过“公平使用互联网”提示词与程序化检测两项措施,将各模型的不公平联网行为降至 1% 以下。该版本还审计了 1000+ 条评分标准并放宽其中 75 条过严项,新增 Sonnet 5 分数并更新 Fable 5,此后仅报告 Main 与 Extended 子集,不再报告 Diamond 子集。

  5. Augment Code 博客(网页)44

    Augment Code:AI 原生转型的四个阶段,从智能体采纳到智能体编排

    Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。

  6. Augment Code 博客(网页)46

    Augment Code:单模型工程时代已经结束

    Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。

  7. Augment Code 博客(网页)65

    Augment 发布 Prism 模型路由,按任务分流降低成本

    Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。

    推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。

  8. Augment Code 博客(网页)48

    Cosmos 让智能体跑通完整 SDLC,工程师的角色变成什么?

    Augment Code 的 Cosmos 平台让智能体串联代码审查与事故响应等环节,大型 PR 的人工审查时间从六七小时降到 45 分钟,周产出提升至三倍。事故响应中智能体已处理 81.3% 的告警,值班工程师每周合并的 PR 增加 44%,首次 RCA 时间从约 30 分钟降至 6 分钟。人类仍负责设计判断、风险把控与最终决策。

  9. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 评测 GPT-6 Astra:与 Claude Fable 5.1 并列两大指数第一且成本更低

    Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。

    推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。

  10. Augment Code 博客(网页)52

    Augment Code 构建 Verifier 智能体自动验证 Agent 代码的端到端表现

    Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。

  11. Anthropic:Research(发表成果 · 网页)60

    Anthropic 开放 Claude 真实使用数据,支持外部研究者独立开展研究

    Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。

    推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。

  12. Anthropic:The Institute(旗舰研究长文 · 网页)25

    Anthropic 发布 Claude 应用案例清单:覆盖编程、安全与数据分析

    Anthropic 整理了一份使用 Claude 构建产品的企业清单,涵盖编程工具、网络安全、商业智能与数据分析等类别。清单收录了 Cursor、Devin、Bolt.new、Databricks、Elastic 等产品,其中 Blitzy 用 Claude 关系映射整个代码库并调度数千个专用智能体,Ellipsis 已安装于超 67,000 个代码仓库、平均提升工程效率 20%。

  13. Anthropic:Research(发表成果 · 网页)81

    Anthropic:Claude 用11天自主完成费马大定理的 Lean 计算机验证证明

    Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。

    推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。

  14. Anthropic:The Institute(旗舰研究长文 · 网页)23

    Anthropic 如何为 Claude 各产品构建隔离与管控机制

    Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。

  15. Anthropic:The Institute(旗舰研究长文 · 网页)45

    Anthropic 为 Claude 推出 Connectors 连接器目录,收录 872 个连接器

    Anthropic 为 Claude 上线 Connectors 连接器目录,共收录 872 个连接器,把用户已有的工具接入每一段 Claude 对话。目录中包含 Microsoft 的 Playwright MCP server,可让 Claude 操作网页、截图、填表和自动化测试,以及 Upstash 的 Context7 MCP server,用于拉取版本相关的文档与代码示例。

  16. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  17. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz 分析 AI 工程效率三档分布:均值 20-46%、前沿 3x、工厂级 8x+

    Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。

    推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。

  18. Tomer Tunguz 博客(VC 分析)41

    AI 是糟糕的枪手,却是出色的编辑

    投资人 Tomer Tunguz 认为 AI 是糟糕的枪手但出色的编辑:AI 的声音不属于作者,且所有人共用同一个枪手,用多了文章会失去音乐性。他如今用 AI 当编辑,帮自己打磨导语与核心段,其对冷门统计分析的记忆近乎无懈可击。为应对读者对 AI 写作的质疑,他刻意在文中加入 & 符号、自造词和语法花饰等个人印记。

  19. Anthropic:The Institute(旗舰研究长文 · 网页)79

    Anthropic Claude Platform 页面展示 Claude Opus 5.5、Sonnet 5.5、Fable 5.1 与 Haiku 4.5 定价和平台能力

    Anthropic Claude Platform 页面列出 Claude Fable 5.1、Opus 5.5、Sonnet 5.5 和 Haiku 4.5 的定价与适用场景,如 Opus 5.5 定价 Input $4 / MTok、Output $20 / MTok,面向智能体编码和企业工作。

    推荐理由:原文给出各型号模型定价、上下文与用量场景,读者可据此对照选择构建智能体的方案。