跳到正文

#编码

今日 51 条
9月30日周三
  1. Augment Code 博客(网页)65

    Augment 发布 Prism 模型路由,按任务分流降低成本

    Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。

    推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。

  2. Augment Code 博客(网页)48

    Cosmos 让智能体跑通完整 SDLC,工程师的角色变成什么?

    Augment Code 的 Cosmos 平台让智能体串联代码审查与事故响应等环节,大型 PR 的人工审查时间从六七小时降到 45 分钟,周产出提升至三倍。事故响应中智能体已处理 81.3% 的告警,值班工程师每周合并的 PR 增加 44%,首次 RCA 时间从约 30 分钟降至 6 分钟。人类仍负责设计判断、风险把控与最终决策。

  3. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 评测 GPT-6 Astra:与 Claude Fable 5.1 并列两大指数第一且成本更低

    Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。

    推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。

  4. Augment Code 博客(网页)52

    Augment Code 构建 Verifier 智能体自动验证 Agent 代码的端到端表现

    Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。

  5. Anthropic:Research(发表成果 · 网页)60

    Anthropic 开放 Claude 真实使用数据,支持外部研究者独立开展研究

    Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。

    推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。

  6. Anthropic:The Institute(旗舰研究长文 · 网页)25

    Anthropic 发布 Claude 应用案例清单:覆盖编程、安全与数据分析

    Anthropic 整理了一份使用 Claude 构建产品的企业清单,涵盖编程工具、网络安全、商业智能与数据分析等类别。清单收录了 Cursor、Devin、Bolt.new、Databricks、Elastic 等产品,其中 Blitzy 用 Claude 关系映射整个代码库并调度数千个专用智能体,Ellipsis 已安装于超 67,000 个代码仓库、平均提升工程效率 20%。

  7. Anthropic:Research(发表成果 · 网页)81

    Anthropic:Claude 用11天自主完成费马大定理的 Lean 计算机验证证明

    Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。

    推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。

  8. Anthropic:The Institute(旗舰研究长文 · 网页)23

    Anthropic 如何为 Claude 各产品构建隔离与管控机制

    Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。

  9. Anthropic:The Institute(旗舰研究长文 · 网页)45

    Anthropic 为 Claude 推出 Connectors 连接器目录,收录 872 个连接器

    Anthropic 为 Claude 上线 Connectors 连接器目录,共收录 872 个连接器,把用户已有的工具接入每一段 Claude 对话。目录中包含 Microsoft 的 Playwright MCP server,可让 Claude 操作网页、截图、填表和自动化测试,以及 Upstash 的 Context7 MCP server,用于拉取版本相关的文档与代码示例。

  10. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  11. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz 分析 AI 工程效率三档分布:均值 20-46%、前沿 3x、工厂级 8x+

    Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。

    推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。

  12. Tomer Tunguz 博客(VC 分析)41

    AI 是糟糕的枪手,却是出色的编辑

    投资人 Tomer Tunguz 认为 AI 是糟糕的枪手但出色的编辑:AI 的声音不属于作者,且所有人共用同一个枪手,用多了文章会失去音乐性。他如今用 AI 当编辑,帮自己打磨导语与核心段,其对冷门统计分析的记忆近乎无懈可击。为应对读者对 AI 写作的质疑,他刻意在文中加入 & 符号、自造词和语法花饰等个人印记。

  13. Anthropic:The Institute(旗舰研究长文 · 网页)79

    Anthropic Claude Platform 页面展示 Claude Opus 5.5、Sonnet 5.5、Fable 5.1 与 Haiku 4.5 定价和平台能力

    Anthropic Claude Platform 页面列出 Claude Fable 5.1、Opus 5.5、Sonnet 5.5 和 Haiku 4.5 的定价与适用场景,如 Opus 5.5 定价 Input $4 / MTok、Output $20 / MTok,面向智能体编码和企业工作。

    推荐理由:原文给出各型号模型定价、上下文与用量场景,读者可据此对照选择构建智能体的方案。

  14. Tomer Tunguz 博客(VC 分析)38

    模型边用边学:测试时训练如何改变 AI 推理成本与记忆机制

    测试时训练让模型在回答提示词时就地做梯度更新,权重随使用而改变,从而把不断增长的 KV-cache 折叠为固定大小的权重,内存占用不再随上下文线性增长。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能免重训把 4b 模型提升到有竞争力的 128k 上下文表现。

  15. Anthropic:The Institute(旗舰研究长文 · 网页)23

    Claude Code 如何加速代码现代化

    Claude Code 面向企业遗留代码库的现代化改造,结合 AI 代码生成与深度代码库理解,在保持业务逻辑完整的前提下支持可扩展迁移。它能生成依赖图、识别死代码、按复杂度与业务影响排定重构优先级,并自动为重构代码创建单元测试、补充回归测试。该工具可接入现有 CI/CD 流水线与版本控制系统,满足企业级安全与合规要求。

  16. Tomer Tunguz 博客(VC 分析)51

    Tomer Tunguz:AI 提升的不是效率而是产出上限

    Tomer Tunguz 分析五年写作数据后认为,AI 自动化草稿并未减少人工编辑,而是提高了同等工作量的产出上限。行级句编辑中位数稳定在每篇约 136 处,而发布文章的质量下限上升最快,第 10 百分位评分从 2.59 升至 3.81,涨幅约为第 90 百分位的两倍。

  17. Anthropic:The Institute(旗舰研究长文 · 网页)80

    Anthropic 发布 Claude Haiku 4.5,SWE-bench Verified 得分 73.3%

    Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。

    推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。

  18. Anthropic:The Institute(旗舰研究长文 · 网页)82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 并降价最多 30%

    Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。

    推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。

  19. Anthropic:The Institute(旗舰研究长文 · 网页)86

    Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低约 40%

    Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。

    推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。

  20. Anthropic:The Institute(旗舰研究长文 · 网页)81

    Anthropic 发布 Claude Fable 5.1:面向编码与长时间智能体任务的新旗舰模型

    Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。

    推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。

  21. Anthropic:The Institute(旗舰研究长文 · 网页)71

    Anthropic 发布 Claude 桌面与移动应用统一下载页

    Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。

    推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。