跳到正文

#Agent

今日 191 条
9月30日周三
  1. CMU:Machine Learning Blog28

    CMU 在 ICLR 2026:194 篇论文概览

    CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。

  2. Cloudflare Blog77

    Cloudflare:互联网出现第二个受众,智能体流量增长超 1700% 并推动内容付费新机制

    Cloudflare 发文指出互联网出现了由软件代理人类访问的第二个受众:其网络 HTTP 请求从 2024 年底的每秒 6300 万增至近 1.15 亿,一年内 AI 智能体日请求增长超 1700%,今年首次过半流量非人类。

    推荐理由:Cloudflare 用自家网络数据说明智能体流量如何改变流量与收入的关系,并给出可控授权和按使用付费的应对思路。

  3. Augment Code 博客(网页)32

    Augment Code 用 Cosmos 软件工厂实时生成企业试点健康视图

    Augment Code 解决方案架构负责人用其智能体编排平台 Cosmos 生成企业试点健康视图,无需新建数据管道或仪表盘项目。Cosmos 会查询产品使用数据、校正 session lineage、拉取 Salesforce 交易状态,并对照客户通话记录核验结论,输出每个试点的采用度、技术进展、风险与整体健康评估,每个数字都可追溯到实时数据源。

  4. Augment Code 博客(网页)48

    Augment Code 如何用 Cosmos 专家智能体优化 PR 到合并的审查闭环

    Augment Code 将其 Cosmos 代码审查系统从单纯审查扩展到完整的 PR-to-merge 闭环,新增 Verifier、PR Fixer、Review Dashboard 和 cosmos approve 四项能力,由专职专家智能体承担修复、运行时验证与自动审批,人类保留最终合并决定权。该系统此前已帮助其工程组织将代码产出提升 3 倍,同时降低中位合并时间并维持质量。

  5. Augment Code 博客(网页)68

    Augment Code 复盘如何搭建软件工厂,人均规模调整产出提升 4.5 倍

    Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。

    推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。

  6. Artificial Analysis 完整文章(网页)78

    Claude Sonnet 5.5 登上 Artificial Analysis 智能指数第 2 名,token 用量创测量新高

    Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数得分 56(max 档较 Sonnet 5 提升 18 分),仅次于 Opus 5.5 (max)。

    推荐理由:原文给出 Sonnet 5.5 在智能指数、token 用量和成本上的具体数据,读者可据此对比其与 Opus 5.5 和 GPT-6 系列的实际取舍。

  7. Anthropic:Research(发表成果 · 网页)73

    Anthropic:Claude 优化 30 多个开源生物分子模型,平均加速约 4 倍

    Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。

    推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。

  8. Anthropic:Research(发表成果 · 网页)65

    Anthropic Project Swap:201 名员工用 Claude 智能体在交易场上换书

    Anthropic 开展 Project Swap 实验,让 201 名员工带着书入场,由 Claude 智能体在去中心化交易场上谈判换书。仅凭 5 分钟 intake 聊天,Claude 构建的排序与本人自评在 61% 的书对上一致(随机为 50%)。

    推荐理由:实验把市场失灵主要归因于偏好理解而非谈判能力,并给出模型比指令影响更大的量化结果。

  9. Anthropic:Research(发表成果 · 网页)76

    物理学家 Matt von Hippel 复盘 Claude 用 bootstrap 方法算出 N=4 超对称 Yang-Mills 九环振幅

    物理学家 Matt von Hippel 发起挑战后,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 配合 Claude Science 平台算出了 planar N=4 super Yang-Mills 的九环六粒子振幅。

    推荐理由:作者亲历发起挑战到被 Claude 算出九环结果的全过程,给出预算、验证方式和人类团队对比等一手细节。

  10. Anthropic:Newsroom(网页)72

    Anthropic 发布早期成果:Claude 自主发现类 CRISPR 的新型酶系统 ART

    Anthropic 宣布成立生命科学研究组与实验室,并分享早期成果:约 950 个 Claude 智能体用 21 小时和 210 million tokens 搜索 DNA 数据库后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART),模式类似 CRISPR。

    推荐理由:Anthropic 以当事方身份完整披露 Claude 自主发现 ART 酶系统的流程、规模和实验验证方式,读者可以借此了解 AI 智能体驱动生物学研究的具体做法。

  11. Anthropic:The Institute(旗舰研究长文 · 网页)83

    Anthropic 推出 Claude Cowork,支持跨文件与工具完成多步任务

    Anthropic 推出 Claude Cowork,一个面向非编码知识工作的智能体产品,用户给定目标后它可在指定文件夹和工具中直接读写文件、完成多步任务并交出可审查成果,已随付费计划在 web 和移动端(beta)推出,桌面端可访问本机文件夹和应用。

    推荐理由:官方页面给出 Claude Cowork 的任务交接方式、内置浏览器、订阅计划和权限控制,读者可据此评估它对知识工作流的适配。

  12. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Nicholas Carlini 用 16 个并行 Claude 智能体写出可编译 Linux 内核的 C 编译器

    Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。

    推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。

  13. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    Anthropic 工程复盘:Claude Code auto mode 如何用模型分类器替代手动权限审批

    Anthropic 详解 Claude Code 新模式 auto mode 的实现,用基于模型的双层防御替代手动权限审批:输入层提示词注入探针扫描工具输出,输出层运行在 Sonnet 4.6 上的 transcript 分类器在动作执行前评估风险,并以三级放行规则让项目内文件编辑免审。

  14. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)81

    Anthropic 工程复盘:如何为 claude.ai、Claude Code 和 Claude Cowork 构建智能体遏制架构

    Anthropic 工程团队复盘为 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品构建遏制(containment)架构的经验,核心思路是先在环境层用沙箱、VM 和出口控制设定硬边界,再在模型层引导行为。

    推荐理由:Anthropic 自述三大产品的隔离架构与真实事故,给出了环境层优先、匹配用户监督能力、警惕自研组件等可复用原则。

  15. Tomer Tunguz 博客(VC 分析)57

    Vercel COO 称 inbound 销售开发已实现 90% 自动化

    Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中表示,inbound 销售开发实现 90% 自动化,自建客服 Agent 处理 93% 的支持案例,销售开发 Agent ROI 达 32x,两项的年度基础设施账单均为几千美元低位;inbound SDR 团队从 10 人缩至 1.25 人。

  16. Tomer Tunguz 博客(VC 分析)65

    Tom Tunguz 解析 UC Berkeley 研究:harness 决定 AI 答案的成本与毛利

    Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。

    推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。

  17. Tomer Tunguz 博客(VC 分析)64

    Tomer Tunguz:AI 时代软件工程转向系统设计与验证循环

    Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。

    推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。

  18. The Decoder:AI News(RSS)81

    OpenAI 发布 GPT-6.1 Sol,以五分之一成本接近 GPT-6.1 Astra

    OpenAI 发布 GPT-6.1 Sol,因安全问题推迟的旗舰 GPT-6.1 Astra 不按计划上线,Sol 作为更便宜的替代方案推出,OpenAI 称其在 agentic coding、计算机使用和办公任务上接近 Astra,成本约五分之一。

    推荐理由:原文汇总了 GPT-6.1 Sol 的定价与多项基准对比数据,读者可以据此判断它与 Astra、Claude 的成本性能权衡。