Claude Managed Agents 推出 dreaming 功能并开放 outcomes、多智能体编排与 webhooks
Claude 官方宣布在 Managed Agents 中以研究预览形式推出 dreaming,通过回顾过往会话提取模式、整理记忆,让智能体随时间自我改进,开发者可申请访问。
推荐理由:官方发布给出 dreaming、outcomes 与多智能体编排的能力细节和测试数字,读者可据此评估其在复杂任务工作流中的作用。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
Claude 官方宣布在 Managed Agents 中以研究预览形式推出 dreaming,通过回顾过往会话提取模式、整理记忆,让智能体随时间自我改进,开发者可申请访问。
推荐理由:官方发布给出 dreaming、outcomes 与多智能体编排的能力细节和测试数字,读者可据此评估其在复杂任务工作流中的作用。
Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。
推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。
Claude 在桌面端 Cowork 中内置浏览器,任务需要访问网站时侧边栏会打开浏览器,由 Claude 导航、读取、点击和填写表单。浏览器与用户浏览器分离,不共享标签页、书签或密码,银行、邮箱和单点登录站点默认排除,企业版可由管理员开启,本周起向 Pro、Max 和 Team 计划推送。
推荐理由:原文说明内置浏览器与 Claude in Chrome 的分工、隐私隔离和推送范围,读者可以据此判断哪种方式适合自己。
Anthropic 宣布 Claude in Chrome 正式面向所有付费 Claude 计划开放,Claude 现在可以在浏览器中自主执行操作,无需每个动作都经人工批准,操作前由安全分类器校验其安全性并匹配用户请求。
推荐理由:官方宣布 Claude in Chrome 全量开放并支持自主操作,同时给出提示注入防护机制与评测数据,便于读者评估其浏览器自动化能力。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,接入 Shopify、Salesforce、Stripe、Zoom、Xero 等工具,覆盖周报、线索响应、提案撰写、营销内容和月末关账等场景,产品自 5 月上线以来安装量超过 90 万次。
推荐理由:官方公布了新增工作流和集成的具体数量与用户案例,读者可以对照自己的工具链判断是否值得接入。
Trail of Bits 发布研究称,公共技能市场正被窃取凭据、外传数据、劫持智能体的恶意技能淹没,而现有扫描器难以拦截。
推荐理由:Trail of Bits 用四个自研恶意技能实测并绕过多家技能扫描器,读者可以从中了解静态扫描在供应链攻击面前的结构性局限。
Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。
推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。
Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。
推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。
Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。
推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。
Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。
推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。
Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。
推荐理由:报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。
Anthropic 为 Claude 推出插件市场,收录 340 个插件,可将工具、技能与集成打包为一键安装。
推荐理由:原文列出了插件市场的实际内容和安装方式,读者可以据此挑选适合自己的 Claude 扩展组合。
Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。
推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。
Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。
推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。
AI 公司在 12 个月内投入 $9.75b 于前向部署工程(FDE),相当于 Accenture 年度人力成本的四分之一。
推荐理由:原文把 $9.75b FDE 投入拆成三种资本结构,并解释部署取代模型能力成为瓶颈后的护城河逻辑。
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。
Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。
推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。
Claude 现已在 Microsoft Foundry 正式可用,企业可用现有 Azure 认证、计费与治理体系构建生产应用和企业智能体,用量计入 Azure 账单,符合条件的支出可计入 MACC。
推荐理由:原文说明 Claude 在 Microsoft Foundry 正式可用后的计费、合规与部署方式,读者可据此评估接入 Azure 工作流的可行性。
ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。
推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。
Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。
推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。