Anthropic 上线 Claude Marketplace 聚合插件、智能体与服务伙伴
Anthropic 于 9 月 23 日上线 Claude Marketplace,将插件与连接器、智能体和服务伙伴集中到一个入口。
推荐理由:Anthropic 官方发布,明确列出三类入口、2,000 多个连接器插件和承诺支出抵扣方式,便于评估它对采购与工作流的实际影响。
Anthropic 于 9 月 23 日上线 Claude Marketplace,将插件与连接器、智能体和服务伙伴集中到一个入口。
推荐理由:Anthropic 官方发布,明确列出三类入口、2,000 多个连接器插件和承诺支出抵扣方式,便于评估它对采购与工作流的实际影响。
Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。
推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩展了 Vercel 与 Snowflake 用量。
Anthropic 发文说明 Claude Opus 5.5 针对更长、上下文更重的编码会话做了成本优化,估计典型按 token 计费的工作负载运行成本比 Opus 5 低约 40%。
推荐理由:原文用 Claude Code 六个月聚合数据解释长上下文会话成本结构,并给出保护缓存读取的可操作建议。
Anthropic 宣布 Claude Tag(beta)支持个人连接器:在 Slack 频道中让 Claude 使用成员自己账号连接的工具,如 Google Drive、日历、CRM 或 staging 部署,此前只能使用管理员附加到频道的连接器。
Claude 推出插件目录提交门户,插件可打包 MCP 连接器、Agent Skills 或两者,经审核通过后上架 Claude 目录,成为第三方扩展的主要形式。
推荐理由:官方说明插件提交流程、审核与使用分析功能,开发者可据此了解如何为 Claude 构建第三方扩展。
NVIDIA 发布 Open Agent Safety Platform,Anthropic 与其合作,将 NVIDIA 开源软件 OpenShell 引入 Claude Managed Agents 的智能体安全体系。
推荐理由:Anthropic 官方说明与 NVIDIA OpenShell 的分层安全设计,读者可以据此评估企业智能体的权限控制方案。
Asana 让 AI 智能体直接运行在其 Work Graph 模型内,与人类同事一样拥有角色、任务、消息读写和活动流记录,并由 Claude 驱动复杂任务。每个智能体按内容撰写、洞察分析、项目管理等角色预置技能与集成,其有效访问权限受触发者权限约束。智能体的共享记忆仅允许管理员和编辑者写入永久记忆,普通成员反馈只作用于当前任务。
Anthropic 销售团队基于 Claude Managed Agents(beta)构建了一个购买智能体,每天承接数千次对话,将客户从咨询直接引导至结账。该智能体转交的线索转化为商机的概率是旧表单的两倍以上,成交速度快约五天,且客户可选择与智能体或销售代表沟通。一名工程师用几周时间完成初版,销售与内容团队可直接在 Console 中修改系统提示词,上线后每周持续迭代提示词。
Anthropic 宣布 Claude Managed Agents 的记忆功能即日起以公测形式上线。记忆以文件形式挂载在文件系统上,智能体可跨会话学习并共享经验,记忆可通过 API 导出和管理,并带有权限范围、审计日志、版本回滚和内容修订等企业级控制。
推荐理由:官方公告讲清了文件式记忆的机制和企业级控制能力,还给出多家团队的具体效果数字,便于评估对长时程智能体工作的价值。
Claude 宣布将连接器扩展到日常生活类应用,新增 AllTrails、Audible、Booking.com、Instacart、Intuit TurboTax、Spotify、Uber、Tripadvisor 等服务。
推荐理由:官方宣布连接器扩展到日常生活类应用,并说明推荐机制与数据隐私安排,读者可据此评估对日常使用的影响。
Claude 官方宣布在 Managed Agents 中以研究预览形式推出 dreaming,通过回顾过往会话提取模式、整理记忆,让智能体随时间自我改进,开发者可申请访问。
推荐理由:官方发布给出 dreaming、outcomes 与多智能体编排的能力细节和测试数字,读者可据此评估其在复杂任务工作流中的作用。
Anthropic 宣布 Claude Managed Agents 可在用户自控沙箱中运行工具并连接私有网络内的 MCP 服务器。
Anthropic 发布 Swift 包,让 Apple 开发者通过 Apple 的 Foundation Models 框架调用 Claude 处理多步推理、代码生成等复杂任务。
Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。
推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。
Claude 在桌面端 Cowork 中内置浏览器,任务需要访问网站时侧边栏会打开浏览器,由 Claude 导航、读取、点击和填写表单。浏览器与用户浏览器分离,不共享标签页、书签或密码,银行、邮箱和单点登录站点默认排除,企业版可由管理员开启,本周起向 Pro、Max 和 Team 计划推送。
推荐理由:原文说明内置浏览器与 Claude in Chrome 的分工、隐私隔离和推送范围,读者可以据此判断哪种方式适合自己。
Anthropic 宣布 Claude in Chrome 正式面向所有付费 Claude 计划开放,Claude 现在可以在浏览器中自主执行操作,无需每个动作都经人工批准,操作前由安全分类器校验其安全性并匹配用户请求。
推荐理由:官方宣布 Claude in Chrome 全量开放并支持自主操作,同时给出提示注入防护机制与评测数据,便于读者评估其浏览器自动化能力。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,接入 Shopify、Salesforce、Stripe、Zoom、Xero 等工具,覆盖周报、线索响应、提案撰写、营销内容和月末关账等场景,产品自 5 月上线以来安装量超过 90 万次。
推荐理由:官方公布了新增工作流和集成的具体数量与用户案例,读者可以对照自己的工具链判断是否值得接入。
Anthropic 于 6 月 20 日发布 Claude 3.5 Sonnet,官方称其在推理、编程和部分数学任务上超越 OpenAI 的 GPT-4o。CEO Dario Amodei 在 TIME 采访中表示,公司已获高个位数十亿美元融资,但仍视自己相对巨头为弱势一方,并称未看到 scaling laws 放缓的证据。
Anthropic CEO Dario Amodei 在 Stripe 的 "A Cheeky Pint" 播客中与 John Collison 对话,谈及 Anthropic 年化收入(ARR)增长至约 50 亿美元。他讨论了 AI 模型表现出的"资本逐利冲动"、对智能体未来的预测、模型生意的经济学,以及 19 世纪活力论(vitalism)概念。
Cognition 为 Claude Sonnet 4.5 重构了 Devin,新版本速度快 2 倍,Junior Developer Evals 提升 12%,现已开放 Agent Preview,旧版 Devin 仍可使用。团队观察到该模型会感知自身上下文窗口、主动写笔记和并行执行工具调用,为此调整了提示词和记忆管理架构,并分享了子智能体、元智能体提示词等后续探索方向。
Cognition 宣布 Claude Sonnet 4.5 今日起可在 Devin 中使用,同时发布新的 Devin Agent Preview,速度提升超过 2 倍,Jr. Developer Evals 提升 12%。
Augment 在 Terminal Bench 2.0 上用 Opus 4.7 对比 Auggie CLI 与 Claude Code,Auggie 通过率 67.4% 对 66.3%,总 token 少 32%、成本低 33%($463.04 对 $694.50)。
Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。
推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。
ARC Prize 官方推出 ARC-AGI-Pub 公开排行榜,使用公开评测集,取消算力限制、允许联网,并提供 15 万美元验证基金,对复现并验证的高分提交报销最高 $2,500 API 费用。
Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。
推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。
Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。
推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。
ARC Prize 官方公布 2024 年获奖名单并发布技术报告,共 1,430 支团队提交 17,789 份方案,大奖仍未被认领。the ARChitects 以 53.5% 获第一名并获 2.5 万美元,Kaggle 竞赛期间 ARC-AGI-1 SOTA 从 33% 升至 55.5%(MindsAI 因未开源不符获奖资格)。
ARC Prize 介绍 2024 年 ARC Prize 竞赛末期两个登上 ARC-AGI 公开榜单新 SOTA 的开源方案。
Anthropic 发布 Claude 认证咨询与系统集成合作伙伴名单,并开放 Claude Partner Network 加入。
Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。
推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。
Anthropic 整理了一份使用 Claude 构建产品的企业清单,涵盖编程工具、网络安全、商业智能与数据分析等类别。清单收录了 Cursor、Devin、Bolt.new、Databricks、Elastic 等产品,其中 Blitzy 用 Claude 关系映射整个代码库并调度数千个专用智能体,Ellipsis 已安装于超 67,000 个代码仓库、平均提升工程效率 20%。
Tomer Tunguz 分析称 Anthropic 的算力支出约为其薪酬总额的 2.3 倍,约 5000 名员工对应 2026 年约 $10b 推理与训练支出,即每人每年约 $2m;而软件行业前 1% 公司每工程师每年 AI 支出为 $89k,中位数仅 $137。
Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。
推荐理由:报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。
Anthropic 为 Claude 推出插件市场,收录 340 个插件,可将工具、技能与集成打包为一键安装。
推荐理由:原文列出了插件市场的实际内容和安装方式,读者可以据此挑选适合自己的 Claude 扩展组合。
Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。
推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。
Anthropic 上线活动页面,汇总即将举办的活动、直播与往期会议录像,包括 10 月 14 日的 Claude Founder House Stockholm 和 10 月 6 日的 Claude Founder House San Francisco。页面还列出 Claude in Production、从手动编码到多智能体编排等网络研讨会系列,并提供开发者月度通讯订阅。
Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。
推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。
The Economist 用 1981 年以来覆盖 100 国的世界价值观问卷测试 25 个前沿 AI 模型,按世俗到传统、生存到自我表达两轴绘制分布。
Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。