跳到正文

#Anthropic

今日 32 条
9月30日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)69

    Anthropic 工程博客:用代码执行提升 MCP Agent 的上下文效率

    Anthropic 发布工程文章,提出让 Agent 通过代码执行方式与 MCP 服务器交互,以解决工具定义和中间结果占用过多上下文的问题。示例场景中 token 消耗从 150,000 降至 2,000,节省 98.7%。文章还介绍了渐进式工具发现、在执行环境中过滤数据、PII 令牌化保护隐私、状态持久化与可复用 Skills 等收益,并提示需要沙箱、资源限制等安全基础设施作为权衡。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)79

    Anthropic 在 Claude 开发者平台推出 Tool Search Tool、Programmatic Tool Calling 和 Tool Use Examples

    Anthropic 在 Claude 开发者平台发布三项 beta 功能:Tool Search Tool 按需发现工具、Programmatic Tool Calling 用代码编排工具调用、Tool Use Examples 在工具定义中提供示例。

    推荐理由:官方给出了三项工具调用新功能的机制说明和内部测试数字,读者可以据此评估大工具库场景下的上下文与准确性权衡。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    Anthropic 工程博客详解 AI Agent 评测:评测器类型、任务设计与从零到一的建设路线

    Anthropic 工程博客发布长文,系统讲解如何为 AI Agent 构建可靠的自动化评测。文章定义了任务、试验、grader、transcript、评测框架等核心概念,对比代码型、模型型和人工三类评测器的优劣,分别给出编码、对话、研究和计算机使用四类 Agent 的评测方法,并解释 pass@k 与 pass^k 两种指标在非确定性下的差异。

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程师复盘如何设计抗 AI 的技术评测

    Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。

    推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。

  5. Transluce(网页)75

    Transluce 发布迄今最大规模 AI 模型心理健康危机响应独立评测

    Transluce 发布针对主流 AI 模型心理健康危机响应的独立评测,模拟超过 50000 场对话、逾 100 万条消息,覆盖 77 个模型变体,并与 OpenAI、Anthropic、Google DeepMind 合作获取脱敏真实使用数据。

    推荐理由:原文给出了模拟规模、模型代际对比结果和开放数据集,读者可以据此了解 AI 心理健康安全评测的现状与方法。

  6. Anthropic:Transformer Circuits(可解释性研究)35

    Anthropic 可解释性研究:特征与上下文学习的新发现

    Anthropic 可解释性团队在月度更新中指出,模型对跨语言相似文本的活跃特征重叠度(IoU)随样本长度增加而上升。通过对比英法段落首尾句,末句 IoU 显著高于首句,且无关语句的首句重叠度高于末句,支持"模型在更长上下文中构建更丰富表征"的解释,而非虚假激活所致。

  7. Anthropic:Transformer Circuits(可解释性研究)46

    Anthropic 可解释性研究:多选题场景中的“危害压力”机制

    Anthropic 可解释性团队发现,在多选题中加入有害意图语句后,Claude 3.5 Haiku 在 129 道二选一题目上的准确率从 100% 降至 48.1%。原因是“危害检测”key 特征与“拒绝”query 特征相互作用,压低了对正确答案的注意力分数;单独对这一个拒绝特征做负向引导即可将准确率恢复到 93%。

  8. Anthropic:Transformer Circuits(可解释性研究)58

    Anthropic 提出 Activation Oracles:训练 LLM 用自然语言回答关于自身激活的问题

    Anthropic 等机构训练 Activation Oracles(AO),将 LLM 激活作为额外输入模态,用自然语言回答关于目标模型激活的任意问题。在 4 个下游审计任务中,AO 在 3 个上匹配或超过最佳已有方法,可发现微调引入的秘密知识或失智倾向,且训练仅用微调前的原始模型激活;性能随训练数据数量与多样性提升。论文与代码、Demo 已开放。

  9. Anthropic:Transformer Circuits(可解释性研究)50

    Anthropic 推出 HeadVis:可视化语言模型注意力头行为的交互工具

    Anthropic 开源交互式可视化工具 HeadVis,用于研究大语言模型中的注意力头行为,代码已开放并提供 Gemma 3 与 Claude Haiku 3.5 部分注意力头的演示。该工具通过注意力模式、分布指标、低秩分量投影及 QK/OV 电路上的 SAE 特征归因来生成和检验假设,案例研究显示注意力头在全数据分布上的行为常与窄任务表现不同。

  10. Anthropic:Transformer Circuits(可解释性研究)43

    Anthropic 可解释性研究:用下游连接预测哪些特征会操控模型行为

    Anthropic 可解释性团队提出用 TWERA 加权的下游连接来区分外观相似的特征:两个在“草是什么颜色”提示上同样激活、top unembeds 都指向 green 的 CLT 特征,只有 Feature B 被抑制才会让答案从 Green 变成 Red。实验收集 10 组各 3–5 个候选特征,让 Opus 4.7 按操控可能性排序,加入 TWERA 下游特征信息后预测能力小幅提升。

  11. Berkeley RDI:Blog(AI 安全与评测)77

    Berkeley RDI 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准:898 个真实漏洞测试 AI 智能体自主攻击能力

    UC Berkeley 等机构及 Anthropic、OpenAI、Google 发布 ExploitGym 基准,含 898 个真实漏洞(用户态程序、V8 引擎、Linux 内核),测试 AI 智能体能否把已知漏洞变成完整攻击。

    推荐理由:原文给出真实漏洞上智能体自主生成完整攻击代码的成功率和防御绕过数据,读者可据此评估 AI 对攻防两侧的实际影响。

  12. Prime Intellect(网页)75

    Prime Intellect 用 nanoGPT speedrun 评测 18 个前沿模型的自主研究能力

    Prime Intellect 在 nanoGPT optimizer speedrun 上开展 153 次自主运行、覆盖 18 个前沿模型,每次运行使用 8xH200s、最长持续八天,baseline 为 3,290 steps,人类纪录为 2,600。

    推荐理由:实验规模和全部 trace 公开,模型差距主要来自实验执行而非想法本身,这个发现值得一看。

  13. Fireworks AI(网页)68

    Fireworks AI 发布 FireRouter with Opus,编码成本降 57%

    Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。

    推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。

  14. Dario Amodei:Blog(网页)68

    Dario Amodei 撰文回应 DeepSeek 并为芯片出口管制辩护

    Anthropic CEO Dario Amodei 发文认为 DeepSeek 的发布不削弱美国对华芯片出口管制的理由,反而使其更重要。他提出缩放定律、移动曲线、转移范式三个动态,称 DeepSeek-V3 是沿预期成本下降曲线的合理结果而非独特突破,R1 则复现了 OpenAI o1 的思路。

    推荐理由:作者以成本曲线分析逐条回应 DeepSeek 低成本冲击的说法,读者可借此检验出口管制论点的实际依据。

  15. Dario Amodei:Blog(网页)67

    Dario Amodei 撰文呼吁加速 AI 可解释性研究

    Dario Amodei 发表长文《The Urgency of Interpretability》,主张可解释性研究与模型能力正在赛跑,必须在强大 AI 到来前理解模型内部机制。

    推荐理由:作者本人是可解释性研究的当事方,文中给出技术进展、2027目标和政策主张,读者可以据此了解这个方向的路线图。

  16. Dario Amodei:Blog(网页)75

    Dario Amodei 发布长文阐述 AI 指数级进展下的政策主张

    Anthropic CEO Dario Amodei 发表长文,认为 AI 规模化定律推进迅速而政策制定太慢,呼吁在监管与公共安全、宏观经济与税收、科学创新、国家权力与公民自由、地缘政治五个领域重构政策。

    推荐理由:Dario Amodei 以第一人称提出五领域 AI 政策主张并附 Anthropic 立法提案,读者可以据此了解行业头部公司对监管的立场。

  17. Dario Amodei:Blog(网页)71

    Dario Amodei 提出放缓前沿 AI 能力步伐的三步计划

    Anthropic 创始人 Dario Amodei 撰文呼吁在继续推进 AI 的同时放缓模型能力提升速度,给安全工作留出时间,并称 recursive self-improvement 自今夏起已在行业内加速、6–12 个月内类似 OAI-HF 的智能体群体可能造成更大规模破坏。

    推荐理由:作者以当事方身份提出分阶段放缓前沿模型能力的三步计划,并宣布 Anthropic 单方面承诺引入嵌入式第三方评估者。

  18. Dario Amodei:Blog(网页)68

    Dario Amodei 长文《Machines of Loving Grace》展望强大 AI 如何造福世界

    Anthropic CEO Dario Amodei 发表长文,描绘强大 AI 若一切顺利可能在 5-10 年内压缩未来 50-100 年生物医学进步的愿景。他定义强大 AI 为超过诺贝尔奖得主智力、可自主完成数天至数周任务的系统,并提出以智能的边际回报为核心的分析框架,聚焦生物学与健康、神经科学与心理健康、经济发展与减贫、和平与治理、工作与意义五大领域。

    推荐理由:Anthropic CEO 本人撰写的长文,系统给出强大 AI 在五个领域造福社会的具体预测与分析框架,观点源自第一手思考。

  19. Dario Amodei:Blog(网页)74

    Dario Amodei 发文《技术的青春期》:剖析强大 AI 的五类风险并给出应对路线

    Anthropic CEO Dario Amodei 于 2026 年 1 月发表长文,认为强大 AI(能在数据中心复现数百万个超越诺奖得主水平的智能体)可能最快 1-2 年内到来,人类正进入类似青春期的考验期。

    推荐理由:Dario 以当事方身份系统梳理五类 AI 风险及 Anthropic 已落地的对齐、可解释性和监管实践,可帮助读者建立务实的风险框架。

  20. Claude:Blog(网页)72

    Claude 合并 Cowork 与聊天,并推出 Claude Docs、Slides 和 Design 集成

    Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。

    推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。

  21. Claude:Blog(网页)27

    Anthropic 推出 Claude 平台 Console:Messages 直连模型,Managed Agents 托管智能体

    Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。

  22. Claude:Blog(网页)44

    Claude Code 开发者文档:入门指南

    Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。

  23. Claude:Blog(网页)73

    Claude 桌面与移动端应用提供 macOS、Windows、Linux、iOS、Android 下载

    Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。

    推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。