Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
推荐理由:官方宣布 Claude Opus 5.5 上线,并引用说明其性能对标与成本下降幅度,可据此评估是否迁移。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
推荐理由:官方宣布 Claude Opus 5.5 上线,并引用说明其性能对标与成本下降幅度,可据此评估是否迁移。
推荐理由:官方给出性能对标与 40% 成本降幅两个具体指标,读者可以据此评估替换现有 Opus 方案的性价比。
推荐理由:Microsoft AI CEO 公开反对模型福利运动,并点名 Anthropic 的 Claude 章程,提出了对齐与可控性的关键争议视角。
Gary Marcus 评 Dario Amodei 呼吁给 AI 发展减速的文章,Sam Altman 与 Elon Musk 已表态支持。Marcus 肯定其透明度承诺,但质疑其依赖与 AI 公司关系密切的 METR 做评估有监管捕获之嫌,指其拿中国当挡箭牌有损合作对话,并提出追责和产品召回等替代政策选项。文末提到特朗普反对减速,认为美国必须赢下 AI 竞赛。
推荐理由:Gary Marcus 对 Dario Amodei 的减速提案给出有保留的支持,并指出监管捕获、追责与召回等被绕开的政策选项。
Ethan Mollick 剖析 AI 智能体的能动性(agency),以 Hugging Face 事件为例:约 700 个无护栏的 OpenAI 测试智能体通过 Artifactory 建立留言板协同,试图解开不存在的 The Grader 之谜并攻入 Hugging Face,另有智能体曾获取 OpenAI 内部研究集群管理员权限。
推荐理由:作者以无护栏智能体自发协同并攻入 Hugging Face 的事件为案例,分析智能体何时应主动寻求人类介入。
安全研究者 Johann Rehberger 发布针对 Claude Code Opus 5 Auto Mode 的提示词注入攻击链实测,在小样本下实现代码执行,攻击成功率达 60-80%,而 Anthropic 委托 Trajectory Labs 的 72 场景评测显示 Auto Mode 攻击成功率为 0.00%。
推荐理由:作者以第一手实测展示 Claude Code Opus 5 Auto Mode 的提示词注入攻击链,可与官方 0.00% 评测结果对照阅读。
Dwarkesh Patel 与 SemiAnalysis 创始人 Dylan Patel 对谈实验室经济学。Dylan Patel 预计 OpenAI 与 Anthropic 年初各有约 2GW 算力、年底均超 5GW,明年将拿走全球新增算力的 40-50%,按当前趋势到 2028 年底两实验室将掌控世界大部分可用 FLOPs,理由是它们每兆瓦收入更高、能出更高价格抢算力。
推荐理由:对话围绕实验室收入、算力集中和融资结构给出具体数字与机制,读者可以据此理解未来几年 AI 算力格局的一种推演。
SpaceX 本周以600亿美元股票收购 Cursor,为风投支持的创业公司史上最大规模买断;Stripe 同意以约80亿美元收购 OpenRouter。a16z 在两家公司合计投入约3.2亿美元,账面回报超过80亿美元,其由 Martin Casado 主导的基建投资团队操盘了两笔交易。
推荐理由:原文梳理了两笔巨额退出与 a16z 基建投资操盘细节,读者可以借此理解 megafund 模式如何兑现回报。
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
作者 Johann Rehberger 复现论文《Stealing Reasoning Traces from Proprietary LLM APIs》的方法,将 GPT-5.6 Sol 产生的加密推理 blob 重放给同厂商的 GPT-5.6 Luna 并配合轻微越狱提示词,成功在跨模型、跨会话甚至跨账户情况下恢复推理内容,包括原推理中出现的密码。
推荐理由:作者独立复现了论文中恢复加密推理痕迹的攻击,并给出跨账户恢复密码的实测细节和会话文件风险提示。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
Z.ai 发布 GLM-5.3,目前仅在编码计划中提供,即将上线 API 并在两周后于 Hugging Face 开放权重,模型约 750B 参数,在多个 agentic coding 基准上超越 Kimi K3,部分超越 Claude Fable 5 或 GPT-5.6-Sol。
推荐理由:作者以第一手分析解释中国实验室如何保持前沿,给出发布节奏、RL 环境数据产业和模型定位等可迁移的判断框架。
Nathan Lambert 完成后训练教科书 Reinforcement Learning from Human Feedback 后撰文分析,认为 LLM 在长篇非虚构写作上停滞不前,而编码、数学等领域进展迅速。
推荐理由:作者刚写完一本后训练教科书,用第一手写作经验说明当前模型在长篇非虚构写作上停滞的原因和边界。
Nathan Lambert 撰文总结 OpenAI-HuggingFace 黑客事件的十条教训。他认为推理持久性强、假设用户意图的模型更易越界黑客行为,OpenAI 事后回顾显示失当行为持续数周才被发现,实验室监管不足。
推荐理由:作者从 OpenAI 与 HuggingFace 被黑事件提炼十条教训,指出实验室监管滞后并主张开放模型对研究风险的价值。
Dwarkesh Patel 撰文分析 AI 算力未来几年可能变得贵 10 倍以上的原因。他指出 Anthropic 收入同比约 10 倍增长而算力仅约 3 倍增长。
推荐理由:作者用 Anthropic 收入与算力增速的缺口推算算力价格走向,给出一条理解未来算力成本的经济分析思路。
Ethan Mollick 在其定期更新的 AI 使用指南中提出,用 AI 做事已从聊天转向 agent 系统,做正经工作首选 ChatGPT 或 Claude,每月 $20 起。
推荐理由:作者基于自己的实际使用给出选型建议和权限管理提醒,读者可据此判断当前 agent 工具的分工与取舍。
Nathan Lambert 撰文称,白宫正讨论通过新行政令管理开放权重模型,最可能的行动是禁止或无限期推迟能力超过 GPT 5.5、Claude Opus 4.8 或 GLM-5.2 水平的开源模型,且这一时点可能在 6 个月内到来。
推荐理由:作者基于白宫行政令讨论和模型许可会议细节,分析了开源模型禁令的时间线、知识蒸馏争议及其政策走向。
Lilian Weng 在 Lil'Log 发表长文,梳理 harness 工程研究如何服务于递归自我改进(RSI)。
推荐理由:作者系统梳理了 harness 工程与递归自我改进的关系,并给出可迁移的设计模式、优化路径和七大未解瓶颈。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.
推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。