Tomasz Tunguz:Agent harness 对编码成绩与成本的影响超过模型本身
Tomasz Tunguz 撰文称 harness 对编码基准和成本的影响大于模型。Endor Labs Agent Security League 测试显示。
推荐理由:文章用同一模型在不同 harness 下的分数差和缓存成本数据,说明运行时框架对编码表现和账单的影响可能超过模型本身。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
Tomasz Tunguz 撰文称 harness 对编码基准和成本的影响大于模型。Endor Labs Agent Security League 测试显示。
推荐理由:文章用同一模型在不同 harness 下的分数差和缓存成本数据,说明运行时框架对编码表现和账单的影响可能超过模型本身。
ARC Prize 通过 160 段回放与推理轨迹分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现,分数分别为 0.43% 和 0.18%(半私域数据集测试),并开源分析包。
推荐理由:ARC Prize 基于 160 段推理回放拆解两大模型的失败模式,指出总分掩盖了两者截然不同的推理缺陷。
Anthropic 推出 Claude Marketplace 生态系统,提供超过 2000 个连接器和插件,可连接 Google Drive、Gmail、Microsoft 365、Notion、Slack、Atlassian 等应用。
推荐理由:Anthropic 官方页面列出了生态的实际组成和开放入口,读者可以据此了解 Claude 周边的连接器、产品和合作资源。
作者分析 AWS 最新季度年化营收达 $169b、增速 36.7% 为 18 个季度最快并连续五个季度加速,与 Azure 的差距从 16 个百分点缩窄到 6 个。但 AWS 积压订单 $496b 在三巨头中最小,自由现金流转为负 $7.6b,2026 资本开支计划上调至 $220b;Andy Jassy 称 AWS 有潜力成为 $1T 营收业务,其关键在于企业生产工作负载这一中间段何时普及推理。
推荐理由:作者用 AWS 与 Azure、Google Cloud 的增速、积压订单和资本开支对比,帮读者看清云计算竞争格局与万亿美元目标的真实约束。
Anthropic Claude Platform 页面列出 Claude Fable 5.1、Opus 5.5、Sonnet 5.5 和 Haiku 4.5 的定价与适用场景,如 Opus 5.5 定价 Input $4 / MTok、Output $20 / MTok,面向智能体编码和企业工作。
推荐理由:原文给出各型号模型定价、上下文与用量场景,读者可据此对照选择构建智能体的方案。
Anthropic 更新 Claude Fable 5 的生物学安全分类器,生物学相关的 fallback(切换到能力较弱的 Opus 5)减少约 85%,用户在解读化验结果、了解症状、教育性生物学问题等日常场景将更少被拦截。
推荐理由:官方说明了 classifier 重写思路和 85% 的 fallback 降幅,可以了解生物学安全防护如何在风险与可用性之间权衡。
Tomer Tunguz 分析,超大规模云厂商在 2026 年 Q2 财报电话会上称 AI 产能持续受限,HBM3e 内存涨价 20%、HBM4 预计翻倍。
推荐理由:作者用各实验室定价与算力供给数据,解释分层定价如何维持杰文斯悖论,并指出路由层可能成为新的战略环节。
Anthropic 推出面向小型企业的 Claude for Small Business 插件,提供可定时运行的工作流:周一简报、月度结账、跟进线索并生成报价。
推荐理由:原文给出具体工作流、审批机制和数据安全细节,读者可判断这套面向十人以下企业的自动化方案是否适合自己。
Anthropic 宣布未来的 Claude 模型生成文本将带水印,以遵守欧盟 AI Act 对 AI 生成内容标记的要求,采用 Google DeepMind 2024 年 Nature 论文中的 SynthID-Text 方法,并随 2026 年 7 月约 190 个签署方的 EU Code of Practice 一同公布。
推荐理由:官方解释了水印只改变选词随机性来源这一原理,以及质量、价格、检测 API 和各类边界情况的影响。
Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。
推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。
文章引用 Dylan Patel 等人的观点分析 AI 模型公司按兆瓦计的单位经济:基础算力成本约 $10-15M/MW,Anthropic 2026 年收入达 $50M/MW,实现首个盈利季度,收入 $10.9B、营业利润 $559M。
推荐理由:文章用每兆瓦收入和毛利数据拆解 AI 模型公司的单位经济,并解释推理利润如何反哺训练的工厂模式。
Tomer Tunguz 撰文指出前沿 AI 市场正分化为封闭阵营,实验室通过选择伙伴、限制访问来管控最强模型。
推荐理由:作者梳理了前沿模型从按 token 出售转向准入管控的多方实例,并给出开源与 Nvidia 反制力量的行业分析。
Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。
推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。
Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。
Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。
推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。
推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。
Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。
推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。
Anthropic 推出 Agent Skills,用带 SKILL.md 的文件夹把流程和最佳实践变成 Claude 可自动调用的能力。同一 Skill 可跨 Claude.ai、Claude Code 和 API 使用,支持多 Skill 组合,内置 Excel、PowerPoint、数据分析等常用技能,Box、Notion、Figma、Canva 等伙伴展示了各自的应用方式。
推荐理由:Anthropic 官方页面说明 Skills 的构建方式、跨平台复用和内置能力,读者可以据此判断是否将其纳入自己的工作流。
Anthropic 推出 Claude for Microsoft 365,Claude 可直接在 Excel、PowerPoint、Word 和 Outlook 中工作。
推荐理由:原文来自官方,给出了四大 Office 应用中的具体能力和可用性细节,读者可据此评估是否替换现有办公工作流。