Anthropic 展示 Claude 编程能力:Opus 5.5 在 Terminal-Bench 4.0 得分 66.4%
Anthropic 公布 Claude 在编程场景的能力数据:Opus 5.5 在 Terminal-Bench 4.0 上得分 66.4%,为某 AI 平台客户带来 60 倍更快的代码审查反馈,为某企业软件客户将测试运行时间缩短 95%。
Anthropic 公布 Claude 在编程场景的能力数据:Opus 5.5 在 Terminal-Bench 4.0 上得分 66.4%,为某 AI 平台客户带来 60 倍更快的代码审查反馈,为某企业软件客户将测试运行时间缩短 95%。
文章引用 Dylan Patel 等人的观点分析 AI 模型公司按兆瓦计的单位经济:基础算力成本约 $10-15M/MW,Anthropic 2026 年收入达 $50M/MW,实现首个盈利季度,收入 $10.9B、营业利润 $559M。
推荐理由:文章用每兆瓦收入和毛利数据拆解 AI 模型公司的单位经济,并解释推理利润如何反哺训练的工厂模式。
Claude Code 面向企业遗留代码库的现代化改造,结合 AI 代码生成与深度代码库理解,在保持业务逻辑完整的前提下支持可扩展迁移。它能生成依赖图、识别死代码、按复杂度与业务影响排定重构优先级,并自动为重构代码创建单元测试、补充回归测试。该工具可接入现有 CI/CD 流水线与版本控制系统,满足企业级安全与合规要求。
Tomer Tunguz 撰文指出前沿 AI 市场正分化为封闭阵营,实验室通过选择伙伴、限制访问来管控最强模型。
推荐理由:作者梳理了前沿模型从按 token 出售转向准入管控的多方实例,并给出开源与 Nvidia 反制力量的行业分析。
Anthropic 发布工程长文,介绍用 Claude 构建能规划、行动与协作的 AI 智能体,并称 Claude 在客户支持到编程等智能体场景中表现优于其他模型。
Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。
推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。
Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。
Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。
推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。
推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。
Anthropic 公布 Claude 订阅方案:Free 档 $0,Pro 档年付 $17/月($200 一次性付清)、月付 $20,Max 档 $100/月起,可选 Pro 5 倍或 20 倍用量。
Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。
推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。
Anthropic 推出 Agent Skills,用带 SKILL.md 的文件夹把流程和最佳实践变成 Claude 可自动调用的能力。同一 Skill 可跨 Claude.ai、Claude Code 和 API 使用,支持多 Skill 组合,内置 Excel、PowerPoint、数据分析等常用技能,Box、Notion、Figma、Canva 等伙伴展示了各自的应用方式。
推荐理由:Anthropic 官方页面说明 Skills 的构建方式、跨平台复用和内置能力,读者可以据此判断是否将其纳入自己的工作流。
Anthropic 推出 Claude for Microsoft 365,Claude 可直接在 Excel、PowerPoint、Word 和 Outlook 中工作。
推荐理由:原文来自官方,给出了四大 Office 应用中的具体能力和可用性细节,读者可据此评估是否替换现有办公工作流。
Anthropic 推出 Claude in Chrome 扩展,面向所有付费计划开放,可读取当前登录页面并代替用户点击、输入和填写表单。
推荐理由:官方产品页说明了 Claude in Chrome 的能力边界、三种访问方式和安全机制,读者可据此判断是否将其纳入自己的浏览器工作流。
Anthropic 推出 Claude Security,面向 Claude Enterprise 开放公测,用 Claude Mythos 5.1 扫描代码库,对发现结果做对抗性验证并给出建议补丁,所有补丁需人工审核批准。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。
推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。
Every 的 head of evals Mike Taylor 公开他让 Claude 保留个人声音的写作流程:先写标题、收集来源搭骨架、用 Monologue 录音记录想法、让 Claude 生成 story beats,再用 Claude Opus 5.5、Fable 5.1 和 GPT-6 Astra 生成多版草稿后拼接,自编后交编辑。
Marcus Moretti 是 Spiral 的总经理,在 Every 上发表了多篇文章,包括《Claude Code for Product Managers》《Spiral 4.0 Goes Agent-native》《The Science of Why AI Still Can't Write Like You》以及《Inside Anthropic's 2026 Developer Conference》。
Spiral 总经理 Marcus Moretti 用 Claude Code 独自承担代码、客服、营销和产品管理,除路线图外所有 PRD 和工单均由 Claude 撰写,原本分散在 10 个应用中的事务性工作被收进单一对话线程。他通过 compound engineering 的 /ce:strategy 技能生成产品战略文档,并将路线图作为 GitHub 项目 README 管理工单。
作者用 Claude 搭建写作风格工具 Tastemaker,并加了连接 Claude Code、Codex 等 Agent 的 MCP 连接器,自认功能可用便上线。
Every 发布对 GPT-6 Astra 的 Vibe Check 评测,认为它是大幅升级,写作、软件操作和视觉设计表现令人印象深刻,但也存在一些坏习惯。
OpenAI 的 GPT-6 Sol 与 Anthropic 的 Claude Opus 5.5 同日发布,Every 基于日常工作的实测与评测对两者做了对比,结论是存在一个明确的取舍。该对比旨在回答该用 Sol 6 还是 Opus 5.5 的问题,完整内容需订阅阅读。
Eugene Yan 让 gpt-4、gpt-3.5-turbo-0301、claude-v1.2、cohere-xlarge 等 LLM 根据训练数据为他写传记,以观察各模型学到了什么。gpt3.5/4 整体表现最好,主旨正确但细节多有事实错误,且部分模型比其他模型更多地背诵和复述训练数据。这些模型无法联网,输出完全基于训练数据。
Every 网站文章列表页汇总了多篇 AI 主题文章,涵盖 Claude 的 Agent 能力、Claude Skills 入门、GPT-5 发布后的走向、OpenAI Codex 成为 Claude Code 竞品、Super Sonnet 4、Claude Code 占据领先位置,以及 OpenAI Atlas、MCP 等话题。
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
Eugene Yan 发布提示词工程基础教程,核心观点是把提示词视为对概率模型的条件化,并给出评估先行的工作流。文章用 Claude Messages API 演示角色设定、XML 结构化输入输出、Prefill、n-shot 提示、改进 CoT、拆分多步提示、stop sequence 和 temperature 选择等技巧,并指出礼貌用语和小费威胁等做法对近期模型效果影响不大。
Eugene Yan 发布 AI Reading Club(AiReadingClub.com)的构建复盘,核心是 AI 阅读伴侣 Dewey,支持理解所选上下文、答疑、生成测验、回顾全书进度、书内查找和回看历史讨论。
Anthropic 提出 Contextual Retrieval 方法,在嵌入前为每个文本块前置上下文说明,结合 Contextual Embeddings 与 Contextual BM25 将 top-20 检索失败率降低 49%(5.7%→2.9%),叠加 reranking 后降低 67%(5.7%→1.9%)。
Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。
推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。
Anthropic 的升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,超过此前 SOTA 的 45%,模型本身未变而成绩来自围绕模型的 agent 脚手架。
Anthropic 发布工程指南,介绍给 Claude 增加 "think" 工具的方法,让模型在长链工具调用和策略密集场景中停下来做结构化思考。在 τ-bench 航空域,think 工具加优化提示词的 pass^1 达 0.570,比基线 0.370 相对提升 54%;零售域仅加工具即达 0.812(基线 0.783)。
Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。
推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。
Anthropic 工程团队发布长文,复盘 Claude Research 多智能体研究系统从原型到生产的构建过程。系统采用 orchestrator-worker 架构,内部评估中 Claude Opus 4 主导加 Claude Sonnet 4 子代理的组合比单代理 Claude Opus 4 高出 90.2%,但多智能体消耗约 15 倍于普通对话的 token。
Anthropic 推出 Desktop Extensions,把 MCP 服务器连同依赖打包成 .mcpb 文件(发布时为 .dxt,2025 年 9 月起改名),在 Claude Desktop 中双击即可安装,无需终端、手动改配置文件或处理依赖冲突。
Anthropic 发布工程文章,讲解如何为 MCP 和 LLM 智能体编写高效工具,包括构建原型、运行评测、用 Claude Code 自动分析转录并改进工具的流程。
Anthropic 复盘 8 月至 9 月初影响 Claude 响应质量的三个基础设施 bug:8 月 5 日上下文窗口路由错误最严重时影响 16% 的 Sonnet 4 请求。
Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。
推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。
Anthropic 发布 Agent Skills 工程解析,说明 Skills 是包含 SKILL.md 的目录,通过渐进式披露分三级加载指令、脚本和资源,可附 Python 脚本作为可执行工具。Skills 已支持 Claude.ai、Claude Code、Claude Agent SDK 和开发者平台,文末给出编写、评估与安全审计建议,并提示恶意 Skills 可能引入漏洞或数据外泄风险。
Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。