Anthropic 推出 Claude 平台 Console:Messages 直连模型,Managed Agents 托管智能体
Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。
Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。
Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。
Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。
推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。
Cloudflare 为 Workers 推出内置错误监控功能 Issues,现处开放测试阶段。无需额外 SDK,一行配置即可自动归组重复异常、5xx 响应和错误日志。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
Augment Code 将其 Cosmos 代码审查系统从单纯审查扩展到完整的 PR-to-merge 闭环,新增 Verifier、PR Fixer、Review Dashboard 和 cosmos approve 四项能力,由专职专家智能体承担修复、运行时验证与自动审批,人类保留最终合并决定权。该系统此前已帮助其工程组织将代码产出提升 3 倍,同时降低中位合并时间并维持质量。
Augment Code 今年早些时候从零重构了 Auggie CLI 的 harness,在 SWE-bench Pro(731 实例,opus4.7)上 Auggie v2 通过率与 Claude Code 相当的情况下,单任务成本 $1.27 对 $2.70,便宜 53%,平均耗时 330s 对 409s。
Augment Code 的两人 Cosmos Advisor 团队用 Cosmos 构建了 Feedback Triager 智能体,把每周产品反馈从约 5 条增至 30+ 条的压力接了过来。
Augment Code 发布 Cosmos Advisor,一个内置于 Cosmos 平台的专家智能体,可在同一对话中回答、配置、部署、检查并改进系统,让定制智能体约十分钟接入企业工作流。
Artificial Analysis 评测 GPT-6 Sol 和 Luna,两者价格较 GPT-5.6 减半,Intelligence Index 持平,Sol 编码指数升 2 分至 57,Luna 降 2 分至 41。
推荐理由:原文以统一基准实测两款新模型的成本与能力变化,读者可据此判断价格减半后智能与编码表现的取舍。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。
推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。
Anthropic 宣布 Claude Design 现可在任意 Claude 对话中使用,包括 Claude Code 和 Artifacts 标签页,Claude Tag 支持即将推出。
推荐理由:原文给出可用范围、连接器和设计系统管理等具体变化,读者可据此判断它对设计到交付流程的影响。
Anthropic 推出 Claude Code Enterprise,支持在终端、桌面、任意 IDE、Slack 或网页中用自然语言开发完整功能,包括写代码、建测试和开 PR。
Anthropic 的 Claude Code 是一款可在终端、IDE、Slack 和网页中使用的编码智能体,支持 macOS、Linux 和 Windows,能规划任务、编写代码、运行测试并打开 PR,可处理 bug 修复、代码库解读和持续数小时的重构迁移。
Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。
推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
OpenAI 发布 GPT-6.1 Sol,定位接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景,价格为其标准 API 输入和输出 token 价格的五分之一。
推荐理由:原文点出 GPT-6.1 Sol 的定位与价格对比,读者可以据此判断它在编码等场景的成本取舍。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载。
推荐理由:原文给出与 GPT-6 Astra 的任务成本对比和 Bedrock 安全控制细节,读者可据此评估在自有工作流中采用的成本收益。
NVIDIA 开源了基于 TensorRT 的 C++ AI 模型参考实现集合 TensorRT Model Connect,目标是让 NVIDIA 推理栈的性能更易获取。项目围绕编码智能体设计,采用并行工作、模型族隔离、可逆变更与 GPU 验证等实践。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式、推理档位与成本取舍,便于评估长任务智能体的落地配置。
Databricks 介绍其内部新模型发布流程:通过 Unity Gateway 让全体员工首日获得 Opus 5.5、GPT-6 Sol 和 GPT-Luna 的实验性访问,并用四类按用户预算控制成本。
推荐理由:Databricks 以自身一万多名员工的实际 rollout 数据为例,给出一套可复用的新模型评估与推广方法,含具体成本对比。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作。
推荐理由:文章给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它适合承接哪类持续运行的编码任务。
OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。
MiniMax's latest text model, M3.1-Flash-Preview, debuts today on MiniMax Code. Built for everyday development, it's fast, reliable, and ready for real work, from quick bug fixes to full features.
Proaction 使用 Codex 后销售转化率提升 60%,每月节省 40–60 小时工程时间和 25–33 小时创始人时间。其联合创始人 Colin Knudsen 每月用 Codex 在 30–45 分钟内构建 4–6 个定制交互演示,并借助 Granola、Gmail、Slack、Linear、GitHub、HubSpot 等插件统一处理日常工作。
微软宣布重塑 Microsoft Copilot,推出三大新能力:Home 作为统一入口整合 Chat 和 Cowork 并内置 Office;Code 让非开发者用自然语言构建应用,与 GitHub Copilot 同源技术并在沙箱中运行;Autopilot(原名 Scout)是可在租户内持续自主工作的智能体。
Claude Code v2.1.282 新增 maxProseWidth 设置,可限制宽终端中 Claude 正文宽度而表格与代码块保持全宽,并新增启动提示及 /status、claude doctor 中列出被忽略或关闭遥测的变量。
Databricks 发布 Unity Gateway CLI,让管理员集中配置编码智能体的默认模型、MCP 服务器、技能、Smart Routing 和支出策略,开发者用 `ug claude`、`ug codex` 等命令即可启动已批准的智能体。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按需测量、修正幅度小且锚定在用户当前查看位置,从而避免滚动跳动。
Together AI 发布教程,演示如何以 Qwen3.5 4B 为基础模型,用 MultiNLI、BoolQ、Banking77 等 6 个数据源共 37,840 条样本微调一个 Jev 式分类模型,训练成本约 $17.0,耗时约 25 分钟。
Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)并设为默认 Opus 模型,支持 1M 上下文,价格 $4/$20 per Mtok、缓存读取 $0.20/Mtok;Pro 和 Team Standard 计划默认模型也从 Sonnet 改为 Opus。
推荐理由:原文列出该版本新增 Claude Opus 5.5 默认模型、MCP 描述长度可配置等改动,读者可对照修复清单决定是否升级。
小米 MiMo 在 GitHub 开源 mimoagent,一个仅约 100 行代码的 AI 智能体,可解决 GitHub issue 或在命令行中辅助用户。项目主打极简设计,无需庞大配置和大型 monorepo,并在 SWE-bench Verified 上取得超过 74% 的分数。仓库地址:https://github.com/XiaomiMiMo/mimoagent
Claude Code v2.1.278 将 Claude API、Enterprise 用户以及 Bedrock、Vertex、Foundry 和网关上的 auto 模式默认切换为服务端分类器,不再收取分类器开销,计费回退时会给出警告。