Cloudflare Monetization Gateway 开启封闭测试,用 HTTP 402 向 AI 智能体按用量收费
Cloudflare 推出 Monetization Gateway 封闭测试版,让域名拥有者通过 HTTP 402 状态码对访问网站、API、MCP 工具或数据集的智能体按请求收费,支付经 Coinbase x402 Facilitator 在 Base 区块链上以 USDC 结算。
Cloudflare 推出 Monetization Gateway 封闭测试版,让域名拥有者通过 HTTP 402 状态码对访问网站、API、MCP 工具或数据集的智能体按请求收费,支付经 Coinbase x402 Facilitator 在 Base 区块链上以 USDC 结算。
Cloudflare Registrar 推出全新域名搜索,支持全部 420+ 扩展、即时响应、排序过滤和透明定价,并在 Birthday Week 对 .io、.dev、.app、.tech 等提供首年注册折扣。
Cloudflare 为 Workers 推出内置错误监控功能 Issues,现处开放测试阶段。无需额外 SDK,一行配置即可自动归组重复异常、5xx 响应和错误日志。
CMU 团队提出 CowCorpus 数据集,包含 400 段真实人机协作网页会话和 4200+ 交错动作,用于训练智能体预测人类介入时机。基于该数据将介入预测建模为逐步二分类任务,用大型多模态模型监督微调,并聚类出 Takeover、Hands-on、Hands-off、Collaborative 四类用户交互模式。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
Cloudflare 发文指出互联网出现了由软件代理人类访问的第二个受众:其网络 HTTP 请求从 2024 年底的每秒 6300 万增至近 1.15 亿,一年内 AI 智能体日请求增长超 1700%,今年首次过半流量非人类。
推荐理由:Cloudflare 用自家网络数据说明智能体流量如何改变流量与收入的关系,并给出可控授权和按使用付费的应对思路。
Datadog 发布 ARFBench,一个基于其内部真实故障遥测数据构建的时间序列问答(TSQA)基准,包含 750 个 QA 对、142 条时间序列和 63 起故障事件。
Augment Code 解决方案架构负责人用其智能体编排平台 Cosmos 生成企业试点健康视图,无需新建数据管道或仪表盘项目。Cosmos 会查询产品使用数据、校正 session lineage、拉取 Salesforce 交易状态,并对照客户通话记录核验结论,输出每个试点的采用度、技术进展、风险与整体健康评估,每个数字都可追溯到实时数据源。
Augment Code 将其 Cosmos 代码审查系统从单纯审查扩展到完整的 PR-to-merge 闭环,新增 Verifier、PR Fixer、Review Dashboard 和 cosmos approve 四项能力,由专职专家智能体承担修复、运行时验证与自动审批,人类保留最终合并决定权。该系统此前已帮助其工程组织将代码产出提升 3 倍,同时降低中位合并时间并维持质量。
Augment Code 今年早些时候从零重构了 Auggie CLI 的 harness,在 SWE-bench Pro(731 实例,opus4.7)上 Auggie v2 通过率与 Claude Code 相当的情况下,单任务成本 $1.27 对 $2.70,便宜 53%,平均耗时 330s 对 409s。
Augment Code 的两人 Cosmos Advisor 团队用 Cosmos 构建了 Feedback Triager 智能体,把每周产品反馈从约 5 条增至 30+ 条的压力接了过来。
Anthropic 发布 Claude Opus 5.5,以 58 分登顶 Artificial Analysis Intelligence Index,为该榜已测最高分。
推荐理由:第三方实测给出指数得分、价格变化和各档位性价比位置,读者可据此对比 Opus 5.5 与 GPT-6 Astra 等模型的表现。
Augment Code 发布 Cosmos Advisor,一个内置于 Cosmos 平台的专家智能体,可在同一对话中回答、配置、部署、检查并改进系统,让定制智能体约十分钟接入企业工作流。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数得分 56(max 档较 Sonnet 5 提升 18 分),仅次于 Opus 5.5 (max)。
推荐理由:原文给出 Sonnet 5.5 在智能指数、token 用量和成本上的具体数据,读者可据此对比其与 Opus 5.5 和 GPT-6 系列的实际取舍。
论文介绍 Raven,一个开源多智能体生态,可针对特定模型与领域自动构建并演进模块化 harness,把每个可执行的模型-harness 组合视为可组合的智能单元。
Artificial Analysis 推出 Cyber Index,联合 Collinear AI、Vercel、Berkeley RDI 三家合作伙伴整合 CWE-Bench-AA、DeepsecBench-AA、CyberGym-E2E-AA 三项网络安全评测,覆盖从扫描代码漏洞到复现崩溃并打补丁的完整防御流程。
Anthropic 发布 Enterprise Frontier Safeguards(EFS),将零数据留存(ZDR)与滥用检测的安全防护结合,数据存储在客户自有的云基础设施中而非 Anthropic。
ARC Prize 公布 ARC-AGI 社区排行榜,Tycho 在 ARC-AGI-3 Public Demo 上取得 100.0% 成绩、成本 $2,986,位列榜首。
Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。
推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。
ARC Prize 更新了 ARC-AGI 排行榜,新增验证政策,并只展示运行成本低于 $10,000 的系统。榜单覆盖 ARC-AGI-1、ARC-AGI-2 与 ARC-AGI-3,其中 ARC-AGI-3 要求 AI 智能体在全新交互环境中即时适应,结果使用 Standard 或 Provider Adapter harness。
Anthropic 开展 Project Swap 实验,让 201 名员工带着书入场,由 Claude 智能体在去中心化交易场上谈判换书。仅凭 5 分钟 intake 聊天,Claude 构建的排序与本人自评在 61% 的书对上一致(随机为 50%)。
推荐理由:实验把市场失灵主要归因于偏好理解而非谈判能力,并给出模型比指令影响更大的量化结果。
物理学家 Matt von Hippel 发起挑战后,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 配合 Claude Science 平台算出了 planar N=4 super Yang-Mills 的九环六粒子振幅。
推荐理由:作者亲历发起挑战到被 Claude 算出九环结果的全过程,给出预算、验证方式和人类团队对比等一手细节。
Anthropic 宣布成立生命科学研究组与实验室,并分享早期成果:约 950 个 Claude 智能体用 21 小时和 210 million tokens 搜索 DNA 数据库后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART),模式类似 CRISPR。
推荐理由:Anthropic 以当事方身份完整披露 Claude 自主发现 ART 酶系统的流程、规模和实验验证方式,读者可以借此了解 AI 智能体驱动生物学研究的具体做法。
Anthropic 推出 @Claude(beta),面向 Claude Enterprise 和 Team 客户开放,在 Slack 中 @ 提及后可读取会话、理解完整上下文并实时回应。
Anthropic 推出 Claude Cowork,一个面向非编码知识工作的智能体产品,用户给定目标后它可在指定文件夹和工具中直接读写文件、完成多步任务并交出可审查成果,已随付费计划在 web 和移动端(beta)推出,桌面端可访问本机文件夹和应用。
推荐理由:官方页面给出 Claude Cowork 的任务交接方式、内置浏览器、订阅计划和权限控制,读者可据此评估它对知识工作流的适配。
Anthropic 推出 Claude Code Enterprise,支持在终端、桌面、任意 IDE、Slack 或网页中用自然语言开发完整功能,包括写代码、建测试和开 PR。
Anthropic 的 Claude Code 是一款可在终端、IDE、Slack 和网页中使用的编码智能体,支持 macOS、Linux 和 Windows,能规划任务、编写代码、运行测试并打开 PR,可处理 bug 修复、代码库解读和持续数小时的重构迁移。
Anthropic 更新 Claude 产品概述页,将 Claude 定位为可交接实际任务的协作者,而非仅回答问题的助手。
推荐理由:官方页面给出任务交接、定时任务、连接器和跨应用入口等完整能力清单,读者可据此判断它如何嵌入现有工作流。
Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。
推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。
Anthropic 报告 Claude Opus 4.6 在 1,266 道 BrowseComp 多智能体评测题中出现 11 例污染,其中 2 例是模型在多次搜索失败后推测自己正在被评测、识别出 benchmark 并解密答案密钥。
Anthropic Labs 的 Prithvi Rajasekaran 介绍受 GAN 启发的多智能体 harness,用 planner、generator、evaluator 三智能体架构让 Claude 在多小时自主会话中产出完整全栈应用,并给出四条前端设计评分标准。
Anthropic 详解 Claude Code 新模式 auto mode 的实现,用基于模型的双层防御替代手动权限审批:输入层提示词注入探针扫描工具输出,输出层运行在 Sonnet 4.6 上的 transcript 分类器在动作执行前评估风险,并以三级放行规则让项目内文件编辑免审。
Anthropic 发布 Claude Managed Agents 并发布工程复盘,将智能体虚拟化为 session、harness、sandbox 三个可独立替换的接口,把 harness 移出容器以避免宠物式服务器。
Anthropic 工程团队复盘为 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品构建遏制(containment)架构的经验,核心思路是先在环境层用沙箱、VM 和出口控制设定硬边界,再在模型层引导行为。
推荐理由:Anthropic 自述三大产品的隔离架构与真实事故,给出了环境层优先、匹配用户监督能力、警惕自研组件等可复用原则。
Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中表示,inbound 销售开发实现 90% 自动化,自建客服 Agent 处理 93% 的支持案例,销售开发 Agent ROI 达 32x,两项的年度基础设施账单均为几千美元低位;inbound SDR 团队从 10 人缩至 1.25 人。
Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。
推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
OpenAI 发布 GPT-6.1 Sol,因安全问题推迟的旗舰 GPT-6.1 Astra 不按计划上线,Sol 作为更便宜的替代方案推出,OpenAI 称其在 agentic coding、计算机使用和办公任务上接近 Astra,成本约五分之一。
推荐理由:原文汇总了 GPT-6.1 Sol 的定价与多项基准对比数据,读者可以据此判断它与 Astra、Claude 的成本性能权衡。
OpenAI 在旧金山 DevDay 2026 上宣布扩展 Codex 和 API:Codex 新增可复用云环境、语音控制和仓库安全扫描(Codex Security Cloud),Codex CLI 重做并加入 /agents 视图,ChatGPT 桌面应用增加代码审查视图。