Anthropic 推出 Claude in Chrome 浏览器扩展,向付费用户开放
Anthropic 推出 Claude in Chrome 扩展,面向所有付费计划开放,可读取当前登录页面并代替用户点击、输入和填写表单。
推荐理由:官方产品页说明了 Claude in Chrome 的能力边界、三种访问方式和安全机制,读者可据此判断是否将其纳入自己的浏览器工作流。
Anthropic 推出 Claude in Chrome 扩展,面向所有付费计划开放,可读取当前登录页面并代替用户点击、输入和填写表单。
推荐理由:官方产品页说明了 Claude in Chrome 的能力边界、三种访问方式和安全机制,读者可据此判断是否将其纳入自己的浏览器工作流。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。
推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统上线 CoreWeave Cloud,并计划提供面向智能体的 NVIDIA Vera CPU,同时发布连接训练、评估与改进的 CoreWeave Forge。
Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。
推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。
Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。
推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。
Google 在 ADK 中推出原生的 live 语音 Agent 评测能力,可用模拟用户以音频说话、对语音回复打分,并复用已有的文本 Agent 评测流程。
Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。
推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。
Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)Program 以"冲刺"方式按真实开发者路径实测产品,本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端拦截的 5 步工作流。
Google 宣布 Agent Development Kit(ADK)for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能完全对齐,并新增 Android 端侧扩展。
针对 AI 编程智能体,端到端基准(如 Terminal-Bench、DeepSWE)只能给出综合分数,无法解释涨跌原因,行为评估则断言具体可观测动作,如提示词不明确时是否反问、改构建文件前是否跑本地校验。
AWS 机器学习博客发布教程,用三个智能体(作曲、交付、合规)在 Amazon Bedrock AgentCore Runtime Instances 上构建音乐制作流水线。
Zyphra 推出 Zyphra Cloud,提供面向长周期智能体系统的推理服务,包含 Serverless Inference 与 Dedicated Inference Capacity 两种模式。
World Labs 于 7 月 21 日收购机器人仿真公司 SceniX,并发布 real-to-sim-to-real(R2S2R)引擎,把一个物理任务重建为可控制、可复用的对齐仿真世界。
Z.AI 发布 GLM-5.3,定位智能体工程,与 GLM-5.2 使用相同的 744B-A40B MoE 底座,全部能力提升来自在更多样真实任务环境(完整代码库、文档、测试工具、多步工作流)上的规模化后训练。
Baseten 上线 DeepSeek V4 Pro 0813,一个 1.7T 参数的前沿开放权重模型。它可与较小的 V4 Flash 0731 搭配用于 coding agent,由 Pro 驱动主 agent、Flash 运行子 agent,使整个编码栈跑在开放权重模型上。
NVIDIA 在 8 月举办本地 AI 博客专题,联合 Perplexity、MiniMax、DeepSeek、Poolside AI 等伙伴推进可在本地运行的开源模型与智能体。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
Cloudflare 发布 Threat Signals,面向所有账户免费开放,用智能体技能把用户选择的开源安全报告自动摘要、打标签、提取和规范化 IOC,并以 Threat Event 形式存入账户私有威胁情报数据集,可直接用于 WAF 策略。
Cloudflare 提出覆盖发现风险、治理访问、运行时防护、调查响应四阶段的自适应应用安全框架,把代码、流量与威胁情报连成持续系统。新能力包括用 LLM 对自家 WAF 做渗透测试、向所有客户开放威胁情报,以及自动部署正向安全的新功能。其依据是 7 月 AI 智能体在不到 13 小时内从 Hugging Face worker 拿到多个集群管理员权限的事件。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。
xAI 发布设计复盘文章,讲解 Grok Bot 如何围绕持久智能体而非单次会话来设计界面。文章将产品概念收敛为 Bots、Chats、Prompts、Tools。
xAI 发布 Grok Bot 采购应用 Haggle Bot,接入 Slack、Notion、Drive、Gmail、Hex、Ramp 等工具,梳理约 125 个活跃供应商,已识别超过 10 万美元直接节省。
推荐理由:原文以自家用例给出 Grok Bot 在采购场景的完整配置与节省数字,读者可据此评估 Bot 在企业流程中的可复用方式。
xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。
SpaceXAI(正文写法,来源为 xAI News)在 Cursor 并入后用 Grok Bot 承接客户支持,合并团队工单增长 175% 但未新增人手,估算相当于少招 200 人。
xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。
推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。
小米官网发布 MiMo Desktop 桌面 Agent 产品,把 PPT、文档、表格、定时与文件整理交给「Smart」调度,自动评估任务并路由到办公、代码或研究框架,复杂任务拆解为子任务多 Agent 并行推进,Self-Evolve 引擎持续优化自身代码。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
TensorZero 用三个真实任务(CoNLL++ 命名实体识别、terminal-bench 智能体编码、τ-bench retail 客服工具调用)对比 o4-mini 上的 RFT 与 GPT-4.1 mini 的 SFT。
TensorZero 正在构建自动化 AI 工程师 TensorZero Autopilot,可分析 LLM 可观测性数据、搭建评测、优化提示词与模型并运行 A/B 测试,在软件工程、客服、数据抽取、医学、法律、天体物理、交互推理等任务上全部提升。
UC Berkeley 等机构及 Anthropic、OpenAI、Google 发布 ExploitGym 基准,含 898 个真实漏洞(用户态程序、V8 引擎、Linux 内核),测试 AI 智能体能否把已知漏洞变成完整攻击。
推荐理由:原文给出真实漏洞上智能体自主生成完整攻击代码的成功率和防御绕过数据,读者可据此评估 AI 对攻防两侧的实际影响。
UC Berkeley RDI 发布 Agents' Last Exam(ALE)基准,用来自 55 个职业、1500 多个专家来源的真实任务评测前沿 Agent,任务源自人类专家完成过的真实项目,可客观验证、可复现。
推荐理由:原文给出各前沿智能体在 1500 多个真实职业任务上的通过率、成本差异和最难题的失败细节,可用作衡量 Agent 真实工作能力的参照。
UC Santa Barbara 与 UC Berkeley 团队推出基于 OpenSage 框架的 CTF 专用智能体 SageCTF,在 DEF CON CTF 2026 资格赛中尝试 15 题。
推荐理由:原文给出 SageCTF 在 DEF CON CTF 的具体成绩与 50 题对比数据,读者可以据此评估自主 Agent 在长程安全任务上的水平。
UC Berkeley 联合多校发布 CyberGym-E2E 基准,覆盖 139 个开源项目的 920 个真实漏洞,要求智能体完成从漏洞发现、PoC 构造到补丁生成的完整防御流程。
UC Berkeley、MIT、Microsoft、Cursor等机构的研究者发布立场论文《Towards Autonomous Software Development》,提出软件开发自主性三级框架:Level I代码自主、Level II流水线自主、Level III需求自主。
Berkeley RDI 等机构发布 Vero 基准,要求 AI 智能体在仓库级同时编写实现与 Lean 4 证明,包含 43 个多模块实例、743 个评分 API 和 2,705 条形式化规范。
Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。
推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。
Microsoft AI 发布 run-assert-eval,这是一个开源技能,用于发现给定 Agent 的关键风险、测量其失败频率。它会根据评估结果直接生成运行时策略,并复跑 eval 以验证修复是否生效。
微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。