蚂蚁 inclusionAI 开源 PIBench:评估 AI 编程智能体的端到端支付集成能力
蚂蚁 inclusionAI 在 GitHub 开源 PIBench,一个用于评估 AI 编程智能体在真实端到端支付集成任务中表现的基准。该基准聚焦支付集成这一实际开发场景,目前以开源形式发布。
蚂蚁 inclusionAI 在 GitHub 开源 PIBench,一个用于评估 AI 编程智能体在真实端到端支付集成任务中表现的基准。该基准聚焦支付集成这一实际开发场景,目前以开源形式发布。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 Avernet,定位为分布式智能体协调平台,让智能体在其中共同生存、连接、协调、执行与演化。该平台目前以开源仓库形式发布,具体功能细节与可用性尚未在仓库描述中展开。
Nous Research 为 Hermes Agent 推出 Telegram Business Mode 插件,以秘书机器人形式运行,每条草拟回复都需经所有者批准后才会发送给客户。该插件采用 observe-with-approval 机制,目前已在 GitHub 开源。
Nous Research 在 GitHub 新建仓库 harbor-fork,定位为评估和改进 AI 智能体的框架。该仓库目前仅给出这一句功能描述,未披露具体模型、参数规模或评测基准信息。
Mistral AI 发布 Apache-2.0 协议的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明工程。
Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者无论技术背景如何,都在活动结束前构建出可用的 AI 智能体。有参会者称三小时完成了原本需要六个月的工作,另一位来自 $2B+ 科技公司的参会者表示,把 Ghostwriter 指向知识库后,15 分钟就一次性生成了智能体。Sierra 总结的三大要点是:任何人都能成为"海盗"、通才回归、以及 10 倍员工。
ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。
Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1,331 个专家测试。
Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项智能体改动都需经实验验证。实验默认以解决率和流失率等业务指标评估,仪表盘展示统计显著性、效果出现时间及稳定性,支持逐步放量后全量发布。Ghostwriter 会分析全部对话、提炼假设并在数分钟内将其转化为实验,使测试频率从每季度一次提升至持续迭代。
MIT 电气工程与计算机科学系副教授 Phillip Isola 在专访中界定,智能体 AI 是能在物理或数字世界中采取行动(如机器人操作、订机票)的 AI,与生成内容的 ChatGPT、Claude 等生成式 AI 不同,其核心仍是 Claude 这类基础模型外加工具与记忆封装。他指出编程智能体是目前最成功的应用,最大挑战是训练数据匮乏,并警示验证不足、数据泄露与去技能化风险。
Together AI 宣布其 9 篇论文入选 ICML 2026(7 月 6 日至 11 日,首尔,展位 B714),覆盖从智能体到 GPU kernel 的全栈研究。
vLLM Semantic Router 团队推出 Micro-Agent 能力,把单次模型 API 调用变成服务层内有界的多模型协作,用户仍只调用一个模型名 vllm-sr/auto。
MIT 与微软 Azure 研究人员提出智能体工作流优化系统 Murakkab,开发者只需用自然语言描述意图,系统即自动选择模型与工具、并行调度并动态分配云端硬件资源。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,从此前的独立 Gemini 2.5 computer use 模型整合进主力 Flash 模型,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动和桌面环境操作的智能体。
推荐理由:原文给出 computer use 内置于 Gemini 3.5 Flash 的能力和安全措施,读者可据此评估在自动化任务中的可用性。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织分配连接器访问权限、可单独开关工具的管理员控制,以及带连接器作用域的 API key,均已 GA。多账号连接器(GA)支持一个连接器绑定多个账号,Connectors Debugger(公开预览)可分 11 步定位 MCP 连接故障。目录现有 60 多个预置集成,并支持自定义 MCP 连接器。
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。
推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。
Sierra 于 3 月推出 Ghostwriter,让构建和优化 AI 智能体无需点击或写代码,只需描述需求。三个月后,支持主管、运营经理、QA 团队等从未写过代码的人开始直接改进客户体验。Sierra 同时推出优化智能体的 Explorer,持续分析客户对话并找出客户流失、处理不佳的问题及 CSAT 下滑点,再由 Ghostwriter 将洞察转化为改进。
Modem 面向所有用户开放 Zendesk 集成 beta 版,可在 Settings → Integrations → Zendesk 中通过 OAuth 连接。
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队从处理排队转向根因修复和产品洞察。Wilson 的 AI 智能体可追问身高与偏好来推荐手套等具体产品,Minted 则用 AI 打通各客户平台识别趋势。Sierra 博客称客户对话正从成本项变为产品改进与业务增长的洞察来源。
Sierra 与 Knox Systems 合作获得 FedRAMP High 认证,距其成立仅两年多,快于多数企业的认证周期。该认证使其 AI 智能体可服务美国联邦机构,此前已有 40% 的 Fortune 50 企业采用其技术。Sierra 支持语音、聊天、邮件多渠道及 58 种语言,Cigna 用八周上线智能体并将患者认证时间缩短 80%。
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者的多智能体 AI 安全研究资助,总额最高 1000 万美元。
推荐理由:原文列出了四个优先研究方向和申请时间线,研究者可以直接据此判断是否提交多智能体安全方向的提案。
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,通过多智能体协作处理多源、多跳查询,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
Modem 面向所有用户开放 Notion 集成,智能体可创建页面、填充数据库行、更新属性并向已有页面追加内容,所有写入操作均需用户确认后执行。该集成通过 OAuth 授权,访问令牌加密存储,可在 Settings 中随时断开。用户还能把 Notion 中的文档、PRD 等资料结合技能与自动化,构建 UTM 生成、Bug 分诊、客户研究等智能体工作流。
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
Google Research 将驱动 Flood Hub 的水文模型框架在 GitHub 以 Apache 2.0 许可证开源,供各国气象水文部门训练 AI 洪水预报模型。
vLLM Semantic Router 新增会话感知智能体路由(SAAR),在语义路由之上加入路由器会话记忆、工具循环硬锁、安全重置边界、前缀缓存感知的切换定价与可回放轨迹。在 21,600 个确定性轮次中,SAAR 将模型切换减少 79.29%,消除 3,836 次不安全切换,物理模型成本估算降低 78.71%;在 2,896 个 AMD ROCm 实时请求中保持会话连续性,未观察到违规。
Google Research 在 I/O 2026 上发布 Gemini for Science 科研工具套件,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 以及基于 NotebookLM 的 Literature Insights。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的整合 AI 栈,与 Airbus、BMW 和 ASML 合作优化设计、仿真与生产,并收购 Emmi 补充科学能力。Vibe 智能体升级为统一智能体,可处理收件箱与日历、深度研究、编码到合并 PR 等长程多步任务;Les Ulis 新的 10 MW 推理数据中心计划于 Q3 2026 启用,以增强算力控制与安全。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 整体升级为 Vibe,原有对话、设置与套餐全部迁移。Work Mode 处理跨企业工具的多步骤长任务,如邮件日历跟进、深度研究、文档撰写和定时任务;Code Mode 从网页发起远程编码会话直至生成 PR,并推出 VS Code 扩展和更新的 CLI(新增 /teleport、权限控制等)。
推荐理由:官方发布说明写清了 Le Chat 升级为 Vibe 后的工作与编码两大模式、各端入口和定价,可据以评估是否替换现有工作流。
上海人工智能实验室 InternLM 项目提出 Skill-as-Pseudocode,把 markdown 技能库重构为带类型的伪代码契约,供 LLM 智能体调用,该工作入选 EMNLP 2026 Findings。
Mistral 发布 Mistral Medium 3.5(128B 密集模型,256k 上下文窗口,修改版 MIT 许可开源权重),并将其设为 Le Chat 和 Vibe CLI 的默认模型。
推荐理由:官方公布了模型规模、基准成绩与定价,并说明云端异步智能体如何嵌入现有工程工作流。
Mistral AI 在 Studio 发布 Connectors 公测,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括直接工具调用、requires_confirmation 人工审批流和连接器的程序化管理;连接器 centrally 注册后可在 LeChat 和 AI Studio 间复用,并支持与 CRM、知识库等企业系统集成。
Sierra 在多伦多开设办公室,目前约有十几名员工,客户数量持续增长。基于 Sierra 构建的 AI 智能体已服务超过 40% 的 Fortune 50 企业,处理数十亿次客户交互。Singtel 在 10 周内上线,解决率超过 70%;Cigna 在 8 周内投产,将患者身份验证时间缩短了 80%。
Sierra 称 Agent Strategist 是其增长最快的团队,这一角色结合 go-to-market、咨询与构建能力,负责端到端落地 AI 智能体。该岗位借助其构建智能体的工具 Ghostwriter,将客户旅程转化为可运行智能体,并持续改写提示词、运行数百次模拟来调优。Sierra 按结果收费,仅在智能体交付实际成果时获得收入。