Sierra 在多伦多开设办公室,AI 智能体已服务超 40% 的 Fortune 50
Sierra 在多伦多开设办公室,目前约有十几名员工,客户数量持续增长。基于 Sierra 构建的 AI 智能体已服务超过 40% 的 Fortune 50 企业,处理数十亿次客户交互。Singtel 在 10 周内上线,解决率超过 70%;Cigna 在 8 周内投产,将患者身份验证时间缩短了 80%。
Sierra 在多伦多开设办公室,目前约有十几名员工,客户数量持续增长。基于 Sierra 构建的 AI 智能体已服务超过 40% 的 Fortune 50 企业,处理数十亿次客户交互。Singtel 在 10 周内上线,解决率超过 70%;Cigna 在 8 周内投产,将患者身份验证时间缩短了 80%。
Sierra 称 Agent Strategist 是其增长最快的团队,这一角色结合 go-to-market、咨询与构建能力,负责端到端落地 AI 智能体。该岗位借助其构建智能体的工具 Ghostwriter,将客户旅程转化为可运行智能体,并持续改写提示词、运行数百次模拟来调优。Sierra 按结果收费,仅在智能体交付实际成果时获得收入。
Modem 向所有用户开放 Automation Templates,可在 Automations 页面浏览并一键安装经过测试的现成智能体自动化。安装后模板会生成预填提示词、调度和输出目标的自动化,未编辑提示词时还能随官方改进持续更新,用户也可随时 fork 自行定制。模板覆盖 GitHub PR 合并后通知 Slack、每日新面孔识别、每周更新日志草稿等场景。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 实验室加速细胞衰老逆转研究:它扫描数万篇论文后提出 20 多个可测试的新遗传因子,其中数个经实验验证能驱动细胞进入更年轻状态并改善整体功能。Co-Scientist 还将原本需长达六个月的筛选数据分析缩短至几天。
Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列于产品与工具入口。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验工具:基于 Co-Scientist 的 Hypothesis Generation。
Nous Research 在 GitHub 上线 hermes-compression-eval,一个面向 hermes-agent 的 ContextCompressor 的离线探针式评测工具。其方法论改编自 Factory 于 2025 年 12 月发布的《Evaluating Compression》。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出将 NLRP3 炎症小体作为连接炎症与代谢的分子桥梁这一新假设,并经实验验证。该假设或为靶向联合疗法铺路,也解释了 resmetirom 为何仅对少数符合条件的患者有效。
Google Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关矛盾文献,将想法转化为可检验假设并按可行性与风险收益排序。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。
推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。
过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊
People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models
Institute for Law & AI 提出“激进可选性”监管思路,主张政府短期避免过度监管,同时提前建设信息收集、举报人保护、评估与人才等制度工具,以应对 AI 可能带来的剧烈冲击。Meta 与 KAIST 的论文提出 Neural Computer,试图用神经网络在学习到的运行时状态中统一计算、内存与 I/O。
Thinking Machines Lab 宣布 interaction models 研究预览,让模型原生处理实时音频、视频和文本交互,而非依赖外部 harness。
推荐理由:原文由当事团队给出架构设计、能力演示和基准数字,读者可以据此了解交互能力如何内置于模型本身。
NousResearch 在 GitHub 发布 agent-governance-toolkit 开源仓库,面向自主 AI 智能体提供策略执行、零信任身份、执行沙箱和可靠性工程能力。仓库说明覆盖 10/10 OWASP Agentic Top 10。
阿里巴巴在 GitHub 上线 skill-up,一个用于 Agent Skills 评估与进化的工具。该仓库定位为对 Agent 技能进行评测并推动其迭代演进,目前公开信息仅包含这一句功能描述。
开发者用 CLI 智能体 Goose 配合 Together 的 dedicated containers 技能,仅凭一句提示词就为 Netflix 新发布的 void-model 生成了可在 Together Dedicated Container Inference(DCI)上运行的完整容器配置,把从模型发布到实际部署的滞后压缩到近乎为零。
Sierra 的 Monitors 是常驻评估层,用 LLM-as-judge 审查每一段对话,追踪智能体质量与客户情绪。每个 monitor 都经过基于团队标注对话和模型一致性的严格评估循环,模型分歧会被反馈进训练与评估集,直到稳定一致。Sierra 还通过 Agent Studio 让企业用自然语言创建自定义 monitor,并走同一套评估流程。
Modem 向所有用户推出 Agent Skills,即可复用的智能体指令集,由 slug、一句触发描述和指令正文三部分组成,在 chat、Slack 和 automations 中统一生效,并与全组织共享。
browser-use 发布新仓库 terminal,一个用于在浏览器中完成任务的终端 UI。该工具以终端界面形式操作浏览器,具体功能与可用性细节尚未在仓库描述中展开。
Google DeepMind 发布 AlphaEvolve(基于 Gemini 的编码智能体)一年来的影响汇总。
推荐理由:原文系统汇总了 AlphaEvolve 一年来在科研、基础设施与商业中的落地案例,附具体数字,可作为评估此类编码智能体实用价值的参照。
阿里巴巴在 GitHub 上线 UnifiedModel,一个让 AI 智能体理解企业数据的语义层。该模型只需定义一次实体与关系,即可通过 SPL/MCP/REST 查询,并把遥测、服务与业务对象连入同一对象图。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,通过渐进式披露只向模型提供当下最相关的信息,避免上下文窗口内无关 token 稀释注意力。
Sierra 宣布融资 9.5 亿美元,由 Tiger Global 和 GV 领投,估值超过 150 亿美元,公司称现有超 10 亿美元可用于投入。
Johann Rehberger 发布 DEF CON Singapore 演讲全文,披露 M365 Copilot 与消费版 Copilot 的多条漏洞链,MSRC 编号 CVE-2026-24299,问题已修复。
推荐理由:作者亲历披露全链路攻击并给出修复时间线,读者可以借此理解间接提示词注入与内存持久化的实际风险。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
OpenAI 上周在 Codex 中发布 Auto-review,用单独的 Agent(GPT-5.4 Thinking low reasoning)在沙箱边界自动批准或拒绝操作,替代人工同步审批。
推荐理由:原文给出 Auto-review 的机制、内部部署数字和已知局限,读者可据此评估它在编码 Agent 工作流中的适用性。
OpenAI 推出 OpenAI Developers 插件,帮助开发者在 ChatGPT 和 Codex 中构建 AI 应用与智能体,并提供 OpenAI API 接入与配置指引。
OpenAI 在 GitHub 新建仓库 openai-realtime-meeting-assistant,演示如何把 Realtime API 用作会议助手来管理 Kanban Board。该仓库为示例项目,展示 Realtime API 在会议场景中驱动看板任务管理的用法。
阿里巴巴在 GitHub 上线 AILens,为 AI 提供全栈可观测性,首批支持端到端 RL 后训练,后续将扩展到 Agent 与推理引擎监控。
NVIDIA Nemotron 3 Nano Omni 现已在 Together AI 平台可用,Together AI 提供首日(Day 0)接入与 Dedicated Inference 部署。
Xiaomi MiMo-V2.5 is now officially open-sourced! MIT License, supporting commercial deployment, continued training, and fine-tuning - no additional authorization required. Two models, both supporting a 1M-token context window : • MiMo-V2.5-Pro: built for complex agent and coding tasks, ranking No.1 among open-source models on GDPVal-AA and ClawEval • MiMo-V2.5: a native omni-modal model with strong agent capabilities A model's value isn't measured by rankings alone — it's measured by the problems it solves. Let's build with MiMo now! 🤗 Weights: https://huggingface.co/collections/XiaomiMiMo/mimo-v25 📄 Blog: https://mimo.xiaomi.com/index#blog
Mistral AI 发布 Workflows 公开预览版,一个面向企业 AI 的编排层,提供持久执行、可观测性、容错和人工审批,ASML、ABANCA、CMA-CGM 等客户已在用它自动化关键业务流程。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立新合作,属于其 National Partnerships for AI 计划的一部分。
browser-use 发布开源仓库 bux,定位为全天候运行的 Claude Code 智能体,用于 Playwright 风格的浏览器自动化。它结合 Browser Use Cloud 和 Telegram,可在用户自己拥有的任意设备上运行真实浏览器。
Gas City 本周发布 v1.0.0,由 Julian Knutsen 和 Chris Sells 基于 Steve Yegge 的构想开发,将 Gas Town 整个栈重构为可组合的声明式 SDK,用于搭建自主协作的 agent 团队(即所谓 dark factory)。
阿里巴巴在 GitHub 发布 obz-cli,一个面向 metrics、logs、traces 的多后端可观测性 CLI,提供统一接口并适配 AI Agent 使用。该工具将多种可观测性数据源的查询整合到同一命令行界面中。
小米为 MiMo 系列模型推出 MiMo-Skills,一个面向该系列的智能体技能(Agent skills)仓库。目前公开信息仅说明其用途是服务 Xiaomi MiMo 系列,未披露技能数量、支持版本或调用方式等细节。