Nathan Lambert:GLM-5.2 是开源智能体的台阶式跃迁
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
通义 QwenLM 推出 Qwen-AgentWorld,将其定位为面向通用智能体的语言世界模型。该项目的核心思路是用语言模型构建世界模型,以支撑通用智能体的能力。目前公开信息仅包含项目名称与这一方向性描述。
Steve Yegge 撰文认为,随着 Fable 级模型因安全问题被美国政府短暂关闭,超级智能将在最多两三代模型之后被政府管控,多数人可用的大模型能力将呈现平台期。
Hugging Face 在 GitHub 开源 funes 仓库,定位为智能体过往会话的持久化、可搜索记忆。
browser-use 推出 browser-agent-template,这是一个可 fork 并部署到 Vercel 的智能体模板,通过 Browser Use 云端浏览器浏览网页。该模板面向快速搭建网页浏览类 AI 智能体场景,用户可直接 fork 后部署使用。
browser-use 发布 eve,通过 npm 包和脚手架让 Vercel eve agent 接入 Browser Use 云端浏览器。该工具以 npm package + scaffold 形式提供,供开发者为 eve agent 配置云端浏览器能力。
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。
推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。
🚀 MiMo Claw is LIVE Flagship AI Model + Kingsoft Office Integration 🤖 Unlock the Full Power of Agents • Powered by MiMo’s flagship model for reliable long-running tasks • 40–60% lower token consumption than comparable solutions, delivering better long-term value 📄 Productivity, All in One Place • Supports Word, Excel, PowerPoint, and PDF workflows • Generate professional documents, spreadsheets, and presentations with built-in templates 🎁 Expanded Free Benefits • Free to get started • Daily usage expanded from 1 hour to 4 hours • Fully cloud-based with zero deployment required 💰 Limited-time subscription: ¥14.9/month 👉 Try Now: https://aistudio.xiaomimimo.com/#/ 👉 Subscribe: https://platform.xiaomimimo.com/token-plan
Sierra 于 3 月推出 Ghostwriter,让构建和优化 AI 智能体无需点击或写代码,只需描述需求。三个月后,支持主管、运营经理、QA 团队等从未写过代码的人开始直接改进客户体验。Sierra 同时推出优化智能体的 Explorer,持续分析客户对话并找出客户流失、处理不佳的问题及 CSAT 下滑点,再由 Ghostwriter 将洞察转化为改进。
Modem 面向所有用户开放 Zendesk 集成 beta 版,可在 Settings → Integrations → Zendesk 中通过 OAuth 连接。
browser-use 上线 plugins 仓库,为编码智能体提供 browser-harness 和 video-use 两款插件。该仓库托管在 GitHub,具体功能与用法尚未在现有信息中展开。
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队从处理排队转向根因修复和产品洞察。Wilson 的 AI 智能体可追问身高与偏好来推荐手套等具体产品,Minted 则用 AI 打通各客户平台识别趋势。Sierra 博客称客户对话正从成本项变为产品改进与业务增长的洞察来源。
Hugging Face 推出 agent-collabs,用于快速搭建协作式自动研究项目所需的基础设施。该仓库帮助用户快速完成环境配置,以运行多智能体协作的自动研究流程。
Hugging Face 在 GitHub 上线新仓库 tau,将 Pi 的极简编程智能体移植为 Python 版本。该仓库定位为 Pi 编程智能体的 Python 实现,目前公开信息仅说明其为移植项目。
Hugging Face 上线新仓库 mlclaw,用于在 Hugging Face 平台上部署 OpenClaw 智能体。该仓库名为 huggingface/mlclaw,目前仅披露了部署 OpenClaw agents 这一用途。
小米 MiMo 发布并开源终端编程智能体 MiMo Code V0.1,采用 MIT 许可,内置 MiMo V2.5 多模态模型(限时免费、百万 token 上下文)。
推荐理由:官方宣布 MiMo Code V0.1 开源,列出无限上下文、语音输入等具体能力和一行安装命令,可据此评估迁移成本。
Sierra 与 Knox Systems 合作获得 FedRAMP High 认证,距其成立仅两年多,快于多数企业的认证周期。该认证使其 AI 智能体可服务美国联邦机构,此前已有 40% 的 Fortune 50 企业采用其技术。Sierra 支持语音、聊天、邮件多渠道及 58 种语言,Cigna 用八周上线智能体并将患者认证时间缩短 80%。
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者的多智能体 AI 安全研究资助,总额最高 1000 万美元。
推荐理由:原文列出了四个优先研究方向和申请时间线,研究者可以直接据此判断是否提交多智能体安全方向的提案。
Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。
推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。
Ahead of AI 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,按架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评估与基准等类别整理。
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,通过多智能体协作处理多源、多跳查询,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。
Modem 面向所有用户开放 Notion 集成,智能体可创建页面、填充数据库行、更新属性并向已有页面追加内容,所有写入操作均需用户确认后执行。该集成通过 OAuth 授权,访问令牌加密存储,可在 Settings 中随时断开。用户还能把 Notion 中的文档、PRD 等资料结合技能与自动化,构建 UTM 生成、Bug 分诊、客户研究等智能体工作流。
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
Google Research 将驱动 Flood Hub 的水文模型框架在 GitHub 以 Apache 2.0 许可证开源,供各国气象水文部门训练 AI 洪水预报模型。
vLLM Semantic Router 新增会话感知智能体路由(SAAR),在语义路由之上加入路由器会话记忆、工具循环硬锁、安全重置边界、前缀缓存感知的切换定价与可回放轨迹。在 21,600 个确定性轮次中,SAAR 将模型切换减少 79.29%,消除 3,836 次不安全切换,物理模型成本估算降低 78.71%;在 2,896 个 AMD ROCm 实时请求中保持会话连续性,未观察到违规。
QwenLM 发布 open-computer-use,一个基于 MCP 的 Computer Use 服务,供 Qwen Code 及任何 AI Agent 使用。它通过辅助功能 API 控制 macOS、Linux 和 Windows 系统。
推荐理由:原文点明该服务基于 MCP、可跨三大操作系统控制电脑,读者可以据此评估它与 Qwen Code 等 Agent 的结合方式。
Steve Yegge 撰文称运行了约50年的技术面试流程正在走向消亡,AI 辅助简历、AI 作弊和岗位快速变化正让传统评估体系失效。他结合在 Amazon 担任 Bar Raiser 和 Google 招聘委员会的经历指出面试结果统计上很差,主张用实习、co-op 等临时雇佣以及他称为 campfire 的付费真实工作试用替代面试,并让候选人的工作成果形成可携带的记录。
Google Research 在 I/O 2026 上发布 Gemini for Science 科研工具套件,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 以及基于 NotebookLM 的 Literature Insights。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的整合 AI 栈,与 Airbus、BMW 和 ASML 合作优化设计、仿真与生产,并收购 Emmi 补充科学能力。Vibe 智能体升级为统一智能体,可处理收件箱与日历、深度研究、编码到合并 PR 等长程多步任务;Les Ulis 新的 10 MW 推理数据中心计划于 Q3 2026 启用,以增强算力控制与安全。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 整体升级为 Vibe,原有对话、设置与套餐全部迁移。Work Mode 处理跨企业工具的多步骤长任务,如邮件日历跟进、深度研究、文档撰写和定时任务;Code Mode 从网页发起远程编码会话直至生成 PR,并推出 VS Code 扩展和更新的 CLI(新增 /teleport、权限控制等)。
推荐理由:官方发布说明写清了 Le Chat 升级为 Vibe 后的工作与编码两大模式、各端入口和定价,可据以评估是否替换现有工作流。
上海人工智能实验室 InternLM 项目提出 Skill-as-Pseudocode,把 markdown 技能库重构为带类型的伪代码契约,供 LLM 智能体调用,该工作入选 EMNLP 2026 Findings。
Google 在开发者大会发布 Gemini 3.5 Flash 和 Antigravity 2.0,并宣称一个智能体团队用单个提示词、约 $916.92 API 费用和 2.6B token 构建了完整操作系统。
Mistral 发布 Mistral Medium 3.5(128B 密集模型,256k 上下文窗口,修改版 MIT 许可开源权重),并将其设为 Le Chat 和 Vibe CLI 的默认模型。
推荐理由:官方公布了模型规模、基准成绩与定价,并说明云端异步智能体如何嵌入现有工程工作流。
Mistral AI 在 Studio 发布 Connectors 公测,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括直接工具调用、requires_confirmation 人工审批流和连接器的程序化管理;连接器 centrally 注册后可在 LeChat 和 AI Studio 间复用,并支持与 CRM、知识库等企业系统集成。
OpenBMB(清华 NLP)发布 PilotDeck,一个面向任务的 AI 智能体生产力平台。该仓库已上线 GitHub,定位为 task-oriented AI Agent productivity platform,具体功能与参数尚未披露。