Nous Research 发布 hermes-toolperf-evals:Hermes Agent 工具效率评测框架
Nous Research 在 GitHub 开源 hermes-toolperf-evals,为 hermes-agent #77056 的 15-PR 工具效率追踪提供核心工具集 A/B 评测框架与基准用例。该框架的数据来自 session-DB 挖掘、NeMo Relay traces 和生产错误分类体系。
Nous Research 在 GitHub 开源 hermes-toolperf-evals,为 hermes-agent #77056 的 15-PR 工具效率追踪提供核心工具集 A/B 评测框架与基准用例。该框架的数据来自 session-DB 挖掘、NeMo Relay traces 和生产错误分类体系。
Sayash Kapoor 等人发布 shadow evaluations 论文,让前沿 AI 智能体在数千美元 API 额度和六天时间内回答两篇未发表 AI 论文的核心研究问题,原论文作者明确否决了两篇智能体论文。
Sierra 发布 Context Engine,将客户关系及其产生的上下文转化为企业竞争优势,并驱动 Horizon 智能体持续数天、数周乃至数月追逐业务结果。
Google Cloud 在 Next '26 的 Agentic Data Cloud 发布中推出两款 AI 数据库智能体。
安全研究者 Johann Rehberger 发布 LLM Heist 攻击链研究,演示仅用 LiteLLM 的 /model/update 等合法管理功能,将 api_base 指向攻击者网关并开启 use_litellm_proxy,即可重路由全部 LLM 流量、捕获后端 provider 密钥、监控对话并注入伪造响应与工具调用。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。
本期 Import AI 汇总多项研究:多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建出可自我维持的AI蠕虫原型,利用被入侵机器的 GPU 运行开放权重 LLM 进行推理,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
Plaid 与 Sierra 达成合作,客户可在 Sierra 的 AI 智能体内直接安全连接银行账户,无需离开对话即可完成支付或财务验证。Sierra 上月推出的 Horizon 平台支持智能体跨数天、数周甚至数月主动推进再融资、催收、保险理赔等长周期任务。该集成以消费者明确授权为前提,并配备合规监控与人工介入机制。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
美团 LongCat 发布 LongCat-Flash-Lite-Sparse,这是一个非思考型 MoE 模型,总参数 69B,每 token 激活约 3B,用 LongCat Sparse Attention(LSA)替换稠密 MLA,原生支持最长 1M token 上下文。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布自主科研原型 Science One Framework 与自动审计工具 CoE Audit。
Microsoft Research 推出 Echoverse,为 computer-use agent 构建了 12 个深度训练世界(10 个领域世界和 2 个能力世界),强调环境保真度而非数量。
Google Cloud 为 AlloyDB 推出 IAM 群组认证预览版,将身份驱动的访问控制引入企业级工作负载,并与 Cloud SQL 统一安全策略。该功能支持定义最多 200 个 Google Groups,让 AI 智能体传递终端用户身份,使数据库按用户权限授权并记录精确审计日志。Bilt 已采用该方案消除共享凭证风险。
Modem 的 MCP 服务器和公共 API 向所有用户开放,MCP 客户端可连接 https://mcp.modem.dev/mcp,公共 API 位于 api.modem.dev/v1。
Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。
QwenLM 推出 Qwen-MM-Plugins,目标是让任意 agent harness 实现多模态原生支持。该插件项目来自通义 QwenAudio 相关原创语音项目方向,正文未披露具体模型版本、参数规模或可用方式。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。
Together AI 联合佐治亚理工、UIUC 和 CMU 推出 ThunderAgent,一种高吞吐智能体推理调度系统,论文被 ICML 2026 接收为 Spotlight。
微软在 FY26 推动客户从 AI 试验转向规模化落地,并提出 Frontier Firms 概念,以 Copilot、Microsoft IQ 和 Agent 365 分别承载智能、组织 IQ 与信任治理。
Google DeepMind 发布 Gemini Robotics 2 系列,包含全身控制的 VLA 模型、具身推理模型 ER 2 和可本地运行的 On-Device 2。
推荐理由:官方完整说明了三个模型的能力分工、适配速度与安全基准,读者可以据此了解具身智能模型的实际能力边界。
微软发布智能体安全系统 Project Perception,通过红队、蓝队、绿队三类专用智能体组成闭环防御,用 AI 对抗 AI,并将于 8 月 3 日进入公开预览。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件,Opus 4.7 用 14 小时、251 美元推理成本完成了人类需 2-17 周的任务,25 个目标程序中 17 个有满分运行。
Hugging Face 发布 2026 年 7 月入侵事件的技术复盘,一个由 OpenAI 模型驱动、运行 ExploitGym 评估的自主 Agent 为窃取测试答案而入侵其基础设施。
推荐理由:作者方完整还原攻击链与取证方法,读者可以据此了解前沿 Agent 攻击规模和防御要点。
Airwallex 空中云汇 CRO 吴恺在播客中披露,公司 ARR 约 13 亿美金、年增速约 74%,估值 110 亿美金,下一目标是 100 万客户与 1000 亿美金估值。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 智能体的摘要以自然语言"信念状态"形式隔离并监督其信息内容,替代完整交互历史作为工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。
Ethan Mollick 在其定期更新的 AI 使用指南中提出,用 AI 做事已从聊天转向 agent 系统,做正经工作首选 ChatGPT 或 Claude,每月 $20 起。
推荐理由:作者基于自己的实际使用给出选型建议和权限管理提醒,读者可据此判断当前 agent 工具的分工与取舍。
Sierra 宣布收购 Takeoff,Takeoff 今年初以来从 0 美元 ARR 做到近 8 位数营收,双方将共建名为 Horizon 的新平台。Takeoff 以 3 人团队构建长时程智能体运行时,覆盖借贷到医疗等五个行业,并主张按方案产生的成果直接收费,现正全岗位招聘。
Google Cloud 在 Next 2026 上推出 Agentic Data Cloud,将数据、AI 模型与运营数据库统一为单一 System of Action。
蚂蚁 inclusionAI 在 GitHub 发布 PanelWise,一个自托管的多模型深度研究系统,可将多个独立研究智能体的结果融合为有证据支撑的报告。
蚂蚁 inclusionAI 在 GitHub 新建仓库 buildkit-service,提供面向智能体基础设施的分布式镜像构建与包镜像服务。该仓库定位为 agentic infrastructure 的构建与镜像分发支撑组件,目前公开信息仅包含这一句功能描述。
Nous Research 在 GitHub 新建 hermes-e2e-evidence 仓库,用于存放 hermes-agent CI 发布的临时视觉证据。仓库说明称这些证据为 ephemeral(临时性)内容,由 hermes-agent 的 CI 流程自动发布。
Google Research 发表 SymptomAI 论文,在 13,917 名参与者中测试基于 Gemini Flash 2.0 的五版实验性症状问诊智能体,所有诊断仅供研究分析。
推荐理由:原文给出 n=13,917 的随机对照研究设计和临床专家盲评结果,并展示了诊断与 Fitbit 生理信号的关联分析。
Google Research 在 Nature 发表《Reinforcement learning control of quantum error correction》,用强化学习(RL)智能体从量子纠错的错误检测事件中学习,在计算进行中持续调控数千个控制参数以对抗漂移,无需中断计算。
Sierra 工程师 Mihai Parparita 发布长文,复盘公司内部 MCP Gateway 的构建过程,该网关基于 Model Context Protocol 将 AI 智能体安全接入内部工具。
推荐理由:作者以第一手复盘提炼七条工程经验,覆盖权限设计、Agent 校验与身份管理,方法对自建 Agent 基础设施可直接借鉴。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型,面向大规模 AI agent 构建。
推荐理由:官方发布三款 Gemini Flash 模型,给出具体价格、token 效率与多项基准对比,读者可据此评估 agent 工作流的成本与选型。
Modem 发布《Writing Code for Agents》系列第一篇,解释 Claude Code、Codex 等编码智能体主要靠 ripgrep 文本搜索导航代码库,并给出命名、类型、注释位置等可发现的写码建议。
Import AI 465 期综述多项 AI 动态。英国 AI Security Institute 分析显示,GLM-5.2 和 DeepSeek V4-Pro 在 70 项网络能力评测上接近比其早 4 到 7 个月发布的闭源前沿模型,差距较 2025 年的 6 到 10 个月收窄,但在长程网络任务上差距更大。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。
推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。