NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿级通用架构
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。
NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。
Google DeepMind 回顾了从 DQN 玩 Atari 到 AlphaStar 打 StarCraft II 的 15 年游戏 AI 研究历程,并宣布与游戏开发商合作打造新玩法原型。
好消息!LongCat-2.0 搭配 Hermes Agent 的免费使用已再延长两周 🐱 在 @NousResearch Portal 上有更多时间体验!
LongCat-2.0 is now live on the @NousResearch Portal and free to try with Hermes Agent for one week! 🐱
Together AI 在全部 113 个 DeepSWE 任务上对 GLM-5.3 (max) 与 GPT-5.6 Sol (max) 各跑 4 次试验,共 904 次 rollout。
推荐理由:原文基于904次实测给出两模型在成本、速度和任务类型上的具体差异,并提供了可直接套用的级联路由方案。
Sierra 将发布治理直接内置到平台,用 Agent Checks、Simulations、合并审批工作流和分流发布,把变更从 Workspace 安全推进到线上客户对话。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
Hugging Face 在 GitHub 发布 huggingface/s2-cli 仓库,提供一个查询 Semantic Scholar 的命令行界面(CLI)和 Skill,面向智能体和人类使用。
NVIDIA 探索通用编程智能体能否借助 HoloHub 中的示例、文档和开发工具来开发 Holoscan 边缘实时 AI 应用。Holoscan 是面向医疗影像、机器人等边缘实时 AI 应用的平台,HoloHub 是其配套仓库,汇集了不断增长的参考应用与组件。
Gergely Orosz 采访在 Google 工作 14 余年的 Addy Osmani,回顾他 16 岁造浏览器、开发 Chrome DevTools 和 Core Web Vitals 的经历。
Pol Alvarez Vecino 借 Peter Naur 的《Programming as Theory building》指出,真正要降低的复杂度是存在于工程师头脑中的程序 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 的复杂度膨胀。
Grok 4.6 在 DiligenceBench 金融测试中以约 52–53% 位列第 2,与 Claude Opus 5 基本持平,Sonnet 5 以 46.2% 落后。
ALTK-Evolve 让智能体从自身历史轨迹中蒸馏可复用准则并在推理时注入,无需更新权重或人工标注,在 AppWorld 的 585 个多步任务上测试了 8 个模型。
周天奕用 Claude 花四小时做出「同事.skill」,可将聊天记录、会议纪要等「蒸馏」成可调用的 AI 技能包,上线 5 天在 GitHub 收获 7.3k 星标,累计 23k,并衍生出 200 多个 skills。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),用 70 款规则与目标均隐藏的手工游戏测试 AI 自主发现环境规律的能力,目前仅公开 21 款。
browser-use 在 GitHub 发布 macos-harness 仓库,定位是最简单、最精简的 harness,让大语言模型完全自由地控制一台 Mac。
Z.ai 发布 GLM-5.3,目前仅在编码计划中提供,即将上线 API 并在两周后于 Hugging Face 开放权重,模型约 750B 参数,在多个 agentic coding 基准上超越 Kimi K3,部分超越 Claude Fable 5 或 GPT-5.6-Sol。
推荐理由:作者以第一手分析解释中国实验室如何保持前沿,给出发布节奏、RL 环境数据产业和模型定位等可迁移的判断框架。
Meta 的裁员与强制调岗引发未被波及的工程师也开始求职,形成“离职潮”,公司如今以大额股权留人却收效甚微。Cursor 团队发布通用 AI harness Grok Bot,被形容为“面向知识工作的 Codex 体验”,作者用它自动化了大量日常工作流。
Sierra 宣布在慕尼黑开设办公室,服务德国、奥地利和瑞士的企业客户。Sierra 帮助大型企业构建服务与营收 AI 智能体,客户包括全球三分之一领先银行、40% 的 Fortune 50 企业及十大医疗组织中的五家。其客户 BBVA 30 天上线智能体,英国零售商 Next 用时 42 天,Singtel 用时 56 天。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。
推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。
Hugging Face 博客与 AWS Strands Robots 团队演示了在单个 Agent 中跑通机器人数据闭环:录制演示同步到 Storage Bucket,通过 Xet 内容定义分块实现字节级去重上传,再用 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的主力模型,面向编码与 Agent 场景,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方博客给出具体评测分数与限时定价,读者可以据此评估 Flash 系列在编码、Web 开发和知识工作上的实际提升。
Google Cloud 为 BigQuery Graph 引入 measures(预览版),把受治理的指标与关系映射统一起来,让 AI 智能体在图上跨多跳依赖进行推理。
Sierra 提出在基于目标与护栏构建的智能体上沿用纵深防御原则,让每条客户消息在回复前经过内容、规则与政策、Supervisor 模型、确定性护栏等多层检查,单条消息可触发多达六项校验。Sierra 还通过第三方对抗评估与红队测试、平台级 Threat Detection 与单智能体 Agent Monitors 持续监控,并用 Simulations 在上线前压测护栏回归。
Nous Research 在 GitHub 发布 Hermes-Bot-Mode,为 Hermes 桌面端带来 Bot Mode,提供一组具名智能体,各自拥有独立聊天、头像、例程,并支持智能体间互发消息。该功能以桌面插件形式实现,无需修改核心代码。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
Hugging Face 组织的 ICML 2026 Open Reproductions 挑战赛(7 月 15 日至 8 月 2 日)中,1,221 名社区成员用 Claude Code。
推荐理由:原文复现了 ICML 2026 约三分之一的论文并给出具体的证伪案例,读者可以借此了解智能体驱动大规模同行审查的可能与局限。
Honeycomb CTO Charity Majors 认为,2025 年对 AI 持怀疑尚属合理,但 2026 年 AI 正在改变整个行业,怀疑空间越来越小。她称自己的转折点是 2025 年 11 月的 Opus 4.5,并认为 Claude Code 这类 harness 带来的改变更大。她还提出代码审查被高估、非确定性系统需要更多工程纪律。
Sierra 称其 Horizon 智能体可为每位潜在客户配备一名 AI 智能体,持续数天、数周甚至数月主动跟进,直到客户购买或放弃。文中以车险为例,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款问题,第 7 天完成通话并促成保单购买。Sierra 表示该智能体遵循企业合规要求,沟通内容由企业控制。
Grok Bot 现已上线!迈向能干又讨喜的数字同事的早期一步。
Introducing Grok Bot, now in early beta. Bots are AI teammates that do real work for you. They sign in to your tools, use them just like you do, and come back with finished work.
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时视频临床问诊,感知非语言视觉和听觉线索并引导虚拟体格检查。
推荐理由:原文给出三智能体架构和随机对照结果,读者可以据此了解实时视频问诊 AI 的设计思路与评估方法。
Introducing NVIDIA Nemotron 3.5 Lightning⚡ An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster. It delivers up to 4x the output speed of similar-sized models.
Sierra 宣布其平台上的 Agent 可开箱即用地导航复杂的 IVR 电话系统,官方评测中整体通过率从 57% 提升至 85%,增幅约 49%。该能力覆盖通话时机、多级菜单、DTMF 按键音、静默处理和识别真人,配合记忆与智能重试逐步提升成功率;已有医疗支付方、数字药房和收入周期管理公司在使用,文章还展望了 Agent 可信身份认证的长期方向。
ALTK-Evolve 与 ACE 同为无需更新权重、无需人工标注的智能体记忆系统,但 ALTK-Evolve 把记忆投递当作可调旋钮,按任务检索少量高支持度指南,而非每步注入完整 playbook。
Import AI 第 468 期汇总了多项 AI 研究进展。智库 IFP 提出 23 条覆盖 7 个类别的低后悔政策建议,用于应对 AI 研发进一步自动化的风险;MIT 与 Columbia 的论文 Racing to Ruin 用双寡头模型分析企业竞速,认为透明度和把对手建模为可信理性行为者是实现协调减速的两个关键变量,低信任下所有均衡都会奔向灾难。