ARC-AGI-3 交互式推理基准发布
ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。
推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。
ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。
推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。
ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。
推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。
ARC-AGI-1 是 François Chollet 于 2019 年提出的推理基准,包含 800 道网格类谜题任务,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
Preferred Networks 公布了一批由 PFN 研究员、实习生及兼职工程师学生撰写、含联合研究成果的论文,发表于日本及全球的会议与期刊。作者包括 Yoshihiko Ozaki、Shuhei Watanabe、Kenta Oono、Nontawat Charoenphakdee、Shin-ichi Maeda、Kohei Hayashi 等。
RecSys 2022 于 9 月 18-23 日在西雅图举办,行业投稿较 2021 年增长 50%、较 2020 年增长 260%,15 篇行业论文和 15 场行业演讲进入主会程。作者重点推荐三篇论文:用 recency sampling 提升序列推荐训练效率、将 Open Bandit Pipeline 扩展到模拟行业挑战、以及 Google 广告 CTR 模型的工业级 ML 工程实践。
EasyPPO 通过仅对 actor 做过长过滤、按采样回报标准差倒数对 critic 回归加权、以及适度缩小 critic mini-batch,解决了 PPO 训练大语言模型时 critic 的两类失稳问题。
研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。
研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。
HybridCUA 提出让计算机使用智能体(CUA)同时编排 GUI 与 CLI 的混合范式,并构建了含 5K 混合轨迹与 3K 可验证 RLVR 任务的 HybridCUA-8K 数据集。
LongLive-Plug 是一个一次性蒸馏框架,将可复用能力以 LoRA 形式学习在基座模型上,实现免训练、即插即用地部署到兼容的下游模型。这些能力涵盖单次 classifier-free guidance、少步采样和自回归生成的长上下文纠错,即使下游模型新增条件分支或扩展输出通道,适配器仍可复用。
ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
EVO-WAM 让世界动作模型无需额外专家演示即可适应新任务,通过视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频-动作一致性,再迭代训练。在 RoboTwin 2.0 的 7 个未见任务上,Cosmos3 平均成功率从 26.9% 提升至 68.0%,DreamZero 从 28.5% 提升至 46.4%;真实世界 3 个长程复合任务中 Cosmos3 从 20.0% 提升至 76.7%。
研究提出智能体主动性的内容维度:水平主动性追求当前上下文已隐含但用户未明说的信息,垂直主动性追求只有早期证据才能揭示的需求。基于基准自身分解构建的“需求图”可在无模型评判的情况下对两种主动性及停止时机打分。所提 Q&D 方法在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过参数量大 15 倍的提示模型。
SoL-Refiner 是一种单步视频精修器,可将低分辨率模型输出经一次去噪直接转为 4K 视频,方法结合高分辨率持续训练、RL 后训练与最终一步蒸馏。在约 2K 分辨率下,其单步效果在 VBench 与 UniPercept 均值上超过所有外部精修器,在 3840×2176 下两项指标均优于三步的 LTX-2.3 Refiner。
APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观题与开放题。评测显示现有方法难以同时兼顾可靠的长期召回、低开销与有效的主动协助,存在明显的效用—延迟—存储权衡。该基准还测试模型能否识别证据不足的情况。
研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。
研究团队提出 VoxPolyMem,一个面向多方语音对话的交互感知多模态记忆框架,结合增量说话人识别与交互记忆、事实记忆、参与者画像三层记忆结构,并将检索建模为智能体顺序决策。
针对 GRPO 等 RLVR 方法在 rollout 预算有限时出现全失败组、无梯度信号的问题,研究者提出 GRAFT,用同伴模型的轨迹替换全失败组,并通过序列级兼容性加权和 token 级重要性比裁剪控制跨模型失配。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,将增强版 LongCat 模型与多智能体工作流结合,通过规划与调查分离、分节并行撰写与全局审阅来生成有证据支撑的报告。
研究团队提出 OmniTaskonomy 统一分类体系,覆盖 19 项图生图(I2I)生成任务与 25 项图生文(I2T)理解能力,系统探究视觉生成监督何时以及如何提升视觉理解。
研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。
研究者发布 EngiWorld 基准,围绕完整设计闭环构建 1301 个专家任务,覆盖 CAD、CAE、CAM、BIM、EDA 和 3D 可视化 6 个工程领域、26 个专业软件平台,并提供 GUI 与 CLI 接口。
针对 LLM 智能体在扁平语料中反复重新发现文档关系、遗漏互补证据且消耗大量 token 的问题,研究者提出 CorpusMap——围绕文档中反复出现的实体构建导航层,将每个实体表示为 Entity Page 并链接所有提及它的文档,形成可遍历的实体-文档图。
研究者提出 Grounded Entity Biographies(GEB)长视频记忆框架,将同一物理实例在不同片段中的视觉观察归组为可检索的"传记",并在问答时与情节证据一同检索。
LEGO-Anything 是一个 Image-to-Code 框架,让编码智能体迭代编写并执行 Blender 代码、检查场景与渲染结果并修订程序,把单图重建的 3D 场景表示为可检查、可编辑、可查询的场景程序。
研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。
SAKI(Supervision Allocation with KL-constrained Interpolation)通过 KL 约束的教师引导 rollout 与最大耦合,将 token 级监督路由到接受与纠正两类位置,纠正概率恰为 TV(p_t, q_t)。
研究发现,Latent WAM 虽在分布内任务上与 Explicit WAM 持平,却丢失了 WAM 原本的泛化优势;在环境扰动、数据效率和任务泛化三个维度上均出现一致退化。
PanoVLN 用 4B 骨干网络和纯 RGB 输入做全景视觉语言导航,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。
研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
论文提出 Omni-IO Skills,一个即插即用的 Agent Harness,通过分层 Skills、标准化多模态执行接口、依赖感知编排和持久化 Asset Registry,让现有 Agent 无需改动推理核心即可原生处理多模态任务。
MemEvo 是 LLM 驱动的自动研究框架,把流式视频记忆设计转化为可执行记忆程序的搜索问题,用预训练 LLM 迭代生成并优化候选记忆程序,底层视觉语言模型全程冻结。
SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。
研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。
针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。
针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。
BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。