PatchHolmes:通过列表式选择实现智能体补丁检索
PatchHolmes 用列表式选择让智能体一次性读取前 100 个候选 commit,再通过四个带预算的工具打开单个 commit,最终提交唯一答案,Recall@1 达 59.95%,高于逐点系统的 34.61% 和通用检索推理基线的 28.55%。
PatchHolmes 用列表式选择让智能体一次性读取前 100 个候选 commit,再通过四个带预算的工具打开单个 commit,最终提交唯一答案,Recall@1 达 59.95%,高于逐点系统的 34.61% 和通用检索推理基线的 28.55%。
论文 SkillSeek(被 AACL-IJCNLP 2026 Findings 接收)在 89 个任务、4 种设置上对比 11 种 Agent 技能检索方法,发现 BM25 在 4 个设置中的 3 个上持平或超过 agentic 检索循环,小型 cross-encoder 在第四个设置达到相同 0.442 通过率。
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。
论文提出 EviRover,据作者所知是首个显式训练通过交互解决感知查询的感知智能体,采用 SFT 加智能体强化学习训练。团队构建两条数据管线生成 EviRover-SFT-5K 和 EviRover-RL-12K,并发布含 688 个实例、覆盖五类感知任务的人工校验基准 EviLens。
研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。
研究者提出 Agentic Idea Manager(AIM)框架,把研究想法的管理作为自动化研究的核心环节,将想法组织成语义聚类、用实验证据评估其潜力,并自适应分配实验预算。
研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 以原子断言方式评估物理描述。在 Wan 与 Cosmos 骨干上的四项物理视频基准实验中,物理合理性均有提升;基于开源 Cosmos3-Nano 的增强模型超过了闭源 Veo 3.1。
研究者提出 Game-Guided Skill Discovery(GGSD)框架,利用游戏中的自对弈发现人类可直接操控的运动技能,由高层策略从少量离散技能中选择、低层策略学习对应行为。在 Ant、Franka-arm 和 Unitree G1 环境中,人类可替换高层策略直接操控智能体,并通过技能组合解决 Maze、CubePush 等未见任务,无需额外训练。
DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整个回答。在 Qwen3 和 Llama 上,其平均宏准确率超越全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等任务混合上领先。消融显示,联合结果设计贡献了主要增益。
研究分析 JEV 1.13 与三个开源 KEV 模型,发现直接决策模型存在"序数尺度利用偏差":在 36 个序数数据集上,最终决策仅使用 67–76% 的有效 gold 支持,而四个名义任务为 87–102%。
RSIGame 是一个带递归自我改进的自主智能体游戏开发框架,通过局部“探索-诊断-改进”循环与全局质量跟踪循环,在 140 个 GameCraft-Bench 任务、两个游戏引擎和五种生成器上以相同开发预算稳定提升游戏质量。
研究者提出 RoboCoach,一个由世界模型引导的教练框架,通过 Route-Imagine-Diagnose-Improve(RIDI)循环在共享世界模型 COACHWORLD 中执行可复用技能专家,并用进度评判器定位首个失败子任务,从而决定采集哪些演示、更新哪些专家适配器。
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
EvoDuet 是一种双层优化方法,在固定模型参数下让解与搜索查询协同进化,通过检索门让 LLM 判断知识缺口并选择检索新文档、复用已有文档或直接求解。
一项研究系统评测 GPT-6 Astra 作为通用具身策略的能力,覆盖直接控制、与学习策略协作和反馈驱动适应六个领域。
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。
Imagine3D-LLM 让多模态大模型在图像 token 后附加一小组可学习的 summary tokens,将其解码为紧凑的 3D Gaussian Splatting 表示,并以光度重建损失监督、与标准下一 token 预测目标联合训练。
论文提出对 LLM 涌现性失对齐(EM)的动态二阶几何研究:训练轨迹显示方向性 Hessian 曲率集中在语义关键 token 上,Grassmannian 投影表明有害-安全差距扩大主要源于安全梯度重叠下降。
研究者推出 A2Z GameSpec-Bench,用 100 份长篇游戏设计文档(GDD)评测编码智能体的端到端游戏开发忠实度,每份 GDD 被转为含规则、约束与前置依赖的契约,并结合源码检查与智能体生成的测试策略做场景回放和自适应试玩。评测显示当前智能体难以同时满足代码实现与实际游玩中的相互依赖需求;针对具体需求的反馈相比两轮自我修订可将 GDD Fidelity 提升 10.9%。
针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。
ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。
研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。
‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
LEGO-Anything 面向3D场景重建的编程智能体 论文:https://huggingface.co/papers/2609.36380
Omni-IO Skills 让你的智能体原生全能 论文:https://huggingface.co/papers/2609.31847
LongLive-Plug 面向视频生成的一次性通用蒸馏 论文:https://huggingface.co/papers/2609.38154
Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
Apple 研究团队提出 SCLATE,一个让基准测试与未经修改的智能体各自通过适配器向同一开放事件调度器注册事件的执行底座,用混合模拟时钟把长达一个月的场景压缩到数小时。
研究揭示在线策略蒸馏(OPD)在弱到强、同基座和强到弱师生设置下的缩放规律:早期训练中,留出准确率(gold score)随学生初始化 token 级反向 KL 散度的平方根近似线性上升。
论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。
科学家开发出一款“语音时钟”,通过音高、语速等数百项声音特征预测人的年龄,并计算“语音年龄差”。研究基于阿根廷、智利、哥伦比亚、墨西哥和秘鲁 2928 名西班牙语使用者的录音,用机器学习提取 700 多项随衰老和痴呆变化的语音特征。较大的语音年龄差与痴呆等认知问题强烈相关,成果已发表于 Science Advances。
Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。
推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
研究系统考察了 LLM 概念注入与移除场景下的多种条件控制方法,发现高效激活引导(activation steering)方法常以流畅性大幅下降为代价。激活引导在指令微调模型上的效果远不如基座模型,而简单提示词与完整监督微调适合概念注入、却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。
Google 在 TPU 上通过稀疏注意力内核优化加速视频扩散模型的时空注意力计算。视频扩散中自注意力在单层延迟占比可从 720p 的 55.5% 升至 1440p 的 88.2%。
FinnGen 研究团队构建了人群规模的免疫多组学图谱,通过单核 caQTL、eQTL 与 peak–gene link 分析揭示调控性疾病的遗传机制。相关汇总统计数据已公开并可交互浏览,个体级单核计数矩阵等数据需经审批后向研究者开放。研究还整合了 BBJ、日本 COVID-19 工作组及 eQTL Catalogue、TenK10K、SingleBrain 等数据集进行再分析。
Google DeepMind 团队在 Nature 描述了一套名为 SynthIDBio 的水印系统,通过在氨基酸序列和三维结构中编织微弱统计特征,为 AI 设计的蛋白质打上可检测的隐形标记,且不明显损害其结合病毒感染、血管生成和免疫调节相关靶点的功能。