STITCH:用可复用原语在测试时组合任务专属 Agent Harness
研究者提出 STITCH 框架,基于从失败任务轨迹中挖掘的可复用 Harness Primitives,在测试时按任务信息选择并编译出任务专属 Agent Harness,无需生成或修复机制代码。
研究者提出 STITCH 框架,基于从失败任务轨迹中挖掘的可复用 Harness Primitives,在测试时按任务信息选择并编译出任务专属 Agent Harness,无需生成或修复机制代码。
研究者发布 ViLegalExpert,一个基于真实公民—律师咨询构建的大规模越南法律基准,包含超 172K 个问题、覆盖 34 个法律领域,并配有专业答案与专家核验的法律证据。该基准支持法律信息检索、抽取式问答和生成式问答三类任务。实验显示,预训练模型在问答上表现较强,混合检索取得最佳检索效果,但证据检索与有依据的答案生成仍面临显著挑战。
研究对 0.6B–8B 参数模型上的数学推理任务诊断了 On-Policy 自蒸馏(OPSD),发现教师信号由推理模式对齐和完整教师前缀决定,而非特权语义本身。OPSD 仅在狭窄的兼容区间内提升推理,否则会导致无效长度增长、稳定退化或行为崩溃。Token 级分析显示教师信号不稳定且无法预测下游性能,因此 OPSD 是一种敏感算法,而非普遍可靠的推理提升后训练方法。
TRACE 通过目标分组检索、独立类型化证据定位、多模态表格抽取、schema 驱动表格构建与 fail-closed 校验,弥合 LitTraceQA 中源访问与评分可见正确性之间的“grounding contract gap”。
研究者提出 NAMOH,一种架构原生稀疏注意力机制,每个 token 只激活 H 个注意力头中的 K 个,每个头仅保留分配给自己的 token 并在该子序列内做因果注意力。
研究者提出 Tokenwise Residual Comparison(TRC)方法,通过比较生成过程中各 token 对残差流的注意力与多层感知机写入来定位重复异常,并选择性抑制对应层残差流坐标,平均降低循环率 57%。分析显示重复语义在浅层出现并沿残差流传播,破坏正常表征。TRC 在 LVLM、LLM 和 LRM 上均能捕获类似重复动态并有效缓解。
研究者提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)两个组件,为投机解码草稿模型恢复被离策略 token 破坏的完整监督信号。在固定视觉语言和文本语料上,该框架相比 DFlash 将贪心接受长度最高提升 36.5%,单轮训练即超过最佳擦除调度,三轮后匹配目标重生成响应的接受长度。代码已开源。
研究提出位置选择性自蒸馏方法,利用教师与学生模型间的逐位置熵变识别"上下文锐化"与"上下文扩散"两种模式,并通过位置掩码保留熵变分布低尾部分。实验显示,掩码高熵变位置可提升分布外泛化能力,所得自蒸馏评判模型在主观子类别上比 GRPO 等结果监督 RL 训练的评判模型高出 2-9 个百分点,在客观类别上保持竞争力。
Prompt2Skill 框架仅凭自然语言任务描述即可构建技能,通过推导任务规范、发现或合成数据集,并在反思编辑的闭环中优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架持续优于直接提示基线,在开源与前沿模型上平均提升 10.8。
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
RSIGame 是一个带递归自我改进的自主智能体游戏开发框架,通过局部“探索-诊断-改进”循环与全局质量跟踪循环,在 140 个 GameCraft-Bench 任务、两个游戏引擎和五种生成器上以相同开发预算稳定提升游戏质量。
研究者提出一种无散度向量场的最小表示,将 D 维域上的 D 分量无散度场编码为同一域上的 (D-1) 分量场,利用 Fourier 空间的横向结构与 Householder 正交变换直接构造约化坐标。
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文指出,机器学习论文中的实证结果普遍难以复现、代码往往不可得,并阻碍研究发展。作者对这些问题进行了分析与量化,提出具体建议以提升结果的可核查性,即使无法做到完全复现。代码与支撑材料已公开。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),用 70 款规则与目标均隐藏的手工游戏测试 AI 自主发现环境规律的能力,目前仅公开 21 款。