跳到正文

#arXiv

今日 11 条
今天10月1日周四
  1. arXiv:cs.CL(计算语言学,全量分类)36

    ViLegalExpert:面向越南法律检索与问答的大规模真实咨询基准

    研究者发布 ViLegalExpert,一个基于真实公民—律师咨询构建的大规模越南法律基准,包含超 172K 个问题、覆盖 34 个法律领域,并配有专业答案与专家核验的法律证据。该基准支持法律信息检索、抽取式问答和生成式问答三类任务。实验显示,预训练模型在问答上表现较强,混合检索取得最佳检索效果,但证据检索与有依据的答案生成仍面临显著挑战。

  2. arXiv:cs.CL(计算语言学,全量分类)40

    诊断推理语言模型的 On-Policy 自蒸馏(OPSD)

    研究对 0.6B–8B 参数模型上的数学推理任务诊断了 On-Policy 自蒸馏(OPSD),发现教师信号由推理模式对齐和完整教师前缀决定,而非特权语义本身。OPSD 仅在狭窄的兼容区间内提升推理,否则会导致无效长度增长、稳定退化或行为崩溃。Token 级分析显示教师信号不稳定且无法预测下游性能,因此 OPSD 是一种敏感算法,而非普遍可靠的推理提升后训练方法。

  3. arXiv:cs.CL(计算语言学,全量分类)41

    通过残差流动态揭示大模型失控重复现象

    研究者提出 Tokenwise Residual Comparison(TRC)方法,通过比较生成过程中各 token 对残差流的注意力与多层感知机写入来定位重复异常,并选择性抑制对应层残差流坐标,平均降低循环率 57%。分析显示重复语义在浅层出现并沿残差流传播,破坏正常表征。TRC 在 LVLM、LLM 和 LRM 上均能捕获类似重复动态并有效缓解。

  4. arXiv:cs.CL(计算语言学,全量分类)36

    为投机解码恢复离策略监督:基于 rollout 的草稿模型训练框架

    研究者提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)两个组件,为投机解码草稿模型恢复被离策略 token 破坏的完整监督信号。在固定视觉语言和文本语料上,该框架相比 DFlash 将贪心接受长度最高提升 36.5%,单轮训练即超过最佳擦除调度,三轮后匹配目标重生成响应的接受长度。代码已开源。

  5. arXiv:cs.CL(计算语言学,全量分类)35

    通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型

    研究提出位置选择性自蒸馏方法,利用教师与学生模型间的逐位置熵变识别"上下文锐化"与"上下文扩散"两种模式,并通过位置掩码保留熵变分布低尾部分。实验显示,掩码高熵变位置可提升分布外泛化能力,所得自蒸馏评判模型在主观子类别上比 GRPO 等结果监督 RL 训练的评判模型高出 2-9 个百分点,在客观类别上保持竞争力。

9月30日周三
  1. arXiv:cs.LG(机器学习,全量分类)36

    立场:若无法强制复现,就应加强可验证性

    一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文指出,机器学习论文中的实证结果普遍难以复现、代码往往不可得,并阻碍研究发展。作者对这些问题进行了分析与量化,提出具体建议以提升结果的可核查性,即使无法做到完全复现。代码与支撑材料已公开。

8月17日周一