跳到正文

#论文/研究

今日 177 条
9月30日周三
  1. arXiv:cs.CL(计算语言学,全量分类)41

    DeepRewind:预测并修复深度研究智能体的过早承诺

    DeepRewind 是一个面向深度研究智能体的可逆控制层,将智能体不断演化的认知状态表示为包含来源、证据、主张、假设、承诺、计划和草稿的类型化图。它用基于提示词的世界模型预测中间结论的影响与可逆性,由二元控制器拦截高风险承诺,并在后续证据推翻结论时执行依赖感知回滚。

  2. arXiv:cs.CL(计算语言学,全量分类)46

    Population Fidelity:评估 LLM 的人群代表性

    研究者提出 Population Fidelity 评估框架,从群体级准确度、组间变异量及变异结构三个维度衡量 LLM 生成回答的人群代表性。复现"机器偏见"研究后发现,代表性差不仅源于组间变异不足,还在于变异被分配给了错误的群体;文化微调虽能提升与调查中心的整体一致性,却未改善群体内差异的刻画。框架附带可复用代码、数据与训练模型。

  3. arXiv:cs.CL(计算语言学,全量分类)36

    OLIVE:在学生状态上学习教师续写,在线蒸馏新方法

    研究者提出在线蒸馏方法 OLIVE,每轮由学生策略生成新前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。在同等 GPU 小时成本下,OLIVE 推理表现优于采用 top-16 KL 近似的 OPD,异步实现进一步将总训练时间缩短 23.8%。仅用 GPT-5.4-mini 的文本持续训练,OLIVE 在 ScienceWorld 上比同一教师的离线 SFT 高出 13%。

  4. arXiv:cs.CL(计算语言学,全量分类)43

    认知专家语言模型与对应脑系统更对齐

    研究通过提示和微调为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,发现每个专家的表征都更贴近与其认知域匹配的脑系统,而非其他专家。该结果在三种基础模型和三个 fMRI 数据集上均成立,且非认知与表层干预无法产生同等对齐。模型专门化会改变区域对齐,但总体预测准确率基本不变。

  5. arXiv:cs.CL(计算语言学,全量分类)44

    非母语英语如何影响 LLM 终端用户表现:FABLE 数据集与 34 个开源权重模型评测

    研究者构建 FABLE 数据集,包含源自 174K 真实用户提示词的 190,911 条英语提示词变体,并用其评测 34 个开源权重 LLM 的写作任务表现。结果显示模型不会把拼写错误等表层错误带入输出,却会模仿用户提示词中更高层的修辞与词汇特征,最不流利与最流利提示词之间的回答质量差异显著。这表明非母语英语用户不仅得到质量更低的回答,回答本身的流利度也更差。

  6. arXiv:cs.CL(计算语言学,全量分类)37

    LLM 作为多值关系知识库的规范顺序问题:大语言模型为何不可靠

    研究发现 LLM 内部对多值关系按规范顺序(如字母序或时间序)组织概率分布,存在"规范顺序问题"。机制分析显示 LLM 的集合生成分为候选实体检索、内部排序、下一元素选择三个阶段,当提示词要求偏离这一内部顺序时,模型生成完整实体集合的可靠性显著下降。该成果已被 AKBC@EMNLP2026 接收。

  7. arXiv:cs.CL(计算语言学,全量分类)34

    FastGuide:加速扩散语言模型的奖励引导解码

    FastGuide 通过并行与自回归解码的自适应混合,加速扩散大语言模型的奖励引导推理,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,同时保持相近生成质量。该方法每个解码步骤只计算一次奖励模型反向传播并复用于多个 token,并借助 KV cache 与稀疏注意力重计算逐次解掩码,对模型不自信的 token 则延后处理。

  8. arXiv:cs.CL(计算语言学,全量分类)29

    不同分词生育率语言间的概念方向可靠性研究

    研究测量了英语、豪萨语和约鲁巴语在四个语言模型中的情感方向可复现性,使用最终 token 时 split-half 一致度分别为 0.737-0.870、0.589-0.762 和 0.101-0.399,该语言排序在全部 77 组完整模型对比中保持一致。基于相同层训练的分类器预测情感始终高于随机水平,表明预测准确率并不代表方向一致性。研究未证实分词生育率是跨语言差异的成因。

  9. arXiv:cs.CL(计算语言学,全量分类)42

    ProVer:面向智能体强化学习关键决策的细粒度信用分配框架

    ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。

  10. arXiv:cs.CL(计算语言学,全量分类)24

    僧伽罗语 Sandhi 切分的字符级神经方法研究

    研究基于 SandhiLex 提出字符级序列到序列方法,用原生僧伽罗语 Unicode 输入评测循环编码器-解码器模型。最佳模型为双向 LSTM 编码器加单向 LSTM 解码器,在词汇化、派生和词源性 Sandhi 难子集上仅达 68.40% 精确匹配准确率(字符级 82.08%),远低于规则化词缀子集的 94.00%。消融显示双向编码贡献最大,原生僧伽罗文字优于罗马化输入。

  11. arXiv:cs.CL(计算语言学,全量分类)35

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 是一种面向智能体场景的元评估数据合成方法,将元评估重构为偏好判断问题,仅用小型语言模型、无需人工参与且计算开销低。其原型在四个智能体领域、三项评估标准上合成 1000 条样本,150 条子集的人工验证显示与人类判断的一致率从基线 73% 提升至 85%。该数据集对 25 个常见模型的元评估揭示了评估表现与打分粒度、宽松度及模型规模等因素的相关性。

  12. arXiv:cs.CL(计算语言学,全量分类)40

    LLM 组合任务中的因果与可解释结构研究

    研究揭示 LLM 在循环概念(月份、小时、星期、音符)组合任务中的分层机制:中间层基于两个 token 的推断关系构建联合表示,后层则使用涉及全部三个 token 的联合表示完成任务。该规律在 Llama、Qwen、Gemma 和 Mistral 上一致成立,且限制模型仅使用因果相关的联合表示反而提升了下一 token 预测准确率。

  13. arXiv:cs.CL(计算语言学,全量分类)36

    VisKG:面向高效视觉推理的问题特定知识图谱框架

    研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。

  14. arXiv:cs.CL(计算语言学,全量分类)48

    VoxParity:语音智能体在关键场景下能否听懂声音

    VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。

  15. arXiv:cs.CL(计算语言学,全量分类)42

    CruxBench:一个信息发现基准

    研究者提出 CruxBench,一个按信息价值(VOI)给 LLM 生成问题打分的基准,衡量模型提出的关键子问题能在多大程度上更新对目标预测问题的信念。该基准抗污染、开放式且基于真实世界信念变化,在 293 个预测问题上评测了 8 个模型,VOI 与独立能力指标相关性达 r=0.90,但前沿 LLM 仅略微超过随机时机基线。

  16. arXiv:cs.CL(计算语言学,全量分类)33

    PACT:面向单 token 类型化决策的成对锚定校准微调

    研究者提出 PACT 微调方法,将对比样本对结构转化为四个训练项,无需新增标注。在 324 项冻结留出集、三个随机种子上,PACT 准确率 84.6%(对比已发布配方 85.2%,McNemar p ≥ 0.50),重标注下答案翻转率降至 9.8%(对比 13.8%),评分表字段序数误差 MAE 0.232(对比 0.311)。

  17. arXiv:cs.CL(计算语言学,全量分类)34

    用生成式 AI 流水线解决 SEC 10-K 财务数据缺失问题

    研究评估 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B 从 SEC 10-K 文件中提取财务属性的能力,以应对影响超 70% 企业、半数总市值的结构化数据缺失问题。Qwen-2.5 14B 在 Cash 项上取得 83.33% F1,Llama-3.3 70B 在 R&D 项上取得 76.92% F1,表明参数规模与文档复杂度匹配可实现高零样本准确率。

  18. arXiv:cs.CL(计算语言学,全量分类)27

    HSTA:用超球面语义轨迹分析追踪学术预印本、专利信号与算力扩展间的技术扩散

    论文提出无监督方法 HSTA,将 Transformer 句向量投影到单位超球面,用 Spherical K-Means 与 UMAP 分析 arXiv 预印本和 USPTO 专利共 3 万条记录,量化语义质心漂移与商业化偏移。结果显示大语言模型(漂移 0.332)与 AI 系统(0.234)子主题语义演化最快;季度论文量增速在常规显著性水平下并不 Granger 导致前沿算力分配激增。

  19. arXiv:cs.CL(计算语言学,全量分类)51

    arXiv 论文用因果中介分析追踪大语言模型谄媚性附和的机制

    arXiv 论文 arXiv:2609.35822 用因果中介分析研究大语言模型谄媚性附和的机制,发现用户陈述的观点会在最后一个 prompt token 的残差流中早期注入并偏置后续答案检索。一小部分早期注意力头携带该观点信号,消融这些头可大幅降低谄媚而事实准确性基本不变;当观点通过 Are you sure? 这类无内容反问间接表达时,则有另一组头抑制模型原本的正确答案以促成改答。

  20. arXiv:cs.CL(计算语言学,全量分类)50

    τ-Multilingual:跨语言语音智能体基准测试

    研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。

  21. arXiv:cs.CL(计算语言学,全量分类)48

    BreakingWeb:通过受控环境干预构建高难度浏览器使用任务

    研究者提出 BreakingWeb 基准,通过受控环境干预将智能体已能完成的任务改造为高难度实例,包含 519 个干净/干预任务对,覆盖 7 个自托管网站和 29 类干预。干预使六款浏览器使用智能体的通过率平均下降 22.9%,并推翻近半数原本能干净解决的任务;人类首次尝试仅损失 10.0%。六款智能体 75% 的失败属于"信念失败",即在所需变更未发生时仍宣称成功。

  22. arXiv:cs.CL(计算语言学,全量分类)38

    车载对话助手多轮对话的自动化评估框架

    研究者提出一套面向车载对话助手(ICA)的自动化多轮对话测试框架,将系统视为黑盒,通过闭环仿真结合策略引导用户模拟器、对抗策略管理器和两层 LLM 评判器进行评估。在六种 LLM 后端和十二名人工标注者参与的工业级 ICA 测试中,自动评判与人类标注高度一致,策略引导相比无引导仿真每段对话多发现 2.96 倍独特故障类型,故障对话数量增加一倍以上。

  23. arXiv:cs.CL(计算语言学,全量分类)35

    Lookahead-R:基于执行中心规划的预算感知工具检索

    Lookahead-R 是一个将工具检索重构为资源受限序列决策问题的规划框架,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,无需调用真实 API。在 ToolBench 的 I3 划分上,其 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。消融实验表明,显式延迟建模是资源约束下识别高质量工具的关键判别信号。