跳到正文

全部动态

今日 176 条
9月30日周三
  1. arXiv:cs.LG(机器学习,全量分类)32

    EnJoi:面向生成式数据同化的集合联合评分滤波

    研究者提出 EnJoi,一种基于扩散模型的数据同化算法,通过学习包含过去与未来状态的联合分布,动态平衡对当前状态与新观测的置信度,并采用 En4DVar 的改进版本利用粒子集合协方差。在流体与交通流仿真实验中,该方法在观测稀疏且非均匀的情况下重建性能提升。

  2. arXiv:cs.LG(机器学习,全量分类)29

    KernelOnet:基于核函数的可解释神经算子

    论文提出可解释神经算子框架 KernelOnet,将核函数显式嵌入神经算子架构,用显式核替代 DeepONet 的 trunk 网络,提供数据驱动可学习核、物理信息核与混合核三种互补核。在三个基准和浅水波导工程问题上,KernelOnet 精度高,与 DeepONet 可比时以更少可学习参数取得更高精度;其无监督配置无需内部解标签,单次查询推理成本远低于逐实例求解器。

  3. arXiv:cs.LG(机器学习,全量分类)28

    图神经网络实现组织化信号集的采样不变嵌入

    该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。

  4. arXiv:cs.LG(机器学习,全量分类)34

    TMLN:基于轨迹的损失景观导航方法缓解增量学习中的遗忘

    研究者提出 TMLN(Trajectory-Modulatory Landscape Navigation),将持续学习形式化为弯曲损失景观上的最优控制问题,用对角经验 Fisher 信息矩阵(FIM)定义局部黎曼流形,并依据网络参数的历史轨迹动态调节预条件器,直接融入梯度更新以保护关键参数方向,无需附加惩罚项。在类增量和域增量基准上,该方法显著降低了相邻任务间的损失障碍。

  5. arXiv:cs.LG(机器学习,全量分类)46

    感知计算的决定价值:DEEP 基准评估自适应感知分配

    研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。

  6. arXiv:cs.LG(机器学习,全量分类)32

    混合集成学习用于基于 EEG 的癫痫发作预测

    研究提出一种校准混合集成模型,将五个深度学习模型与三个经典机器学习模型通过逻辑回归堆叠元学习器结合,用于基于 EEG 的癫痫发作预测。在 CHB-MIT 数据集上采用严格的留一患者交叉验证,过滤队列中实现 74.2% 发作级灵敏度、每小时 1.24 次误报,平均预警时间 16.9 分钟。受目标误报预算约束的测试调优 oracle 在每小时 0.951 次误报下达到 60.9% 灵敏度。

  7. arXiv:cs.LG(机器学习,全量分类)34

    ReLOBGen:可回放的限价订单簿消息生成方法

    ReLOBGen 提出一种在生成过程中即保证可回放性的限价订单簿(LOB)消息生成方法,通过从当前 LOB 挂单中选取被引用订单并掩码无效 token 保证字段一致,无需事后修正或重采样。在 500 条消息的回放测试中,ReLOBGen 实现 100% 可回放性,提升了盘口顶部统计与相对价格等市场真实性指标,相比 LOBS5 基线每条回放消息提速 2.7-3.6 倍。

  8. arXiv:cs.LG(机器学习,全量分类)31

    用生成式 LLM 与标签聚合分类新闻中的经济政策不确定性

    研究提出基于弱监督的方法,用生成式 LLM 通过提示词生成合成标签,自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型,以替代易产生大量假阳性的关键词方法和依赖昂贵人工标注的机器学习方法。该研究还提出面向 EPU 相关文章的多标签与层级分类方法,使方案兼具成本效益与可扩展性。

  9. arXiv:cs.LG(机器学习,全量分类)36

    立场:若无法强制复现,就应加强可验证性

    一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文指出,机器学习论文中的实证结果普遍难以复现、代码往往不可得,并阻碍研究发展。作者对这些问题进行了分析与量化,提出具体建议以提升结果的可核查性,即使无法做到完全复现。代码与支撑材料已公开。

  10. arXiv:cs.CL(计算语言学,全量分类)35

    DraftTrace:面向 AI 辅助写作的多视角分析环境

    DraftTrace 是一个同时捕捉写作成品、写作过程与 AI 助手交互三类视角的写作环境,可将文档随时间演变的过程重建为提交级、纵向和班级级分析。研究者在 81 名学生的研究生 NLP 课程中部署该工具,发现成品指标区分文本表述差异,过程指标区分文本输入方式差异,两者结合可识别复制粘贴等情形。交互轨迹显示学生早期用助手澄清问题、后期用于核验答案。

  11. arXiv:cs.CL(计算语言学,全量分类)50

    arXiv 论文:稠密检索器对查询中的政治倾向与方言身份信号敏感

    哥伦比亚大学等机构研究者发布 EMNLP 2026 论文,测试查询中的政治意识形态与方言信号是否会偏置检索结果。在政治新闻和消费者健康问答两个领域、五款稠密检索器加一个稀疏基线上,所有检索器都会返回与查询自身政治倾向一致的文章,且对非洲裔美国英语(AAL)问题的检索效果差于白人主流英语(WME);线性探针能从查询嵌入中恢复倾向与方言信息。作者指出此类偏差可能加剧极化和健康差距,代码已开源。

  12. arXiv:cs.CL(计算语言学,全量分类)55

    arXiv 论文:大规模因子分析显示机器智能仅部分可解释

    研究者对 1,618 个语言模型在 456 个纯文本基准上的 13,251 个公开评测分数做因子分析,发现通用智力因子在最宽松估计下也只解释 70.8% 的性能方差,多数解远低于此。内容相近的基准未必聚类,$g$ 因子不被任何共同主题主导,也缺乏证据表明标准"智力"基准能很好代理它,这使得在语言模型开发中把通用智力当作可单独优化的目标缺乏支持。

  13. arXiv:cs.CL(计算语言学,全量分类)38

    人类与视觉语言模型的跨模态关联:选择相似,注意力不同

    研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。

  14. arXiv:cs.CL(计算语言学,全量分类)39

    FinRT:将自适应红队策略蒸馏为消费金融可复用对抗生成器

    FinRT 将自适应红队策略蒸馏为可复用的对抗提示生成器,在消费金融六个受害模型上把攻击成功率从 Rainbow Teaming 的 17.2% 提升至 32.9%,接近翻倍,最大对抗严重度提高 33%。该方法在保持与迭代搜索相当的策略域内语义多样性的同时,具备较高的跨模型迁移性,并呈现不同的受害模型族特化模式。

  15. arXiv:cs.CL(计算语言学,全量分类)43

    掩码扩散语言模型中的可靠并行解码(RPD)

    研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。

  16. arXiv:cs.CL(计算语言学,全量分类)54

    DeLLM 框架提出系统性删除 LLM 记忆的方法

    arXiv 论文(arXiv:2609.36414)研究持久化 LLM 能否按用户请求删除其记忆,发现当前 LLM 无法真正删除信息,即使声称已遗忘且上下文有限。单纯移除匹配消息并不足够,因为对话中的消息依赖会让信息持续存在。作者提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息溯源图以确定删除时应移除哪些消息,实验显示 DeLLM 在保持实用性的同时实现较高删除率。

  17. arXiv:cs.CL(计算语言学,全量分类)41

    DeepRewind:预测并修复深度研究智能体的过早承诺

    DeepRewind 是一个面向深度研究智能体的可逆控制层,将智能体不断演化的认知状态表示为包含来源、证据、主张、假设、承诺、计划和草稿的类型化图。它用基于提示词的世界模型预测中间结论的影响与可逆性,由二元控制器拦截高风险承诺,并在后续证据推翻结论时执行依赖感知回滚。

  18. arXiv:cs.CL(计算语言学,全量分类)46

    Population Fidelity:评估 LLM 的人群代表性

    研究者提出 Population Fidelity 评估框架,从群体级准确度、组间变异量及变异结构三个维度衡量 LLM 生成回答的人群代表性。复现"机器偏见"研究后发现,代表性差不仅源于组间变异不足,还在于变异被分配给了错误的群体;文化微调虽能提升与调查中心的整体一致性,却未改善群体内差异的刻画。框架附带可复用代码、数据与训练模型。

  19. arXiv:cs.CL(计算语言学,全量分类)36

    OLIVE:在学生状态上学习教师续写,在线蒸馏新方法

    研究者提出在线蒸馏方法 OLIVE,每轮由学生策略生成新前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。在同等 GPU 小时成本下,OLIVE 推理表现优于采用 top-16 KL 近似的 OPD,异步实现进一步将总训练时间缩短 23.8%。仅用 GPT-5.4-mini 的文本持续训练,OLIVE 在 ScienceWorld 上比同一教师的离线 SFT 高出 13%。

  20. arXiv:cs.CL(计算语言学,全量分类)43

    认知专家语言模型与对应脑系统更对齐

    研究通过提示和微调为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,发现每个专家的表征都更贴近与其认知域匹配的脑系统,而非其他专家。该结果在三种基础模型和三个 fMRI 数据集上均成立,且非认知与表层干预无法产生同等对齐。模型专门化会改变区域对齐,但总体预测准确率基本不变。

  21. arXiv:cs.CL(计算语言学,全量分类)44

    非母语英语如何影响 LLM 终端用户表现:FABLE 数据集与 34 个开源权重模型评测

    研究者构建 FABLE 数据集,包含源自 174K 真实用户提示词的 190,911 条英语提示词变体,并用其评测 34 个开源权重 LLM 的写作任务表现。结果显示模型不会把拼写错误等表层错误带入输出,却会模仿用户提示词中更高层的修辞与词汇特征,最不流利与最流利提示词之间的回答质量差异显著。这表明非母语英语用户不仅得到质量更低的回答,回答本身的流利度也更差。

  22. arXiv:cs.CL(计算语言学,全量分类)37

    LLM 作为多值关系知识库的规范顺序问题:大语言模型为何不可靠

    研究发现 LLM 内部对多值关系按规范顺序(如字母序或时间序)组织概率分布,存在"规范顺序问题"。机制分析显示 LLM 的集合生成分为候选实体检索、内部排序、下一元素选择三个阶段,当提示词要求偏离这一内部顺序时,模型生成完整实体集合的可靠性显著下降。该成果已被 AKBC@EMNLP2026 接收。

  23. arXiv:cs.CL(计算语言学,全量分类)34

    FastGuide:加速扩散语言模型的奖励引导解码

    FastGuide 通过并行与自回归解码的自适应混合,加速扩散大语言模型的奖励引导推理,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,同时保持相近生成质量。该方法每个解码步骤只计算一次奖励模型反向传播并复用于多个 token,并借助 KV cache 与稀疏注意力重计算逐次解掩码,对模型不自信的 token 则延后处理。