跳到正文

#论文/研究

今日 177 条
9月30日周三
  1. arXiv:cs.LG(机器学习,全量分类)37

    早期学习如何塑造持续学习中表征变化的方向

    研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。

  2. arXiv:cs.LG(机器学习,全量分类)45

    FLOORA:面向建筑设计的领域专用语言模型

    研究团队推出 FLOORA(Floor Layout Optimization with RL Alignment),一个用于建筑布局生成的领域专用语言模型系列,其 0.6B 模型在分布外真实建筑上取得最高 92.0% 的 VLM 评审胜率,合成建筑上达 96.0%,人类评估中 89.3% 被选为最佳模型。

  3. arXiv:cs.LG(机器学习,全量分类)33

    神经路由求解器的决策机制解析:AM、POMO 与 LEHD 的对比研究

    研究通过行为分析、表征探测与因果干预,考察了 AM、POMO(重编码器轻解码器)和 LEHD(轻编码器重解码器)三类自回归 NCO 模型的内部决策机制。结果显示 AM 与 POMO 在求解过程中始终遵循持续的几何模式,而 LEHD 则包含关于多个未来动作的线性可访问信息,并依赖当前节点表征做即时局部决策、起始节点表征承担全局导航。

  4. arXiv:cs.LG(机器学习,全量分类)39

    用协同训练的监控器改进可扩展监督

    研究提出让监控器与工作模型协同训练,以避免工作模型针对固定监控器学会规避。监督设定下证明:当可能监控函数类的 Littlestone 维度有限时,监控可以做到误差与查询率趋近于零;自监督设定下提出基于测试时蒸馏的协同训练流程,监控器用额外测试时算力生成训练标签,再训练其标准算力策略,并对多数投票标签给出有限样本锐化保证。

  5. arXiv:cs.LG(机器学习,全量分类)28

    用于谱优化的神经网络

    研究者提出两种神经网络模型,可直接从区域几何学习微分算子的谱并用于谱优化。基于傅里叶系数与轻量 MLP 的模型在星形几何上精度达 0.2%,landscape 模型在前十个特征值上平均相对误差为 1%,优于 FNO 模型的 4%。两种代理模型均能复现经典谱最优解,如第一特征值对应的圆盘,并可从合成形状泛化到经典图像数据集。

  6. arXiv:cs.LG(机器学习,全量分类)36

    TORQUE:在旋转前后优化哪些坐标该(不)量化

    TORQUE 是一个在固定比特预算下联合优化旋转前后高精度保留坐标数量与位置的量化框架,通过推导量化误差上界并证明 top-k 旋转前保留对每个 k 都能最小化该上界,将坐标子集搜索简化为对 k 的优化。该方法使用离线码本和并行参数选择实现快速优化,在最近邻检索、KV-cache 压缩和激活压缩实验中改善了重建精度与存储成本的权衡。

  7. arXiv:cs.LG(机器学习,全量分类)33

    Preferent Compression Bounds Are Tight:偏好压缩界可证明是紧的

    论文证明满足偏好性质(学习理论中的稳定性)的算法其样本压缩界可证明是紧的,解决了这一悬而未决的问题。作者基于均匀分布与顺序统计量给出显式构造,在极限下达到该界,并提供了仅需初等计数论证、无需无穷维对偶的更短证明。该工作将发表于第 65 届 IEEE CDC 2026,适用于 Scenario Approach、Pick-to-Learn 与支持向量方法等场景。

  8. arXiv:cs.LG(机器学习,全量分类)32

    EnJoi:面向生成式数据同化的集合联合评分滤波

    研究者提出 EnJoi,一种基于扩散模型的数据同化算法,通过学习包含过去与未来状态的联合分布,动态平衡对当前状态与新观测的置信度,并采用 En4DVar 的改进版本利用粒子集合协方差。在流体与交通流仿真实验中,该方法在观测稀疏且非均匀的情况下重建性能提升。

  9. arXiv:cs.LG(机器学习,全量分类)29

    KernelOnet:基于核函数的可解释神经算子

    论文提出可解释神经算子框架 KernelOnet,将核函数显式嵌入神经算子架构,用显式核替代 DeepONet 的 trunk 网络,提供数据驱动可学习核、物理信息核与混合核三种互补核。在三个基准和浅水波导工程问题上,KernelOnet 精度高,与 DeepONet 可比时以更少可学习参数取得更高精度;其无监督配置无需内部解标签,单次查询推理成本远低于逐实例求解器。

  10. arXiv:cs.LG(机器学习,全量分类)28

    图神经网络实现组织化信号集的采样不变嵌入

    该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。

  11. arXiv:cs.LG(机器学习,全量分类)34

    TMLN:基于轨迹的损失景观导航方法缓解增量学习中的遗忘

    研究者提出 TMLN(Trajectory-Modulatory Landscape Navigation),将持续学习形式化为弯曲损失景观上的最优控制问题,用对角经验 Fisher 信息矩阵(FIM)定义局部黎曼流形,并依据网络参数的历史轨迹动态调节预条件器,直接融入梯度更新以保护关键参数方向,无需附加惩罚项。在类增量和域增量基准上,该方法显著降低了相邻任务间的损失障碍。

  12. arXiv:cs.LG(机器学习,全量分类)46

    感知计算的决定价值:DEEP 基准评估自适应感知分配

    研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。

  13. arXiv:cs.LG(机器学习,全量分类)32

    混合集成学习用于基于 EEG 的癫痫发作预测

    研究提出一种校准混合集成模型,将五个深度学习模型与三个经典机器学习模型通过逻辑回归堆叠元学习器结合,用于基于 EEG 的癫痫发作预测。在 CHB-MIT 数据集上采用严格的留一患者交叉验证,过滤队列中实现 74.2% 发作级灵敏度、每小时 1.24 次误报,平均预警时间 16.9 分钟。受目标误报预算约束的测试调优 oracle 在每小时 0.951 次误报下达到 60.9% 灵敏度。

  14. arXiv:cs.LG(机器学习,全量分类)34

    ReLOBGen:可回放的限价订单簿消息生成方法

    ReLOBGen 提出一种在生成过程中即保证可回放性的限价订单簿(LOB)消息生成方法,通过从当前 LOB 挂单中选取被引用订单并掩码无效 token 保证字段一致,无需事后修正或重采样。在 500 条消息的回放测试中,ReLOBGen 实现 100% 可回放性,提升了盘口顶部统计与相对价格等市场真实性指标,相比 LOBS5 基线每条回放消息提速 2.7-3.6 倍。

  15. arXiv:cs.LG(机器学习,全量分类)31

    用生成式 LLM 与标签聚合分类新闻中的经济政策不确定性

    研究提出基于弱监督的方法,用生成式 LLM 通过提示词生成合成标签,自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型,以替代易产生大量假阳性的关键词方法和依赖昂贵人工标注的机器学习方法。该研究还提出面向 EPU 相关文章的多标签与层级分类方法,使方案兼具成本效益与可扩展性。

  16. arXiv:cs.LG(机器学习,全量分类)36

    立场:若无法强制复现,就应加强可验证性

    一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文指出,机器学习论文中的实证结果普遍难以复现、代码往往不可得,并阻碍研究发展。作者对这些问题进行了分析与量化,提出具体建议以提升结果的可核查性,即使无法做到完全复现。代码与支撑材料已公开。

  17. arXiv:cs.CL(计算语言学,全量分类)35

    DraftTrace:面向 AI 辅助写作的多视角分析环境

    DraftTrace 是一个同时捕捉写作成品、写作过程与 AI 助手交互三类视角的写作环境,可将文档随时间演变的过程重建为提交级、纵向和班级级分析。研究者在 81 名学生的研究生 NLP 课程中部署该工具,发现成品指标区分文本表述差异,过程指标区分文本输入方式差异,两者结合可识别复制粘贴等情形。交互轨迹显示学生早期用助手澄清问题、后期用于核验答案。

  18. arXiv:cs.CL(计算语言学,全量分类)50

    arXiv 论文:稠密检索器对查询中的政治倾向与方言身份信号敏感

    哥伦比亚大学等机构研究者发布 EMNLP 2026 论文,测试查询中的政治意识形态与方言信号是否会偏置检索结果。在政治新闻和消费者健康问答两个领域、五款稠密检索器加一个稀疏基线上,所有检索器都会返回与查询自身政治倾向一致的文章,且对非洲裔美国英语(AAL)问题的检索效果差于白人主流英语(WME);线性探针能从查询嵌入中恢复倾向与方言信息。作者指出此类偏差可能加剧极化和健康差距,代码已开源。

  19. arXiv:cs.CL(计算语言学,全量分类)55

    arXiv 论文:大规模因子分析显示机器智能仅部分可解释

    研究者对 1,618 个语言模型在 456 个纯文本基准上的 13,251 个公开评测分数做因子分析,发现通用智力因子在最宽松估计下也只解释 70.8% 的性能方差,多数解远低于此。内容相近的基准未必聚类,$g$ 因子不被任何共同主题主导,也缺乏证据表明标准"智力"基准能很好代理它,这使得在语言模型开发中把通用智力当作可单独优化的目标缺乏支持。

  20. arXiv:cs.CL(计算语言学,全量分类)38

    人类与视觉语言模型的跨模态关联:选择相似,注意力不同

    研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。

  21. arXiv:cs.CL(计算语言学,全量分类)39

    FinRT:将自适应红队策略蒸馏为消费金融可复用对抗生成器

    FinRT 将自适应红队策略蒸馏为可复用的对抗提示生成器,在消费金融六个受害模型上把攻击成功率从 Rainbow Teaming 的 17.2% 提升至 32.9%,接近翻倍,最大对抗严重度提高 33%。该方法在保持与迭代搜索相当的策略域内语义多样性的同时,具备较高的跨模型迁移性,并呈现不同的受害模型族特化模式。

  22. arXiv:cs.CL(计算语言学,全量分类)43

    掩码扩散语言模型中的可靠并行解码(RPD)

    研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。

  23. arXiv:cs.CL(计算语言学,全量分类)54

    DeLLM 框架提出系统性删除 LLM 记忆的方法

    arXiv 论文(arXiv:2609.36414)研究持久化 LLM 能否按用户请求删除其记忆,发现当前 LLM 无法真正删除信息,即使声称已遗忘且上下文有限。单纯移除匹配消息并不足够,因为对话中的消息依赖会让信息持续存在。作者提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息溯源图以确定删除时应移除哪些消息,实验显示 DeLLM 在保持实用性的同时实现较高删除率。