跳到正文

#论文/研究

今日 180 条
9月30日周三
  1. arXiv:cs.AI(全量分类)31

    MERID:用递归自我改进智能体做多模态抑郁症分析

    研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。

  2. arXiv:cs.AI(全量分类)37

    欧盟 AI 法案合规检查工具(AIACC)的实证研究与评估

    研究首次对 12 款主流欧盟 AI 法案合规检查工具(AIACC)进行实证评估,发现其质量差异显著,目前只能作为早期定位工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,且无法提供明确可执行的指导,依赖它们可能造成虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。

  3. arXiv:cs.AI(全量分类)35

    FigAct:把科学图表变成可交互讲解画布

    研究者提出 FigAct 框架,将静态科学图表转化为按问题定制的可视化演示,直接在图表现有图形元素上施加视觉动作以引导读者注意力。其分层搜索策略将元素定位的 token 消耗降低约 40 倍,并基于 grounding 准确率、搜索效率和渲染质量三项奖励训练出 FigAct-8B。团队还构建了经人工核验的真实论文图表 benchmark,用于评估 MLLM 生成有据可依的视觉解释的能力。

  4. arXiv:cs.AI(全量分类)35

    AdaST:面向时空预测的自适应耦合框架

    AdaST 是一个自适应时空预测框架,通过"分解-重组"范式,用异质性感知专家将输入分解为不同耦合模式的组件,再由角色对齐模块处理并经相关性感知的自适应重组器整合输出预测。研究指出真实时空数据存在时间主导、空间主导和强耦合等不同耦合机制,现有方法隐含假设强时空耦合会导致虚假依赖和性能下降。该工作已被 NeurIPS 2026 主会接收,实验显示 AdaST 显著优于当前最优基线。

  5. arXiv:cs.AI(全量分类)34

    PowerZooJax:面向强化学习的 JAX 电力系统基准

    PowerZooJax 是一个基于 JAX 的强化学习电力系统基准套件,提供覆盖发电、输电、配电、分布式能源和数据中心微电网的五个约束马尔可夫决策过程任务。它将潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使整个训练与评估循环留在 GPU 上,实验显示相较 CPU 仿真有显著加速。该开源基准支持对策略回报、安全违规和分布外压力条件进行标准化评估。

  6. arXiv:cs.AI(全量分类)33

    COFFEE:面向离散扩散模型的未来感知引导框架

    COFFEE 是一个即插即用框架,通过将序列依赖与目标分离,避免枚举所有未解析 token 组合带来的指数级计算,从而为离散扩散模型提供序列级引导。它用无目标载体吸收去噪器预测的边际分布构建联合模型,并用编译的有限状态模型记录 token 组合对序列级偏好的影响,无需重训练即可将全局偏好传递给未解析位置。该框架在符号、语言和生物多个基准上取得强控制效果,并支持显式硬约束与学习到的软目标。

  7. arXiv:cs.LG(机器学习,全量分类)37

    表征学习能否脱离损失最小化?Muon 的极坐标更新给出答案

    研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。

  8. arXiv:cs.LG(机器学习,全量分类)30

    Transversal Pooling Neural Networks:面向仿射群作用的池化网络

    研究者提出 transversal pooling 神经网络,将空间最大池化推广到仿射群作用,并证明其对选定子群具有等变性,同时给出单个池化小波系数在输入仿射扰动下的显式稳定性界。实验显示该网络在低数据环境下有效,并可用于预测热带气旋增强。

  9. arXiv:cs.LG(机器学习,全量分类)32

    Transformer 动力学中前馈层的作用

    一项控制论视角的理论研究证明,Transformer 中自注意力之后的前馈层可作为一个独立控制项,无论 key、query、value 矩阵如何取值,都能将 token 驱动到任意接近共识的状态。该结论可扩展至多簇收敛与多头注意力情形,作者通过数值实验验证了结果,并将理论给出的阈值行为与真实 LLM 进行了对比。

  10. arXiv:cs.LG(机器学习,全量分类)37

    语言模型在串行任务需求下如何重新分配注意力头活动

    研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。

  11. arXiv:cs.LG(机器学习,全量分类)39

    预条件物理信息神经算子训练

    研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。

  12. arXiv:cs.LG(机器学习,全量分类)34

    生成式去噪模型 Jacobian 谱特性研究:用谱分析区分扩散与流匹配模型

    研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。

  13. arXiv:cs.LG(机器学习,全量分类)27

    EvoMO-SR:基于多目标 LLM 进化与子结构引导的符号表达式生成

    EvoMO-SR 是一个由 LLM 驱动的符号回归框架,由 LLM 生成方程骨架、外部优化器单独拟合系数,并引入多目标生存选择与子结构引导机制。在 LSR-Synth 的 8 个域内与域外设置中,该框架使用 Llama-3.1-8B-Instruct 小模型在 7 个设置上取得最佳精度。基于规范化子树重叠与项匹配的两项符号精度指标显示,其恢复高精度符号结构的概率更高。

  14. arXiv:cs.LG(机器学习,全量分类)34

    主次弱耦合马尔可夫决策过程中的公平策略优化

    研究针对主次弱耦合马尔可夫决策过程(M2WCMDP)中的公平资源分配问题,用单调、凹、置换不变、归一化的公平函数替代传统效用总和目标。在同质次子MDP下,该问题可化简为在置换不变策略类上优化平台加平均参与者的效用目标;更一般情形则提出基于计数比例的深度强化学习方法和优先采样器。在机器更换与纽约市定价及出租车调度两个应用中验证了方法的公平性与可扩展性。

  15. arXiv:cs.LG(机器学习,全量分类)40

    EHRFlow:从电子健康记录中学习连续患者轨迹

    EHRFlow 是一个多边际流匹配框架,以编码后的患者病史为条件,让未来动力学依赖患者既往临床轨迹,支持不规则观测时间和任意时间跨度预测。在超过一百万患者的真实临床数据集(含独立外部验证队列)上,其 horizon 平均 top-5 临床代码准确率优于自回归与历史无关的流匹配基线。在受控反事实模拟中,条件引导无需训练任务特定结局模型即可近似抗高血压干预的已知效应。

  16. arXiv:cs.LG(机器学习,全量分类)41

    为什么神经网络后门如此容易植入?

    一项理论分析表明,特征学习会让神经网络更容易被植入后门:在干净准确率保持 O(π) 的前提下,懒惰学习需要触发强度 α ∝ π^{-1/2} 才能攻击成功,而特征学习将攻击预算改善至 α ∝ π^{-1/4}。这意味着在小投毒比例下,非线性特征学习大幅降低所需触发强度,基于线性启发式的安全审计会系统性低估后门脆弱性。

  17. arXiv:cs.LG(机器学习,全量分类)37

    Dyad:为 LLM 引入原生类型化决策能力

    研究提出 Dyad 架构,通过环境条件化的动作编码器将候选动作描述并行嵌入,并与 LLM 内部状态打分,得到类型化动作分布。冻结 LLM 仅训练动作编码器即可在四个未见环境中稳定提升;联合优化在多种交互任务和模型规模上超越常规 RL 后训练,9B 模型在 ALFWorld 上平均绝对提升 3.80%,同时改善通用知识、推理与编码能力。