跳到正文

全部动态

今日 179 条
9月30日周三
  1. arXiv:cs.AI(全量分类)34

    PowerZooJax:面向强化学习的 JAX 电力系统基准

    PowerZooJax 是一个基于 JAX 的强化学习电力系统基准套件,提供覆盖发电、输电、配电、分布式能源和数据中心微电网的五个约束马尔可夫决策过程任务。它将潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使整个训练与评估循环留在 GPU 上,实验显示相较 CPU 仿真有显著加速。该开源基准支持对策略回报、安全违规和分布外压力条件进行标准化评估。

  2. arXiv:cs.AI(全量分类)33

    COFFEE:面向离散扩散模型的未来感知引导框架

    COFFEE 是一个即插即用框架,通过将序列依赖与目标分离,避免枚举所有未解析 token 组合带来的指数级计算,从而为离散扩散模型提供序列级引导。它用无目标载体吸收去噪器预测的边际分布构建联合模型,并用编译的有限状态模型记录 token 组合对序列级偏好的影响,无需重训练即可将全局偏好传递给未解析位置。该框架在符号、语言和生物多个基准上取得强控制效果,并支持显式硬约束与学习到的软目标。

  3. arXiv:cs.LG(机器学习,全量分类)37

    表征学习能否脱离损失最小化?Muon 的极坐标更新给出答案

    研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。

  4. arXiv:cs.LG(机器学习,全量分类)30

    Transversal Pooling Neural Networks:面向仿射群作用的池化网络

    研究者提出 transversal pooling 神经网络,将空间最大池化推广到仿射群作用,并证明其对选定子群具有等变性,同时给出单个池化小波系数在输入仿射扰动下的显式稳定性界。实验显示该网络在低数据环境下有效,并可用于预测热带气旋增强。

  5. arXiv:cs.LG(机器学习,全量分类)32

    Transformer 动力学中前馈层的作用

    一项控制论视角的理论研究证明,Transformer 中自注意力之后的前馈层可作为一个独立控制项,无论 key、query、value 矩阵如何取值,都能将 token 驱动到任意接近共识的状态。该结论可扩展至多簇收敛与多头注意力情形,作者通过数值实验验证了结果,并将理论给出的阈值行为与真实 LLM 进行了对比。

  6. arXiv:cs.LG(机器学习,全量分类)37

    语言模型在串行任务需求下如何重新分配注意力头活动

    研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。

  7. arXiv:cs.LG(机器学习,全量分类)39

    预条件物理信息神经算子训练

    研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。

  8. arXiv:cs.LG(机器学习,全量分类)34

    生成式去噪模型 Jacobian 谱特性研究:用谱分析区分扩散与流匹配模型

    研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。

  9. arXiv:cs.LG(机器学习,全量分类)27

    EvoMO-SR:基于多目标 LLM 进化与子结构引导的符号表达式生成

    EvoMO-SR 是一个由 LLM 驱动的符号回归框架,由 LLM 生成方程骨架、外部优化器单独拟合系数,并引入多目标生存选择与子结构引导机制。在 LSR-Synth 的 8 个域内与域外设置中,该框架使用 Llama-3.1-8B-Instruct 小模型在 7 个设置上取得最佳精度。基于规范化子树重叠与项匹配的两项符号精度指标显示,其恢复高精度符号结构的概率更高。

  10. arXiv:cs.LG(机器学习,全量分类)34

    主次弱耦合马尔可夫决策过程中的公平策略优化

    研究针对主次弱耦合马尔可夫决策过程(M2WCMDP)中的公平资源分配问题,用单调、凹、置换不变、归一化的公平函数替代传统效用总和目标。在同质次子MDP下,该问题可化简为在置换不变策略类上优化平台加平均参与者的效用目标;更一般情形则提出基于计数比例的深度强化学习方法和优先采样器。在机器更换与纽约市定价及出租车调度两个应用中验证了方法的公平性与可扩展性。

  11. arXiv:cs.LG(机器学习,全量分类)40

    EHRFlow:从电子健康记录中学习连续患者轨迹

    EHRFlow 是一个多边际流匹配框架,以编码后的患者病史为条件,让未来动力学依赖患者既往临床轨迹,支持不规则观测时间和任意时间跨度预测。在超过一百万患者的真实临床数据集(含独立外部验证队列)上,其 horizon 平均 top-5 临床代码准确率优于自回归与历史无关的流匹配基线。在受控反事实模拟中,条件引导无需训练任务特定结局模型即可近似抗高血压干预的已知效应。

  12. arXiv:cs.LG(机器学习,全量分类)41

    为什么神经网络后门如此容易植入?

    一项理论分析表明,特征学习会让神经网络更容易被植入后门:在干净准确率保持 O(π) 的前提下,懒惰学习需要触发强度 α ∝ π^{-1/2} 才能攻击成功,而特征学习将攻击预算改善至 α ∝ π^{-1/4}。这意味着在小投毒比例下,非线性特征学习大幅降低所需触发强度,基于线性启发式的安全审计会系统性低估后门脆弱性。

  13. arXiv:cs.LG(机器学习,全量分类)37

    Dyad:为 LLM 引入原生类型化决策能力

    研究提出 Dyad 架构,通过环境条件化的动作编码器将候选动作描述并行嵌入,并与 LLM 内部状态打分,得到类型化动作分布。冻结 LLM 仅训练动作编码器即可在四个未见环境中稳定提升;联合优化在多种交互任务和模型规模上超越常规 RL 后训练,9B 模型在 ALFWorld 上平均绝对提升 3.80%,同时改善通用知识、推理与编码能力。

  14. arXiv:cs.LG(机器学习,全量分类)35

    逆蒸馏:IDU 统一框架实现多步匹配模型的数据遗忘与蒸馏

    Inverse Distillation Unlearning(IDU)将多步匹配模型蒸馏为一步生成器的同时,抑制指定训练子集的输出。该方法只需预训练的全数据教师模型和遗忘集数据,无需保留训练样本、额外特征提取器或分类器。在 MNIST 和 CIFAR-10 上,IDU 在 flow-matching 与 score-based 扩散设置下大幅降低遗忘类别的生成频率,同时保持保留类别的生成质量。

  15. arXiv:cs.LG(机器学习,全量分类)37

    早期学习如何塑造持续学习中表征变化的方向

    研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。

  16. arXiv:cs.LG(机器学习,全量分类)45

    FLOORA:面向建筑设计的领域专用语言模型

    研究团队推出 FLOORA(Floor Layout Optimization with RL Alignment),一个用于建筑布局生成的领域专用语言模型系列,其 0.6B 模型在分布外真实建筑上取得最高 92.0% 的 VLM 评审胜率,合成建筑上达 96.0%,人类评估中 89.3% 被选为最佳模型。

  17. arXiv:cs.LG(机器学习,全量分类)33

    神经路由求解器的决策机制解析:AM、POMO 与 LEHD 的对比研究

    研究通过行为分析、表征探测与因果干预,考察了 AM、POMO(重编码器轻解码器)和 LEHD(轻编码器重解码器)三类自回归 NCO 模型的内部决策机制。结果显示 AM 与 POMO 在求解过程中始终遵循持续的几何模式,而 LEHD 则包含关于多个未来动作的线性可访问信息,并依赖当前节点表征做即时局部决策、起始节点表征承担全局导航。

  18. arXiv:cs.LG(机器学习,全量分类)39

    用协同训练的监控器改进可扩展监督

    研究提出让监控器与工作模型协同训练,以避免工作模型针对固定监控器学会规避。监督设定下证明:当可能监控函数类的 Littlestone 维度有限时,监控可以做到误差与查询率趋近于零;自监督设定下提出基于测试时蒸馏的协同训练流程,监控器用额外测试时算力生成训练标签,再训练其标准算力策略,并对多数投票标签给出有限样本锐化保证。

  19. arXiv:cs.LG(机器学习,全量分类)28

    用于谱优化的神经网络

    研究者提出两种神经网络模型,可直接从区域几何学习微分算子的谱并用于谱优化。基于傅里叶系数与轻量 MLP 的模型在星形几何上精度达 0.2%,landscape 模型在前十个特征值上平均相对误差为 1%,优于 FNO 模型的 4%。两种代理模型均能复现经典谱最优解,如第一特征值对应的圆盘,并可从合成形状泛化到经典图像数据集。