表征学习能否脱离损失最小化?Muon 的极坐标更新给出答案
研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。
研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。
研究者提出 transversal pooling 神经网络,将空间最大池化推广到仿射群作用,并证明其对选定子群具有等变性,同时给出单个池化小波系数在输入仿射扰动下的显式稳定性界。实验显示该网络在低数据环境下有效,并可用于预测热带气旋增强。
一项控制论视角的理论研究证明,Transformer 中自注意力之后的前馈层可作为一个独立控制项,无论 key、query、value 矩阵如何取值,都能将 token 驱动到任意接近共识的状态。该结论可扩展至多簇收敛与多头注意力情形,作者通过数值实验验证了结果,并将理论给出的阈值行为与真实 LLM 进行了对比。
针对 MoE 模型批量解码时专家权重传输开销大的问题,研究者提出 BASE,按“移除某专家对 MoE 层输出的影响”对专家排序,并在校准阶段训练轻量线性预测器估计每个 token 的专家移除代价,配合定制 GPU kernel 完成代价预测与专家选择。
研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。
研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。
EnergyEminence 是一个早期测试平台,将 IEEE 118-bus 风格的图时序预测器、非线性 AC 级联仿真与类操作员仪表盘的时间回放耦合,并提出共享有界校准,把野火检测置信度与空间范围转换为来源可比的野火可解释证据。
研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。
研究者提出一种无需标签、损失或拟合模型的方法,从编码器等价类与固定对比设计计算可达对比空间,并给出任意无约束解码器的经验误差下限。
研究者提出物理驱动的跨模态掩码自编码器 CM-MAE,用于地震数据到测井的表示学习,将地震体与测井深度片段联合 token 化,并用四轴旋转位置嵌入映射到连续物理坐标。
EvoMO-SR 是一个由 LLM 驱动的符号回归框架,由 LLM 生成方程骨架、外部优化器单独拟合系数,并引入多目标生存选择与子结构引导机制。在 LSR-Synth 的 8 个域内与域外设置中,该框架使用 Llama-3.1-8B-Instruct 小模型在 7 个设置上取得最佳精度。基于规范化子树重叠与项匹配的两项符号精度指标显示,其恢复高精度符号结构的概率更高。
研究针对主次弱耦合马尔可夫决策过程(M2WCMDP)中的公平资源分配问题,用单调、凹、置换不变、归一化的公平函数替代传统效用总和目标。在同质次子MDP下,该问题可化简为在置换不变策略类上优化平台加平均参与者的效用目标;更一般情形则提出基于计数比例的深度强化学习方法和优先采样器。在机器更换与纽约市定价及出租车调度两个应用中验证了方法的公平性与可扩展性。
DSpine 是一种在骨干网络各层注入相邻因果条件的投机解码 drafter,通过门控相邻注入把前驱预测特征写入后继位置,使因果条件链随网络深度展开而所有位置并行更新。
针对车载自组网中联邦学习假设所有车辆训练同一模型的问题,论文提出编码器共享分层多任务联邦学习框架 EN-HMTFL,将基于聚类的分层联邦学习与全局共享编码器、车辆本地解码器结合,仅交换聚合编码器,原始数据与本地解码器参数保留在车辆端。
EHRFlow 是一个多边际流匹配框架,以编码后的患者病史为条件,让未来动力学依赖患者既往临床轨迹,支持不规则观测时间和任意时间跨度预测。在超过一百万患者的真实临床数据集(含独立外部验证队列)上,其 horizon 平均 top-5 临床代码准确率优于自回归与历史无关的流匹配基线。在受控反事实模拟中,条件引导无需训练任务特定结局模型即可近似抗高血压干预的已知效应。
arXiv 论文 arXiv:2609.36126 测试了使用严格局部连接和异步更新的 Neural Cellular Automata(NCA)在视觉推理任务上的能力,可解大迷宫、数独和 ARC-AGI-1。
ThinQuant 通过基于激活凸包几何结构的数据选择与精确降维优化,实现 LLM 低比特权重和激活量化中的高效旋转学习。Llama-3-70B 在 W4A4KV4 下旋转校准不到 12 分钟,WikiText-2 困惑度 5.63,优于 DartQuant 的 7.55(需 111 分钟)。
一项理论分析表明,特征学习会让神经网络更容易被植入后门:在干净准确率保持 O(π) 的前提下,懒惰学习需要触发强度 α ∝ π^{-1/2} 才能攻击成功,而特征学习将攻击预算改善至 α ∝ π^{-1/4}。这意味着在小投毒比例下,非线性特征学习大幅降低所需触发强度,基于线性启发式的安全审计会系统性低估后门脆弱性。
研究提出 Dyad 架构,通过环境条件化的动作编码器将候选动作描述并行嵌入,并与 LLM 内部状态打分,得到类型化动作分布。冻结 LLM 仅训练动作编码器即可在四个未见环境中稳定提升;联合优化在多种交互任务和模型规模上超越常规 RL 后训练,9B 模型在 ALFWorld 上平均绝对提升 3.80%,同时改善通用知识、推理与编码能力。
Koa-action 是一个面向低延迟原子动作(分类、语义端点检测、布尔判断、打分)的框架,通过引入原子标签 token 与监督微调,把分类变成确定性的单 token 解码。
LoopICL 用单个循环 Transformer 块解耦参数量与计算深度,在 TabArena 和 TALENT 上与 TabICLv2 同 FLOPs 下性能相当,参数量减少近 90%。
Inverse Distillation Unlearning(IDU)将多步匹配模型蒸馏为一步生成器的同时,抑制指定训练子集的输出。该方法只需预训练的全数据教师模型和遗忘集数据,无需保留训练样本、额外特征提取器或分类器。在 MNIST 和 CIFAR-10 上,IDU 在 flow-matching 与 score-based 扩散设置下大幅降低遗忘类别的生成频率,同时保持保留类别的生成质量。
PHASE 是一个生理引导的 iEEG 基础模型,将临床可测的生理特征作为显式学习目标,结合通道内时序阶段(PHASE-T)与跨通道时空阶段(PHASE-ST)的掩码潜变量预测,在 9 个临床站点 222 名参与者的异构记录上预训练。
研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。
GEM-KMeans 提出一种谱归一化但数学等价的非负低秩矩阵分解形式,将梯度更新、非负投影与归一化充分统计量融合进矩阵乘法 epilogue,在 HBM 中只需保留单个因子及小型 tile-reduction 数组,而非三个大规模因子数组。
研究团队推出 FLOORA(Floor Layout Optimization with RL Alignment),一个用于建筑布局生成的领域专用语言模型系列,其 0.6B 模型在分布外真实建筑上取得最高 92.0% 的 VLM 评审胜率,合成建筑上达 96.0%,人类评估中 89.3% 被选为最佳模型。
研究通过行为分析、表征探测与因果干预,考察了 AM、POMO(重编码器轻解码器)和 LEHD(轻编码器重解码器)三类自回归 NCO 模型的内部决策机制。结果显示 AM 与 POMO 在求解过程中始终遵循持续的几何模式,而 LEHD 则包含关于多个未来动作的线性可访问信息,并依赖当前节点表征做即时局部决策、起始节点表征承担全局导航。
研究者提出 CZAR(Composite Zero-Agnostic Return)损失函数,一种围绕凸性、方向不对称、欠预测近线性惩罚、大误差发散和自适应损失下限五项要求构建的分段二次损失,用于金融对数收益预测。
研究提出 Advantage-Based Control Variates(ABC),通过优势-价值形式重新审视轨迹级控制变量,并揭示其协方差结构与 Direct Advantage Estimation(DAE)的回报分解密切相关。
研究提出让监控器与工作模型协同训练,以避免工作模型针对固定监控器学会规避。监督设定下证明:当可能监控函数类的 Littlestone 维度有限时,监控可以做到误差与查询率趋近于零;自监督设定下提出基于测试时蒸馏的协同训练流程,监控器用额外测试时算力生成训练标签,再训练其标准算力策略,并对多数投票标签给出有限样本锐化保证。
研究者提出两种神经网络模型,可直接从区域几何学习微分算子的谱并用于谱优化。基于傅里叶系数与轻量 MLP 的模型在星形几何上精度达 0.2%,landscape 模型在前十个特征值上平均相对误差为 1%,优于 FNO 模型的 4%。两种代理模型均能复现经典谱最优解,如第一特征值对应的圆盘,并可从合成形状泛化到经典图像数据集。
TORQUE 是一个在固定比特预算下联合优化旋转前后高精度保留坐标数量与位置的量化框架,通过推导量化误差上界并证明 top-k 旋转前保留对每个 k 都能最小化该上界,将坐标子集搜索简化为对 k 的优化。该方法使用离线码本和并行参数选择实现快速优化,在最近邻检索、KV-cache 压缩和激活压缩实验中改善了重建精度与存储成本的权衡。
论文证明满足偏好性质(学习理论中的稳定性)的算法其样本压缩界可证明是紧的,解决了这一悬而未决的问题。作者基于均匀分布与顺序统计量给出显式构造,在极限下达到该界,并提供了仅需初等计数论证、无需无穷维对偶的更短证明。该工作将发表于第 65 届 IEEE CDC 2026,适用于 Scenario Approach、Pick-to-Learn 与支持向量方法等场景。
研究团队提出开源多应用平台 FLIP(Federated Learning Interoperability Platform),将联邦学习训练与评估流程做成可组合服务,包括站点数据库队列查询、按需从 PACS 获取 DICOM、站点项目审批和可复用 FL 任务类型。
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。
研究将联想记忆建模为黎曼流形上的 Epanechnikov 核密度众数搜索,证明测地记忆始终保留孤立模式,而体积校正记忆遵循严格的 Ricci 曲率阈值:正曲率在高维下可抹除记忆,负曲率则强化记忆。
FluxLite 是一个免训练、轻量的离散扩散模型推理时提议控制框架,通过 q_t 加权图散度项精确补偿稀疏跳跃率扰动,在保持目标路径的同时将残差重加权方差转化为局部凸目标。
研究者提出 EnJoi,一种基于扩散模型的数据同化算法,通过学习包含过去与未来状态的联合分布,动态平衡对当前状态与新观测的置信度,并采用 En4DVar 的改进版本利用粒子集合协方差。在流体与交通流仿真实验中,该方法在观测稀疏且非均匀的情况下重建性能提升。
论文提出可解释神经算子框架 KernelOnet,将核函数显式嵌入神经算子架构,用显式核替代 DeepONet 的 trunk 网络,提供数据驱动可学习核、物理信息核与混合核三种互补核。在三个基准和浅水波导工程问题上,KernelOnet 精度高,与 DeepONet 可比时以更少可学习参数取得更高精度;其无监督配置无需内部解标签,单次查询推理成本远低于逐实例求解器。
该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。