早期学习如何塑造持续学习中表征变化的方向
研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。
研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。
GEM-KMeans 提出一种谱归一化但数学等价的非负低秩矩阵分解形式,将梯度更新、非负投影与归一化充分统计量融合进矩阵乘法 epilogue,在 HBM 中只需保留单个因子及小型 tile-reduction 数组,而非三个大规模因子数组。
研究团队推出 FLOORA(Floor Layout Optimization with RL Alignment),一个用于建筑布局生成的领域专用语言模型系列,其 0.6B 模型在分布外真实建筑上取得最高 92.0% 的 VLM 评审胜率,合成建筑上达 96.0%,人类评估中 89.3% 被选为最佳模型。
研究通过行为分析、表征探测与因果干预,考察了 AM、POMO(重编码器轻解码器)和 LEHD(轻编码器重解码器)三类自回归 NCO 模型的内部决策机制。结果显示 AM 与 POMO 在求解过程中始终遵循持续的几何模式,而 LEHD 则包含关于多个未来动作的线性可访问信息,并依赖当前节点表征做即时局部决策、起始节点表征承担全局导航。
研究者提出 CZAR(Composite Zero-Agnostic Return)损失函数,一种围绕凸性、方向不对称、欠预测近线性惩罚、大误差发散和自适应损失下限五项要求构建的分段二次损失,用于金融对数收益预测。
研究提出 Advantage-Based Control Variates(ABC),通过优势-价值形式重新审视轨迹级控制变量,并揭示其协方差结构与 Direct Advantage Estimation(DAE)的回报分解密切相关。
研究提出让监控器与工作模型协同训练,以避免工作模型针对固定监控器学会规避。监督设定下证明:当可能监控函数类的 Littlestone 维度有限时,监控可以做到误差与查询率趋近于零;自监督设定下提出基于测试时蒸馏的协同训练流程,监控器用额外测试时算力生成训练标签,再训练其标准算力策略,并对多数投票标签给出有限样本锐化保证。
研究者提出两种神经网络模型,可直接从区域几何学习微分算子的谱并用于谱优化。基于傅里叶系数与轻量 MLP 的模型在星形几何上精度达 0.2%,landscape 模型在前十个特征值上平均相对误差为 1%,优于 FNO 模型的 4%。两种代理模型均能复现经典谱最优解,如第一特征值对应的圆盘,并可从合成形状泛化到经典图像数据集。
TORQUE 是一个在固定比特预算下联合优化旋转前后高精度保留坐标数量与位置的量化框架,通过推导量化误差上界并证明 top-k 旋转前保留对每个 k 都能最小化该上界,将坐标子集搜索简化为对 k 的优化。该方法使用离线码本和并行参数选择实现快速优化,在最近邻检索、KV-cache 压缩和激活压缩实验中改善了重建精度与存储成本的权衡。
论文证明满足偏好性质(学习理论中的稳定性)的算法其样本压缩界可证明是紧的,解决了这一悬而未决的问题。作者基于均匀分布与顺序统计量给出显式构造,在极限下达到该界,并提供了仅需初等计数论证、无需无穷维对偶的更短证明。该工作将发表于第 65 届 IEEE CDC 2026,适用于 Scenario Approach、Pick-to-Learn 与支持向量方法等场景。
研究团队提出开源多应用平台 FLIP(Federated Learning Interoperability Platform),将联邦学习训练与评估流程做成可组合服务,包括站点数据库队列查询、按需从 PACS 获取 DICOM、站点项目审批和可复用 FL 任务类型。
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。
研究将联想记忆建模为黎曼流形上的 Epanechnikov 核密度众数搜索,证明测地记忆始终保留孤立模式,而体积校正记忆遵循严格的 Ricci 曲率阈值:正曲率在高维下可抹除记忆,负曲率则强化记忆。
FluxLite 是一个免训练、轻量的离散扩散模型推理时提议控制框架,通过 q_t 加权图散度项精确补偿稀疏跳跃率扰动,在保持目标路径的同时将残差重加权方差转化为局部凸目标。
研究者提出 EnJoi,一种基于扩散模型的数据同化算法,通过学习包含过去与未来状态的联合分布,动态平衡对当前状态与新观测的置信度,并采用 En4DVar 的改进版本利用粒子集合协方差。在流体与交通流仿真实验中,该方法在观测稀疏且非均匀的情况下重建性能提升。
论文提出可解释神经算子框架 KernelOnet,将核函数显式嵌入神经算子架构,用显式核替代 DeepONet 的 trunk 网络,提供数据驱动可学习核、物理信息核与混合核三种互补核。在三个基准和浅水波导工程问题上,KernelOnet 精度高,与 DeepONet 可比时以更少可学习参数取得更高精度;其无监督配置无需内部解标签,单次查询推理成本远低于逐实例求解器。
该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。
CADENCE 是一种 CPU 原生的双专家时间序列分类架构,在全部 109 个等长 UCR Archive 数据集、30 次重采样(共 3,270 次运行)上取得 0.8864 的平均准确率。
研究者提出 TMLN(Trajectory-Modulatory Landscape Navigation),将持续学习形式化为弯曲损失景观上的最优控制问题,用对角经验 Fisher 信息矩阵(FIM)定义局部黎曼流形,并依据网络参数的历史轨迹动态调节预条件器,直接融入梯度更新以保护关键参数方向,无需附加惩罚项。在类增量和域增量基准上,该方法显著降低了相邻任务间的损失障碍。
一项 arXiv 研究独立复现了某不确定性感知道路级事故预测模型的数据流程,在三个伦敦行政区评估其 11 项设计决策,仅 4 项在第二个行政区复现成功,7 项失败且其中 4 项符号反转。
StepLearn 是一个非参数框架,将即时使用与持久信任分离:把有信息量的状态转移转化为可指导下一步的假设,但需经跨回合的前瞻验证后才允许复用。
研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。
研究者提出一种无散度向量场的最小表示,将 D 维域上的 D 分量无散度场编码为同一域上的 (D-1) 分量场,利用 Fourier 空间的横向结构与 Householder 正交变换直接构造约化坐标。
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文提出自适应离线强化学习(AORL),主张离线 RL 的目标应从直接部署转向学习自适应策略先验,使策略在后续在线交互中通过记忆、探索和自我纠正持续改进。
研究提出一种校准混合集成模型,将五个深度学习模型与三个经典机器学习模型通过逻辑回归堆叠元学习器结合,用于基于 EEG 的癫痫发作预测。在 CHB-MIT 数据集上采用严格的留一患者交叉验证,过滤队列中实现 74.2% 发作级灵敏度、每小时 1.24 次误报,平均预警时间 16.9 分钟。受目标误报预算约束的测试调优 oracle 在每小时 0.951 次误报下达到 60.9% 灵敏度。
ReLOBGen 提出一种在生成过程中即保证可回放性的限价订单簿(LOB)消息生成方法,通过从当前 LOB 挂单中选取被引用订单并掩码无效 token 保证字段一致,无需事后修正或重采样。在 500 条消息的回放测试中,ReLOBGen 实现 100% 可回放性,提升了盘口顶部统计与相对价格等市场真实性指标,相比 LOBS5 基线每条回放消息提速 2.7-3.6 倍。
研究提出基于弱监督的方法,用生成式 LLM 通过提示词生成合成标签,自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型,以替代易产生大量假阳性的关键词方法和依赖昂贵人工标注的机器学习方法。该研究还提出面向 EPU 相关文章的多标签与层级分类方法,使方案兼具成本效益与可扩展性。
Mara Chain 提出一种精炼流程,不再丢弃被拒绝的候选配置,而是保留并借助前序尝试积累的证据迭代精炼,每条精炼链限定固定深度,并用 Pareto 过滤的 Top-N 选择约束候选池。
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文指出,机器学习论文中的实证结果普遍难以复现、代码往往不可得,并阻碍研究发展。作者对这些问题进行了分析与量化,提出具体建议以提升结果的可核查性,即使无法做到完全复现。代码与支撑材料已公开。
DraftTrace 是一个同时捕捉写作成品、写作过程与 AI 助手交互三类视角的写作环境,可将文档随时间演变的过程重建为提交级、纵向和班级级分析。研究者在 81 名学生的研究生 NLP 课程中部署该工具,发现成品指标区分文本表述差异,过程指标区分文本输入方式差异,两者结合可识别复制粘贴等情形。交互轨迹显示学生早期用助手澄清问题、后期用于核验答案。
针对 LLM 自进化中"性能先升后平再降"的退化现象,研究者提出可学习信息增益框架,用一个小语言模型拟合上一轮数据并以负对数似然打分,量化新一轮带来的可参数化新信息,该增益在理论上等于两轮数据分布的 KL 散度加熵变。
哥伦比亚大学等机构研究者发布 EMNLP 2026 论文,测试查询中的政治意识形态与方言信号是否会偏置检索结果。在政治新闻和消费者健康问答两个领域、五款稠密检索器加一个稀疏基线上,所有检索器都会返回与查询自身政治倾向一致的文章,且对非洲裔美国英语(AAL)问题的检索效果差于白人主流英语(WME);线性探针能从查询嵌入中恢复倾向与方言信息。作者指出此类偏差可能加剧极化和健康差距,代码已开源。
研究者对 1,618 个语言模型在 456 个纯文本基准上的 13,251 个公开评测分数做因子分析,发现通用智力因子在最宽松估计下也只解释 70.8% 的性能方差,多数解远低于此。内容相近的基准未必聚类,$g$ 因子不被任何共同主题主导,也缺乏证据表明标准"智力"基准能很好代理它,这使得在语言模型开发中把通用智力当作可单独优化的目标缺乏支持。
研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。
FinRT 将自适应红队策略蒸馏为可复用的对抗提示生成器,在消费金融六个受害模型上把攻击成功率从 Rainbow Teaming 的 17.2% 提升至 32.9%,接近翻倍,最大对抗严重度提高 33%。该方法在保持与迭代搜索相当的策略域内语义多样性的同时,具备较高的跨模型迁移性,并呈现不同的受害模型族特化模式。
长期记忆系统把对话压缩成简短笔记时会选择性地"抹平"时态:在 381 对仅时态不同的用户陈述中,三个写入模型有 244 对把进行时陈述改成一般现在时,反向从未出现,该不对称在全部 11 种模型配置以及 mem0、Graphiti、Letta 中均成立。
研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者记忆接口,并用任务结果的组相对奖励与置信门控的 on-policy 蒸馏训练读者自身 rollout,教师模型在推理时完全移除。
arXiv 论文(arXiv:2609.36414)研究持久化 LLM 能否按用户请求删除其记忆,发现当前 LLM 无法真正删除信息,即使声称已遗忘且上下文有限。单纯移除匹配消息并不足够,因为对话中的消息依赖会让信息持续存在。作者提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息溯源图以确定删除时应移除哪些消息,实验显示 DeLLM 在保持实用性的同时实现较高删除率。
研究用 Values Survey Module 2013 审计了决策型语言模型 TypeSafe JEV 的文化价值观,以 12 组沙特和 12 组美国人设及无人设、英语和阿拉伯语、8 种提问方式共获得 288,000 个答案。