ROSS:通过选择性监督从自生成 rollout 中再学习
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。
研究将联想记忆建模为黎曼流形上的 Epanechnikov 核密度众数搜索,证明测地记忆始终保留孤立模式,而体积校正记忆遵循严格的 Ricci 曲率阈值:正曲率在高维下可抹除记忆,负曲率则强化记忆。
FluxLite 是一个免训练、轻量的离散扩散模型推理时提议控制框架,通过 q_t 加权图散度项精确补偿稀疏跳跃率扰动,在保持目标路径的同时将残差重加权方差转化为局部凸目标。
研究者提出 EnJoi,一种基于扩散模型的数据同化算法,通过学习包含过去与未来状态的联合分布,动态平衡对当前状态与新观测的置信度,并采用 En4DVar 的改进版本利用粒子集合协方差。在流体与交通流仿真实验中,该方法在观测稀疏且非均匀的情况下重建性能提升。
论文提出可解释神经算子框架 KernelOnet,将核函数显式嵌入神经算子架构,用显式核替代 DeepONet 的 trunk 网络,提供数据驱动可学习核、物理信息核与混合核三种互补核。在三个基准和浅水波导工程问题上,KernelOnet 精度高,与 DeepONet 可比时以更少可学习参数取得更高精度;其无监督配置无需内部解标签,单次查询推理成本远低于逐实例求解器。
该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。
CADENCE 是一种 CPU 原生的双专家时间序列分类架构,在全部 109 个等长 UCR Archive 数据集、30 次重采样(共 3,270 次运行)上取得 0.8864 的平均准确率。
研究者提出 TMLN(Trajectory-Modulatory Landscape Navigation),将持续学习形式化为弯曲损失景观上的最优控制问题,用对角经验 Fisher 信息矩阵(FIM)定义局部黎曼流形,并依据网络参数的历史轨迹动态调节预条件器,直接融入梯度更新以保护关键参数方向,无需附加惩罚项。在类增量和域增量基准上,该方法显著降低了相邻任务间的损失障碍。
一项 arXiv 研究独立复现了某不确定性感知道路级事故预测模型的数据流程,在三个伦敦行政区评估其 11 项设计决策,仅 4 项在第二个行政区复现成功,7 项失败且其中 4 项符号反转。
StepLearn 是一个非参数框架,将即时使用与持久信任分离:把有信息量的状态转移转化为可指导下一步的假设,但需经跨回合的前瞻验证后才允许复用。
研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。
研究者提出一种无散度向量场的最小表示,将 D 维域上的 D 分量无散度场编码为同一域上的 (D-1) 分量场,利用 Fourier 空间的横向结构与 Householder 正交变换直接构造约化坐标。
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文提出自适应离线强化学习(AORL),主张离线 RL 的目标应从直接部署转向学习自适应策略先验,使策略在后续在线交互中通过记忆、探索和自我纠正持续改进。
研究提出一种校准混合集成模型,将五个深度学习模型与三个经典机器学习模型通过逻辑回归堆叠元学习器结合,用于基于 EEG 的癫痫发作预测。在 CHB-MIT 数据集上采用严格的留一患者交叉验证,过滤队列中实现 74.2% 发作级灵敏度、每小时 1.24 次误报,平均预警时间 16.9 分钟。受目标误报预算约束的测试调优 oracle 在每小时 0.951 次误报下达到 60.9% 灵敏度。
ReLOBGen 提出一种在生成过程中即保证可回放性的限价订单簿(LOB)消息生成方法,通过从当前 LOB 挂单中选取被引用订单并掩码无效 token 保证字段一致,无需事后修正或重采样。在 500 条消息的回放测试中,ReLOBGen 实现 100% 可回放性,提升了盘口顶部统计与相对价格等市场真实性指标,相比 LOBS5 基线每条回放消息提速 2.7-3.6 倍。
研究提出基于弱监督的方法,用生成式 LLM 通过提示词生成合成标签,自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型,以替代易产生大量假阳性的关键词方法和依赖昂贵人工标注的机器学习方法。该研究还提出面向 EPU 相关文章的多标签与层级分类方法,使方案兼具成本效益与可扩展性。
Mara Chain 提出一种精炼流程,不再丢弃被拒绝的候选配置,而是保留并借助前序尝试积累的证据迭代精炼,每条精炼链限定固定深度,并用 Pareto 过滤的 Top-N 选择约束候选池。
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文指出,机器学习论文中的实证结果普遍难以复现、代码往往不可得,并阻碍研究发展。作者对这些问题进行了分析与量化,提出具体建议以提升结果的可核查性,即使无法做到完全复现。代码与支撑材料已公开。
DraftTrace 是一个同时捕捉写作成品、写作过程与 AI 助手交互三类视角的写作环境,可将文档随时间演变的过程重建为提交级、纵向和班级级分析。研究者在 81 名学生的研究生 NLP 课程中部署该工具,发现成品指标区分文本表述差异,过程指标区分文本输入方式差异,两者结合可识别复制粘贴等情形。交互轨迹显示学生早期用助手澄清问题、后期用于核验答案。
针对 LLM 自进化中"性能先升后平再降"的退化现象,研究者提出可学习信息增益框架,用一个小语言模型拟合上一轮数据并以负对数似然打分,量化新一轮带来的可参数化新信息,该增益在理论上等于两轮数据分布的 KL 散度加熵变。
哥伦比亚大学等机构研究者发布 EMNLP 2026 论文,测试查询中的政治意识形态与方言信号是否会偏置检索结果。在政治新闻和消费者健康问答两个领域、五款稠密检索器加一个稀疏基线上,所有检索器都会返回与查询自身政治倾向一致的文章,且对非洲裔美国英语(AAL)问题的检索效果差于白人主流英语(WME);线性探针能从查询嵌入中恢复倾向与方言信息。作者指出此类偏差可能加剧极化和健康差距,代码已开源。
研究者对 1,618 个语言模型在 456 个纯文本基准上的 13,251 个公开评测分数做因子分析,发现通用智力因子在最宽松估计下也只解释 70.8% 的性能方差,多数解远低于此。内容相近的基准未必聚类,$g$ 因子不被任何共同主题主导,也缺乏证据表明标准"智力"基准能很好代理它,这使得在语言模型开发中把通用智力当作可单独优化的目标缺乏支持。
研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。
FinRT 将自适应红队策略蒸馏为可复用的对抗提示生成器,在消费金融六个受害模型上把攻击成功率从 Rainbow Teaming 的 17.2% 提升至 32.9%,接近翻倍,最大对抗严重度提高 33%。该方法在保持与迭代搜索相当的策略域内语义多样性的同时,具备较高的跨模型迁移性,并呈现不同的受害模型族特化模式。
长期记忆系统把对话压缩成简短笔记时会选择性地"抹平"时态:在 381 对仅时态不同的用户陈述中,三个写入模型有 244 对把进行时陈述改成一般现在时,反向从未出现,该不对称在全部 11 种模型配置以及 mem0、Graphiti、Letta 中均成立。
研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者记忆接口,并用任务结果的组相对奖励与置信门控的 on-policy 蒸馏训练读者自身 rollout,教师模型在推理时完全移除。
arXiv 论文(arXiv:2609.36414)研究持久化 LLM 能否按用户请求删除其记忆,发现当前 LLM 无法真正删除信息,即使声称已遗忘且上下文有限。单纯移除匹配消息并不足够,因为对话中的消息依赖会让信息持续存在。作者提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息溯源图以确定删除时应移除哪些消息,实验显示 DeLLM 在保持实用性的同时实现较高删除率。
研究用 Values Survey Module 2013 审计了决策型语言模型 TypeSafe JEV 的文化价值观,以 12 组沙特和 12 组美国人设及无人设、英语和阿拉伯语、8 种提问方式共获得 288,000 个答案。
DeepRewind 是一个面向深度研究智能体的可逆控制层,将智能体不断演化的认知状态表示为包含来源、证据、主张、假设、承诺、计划和草稿的类型化图。它用基于提示词的世界模型预测中间结论的影响与可逆性,由二元控制器拦截高风险承诺,并在后续证据推翻结论时执行依赖感知回滚。
研究者提出 verbalization training(VT),通过截断模型自发说出评估意识前的 rollout 生成训练前缀,再用 RL 目标校准地提升这种表达,从而在不监督潜在信念本身的前提下让 LLM 更愿意说出评估意识。
HeurEvo 是一个自动化 plan–code–component 协同进化框架,通过 planner、coder 与 component evolver 联合进化算法结构、实现代码和共享组件池,并由 interpreter agent 分析执行结果提供反馈。
研究者提出 Population Fidelity 评估框架,从群体级准确度、组间变异量及变异结构三个维度衡量 LLM 生成回答的人群代表性。复现"机器偏见"研究后发现,代表性差不仅源于组间变异不足,还在于变异被分配给了错误的群体;文化微调虽能提升与调查中心的整体一致性,却未改善群体内差异的刻画。框架附带可复用代码、数据与训练模型。
研究者提出在线蒸馏方法 OLIVE,每轮由学生策略生成新前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。在同等 GPU 小时成本下,OLIVE 推理表现优于采用 top-16 KL 近似的 OPD,异步实现进一步将总训练时间缩短 23.8%。仅用 GPT-5.4-mini 的文本持续训练,OLIVE 在 ScienceWorld 上比同一教师的离线 SFT 高出 13%。
研究通过提示和微调为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,发现每个专家的表征都更贴近与其认知域匹配的脑系统,而非其他专家。该结果在三种基础模型和三个 fMRI 数据集上均成立,且非认知与表层干预无法产生同等对齐。模型专门化会改变区域对齐,但总体预测准确率基本不变。
研究者推出 CineSubBench,一个基于多语言电影字幕评测 LLM 长上下文电影理解能力的基准,含 1,012 部电影、六种语言共 6,072 条字幕轨和 8.13M 条带时间戳字幕。
研究者构建 FABLE 数据集,包含源自 174K 真实用户提示词的 190,911 条英语提示词变体,并用其评测 34 个开源权重 LLM 的写作任务表现。结果显示模型不会把拼写错误等表层错误带入输出,却会模仿用户提示词中更高层的修辞与词汇特征,最不流利与最流利提示词之间的回答质量差异显著。这表明非母语英语用户不仅得到质量更低的回答,回答本身的流利度也更差。
研究发现 LLM 内部对多值关系按规范顺序(如字母序或时间序)组织概率分布,存在"规范顺序问题"。机制分析显示 LLM 的集合生成分为候选实体检索、内部排序、下一元素选择三个阶段,当提示词要求偏离这一内部顺序时,模型生成完整实体集合的可靠性显著下降。该成果已被 AKBC@EMNLP2026 接收。
研究用探针、对比方向和表征相似度考察 Gemma 4 31B 对九种非洲语言及三种对照语言的表征,发现非洲语言间的"非洲 vs 西方"对比方向在多个层上比它们与对照语言更对齐,跨语系比较在十二层中的五层通过 Holm 阈值。
FastGuide 通过并行与自回归解码的自适应混合,加速扩散大语言模型的奖励引导推理,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,同时保持相近生成质量。该方法每个解码步骤只计算一次奖励模型反向传播并复用于多个 token,并借助 KV cache 与稀疏注意力重计算逐次解掩码,对模型不自信的 token 则延后处理。