预条件物理信息神经算子训练
研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。
研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。
研究者提出一种无需标签、损失或拟合模型的方法,从编码器等价类与固定对比设计计算可达对比空间,并给出任意无约束解码器的经验误差下限。
EvoMO-SR 是一个由 LLM 驱动的符号回归框架,由 LLM 生成方程骨架、外部优化器单独拟合系数,并引入多目标生存选择与子结构引导机制。在 LSR-Synth 的 8 个域内与域外设置中,该框架使用 Llama-3.1-8B-Instruct 小模型在 7 个设置上取得最佳精度。基于规范化子树重叠与项匹配的两项符号精度指标显示,其恢复高精度符号结构的概率更高。
针对车载自组网中联邦学习假设所有车辆训练同一模型的问题,论文提出编码器共享分层多任务联邦学习框架 EN-HMTFL,将基于聚类的分层联邦学习与全局共享编码器、车辆本地解码器结合,仅交换聚合编码器,原始数据与本地解码器参数保留在车辆端。
ThinQuant 通过基于激活凸包几何结构的数据选择与精确降维优化,实现 LLM 低比特权重和激活量化中的高效旋转学习。Llama-3-70B 在 W4A4KV4 下旋转校准不到 12 分钟,WikiText-2 困惑度 5.63,优于 DartQuant 的 7.55(需 111 分钟)。
LoopICL 用单个循环 Transformer 块解耦参数量与计算深度,在 TabArena 和 TALENT 上与 TabICLv2 同 FLOPs 下性能相当,参数量减少近 90%。
Inverse Distillation Unlearning(IDU)将多步匹配模型蒸馏为一步生成器的同时,抑制指定训练子集的输出。该方法只需预训练的全数据教师模型和遗忘集数据,无需保留训练样本、额外特征提取器或分类器。在 MNIST 和 CIFAR-10 上,IDU 在 flow-matching 与 score-based 扩散设置下大幅降低遗忘类别的生成频率,同时保持保留类别的生成质量。
PHASE 是一个生理引导的 iEEG 基础模型,将临床可测的生理特征作为显式学习目标,结合通道内时序阶段(PHASE-T)与跨通道时空阶段(PHASE-ST)的掩码潜变量预测,在 9 个临床站点 222 名参与者的异构记录上预训练。
研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。
GEM-KMeans 提出一种谱归一化但数学等价的非负低秩矩阵分解形式,将梯度更新、非负投影与归一化充分统计量融合进矩阵乘法 epilogue,在 HBM 中只需保留单个因子及小型 tile-reduction 数组,而非三个大规模因子数组。
研究团队推出 FLOORA(Floor Layout Optimization with RL Alignment),一个用于建筑布局生成的领域专用语言模型系列,其 0.6B 模型在分布外真实建筑上取得最高 92.0% 的 VLM 评审胜率,合成建筑上达 96.0%,人类评估中 89.3% 被选为最佳模型。
TORQUE 是一个在固定比特预算下联合优化旋转前后高精度保留坐标数量与位置的量化框架,通过推导量化误差上界并证明 top-k 旋转前保留对每个 k 都能最小化该上界,将坐标子集搜索简化为对 k 的优化。该方法使用离线码本和并行参数选择实现快速优化,在最近邻检索、KV-cache 压缩和激活压缩实验中改善了重建精度与存储成本的权衡。
研究团队提出开源多应用平台 FLIP(Federated Learning Interoperability Platform),将联邦学习训练与评估流程做成可组合服务,包括站点数据库队列查询、按需从 PACS 获取 DICOM、站点项目审批和可复用 FL 任务类型。
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。
研究将联想记忆建模为黎曼流形上的 Epanechnikov 核密度众数搜索,证明测地记忆始终保留孤立模式,而体积校正记忆遵循严格的 Ricci 曲率阈值:正曲率在高维下可抹除记忆,负曲率则强化记忆。
研究者提出 TMLN(Trajectory-Modulatory Landscape Navigation),将持续学习形式化为弯曲损失景观上的最优控制问题,用对角经验 Fisher 信息矩阵(FIM)定义局部黎曼流形,并依据网络参数的历史轨迹动态调节预条件器,直接融入梯度更新以保护关键参数方向,无需附加惩罚项。在类增量和域增量基准上,该方法显著降低了相邻任务间的损失障碍。
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文提出自适应离线强化学习(AORL),主张离线 RL 的目标应从直接部署转向学习自适应策略先验,使策略在后续在线交互中通过记忆、探索和自我纠正持续改进。
研究提出基于弱监督的方法,用生成式 LLM 通过提示词生成合成标签,自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型,以替代易产生大量假阳性的关键词方法和依赖昂贵人工标注的机器学习方法。该研究还提出面向 EPU 相关文章的多标签与层级分类方法,使方案兼具成本效益与可扩展性。
针对 LLM 自进化中"性能先升后平再降"的退化现象,研究者提出可学习信息增益框架,用一个小语言模型拟合上一轮数据并以负对数似然打分,量化新一轮带来的可参数化新信息,该增益在理论上等于两轮数据分布的 KL 散度加熵变。
arXiv 论文(arXiv:2609.36414)研究持久化 LLM 能否按用户请求删除其记忆,发现当前 LLM 无法真正删除信息,即使声称已遗忘且上下文有限。单纯移除匹配消息并不足够,因为对话中的消息依赖会让信息持续存在。作者提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息溯源图以确定删除时应移除哪些消息,实验显示 DeLLM 在保持实用性的同时实现较高删除率。
研究者提出 verbalization training(VT),通过截断模型自发说出评估意识前的 rollout 生成训练前缀,再用 RL 目标校准地提升这种表达,从而在不监督潜在信念本身的前提下让 LLM 更愿意说出评估意识。
研究者提出在线蒸馏方法 OLIVE,每轮由学生策略生成新前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。在同等 GPU 小时成本下,OLIVE 推理表现优于采用 top-16 KL 近似的 OPD,异步实现进一步将总训练时间缩短 23.8%。仅用 GPT-5.4-mini 的文本持续训练,OLIVE 在 ScienceWorld 上比同一教师的离线 SFT 高出 13%。
研究者构建 FABLE 数据集,包含源自 174K 真实用户提示词的 190,911 条英语提示词变体,并用其评测 34 个开源权重 LLM 的写作任务表现。结果显示模型不会把拼写错误等表层错误带入输出,却会模仿用户提示词中更高层的修辞与词汇特征,最不流利与最流利提示词之间的回答质量差异显著。这表明非母语英语用户不仅得到质量更低的回答,回答本身的流利度也更差。
研究发现 LLM 内部对多值关系按规范顺序(如字母序或时间序)组织概率分布,存在"规范顺序问题"。机制分析显示 LLM 的集合生成分为候选实体检索、内部排序、下一元素选择三个阶段,当提示词要求偏离这一内部顺序时,模型生成完整实体集合的可靠性显著下降。该成果已被 AKBC@EMNLP2026 接收。
ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。
研究评估 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B 从 SEC 10-K 文件中提取财务属性的能力,以应对影响超 70% 企业、半数总市值的结构化数据缺失问题。Qwen-2.5 14B 在 Cash 项上取得 83.33% F1,Llama-3.3 70B 在 R&D 项上取得 76.92% F1,表明参数规模与文档复杂度匹配可实现高零样本准确率。
论文提出无监督方法 HSTA,将 Transformer 句向量投影到单位超球面,用 Spherical K-Means 与 UMAP 分析 arXiv 预印本和 USPTO 专利共 3 万条记录,量化语义质心漂移与商业化偏移。结果显示大语言模型(漂移 0.332)与 AI 系统(0.234)子主题语义演化最快;季度论文量增速在常规显著性水平下并不 Granger 导致前沿算力分配激增。
研究测试 7 个 LLM、12 种任务设计、3 次独立运行,对 3000 条推文进行冒犯性语言与仇恨言论标注,同一模型与设计重复运行的中位 Fleiss' κ 达 0.91,更换任务设计后中位 Cohen's κ 降至 0.76。
研究者提出 Less Uniform Diffusion(LUDI)框架,通过引入 less uniform loss 和 per-token time embeddings 解决均匀扩散语言模型(UDLM)训练目标过度均匀与采样时条件-目标混淆的问题。
Anthropic 可解释性团队在月度更新中指出,模型对跨语言相似文本的活跃特征重叠度(IoU)随样本长度增加而上升。通过对比英法段落首尾句,末句 IoU 显著高于首句,且无关语句的首句重叠度高于末句,支持"模型在更长上下文中构建更丰富表征"的解释,而非虚假激活所致。
Prime Intellect 的 PRIME-RL 强化学习栈从训练单个智能体扩展到多智能体系统,可编程任意智能体交互、选择哪些角色参与学习,并在完整交互中分配信用。
Prime Intellect 基于 NIXL 和 ModelExpress 重建了 prime-rl 的权重传输流程,把 GLM-5.2 的 RL 权重同步从 60-90 秒降至个位数秒,实测约 4 秒。
Meta AI 推出 Brain2Qwerty v2,可从非侵入式脑记录(MEG)实时解码完整句子,词准确率 61%,远高于其他非侵入式方法的 8%,最佳参与者达 78%。
LlamaIndex 发布开源文档抽取基准 ExtractBench,覆盖 370 份企业文档(4,869 页)、8 个业务领域和 67 种文档类型,评测 14 个系统并联合评估长记录完整性、扫描与手写识别、字词级 grounding 和成本。
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit Q4_0 检查点,采用量化感知蒸馏(QAD)训练,四款模型均保留约 97% 的 BF16 平均性能。
Liquid AI 推出 LongevityBench,一个覆盖五个生物数据领域的 17 项任务开放基准,并用它评估了来自六个开发团队的 18 个前沿 AI 系统。同期研究还包括 In-Place Tokenizer Expansion,可在不损失质量的前提下将非英文 token 数量最多减少 4 倍。
Andrej Karpathy 撰文提出训练神经网络的系统流程,指出神经网络训练是易泄露的抽象且会静默失败,配置错误往往不报错只是效果变差。流程分六步:深入检查数据、搭建端到端训练评估骨架并建立简单基线、过拟合、正则化、调参、最后压榨性能,并给出固定随机种子、验证初始损失、过拟合单个 batch、Adam 配 3e-4 学习率、优先随机搜索等具体技巧。
Andrej Karpathy 复现 Yann LeCun 等 1989 年的《Backpropagation Applied to Handwritten Zip Code Recognition》,认为这是最早的端到端反向传播神经网络实际应用,代码开源在 karpathy/lecun1989-repro。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。