跳到正文

#数据/训练

今日 93 条
9月30日周三
  1. arXiv:cs.LG(机器学习,全量分类)39

    预条件物理信息神经算子训练

    研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。

  2. arXiv:cs.LG(机器学习,全量分类)27

    EvoMO-SR:基于多目标 LLM 进化与子结构引导的符号表达式生成

    EvoMO-SR 是一个由 LLM 驱动的符号回归框架,由 LLM 生成方程骨架、外部优化器单独拟合系数,并引入多目标生存选择与子结构引导机制。在 LSR-Synth 的 8 个域内与域外设置中,该框架使用 Llama-3.1-8B-Instruct 小模型在 7 个设置上取得最佳精度。基于规范化子树重叠与项匹配的两项符号精度指标显示,其恢复高精度符号结构的概率更高。

  3. arXiv:cs.LG(机器学习,全量分类)35

    逆蒸馏:IDU 统一框架实现多步匹配模型的数据遗忘与蒸馏

    Inverse Distillation Unlearning(IDU)将多步匹配模型蒸馏为一步生成器的同时,抑制指定训练子集的输出。该方法只需预训练的全数据教师模型和遗忘集数据,无需保留训练样本、额外特征提取器或分类器。在 MNIST 和 CIFAR-10 上,IDU 在 flow-matching 与 score-based 扩散设置下大幅降低遗忘类别的生成频率,同时保持保留类别的生成质量。

  4. arXiv:cs.LG(机器学习,全量分类)37

    早期学习如何塑造持续学习中表征变化的方向

    研究提出"脚手架"概念:早期表征漂移形成的低维子空间会被后续任务持续复用。在四个预训练视觉编码器和两个数据集上,后续表征变化一致偏向该早期子空间而非匹配的随机替代方向,且这种复用依赖学习历史。将运动约束在脚手架内会减慢新任务习得,但对旧任务保持的影响不一致。

  5. arXiv:cs.LG(机器学习,全量分类)45

    FLOORA:面向建筑设计的领域专用语言模型

    研究团队推出 FLOORA(Floor Layout Optimization with RL Alignment),一个用于建筑布局生成的领域专用语言模型系列,其 0.6B 模型在分布外真实建筑上取得最高 92.0% 的 VLM 评审胜率,合成建筑上达 96.0%,人类评估中 89.3% 被选为最佳模型。

  6. arXiv:cs.LG(机器学习,全量分类)36

    TORQUE:在旋转前后优化哪些坐标该(不)量化

    TORQUE 是一个在固定比特预算下联合优化旋转前后高精度保留坐标数量与位置的量化框架,通过推导量化误差上界并证明 top-k 旋转前保留对每个 k 都能最小化该上界,将坐标子集搜索简化为对 k 的优化。该方法使用离线码本和并行参数选择实现快速优化,在最近邻检索、KV-cache 压缩和激活压缩实验中改善了重建精度与存储成本的权衡。

  7. arXiv:cs.LG(机器学习,全量分类)34

    TMLN:基于轨迹的损失景观导航方法缓解增量学习中的遗忘

    研究者提出 TMLN(Trajectory-Modulatory Landscape Navigation),将持续学习形式化为弯曲损失景观上的最优控制问题,用对角经验 Fisher 信息矩阵(FIM)定义局部黎曼流形,并依据网络参数的历史轨迹动态调节预条件器,直接融入梯度更新以保护关键参数方向,无需附加惩罚项。在类增量和域增量基准上,该方法显著降低了相邻任务间的损失障碍。

  8. arXiv:cs.LG(机器学习,全量分类)31

    用生成式 LLM 与标签聚合分类新闻中的经济政策不确定性

    研究提出基于弱监督的方法,用生成式 LLM 通过提示词生成合成标签,自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型,以替代易产生大量假阳性的关键词方法和依赖昂贵人工标注的机器学习方法。该研究还提出面向 EPU 相关文章的多标签与层级分类方法,使方案兼具成本效益与可扩展性。

  9. arXiv:cs.CL(计算语言学,全量分类)54

    DeLLM 框架提出系统性删除 LLM 记忆的方法

    arXiv 论文(arXiv:2609.36414)研究持久化 LLM 能否按用户请求删除其记忆,发现当前 LLM 无法真正删除信息,即使声称已遗忘且上下文有限。单纯移除匹配消息并不足够,因为对话中的消息依赖会让信息持续存在。作者提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息溯源图以确定删除时应移除哪些消息,实验显示 DeLLM 在保持实用性的同时实现较高删除率。

  10. arXiv:cs.CL(计算语言学,全量分类)36

    OLIVE:在学生状态上学习教师续写,在线蒸馏新方法

    研究者提出在线蒸馏方法 OLIVE,每轮由学生策略生成新前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。在同等 GPU 小时成本下,OLIVE 推理表现优于采用 top-16 KL 近似的 OPD,异步实现进一步将总训练时间缩短 23.8%。仅用 GPT-5.4-mini 的文本持续训练,OLIVE 在 ScienceWorld 上比同一教师的离线 SFT 高出 13%。

  11. arXiv:cs.CL(计算语言学,全量分类)44

    非母语英语如何影响 LLM 终端用户表现:FABLE 数据集与 34 个开源权重模型评测

    研究者构建 FABLE 数据集,包含源自 174K 真实用户提示词的 190,911 条英语提示词变体,并用其评测 34 个开源权重 LLM 的写作任务表现。结果显示模型不会把拼写错误等表层错误带入输出,却会模仿用户提示词中更高层的修辞与词汇特征,最不流利与最流利提示词之间的回答质量差异显著。这表明非母语英语用户不仅得到质量更低的回答,回答本身的流利度也更差。

  12. arXiv:cs.CL(计算语言学,全量分类)37

    LLM 作为多值关系知识库的规范顺序问题:大语言模型为何不可靠

    研究发现 LLM 内部对多值关系按规范顺序(如字母序或时间序)组织概率分布,存在"规范顺序问题"。机制分析显示 LLM 的集合生成分为候选实体检索、内部排序、下一元素选择三个阶段,当提示词要求偏离这一内部顺序时,模型生成完整实体集合的可靠性显著下降。该成果已被 AKBC@EMNLP2026 接收。

  13. arXiv:cs.CL(计算语言学,全量分类)42

    ProVer:面向智能体强化学习关键决策的细粒度信用分配框架

    ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。

  14. arXiv:cs.CL(计算语言学,全量分类)34

    用生成式 AI 流水线解决 SEC 10-K 财务数据缺失问题

    研究评估 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B 从 SEC 10-K 文件中提取财务属性的能力,以应对影响超 70% 企业、半数总市值的结构化数据缺失问题。Qwen-2.5 14B 在 Cash 项上取得 83.33% F1,Llama-3.3 70B 在 R&D 项上取得 76.92% F1,表明参数规模与文档复杂度匹配可实现高零样本准确率。

  15. arXiv:cs.CL(计算语言学,全量分类)27

    HSTA:用超球面语义轨迹分析追踪学术预印本、专利信号与算力扩展间的技术扩散

    论文提出无监督方法 HSTA,将 Transformer 句向量投影到单位超球面,用 Spherical K-Means 与 UMAP 分析 arXiv 预印本和 USPTO 专利共 3 万条记录,量化语义质心漂移与商业化偏移。结果显示大语言模型(漂移 0.332)与 AI 系统(0.234)子主题语义演化最快;季度论文量增速在常规显著性水平下并不 Granger 导致前沿算力分配激增。

  16. Anthropic:Transformer Circuits(可解释性研究)35

    Anthropic 可解释性研究:特征与上下文学习的新发现

    Anthropic 可解释性团队在月度更新中指出,模型对跨语言相似文本的活跃特征重叠度(IoU)随样本长度增加而上升。通过对比英法段落首尾句,末句 IoU 显著高于首句,且无关语句的首句重叠度高于末句,支持"模型在更长上下文中构建更丰富表征"的解释,而非虚假激活所致。

  17. Andrej Karpathy:Blog(网页)66

    Andrej Karpathy 详解训练神经网络的六步方法

    Andrej Karpathy 撰文提出训练神经网络的系统流程,指出神经网络训练是易泄露的抽象且会静默失败,配置错误往往不报错只是效果变差。流程分六步:深入检查数据、搭建端到端训练评估骨架并建立简单基线、过拟合、正则化、调参、最后压榨性能,并给出固定随机种子、验证初始损失、过拟合单个 batch、Adam 配 3e-4 学习率、优先随机搜索等具体技巧。

  18. Goodfire Research(网页)37

    Goodfire 推出 Silico for Life Sciences:面向生命科学的模型可解释性工具

    Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。