跳到正文

#数据/训练

今日 93 条
11月23日周日
  1. Ilya Sutskever60

    Ilya Sutskever 转发 Anthropic 新研究并称其为重要工作。该研究题为 Natural emergent misalignment from reward hacking in production RL,研究模型在训练中对任务作弊的 reward hacking 现象,指出若不加缓解,其后果可能非常严重。

    引用Anthropic@AnthropicAI

    New Anthropic research: Natural emergent misalignment from reward hacking in production RL. “Reward hacking” is where models learn to cheat on tasks they’re given during training. Our new study finds that the consequences of reward hacking, if unmitigated, can be very serious.

11月19日周三
11月1日周六
  1. BAIR:Berkeley AI Research Blog47

    无需 TD 学习的强化学习:用分治法扩展 off-policy RL

    伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。

10月27日周一
  1. Thinking Machines Lab:官方博客(RSS)64

    Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果

    Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。

    推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。

9月26日周五
  1. Thinking Machines Lab:官方博客(RSS)45

    Thinking Machines Lab 提出模块化流形与流形版 Muon 优化器

    Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。

9月21日周日
9月8日周一
9月1日周一
  1. BAIR:Berkeley AI Research Blog50

    word2vec 究竟学到了什么?BAIR 给出闭式学习理论

    BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。

7月23日周三
7月18日周五
7月3日周四
  1. 上海人工智能实验室 InternLM:原创项目35

    InternLM 推出 POLAR:基于策略判别学习的预训练可扩展高性能奖励模型

    上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。

2月26日周三
2月24日周一
11月28日周四
7月7日周日
  1. Lilian Weng:Lil'Log(RSS)63

    Lilian Weng 长文解读大语言模型的外在幻觉:成因、检测与缓解方法

    Lilian Weng 在 Lil'Log 发表长文,将幻觉聚焦于外在幻觉,即模型输出未被提供的上下文或世界知识支持、编造且不可验证的内容。文章梳理幻觉成因,包括预训练数据中的过时或错误信息,以及微调引入新知识会加剧幻觉(Gekhman et al. 2024 发现模型学会 Unknown 样本后更易幻觉)。

    推荐理由:Lilian Weng 系统梳理大语言模型外在幻觉的成因、检测基准与缓解方法,覆盖 RAG、采样、微调等技术路线。

2月5日周一
10月25日周三
1月27日周五
4月16日周六
2月20日周日
  1. Lilian Weng:Lil'Log(RSS)44

    数据不足时如何学习(下):主动学习

    面对标注数据有限的有监督任务,主动学习在固定标注预算 B 下从无标注数据集中挑选最有价值的样本交给人工标注,以最大化模型性能提升。文章梳理了不确定性采样(最小置信度、margin、熵)、Query-By-Committee 以及多样性采样等采样策略,并区分了数据噪声带来的偶然不确定性与模型参数导致的可认知不确定性。

12月5日周日
  1. Lilian Weng:Lil'Log(RSS)49

    数据不足时如何学习(一):半监督学习

    Lil'Log 发布“Learning with not Enough Data”系列第一篇,聚焦半监督学习,即同时利用有标注和无标注数据训练模型。文章梳理了平滑性、聚类、低密度分离与流形四种假设,并介绍一致性正则化方法,如 Π-model 等,指出该领域研究多集中于视觉任务,语言任务更常用预训练加微调范式。

9月24日周五
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读如何在多 GPU 上训练超大模型

    Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。

5月31日周一
  1. Lilian Weng:Lil'Log(RSS)46

    对比表示学习(Contrastive Representation Learning)综述

    对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对彼此远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。文章梳理了对比损失、Triplet Loss、Lifted Structured Loss、N-pair Loss 和 NCE 等训练目标,指出近期趋势是在一个 batch 中纳入多组正负样本对。

1月2日周六
8月6日周四
  1. Lilian Weng:Lil'Log(RSS)37

    神经架构搜索(NAS)综述:搜索空间、搜索算法与评估策略

    神经架构搜索(NAS)通过自动学习高性能网络拓扑,由搜索空间、搜索算法和评估策略三大组件构成。搜索空间从早期的逐层序列化表示发展到 NASNet 的 cell 重复堆叠结构,后者支持跨数据集迁移并可通过调整 cell 重复次数缩放模型。Zoph & Le 2017 的实验曾用 800 块 GPU 并行运行 28 天,NASNet 还提出 ScheduledDropPath 显著提升最终性能。

1月29日周三
  1. Lilian Weng:Lil'Log(RSS)30

    强化学习中的课程学习(Curriculum Learning)综述

    Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。

11月10日周日
9月5日周四
  1. Lilian Weng:Lil'Log(RSS)50

    进化策略(Evolution Strategies)详解

    Lilian Weng 在 Lil'Log 发文详解进化策略(ES)这类黑盒优化算法,目标为实数向量 x ∈ ℝⁿ。文章介绍了最基础的 Simple Gaussian ES,以及通过协方差矩阵 C 追踪样本间依赖关系、解决探索空间无法快速调整问题的 CMA-ES。

5月5日周日
  1. Lilian Weng:Lil'Log(RSS)38

    域随机化如何实现 Sim2Real 迁移

    域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。

3月14日周四
1月31日周四
11月30日周五
  1. Lilian Weng:Lil'Log(RSS)49

    Meta-Learning 元学习:如何让模型学会快速学习

    Meta-Learning(元学习)旨在让模型仅凭少量训练样本就能快速学习新概念与新任务,因此也被称为"learning to learn"。其核心做法是在多种学习任务上训练模型,使每个数据集被视为一个数据样本,从而优化模型在任务分布上的表现,包括训练时未见过的新任务。

10月13日周六
  1. Lilian Weng:Lil'Log(RSS)45

    基于流的深度生成模型:Normalizing Flows 如何显式建模数据分布

    基于流的深度生成模型通过一系列可逆变换构建,借助 normalizing flows 显式学习数据分布 p(x),损失函数即负对数似然,从而绕开 GAN 与 VAE 难以计算概率密度的问题。与 GAN 的对抗博弈和 VAE 优化 ELBO 不同,该模型依赖 Jacobian 行列式与变量变换定理完成密度估计,可用于数据生成、密度估计、隐变量推断和补全不完整样本。

6月26日周二
  1. Sam Altman:Blog(RSS)75

    Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手

    OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。

4月8日周日
12月31日周日
  1. Lilian Weng:Lil'Log(RSS)47

    R-CNN 家族目标检测模型详解:R-CNN、Fast R-CNN、Faster R-CNN 与 Mask R-CNN

    R-CNN 家族包含 R-CNN、Fast R-CNN、Faster R-CNN 和 Mask R-CNN 四个模型,前三个用于目标识别,Mask R-CNN 用于图像分割。R-CNN 先用 selective search 生成约 2k 个候选区域,再对每个区域独立提取 CNN 特征做分类,并用回归模型修正边界框。文章还介绍了非极大值抑制和难负样本挖掘等常用技巧。

10月15日周日
  1. Lilian Weng:Lil'Log(RSS)43

    如何学习词嵌入(Word Embedding)

    词嵌入把词和短语表示为维度更低、更稠密的非二值数值向量,以近似词间相似度并揭示隐藏语义关系。学习词嵌入主要有两类依赖上下文的方法:基于计数的无监督方法对全局词共现矩阵做矩阵分解,基于上下文的监督方法则设计预测模型,在预测目标词的同时学到词向量,代表模型为 skip-gram 与 CBOW。

9月28日周四
  1. Lilian Weng:Lil'Log(RSS)31

    用信息论剖析深度学习:Tishby 的信息瓶颈理论

    Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练,将 DNN 视为马尔可夫链,用编码器互信息 I(X;T_i) 与解码器互信息 I(T_i;Y) 构成信息平面刻画各隐藏层。他发现 DNN 训练分为两个阶段:先充分表示输入并最小化泛化误差,再压缩表示、遗忘无关细节,并认为"学习最重要的部分其实是遗忘"。

8月20日周日