New Anthropic research: Natural emergent misalignment from reward hacking in production RL. “Reward hacking” is where models learn to cheat on tasks they’re given during training. Our new study finds that the consequences of reward hacking, if unmitigated, can be very serious.
#数据/训练
#数据/训练
今日 93 条
Ilya Sutskever@ilyasutAI 评分6060引用Anthropic@AnthropicAI
DeepSeek:GitHub 新仓库AI 评分3030 DeepSeek 开源 LPLB:面向 MoE 模型的专家并行负载均衡器
DeepSeek 在 GitHub 发布 LPLB,一个基于线性规划、面向 MoE 模型的专家并行负载均衡器,目前处于早期研究阶段。该仓库未披露参数规模、性能数据或具体可用形式。
BAIR:Berkeley AI Research BlogAI 评分4747 无需 TD 学习的强化学习:用分治法扩展 off-policy RL
伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。
Thinking Machines Lab:官方博客(RSS)精选AI 评分6464 Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
Thinking Machines Lab:官方博客(RSS)AI 评分4545 Thinking Machines Lab 提出模块化流形与流形版 Muon 优化器
Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。
美团 LongCat:HuggingFace 新模型AI 评分6464 美团发布 LongCat-Flash-Thinking 大推理模型,560B 参数 MoE 架构并以 MIT 协议开源
美团发布并开源 LongCat-Flash-Thinking,总参数 560B 的 MoE 大推理模型,按上下文动态激活 18.6B~31.3B(平均约 27B)参数,权重采用 MIT License。
上海人工智能实验室 InternLM:原创项目AI 评分2323 InternLM 推出 AdaptiveGEMM:适配多种 Group M 长度的 FP8 GEMM
上海人工智能实验室 InternLM 项目发布 AdaptiveGEMM,一种可适配不同 Group M 长度的 FP8 GEMM 实现。该工作针对分组矩阵乘法中 Group M 长度多变的情况做自适应处理,属于底层算子层面的优化。
BAIR:Berkeley AI Research BlogAI 评分5050 word2vec 究竟学到了什么?BAIR 给出闭式学习理论
BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。
Mistral AI:News(网页)精选AI 评分6161 Mistral AI 发布 Mistral Large 2 全生命周期环境影响分析
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),并经 Resilio 和 Hubblo 同行评审。
推荐理由:原文给出了 Mistral Large 2 全生命周期的具体碳、水和资源消耗数字,并说明其对选型与采购的意义。
OpenAI Developers(RSS)AI 评分1717 OpenAI DevDay 蒸馏专场:模型蒸馏策略解析
OpenAI DevDay 举办蒸馏(distillation)专题活动,讨论高效蒸馏模型的策略。内容聚焦蒸馏方法本身,未披露具体模型、参数规模或基准数据。
上海人工智能实验室 InternLM:原创项目AI 评分3535 InternLM 推出 POLAR:基于策略判别学习的预训练可扩展高性能奖励模型
上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。
DeepSeek:GitHub 新仓库AI 评分4242 DeepSeek 开源双向流水线并行算法 DualPipe,用于 V3/R1 训练
DeepSeek 在 GitHub 开源双向流水线并行算法 DualPipe,用于 DeepSeek V3/R1 训练中的计算与通信重叠。该算法通过双向流水线调度实现计算与通信的 overlap,仓库路径为 deepseek-ai/DualPipe。
DeepSeek:GitHub 新仓库AI 评分3939 DeepSeek 开源 profile-data:分析 V3/R1 计算通信重叠
DeepSeek 在 GitHub 新建 profile-data 仓库,用于分析 V3/R1 的计算通信重叠。该仓库聚焦计算与通信过程的 overlap 分析,目前仅给出这一句说明,未披露具体方法、数据或工具细节。
DeepSeek:GitHub 新仓库AI 评分4747 DeepSeek 开源 smallpond:基于 DuckDB 和 3FS 的轻量数据处理框架
DeepSeek 在 GitHub 开源了轻量数据处理框架 smallpond,构建于 DuckDB 和 3FS 之上。该框架定位为轻量级数据处理方案,目前仓库未披露更多参数与性能细节。
Lilian Weng:Lil'Log(RSS)AI 评分5151 Lilian Weng 长文解析强化学习中的奖励劫持现象
Lilian Weng 发表长文《Reward Hacking in Reinforcement Learning》,系统讲解 RL 智能体利用奖励函数缺陷获取高奖励却不完成预期任务的现象。
Lilian Weng:Lil'Log(RSS)精选AI 评分6363 Lilian Weng 长文解读大语言模型的外在幻觉:成因、检测与缓解方法
Lilian Weng 在 Lil'Log 发表长文,将幻觉聚焦于外在幻觉,即模型输出未被提供的上下文或世界知识支持、编造且不可验证的内容。文章梳理幻觉成因,包括预训练数据中的过时或错误信息,以及微调引入新知识会加剧幻觉(Gekhman et al. 2024 发现模型学会 Unknown 样本后更易幻觉)。
推荐理由:Lilian Weng 系统梳理大语言模型外在幻觉的成因、检测基准与缓解方法,覆盖 RAG、采样、微调等技术路线。
Lilian Weng:Lil'Log(RSS)AI 评分5252 Lilian Weng 撰文探讨高质量人工标注数据的收集与质量控制
Lilian Weng 发布长文《Thinking about High-Quality Human Data》,梳理高质量人工标注数据的两个方向:数据收集操作步骤与质量保证。
Lilian Weng:Lil'Log(RSS)AI 评分5555 Lilian Weng 长文解析 LLM 的对抗攻击:从梯度攻击到越狱提示与红队
Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。
Lilian Weng:Lil'Log(RSS)AI 评分5252 Lilian Weng 更新 The Transformer Family 2.0:系统梳理 Transformer 架构改进
Lilian Weng 在 Lil'Log 发布 The Transformer Family 2.0,对三年前的旧版综述做了大幅重构和扩充,篇幅约为旧版两倍。
Lilian Weng:Lil'Log(RSS)AI 评分5252 Lilian Weng:数据不足时的学习(三)数据生成
Lilian Weng 发布系列博客第三篇,介绍训练数据不足时的两类数据生成思路:对已有样本做增强,以及用预训练大语言模型合成新数据。
Lilian Weng:Lil'Log(RSS)AI 评分4444 数据不足时如何学习(下):主动学习
面对标注数据有限的有监督任务,主动学习在固定标注预算 B 下从无标注数据集中挑选最有价值的样本交给人工标注,以最大化模型性能提升。文章梳理了不确定性采样(最小置信度、margin、熵)、Query-By-Committee 以及多样性采样等采样策略,并区分了数据噪声带来的偶然不确定性与模型参数导致的可认知不确定性。
Lilian Weng:Lil'Log(RSS)AI 评分4949 数据不足时如何学习(一):半监督学习
Lil'Log 发布“Learning with not Enough Data”系列第一篇,聚焦半监督学习,即同时利用有标注和无标注数据训练模型。文章梳理了平滑性、聚类、低密度分离与流形四种假设,并介绍一致性正则化方法,如 Π-model 等,指出该领域研究多集中于视觉任务,语言任务更常用预训练加微调范式。
Lilian Weng:Lil'Log(RSS)AI 评分5252 Lilian Weng 长文解读如何在多 GPU 上训练超大模型
Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。
Lilian Weng:Lil'Log(RSS)AI 评分4646 对比表示学习(Contrastive Representation Learning)综述
对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对彼此远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。文章梳理了对比损失、Triplet Loss、Lifted Structured Loss、N-pair Loss 和 NCE 等训练目标,指出近期趋势是在一个 batch 中纳入多组正负样本对。
Lilian Weng:Lil'Log(RSS)精选AI 评分7070 Lilian Weng 长文解读可控神经文本生成的主要方法
Lilian Weng 在 Lil'Log 发表长文,系统梳理如何引导无条件预训练语言模型生成可控内容,涵盖解码策略(温度采样、top-k、nucleus sampling。
推荐理由:文章系统梳理了在不改动语言模型权重与微调两条路线下的主要可控文本生成方法,并给出各自优劣与适用场景。
Lilian Weng:Lil'Log(RSS)AI 评分3737 神经架构搜索(NAS)综述:搜索空间、搜索算法与评估策略
神经架构搜索(NAS)通过自动学习高性能网络拓扑,由搜索空间、搜索算法和评估策略三大组件构成。搜索空间从早期的逐层序列化表示发展到 NASNet 的 cell 重复堆叠结构,后者支持跨数据集迁移并可通过调整 cell 重复次数缩放模型。Zoph & Le 2017 的实验曾用 800 块 GPU 并行运行 28 天,NASNet 还提出 ScheduledDropPath 显著提升最终性能。
Lilian Weng:Lil'Log(RSS)AI 评分3030 强化学习中的课程学习(Curriculum Learning)综述
Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。
Lilian Weng:Lil'Log(RSS)AI 评分5858 Lilian Weng 长文解读自监督表征学习
Lilian Weng 在 Lil'Log 发表关于自监督表征学习的综述,核心思想是利用数据自带的信息构造 pretext task,从而在无标注数据上以监督方式训练,目标是学到可迁移到下游任务的中间表征而非任务本身的准确率。
Lilian Weng:Lil'Log(RSS)AI 评分5050 进化策略(Evolution Strategies)详解
Lilian Weng 在 Lil'Log 发文详解进化策略(ES)这类黑盒优化算法,目标为实数向量 x ∈ ℝⁿ。文章介绍了最基础的 Simple Gaussian ES,以及通过协方差矩阵 C 追踪样本间依赖关系、解决探索空间无法快速调整问题的 CMA-ES。
Lilian Weng:Lil'Log(RSS)AI 评分3838 域随机化如何实现 Sim2Real 迁移
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。
Lilian Weng:Lil'Log(RSS)AI 评分4040 深度神经网络真的严重过拟合了吗?
深度神经网络参数量巨大却仍能泛化,Lilian Weng 从压缩与模型选择角度梳理了相关理论。文章讨论了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度,并补充了 Lottery Ticket Hypothesis 一节。
Lilian Weng:Lil'Log(RSS)AI 评分5757 Lilian Weng 长文解读广义语言模型:从 CoVe、ELMo 到 GPT-3 与 ELECTRA
Lilian Weng 在 Lil'Log 发表长文,系统梳理上下文相关词向量与预训练语言模型的方法演进。
Lilian Weng:Lil'Log(RSS)AI 评分4949 Meta-Learning 元学习:如何让模型学会快速学习
Meta-Learning(元学习)旨在让模型仅凭少量训练样本就能快速学习新概念与新任务,因此也被称为"learning to learn"。其核心做法是在多种学习任务上训练模型,使每个数据集被视为一个数据样本,从而优化模型在任务分布上的表现,包括训练时未见过的新任务。
Lilian Weng:Lil'Log(RSS)AI 评分4545 基于流的深度生成模型:Normalizing Flows 如何显式建模数据分布
基于流的深度生成模型通过一系列可逆变换构建,借助 normalizing flows 显式学习数据分布 p(x),损失函数即负对数似然,从而绕开 GAN 与 VAE 难以计算概率密度的问题。与 GAN 的对抗博弈和 VAE 优化 ELBO 不同,该模型依赖 Jacobian 行列式与变量变换定理完成密度估计,可用于数据生成、密度估计、隐变量推断和补全不完整样本。
Sam Altman:Blog(RSS)AI 评分7575 Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手
OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。
Lilian Weng:Lil'Log(RSS)AI 评分5050 策略梯度算法综述:从 REINFORCE 到 SAC、TD3 与 IMPALA
Lilian Weng 在 Lil'Log 发布《Policy Gradient Algorithms》综述,系统梳理策略梯度方法,并陆续补充 SAC、D4PG、TD3、SVPG、IMPALA、PPG 等新算法及 SAC 自动温度调整。
Lilian Weng:Lil'Log(RSS)AI 评分4747 R-CNN 家族目标检测模型详解:R-CNN、Fast R-CNN、Faster R-CNN 与 Mask R-CNN
R-CNN 家族包含 R-CNN、Fast R-CNN、Faster R-CNN 和 Mask R-CNN 四个模型,前三个用于目标识别,Mask R-CNN 用于图像分割。R-CNN 先用 selective search 生成约 2k 个候选区域,再对每个区域独立提取 CNN 特征做分类,并用回归模型修正边界框。文章还介绍了非极大值抑制和难负样本挖掘等常用技巧。
Lilian Weng:Lil'Log(RSS)AI 评分4343 如何学习词嵌入(Word Embedding)
词嵌入把词和短语表示为维度更低、更稠密的非二值数值向量,以近似词间相似度并揭示隐藏语义关系。学习词嵌入主要有两类依赖上下文的方法:基于计数的无监督方法对全局词共现矩阵做矩阵分解,基于上下文的监督方法则设计预测模型,在预测目标词的同时学到词向量,代表模型为 skip-gram 与 CBOW。
Lilian Weng:Lil'Log(RSS)AI 评分3131 用信息论剖析深度学习:Tishby 的信息瓶颈理论
Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练,将 DNN 视为马尔可夫链,用编码器互信息 I(X;T_i) 与解码器互信息 I(T_i;Y) 构成信息平面刻画各隐藏层。他发现 DNN 训练分为两个阶段:先充分表示输入并最小化泛化误差,再压缩表示、遗忘无关细节,并认为"学习最重要的部分其实是遗忘"。
Lilian Weng:Lil'Log(RSS)AI 评分4343 从 GAN 到 WGAN:生成对抗网络的数学原理与训练难题
生成对抗网络(GAN)由生成器和判别器构成零和博弈,但存在训练不稳定、难以收敛的问题。文章从 KL 散度与 JS 散度出发推导 GAN 的 minimax 损失函数,指出判别器最优值为 p_r/(p_r+p_g),并介绍为解决训练困难而提出的改进版本 WGAN。