Eugene Yan 详解如何生成合成数据用于微调:蒸馏与自我改进两条路线
Eugene Yan 发表长文,系统讲解如何生成和使用合成数据进行预训练、指令微调与偏好微调。文章将方法分为从更强模型蒸馏(如 Unnatural Instructions。
Eugene Yan 发表长文,系统讲解如何生成和使用合成数据进行预训练、指令微调与偏好微调。文章将方法分为从更强模型蒸馏(如 Unnatural Instructions。
Eugene Yan 发布长文,基于约二十篇论文系统讲解如何应用和评估 LLM-as-Judge(LLM 评估器)。
Eugene Yan 整理 2024 年参加多个 ML 会议后的 39 条经验,涵盖机器学习系统构建、生产与规模化、执行协作、面向用户和参会演讲五方面。要点包括尽早投入奖励函数工程、扎实 evals 是差异化和护城河、从 demo 到产品 effort 巨大、每次 10 倍规模增长都会暴露新问题,并引用 Karpathy、Will Larson 等人的观点。
Andrej Karpathy 发布长文讲解强化学习,用 130 行 Python 仅依赖 numpy 的脚本,以 Policy Gradients 从原始像素训练出能在 ATARI Pong 中略胜内置 AI 的 2 层策略网络,约 8000 个 episode、20 万局游戏、800 次参数更新。
ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
针对 GRPO 等 RLVR 方法在 rollout 预算有限时出现全失败组、无梯度信号的问题,研究者提出 GRAFT,用同伴模型的轨迹替换全失败组,并通过序列级兼容性加权和 token 级重要性比裁剪控制跨模型失配。
针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。
针对大语言模型多步推理路径的隐藏状态分析,研究者提出 PAIR(Phase-Aligned Intra-question Reasoning),按归一化轨迹进度将变长路径映射到共享相对相位,只在同一问题、同一相位内比较成功与失败轨迹。
针对仅用交叉熵(CE)监督最终答案、不约束思维过程的训练缺陷,研究者提出 REST(REpresentation-Supervised Thoughts),将因果性、最小性、可分离性与稳定性四项思维表征属性转化为可微损失并叠加到 CE 上。
研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。
DSpine 是一种在骨干网络各层注入相邻因果条件的投机解码 drafter,通过门控相邻注入把前驱预测特征写入后继位置,使因果条件链随网络深度展开而所有位置并行更新。
arXiv 论文 arXiv:2609.36126 测试了使用严格局部连接和异步更新的 Neural Cellular Automata(NCA)在视觉推理任务上的能力,可解大迷宫、数独和 ARC-AGI-1。
Koa-action 是一个面向低延迟原子动作(分类、语义端点检测、布尔判断、打分)的框架,通过引入原子标签 token 与监督微调,把分类变成确定性的单 token 解码。
研究提出 Advantage-Based Control Variates(ABC),通过优势-价值形式重新审视轨迹级控制变量,并揭示其协方差结构与 Direct Advantage Estimation(DAE)的回报分解密切相关。
FluxLite 是一个免训练、轻量的离散扩散模型推理时提议控制框架,通过 q_t 加权图散度项精确补偿稀疏跳跃率扰动,在保持目标路径的同时将残差重加权方差转化为局部凸目标。
研究者对 1,618 个语言模型在 456 个纯文本基准上的 13,251 个公开评测分数做因子分析,发现通用智力因子在最宽松估计下也只解释 70.8% 的性能方差,多数解远低于此。内容相近的基准未必聚类,$g$ 因子不被任何共同主题主导,也缺乏证据表明标准"智力"基准能很好代理它,这使得在语言模型开发中把通用智力当作可单独优化的目标缺乏支持。
研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。
研究者提出在线蒸馏方法 OLIVE,每轮由学生策略生成新前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。在同等 GPU 小时成本下,OLIVE 推理表现优于采用 top-16 KL 近似的 OPD,异步实现进一步将总训练时间缩短 23.8%。仅用 GPT-5.4-mini 的文本持续训练,OLIVE 在 ScienceWorld 上比同一教师的离线 SFT 高出 13%。
研究通过提示和微调为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,发现每个专家的表征都更贴近与其认知域匹配的脑系统,而非其他专家。该结果在三种基础模型和三个 fMRI 数据集上均成立,且非认知与表层干预无法产生同等对齐。模型专门化会改变区域对齐,但总体预测准确率基本不变。
FastGuide 通过并行与自回归解码的自适应混合,加速扩散大语言模型的奖励引导推理,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,同时保持相近生成质量。该方法每个解码步骤只计算一次奖励模型反向传播并复用于多个 token,并借助 KV cache 与稀疏注意力重计算逐次解掩码,对模型不自信的 token 则延后处理。
研究揭示 LLM 在循环概念(月份、小时、星期、音符)组合任务中的分层机制:中间层基于两个 token 的推断关系构建联合表示,后层则使用涉及全部三个 token 的联合表示完成任务。该规律在 Llama、Qwen、Gemma 和 Mistral 上一致成立,且限制模型仅使用因果相关的联合表示反而提升了下一 token 预测准确率。
研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。
研究在四个语言模型和三个事实问答数据集上发现,按答案一致性将幻觉分为高一致(Ghost)与低一致(Flickering)两类后,可检测性差距达 0.35 至 0.46 AUC。
一项研究在 BoolQ、GSM8K 和 Corr2Cause 上追踪 29 个开源权重 LLM 初始答案与修订答案的正确性转移,发现聚合准确率会掩盖截然不同的修订行为:Llama-3.1-8B 在 GSM8K 上提升 25.5 个百分点,同时有 19.1% 原本正确的答案被改错。
Anthropic 的 Transformer Circuits 研究训练了一个 1 层 Transformer,将其分解为 token、位置、特征与 logits 之间的虚拟权重,首次在训练好的 Transformer 中通过测量对训练损失的影响定位出具体干扰权重。
TensorZero 用三个真实任务(CoNLL++ 命名实体识别、terminal-bench 智能体编码、τ-bench retail 客服工具调用)对比 o4-mini 上的 RFT 与 GPT-4.1 mini 的 SFT。
Sarvam AI 于 2026 年 3 月 6 日开源 Sarvam 30B 和 Sarvam 105B 两个从零训练的 MoE 推理模型,训练完全在 IndiaAI 任务的算力上于印度完成,权重可从 AI Kosh 和 Hugging Face 下载。
推荐理由:官方发布开源推理模型,给出完整训练与推理细节和基准对比,可了解印度本土全栈模型的做法。
RadixArk SGLang 团队与 Ant Ling Infra 团队在 4 张 NVIDIA Blackwell GPU 上为混合线性注意力 MoE 模型 Ling-3.0-flash 优化 batch-1 解码,NEXTN/MTP 路径将单请求吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。
推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 推出 LongevityBench,一个覆盖五个生物数据领域的 17 项任务开放基准,并用它评估了来自六个开发团队的 18 个前沿 AI 系统。同期研究还包括 In-Place Tokenizer Expansion,可在不损失质量的前提下将非英文 token 数量最多减少 4 倍。
Z.AI 发布面向智能体工程的新模型 GLM-5.3,沿用与 GLM-5.2 相同的 744B-A40B MoE 底座,能力提升全部来自在更多样真实任务环境上的规模化后训练。
Baseten Base Labs 推出 Inkling 模型,API 中模型标识为 inferact/inkling-nvfp4,返回结果包含 reasoning_content 字段,可输出推理过程。示例请求中 prompt_tokens 为 9、completion_tokens 为 295,其中 reasoning_tokens 占 182。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
Andrej Karpathy 复现 Yann LeCun 等 1989 年的《Backpropagation Applied to Handwritten Zip Code Recognition》,认为这是最早的端到端反向传播神经网络实际应用,代码开源在 karpathy/lecun1989-repro。
Andrej Karpathy 发布艺术项目 microgpt,一个 200 行、零依赖的纯 Python 单文件,包含数据集、tokenizer、autograd 引擎、GPT-2 风格架构、Adam 优化器和训练与推理循环。
推荐理由:Karpathy 用 200 行无依赖纯 Python 完整实现 GPT 训练与推理,并逐段讲解,是理解大语言模型算法本质的入门材料。
Fireworks AI 基于 DeepSWE v1.1 的 113 个任务分析称,按任务选模型的 oracle 路由在 18 个模型上可达 97.6% 通过率、每任务 $1.88,比最佳单模型 GPT-6 Astra(74.1%、$6.52)高 23 分且成本不到三分之一;仅用开源权重模型也能达 90.3%、$1.45。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。
Eugene Yan 用 RQ-VAE 把 Amazon Reviews 2023 游戏品类的 66k 商品编码为语义 ID,再微调 Qwen3-8B,构建一个无需检索、单一模型即可同时理解自然语言和商品 ID 的推荐混合模型。