跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 41–46 条 · 共 46 条
10月27日周一
  1. Thinking Machines Lab:官方博客(RSS)64

    Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果

    Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。

    推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。

9月24日周三
7月23日周三
7月29日周一
  1. Hamel Husain 长文(网页)77

    Hamel Husain 发布免费开放课程 Mastering LLMs

    Hamel Husain 等人发布免费开放课程 Mastering LLMs,整理自此前付费课程的讲座,由 25 位以上业界从业者讲授,涵盖 evals、RAG、微调、应用构建和提示词工程等主题。课程超过 40 小时,面向有一定 LLM 经验的工程师和数据科学家,提供章节摘要、笔记、幻灯片和资源,帮助读者按主题跳读和学习。

    推荐理由:作者本人组织并公开了原本付费的课程内容,覆盖 evals、RAG、微调等主题,读者可按需跳读感兴趣的章节。

7月7日周日
  1. Lilian Weng:Lil'Log(RSS)63

    Lilian Weng 长文解读大语言模型的外在幻觉:成因、检测与缓解方法

    Lilian Weng 在 Lil'Log 发表长文,将幻觉聚焦于外在幻觉,即模型输出未被提供的上下文或世界知识支持、编造且不可验证的内容。文章梳理幻觉成因,包括预训练数据中的过时或错误信息,以及微调引入新知识会加剧幻觉(Gekhman et al. 2024 发现模型学会 Unknown 样本后更易幻觉)。

    推荐理由:Lilian Weng 系统梳理大语言模型外在幻觉的成因、检测基准与缓解方法,覆盖 RAG、采样、微调等技术路线。

1月2日周六