跳到正文

#教程/实践

今日 38 条
7月18日周五
6月9日周一
5月5日周一
5月1日周四
4月9日周三
3月17日周一
3月4日周二
12月10日周二
7月7日周日
  1. Lilian Weng:Lil'Log(RSS)63

    Lilian Weng 长文解读大语言模型的外在幻觉:成因、检测与缓解方法

    Lilian Weng 在 Lil'Log 发表长文,将幻觉聚焦于外在幻觉,即模型输出未被提供的上下文或世界知识支持、编造且不可验证的内容。文章梳理幻觉成因,包括预训练数据中的过时或错误信息,以及微调引入新知识会加剧幻觉(Gekhman et al. 2024 发现模型学会 Unknown 样本后更易幻觉)。

    推荐理由:Lilian Weng 系统梳理大语言模型外在幻觉的成因、检测基准与缓解方法,覆盖 RAG、采样、微调等技术路线。

4月12日周五
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文综述扩散模型在视频生成中的应用

    Lilian Weng 在 Lil'Log 发布长文,系统梳理扩散模型用于视频生成的方法。文章先讲从零训练的参数化、采样与 3D U-Net、DiT 架构(如 VDM、Imagen Video、Sora),再讲如何改造预训练图像模型生成视频(Make-A-Video、Video LDM、SVD、Lumiere),最后介绍 Text2Video-Zero、ControlVideo 等免训练适配方法。

2月5日周一
6月23日周五
  1. Lilian Weng:Lil'Log(RSS)80

    Lilian Weng 长文解析 LLM 驱动的自主智能体系统

    Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。

    推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。

3月15日周三
1月27日周五
1月11日周三
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读大型 Transformer 模型的推理优化方法

    Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。

9月9日周五
  1. Lilian Weng:Lil'Log(RSS)43

    神经网络切线核(NTK)背后的数学原理详解

    神经网络切线核(NTK)是一种通过梯度下降解释神经网络训练演化过程的核方法,可说明足够宽的神经网络在最小化经验损失时为何能稳定收敛到全局最小值。该文深入剖析 NTK 的动机与定义,并证明无限宽神经网络在不同初始化下均能确定性收敛。

6月10日周五
  1. Lilian Weng:Lil'Log(RSS)64

    Lilian Weng 综述广义视觉语言模型(VLM)的四类实现路径

    Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。

    推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。

4月16日周六
2月20日周日
  1. Lilian Weng:Lil'Log(RSS)44

    数据不足时如何学习(下):主动学习

    面对标注数据有限的有监督任务,主动学习在固定标注预算 B 下从无标注数据集中挑选最有价值的样本交给人工标注,以最大化模型性能提升。文章梳理了不确定性采样(最小置信度、margin、熵)、Query-By-Committee 以及多样性采样等采样策略,并区分了数据噪声带来的偶然不确定性与模型参数导致的可认知不确定性。

12月5日周日
  1. Lilian Weng:Lil'Log(RSS)49

    数据不足时如何学习(一):半监督学习

    Lil'Log 发布“Learning with not Enough Data”系列第一篇,聚焦半监督学习,即同时利用有标注和无标注数据训练模型。文章梳理了平滑性、聚类、低密度分离与流形四种假设,并介绍一致性正则化方法,如 Π-model 等,指出该领域研究多集中于视觉任务,语言任务更常用预训练加微调范式。

9月24日周五
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读如何在多 GPU 上训练超大模型

    Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。

7月11日周日
  1. Lilian Weng:Lil'Log(RSS)75

    Lilian Weng 详解扩散模型:从 DDPM 原理到 DDIM、LDM、DiT 的演进

    Lilian Weng 在 Lil'Log 发表的长文系统讲解扩散模型:通过马尔可夫链逐步加噪再学习反向去噪来生成数据,涵盖 DDPM 的变分下界训练目标、与 NCSN 的联系、β 调度与方差参数化等核心内容。

    推荐理由:作者原创长文系统讲解扩散模型,从 DDPM 前反向过程到 DDIM、LDM、DiT 等演进,兼顾数学推导与方法脉络。

5月31日周一
  1. Lilian Weng:Lil'Log(RSS)46

    对比表示学习(Contrastive Representation Learning)综述

    对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对彼此远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。文章梳理了对比损失、Triplet Loss、Lifted Structured Loss、N-pair Loss 和 NCE 等训练目标,指出近期趋势是在一个 batch 中纳入多组正负样本对。

3月21日周日
  1. Lilian Weng:Lil'Log(RSS)47

    如何降低语言模型的有害输出

    大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程施加强控制。Lilian Weng 在文中梳理了有害内容的定义分歧、Zampieri 等人提出的三级攻击性语言分类体系(OLID 数据集),以及专家标注、众包、专业审核员和合成数据四类毒性检测数据收集方式。

1月2日周六
10月29日周四
8月6日周四
  1. Lilian Weng:Lil'Log(RSS)37

    神经架构搜索(NAS)综述:搜索空间、搜索算法与评估策略

    神经架构搜索(NAS)通过自动学习高性能网络拓扑,由搜索空间、搜索算法和评估策略三大组件构成。搜索空间从早期的逐层序列化表示发展到 NASNet 的 cell 重复堆叠结构,后者支持跨数据集迁移并可通过调整 cell 重复次数缩放模型。Zoph & Le 2017 的实验曾用 800 块 GPU 并行运行 28 天,NASNet 还提出 ScheduledDropPath 显著提升最终性能。

6月7日周日
  1. Lilian Weng:Lil'Log(RSS)41

    深度强化学习中的探索策略

    深度强化学习中的探索策略综述,涵盖 epsilon-greedy、UCB、Boltzmann 探索、Thompson sampling 等经典方法,以及熵损失项和基于噪声的探索。文章重点讨论 hard-exploration 与 Noisy-TV 两大难题,并介绍以内在奖励作为探索奖励的思路,包括基于计数的探索与密度模型伪计数方法。

4月7日周二
1月29日周三
  1. Lilian Weng:Lil'Log(RSS)30

    强化学习中的课程学习(Curriculum Learning)综述

    Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。

11月10日周日
9月5日周四
  1. Lilian Weng:Lil'Log(RSS)50

    进化策略(Evolution Strategies)详解

    Lilian Weng 在 Lil'Log 发文详解进化策略(ES)这类黑盒优化算法,目标为实数向量 x ∈ ℝⁿ。文章介绍了最基础的 Simple Gaussian ES,以及通过协方差矩阵 C 追踪样本间依赖关系、解决探索空间无法快速调整问题的 CMA-ES。

6月23日周日
  1. Lilian Weng:Lil'Log(RSS)38

    Meta Reinforcement Learning:元强化学习综述

    元强化学习(Meta-RL)是在强化学习领域做元学习,训练时在一批 MDP 上学习、测试时快速适应新任务,Wang et al. (2016) 与 Duan et al. (2017) 的 RL² 同时提出这一思路。与普通 RL 不同,策略观测除当前状态 s_t 外还加入上一动作 a_{t-1} 与上一奖励 r_{t-1},并采用 LSTM 策略以隐状态记忆轨迹特征。

5月5日周日
  1. Lilian Weng:Lil'Log(RSS)38

    域随机化如何实现 Sim2Real 迁移

    域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。

1月31日周四
12月27日周四
11月30日周五
  1. Lilian Weng:Lil'Log(RSS)49

    Meta-Learning 元学习:如何让模型学会快速学习

    Meta-Learning(元学习)旨在让模型仅凭少量训练样本就能快速学习新概念与新任务,因此也被称为"learning to learn"。其核心做法是在多种学习任务上训练模型,使每个数据集被视为一个数据样本,从而优化模型在任务分布上的表现,包括训练时未见过的新任务。