Lilian Weng 长文解读可控神经文本生成的主要方法
Lilian Weng 在 Lil'Log 发表长文,系统梳理如何引导无条件预训练语言模型生成可控内容,涵盖解码策略(温度采样、top-k、nucleus sampling。
推荐理由:文章系统梳理了在不改动语言模型权重与微调两条路线下的主要可控文本生成方法,并给出各自优劣与适用场景。
Lilian Weng 在 Lil'Log 发表长文,系统梳理如何引导无条件预训练语言模型生成可控内容,涵盖解码策略(温度采样、top-k、nucleus sampling。
推荐理由:文章系统梳理了在不改动语言模型权重与微调两条路线下的主要可控文本生成方法,并给出各自优劣与适用场景。
神经架构搜索(NAS)通过自动学习高性能网络拓扑,由搜索空间、搜索算法和评估策略三大组件构成。搜索空间从早期的逐层序列化表示发展到 NASNet 的 cell 重复堆叠结构,后者支持跨数据集迁移并可通过调整 cell 重复次数缩放模型。Zoph & Le 2017 的实验曾用 800 块 GPU 并行运行 28 天,NASNet 还提出 ScheduledDropPath 显著提升最终性能。
Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。
Lilian Weng 在 Lil'Log 发表关于自监督表征学习的综述,核心思想是利用数据自带的信息构造 pretext task,从而在无标注数据上以监督方式训练,目标是学到可迁移到下游任务的中间表征而非任务本身的准确率。
Lilian Weng 在 Lil'Log 发文详解进化策略(ES)这类黑盒优化算法,目标为实数向量 x ∈ ℝⁿ。文章介绍了最基础的 Simple Gaussian ES,以及通过协方差矩阵 C 追踪样本间依赖关系、解决探索空间无法快速调整问题的 CMA-ES。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。
深度神经网络参数量巨大却仍能泛化,Lilian Weng 从压缩与模型选择角度梳理了相关理论。文章讨论了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度,并补充了 Lottery Ticket Hypothesis 一节。
Lilian Weng 在 Lil'Log 发表长文,系统梳理上下文相关词向量与预训练语言模型的方法演进。
Meta-Learning(元学习)旨在让模型仅凭少量训练样本就能快速学习新概念与新任务,因此也被称为"learning to learn"。其核心做法是在多种学习任务上训练模型,使每个数据集被视为一个数据样本,从而优化模型在任务分布上的表现,包括训练时未见过的新任务。
基于流的深度生成模型通过一系列可逆变换构建,借助 normalizing flows 显式学习数据分布 p(x),损失函数即负对数似然,从而绕开 GAN 与 VAE 难以计算概率密度的问题。与 GAN 的对抗博弈和 VAE 优化 ELBO 不同,该模型依赖 Jacobian 行列式与变量变换定理完成密度估计,可用于数据生成、密度估计、隐变量推断和补全不完整样本。
OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。
Lilian Weng 在 Lil'Log 发布《Policy Gradient Algorithms》综述,系统梳理策略梯度方法,并陆续补充 SAC、D4PG、TD3、SVPG、IMPALA、PPG 等新算法及 SAC 自动温度调整。
R-CNN 家族包含 R-CNN、Fast R-CNN、Faster R-CNN 和 Mask R-CNN 四个模型,前三个用于目标识别,Mask R-CNN 用于图像分割。R-CNN 先用 selective search 生成约 2k 个候选区域,再对每个区域独立提取 CNN 特征做分类,并用回归模型修正边界框。文章还介绍了非极大值抑制和难负样本挖掘等常用技巧。
词嵌入把词和短语表示为维度更低、更稠密的非二值数值向量,以近似词间相似度并揭示隐藏语义关系。学习词嵌入主要有两类依赖上下文的方法:基于计数的无监督方法对全局词共现矩阵做矩阵分解,基于上下文的监督方法则设计预测模型,在预测目标词的同时学到词向量,代表模型为 skip-gram 与 CBOW。
Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练,将 DNN 视为马尔可夫链,用编码器互信息 I(X;T_i) 与解码器互信息 I(T_i;Y) 构成信息平面刻画各隐藏层。他发现 DNN 训练分为两个阶段:先充分表示输入并最小化泛化误差,再压缩表示、遗忘无关细节,并认为"学习最重要的部分其实是遗忘"。
生成对抗网络(GAN)由生成器和判别器构成零和博弈,但存在训练不稳定、难以收敛的问题。文章从 KL 散度与 JS 散度出发推导 GAN 的 minimax 损失函数,指出判别器最优值为 p_r/(p_r+p_g),并介绍为解决训练困难而提出的改进版本 WGAN。
在 RNN 股票价格预测教程第二部分中,作者为第一部分搭建的循环神经网络加入股票代码嵌入向量,使其能同时处理多只股票。模型将股票代码映射为长度为 3 的嵌入向量,与每日价格输入拼接后送入 LSTM,替代 one-hot 编码以压缩表示并让相似股票共享模式。新增 embedding_size 和 stock_count 两个配置项,数据来自 Google Finance 历史股价。
Lilian Weng 在 WiMLDS x Fintech meetup 的演讲整理稿中,以 2016 年 AlphaGo 4-1 击败李世石为引,梳理了深度学习的原理与经典模型。文章指出深度学习如今奏效的关键在于数据规模大幅增长与算力显著提升,并介绍了 CNN、RNN 等模型,其中 CNN 的神经元连接方式受视觉皮层启发。