跳到正文

#数据/训练

今日 31 条
1月2日周六
8月6日周四
  1. Lilian Weng:Lil'Log(RSS)37

    神经架构搜索(NAS)综述:搜索空间、搜索算法与评估策略

    神经架构搜索(NAS)通过自动学习高性能网络拓扑,由搜索空间、搜索算法和评估策略三大组件构成。搜索空间从早期的逐层序列化表示发展到 NASNet 的 cell 重复堆叠结构,后者支持跨数据集迁移并可通过调整 cell 重复次数缩放模型。Zoph & Le 2017 的实验曾用 800 块 GPU 并行运行 28 天,NASNet 还提出 ScheduledDropPath 显著提升最终性能。

1月29日周三
  1. Lilian Weng:Lil'Log(RSS)30

    强化学习中的课程学习(Curriculum Learning)综述

    Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。

11月10日周日
9月5日周四
  1. Lilian Weng:Lil'Log(RSS)50

    进化策略(Evolution Strategies)详解

    Lilian Weng 在 Lil'Log 发文详解进化策略(ES)这类黑盒优化算法,目标为实数向量 x ∈ ℝⁿ。文章介绍了最基础的 Simple Gaussian ES,以及通过协方差矩阵 C 追踪样本间依赖关系、解决探索空间无法快速调整问题的 CMA-ES。

5月5日周日
  1. Lilian Weng:Lil'Log(RSS)38

    域随机化如何实现 Sim2Real 迁移

    域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。

3月14日周四
1月31日周四
11月30日周五
  1. Lilian Weng:Lil'Log(RSS)49

    Meta-Learning 元学习:如何让模型学会快速学习

    Meta-Learning(元学习)旨在让模型仅凭少量训练样本就能快速学习新概念与新任务,因此也被称为"learning to learn"。其核心做法是在多种学习任务上训练模型,使每个数据集被视为一个数据样本,从而优化模型在任务分布上的表现,包括训练时未见过的新任务。

10月13日周六
  1. Lilian Weng:Lil'Log(RSS)45

    基于流的深度生成模型:Normalizing Flows 如何显式建模数据分布

    基于流的深度生成模型通过一系列可逆变换构建,借助 normalizing flows 显式学习数据分布 p(x),损失函数即负对数似然,从而绕开 GAN 与 VAE 难以计算概率密度的问题。与 GAN 的对抗博弈和 VAE 优化 ELBO 不同,该模型依赖 Jacobian 行列式与变量变换定理完成密度估计,可用于数据生成、密度估计、隐变量推断和补全不完整样本。

6月26日周二
  1. Sam Altman:Blog(RSS)75

    Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手

    OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。

4月8日周日
12月31日周日
  1. Lilian Weng:Lil'Log(RSS)47

    R-CNN 家族目标检测模型详解:R-CNN、Fast R-CNN、Faster R-CNN 与 Mask R-CNN

    R-CNN 家族包含 R-CNN、Fast R-CNN、Faster R-CNN 和 Mask R-CNN 四个模型,前三个用于目标识别,Mask R-CNN 用于图像分割。R-CNN 先用 selective search 生成约 2k 个候选区域,再对每个区域独立提取 CNN 特征做分类,并用回归模型修正边界框。文章还介绍了非极大值抑制和难负样本挖掘等常用技巧。

10月15日周日
  1. Lilian Weng:Lil'Log(RSS)43

    如何学习词嵌入(Word Embedding)

    词嵌入把词和短语表示为维度更低、更稠密的非二值数值向量,以近似词间相似度并揭示隐藏语义关系。学习词嵌入主要有两类依赖上下文的方法:基于计数的无监督方法对全局词共现矩阵做矩阵分解,基于上下文的监督方法则设计预测模型,在预测目标词的同时学到词向量,代表模型为 skip-gram 与 CBOW。

9月28日周四
  1. Lilian Weng:Lil'Log(RSS)31

    用信息论剖析深度学习:Tishby 的信息瓶颈理论

    Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练,将 DNN 视为马尔可夫链,用编码器互信息 I(X;T_i) 与解码器互信息 I(T_i;Y) 构成信息平面刻画各隐藏层。他发现 DNN 训练分为两个阶段:先充分表示输入并最小化泛化误差,再压缩表示、遗忘无关细节,并认为"学习最重要的部分其实是遗忘"。

8月20日周日
7月22日周六
  1. Lilian Weng:Lil'Log(RSS)35

    用 RNN 预测股票价格(第二部分):引入股票代码嵌入

    在 RNN 股票价格预测教程第二部分中,作者为第一部分搭建的循环神经网络加入股票代码嵌入向量,使其能同时处理多只股票。模型将股票代码映射为长度为 3 的嵌入向量,与每日价格输入拼接后送入 LSTM,替代 one-hot 编码以压缩表示并让相似股票共享模式。新增 embedding_size 和 stock_count 两个配置项,数据来自 Google Finance 历史股价。

6月21日周三
  1. Lilian Weng:Lil'Log(RSS)33

    面向好奇者的深度学习概览

    Lilian Weng 在 WiMLDS x Fintech meetup 的演讲整理稿中,以 2016 年 AlphaGo 4-1 击败李世石为引,梳理了深度学习的原理与经典模型。文章指出深度学习如今奏效的关键在于数据规模大幅增长与算力显著提升,并介绍了 CNN、RNN 等模型,其中 CNN 的神经元连接方式受视觉皮层启发。