跳到正文

#推理

今日 30 条
7月21日周一
6月11日周三
  1. Sam Altman:Blog(RSS)54

    Sam Altman 发文《温和的奇点》:人类已越过事件视界

    Sam Altman 发文称技术起飞已经开始,人类接近构建数字超级智能,且过程比想象中平缓。他判断 2025 年出现能完成真实认知工作的 Agent,2026 年可能产生能发现新洞见的系统,2027 年可能出现能在现实世界执行任务的机器人;科学家用 AI 后生产力提升两到三倍,ChatGPT 平均每次查询耗电约 0.34 瓦时、用水约 0.000085 加仑。

6月10日周二
5月1日周四
4月26日周六
12月19日周四
10月25日周三
6月23日周五
  1. Lilian Weng:Lil'Log(RSS)80

    Lilian Weng 长文解析 LLM 驱动的自主智能体系统

    Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。

    推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。

3月15日周三
1月27日周五
1月11日周三
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读大型 Transformer 模型的推理优化方法

    Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。

9月9日周五
  1. Lilian Weng:Lil'Log(RSS)43

    神经网络切线核(NTK)背后的数学原理详解

    神经网络切线核(NTK)是一种通过梯度下降解释神经网络训练演化过程的核方法,可说明足够宽的神经网络在最小化经验损失时为何能稳定收敛到全局最小值。该文深入剖析 NTK 的动机与定义,并证明无限宽神经网络在不同初始化下均能确定性收敛。

1月2日周六
10月29日周四
6月7日周日
  1. Lilian Weng:Lil'Log(RSS)41

    深度强化学习中的探索策略

    深度强化学习中的探索策略综述,涵盖 epsilon-greedy、UCB、Boltzmann 探索、Thompson sampling 等经典方法,以及熵损失项和基于噪声的探索。文章重点讨论 hard-exploration 与 Noisy-TV 两大难题,并介绍以内在奖励作为探索奖励的思路,包括基于计数的探索与密度模型伪计数方法。

4月7日周二
1月29日周三
  1. Lilian Weng:Lil'Log(RSS)30

    强化学习中的课程学习(Curriculum Learning)综述

    Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。

6月23日周日
  1. Lilian Weng:Lil'Log(RSS)38

    Meta Reinforcement Learning:元强化学习综述

    元强化学习(Meta-RL)是在强化学习领域做元学习,训练时在一批 MDP 上学习、测试时快速适应新任务,Wang et al. (2016) 与 Duan et al. (2017) 的 RL² 同时提出这一思路。与普通 RL 不同,策略观测除当前状态 s_t 外还加入上一动作 a_{t-1} 与上一奖励 r_{t-1},并采用 LSTM 策略以隐状态记忆轨迹特征。

6月24日周日
  1. Lilian Weng:Lil'Log(RSS)66

    Lilian Weng 长文解读深度学习中的注意力机制:从 Seq2Seq 到 Transformer 与 Self-Attention GAN

    Lilian Weng 在 Lil'Log 发表注意力机制综述教程,从 seq2seq 的定长上下文向量缺陷讲起,解释注意力如何解决长句遗忘问题,并给出 Content-base、Additive、Scaled Dot-Product 等多种对齐分数函数的汇总表。

    推荐理由:原文系统梳理了注意力机制从 seq2seq 到 Transformer 的各种形式与对齐分数函数,适合作为理解后续模型架构的基础参考。

2月19日周一
  1. Lilian Weng:Lil'Log(RSS)62

    Lilian Weng 长文梳理强化学习核心概念与经典算法

    Lilian Weng 在 Lil'Log 发布强化学习综述教程,从智能体与环境交互的基本概念讲起,覆盖 MDP、Bellman 方程、动态规划、蒙特卡洛方法。

    推荐理由:文章系统梳理了强化学习的核心概念与经典算法,从动态规划到策略梯度再到 AlphaGo Zero,适合作为入门起点。

1月23日周二
  1. Lilian Weng:Lil'Log(RSS)49

    多臂老虎机问题及其解法

    多臂老虎机问题刻画了探索与利用的两难:面对 K 台奖励概率未知的老虎机,需在有限信息下最大化累计奖励。文章给出 Bernoulli 多臂老虎机的形式化定义与 regret 损失函数,并介绍 ε-Greedy 与 Upper Confidence Bounds(UCB)两类策略,代码实现见 lilianweng/multi-armed-bandit。

8月1日周二
  1. Lilian Weng:Lil'Log(RSS)59

    Lilian Weng 撰文讲解如何解释机器学习模型的预测

    Lilian Weng 在 Lil'Log 发表综述文章,讲解如何解释机器学习模型的预测。文章从金融、医疗、司法等场景对模型可信度的需求出发,先介绍线性回归、朴素贝叶斯、决策列表、随机森林等自带可解释性的模型,再讲解预测分解、局部梯度解释向量和 LIME 等黑盒模型局部解释方法,并概述 BETA 和 DARPA 的可解释 AI(XAI)项目等全局解释方向。