跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2018-04-08AI 评分50

策略梯度算法综述:从 REINFORCE 到 SAC、TD3 与 IMPALA

Policy Gradient Algorithms

AI 导读

Lilian Weng 在 Lil'Log 发布《Policy Gradient Algorithms》综述,系统梳理策略梯度方法,并陆续补充 SAC、D4PG、TD3、SVPG、IMPALA、PPG 等新算法及 SAC 自动温度调整。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io