跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2020-06-07AI 评分41

深度强化学习中的探索策略

Exploration Strategies in Deep Reinforcement Learning

AI 导读

深度强化学习中的探索策略综述,涵盖 epsilon-greedy、UCB、Boltzmann 探索、Thompson sampling 等经典方法,以及熵损失项和基于噪声的探索。文章重点讨论 hard-exploration 与 Noisy-TV 两大难题,并介绍以内在奖励作为探索奖励的思路,包括基于计数的探索与密度模型伪计数方法。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io