跳到正文
原文
BAIR:Berkeley AI Research Blog·· 2025-11-01AI 评分47

无需 TD 学习的强化学习:用分治法扩展 off-policy RL

RL without TD learning

AI 导读

伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。

来源:BAIR:Berkeley AI Research Blog · bair.berkeley.edu