Lilian Weng:Lil'Log(RSS)·· 2024-11-28AI 评分51
Lilian Weng 长文解析强化学习中的奖励劫持现象
Reward Hacking in Reinforcement Learning
AI 导读
Lilian Weng 发表长文《Reward Hacking in Reinforcement Learning》,系统讲解 RL 智能体利用奖励函数缺陷获取高奖励却不完成预期任务的现象。
来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io