跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2024-11-28AI 评分51

Lilian Weng 长文解析强化学习中的奖励劫持现象

Reward Hacking in Reinforcement Learning

AI 导读

Lilian Weng 发表长文《Reward Hacking in Reinforcement Learning》,系统讲解 RL 智能体利用奖励函数缺陷获取高奖励却不完成预期任务的现象。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io