跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 14 小时前AI 评分38

EasyPPO:稳定 critic 是 PPO 训练 LLM 的关键

EasyPPO: Stabilizing the Critic Is Key

AI 导读

EasyPPO 通过仅对 actor 做过长过滤、按采样回报标准差倒数对 critic 回归加权、以及适度缩小 critic mini-batch,解决了 PPO 训练大语言模型时 critic 的两类失稳问题。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co