HuggingFace Daily Papers(社区热门论文)·· 14 小时前AI 评分38
EasyPPO:稳定 critic 是 PPO 训练 LLM 的关键
EasyPPO: Stabilizing the Critic Is Key
AI 导读
EasyPPO 通过仅对 actor 做过长过滤、按采样回报标准差倒数对 critic 回归加权、以及适度缩小 critic mini-batch,解决了 PPO 训练大语言模型时 critic 的两类失稳问题。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co