跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 14 小时前AI 评分38

Thinking Reward Model(TRM):先思考再打分的视觉生成奖励模型

Think Before You Score: Thinking Reward Model for Visual Generation

AI 导读

研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co