跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 16 小时前AI 评分37

GRAFT:用跨模型轨迹交换提升 RLVR 的离策略框架

Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

AI 导读

针对 GRPO 等 RLVR 方法在 rollout 预算有限时出现全失败组、无梯度信号的问题,研究者提出 GRAFT,用同伴模型的轨迹替换全失败组,并通过序列级兼容性加权和 token 级重要性比裁剪控制跨模型失配。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co