HuggingFace Daily Papers(社区热门论文)·· 16 小时前AI 评分37
GRAFT:用跨模型轨迹交换提升 RLVR 的离策略框架
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
AI 导读
针对 GRPO 等 RLVR 方法在 rollout 预算有限时出现全失败组、无梯度信号的问题,研究者提出 GRAFT,用同伴模型的轨迹替换全失败组,并通过序列级兼容性加权和 token 级重要性比裁剪控制跨模型失配。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co