跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 14 小时前AI 评分37

ROSS:通过选择性监督从自生成 rollout 中再学习

ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

AI 导读

ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co