HuggingFace Daily Papers(社区热门论文)·· 1 小时前AI 评分34
RIDE:在表征空间外推 RL 诱导变化,实现 on-policy 蒸馏中学生超越教师
The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
AI 导读
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co