跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 小时前AI 评分34

RIDE:在表征空间外推 RL 诱导变化,实现 on-policy 蒸馏中学生超越教师

The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation

AI 导读

RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co