跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Ilgee Hong, Changlong Yu, Zhenghao Xu, Xin Liu, Yuwei Zhang, Qin Lu, Bing Yin, Tuo Zhao·· 2 小时前AI 评分35

通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型

Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

AI 导读

研究提出位置选择性自蒸馏方法,利用教师与学生模型间的逐位置熵变识别"上下文锐化"与"上下文扩散"两种模式,并通过位置掩码保留熵变分布低尾部分。实验显示,掩码高熵变位置可提升分布外泛化能力,所得自蒸馏评判模型在主观子类别上比 GRPO 等结果监督 RL 训练的评判模型高出 2-9 个百分点,在客观类别上保持竞争力。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org