跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Jungseob Lee, Chanjun Park, Sugyeong Eo, Hyeonseok Moon·· 2 小时前AI 评分36

为投机解码恢复离策略监督:基于 rollout 的草稿模型训练框架

Recovering Off-Policy Supervision for Speculative Decoding

AI 导读

研究者提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)两个组件,为投机解码草稿模型恢复被离策略 token 破坏的完整监督信号。在固定视觉语言和文本语料上,该框架相比 DFlash 将贪心接受长度最高提升 36.5%,单轮训练即超过最佳擦除调度,三轮后匹配目标重生成响应的接受长度。代码已开源。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org