arXiv:cs.CL(计算语言学,全量分类)· Jungseob Lee, Chanjun Park, Sugyeong Eo, Hyeonseok Moon·· 2 小时前AI 评分36
为投机解码恢复离策略监督:基于 rollout 的草稿模型训练框架
Recovering Off-Policy Supervision for Speculative Decoding
AI 导读
研究者提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)两个组件,为投机解码草稿模型恢复被离策略 token 破坏的完整监督信号。在固定视觉语言和文本语料上,该框架相比 DFlash 将贪心接受长度最高提升 36.5%,单轮训练即超过最佳擦除调度,三轮后匹配目标重生成响应的接受长度。代码已开源。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org