热点事件持续更新
投机解码离策略监督恢复训练框架
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月1日,arXiv cs.CL 刊出研究,提出基于 rollout 的训练框架,用于为投机解码草稿模型恢复离策略监督。该框架包含 Anchor-Label Relabelling(ALR)与 In-Rollout Anchors(IRA)两个组件,旨在恢复被离策略 token 破坏的完整监督信号。在固定视觉语言和文本语料上,相比 DFlash,贪心接受长度最高提升 36.5%;单轮训练即超过最佳擦除调度,三轮后匹配目标重生成响应的接受长度。代码已开源。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 12:00
新框架以 ALR 与 IRA 恢复离策略监督,接受长度较 DFlash 最高提升 36.5%。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv:cs.CL(计算语言学,全量分类)为投机解码恢复离策略监督:基于 rollout 的草稿模型训练框架
研究者提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)两个组件,为投机解码草稿模型恢复被离策略 token 破坏的完整监督信号。在固定视觉语言和文本语料上,该框架相比 DFlash 将贪心接受长度最高提升 36.5%,单轮训练即超过最佳擦除调度,三轮后匹配目标重生成响应的接受长度。代码已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。