新目标训练投机解码草稿模型
热点事件持续更新
新目标训练投机解码草稿模型
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
研究者 Yunxiao Zhao 与 Changxiao Cai 提出期望解码轮数(EDR)目标,用于训练并行投机解码的草稿模型,通过直接最小化期望解码轮数来优化草稿模型。 该方法将投机解码建模为马尔可夫奖励过程,用状态占用率加权局部拒绝代价,且不引入额外超参数,可推导出精确的时序差分梯度,支持从目标模型 rollout 进行无偏随机优化。 他们用 EDR 微调 DSpark 和 DFly 两个现有草稿模型,在数学推理、代码生成和对话共九项基准上平均接受长度持续提升,并称其优于现有训练目标。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
通过直接最小化期望解码轮数训练并行投机草稿模型报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CL通过直接最小化期望解码轮数训练并行投机草稿模型
研究者提出期望解码轮数(EDR)目标,将投机解码建模为马尔可夫奖励过程,用状态占用率加权局部拒绝代价,且不引入额外超参数。该方法可推导出精确的时序差分梯度,支持从目标模型 rollout 进行无偏随机优化。用 EDR 微调 DSpark 和 DFly 两个 SOTA 草稿模型后,在数学推理、代码生成和对话共九项基准上持续提升平均接受长度,并优于现有训练目标。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。