跳到正文
热点事件持续更新

新目标训练投机解码草稿模型

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者 Yunxiao Zhao 与 Changxiao Cai 提出期望解码轮数(EDR)目标,用于训练并行投机解码的草稿模型,通过直接最小化期望解码轮数来优化草稿模型。 该方法将投机解码建模为马尔可夫奖励过程,用状态占用率加权局部拒绝代价,且不引入额外超参数,可推导出精确的时序差分梯度,支持从目标模型 rollout 进行无偏随机优化。 他们用 EDR 微调 DSpark 和 DFly 两个现有草稿模型,在数学推理、代码生成和对话共九项基准上平均接受长度持续提升,并称其优于现有训练目标。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    通过直接最小化期望解码轮数训练并行投机草稿模型

    研究者提出期望解码轮数(EDR)目标,将投机解码建模为马尔可夫奖励过程,用状态占用率加权局部拒绝代价,且不引入额外超参数。该方法可推导出精确的时序差分梯度,支持从目标模型 rollout 进行无偏随机优化。用 EDR 微调 DSpark 和 DFly 两个 SOTA 草稿模型后,在数学推理、代码生成和对话共九项基准上持续提升平均接受长度,并优于现有训练目标。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。