arXiv:cs.CL(计算语言学,全量分类)· Darshan Thaker, Lachlan Ewen MacDonald, Ren\'e Vidal·· 1 天前AI 评分34
FastGuide:加速扩散语言模型的奖励引导解码
FastGuide: Accelerating Reward Guidance for Diffusion Large Language Models
AI 导读
FastGuide 通过并行与自回归解码的自适应混合,加速扩散大语言模型的奖励引导推理,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,同时保持相近生成质量。该方法每个解码步骤只计算一次奖励模型反向传播并复用于多个 token,并借助 KV cache 与稀疏注意力重计算逐次解掩码,对模型不自信的 token 则延后处理。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org