跳到正文
热点事件持续更新

扩散语言模型新框架:奖励引导拼接推理步骤

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Roy Miles 等作者提出名为 Stitching Noisy Diffusion Thoughts 的自一致性框架,用掩码扩散语言模型采样大量低成本推理轨迹,再由现成过程奖励模型为每个中间步骤打分,跨轨迹拼接最高质量步骤生成复合推理链,并只重算最终答案。 研究者在论文中称,该方法相对传统扩散模型(如 Dream、LLaDA)与统一架构(如 TiDAR)可实现最高 1.8 倍延迟降低。论文称代码已公开。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    扩散语言模型测试时扩展:用奖励引导拼接实现推理加速

    研究者提出 Stitching Noisy Diffusion Thoughts,一种自一致性框架:用掩码扩散语言模型采样大量低成本推理轨迹,再由现成过程奖励模型(PRM)为每个中间步骤打分,跨轨迹拼接最高质量步骤生成复合推理链,并仅重算最终答案。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。