跳到正文
热点事件持续更新

扩散模型强化学习后训练的对齐-多样性权衡

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年10月3日,arXiv cs.LG 刊出 iADD 研究,针对 DDPO 等扩散模型强化学习后训练方法在奖励优化时牺牲多样性与质量的问题,提出改进方案。研究通过理论分析指出,仅对扩散模型后段 timestep 更新可能损害多样性,并基于 Feynman-Kac 训练实现更优的对齐-多样性权衡。在三个任务上的实验与消融显示,该方法在对齐和多样性上均取得显著提升。目前进展停留在论文发布阶段,尚无后续独立复现或应用报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. arXiv:cs.LG(机器学习,全量分类)
    iADD:改进扩散策略优化中的对齐与多样性

    针对 DDPO 等扩散模型强化学习后训练方法在奖励优化时牺牲多样性与质量的问题,研究者提出 iADD,通过理论分析证明仅对扩散模型后段 timestep 更新可能损害多样性,并基于 Feynman-Kac 训练实现更优的对齐-多样性权衡。在三个任务上的实验与消融显示,该方法在对齐和多样性上均取得显著提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。