跳到正文
热点事件持续更新

IDRF:掩码离散扩散模型的奖励微调框架

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Vladislav Gromadskii 等作者提出 IDRF,一种针对少步掩码离散扩散生成器的奖励微调框架。它用逆蒸馏正则替代不可解的序列级 KL 惩罚,并证明该损失是序列级 KL 散度的上界。 该方法无需参考模型 rollout,在 DNA、图像和文本生成任务上以最多少 32 倍的去噪步数取得高奖励,同时缓解 reward hacking 并保持样本质量。

AI 根据报道生成 · 57 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    IDRF:掩码离散扩散模型的逆蒸馏奖励微调

    IDRF 是一种针对少步掩码离散扩散生成器的奖励微调框架,用逆蒸馏正则替代不可解的序列级 KL 惩罚,并证明其损失上界该 KL 散度。该方法无需参考模型 rollout,在 DNA、图像和文本生成上以最多少 32 倍的去噪步数取得高奖励,同时缓解 reward hacking 并保持样本质量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。