跳到正文
热点事件持续更新

ImplicitRM:从隐式反馈学无偏奖励模型

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者 Hao Wang 等人提出 ImplicitRM,可直接从点击、复制、跳过等隐式用户反馈中学习奖励模型,以减少对昂贵显式反馈的依赖。作者称该方法用分层模型将训练样本划分为四个潜在组,并推导出理论上无偏的似然最大化目标,以应对隐式反馈缺少确定负样本和选择偏差两大问题。 据该工作描述,在多种 LLM 主干和基准数据集上的实验显示,ImplicitRM 能从隐式反馈学到较准确的奖励模型,并提升下游 RLHF 任务表现。该论文已被 ICML 2026 接收,上述效果与无偏性均为作者在论文中的说法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    ImplicitRM:从隐式反馈学习无偏奖励模型用于 LLM 对齐

    针对奖励模型依赖昂贵显式反馈的问题,研究者提出 ImplicitRM,可直接从点击、复制、跳过等隐式用户反馈中学习无偏奖励模型。该方法用分层模型将训练样本划分为四个潜在组,并推导出理论上无偏的似然最大化目标,以解决隐式反馈缺少确定负样本和选择偏差两大挑战。实验在多种 LLM 主干和基准数据集上验证其能从隐式反馈学到准确奖励模型,并提升下游 RLHF 任务表现,该工作已被 ICML 2026 接收。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。