跳到正文
热点事件持续更新

研究者提出DAR强化学习目标用于LLM回归

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

Jungsoo Park等研究者提出分布感知奖励(DAR),一种on-policy强化学习目标,用于大语言模型的回归任务。其做法是对同一输入生成多次预测、形成经验预测分布,再按每个预测对整体分布质量的leave-one-out贡献分配奖励。 研究者在合成插值/外推任务以及涉及代码、分子数据的两个真实科学回归任务上实验,称DAR相比监督微调和逐点强化学习,产生了校准更好的不确定性估计,同时持续降低预测误差并提升排序质量。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    面向 LLM 回归的预测分布强化学习:DAR 方法

    研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过评估同一输入多次预测形成的经验预测分布,并按每个预测对整体分布质量的 leave-one-out 贡献分配奖励。在合成插值/外推任务和涉及代码、分子数据的两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习,产生了校准更好的不确定性估计,同时持续降低预测误差并提升排序质量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。