研究者提出DAR强化学习目标用于LLM回归
热点事件持续更新
研究者提出DAR强化学习目标用于LLM回归
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
Jungsoo Park等研究者提出分布感知奖励(DAR),一种on-policy强化学习目标,用于大语言模型的回归任务。其做法是对同一输入生成多次预测、形成经验预测分布,再按每个预测对整体分布质量的leave-one-out贡献分配奖励。 研究者在合成插值/外推任务以及涉及代码、分子数据的两个真实科学回归任务上实验,称DAR相比监督微调和逐点强化学习,产生了校准更好的不确定性估计,同时持续降低预测误差并提升排序质量。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
面向 LLM 回归的预测分布强化学习:DAR 方法报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LG面向 LLM 回归的预测分布强化学习:DAR 方法
研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过评估同一输入多次预测形成的经验预测分布,并按每个预测对整体分布质量的 leave-one-out 贡献分配奖励。在合成插值/外推任务和涉及代码、分子数据的两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习,产生了校准更好的不确定性估计,同时持续降低预测误差并提升排序质量。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。