样本-only框架评估BoN策略
热点事件持续更新
样本-only框架评估BoN策略
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究者提出一种仅依赖样本的Best-of-N(BoN)策略评估与选择框架,无需访问响应似然即可估计密度比,并给出双稳健估计器BoN-DR。该估计器可跨候选预算复用共享辅助样本池,在奖励估计器设定错误时仍保持渐近推断有效。 在合成实验与GSM8K(多种参考模型和奖励模型)上,该方法能准确估计BoN策略价值并选出有效采样预算。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
面向推理时对齐的 Best-of-N 策略高效评估方法报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LG面向推理时对齐的 Best-of-N 策略高效评估方法
研究者提出一种仅依赖样本的 Best-of-N(BoN)策略评估与选择框架,无需访问响应似然即可估计密度比。该框架给出双稳健估计器 BoN-DR,可跨候选预算复用共享辅助样本池,并在奖励估计器设定错误时仍保持渐近推断有效。在合成实验与 GSM8K(多种参考模型和奖励模型)上,该方法能准确估计 BoN 策略价值并选出有效采样预算。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。