跳到正文
热点事件持续更新

arXiv 研究提出松弛线性奖励以满足对齐公理

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

arXiv 上的一项机器学习研究提出,放宽线性奖励模型、允许每个候选存在松弛量,以最小总松弛满足带 margin η 的 PO 和 PMC 公理,且不对投票者或比较数据收集方式作假设。作者称,当候选数为 m、η 不超过 O(1/m²) 时,最优总松弛上界为 O(1),并给出紧致性实例。 新方法对每次错误比较惩罚线性部分,同时最小化总松弛与违规数。实验显示,其线性奖励优于线性 BTL。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    对齐中线性奖励的公理可满足性

    研究提出放宽线性奖励模型、允许每个候选存在松弛量,以最小总松弛满足带 margin η 的 PO 和 PMC 公理,且不对投票者或比较数据收集方式作假设。当候选数为 m、η 不超过 O(1/m²) 时,最优总松弛上界为 O(1),并给出紧致性实例。新方法对每次错误比较惩罚线性部分,同时最小化总松弛与违规数,实验显示其线性奖励优于线性 BTL。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。