跳到正文
热点事件持续更新

EvoRubric:共享策略生成评分标准的RL框架

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Xin Guan等作者提出EvoRubric,一个协同演化强化学习框架:同一个策略既充当推理器,又充当评分标准的生成器,配合冻结的Meta-Verifier和Grader,为开放式生成任务学习评分标准。作者称其结合了评分标准有效性反馈、回答区分度和同伴一致性。 在Medical、Writing、Science三类共五个benchmark上,8B模型均分56.28、14B模型均分61.13,较最强基线分别高出3.09和2.06分。

AI 根据报道生成 · 50 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    EvoRubric:自演进评分标准驱动的开放生成强化学习框架

    EvoRubric 是一个协同演进强化学习框架,通过共享策略同时充当推理器与评分标准生成器,结合冻结的 Meta-Verifier 和 Grader 完成开放式生成的评分标准学习。在 Medical、Writing、Science 三类共五个 benchmark 上,8B 模型均分 56.28、14B 模型均分 61.13,较最强基线分别高出 3.09 和 2.06 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。