EvoRubric:共享策略生成评分标准的RL框架
热点事件持续更新
EvoRubric:共享策略生成评分标准的RL框架
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Xin Guan等作者提出EvoRubric,一个协同演化强化学习框架:同一个策略既充当推理器,又充当评分标准的生成器,配合冻结的Meta-Verifier和Grader,为开放式生成任务学习评分标准。作者称其结合了评分标准有效性反馈、回答区分度和同伴一致性。 在Medical、Writing、Science三类共五个benchmark上,8B模型均分56.28、14B模型均分61.13,较最强基线分别高出3.09和2.06分。
AI 根据报道生成 · 50 分钟前更新
最新进展10月9日 12:00
EvoRubric:自演进评分标准驱动的开放生成强化学习框架报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.CLEvoRubric:自演进评分标准驱动的开放生成强化学习框架
EvoRubric 是一个协同演进强化学习框架,通过共享策略同时充当推理器与评分标准生成器,结合冻结的 Meta-Verifier 和 Grader 完成开放式生成的评分标准学习。在 Medical、Writing、Science 三类共五个 benchmark 上,8B 模型均分 56.28、14B 模型均分 61.13,较最强基线分别高出 3.09 和 2.06 分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。