跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Yida Cai, Xin Dai, Bingxiang He, Huiyuan Xie, Yuxiao Ye, Zhenghao Liu, Yang Bai, Zhiyuan Liu·· 3 小时前AI 评分32

LexReward:面向法律语言模型的分类驱动奖励框架

LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

AI 导读

LexReward 是一个面向法律语言模型的分类驱动奖励框架,从 Style、Element、Chain 三个维度刻画法律回答质量,并为每个维度制定评分细则。基于该奖励构建的偏好数据用于 DPO 训练,在三个维度上均提升表现;其训练出的奖励模型 LexRM 无需参考答案即可通过强化学习提升对应维度的策略表现。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org