跳到正文
原文
arXiv:cs.AI(全量分类)· Zhimin Gao, Pichao Wang·· 3 小时前AI 评分43

OpenJev-RLCD:一个可运行的 RLCD 实现

OpenJev-RLCD: A Working RLCD Implementation

AI 导读

研究者提出面向推理模型的 RLCD(校准决策强化学习)可运行实现:模型先采样推理过程,再用严格适当评分规则对其最终给出的答案分布打分。

来源:arXiv:cs.AI(全量分类) · arxiv.org