arXiv:cs.AI(全量分类)· Zhimin Gao, Pichao Wang·2026-10-01 12:00· 3 小时前AI 评分43OpenJev-RLCD:一个可运行的 RLCD 实现OpenJev-RLCD: A Working RLCD ImplementationAI 导读研究者提出面向推理模型的 RLCD(校准决策强化学习)可运行实现:模型先采样推理过程,再用严格适当评分规则对其最终给出的答案分布打分。来源:arXiv:cs.AI(全量分类) · arxiv.org#论文/研究#推理#数据/训练查看事件全部后续