CLM-v0.1-8B裁判能力评测:接近随机
热点事件持续更新
CLM-v0.1-8B裁判能力评测:接近随机
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Gowthamkumar Nandakishore 发布预注册评测研究,用五个公开偏好基准和一个幻觉基准评估开源对比决策模型 CLM-v0.1-8B 的裁判能力,结论是该模型在困难基准上接近随机水平。 结果显示,CLM-v0.1-8B 在四选一中最高得分 0.351(随机为 0.250),两两比较为 0.593(随机为 0.500),在 RM-Bench 和 JudgeBench 上与抛硬币在统计上无法区分,对 HaluEval 的每一项都输出同一标签。 评测设计在未见过任何测试项前预先注册并冻结,同时对比生成式模型、奖励模型和简单基线,逐项预测结果已公开。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
CLM-as-a-Judge:开放对比决策模型 CLM-v0.1-8B 在公开评测基准上的裁判能力评估报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGCLM-as-a-Judge:开放对比决策模型 CLM-v0.1-8B 在公开评测基准上的裁判能力评估
开放对比决策模型 CLM-v0.1-8B 在公开裁判基准上接近随机水平:最佳四选一得 0.351(随机为 0.250),两两比较得 0.593(随机为 0.500),在 RM-Bench 与 JudgeBench 上与抛硬币在统计上无法区分,HaluEval 全部输出同一标签。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。