跳到正文
热点事件持续更新

CLM-v0.1-8B裁判能力评测:接近随机

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Gowthamkumar Nandakishore 发布预注册评测研究,用五个公开偏好基准和一个幻觉基准评估开源对比决策模型 CLM-v0.1-8B 的裁判能力,结论是该模型在困难基准上接近随机水平。 结果显示,CLM-v0.1-8B 在四选一中最高得分 0.351(随机为 0.250),两两比较为 0.593(随机为 0.500),在 RM-Bench 和 JudgeBench 上与抛硬币在统计上无法区分,对 HaluEval 的每一项都输出同一标签。 评测设计在未见过任何测试项前预先注册并冻结,同时对比生成式模型、奖励模型和简单基线,逐项预测结果已公开。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    CLM-as-a-Judge:开放对比决策模型 CLM-v0.1-8B 在公开评测基准上的裁判能力评估

    开放对比决策模型 CLM-v0.1-8B 在公开裁判基准上接近随机水平:最佳四选一得 0.351(随机为 0.250),两两比较得 0.593(随机为 0.500),在 RM-Bench 与 JudgeBench 上与抛硬币在统计上无法区分,HaluEval 全部输出同一标签。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。