跳到正文

内容形态

评测基准 最新动态

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

61 条精选近 30 天 50 条共收录 651 条

更新

精选归档 · 第 4 页

6月12日周一第 61–61 条
  1. Hugging Face:Blog70

    Hugging Face 实验:GPT-4 能否像人类标注员一样为模型输出打分

    Hugging Face 扩展 Open LLM Leaderboard,用 Scale AI 人工标注和 GPT-4 对 Koala-13B、Vicuna-13B、OpenAssistant-12b、Dolly-12b 在 327 条提示上的输出做成对偏好评估并计算 Elo 排名。

    推荐理由:原文用同一盲测集对比 Scale AI 人工标注与 GPT-4 评分,给出 Elo 排名、位置偏差和相关系数等可核查数据。