LMSYS 发布 Chatbot Arena 榜单更新,推出 MT-Bench 并发布 Vicuna-33B
News Chatbot Arena Leaderboard Week 8: Introducing MT-Bench and Vicuna-33B In this blog post, we share the latest update on Chatbot Arena leaderboard, which now includes more open models and three metrics: 1. Chatbot Arena Elo, based on 42K anonymous votes from Chatbot Aren... Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Hao Zhang June 22, 2023
LMSYS Chatbot Arena 团队更新排行榜,新增 MT-Bench 评分,基于 42K 匿名投票的 Arena Elo 和 MMLU 三项指标,并发布 Vicuna-v1.3 系列(7B 至 33B)权重。
原文同时给出 MT-Bench 设计细节、GPT-4 评审的偏差分析和 28 个模型的完整榜单,读者可据此理解多轮对话评测方法及其局限。
在这篇博客文章中,我们分享了 Chatbot Arena 排行榜的最新更新,现在它包含了更多开放模型和三项指标:
- Chatbot Arena Elo,基于来自 Chatbot Arena 的 42K 匿名投票,使用 Elo 评分系统。
- MT-Bench 分数,基于一个具有挑战性的多轮基准测试和 GPT-4 评分,在我们 Judging LLM-as-a-judge 论文中提出并验证。
- MMLU,一个被广泛采用的 基准测试。
此外,我们很高兴推出我们的新系列 Vicuna-v1.3 模型,参数范围从 7B 到 33B,在扩展的用户共享对话集上训练。 它们的权重现在可用。
更新后的排行榜和新模型
表 1. LLM 排行榜(时间范围:2023 年 4 月 24 日至 6 月 19 日)。最新详细版本见此处。
| 模型 | MT-bench(分数) | Arena Elo 评分 | MMLU | 许可证 |
|---|---|---|---|---|
| GPT-4 | 8.99 | 1227 | 86.4 | 专有 |
| GPT-3.5-turbo | 7.94 | 1130 | 70.0 | 专有 |
| Claude-v1 | 7.90 | 1178 | 75.6 | 专有 |
| Claude-instant-v1 | 7.85 | 1156 | 61.3 | 专有 |
| Vicuna-33B | 7.12 | - | 59.2 | 非商业 |
| WizardLM-30B | 7.01 | - | 58.7 | 非商业 |
| Guanaco-33B | 6.53 | 1065 | 57.6 | 非商业 |
| Tulu-30B | 6.43 | - | 58.1 | 非商业 |
| Guanaco-65B | 6.41 | - | 62.1 | 非商业 |
| OpenAssistant-LLaMA-30B | 6.41 | - | 56.0 | 非商业 |
| PaLM-Chat-Bison-001 | 6.40 | 1038 | - | 专有 |
| Vicuna-13B | 6.39 | 1061 | 52.1 | 非商业 |
| MPT-30B-chat | 6.39 | - | 50.4 | CC-BY-NC-SA-4.0 |
| WizardLM-13B | 6.35 | 1048 | 52.3 | 非商业 |
| Vicuna-7B | 6.00 | 1008 | 47.1 | 非商业 |
| Baize-v2-13B | 5.75 | - | 48.9 | 非商业 |
| Nous-Hermes-13B | 5.51 | - | 49.3 | 非商业 |
| MPT-7B-Chat | 5.42 | 956 | 32.0 | CC-BY-NC-SA-4.0 |
| GPT4All-13B-Snoozy | 5.41 | 986 | 43.0 | 非商业 |
| Koala-13B | 5.35 | 992 | 44.7 | 非商业 |
| MPT-30B-Instruct | 5.22 | - | 47.8 | CC-BY-SA 3.0 |
| Falcon-40B-Instruct | 5.17 | - | 54.7 | Apache 2.0 |
| H2O-Oasst-OpenLLaMA-13B | 4.63 | - | 42.8 | Apache 2.0 |
| Alpaca-13B | 4.53 | 930 | 48.1 | 非商业 |
| ChatGLM-6B | 4.50 | 905 | 36.1 | 非商业 |
| OpenAssistant-Pythia-12B | 4.32 | 924 | 27.0 | Apache 2.0 |
| RWKV-4-Raven-14B | 3.98 | 950 | 25.6 | Apache 2.0 |
| Dolly-V2-12B | 3.28 | 850 | 25.7 | MIT |
| FastChat-T5-3B | 3.04 | 897 | 47.7 | Apache 2.0 |
| StableLM-Tuned-Alpha-7B | 2.75 | 871 | 24.4 | CC-BY-NC-SA-4.0 |
| LLaMA-13B | 2.61 | 826 | 47.0 | 非商业 |
欢迎尝试 Chatbot Arena 投票演示。 请记住,每个基准测试都有其局限性。请将结果视为指导性参考。更多技术细节请参阅我们下面的讨论。
使用 MT-bench 和 Arena 评估聊天机器人
动机
虽然已有多个用于评估大型语言模型(LLM)性能的基准测试,例如 MMLU、HellaSwag 和 HumanEval, 但我们注意到这些基准测试在评估 LLM 的人类偏好时可能有所不足。 传统基准测试通常以封闭式问题和简洁输出(例如多项选择)来测试 LLM,这并不能反映基于 LLM 的聊天助手的典型用例。
为了填补这一空白,在本次排行榜更新中,除了 Chatbot Arena Elo 系统外,我们还添加了一个新的基准测试:MT-Bench。
- MT-bench 是一个具有挑战性的多轮问题集,旨在评估模型的对话和指令遵循能力。您可以在此处查看 MT-bench 的示例问题和答案。
- Chatbot Arena 是一个众包对战平台,用户可以向聊天机器人提出任何问题,并投票选出自己更喜欢的回答。
这两个基准测试都旨在将人类偏好作为主要指标。
为什么是 MT-Bench?
MT-Bench 是一个精心策划的基准测试,包含 80 个高质量的多轮问题。 这些问题旨在评估模型在多轮对话中的对话流畅度和指令遵循能力。 它们既包含常见用例,也包含旨在区分不同聊天机器人的具有挑战性的指令。 MT-Bench 作为对我们基于众包的评估——Chatbot Arena 的质量控制补充。
通过运行 Chatbot Arena 两个月并分析用户的提示,我们确定了用户提示的 8 个主要类别:写作、角色扮演、信息提取、推理、数学、编程、知识 I(STEM)和知识 II(人文/社会科学)。 我们为每个类别精心设计了 10 个多轮问题,总共得到 160 个问题。我们在图 1 中展示了一些示例问题。你可以在这里找到更多。

图 1:来自 MT-Bench 的示例问题。
但是,如何给聊天机器人的回答评分呢?
尽管我们认为人类偏好是黄金标准,但收集起来却以缓慢和昂贵著称。 在我们的第一篇 Vicuna 博客文章中,我们探索了一种基于 GPT-4 的自动化评估流程。 这种方法此后变得流行,并被若干同期和后续工作采用。
在我们最新的论文《Judging LLM-as-a-judge》中,我们进行了一项系统性研究,以回答这些 LLM 评判者究竟有多可靠。 我们在此简要概述结论,但建议阅读论文以了解更多细节。
我们首先承认 LLM-as-a-judge 的潜在局限性:
- 位置偏差,即 LLM 评判者可能在成对比较中偏向第一个回答。
- 冗长偏差,即 LLM 评判者可能偏向更长的回答,而不管其质量如何。
- 自我增强偏差,即 LLM 评判者可能偏向自己的回答。
- 推理能力有限,指 LLM 评判者在给数学和推理问题评分时可能存在的不足。
我们的研究随后探讨了少样本评判者、思维链评判者、基于参考的评判者和微调评判者如何帮助缓解这些局限性。
在实施其中一些解决方案后,我们发现尽管存在局限性,像 GPT-4 这样强大的 LLM 评判者仍能与受控的人类偏好和众包人类偏好高度一致,达到超过 80% 的一致率。 这一一致率水平可与两位不同人类评判者之间的一致率相媲美。 因此,如果谨慎使用,LLM-as-a-judge 可以作为人类偏好的可扩展且可解释的近似。
我们还发现,基于 GPT-4 的单回答评分(不进行成对比较)也能有效地对模型进行排名,并与人类偏好很好地匹配。 在表 1 中,我们基于 GPT-4 的单回答评分将 MT-Bench 作为排行榜上的一列呈现。
结果与分析
MT-Bench 能有效区分不同聊天机器人
表1详细列出了MT-bench增强排行榜的情况,我们对28个流行的指令微调模型进行了详尽评估。 我们观察到不同能力的聊天机器人之间存在明显差异,其得分与Chatbot Arena Elo评分高度相关。 特别是,MT-Bench揭示了GPT-4与GPT-3.5/Claude之间,以及开源与专有模型之间的显著性能差距。
为了更深入地探究聊天机器人之间的区分因素,我们选取了几个代表性的聊天机器人,并在图2中按类别分解了它们的表现。 与GPT-3.5/Claude相比,GPT-4在编码和推理方面表现出更优越的性能,而Vicuna-13B在几个特定类别中明显落后:提取、编码和数学。 这表明开源模型仍有很大的改进空间。

图2:6个代表性LLM在8个类别(写作、角色扮演、推理、数学、编码、提取、STEM、人文学科)中能力的比较。
多轮对话能力
接下来,我们分析了所选模型的多轮得分,见表2。
表2. LLM在对话第一轮和第二轮的MT-bench得分细分。满分为10分。
| 模型 | 第一轮平均得分 | 第二轮平均得分 | 得分差异 |
|---|---|---|---|
| GPT-4 | 8.96 | 9.03 | 0.07 |
| Claude-v1 | 8.15 | 7.65 | -0.50 |
| GPT-3.5-turbo | 8.08 | 7.81 | -0.26 |
| Vicuna-33B | 7.46 | 6.79 | -0.67 |
| WizardLM-30B | 7.13 | 6.89 | -0.24 |
| WizardLM-13B | 7.12 | 5.59 | -1.53 |
| Guanaco-33B | 6.88 | 6.18 | -0.71 |
| Vicuna-13B | 6.81 | 5.96 | -0.85 |
| PaLM2-Chat-Bison | 6.71 | 6.09 | -0.63 |
| Vicuna-7B | 6.69 | 5.30 | -1.39 |
| Koala-13B | 6.08 | 4.63 | -1.45 |
| MPT-7B-Chat | 5.85 | 4.99 | -0.86 |
| Falcon-40B-instruct | 5.81 | 4.53 | -1.29 |
| H2OGPT-Oasst-Open-LLaMA-13B | 5.51 | 3.74 | -1.78 |
MT-bench在其设计中包含了具有挑战性的后续问题。 对于开源模型,从第一轮到第二轮的表现在显著下降(例如,Vicuna-7B、WizardLM-13B),而强大的专有模型则保持一致。 我们还注意到,基于LLaMA的模型与那些采用宽松许可证的模型(MPT-7B、Falcon-40B和指令微调的Open-LLaMA)之间存在相当大的性能差距。
LLM评判的可解释性
LLM评判的另一个优势是能够提供可解释的评估。 图3展示了GPT-4对MT-bench问题的判断实例,其中包含alpaca-13b和gpt-3.5-turbo的回答。 GPT-4提供了全面且有逻辑的反馈来支持其判断。 我们的研究发现,此类评审有助于指导人类做出更明智的决策(更多细节请参阅第4.2节)。 所有GPT-4的判断都可以在我们的演示网站上找到。

图3:MT-bench在评估LLM的人类偏好方面提供了更多可解释性。
总之,我们已经证明MT-Bench能够有效区分不同能力的聊天机器人。 它具有可扩展性,通过类别细分提供有价值的见解,并为人类评判者提供可解释性以供验证。 然而,LLM评判应谨慎使用。它仍可能出错,尤其是在评分数学/推理问题时。
如何在MT-Bench上评估新模型?
在MT-bench上评估模型既简单又快速。我们的脚本支持所有huggingface模型,并且我们提供了详细说明, 您可以在其中生成模型对MT-bench问题的回答及其GPT-4判断。您也可以在我们的gradio浏览演示中查看回答和评审。
下一步
对话数据发布
我们正在向更广泛的研究社区发布 Chatbot Arena 对话数据。敬请关注更新!
MT-bench-1K
MT-Bench 目前由一组精心挑选的 80 个问题组成,以确保最高质量。 我们正在积极将问题集扩展到 MT-Bench-1K,通过整合来自 Chatbot Arena 的高质量提示,并使用 LLM 自动生成新的问题。 如果您有任何好的想法,我们很乐意听取您的意见。
合作邀请
我们正在与多个组织合作,探索大规模标准化评估 LLM 人类偏好的可能性。 如果您对此感兴趣,请随时与我们联系。
已有大量有趣的工作研究如何评估人类偏好以及如何使用强大的 LLM 作为评估裁判。 欢迎您查看这些工作,了解关于此主题的更多观点:
- 使用 MT-Bench 和 Chatbot Arena 评判 LLM-as-a-judge
- 基础模型能像人类一样标注数据吗?
- 骆驼能走多远?探索开放资源上指令微调的现状
- 模仿专有 LLM 的虚假承诺
- AlpacaEval 和 AlpacaFarm
- 大型语言模型不是公平的评估者
链接
以下是运行 MT-bench 和本博文中使用的其他指标的现成工具和代码:
- MT-bench 使用 fastchat.llm_judge,
- Arena Elo 计算器。
- MMLU 基于 InstructEval 和 Chain-of-Thought Hub。
如果您希望在排行榜上看到更多模型,我们邀请您为 FastChat 做贡献或联系我们以提供 API 访问权限。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org