LMSYS 发布 Chatbot Arena 平台并公布首批 Elo 模型排行榜
Blog Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings We present Chatbot Arena, a benchmark platform for large language models (LLMs) that features anonymous, randomized battles in a crowdsourced manner. In this blog post, we are releasing our initial re... Lianmin Zheng, Ying Sheng, Wei-Lin Chiang, Hao Zhang, Joseph E. Gonzalez, Ion Stoica May 3, 2023
LMSYS 团队推出 Chatbot Arena,一个让用户与两个匿名模型并排对话并投票的大语言模型众包评测平台,采用国际象棋中的 Elo 评分系统生成排行榜。
原文给出了 Chatbot Arena 的 Elo 排名机制、首批九个开源模型榜单和 4.7K 投票数据,读者可以据此了解众包评测方法的来源。
Lianmin Zheng*、Ying Sheng*、Wei-Lin Chiang、Hao Zhang、Joseph E. Gonzalez、Ion Stoica2023年5月3日
我们推出 Chatbot Arena,一个面向大型语言模型(LLM)的基准测试平台,其特点是采用众包方式进行匿名、随机的对战。在这篇博客文章中,我们将发布初步结果以及基于 Elo 评分系统的排行榜,Elo 评分系统是国际象棋和其他竞技游戏中广泛使用的评分系统。我们邀请整个社区加入这项工作,贡献新模型,并通过提问和投票选出你最喜欢的回答来评估它们。
表1. LLM 排行榜(时间范围:2023年4月24日 - 5月1日)。最新详细版本见此处。
| 排名 | 模型 | Elo 评分 | 描述 |
|---|---|---|---|
| 1 | 🥇 vicuna-13b | 1169 | 由 LMSYS 基于 LLaMA 在用户分享的对话上微调的聊天助手 |
| 2 | 🥈 koala-13b | 1082 | 由 BAIR 开发的用于学术研究的对话模型 |
| 3 | 🥉 oasst-pythia-12b | 1065 | 由 LAION 开发的面向所有人的 Open Assistant |
| 4 | alpaca-13b | 1008 | 由斯坦福基于 LLaMA 在指令遵循演示上微调的模型 |
| 5 | chatglm-6b | 985 | 由清华大学开发的开源双语对话语言模型 |
| 6 | fastchat-t5-3b | 951 | 由 LMSYS 基于 FLAN-T5 微调的聊天助手 |
| 7 | dolly-v2-12b | 944 | 由 Databricks 开发的指令微调开源大型语言模型 |
| 8 | llama-13b | 932 | 由 Meta 开发的开源高效基础语言模型 |
| 9 | stablelm-tuned-alpha-7b | 858 | Stability AI 语言模型 |
表1展示了九个热门模型的 Elo 评分,这些评分基于本notebook中分享的 4.7K 投票数据和计算。你也可以尝试投票演示。

图1. 并排聊天和投票界面。
请注意,我们会定期发布博客文章以更新排行榜。欢迎查看以下更新:
引言
继 ChatGPT 取得巨大成功之后,涌现了大量经过微调以遵循指令的开源大型语言模型。这些模型能够针对用户的问题/提示提供有价值的帮助。著名的例子包括基于 LLaMA 的 Alpaca 和 Vicuna,以及基于 Pythia 的 OpenAssistant 和 Dolly。
尽管每周都有新模型不断发布,但社区在有效对这些模型进行基准测试方面面临挑战。对 LLM 助手进行基准测试极具挑战性,因为问题可能是开放式的,而且编写程序自动评估回答质量非常困难。 在这种情况下,我们通常不得不求助于基于成对比较的人工评估。
基于成对比较的良好基准测试系统应具备一些理想的特性。
- 可扩展性。当为所有可能的模型对收集足够数据不可行时,系统应能扩展到大量模型。
- 增量性。系统应能够使用相对较少的试验来评估新模型。
- 唯一排序。系统应为所有模型提供唯一的排序。给定任意两个模型,我们应该能够判断哪个排名更高或它们是否并列。
现有的 LLM 基准测试系统很少能满足所有这些特性。经典的 LLM 基准测试框架,例如 HELM 和 lm-evaluation-harness,为学术研究中常用的任务提供了多指标测量。然而,它们并非基于成对比较,并且在评估开放式问题方面效果不佳。OpenAI 也推出了 evals 项目以收集更好的问题,但该项目并未为所有参与模型提供排名机制。当我们推出 Vicuna 模型时,我们使用了一个基于 GPT-4 的评估流程,但它并未提供可扩展和增量评级的解决方案。
在这篇博客文章中,我们介绍了 Chatbot Arena,一个以众包方式开展匿名随机对战的 LLM 基准测试平台。Chatbot Arena 采用了 Elo 评分系统,这是国际象棋和其他竞技游戏中广泛使用的评分系统。Elo 评分系统有望提供上述所需的特性。我们注意到 Anthropic LLM 论文也采用了 Elo 评分系统。
为了收集数据,我们在一周前推出了该竞技场,并搭载了几个流行的开源 LLM。在竞技场中,用户可以同时与两个匿名模型聊天,并投票选出哪一个更好。这种众包式的数据收集方式代表了 LLM 在真实场景中的一些用例。几种评估方法之间的比较如表 2 所示。
表 2:不同评估方法之间的比较。
| HELM / lm-evaluation-harness | OpenAI/eval | Alpaca Evaluation | Vicuna Evaluation | Chatbot Arena | |
|---|---|---|---|---|---|
| 问题来源 | 学术数据集 | 混合 | Self-instruct 评估集 | GPT-4 生成 | 用户提示 |
| 评估者 | 程序 | 程序/模型 | 人类 | GPT-4 | 用户 |
| 指标 | 基础指标 | 基础指标 | 胜率 | 胜率 | Elo 评分 |
数据收集
我们使用多模型服务系统 FastChat 在 https://lmarena.ai 上托管了该竞技场。当用户进入竞技场时,他们可以同时与两个匿名模型聊天,如图 1 所示。 在收到两个模型的回复后,用户可以继续聊天,或投票选出他们认为更好的模型。一旦提交投票,模型名称就会被揭晓。用户可以继续聊天,或重新开始一场与两个新随机选择的匿名模型的对战。该平台会记录所有用户交互。在我们的分析中,我们仅使用模型名称隐藏时的投票。
该竞技场大约在一周前推出,自那时起我们已收集了 4.7k 条有效的匿名投票。我们在这个 notebook 中分享了一些探索性分析,并在此提供一个简短总结。

图 2:每种模型组合的对战次数
图 2 显示了每种模型组合的对战次数。当我们最初启动锦标赛时,我们根据基准测试对可能的排名有先验信息,并选择按照这一排名来配对模型。我们优先选择我们认为基于这一排名会形成强配对的组合。然而,我们后来切换到均匀采样,以获得对排名更好的整体覆盖。在锦标赛接近尾声时,我们还引入了一个新模型 fastchat-t5-3b。所有这些都导致了模型频率不均匀。

图 3:前 15 种语言的对战次数。
图 3 绘制了语言分布,并显示大多数用户提示是英文。
Elo 评分系统
Elo 评分系统是一种计算玩家相对技能水平的方法,已被广泛应用于竞技游戏和体育运动中。两名玩家之间的评分差异可以作为比赛结果的预测指标。Elo 评分系统在我们的场景中效果很好,因为我们有多个模型,并在它们之间进行两两对战。
如果玩家 A 的评分为 Ra,玩家 B 的评分为 Rb,那么玩家 A 获胜概率的精确公式(使用以 10 为底的对数曲线)为
玩家的评分可以在每场对战后进行线性更新。假设玩家 A(评分为 Ra)预期得分为 Ea 分,但实际得分为 Sa 分。更新该玩家评分的公式为
利用收集到的数据,我们在此 notebook 中计算了各模型的 Elo 评分,并将主要结果列于表 1。欢迎您尝试该 notebook,并自行探索投票数据。数据仅包含投票结果,不包含对话历史,因为发布对话历史会引发隐私和有害内容等问题。
两两胜率
作为校准的基础,我们在此还展示了锦标赛中每个模型的两两胜率(图 4),以及使用 Elo 评分估计的预测两两胜率(图 5)。 通过比较这些图,我们发现 Elo 评分能够较好地预测胜率。

图 4:所有非平局的 A 对 B 对战中模型 A 获胜的比例。

图 5:在 A 对 B 对战中,使用 Elo 评分预测的模型 A 胜率
未来计划
我们计划开展以下工作:
- 添加更多闭源模型(ChatGPT-3.5、ChatGPT-4 和 Claude-v1 现已在匿名 Arena 中可用)
- 添加更多开源模型
- 定期发布更新的排行榜(例如每月)
- 实现更好的采样算法、锦标赛机制和服务系统,以支持更多数量的模型
- 针对不同任务类型提供细粒度的排名。
我们感谢您的任何反馈,以帮助改进 arena。
加入我们
我们邀请整个社区加入这项基准测试工作,贡献您的模型,并为您认为提供更好答案的匿名模型投票。您可以访问 https://lmarena.ai 为更好的模型投票。如果您希望在 arena 中看到某个特定模型,可以按照此 指南 帮助我们添加它。
致谢
我们感谢 Vicuna 团队其他成员提供的宝贵反馈,以及 MBZUAI 捐赠的计算资源。此外,我们还要感谢 Tianjun Zhang 和 Eric Wallace 的富有洞见的讨论。
链接
- 演示:https://lmarena.ai
- 排行榜:https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard
- GitHub:https://github.com/lm-sys/FastChat
- Colab notebook:https://colab.research.google.com/drive/1RAWb22-PFNI-X1gPVzc927SGUdfr6nsR?usp=sharing
引用
如果您觉得我们的工作有用,请引用以下 论文。
@misc{chiang2024chatbot,
title={Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference},
author={Wei-Lin Chiang and Lianmin Zheng and Ying Sheng and Anastasios Nikolas Angelopoulos and Tianle Li and Dacheng Li and Hao Zhang and Banghua Zhu and Michael Jordan and Joseph E. Gonzalez and Ion Stoica},
year={2024},
eprint={2403.04132},
archivePrefix={arXiv},
primaryClass={cs.AI}
}
@inproceedings{zheng2023judging,
title={Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena},
author={Lianmin Zheng and Wei-Lin Chiang and Ying Sheng and Siyuan Zhuang and Zhanghao Wu and Yonghao Zhuang and Zi Lin and Zhuohan Li and Dacheng Li and Eric Xing and Hao Zhang and Joseph E. Gonzalez and Ion Stoica},
booktitle={Thirty-seventh Conference on Neural Information Processing Systems Datasets and Benchmarks Track},
year={2023},
url={https://openreview.net/forum?id=uccHPGDlao}
}
@inproceedings{zheng2024lmsyschatm,
title={LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset},
author={Lianmin Zheng and Wei-Lin Chiang and Ying Sheng and Tianle Li and Siyuan Zhuang and Zhanghao Wu and Yonghao Zhuang and Zhuohan Li and Zi Lin and Eric Xing and Joseph E. Gonzalez and Ion Stoica and Hao Zhang},
booktitle={The Twelfth International Conference on Learning Representations},
year={2024},
url={https://openreview.net/forum?id=BOfDKxfwt0}
}
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org