LMSYS Chatbot Arena 排行榜更新:GPT-4 居首,PaLM 2 暴露拒答与多语言短板
News Chatbot Arena Leaderboard Updates (Week 4) In this update, we are excited to welcome the following models joining the Chatbot Arena: 1. Google PaLM 2, chat-tuned with the code name chat-bison@001 on Google Cloud Vertex AI 2. Anthropic Claude-... LMSYS Org May 25, 2023
LMSYS 发布基于 2023 年 4 月 24 日至 5 月 22 日 27K 匿名投票的 Chatbot Arena Elo 排行榜,GPT-4(1225)、Claude-v1(1195)、Claude-instant-v1(1153)居前三,并新增 Google PaLM 2(chat-bison@001)、MPT-7B-chat、Vicuna-7B 等模型。
基于 27K 真实匿名投票给出 Elo 排名,并指出 PaLM 2 因拒答和多语言短板输给更弱模型,可作选型参考。
在本次更新中,我们很高兴欢迎以下模型加入 Chatbot Arena:
- Google PaLM 2,在 Google Cloud Vertex AI 上以代码名 chat-bison@001 进行聊天微调
- Anthropic Claude-instant-v1
- MosaicML MPT-7B-chat
- Vicuna-7B
基于 2023 年 4 月 24 日至 5 月 22 日期间在真实环境中收集的 27K 匿名投票数据,新的 Elo 评分排行榜已在下方表 1 中发布。
我们提供了一个 Google Colab notebook 来分析投票数据,包括 Elo 评分的计算。 你也可以尝试投票 demo。
表 1. LLM 排行榜(时间范围:2023 年 4 月 24 日 - 5 月 22 日)。最新详细版本见此处。
| 排名 | 模型 | Elo 评分 | 描述 | 许可证 |
|---|---|---|---|---|
| 1 | 🥇 GPT-4 | 1225 | OpenAI 的 ChatGPT-4 | 专有 |
| 2 | 🥈 Claude-v1 | 1195 | Anthropic 的 Claude | 专有 |
| 3 | 🥉 Claude-instant-v1 | 1153 | Claude 的更轻量、更便宜且更快的版本 | 专有 |
| 4 | GPT-3.5-turbo | 1143 | OpenAI 的 ChatGPT-3.5 | 专有 |
| 5 | Vicuna-13B | 1054 | 由 LMSYS 基于用户分享的对话对 LLaMA 进行微调的聊天助手 | 权重可用;非商业 |
| 6 | PaLM 2 | 1042 | 为聊天调优的 PaLM 2(Google Vertex AI 上的 chat-bison@001)。PaLM 2 模型系列为 Bard 提供支持。 | 专有 |
| 7 | Vicuna-7B | 1007 | 由 LMSYS 基于用户分享的对话对 LLaMA 进行微调的聊天助手 | 权重可用;非商业 |
| 8 | Koala-13B | 980 | BAIR 用于学术研究的对话模型 | 权重可用;非商业 |
| 9 | mpt-7b-chat | 952 | 由 MosaicML 基于 MPT-7B 微调的聊天机器人 | CC-By-NC-SA-4.0 |
| 10 | FastChat-T5-3B | 941 | 由 LMSYS 基于 FLAN-T5 微调的聊天助手 | Apache 2.0 |
| 11 | Alpaca-13B | 937 | 由斯坦福基于指令遵循演示对 LLaMA 进行微调的模型 | 权重可用;非商业 |
| 12 | RWKV-4-Raven-14B | 928 | 具有 transformer 级 LLM 性能的 RNN | Apache 2.0 |
| 13 | Oasst-Pythia-12B | 921 | 由 LAION 为所有人提供的 Open Assistant | Apache 2.0 |
| 14 | ChatGLM-6B | 921 | 清华大学的开源双语对话语言模型 | 权重可用;非商业 |
| 15 | StableLM-Tuned-Alpha-7B | 882 | Stability AI 语言模型 | CC-BY-NC-SA-4.0 |
| 16 | Dolly-V2-12B | 866 | Databricks 的指令微调开源大型语言模型 | MIT |
| 17 | LLaMA-13B | 854 | Meta 的开放且高效的基础语言模型 | 权重可用;非商业 |
胜率矩阵
所有模型对的胜率矩阵如图 1 所示。

图 1:所有非平局 A 对 B 对战中模型 A 获胜的比例。
如果你想看到更多模型,请帮助我们添加它们或通过向我们提供 API 访问权限来联系我们。
概述
Google PaLM 2
Google 的 PaLM 2 是我们上次排行榜更新以来宣布的最重要模型之一。我们通过 Google Cloud Vertex AI API 将 PaLM 2 Chat 添加到 Chatbot Arena。该模型以代码名 chat-bison@001 进行聊天调优。
在过去两周内,PaLM 2 与其他 16 个聊天机器人进行了约 1.8k 场匿名对战,目前在排行榜上排名第 6。它排名高于所有其他开源聊天机器人,除了 Vicuna-13B,其 Elo 比 PaLM 2 高 12 分(Vicuna 1054 对 PaLM 2 1042),就 ELO 评分而言几乎是虚拟平局。我们从 PaLM 2 的 Arena 数据中注意到以下有趣结果。
PaLM 2 在与排名前 4 的玩家(即 GPT-4、Claude-v1、ChatGPT、Claude-instant-v1)对战时表现更好,并且在与 Vicuna 的对战中赢得了 53% 的对局,但在与较弱玩家对战时表现较差。这可以从图 1 中显示的胜率矩阵看出。在 PaLM 2 参与的所有对战中,有 21.6% 是输给了不属于 GPT-4、Claude-v1、GPT-3.5-turbo、Claude-instant-v1 之一的聊天机器人。作为参考,另一个专有模型 GPT-3.5-turbo 仅在这些聊天机器人手中输掉了 12.8% 的对战。
简而言之,我们发现,与我们所评估的其他模型相比,目前在 Google Cloud Vertex API 上可用的 PaLM 2 版本存在以下不足:
- PaLM 2 似乎比其他模型受到更严格的监管,这影响了它回答某些问题的能力。
- 当前提供的 PaLM 2 多语言能力有限。
- 当前提供的 PaLM 2 推理能力不尽如人意。
PaLM 2 受到更严格的监管
PaLM 2 似乎比其他模型受到更严格的监管。在许多用户对话中,当用户提出 PaLM 2 不确定或不愿回答的问题时,PaLM 2 比其他模型更可能拒绝回应。
根据粗略估计,在所有两两对战中,PaLM 2 因拒绝回答而输掉了 20.9% 的对战,而在输给不属于前四名(GPT-4、Claude-v1、ChatGPT、Claude-instant-v1)之一的聊天机器人的对战中,有 30.8% 是因拒绝回答而落败。
这在一定程度上解释了为什么 PaLM 2 在排行榜上经常输给较弱的聊天机器人。这也凸显了聊天机器人竞技场方法论的一个缺陷,因为普通用户更可能惩罚拒答,而非微妙不准确的回答。下面我们提供几个失败案例,说明 PaLM 如何因为拒绝回答问题而输给较弱的聊天机器人。
我们还注意到,有时很难明确界定 LLM 监管的边界。在所提供的 PaLM 2 版本中,我们看到几种不良倾向:
- PaLM 2 拒绝许多角色扮演问题,即使用户要求它模拟 Linux 终端或编程语言解释器。
- 有时 PaLM 2 拒绝回答简单且无争议的事实性问题。
下面展示几个例子:

图 2:PaLM 2 拒绝回答的示例问题。
多语言能力有限
我们从目前在 Google Vertex API 上提供的公共 API chat-bison@001 中,没有看到 PaLM 2 具备强大的多语言能力。PaLM 2 往往不回答非英语问题,包括用中文、西班牙语和希伯来语等流行语言书写的问题。我们无法使用当前的 PaLM 2 版本复现 PaLM 2 技术报告中展示的几个多语言示例。我们正在等待 Google 逐步发布最新版本的 PaLM 2。
我们还分别计算了仅考虑英语和仅考虑非英语对话时所有模型的 Elo 评分,如图 3 所示。结果证实了这些观察——在非英语排行榜上,PaLM 2 排名第 16。

图 3:仅英语和非英语排行榜。
PaLM 2 的推理能力不尽如人意
我们还观察到,所提供的 PaLM 2 版本并未展现出强大的推理能力。一方面,它似乎能检测问题是否为纯文本形式,并倾向于拒绝许多非纯文本的问题,比如涉及编程语言、调试和代码解释的问题。另一方面,我们发现 PaLM 2 在与其他聊天机器人相比时,在一些入门级推理任务上表现不佳。详见图 4 中的几个示例。

图 4:PaLM 2 在简单推理任务上失败的示例。
移除非英语和拒绝对话后的 Elo 评分
我们移除了所有非英语对话以及 PaLM 2 未提供答案的所有对话,并使用过滤后的数据计算了每个模型的 Elo 评分。这一评分代表了 PaLM 2 在竞技场中 Elo 的假设上限。参见下方图 5。

图 5:移除 PaLM 2 的非英语和拒绝对话后的排行榜。
小型模型同样具有竞争力
我们观察到几个较小的模型,包括 vicuna-7B 和 mpt-7b-chat,在排行榜上获得了高分。这些较小的模型在与参数量翻倍的大型模型对比时,表现相当出色。
我们推测,高质量预训练和微调数据集比模型规模更为关键。然而,对于更复杂的推理任务或回答更微妙的问题(如 Trivia),更大的模型仍可能表现更好。 因此,在预训练和微调阶段精心策划高质量数据集,似乎是减小模型规模同时保持模型质量的关键途径。
Claude-v1 与 Claude-instant-v1
Claude-instant-v1 是 Anthropic 提供的 Claude-v1 的低成本、更快捷替代品。若在竞技场中进行实际基准测试,我们观察到 Claude-instant 接近 GPT-3.5-turbo(1153 对 1143)。Claude 与 Claude-instant 之间的评分差距似乎小于 GPT-4 与 GPT-3.5-turbo 之间的差距。Claude-instant 的上下文长度为 9K,收费为每 1K 提示令牌 0.00163 美元,每 1K 完成令牌 0.00551 美元,而其 OpenAI 竞争对手产品 GPT-3.5-turbo 的上下文长度为 4K,统一价格为每 1K 令牌 0.002 美元(无论提示还是完成)。
“野外”评估的局限性
然而,我们想指出关于当前聊天机器人竞技场和排行榜的一些事实。当前竞技场旨在对基于 LLM 的聊天机器人进行“野外”基准测试。这意味着,竞技场用户提供的投票数据以及投票过程中生成的提示-答案反映了聊天机器人在正常人类-聊天机器人交互中的表现。这可能与 LLM 研究文献中的许多基准测试结果不一致,后者倾向于描述零样本、复杂推理等长尾能力。因此,当前的聊天机器人竞技场在清晰反映聊天机器人之间长尾能力差异方面存在局限性。更多细节及我们的计划见后续章节。
后续步骤
评估 LLM 的长尾能力
正如社区在帖子 1和帖子 2中指出的那样,当前的 Arena 和排行榜设计有一个主要局限:小规模用户研究往往无法生成足够多困难或中等难度的提示,而这些提示对于区分 LLM 之间的长尾能力差异是必要的。此外,对于困难问题,普通 Arena 用户也很难判断哪个 LLM 生成的答案更好——有些领域特定问题被认为非常困难,即使对 99% 的非专家人类也是如此。
然而,长尾能力(如复杂推理)对于 LLM 完成现实世界任务可能至关重要。将长尾能力构建到 LLM 中是圣杯问题,也是 LLM 开发中研究最活跃、投资最多的领域。
我们认真倾听社区反馈,并正在思考如何改进排行榜以克服这些局限,捕捉 LLM 中的长尾能力差异。在 Chatbot Arena 之上,我们正在积极设计一种新的锦标赛机制,使用专家设计的预设问题和专家评委来检验聊天机器人。我们很快会有更多更新。
更多模型
自 Arena 推出以来,我们收到了社区许多添加更多模型的请求。由于我们拥有的计算资源和带宽有限,我们可能无法服务所有模型。我们正在努力提升服务系统的可扩展性。 与此同时,你仍然可以为新模型贡献支持,或者如果你能帮助我们扩展系统,请联系我们。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org