跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 4 小时前精选AI 评分80

LMSYS 发布 Chatbot Arena 榜单更新,推出 MT-Bench 并发布 Vicuna-33B

News Chatbot Arena Leaderboard Week 8: Introducing MT-Bench and Vicuna-33B In this blog post, we share the latest update on Chatbot Arena leaderboard, which now includes more open models and three metrics: 1. Chatbot Arena Elo, based on 42K anonymous votes from Chatbot Aren... Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Hao Zhang June 22, 2023

AI 导读

LMSYS Chatbot Arena 团队更新排行榜,新增 MT-Bench 评分,基于 42K 匿名投票的 Arena Elo 和 MMLU 三项指标,并发布 Vicuna-v1.3 系列(7B 至 33B)权重。

推荐理由

原文同时给出 MT-Bench 设计细节、GPT-4 评审的偏差分析和 28 个模型的完整榜单,读者可据此理解多轮对话评测方法及其局限。

正文 · AI 翻译

在这篇博客文章中,我们分享了 Chatbot Arena 排行榜的最新更新,现在它包含了更多开放模型和三项指标:

  1. Chatbot Arena Elo,基于来自 Chatbot Arena 的 42K 匿名投票,使用 Elo 评分系统。
  2. MT-Bench 分数,基于一个具有挑战性的多轮基准测试和 GPT-4 评分,在我们 Judging LLM-as-a-judge 论文中提出并验证。
  3. MMLU,一个被广泛采用的 基准测试。

此外,我们很高兴推出我们的新系列 Vicuna-v1.3 模型,参数范围从 7B 到 33B,在扩展的用户共享对话集上训练。 它们的权重现在可用。

更新后的排行榜和新模型

表 1. LLM 排行榜(时间范围:2023 年 4 月 24 日至 6 月 19 日)。最新详细版本见此处。

模型 MT-bench(分数) Arena Elo 评分 MMLU 许可证
GPT-4 8.99 1227 86.4 专有
GPT-3.5-turbo 7.94 1130 70.0 专有
Claude-v1 7.90 1178 75.6 专有
Claude-instant-v1 7.85 1156 61.3 专有
Vicuna-33B 7.12 - 59.2 非商业
WizardLM-30B 7.01 - 58.7 非商业
Guanaco-33B 6.53 1065 57.6 非商业
Tulu-30B 6.43 - 58.1 非商业
Guanaco-65B 6.41 - 62.1 非商业
OpenAssistant-LLaMA-30B 6.41 - 56.0 非商业
PaLM-Chat-Bison-001 6.40 1038 - 专有
Vicuna-13B 6.39 1061 52.1 非商业
MPT-30B-chat 6.39 - 50.4 CC-BY-NC-SA-4.0
WizardLM-13B 6.35 1048 52.3 非商业
Vicuna-7B 6.00 1008 47.1 非商业
Baize-v2-13B 5.75 - 48.9 非商业
Nous-Hermes-13B 5.51 - 49.3 非商业
MPT-7B-Chat 5.42 956 32.0 CC-BY-NC-SA-4.0
GPT4All-13B-Snoozy 5.41 986 43.0 非商业
Koala-13B 5.35 992 44.7 非商业
MPT-30B-Instruct 5.22 - 47.8 CC-BY-SA 3.0
Falcon-40B-Instruct 5.17 - 54.7 Apache 2.0
H2O-Oasst-OpenLLaMA-13B 4.63 - 42.8 Apache 2.0
Alpaca-13B 4.53 930 48.1 非商业
ChatGLM-6B 4.50 905 36.1 非商业
OpenAssistant-Pythia-12B 4.32 924 27.0 Apache 2.0
RWKV-4-Raven-14B 3.98 950 25.6 Apache 2.0
Dolly-V2-12B 3.28 850 25.7 MIT
FastChat-T5-3B 3.04 897 47.7 Apache 2.0
StableLM-Tuned-Alpha-7B 2.75 871 24.4 CC-BY-NC-SA-4.0
LLaMA-13B 2.61 826 47.0 非商业

­

欢迎尝试 Chatbot Arena 投票演示。 请记住,每个基准测试都有其局限性。请将结果视为指导性参考。更多技术细节请参阅我们下面的讨论。

使用 MT-bench 和 Arena 评估聊天机器人

动机

虽然已有多个用于评估大型语言模型(LLM)性能的基准测试,例如 MMLU、HellaSwag 和 HumanEval, 但我们注意到这些基准测试在评估 LLM 的人类偏好时可能有所不足。 传统基准测试通常以封闭式问题和简洁输出(例如多项选择)来测试 LLM,这并不能反映基于 LLM 的聊天助手的典型用例。

为了填补这一空白,在本次排行榜更新中,除了 Chatbot Arena Elo 系统外,我们还添加了一个新的基准测试:MT-Bench。

  • MT-bench 是一个具有挑战性的多轮问题集,旨在评估模型的对话和指令遵循能力。您可以在此处查看 MT-bench 的示例问题和答案。
  • Chatbot Arena 是一个众包对战平台,用户可以向聊天机器人提出任何问题,并投票选出自己更喜欢的回答。

这两个基准测试都旨在将人类偏好作为主要指标。

为什么是 MT-Bench?

MT-Bench 是一个精心策划的基准测试,包含 80 个高质量的多轮问题。 这些问题旨在评估模型在多轮对话中的对话流畅度和指令遵循能力。 它们既包含常见用例,也包含旨在区分不同聊天机器人的具有挑战性的指令。 MT-Bench 作为对我们基于众包的评估——Chatbot Arena 的质量控制补充。

通过运行 Chatbot Arena 两个月并分析用户的提示,我们确定了用户提示的 8 个主要类别:写作、角色扮演、信息提取、推理、数学、编程、知识 I(STEM)和知识 II(人文/社会科学)。 我们为每个类别精心设计了 10 个多轮问题,总共得到 160 个问题。我们在图 1 中展示了一些示例问题。你可以在这里找到更多。

图 1:来自 MT-Bench 的示例问题。

但是,如何给聊天机器人的回答评分呢?

尽管我们认为人类偏好是黄金标准,但收集起来却以缓慢和昂贵著称。 在我们的第一篇 Vicuna 博客文章中,我们探索了一种基于 GPT-4 的自动化评估流程。 这种方法此后变得流行,并被若干同期和后续工作采用。

在我们最新的论文《Judging LLM-as-a-judge》中,我们进行了一项系统性研究,以回答这些 LLM 评判者究竟有多可靠。 我们在此简要概述结论,但建议阅读论文以了解更多细节。

我们首先承认 LLM-as-a-judge 的潜在局限性:

  • 位置偏差,即 LLM 评判者可能在成对比较中偏向第一个回答。
  • 冗长偏差,即 LLM 评判者可能偏向更长的回答,而不管其质量如何。
  • 自我增强偏差,即 LLM 评判者可能偏向自己的回答。
  • 推理能力有限,指 LLM 评判者在给数学和推理问题评分时可能存在的不足。

我们的研究随后探讨了少样本评判者、思维链评判者、基于参考的评判者和微调评判者如何帮助缓解这些局限性。

在实施其中一些解决方案后,我们发现尽管存在局限性,像 GPT-4 这样强大的 LLM 评判者仍能与受控的人类偏好和众包人类偏好高度一致,达到超过 80% 的一致率。 这一一致率水平可与两位不同人类评判者之间的一致率相媲美。 因此,如果谨慎使用,LLM-as-a-judge 可以作为人类偏好的可扩展且可解释的近似。

我们还发现,基于 GPT-4 的单回答评分(不进行成对比较)也能有效地对模型进行排名,并与人类偏好很好地匹配。 在表 1 中,我们基于 GPT-4 的单回答评分将 MT-Bench 作为排行榜上的一列呈现。

结果与分析

MT-Bench 能有效区分不同聊天机器人

表1详细列出了MT-bench增强排行榜的情况,我们对28个流行的指令微调模型进行了详尽评估。 我们观察到不同能力的聊天机器人之间存在明显差异,其得分与Chatbot Arena Elo评分高度相关。 特别是,MT-Bench揭示了GPT-4与GPT-3.5/Claude之间,以及开源与专有模型之间的显著性能差距。

为了更深入地探究聊天机器人之间的区分因素,我们选取了几个代表性的聊天机器人,并在图2中按类别分解了它们的表现。 与GPT-3.5/Claude相比,GPT-4在编码和推理方面表现出更优越的性能,而Vicuna-13B在几个特定类别中明显落后:提取、编码和数学。 这表明开源模型仍有很大的改进空间。

图2:6个代表性LLM在8个类别(写作、角色扮演、推理、数学、编码、提取、STEM、人文学科)中能力的比较。

多轮对话能力

接下来,我们分析了所选模型的多轮得分,见表2。

表2. LLM在对话第一轮和第二轮的MT-bench得分细分。满分为10分。

模型 第一轮平均得分 第二轮平均得分 得分差异
GPT-4 8.96 9.03 0.07
Claude-v1 8.15 7.65 -0.50
GPT-3.5-turbo 8.08 7.81 -0.26
Vicuna-33B 7.46 6.79 -0.67
WizardLM-30B 7.13 6.89 -0.24
WizardLM-13B 7.12 5.59 -1.53
Guanaco-33B 6.88 6.18 -0.71
Vicuna-13B 6.81 5.96 -0.85
PaLM2-Chat-Bison 6.71 6.09 -0.63
Vicuna-7B 6.69 5.30 -1.39
Koala-13B 6.08 4.63 -1.45
MPT-7B-Chat 5.85 4.99 -0.86
Falcon-40B-instruct 5.81 4.53 -1.29
H2OGPT-Oasst-Open-LLaMA-13B 5.51 3.74 -1.78

­

MT-bench在其设计中包含了具有挑战性的后续问题。 对于开源模型,从第一轮到第二轮的表现在显著下降(例如,Vicuna-7B、WizardLM-13B),而强大的专有模型则保持一致。 我们还注意到,基于LLaMA的模型与那些采用宽松许可证的模型(MPT-7B、Falcon-40B和指令微调的Open-LLaMA)之间存在相当大的性能差距。

LLM评判的可解释性

LLM评判的另一个优势是能够提供可解释的评估。 图3展示了GPT-4对MT-bench问题的判断实例,其中包含alpaca-13b和gpt-3.5-turbo的回答。 GPT-4提供了全面且有逻辑的反馈来支持其判断。 我们的研究发现,此类评审有助于指导人类做出更明智的决策(更多细节请参阅第4.2节)。 所有GPT-4的判断都可以在我们的演示网站上找到。

图3:MT-bench在评估LLM的人类偏好方面提供了更多可解释性。

总之,我们已经证明MT-Bench能够有效区分不同能力的聊天机器人。 它具有可扩展性,通过类别细分提供有价值的见解,并为人类评判者提供可解释性以供验证。 然而,LLM评判应谨慎使用。它仍可能出错,尤其是在评分数学/推理问题时。

如何在MT-Bench上评估新模型?

在MT-bench上评估模型既简单又快速。我们的脚本支持所有huggingface模型,并且我们提供了详细说明, 您可以在其中生成模型对MT-bench问题的回答及其GPT-4判断。您也可以在我们的gradio浏览演示中查看回答和评审。

下一步

对话数据发布

我们正在向更广泛的研究社区发布 Chatbot Arena 对话数据。敬请关注更新!

MT-bench-1K

MT-Bench 目前由一组精心挑选的 80 个问题组成,以确保最高质量。 我们正在积极将问题集扩展到 MT-Bench-1K,通过整合来自 Chatbot Arena 的高质量提示,并使用 LLM 自动生成新的问题。 如果您有任何好的想法,我们很乐意听取您的意见。

合作邀请

我们正在与多个组织合作,探索大规模标准化评估 LLM 人类偏好的可能性。 如果您对此感兴趣,请随时与我们联系。

已有大量有趣的工作研究如何评估人类偏好以及如何使用强大的 LLM 作为评估裁判。 欢迎您查看这些工作,了解关于此主题的更多观点:

链接

以下是运行 MT-bench 和本博文中使用的其他指标的现成工具和代码:

如果您希望在排行榜上看到更多模型,我们邀请您为 FastChat 做贡献或联系我们以提供 API 访问权限。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org