LMSYS 发布 Chatbot Arena 33K 对话偏好数据集与 3K MT-bench 专家标注
News Chatbot Arena Conversation Dataset Release Since its launch three months ago, Chatbot Arena has become a widely cited LLM evaluation platform that emphasizes large-scale, community-based, and interactive human evaluation. In that short time sp... LMSYS Org July 20, 2023
LMSYS 发布两套人类偏好数据集:Chatbot Arena 收集的 33K 众包对话(2023 年 4 月至 6 月,含 20 个 LLM 输出、用户投票和毒性标签),以及 MT-bench 的 3.3K 专家级成对偏好标注,覆盖 GPT-4、GPT-3.5、Claude-v1 等 6 个模型对 80 个问题的回答。
LMSYS 公开 33K 真人偏好对话和 3K 专家标注数据,可与 Meta 花费约 800 万美元且未开放的 Llama 2 偏好数据作对照。
自三个月前推出以来,Chatbot Arena 已成为一个被广泛引用的 LLM 评估平台,强调大规模、基于社区和交互式的人工评估。在这段短时间内,我们为 22 个模型收集了来自 19K 个独立 IP 地址的约 53K 投票。
在这篇博客文章中,我们发布了一个包含更多模型的更新排行榜,以及两个用于人类偏好相关研究的数据集:
根据这篇 Llama2 分析博客文章的估计,Meta 为 LLama 2 的人类偏好数据花费了约 800 万,而该数据集现在不可用。 因此,我们认为我们的数据集非常有价值,因为获取人类偏好成本高昂,且开放、高质量的数据集可用性有限。
更新后的排行榜
我们在 lmsys/chatbot-arena-leaderboard 托管最新排行榜。下面是截图。自上次更新以来,我们添加了两个 30B 模型:Vicuna-33B-v1.3 和 MPT-30B-chat,两者在竞技场中表现都非常好。 两天前,我们还将 Llama 2 和 Claude 2 引入竞技场。在我们获得足够投票后,排行榜将很快包含它们。 请在我们的投票网站上投票来帮助我们。
除了缓慢更新的 Arena Elo 评分外,我们还使用 MT-bench,一个基于 GPT-4 的快速自动评估流程来评估所有新模型,包括 LLama 2 (chat)、Claude 2、WizardLM-13B-v1.1、XGen-7B-8K-Inst 和 ChatGLM2-6B。 欢迎查看交互式 lmsys/chatbot-arena-leaderboard,根据不同指标对模型进行排序。 LLama 2 的一些早期评估结果可以在我们的推文中找到。

图 1. Chatbot Arena 排行榜 (查看更多)
数据集 1:33K Chatbot Arena 对话数据
链接:lmsys/chatbot_arena_conversations
该数据集包含 2023 年 4 月至 6 月在 Chatbot Arena 上收集的 33K 条清理过的对话,带有成对的人类偏好。 每个样本包括两个模型名称、它们的完整对话文本、用户投票、匿名用户 ID、检测到的语言标签、OpenAI 审核 API 标签、额外的有毒标签以及时间戳。
为确保数据安全发布,我们已尝试移除所有包含个人身份信息 (PII) 的对话。此外,我们包含了 OpenAI 审核 API 输出,以标记不当对话。然而,我们选择不移除所有这些对话,以便研究人员可以研究与 LLM 在野外使用相关的安全问题以及 OpenAI 审核过程。例如,我们包含了由我们自己的有毒标签器生成的额外有毒标签,该标签器是通过在手动标注数据上微调 T5 和 RoBERTa 训练的。
独特性与潜在用途
与现有的人类偏好数据集如 Anthropic/hh-rlhf 和 OpenAssistant/oasst1 相比。该数据集
- 包含 20 个 LLM 的输出,包括更强大的 LLM,如 GPT-4 和 Claude-v1。它还包含这些最先进模型的许多失败案例。
- 包含来自超过 13K 用户在野外的无限制对话。
我们相信这些数据将帮助 AI 研究社区回答围绕以下主题的重要问题:
- 真实世界用户提示的特征
- 用 RLHF 训练更好的模型
- 改进并评估 LLM 评估方法
- 构建模型选择和请求分发算法
- 研究不当内容过滤机制的设计与应用
免责声明与条款
- 本数据集包含冒犯性对话。若未采取适当的过滤措施,本数据集不适用于训练对话智能体。对于在此数据集上训练出的模型的任何输出,我们概不负责。
- 本数据集中陈述或表达的观点不代表参与数据收集工作的研究人员或机构的观点。
- 本数据的使用者有责任确保其被恰当使用,包括遵守任何适用的法律法规。
- 本数据的使用者在使用特定模型的直接输出时,应遵守该模型的使用条款。
- 如果您发现数据集存在任何问题,请联系我们。
可视化与 Elo 评分计算
这个 Colab notebook 提供了一些可视化,并展示了如何使用该数据集计算 Elo 评分。我们在此粘贴了一些图表。

图 2. 在所有非平局的 A 对 B 对战中模型 A 的获胜比例。

图 3. 各模型两两之间的对战次数。
数据集 2:3K MT-bench 人工标注
链接:lmsys/mt_bench_human_judgments
除了使用 Chatbot Arena 进行的众包评估外,我们还使用 MT-bench 进行了受控的人工评估。
该数据集包含 3.3K 条专家级成对人类偏好数据,针对 6 个模型对 80 个 MT-bench 问题生成的模型回复。 这 6 个模型是 GPT-4、GPT-3.5、Claud-v1、Vicuna-13B、Alpaca-13B 和 LLaMA-13B。标注者大多是具备各问题主题领域专业知识的研究生。数据收集的详细信息可在我们的论文中找到。
一致性计算
这个 Colab notebook 展示了如何使用该数据集计算人类与 GPT-4 评判者之间的一致性。我们的结果表明,人类与 GPT-4 评判者之间达成超过 80% 的一致性,与人类之间的一致性水平相同。
致谢
我们感谢整个社区为 arena 数据集做出的贡献。 我们还计划在完成全面审查后,于未来逐步发布更多对话。
引用
@misc{zheng2023judging,
title={Judging LLM-as-a-judge with MT-Bench and Chatbot Arena},
author={Lianmin Zheng and Wei-Lin Chiang and Ying Sheng and Siyuan Zhuang and Zhanghao Wu and Yonghao Zhuang and Zi Lin and Zhuohan Li and Dacheng Li and Eric. P Xing and Hao Zhang and Joseph E. Gonzalez and Ion Stoica},
year={2023},
eprint={2306.05685},
archivePrefix={arXiv},
primaryClass={cs.CL}
}
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org