Chatbot Arena 榜单更新:GPT-4 登顶,PaLM 2 暴露短板
先了解这件事
2026年10月2日,LMSYS 在官方博客发布 Chatbot Arena Elo 排行榜更新。该榜单基于 2023 年 4 月 24 日至 5 月 22 日收集的 27K 匿名投票,排名前三的模型为 GPT-4(1225 分)、Claude-v1(1195 分)和 Claude-instant-v1(1153 分);此次更新还新增了 Google PaLM 2(chat-bison@001)、MPT-7B-chat、Vicuna-7B 等模型,其中 PaLM 2 暴露出拒答与多语言方面的短板。同日另一篇博客则发布第 2 周榜单更新,称新增 GPT-4、GPT-3.5-turbo、Claude-v1 和 RWKV-4-Raven-14B 四款模型,基于 13K 投票对 13 个模型排名,GPT-4 以 Elo 1274 居首,Claude-v1 以 1224 位列第二,GPT-3.5-turbo 以 1155 排第三,开源模型最高为 Vicuna-13B 的 1083。两篇报道在投票量(27K 与 13K)及 GPT-4、Claude-v1 的 Elo 分数(1225/1195 与 1274/1224)上存在不一致。
AI 根据报道生成 · 2 小时前更新
事件进展
2 个进展
- 10月2日 22:51 · 1 篇报道LMSYS 更新 Chatbot Arena 排行榜,新增 GPT-4 等 4 个模型LMSYS:Blog(Chatbot Arena 团队):Chatbot Arena 第 2 周榜单更新:GPT-4 登顶,Claude-v1 第二
- 10月2日 22:51 · 1 篇报道LMSYS Chatbot Arena 第4周榜单更新LMSYS:Blog(Chatbot Arena 团队):LMSYS Chatbot Arena 排行榜更新:GPT-4 居首,PaLM 2 暴露拒答与多语言短板
报道时间线
沿着报道,了解事件的不同侧面。
- LMSYS:Blog(Chatbot Arena 团队)Chatbot Arena 第 2 周榜单更新:GPT-4 登顶,Claude-v1 第二
Chatbot Arena 发布第 2 周榜单更新,新增 GPT-4、GPT-3.5-turbo、Claude-v1 和 RWKV-4-Raven-14B 四款模型,基于 13K 投票数据对 13 个模型排名。GPT-4 以 Elo 1274 居首,Claude-v1 以 1224 位列第二,GPT-3.5-turbo 以 1155 排第三,开源模型最高为 Vicuna-13B 的 1083。
- LMSYS:Blog(Chatbot Arena 团队)精选LMSYS Chatbot Arena 排行榜更新:GPT-4 居首,PaLM 2 暴露拒答与多语言短板
LMSYS 发布基于 2023 年 4 月 24 日至 5 月 22 日 27K 匿名投票的 Chatbot Arena Elo 排行榜,GPT-4(1225)、Claude-v1(1195)、Claude-instant-v1(1153)居前三,并新增 Google PaLM 2(chat-bison@001)、MPT-7B-chat、Vicuna-7B 等模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。