Chatbot Arena 引入风格控制:剥离长度与 markdown 对排名的影响
Blog Does style matter? Disentangling style and substance in Chatbot Arena Why is GPT-4o-mini so good? Why does Claude rank so low, when anecdotal experience suggests otherwise? We have answers for you. We controlled for the effect of length and markdown, and indeed, the ra... Tianle Li, Anastasios Angelopoulos, Wei-Lin ChiangAug 29, 2024
LMSYS Chatbot Arena 团队在 Bradley-Terry 回归中加入风格特征,控制回答长度、markdown 标题、加粗和列表数量后重新计算排名。
原文给出控制长度和 markdown 后的 Arena 排名变化与方法细节,读者可据此重新审视各模型分数中的风格成分。
为什么 GPT-4o-mini 如此出色?为什么 Claude 排名如此之低,而坊间经验却表明并非如此?
我们为你找到了答案。我们控制了长度和 markdown 的影响,果然,排名发生了变化。这只是我们迈向更大目标的第一步——在 Chatbot Arena 排行榜中厘清实质与风格。
快来看看下面的结果! 风格确实对模型在排行榜上的表现有强烈影响。这很合理——从人类偏好的角度来看,重要的不只是你说了什么,还有你怎么说。但现在,我们有办法将写作风格的影响与内容分离开来,让你能分别看到两者的效果。
在控制长度和风格后,我们发现排名出现了明显变化。GPT-4o-mini 和 Grok-2-mini 跌至大多数前沿模型之下,而 Claude 3.5 Sonnet、Opus 和 Llama-3.1-405B 则大幅上升。在 Hard Prompt 子集中,Claude 3.5 Sonnet 与 chatgpt-4o-latest 并列第一,Llama-3.1-405B 攀升至第三。我们期待看到社区如何利用这个新工具来分离风格与实质!
总排名 + 风格控制

图 1. Chatbot Arena 总排名 vs 对回答长度、markdown 标题数量、markdown 加粗数量以及 markdown 列表元素数量进行“控制”后的 Chatbot Arena 总排名。
Hard Prompt 排名 + 风格控制

图 2. Hard Prompt 类别排名 vs 对回答长度、markdown 标题数量、markdown 加粗数量以及 markdown 列表元素数量进行“控制”后的 Hard Prompt 类别排名。
带风格控制的完整排行榜

请通过以下链接查看排行榜和 colab notebook。我们很快会将风格控制推广到所有类别。敬请期待!
方法论
高层思路。 这里的目标是理解风格与实质对 Arena Score 的影响。考虑模型 A 和 B。模型 A 擅长生成代码、事实性且无偏见的回答等,但它的输出简短扼要。模型 B 在实质方面(例如正确性)不那么出色,但它输出漂亮的 markdown,并给出冗长、详尽、华丽的回答。模型 A 和模型 B,哪个更好?
答案不是一维的。模型 A 在实质方面更好,模型 B 在风格方面更好。理想情况下,我们希望能有一种方法来区分这两者:捕捉模型的 Arena Score 中有多少来自实质,多少来自风格。
我们的方法是朝着这个目标迈出的第一步。我们在 Bradley-Terry 回归中明确将风格建模为自变量。例如,我们加入了长度作为特征——就像每个模型一样,长度差异也有它自己的 Arena Score!通过这样做,我们期望每个模型的 Arena Score 能反映其真实实力,同时控制长度的影响。
请阅读下文了解技术细节。我们不仅控制了长度,还控制了一些其他风格特征。作为第一个版本,我们提议控制
- 回答 token 长度
- markdown 标题数量
- markdown 加粗元素数量
- markdown 列表数量
我们在 google colab 上公开发布了包含投票和风格元素的数据以及代码!你现在就可以尝试风格控制的实验。更多改进即将到来,如果你想帮助贡献,请联系我们!
背景。 为了得出上述结果,我们通过在 Bradley-Terry 回归中加入额外的“风格特征”来控制风格的影响。这是统计学中的一种标准技术,最近已被用于 LLM 评估中 [1]。此外,有研究表明人类对“漂亮”和更详细的回答可能存在偏见 [2, 3]。其思路是,通过在回归中包含任何混杂变量(例如回答长度),我们可以将强度的任何增加归因于混杂因素,而不是模型。这样,Bradley-Terry 系数将更能反映模型的内在能力,而不是可能的混杂因素。混杂因素的定义在某种程度上取决于我们的解释;作为风格特征,我们使用回答长度的(归一化)差异、Markdown 标题的数量以及列表的数量。
更正式地说,考虑向量 X1,…,Xn∈RM 和 Y1,…,Yn∈{0,1},其中 n 是对战次数,M 是模型数量。
对于每个 i∈[n],当且仅当模型 m∈[M] 是 Chatbot Arena 中显示在左侧的模型时,Xi,m=1;当且仅当它显示在右侧时,Xi,m=−1。也就是说,Xi 是一个有两个非零元素的向量。如果左侧模型获胜,结果 Yi 取值为 Yi=1,否则为 Yi=0。
计算 Arena Score(即 Bradley-Terry 系数,我们之前称之为 Elo 分数)的标准方法是对 Yi 关于 Xi 进行逻辑回归。也就是说,对于每个模型 m,我们关联一个标量 β^m 来描述其强度,向量 β^ 通过求解以下逻辑回归来确定:
β^=argminβ∈RM1n∑i=1nBCELoss(sigmoid(Xi⊤β),Yi)
其中 BCELoss 表示二元交叉熵损失。(在实践中,我们还会重新加权该目标以处理非均匀的模型采样,但我们现在先忽略这一点。)
风格控制
现在,对于每次对战 i∈[n],假设除了 Xi 之外,我们还观察到一些额外的风格特征 Zi∈RS。这些风格特征可以简单也可以复杂,随你所需。例如,Zi 可以只是两个模型回答长度的差异,此时 S=1。或者,我们可以有 S>1 并包含其他与风格相关的特征,例如 Markdown 标题的数量、与拒绝相关的常见词,甚至是由模型自动提取的风格特征!
在这里,我们将每个风格特征定义为 normalize (featureA−featureBfeatureA+featureB)
例如,第一个新特征,即回答 A 和回答 B 之间的 token 长度差异,可以表示为 normalize (lengthA−lengthBlengthA+lengthB)
我们将差值除以两个答案 token 长度之和,使长度差与成对答案的 token 长度成比例。一个 500 token 的答案与一个 520 token 的答案在长度上大致相当,而一个 20 token 的答案与一个 40 token 的答案则差异很大,尽管两种情况下差值都是 20 token。另一种方法是,AlpacaEval LC 使用以下归一化技术。
tanh(featureA−featureB)σ(featureA−featureB))。
风格控制的想法非常基本。我们执行与之前相同的逻辑回归,但加入一些额外的、可加的風格系数: β^,γ^=argminβ∈RM,γ∈RS1n∑i=1nBCELoss(sigmoid(Xi⊤β+Zi⊤γ),Yi). 我们将结果 β^ 和 γ^ 分别称为“模型系数”和“风格系数”。模型系数与之前的解释相同;然而,它们是在控制了风格效应的情况下得到的,而风格效应由风格系数显式建模!
当风格系数很大时,意味着风格特征对响应有很大影响。要定义“大”,你需要对风格系数进行适当的归一化,以便它们可以相互比较。总而言之,在分析风格系数时,我们发现长度是主导的风格因素。所有其他 markdown 效应都是二阶的。
我们报告在不同风格控制方法下,每个风格属性的以下系数。
| 长度 | Markdown 列表 | Markdown 标题 | Markdown 粗体 | |
|---|---|---|---|---|
| 同时控制 | 0.249 | 0.031 | 0.024 | 0.019 |
| 仅控制 Markdown | - | 0.111 | 0.044 | 0.056 |
| 仅控制长度 | 0.267 | - | - | - |
消融
接下来,我们比较仅控制答案长度、仅控制 markdown 元素以及同时控制两者时的排名变化。我们首先展示 Chatbot Arena 总体表。
| 模型 | 排名差异(仅长度) | 排名差异(仅 Markdown) | 排名差异(两者) |
|---|---|---|---|
| chatgpt-4o-latest | 1->1 | 1->1 | 1->1 |
| gemini-1.5-pro-exp-0827 | 2->2 | 2->2 | 2->2 |
| gemini-1.5-pro-exp-0801 | 2->2 | 2->2 | 2->2 |
| gpt-4o-2024-05-13 | 5->3 | 5->3 | 5->2 |
| claude-3-5-sonnet-20240620 | 6->5 | 6->4 | 6->4 |
| gemini-advanced-0514 | 7->5 | 7->8 | 7->6 |
| grok-2-2024-08-13 | 2->4 | 2->4 | 2->5 |
| llama-3.1-405b-instruct | 6->6 | 6->4 | 6->6 |
| gpt-4o-2024-08-06 | 7->6 | 7->8 | 7->6 |
| gpt-4-turbo-2024-04-09 | 11->8 | 11->8 | 11->9 |
| claude-3-opus-20240229 | 16->14 | 16->8 | 16->10 |
| gemini-1.5-pro-api-0514 | 10->8 | 10->13 | 10->10 |
| gemini-1.5-flash-exp-0827 | 6->8 | 6->9 | 6->9 |
| gpt-4-1106-preview | 16->14 | 16->8 | 16->11 |
| gpt-4o-mini-2024-07-18 | 6->8 | 6->11 | 6->11 |
| gpt-4-0125-preview | 17->14 | 17->12 | 17->13 |
| mistral-large-2407 | 16->14 | 16->13 | 16->13 |
| athene-70b-0725 | 16->16 | 16->17 | 16->17 |
| grok-2-mini-2024-08-13 | 6->15 | 6->15 | 6->18 |
| gemini-1.5-pro-api-0409-preview | 11->16 | 11->21 | 11->18 |
我们还在 Chatbot Arena 困难提示类别上进行了相同的比较。
| 模型 | 排名差异(仅长度) | 排名差异(仅 Markdown) | 排名差异(两者) |
|---|---|---|---|
| chatgpt-4o-latest | 1->1 | 1->1 | 1->1 |
| claude-3-5-sonnet-20240620 | 2->2 | 2->1 | 2->1 |
| gemini-1.5-pro-exp-0827 | 2->2 | 2->2 | 2->1 |
| gemini-1.5-pro-exp-0801 | 2->3 | 2->3 | 2->3 |
| gpt-4o-2024-05-13 | 2->2 | 2->2 | 2->3 |
| llama-3.1-405b-instruct | 4->4 | 4->2 | 4->3 |
| grok-2-2024-08-13 | 2->3 | 2->3 | 2->4 |
| gemini-1.5-flash-exp-0827 | 4->4 | 4->6 | 4->4 |
| gemini-1.5-pro-api-0514 | 7->6 | 7->7 | 7->7 |
| gpt-4o-2024-08-06 | 4->4 | 4->6 | 4->4 |
| gemini-advanced-0514 | 9->7 | 9->7 | 9->7 |
| claude-3-opus-20240229 | 14->7 | 14->7 | 14->7 |
| mistral-large-2407 | 7->7 | 7->6 | 7->7 |
| gpt-4-1106-preview | 11->10 | 11->7 | 11->7 |
| gpt-4-turbo-2024-04-09 | 9->7 | 9->7 | 9->7 |
| athene-70b-0725 | 11->7 | 11->8 | 11->7 |
| gpt-4o-mini-2024-07-18 | 4->7 | 4->7 | 4->11 |
| gpt-4-0125-preview | 15->14 | 15->10 | 15->13 |
| grok-2-mini-2024-08-13 | 5->12 | 5->8 | 5->13 |
| deepseek-coder-v2-0724 | 16->14 | 16->13 | 16->14 |
局限性与未来工作
我们希望继续构建一个流程,以在竞技场中区分风格与实质。尽管控制风格是向前迈出的一大步,但我们的分析仍然是观察性的。可能存在未观察到的混杂因素,例如长度与实质质量之间的正相关,这些因素未被我们的研究考虑在内。例如,一个可能同时正向影响长度和质量的未观察混杂因素的著名例子是推理问题的思维链解释。
为了解决这些局限性,我们期待在流程中引入因果推断,并开展前瞻性随机试验,以评估长度、markdown 等因素的影响。随着我们不断改进系统和优化分析,我们的风格控制流程也将发生变化。敬请关注,如果你想提供帮助,请告诉我们!
参考文献
[1] Dubois 等,“Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators”,arXiv 预印本
[2] Chen 等,“Humans or LLMs as the Judge? A Study on Judgement Bias”,arXiv 预印本
[3] Park 等,“Disentangling Length from Quality in Direct Preference Optimization”,arXiv 预印本
引用
@misc{chiang2024chatbot,
title={Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference},
author={Wei-Lin Chiang and Lianmin Zheng and Ying Sheng and Anastasios Nikolas Angelopoulos and Tianle Li and Dacheng Li and Hao Zhang and Banghua Zhu and Michael Jordan and Joseph E. Gonzalez and Ion Stoica},
year={2024},
eprint={2403.04132},
archivePrefix={arXiv},
primaryClass={cs.AI}
}
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org