LMSYS 推出开源社区红队平台 RedTeam Arena
Blog RedTeam Arena: An Open-Source, Community-driven Jailbreaking Platform We are excited to launch RedTeam Arena, a community-driven redteaming platform, built in collaboration with Pliny and the BASI community! <img src="/images/blog/redteamarena/badwords.png" style="di... Anastasios Angelopoulos, Luca Vivona, Wei-Lin Chiang, Aryan Vichare, Lisa Dunlap, Salvivona, Pliny, Ion Stoica Sep 13, 2024
LMSYS 联合 Pliny 和 BASI 社区推出开源红队平台 RedTeam Arena,首个游戏 Bad Words 挑战玩家在一分钟内诱导模型说出目标“bad words”,已有数千用户参与排行榜竞争。
原文说明了平台玩法、开放入口和 Extended Elo 排行榜的统计设计,读者可了解其与标准 Elo 的样本效率差异。
Anastasios Angelopoulos*、Luca Vivona*、Wei-Lin Chiang*、Aryan Vichare、Lisa Dunlap、Salvivona、Pliny、Ion Stoica2024年9月13日
我们非常激动地推出 RedTeam Arena,这是一个社区驱动的红队测试平台,由我们与 Pliny 以及 BASI 社区合作构建!

图 1:RedTeam Arena 中的 Bad Words,网址为 redarena.ai
RedTeam Arena 是一个面向 LLM 的开源红队测试平台。我们的计划是提供一些游戏,让人们既能玩得开心,又能磨练自己的红队测试技能。我们创建的第一个游戏叫做Bad Words,挑战玩家说服模型说出目标“坏词”。它已经获得了社区的广泛采用,有数千名用户参与,并争夺越狱者排行榜的榜首。
我们计划在短暂的责任披露延迟后开放数据。我们希望这些数据能帮助社区确定 AI 模型的边界——它们如何被控制和说服。
这不是漏洞赏金计划,也不是你奶奶那个年代的越狱竞技场。我们的目标是服务并壮大红队测试社区。让它成为有史以来最大规模的众包红队测试行动之一。在我们看来,容易被说服的模型并不更差:它们只是更可控,对说服的抵抗力更低。根据你的用例,这可能是好事也可能是坏事;这不是非黑即白的。
我们需要你的帮助。来 redarena.ai 加入我们的越狱游戏吧。所有代码都在 Github 上开源。你可以在 Discord 上提出问题并发送反馈。欢迎在 X 上提出新游戏或新的坏词(只需 @lmsysorg 和 @elder_plinius,这样我们就能看到)!
排行榜:扩展 Elo

图 2. 排行榜截图。最新版本见 redarena.ai/leaderboard
人们一直在问我们如何计算玩家、模型和提示词的排行榜。思路是将每一轮 Bad Words 视为玩家与(提示词、模型)组合之间的 1v1 对战,并计算相应的 Elo 分数。天真地这样做样本效率低下,会导致收敛缓慢,因此我们为此设计了一种新的统计方法(文章即将发布!),下面我们将进行描述。
观测模型。设 T 为对战数(“时间步”),M 为模型数,P 为玩家数,R 为提示词数。对于每场对战 i∈[n],我们有一个玩家、一个模型和一个提示词,编码如下:
- XiModel∈{0,1}M,一个 one-hot 向量,在对战 i 中采样到的模型对应条目上为 1。
- XiPlayer∈{0,1}P,一个 one-hot 向量,在对战 i 中玩家对应条目上为 1。
- XiPrompt∈{0,1}R,一个 one-hot 向量,在对战 i 中采样到的提示词对应条目上为 1。
- Yi∈{0,1},一个二元结果,如果玩家获胜(或弃权)则取值为 1,否则为 0。
然后我们将玩家的获胜概率建模为
P(Yi=1∣XiModel,XiPlayer,XiPrompt)=eXiPlayerβPlayereXiPlayerβPlayer+eXiModelβModel+XiPromptβPrompt.
这个形式可能看起来很熟悉,因为它与 Arena Score 是同一类型的模型:逻辑模型。这只是一个具有不同加性结构的逻辑模型——模型得分 βModel 和提示得分 βPrompt 以加性方式结合,生成模型-提示对的总强度概念。玩家得分 βPlayer 的解释与标准 Elo 得分类似,我们让 β 表示拼接 (βPlayer,βModel,βPrompt)。由于没有更好的术语,我们将此模型称为“扩展 Elo”。
这个新模型解决了旧 Elo 算法无法解决的什么问题?答案在于估计的效率。标准 Elo 算法可以通过简单地将每个模型-提示对视为一个不同的“对手”来计算排行榜,从而应用于我们的设置。然而,这种方法有两个问题: 它无法区分提示的有效性与模型的有效性。该对只有一个系数。相反,扩展 Elo 可以为每个子部分分配强度。 有 M×R 个模型-提示对,而只有 M+R 个不同的模型和提示。因此,如果 M 和 R 按比例增长,渐近地,扩展 Elo 过程比标准 Elo 过程节省二次方的样本量。
现在,我们在线解决这个逻辑回归问题。也就是说,让 ℓ(x,y;β) 为二元交叉熵损失,我们使用迭代
βn=βn−1−η∇βℓ(Xn−1,Yn−1;βn−1),
对于某个学习率 η。 这是 Elo 更新的推广。事实上,如果去掉提示系数,它就完全简化为玩家和模型之间的 Elo 更新,就像这些是 1-1 比赛一样。
就是这样!在以这种方式更新模型系数后,我们在 RedTeam Arena 的表格中报告它们。我们对此方法还有更多计划:扩展 Elo 不仅可以用于像这样的 1v2 排行榜,还可以用于任何 NvM 玩家排行榜,以便使用二元人类偏好反馈将强度概念归因于每个子部分。
接下来是什么?
RedTeam Arena 是一个社区驱动的项目,我们渴望在您的帮助下进一步发展它!无论是通过提出 Github 问题、在此处创建 PR,还是在 Discord 上提供反馈,我们都欢迎您的所有贡献!
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org