跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 2 小时前精选AI 评分76

LMSYS 发布 LLM decontaminator:改写测试样本即可让 13B 模型在 MMLU 等基准上接近 GPT-4

Blog Catch me if you can! How to beat GPT-4 with a 13B model Announcing Llama-rephraser: 13B models reaching GPT-4 performance in major benchmarks (MMLU/GSK-8K/HumanEval)! To ensure result validity, we followed OpenAI's decontamination method and found no evid... Shuo Yang, Wei-Lin Chiang, Lianmin Zheng, Joseph E. Gonzalez, Ion Stoica Nov 14, 2023

AI 导读

LMSYS 团队发现,将 MMLU、GSM-8K、HumanEval 等基准的测试样本改写或翻译后混入训练集,13B 模型即可大幅刷高分数(如 MMLU 85.9),而 n-gram 重叠和嵌入相似度等现有检测方法均无法发现这种污染。

推荐理由

原文用改写测试集让 13B 模型刷高基准的实验,说明现有去污染检测手段的盲区,并给出开源检测工具。

正文 · AI 翻译

Shuo Yang*、Wei-Lin Chiang*、Lianmin Zheng*、Joseph E. Gonzalez、Ion Stoica2023年11月14日

宣布 Llama-rephraser:13B 模型在主要基准测试(MMLU/GSK-8K/HumanEval)中达到 GPT-4 性能! 为确保结果有效性,我们遵循 OpenAI 的去污染方法,未发现数据污染的证据。

背后的诀窍是什么?其实,你只需要改写测试集!我们只是对测试样本进行改写,或将其翻译成另一种语言。事实证明,一个 13B 的 LLM 足够聪明,能够“泛化”到这些变体之外,并达到极高的基准性能。那么,我们是不是刚刚取得了重大突破?显然,我们对污染的理解存在问题。

在这篇博客文章中,我们指出了为什么污染仍然被理解不足,以及现有的去污染措施为何无法捕捉这些细微差别。为应对此类风险,我们提出了一种更强的基于 LLM 的去污染器,并将其应用于真实世界的训练数据集(例如 Stack、RedPajama),揭示了与广泛使用的基准测试存在显著测试重叠。 如需更多技术细节,请参阅我们的论文。

现有去污染措施有什么问题?

当测试集信息泄露到训练集中时,就会发生污染,导致对模型性能的估计过于乐观。 尽管这已被认为是一个关键问题,但理解和检测污染仍然是一个开放且具有挑战性的问题。

最常用的方法是 n-gram 重叠和嵌入相似性搜索。 n-gram 重叠依赖字符串匹配来检测污染,被 GPT-4、PaLM 和 Llama-2 等领先开发工作广泛使用。 嵌入相似性搜索使用预训练模型(例如 BERT)的嵌入来寻找相似且可能被污染的样本。

然而,我们表明,测试数据的简单变体(例如改写、翻译)可以轻松绕过现有的简单检测方法。 我们将此类测试用例的变体称为改写样本。

下面我们展示一个来自 MMLU 基准测试的改写样本。我们表明,如果此类样本被包含在训练集中,一个 13B 模型可以达到极高的性能(MMLU 85.9)。 不幸的是,现有的检测方法(例如 n-gram 重叠、嵌入相似性)无法检测出此类污染。嵌入相似性方法难以将改写后的问题与同一学科(高中美国历史)中的其他问题区分开来。

借助类似的改写技术,我们在广泛使用的编码和数学基准测试(如 HumanEval 和 GSM-8K)中观察到一致的结果(如封面图所示)。因此,能够检测出此类改写样本变得至关重要。

更强的检测方法:LLM 去污染器

为应对可能的污染风险,我们提出了一种新的污染检测方法“LLM 去污染器”。

这个 LLM 去污染器包括两个步骤:

  1. 对于每个测试用例,LLM 去污染器使用嵌入相似性搜索识别出相似度最高的前 k 个训练项。
  2. 从这些项中,LLM 去污染器生成 k 个潜在的改写对。每个对都使用先进的 LLM(如 GPT-4)评估其是否为改写。

结果表明,我们提出的 LLM 方法在去除改写样本方面显著优于现有方法。

评估不同的检测方法

为了比较不同的检测方法,我们使用 MMLU 基准构建了 200 对提示,分别来自原始测试集和改写后的测试集。其中包括 100 对随机样本和 100 对改写样本。 这些样本对上的 f1 分数反映了检测方法识别数据污染的能力,分数越高表示检测越精确。 如下表所示,除了 LLM decontaminator 之外,其他所有检测方法都会引入一些误报。改写样本和翻译样本都能成功规避 n-gram 重叠检测。使用 multi-qa BERT 时,嵌入相似度搜索对翻译样本无效。我们提出的 LLM decontaminator 在所有情况下都更为稳健,f1 分数最高。

真实世界数据集中的污染

我们将 LLM decontaminator 应用于广泛使用的真实世界数据集(如 Stack、RedPajama 等),并识别出大量改写样本。下表显示了每个训练数据集中不同基准的污染百分比。

下面我们展示一些检测到的样本。

CodeAlpaca 包含 20K 条由 GPT 生成的指令跟随合成数据,广泛用于指令微调(例如 Tulu)。

下面展示了 CodeAlpaca 中的一个改写示例。

这表明 LLM 生成的合成数据中可能潜藏着污染。在 Phi-1 的报告中,他们也发现了这类语义相似的测试样本,无法通过 n-gram 重叠检测发现。

MATH 是一个广泛认可的数学训练数据集,涵盖代数、几何和数论等多个数学领域。 令人惊讶的是,我们甚至发现 MATH 基准中训练集与测试集之间存在污染,如下所示。

StarCoder-Data 用于训练 StarCoder 和 StarCoderBase,包含 86 种编程语言的 783GB 代码。在 StarCoder 的论文中,代码训练数据通过移除包含 HumanEval 文档字符串或解答的文件进行了去污染。然而,仍有一些样本被 LLM decontaminator 检测到。

使用 LLM Decontaminator 扫描你的数据

基于上述研究,我们建议社区在使用任何公开基准时采用更强的去污染方法。我们提出的 LLM decontaminator 已在 GitHub 上开源。 下面我们展示如何使用 LLM decontaminator 工具从训练数据中移除改写样本。以下示例可在此处找到。

预处理训练数据和测试数据。 LLM decontaminator 接受 jsonl 格式的数据集,每一行对应一个 {"text": data} 条目。

运行端到端检测。 以下命令基于 sentence bert 构建 top-k 相似数据库,并使用 GPT-4 逐一检查它们是否为改写样本。你可以通过修改参数来选择嵌入模型和检测模型。

结论

在这篇博客中,我们表明污染问题仍然没有得到充分理解。通过我们提出的去污染方法,我们揭示了真实世界数据集中此前未知的显著测试重叠。我们鼓励社区重新思考 LLM 语境下的基准测试与污染问题,并在公共基准上评估 LLM 时采用更强的去污染工具。 此外,我们呼吁社区积极开发全新的一次性考试,以准确评估 LLM。欢迎在 Chatbot Arena 了解更多我们正在进行的实时 LLM 评估工作!

致谢

我们要感谢 Ying Sheng 就改写样本进行的早期讨论。 我们还要感谢 Dacheng Li、Erran Li、Hao Liu、Jacob Steinhardt、Hao Zhang 和 Siyuan Zhuang 提供的深刻反馈。

引用

@misc{yang2023rethinking,
      title={Rethinking Benchmark and Contamination for Language Models with Rephrased Samples}, 
      author={Shuo Yang and Wei-Lin Chiang and Lianmin Zheng and Joseph E. Gonzalez and Ion Stoica},
      year={2023},
      eprint={2311.04850},
      archivePrefix={arXiv},
      primaryClass={cs.CL}
}

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org