跳到正文
热点事件持续更新

LMSYS 揭露基准污染新手法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,LMSYS(Chatbot Arena 团队)发布 LLM decontaminator,指出一种新的基准污染方式:将 MMLU、GSM-8K、HumanEval 等基准的测试样本改写或翻译后混入训练集,13B 模型即可在 MMLU 等基准上大幅刷高分数,例如 MMLU 达到 85.9,接近 GPT-4 水平。该团队同时发现,n-gram 重叠和嵌入相似度等现有污染检测方法均无法发现这种改写或翻译后的污染。目前进展停留在这一发现本身,尚无后续回应或修复方案。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. LMSYS:Blog(Chatbot Arena 团队)精选
    LMSYS 发布 LLM decontaminator:改写测试样本即可让 13B 模型在 MMLU 等基准上接近 GPT-4

    LMSYS 团队发现,将 MMLU、GSM-8K、HumanEval 等基准的测试样本改写或翻译后混入训练集,13B 模型即可大幅刷高分数(如 MMLU 85.9),而 n-gram 重叠和嵌入相似度等现有检测方法均无法发现这种污染。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。