研究:近乎持平的LLM排名对基准组成敏感
热点事件持续更新
研究:近乎持平的LLM排名对基准组成敏感
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一项基于五个基准题级响应的研究发现,当跨模型家族差距不足一个百分点时,基准重组后30.9%–47.1%的模型对会出现排名反转,远超随机子采样的中位数16.9–28.6个百分点(p=.001)。作者Qiaoyuan Zheng与Yiqu Yang据此指出,小幅榜单差距常被解读为某模型更优,但其方向可能取决于基准包含哪些题目。 五个基准中仅第五个未出现显著超额反转(-0.9个百分点,p=.689)。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
近乎持平的 LLM 排名对 Family-DIF 引导的基准重组是否稳健?报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.CL近乎持平的 LLM 排名对 Family-DIF 引导的基准重组是否稳健?
一项基于五个基准题级响应的研究发现,跨模型家族差距不足一个百分点时,30.9%–47.1% 的模型对会在基准重组后排名反转,远超随机子采样的中位数 16.9–28.6 个百分点(p=.001),仅第五个基准未见显著超额(-0.9 个百分点,p=.689)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。