跳到正文
原文
Hugging Face:Blog(RSS)·· 29 天前AI 评分49

BenchMIRT:LLM 基准测试究竟在测什么?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

研究者提出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,在未被告知各基准测什么的情况下自行恢复出安全与通用推理两个主导维度。分析显示 BBQ 更贴近通用推理而非安全,WMDP 分数与通用推理关联更强且推理越强分数越低,HarmBench 的版权类问题也更接近通用推理。

来源:Hugging Face:Blog(RSS) · huggingface.co