跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Hui Dai, Lina Piao, Nick Merrill, Nadja Flechner, Ezra Karger, Haifeng Xu·· 1 天前AI 评分42

CruxBench:一个信息发现基准

CruxBench: A Benchmark of Information Discovery

AI 导读

研究者提出 CruxBench,一个按信息价值(VOI)给 LLM 生成问题打分的基准,衡量模型提出的关键子问题能在多大程度上更新对目标预测问题的信念。该基准抗污染、开放式且基于真实世界信念变化,在 293 个预测问题上评测了 8 个模型,VOI 与独立能力指标相关性达 r=0.90,但前沿 LLM 仅略微超过随机时机基线。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org