跳到正文
原文
Eugene Yan:Writing·· 15 小时前AI 评分68

Eugene Yan 详解长上下文问答系统评测:指标、数据集与六个基准

Evaluating Long-Context Question & Answer Systems

AI 导读

Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。

来源:Eugene Yan:Writing · eugeneyan.com