跳到正文
热点事件持续更新

研究发布LLM检索鲁棒性评测基准与指标

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Shuyang Cao等作者发布了一个LLM检索鲁棒性评测基准,覆盖五个数据集、1891个样本、三类任务,每个样本的文档分别用稀疏和稠密检索器获取,并提出三项对应研究问题的鲁棒性指标。 用该基准评估11个LLM在RAG场景下的表现,结果显示模型整体鲁棒性较高,但跨任务差异显著,是否采用RAG需视具体场景而定。Qwen和GPT模型在关闭推理时鲁棒性明显下降;将检索文档作为工具响应可提升Claude模型,但会损害Qwen和GPT模型。

AI 根据报道生成 · 1 小时前更新

最新进展10月5日 12:00
评估大语言模型的检索鲁棒性

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    评估大语言模型的检索鲁棒性

    研究构建了覆盖五个数据集、1891 个样本的基准,用稀疏和稠密检索器评估 11 个 LLM 在 RAG 场景下的检索鲁棒性,并提出三项对应研究问题的鲁棒性指标。结果显示模型整体鲁棒性较高,但跨任务差异显著,是否采用 RAG 需视具体场景而定。Qwen 和 GPT 模型在关闭推理时鲁棒性明显下降,将检索文档作为工具响应可提升 Claude 模型但会损害 Qwen 和 GPT 模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。