跳到正文
热点事件持续更新

发布多轮不可回答性基准与探针评估

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

Jerzy Kamiński 等作者提交预印本论文,发布一个按轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户(可回答澄清问题)的评测框架,用六个数据集和六个开源权重 LLM 检验大语言模型潜空间“无法回答”信号的泛化能力。 作者称,在共享同一不可回答依据的数据集之间,探针迁移稳健:数学缺失信息场景 AUROC 为 0.77–0.97,段落缺失场景(SQuAD 2.0 与 MuSiQue 互迁)为 0.77–0.90;但单轮探针零样本无法检测对话何时变得可回答,结构内探针虽能恢复该能力,却不优于词袋分类器。作者还称,对校准后探针加一个门控、无需微调模型,就能以远高于随机的精度在欠明确轮次触发,其端任务成功率与使用真实标签的门控相差不超过 0.08;不过在四个模型上,它未能稳定胜过原始生成或提示式整合。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    大语言模型潜空间"无法回答"信号的跨域与多轮泛化研究

    研究者构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评测框架,用六个数据集和六个开源权重 LLM 检验"无法回答"探针的泛化能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。