跳到正文
热点事件持续更新

研究提议ASR与意图恢复率联合评估LLM安全

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Haitong Jiang等作者发表论文,提出在LLM安全评估中除攻击成功率(ASR)外,还要报告操作理解率(UR),以区分模型是识别并拒绝了有害任务、未能识别任务,还是答非所问。 论文称,受控英文重构实验显示,提示词越明确,意图恢复率越高,而ASR并不遵循同样规律,说明仅凭ASR会掩盖模型行为差异。作者已公开代码与实验输入。 该提议针对的是当前安全评估普遍只用ASR汇总有害输出行为的做法。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    LLM 安全评估中的意图恢复:相同结果,不同证据

    针对 LLM 安全评估普遍只用攻击成功率(ASR)汇总有害输出行为的问题,研究者提出将 ASR 与操作理解率(UR)配对报告,以区分模型是识别并拒绝了有害任务、未能识别任务,还是答非所问。受控英文重构实验显示,提示词越明确,意图恢复率越高,而 ASR 并不遵循同样规律。代码与实验输入已公开。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。