跳到正文
热点事件持续更新

分类后缀提升激活探针OOD检测

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

arXiv 上 cs.LG 的一篇论文研究在用户轮次后追加分类指令,对 LLM 智能体激活探针恶意输入检测的影响。作者 Elad David 与 Max Fomin 在 13 个安全基准(越狱、注入、良性对话)和 Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B 三个开源模型上,采用严格留一数据集(LODO)评估,发现单点激活探针的分布外检测 AUC 最高提升约 4 点。 论文称增益来自分类格式本身而非具体标准:无内容标签的指令与真实恶意/良性标准效果相当。该收益可延续到生产环境使用的多点池化探针,但最佳后缀取决于模型与读出方式。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    分类后缀如何提升 LLM 智能体激活探针的恶意输入检测

    在 13 个安全基准和 Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B 三个开源模型上,用户轮次后追加分类指令可让单点激活探针的分布外检测 AUC 最高提升约 4 点。增益来自分类格式本身而非具体标准,无内容标签的指令与真实恶意/良性标准效果相当。该收益可延续到生产环境使用的多点池化探针,但最佳后缀取决于模型与读出方式。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。