跳到正文
热点事件持续更新

多轮对话后门攻击:模型自生成触发词

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

arXiv 论文(arXiv:2610.07723)提出一种针对多轮对话大语言模型的答案侧后门攻击。攻击者先用良性首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发器;当后续有害查询到来时,模型会绕过安全拒绝,而用户输入始终干净。作者 Yibo Zhang 等人称,该攻击挑战了以往假设,此前人们认为用户输入干净即可避免后门触发。 目前这是论文提出的方法,尚无实际攻击效果被独立验证的报道。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    arXiv 论文提出多轮对话中的答案侧后门攻击,触发词由模型自生成

    arXiv 论文(arXiv:2610.07723)提出针对多轮对话 LLM 的答案侧后门攻击:攻击者用良性首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后成为触发器,后续有害查询到来时模型绕过安全拒绝,而用户输入始终干净。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。