多轮对话后门攻击:模型自生成触发词
热点事件持续更新
多轮对话后门攻击:模型自生成触发词
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
arXiv 论文(arXiv:2610.07723)提出一种针对多轮对话大语言模型的答案侧后门攻击。攻击者先用良性首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发器;当后续有害查询到来时,模型会绕过安全拒绝,而用户输入始终干净。作者 Yibo Zhang 等人称,该攻击挑战了以往假设,此前人们认为用户输入干净即可避免后门触发。 目前这是论文提出的方法,尚无实际攻击效果被独立验证的报道。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
arXiv 论文提出多轮对话中的答案侧后门攻击,触发词由模型自生成报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGarXiv 论文提出多轮对话中的答案侧后门攻击,触发词由模型自生成
arXiv 论文(arXiv:2610.07723)提出针对多轮对话 LLM 的答案侧后门攻击:攻击者用良性首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后成为触发器,后续有害查询到来时模型绕过安全拒绝,而用户输入始终干净。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。