研究:安全对齐蒸馏可传播后门
热点事件持续更新
研究:安全对齐蒸馏可传播后门
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Jian Luo 等作者发表论文称,安全对齐但被植入后门的教师模型可通过 on-policy 蒸馏(OPD)把隐藏恶意行为传给原本干净的学生模型。据其威胁模型,投毒率低至 3% 时,蒸馏后学生的攻击成功率(ASR)最高达 70%;仅用 10 个投毒样本,训练 16 轮后 ASR 即达 67%。论文同时提出 Lazy Defense 作为缓解方法。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
安全对齐的 on-policy 蒸馏会传播后门吗?3% 投毒率可达 70% 攻击成功率报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LG安全对齐的 on-policy 蒸馏会传播后门吗?3% 投毒率可达 70% 攻击成功率
研究发现,安全对齐但被植入后门的教师模型可通过 on-policy 蒸馏(OPD)将隐藏恶意行为传给原本干净的学生模型,投毒率低至 3% 时学生攻击成功率(ASR)最高达 70%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。