跳到正文
热点事件持续更新

研究:恶意微调防御在持续训练下失效

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

一项 arXiv 论文测试了六种针对恶意微调的对齐防御,在四个开源权重模型上将同一有害数据微调攻击延长到三个 epoch,结果显示全部 72 次防御运行结束时模型有害性都高于发布时。Llama-3.1 在最高学习率下,带防御模型几乎与无防御模型一样有害。 作者 Itay Zloczower 等称,十五种近期防御共享同一弱点:都建立在有限的攻击者模型上,权重发布后保护无法持续,目前不应视为可靠防护。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    研究显示针对恶意微调的对齐防御在持续训练下会失效

    arXiv 论文测试了六种防御在四个开源权重模型上的表现,将同一有害数据微调攻击延长到三个 epoch 后,全部 72 次防御运行结束时模型有害性都高于发布时,Llama-3.1 在最高学习率下防御模型几乎与无防御模型一样有害。作者指出十五种近期防御共享同一弱点,即都建立在有限的攻击者模型上,权重发布后保护无法持续,目前不应视为可靠防护。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。