TARE:用未投毒孪生模型度量后门防御代价
热点事件持续更新
TARE:用未投毒孪生模型度量后门防御代价
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究提出 TARE,用同一配方、调度和种子训练的未投毒孪生模型来度量后门防御的"剥离代价"(tare):在 BackdoorBench 上(≤10 张中毒图、仅攻击成功率低于 5% 的结果被采纳),孪生模型损失的准确率即为 tare。作者称,在 WaNet、BPP、Input-Aware 的攻击配置中 MultiStepLR 从未触发,导致受害模型从未退火,在 30/31 个公开 CIFAR 单元中准确率最低(≤5%)。 作者发布了三键补丁、带签名的 tare 列(7 种攻击 × 8 种防御)以及面向种子稳定防御的无孪生估计器 TARE-Z。作者还称,在同一种攻击内部起点在排名中会相互抵消,因此 tare 不改变该攻击内的排序;投毒在 tare 之外额外造成的影响按两种估计器列出,且未作校正,其中可归因于投毒去除的份额尚未确定。
AI 根据报道生成 · 3 小时前更新
最新进展10月7日 12:00
TARE:用未中毒孪生模型重新度量后门防御的真实代价报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AITARE:用未中毒孪生模型重新度量后门防御的真实代价
研究提出 TARE,用同一配方、调度和种子训练的未中毒孪生模型来度量后门防御的"剥离代价"(tare);发现 BackdoorBench 上 WaNet、BPP、Input-Aware 的攻击配置中 MultiStepLR 从未触发,导致受害模型从未退火、在 30/31 个公开 CIFAR 单元中准确率最低(≤5%)。
本事件热度走势
- 可比范围当前
- 9
- 可比范围峰值
- 910月7日 14:00
- 近 24 小时变化
- –
02.557.510
14:0015:0016:00
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。