跳到正文
热点事件持续更新

研究称互信息无法认证开放权重模型防篡改

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Domenic Rosati 等作者提交论文,称开放权重模型在移除有害信息后,发布时的互信息不足以普遍证明模型能抵抗微调攻击。论文给出的显式构造使两项互信息量均为零,模型仅需一步梯度即可恢复,说明“信息已移除”不等于“抗微调”。 研究指出,保函数的重参数化可在互信息不变的情况下改变梯度下降几何结构,训练顺序能在固定权重-数据互信息下改变恢复时间,表征层面的精确独立甚至可保留全部参数雅可比矩阵。该论文标注为“Under submission AISTATS 2026”,尚未经同行评审确认。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    移除信息内容不能证明开放权重模型的抗篡改能力

    开放权重模型移除有害信息后,其发布时的互信息不足以普遍证明模型能抵抗微调攻击。研究发现,保函数的重参数化可在互信息不变的情况下改变梯度下降几何结构,训练顺序能在固定权重-数据互信息下改变恢复时间,而表征层面的精确独立甚至可保留全部参数雅可比矩阵;论文给出的一种显式构造使两项互信息量均为零,模型仅需一步梯度即可恢复。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。