跳到正文
热点事件持续更新

研究提出认证式机制编辑方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Md Sazid Uddin 等作者发表论文,提出“认证式机制编辑”,声称能证明性地保证:在连续嵌入空间的某个区域内禁用一条回路,会移除一项技能,同时保留另一项技能,即信息流安全意义上的特征不干扰保证。 该方法从玩具 ReLU 网络验证到标准 softmax + LayerNorm Transformer,并借助可靠的边界传播,将可处理的输入扰动维度提升约 9 倍。 作者同时说明,这些保证只在小规模、标准架构网络上成立,且与任何移除主张一样,前提是目标技能存在可判定的规格,而现实中的危害未必具备这一性质。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    认证式机制编辑:技能移除与保留的行为保证

    研究者提出"认证式机制编辑",可证明性地保证在连续嵌入空间区域内禁用某回路即移除一项技能、同时保留另一项技能,从玩具 ReLU 网络一路验证到标准 softmax + LayerNorm Transformer,并借助可靠的边界传播将可处理的输入扰动维度提升约 9 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。