研究提出认证式机制编辑方法
热点事件持续更新
研究提出认证式机制编辑方法
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Md Sazid Uddin 等作者发表论文,提出“认证式机制编辑”,声称能证明性地保证:在连续嵌入空间的某个区域内禁用一条回路,会移除一项技能,同时保留另一项技能,即信息流安全意义上的特征不干扰保证。 该方法从玩具 ReLU 网络验证到标准 softmax + LayerNorm Transformer,并借助可靠的边界传播,将可处理的输入扰动维度提升约 9 倍。 作者同时说明,这些保证只在小规模、标准架构网络上成立,且与任何移除主张一样,前提是目标技能存在可判定的规格,而现实中的危害未必具备这一性质。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
认证式机制编辑:技能移除与保留的行为保证报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LG认证式机制编辑:技能移除与保留的行为保证
研究者提出"认证式机制编辑",可证明性地保证在连续嵌入空间区域内禁用某回路即移除一项技能、同时保留另一项技能,从玩具 ReLU 网络一路验证到标准 softmax + LayerNorm Transformer,并借助可靠的边界传播将可处理的输入扰动维度提升约 9 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。