Weight Oracles:语言模型直接读取神经网络权重
热点事件持续更新
Weight Oracles:语言模型直接读取神经网络权重
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Krishna Kabra 等作者发表论文提出 Weight Oracles:微调语言模型直接读取目标网络的原始权重,以此诊断网络属性,无需行为测试。 在小型 Transformer 上,该方法模拟前向传播的留出准确率达到 99%;在后门检测中,对注意力路由后门取得 AUROC 0.93,对多样化威胁分布取得 0.81。 论文指出,将这一方法扩展到现实模型规模仍是主要未解挑战。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
Weight Oracles:用语言模型直接读取神经网络权重报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGWeight Oracles:用语言模型直接读取神经网络权重
研究者提出 Weight Oracles,即通过微调语言模型直接读取目标网络原始权重来诊断其属性,无需行为测试。该方法在小型 Transformer 上模拟前向传播达到 99% 的留出准确率,并在未见过的后门检测中取得 AUROC 0.93(注意力路由后门)和 0.81(多样化威胁分布)。其扩展到现实模型规模仍是主要未解挑战。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。