跳到正文
热点事件持续更新

Weight Oracles:语言模型直接读取神经网络权重

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Krishna Kabra 等作者发表论文提出 Weight Oracles:微调语言模型直接读取目标网络的原始权重,以此诊断网络属性,无需行为测试。 在小型 Transformer 上,该方法模拟前向传播的留出准确率达到 99%;在后门检测中,对注意力路由后门取得 AUROC 0.93,对多样化威胁分布取得 0.81。 论文指出,将这一方法扩展到现实模型规模仍是主要未解挑战。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    Weight Oracles:用语言模型直接读取神经网络权重

    研究者提出 Weight Oracles,即通过微调语言模型直接读取目标网络原始权重来诊断其属性,无需行为测试。该方法在小型 Transformer 上模拟前向传播达到 99% 的留出准确率,并在未见过的后门检测中取得 AUROC 0.93(注意力路由后门)和 0.81(多样化威胁分布)。其扩展到现实模型规模仍是主要未解挑战。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。