Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分46
Anthropic 可解释性团队:用字典学习特征训练生物武器危害分类器
Using Dictionary Learning Features as Classifiers A preliminary note comparing feature-based and raw-activation based harmfulness classifiers.
AI 导读
Anthropic 可解释性团队初步实验显示,用字典学习得到的特征激活训练生物武器危害分类器,在部分场景下可媲美甚至超过基于原始激活的线性探针,尤其在合成数据上采用上下文 max-pooling 时表现更优。基于特征的决策树性能较弱但更易解释,可视化线性特征分类器还能发现数据集中的虚假相关并据此构造对抗攻击。不过使用特征显著增加复杂度,原始激活仍是强基线。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub