Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分47
Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征更稠密多义的初步发现
Insights on Crosscoder Model Diffing A preliminary note on using crosscoders to diff models.
AI 导读
Anthropic 可解释性团队发现,crosscoder 模型差异分析中仅属于单一模型的特征往往更稠密、更多义,激活频率比共享特征高约一个数量级,原因可能是共享特征已能解释两个模型的神经元激活,独占特征需编码更多信息才能争取到特征容量。团队提出给一小部分指定共享特征降低稀疏惩罚的缓解策略,使独占特征更易解释、更单义,并在真实模型上成功分离出可解释的行为差异特征。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub