Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分44
Anthropic 可解释性研究:当 transcoder 失灵,机制忠实性的玩具模型
A Toy Model of Mechanistic (Un)Faithfulness When transcoders go awry.
AI 导读
Anthropic 的 Chris Olah 发布非正式笔记,用玩具模型展示 transcoder 的机制不忠实问题:在 x→abs(x) 任务中,模型本身没有对重复数据点 p 的特殊概念,但 transcoder 会学出专门激活并输出 p 的"数据点特征",以不同计算机制实现低 MSE 和单义性。作者提出"Jacobian matching"或可缓解该问题,并强调这仍是初步结果,需低置信度看待。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub