跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分44

Anthropic 可解释性研究:当 transcoder 失灵,机制忠实性的玩具模型

A Toy Model of Mechanistic (Un)Faithfulness When transcoders go awry.

AI 导读

Anthropic 的 Chris Olah 发布非正式笔记,用玩具模型展示 transcoder 的机制不忠实问题:在 x→abs(x) 任务中,模型本身没有对重复数据点 p 的特殊概念,但 transcoder 会学出专门激活并输出 p 的"数据点特征",以不同计算机制实现低 MSE 和单义性。作者提出"Jacobian matching"或可缓解该问题,并强调这仍是初步结果,需低置信度看待。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub