Anthropic:Transformer Circuits(可解释性研究)·· 16 小时前AI 评分47
在 1 层 Transformer 中识别干扰权重:测量其对模型输出与损失的影响
Characterizing interference weights in a tiny language model We identify interference weights in a 1-layer transformer by measuring their effect on model outputs and loss.
AI 导读
Anthropic 的 Transformer Circuits 研究训练了一个 1 层 Transformer,将其分解为 token、位置、特征与 logits 之间的虚拟权重,首次在训练好的 Transformer 中通过测量对训练损失的影响定位出具体干扰权重。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub