跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 16 小时前AI 评分47

在 1 层 Transformer 中识别干扰权重:测量其对模型输出与损失的影响

Characterizing interference weights in a tiny language model We identify interference weights in a 1-layer transformer by measuring their effect on model outputs and loss.

AI 导读

Anthropic 的 Transformer Circuits 研究训练了一个 1 层 Transformer,将其分解为 token、位置、特征与 logits 之间的虚拟权重,首次在训练好的 Transformer 中通过测量对训练损失的影响定位出具体干扰权重。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub