跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分45

Anthropic 可解释性团队发布注意力机制研究进展:发现注意力叠加与跨层表示证据

Progress on Attention An update on our progress studying attention.

AI 导读

Anthropic 可解释性团队报告在真实语言模型中发现注意力叠加(attention superposition)与跨层注意力表示的显著证据,并提出 Multi-Token Transcoders 作为研究 QK 与 OV 条件耦合的实用方法。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub