Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分45
Anthropic 可解释性团队发布注意力机制研究进展:发现注意力叠加与跨层表示证据
Progress on Attention An update on our progress studying attention.
AI 导读
Anthropic 可解释性团队报告在真实语言模型中发现注意力叠加(attention superposition)与跨层注意力表示的显著证据,并提出 Multi-Token Transcoders 作为研究 QK 与 OV 条件耦合的实用方法。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub