Anthropic:Transformer Circuits(可解释性研究)·· 16 小时前AI 评分39
Anthropic 可解释性团队提出 Turn-Averaged SAE:按对话轮次平均残差流以压缩特征激活
Circuits Updates — June 2026 A short update on turn-averaged sparse autoencoders.
AI 导读
Anthropic 可解释性团队在 Circuits Updates 中介绍了 Turn-Averaged SAE:将单个人类或 Assistant 轮次内所有 token 的残差流平均后训练 SAE,使每轮仅呈现 L0 个激活特征,而非 per-token SAE 的 n_tokens × L0 个。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub