跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 16 小时前AI 评分39

Anthropic 可解释性团队提出 Turn-Averaged SAE:按对话轮次平均残差流以压缩特征激活

Circuits Updates — June 2026 A short update on turn-averaged sparse autoencoders.

AI 导读

Anthropic 可解释性团队在 Circuits Updates 中介绍了 Turn-Averaged SAE:将单个人类或 Assistant 轮次内所有 token 的残差流平均后训练 SAE,使每轮仅呈现 L0 个激活特征,而非 per-token SAE 的 n_tokens × L0 个。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub