跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分41

Anthropic 可解释性团队 Circuits Updates(2024 年 1 月):注意力叠加、字典学习与 MNIST 模型稀疏特征

Circuits Updates — January 2024 A collection of small updates from the Anthropic Interpretability Team.

AI 导读

Anthropic 可解释性团队发布 2024 年 1 月 Circuits Updates,汇总注意力叠加、字典学习等阶段性研究。团队未来数月将聚焦三个方向:字典学习的规模化与科学化、用字典学习攻击真实模型中的注意力叠加、以及在此基础上理解电路。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub