Anthropic:Transformer Circuits(可解释性研究)·· 16 小时前AI 评分50
Anthropic 推出 HeadVis:可视化语言模型注意力头行为的交互工具
HeadVis We develop an interactive visualization tool to help us understand the behaviors of attention heads in language models.
AI 导读
Anthropic 开源交互式可视化工具 HeadVis,用于研究大语言模型中的注意力头行为,代码已开放并提供 Gemma 3 与 Claude Haiku 3.5 部分注意力头的演示。该工具通过注意力模式、分布指标、低秩分量投影及 QK/OV 电路上的 SAE 特征归因来生成和检验假设,案例研究显示注意力头在全数据分布上的行为常与窄任务表现不同。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub