跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分41

Anthropic 可解释性团队 Circuits Updates:字典学习可解释性评测与 SAE 特征自解释

Circuits Updates — August 2024 A collection of small updates: interpretability evals, reproducing self-explanation.

AI 导读

Anthropic 可解释性团队发布 Circuits Updates,提出两种量化自动可解释性方法,通过测量 Claude 能否借助特征可视化工具准确预测特征激活,来评测字典学习特征的可解释性。其中对比评测用正负句对找出仅对一侧激活的特征,用于衡量特征是否精确对应可解释概念;团队同时给出自解释 SAE 特征的案例研究,并强调这些结果属于初步实验而非成熟论文。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub