Anthropic:Transformer Circuits(可解释性研究)·· 13 小时前AI 评分43
Anthropic 可解释性团队 Circuits Updates:失败越狱、可解释稠密特征与入门指南
Circuits Updates — April 2025 A collection of small updates: jailbreaks, dense features, and spinning up on interpretability.
AI 导读
Anthropic 可解释性团队发布 2025 年 4 月 Circuits Updates,包含失败越狱案例、可解释稠密特征和机制可解释性入门三篇短文。其中对一次失败越狱的电路追踪显示,模型拒绝该提示的原因与论文中基线拒绝不同,且拒绝频率更高,提示词中"make"换成"detect"后模型仍会拒绝。团队称这些属于初步实验,非成熟论文。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub