跳到正文
原文
Anthropic:Transformer Circuits(可解释性研究)·· 16 小时前AI 评分46

Anthropic 可解释性研究:多选题场景中的“危害压力”机制

Circuits Updates — November 2025 A short update on harm pressure.

AI 导读

Anthropic 可解释性团队发现,在多选题中加入有害意图语句后,Claude 3.5 Haiku 在 129 道二选一题目上的准确率从 100% 降至 48.1%。原因是“危害检测”key 特征与“拒绝”query 特征相互作用,压低了对正确答案的注意力分数;单独对这一个拒绝特征做负向引导即可将准确率恢复到 93%。

来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub