Anthropic:Transformer Circuits(可解释性研究)·· 15 小时前AI 评分58
Anthropic 提出 Activation Oracles:训练 LLM 用自然语言回答关于自身激活的问题
Circuits Cross-Post — Activation Oracles We train language models to answer questions about their own activations in natural language.
AI 导读
Anthropic 等机构训练 Activation Oracles(AO),将 LLM 激活作为额外输入模态,用自然语言回答关于目标模型激活的任意问题。在 4 个下游审计任务中,AO 在 3 个上匹配或超过最佳已有方法,可发现微调引入的秘密知识或失智倾向,且训练仅用微调前的原始模型激活;性能随训练数据数量与多样性提升。论文与代码、Demo 已开放。
来源:Anthropic:Transformer Circuits(可解释性研究) · alignment.anthropic.com