arXiv:cs.CL(计算语言学,全量分类)· Jiayi Li, Ruizhe Li·· 1 天前AI 评分41
SAKIKO:工具调用 LLM 内部干预的机制审计框架
When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs
AI 导读
研究者提出 SAKIKO 审计框架,用于检验工具调用 LLM 的内部激活干预是否构成真正的"修复"。在 When2Call 和 MetaTool 上对七个 LLM 的测试中,通道键控干预在五个模型上带来方向特定的净增益,但 59 个预算匹配的随机方向无一能匹配校准后的目标增益。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org