跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Jiayi Li, Ruizhe Li·· 1 天前AI 评分41

SAKIKO:工具调用 LLM 内部干预的机制审计框架

When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs

AI 导读

研究者提出 SAKIKO 审计框架,用于检验工具调用 LLM 的内部激活干预是否构成真正的"修复"。在 When2Call 和 MetaTool 上对七个 LLM 的测试中,通道键控干预在五个模型上带来方向特定的净增益,但 59 个预算匹配的随机方向无一能匹配校准后的目标增益。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org