热点事件持续更新
机制可解释性干预忠实度存在恢复缺口
1 篇报道1 个报道来源13 小时前更新
先了解这件事
AI 综述
2026年10月3日,arXiv cs.LG 发布一项机制可解释性研究,指出干预定义的忠实度指标存在“目标层面恢复缺口”:该指标可能偏好一个规模相同但行为复现更差的电路。研究在四个人类参考任务和 InterpBench 上测试了 EAP、EAP-IG、ACDC 与 Edge-SP,发现四者输出均出现该失败;在重采样下,KL 在人类参考任务上对 9.4%-41.2% 的候选电路对产生错误排序。目前进展限于该预印本报告,尚无后续报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月3日 12:00
arXiv 预印本报告干预式忠实度指标在四类方法上均出现电路排序错误。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- arXiv:cs.LG(机器学习,全量分类)机制可解释性存在目标层面的恢复缺口:干预式忠实度为何会选错电路
机制可解释性研究揭示了一种"目标层面恢复缺口":干预定义的忠实度指标可能偏好一个规模相同但行为复现更差的电路。在四个人类参考任务和 InterpBench 上,EAP、EAP-IG、ACDC 与 Edge-SP 的输出均出现该失败,重采样下 KL 在人类参考任务上对 9.4%-41.2% 的候选电路对产生错误排序。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。