论文提出NSG指标衡量LLM自解释可信度
热点事件持续更新
论文提出NSG指标衡量LLM自解释可信度
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Harry Mayne 等作者提出 Normalized Simulatability Gain(NSG)指标,以“解释能否帮助观察者预测模型行为”来衡量 LLM 自解释的忠实性。作者用该指标评估 Gemini 3、GPT-5.2、Claude 4.5 等 18 个前沿模型,覆盖健康、商业、伦理数据集的 7,000 个反事实样本。 结果显示,自解释使行为预测提升 11–37% NSG,且比外部模型生成的解释更具预测信息;同时 5–15% 的自解释高度误导。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
论文提出 NSG 指标:LLM 自解释有助于预测模型行为报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LG论文提出 NSG 指标:LLM 自解释有助于预测模型行为
论文提出 Normalized Simulatability Gain(NSG)指标,以解释能否帮助观察者预测模型行为来衡量其忠实性。作者评估 Gemini 3、GPT-5.2、Claude 4.5 等 18 个前沿模型在健康、商业、伦理数据集的 7,000 个反事实样本,发现自解释将行为预测提升 11-37% NSG,且比外部模型生成的解释更具预测信息;同时 5-15% 的自解释高度误导。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。