arXiv:cs.CL(计算语言学,全量分类)· Yihuai Hong, Shauli Ravfogel, Chen Zhao, Eunsol Choi·· 3 小时前AI 评分50
研究提出 CIA 指标衡量并改进 LLM 思维链与内部推理的对齐
Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment
AI 导读
研究者提出 CoT-Interpretability Alignment(CIA)指标,用可解释性工具检测 LLM 思维链描述与内部推理策略的一致程度。在两跳问答、提示干预和整数乘法三个任务、三个 LLM 上测得对齐度仅 44.8-75.9%;随后以任务准确率和参数化忠实度作为奖励做后训练,可显著提升 CoT 忠实度并保持或提高任务准确率。代码与数据已开源,论文共 28 页。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org