跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Yihuai Hong, Shauli Ravfogel, Chen Zhao, Eunsol Choi·· 3 小时前AI 评分50

研究提出 CIA 指标衡量并改进 LLM 思维链与内部推理的对齐

Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

AI 导读

研究者提出 CoT-Interpretability Alignment(CIA)指标,用可解释性工具检测 LLM 思维链描述与内部推理策略的一致程度。在两跳问答、提示干预和整数乘法三个任务、三个 LLM 上测得对齐度仅 44.8-75.9%;随后以任务准确率和参数化忠实度作为奖励做后训练,可显著提升 CoT 忠实度并保持或提高任务准确率。代码与数据已开源,论文共 28 页。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org