跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Ryan Brown, Zihao Fu, Chris Russell·· 3 小时前AI 评分39

Settle:让推理模型学会何时停止推理

Settle: Learning When to Stop Reasoning

AI 导读

Settle 通过已完成推理轨迹中的答案稳定性来学习何时停止,训练现有推理结束 token 并让其他预测贴近基座模型,推理时仅需普通解码。在 MATH-500 上搭配 Qwen3-4B,Settle 减少 40% token 数、准确率仅降 0.5 个百分点,相比在首个稳定答案处截断的监督微调提升 6.16 个百分点,且 token 数几乎相同。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org