跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2025-05-01AI 评分53

Lilian Weng 长文综述:为什么测试时思考能提升大模型推理能力

Why We Think

AI 导读

Lilian Weng 发布长文《Why We Think》,综述测试时计算与思维链推理的研究进展。文章覆盖并行采样与顺序修订等解码方法、DeepSeek-R1 等强化学习训练范式、CoT 忠实性与 reward hacking 风险,以及测试时计算与预训练缩放的互换边界。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io