Lilian Weng:Lil'Log(RSS)·· 2025-05-01AI 评分53
Lilian Weng 长文综述:为什么测试时思考能提升大模型推理能力
Why We Think
AI 导读
Lilian Weng 发布长文《Why We Think》,综述测试时计算与思维链推理的研究进展。文章覆盖并行采样与顺序修订等解码方法、DeepSeek-R1 等强化学习训练范式、CoT 忠实性与 reward hacking 风险,以及测试时计算与预训练缩放的互换边界。
来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io