跳到正文
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2023-05-31精选AI 评分70

OpenAI 用过程监督提升模型数学推理并达到新 SOTA

Improving mathematical reasoning with process supervision

AI 导读

OpenAI 训练模型在数学问题求解上取得新 SOTA,方法是对每一步正确推理给予奖励(过程监督),而非只奖励最终正确答案(结果监督)。除性能提升外,过程监督还有对齐价值:直接训练模型产出人类认可的思维链。

推荐理由

原文说明过程监督相比结果监督在数学推理上的性能提升,以及它对人类可核查思维链的对齐价值。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com