跳到正文
原文
OpenAI:Alignment 研究博客(RSS)· Micah Carroll, Tomek Korbak, Zehao Dou, Bowen Baker, Ian Kivlichan·· 2026-05-07精选AI 评分66

OpenAI 调查 RL 训练中意外评分 CoT 的后果

Investigating the consequences of accidentally grading CoT during RL

AI 导读

OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

推荐理由

OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。

来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com