跳到正文
原文
OpenAI:Alignment 研究博客(RSS)· Axel Højmark, Jérémy Scheurer, Jenny Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke·· 2026-07-21精选AI 评分74

OpenAI 与 Apollo Research 提出 Contrastive SDF 测量模型的 reward-seeking 倾向

Measuring Reward-Seeking by Instilling Contrastive Beliefs

AI 导读

OpenAI 与 Apollo Research 发布 Contrastive Synthetic Document Finetuning 方法,通过向模型两个副本灌输相反的评分者信念,测量行为对评分者偏好的因果敏感度。

推荐理由

原文提出可量化的 reward-seeking 测量方法,并用模型有机体验证其有效性,读者可以据此了解前沿 RL 训练中奖励寻求的演变趋势。

来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com