OpenAI:Alignment 研究博客(RSS)· Axel Højmark, Jérémy Scheurer, Jenny Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke·· 2026-07-21精选AI 评分74
OpenAI 与 Apollo Research 提出 Contrastive SDF 测量模型的 reward-seeking 倾向
Measuring Reward-Seeking by Instilling Contrastive Beliefs
AI 导读
OpenAI 与 Apollo Research 发布 Contrastive Synthetic Document Finetuning 方法,通过向模型两个副本灌输相反的评分者信念,测量行为对评分者偏好的因果敏感度。
推荐理由
原文提出可量化的 reward-seeking 测量方法,并用模型有机体验证其有效性,读者可以据此了解前沿 RL 训练中奖励寻求的演变趋势。
来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com