OpenAI:Alignment 研究博客(RSS)· Akshay V. Jagadeesh, Rahul Arora, Mikhail Trofimov, Khaled Saab, Ali Malik, Foivos Tsimpourlas, Karan Singhal·· 2026-06-19AI 评分53
OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化
Reinforcement learning towards broadly and persistently beneficial models
AI 导读
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com