跳到正文
原文
OpenAI:Alignment 研究博客(RSS)· Hannah Sheahan·· 2026-02-07AI 评分57

OpenAI 用推理模型从真实对话中发现未知 AI 失调行为

Discovering unknown AI misalignments in real-world usage

AI 导读

OpenAI 提出一种利用推理模型(AI judges)分析真实生产对话的方法,通过识别用户情绪退化来检测和诊断 ChatGPT 的失调行为,发现情绪退化的对话包含 Model Spec 违规的概率约为其他对话的两倍。

来源:OpenAI:Alignment 研究博客(RSS) · alignment.openai.com