跳到正文
原文
Anthropic:Research(发表成果 · 网页)·· 12 小时前精选AI 评分78

Anthropic 报告:Claude 自动化对齐研究可靠缓解十类对齐失败

Aug 28, 2026AlignmentAutomated researchers can reliably mitigate alignment failures

AI 导读

Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。

推荐理由

报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com