Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1 透明度说明
Transparency
Anthropic 发布 Claude Fable 5.1 透明度说明页,介绍其能力、训练数据与安全评估。Fable 5.1 与 Mythos 5.1 为同一模型但保护级别不同,Fable 5.1 面向公众,Mythos 5.1 仅通过可信访问计划和 Claude Security 提供,用于网络安全和生命科学工作。
官方透明度页汇总了模型能力、安全评估与 RSP 风险结论,读者可据此了解部署保护与风险判断的依据。
Claude Fable 5.1 摘要表
| 模型描述 | Claude Fable 5.1 是全球最先进的编码与知识工作模型——其研究能力让我们得以初步窥见 AI 模型将如何推动科学进步。 |
| 基准测试能力 | 请参阅我们的 Claude Fable 5.1 与 Claude Mythos 5.1 系统卡第 8 节关于能力的内容。 |
| 可接受用途 | Anthropic 的使用政策适用。 |
| 发布日期 | 2026 年 9 月 |
| 模态 | Claude Fable 5.1 能够理解文本(包括语音听写)和图像输入,可进行对话、分析、编码和创意任务。Claude 可以输出文本(包括基于文本的产物)和图表。 |
| 模型架构与训练方法 | Claude Fable 5.1 在大规模、多样化的数据集上进行了预训练,以获得语言能力。预训练过程之后,Fable 5.1 经历了大量的后训练,目标是使其成为一名高效的助手,其行为符合 Claude 宪法中所述的价值观。 |
| 训练数据 | Claude Fable 5.1 使用专有混合数据进行训练,包括来自在线来源的公开可用信息、公共和私有数据集、用户数据,以及其他模型生成的合成数据。在整个训练过程中,我们使用了多种数据清洗和过滤方法,包括去重和分类。 |
| 测试方法与结果 | 基于我们的评估,我们以 ASL-3 防护部署了 Claude Fable 5.1,将其视为具有 CB-1 能力。自主性威胁模型 1 适用于 Claude Fable 5.1。部分安全评估摘要见下文。 |
Claude Mythos 5.1 与 Claude Fable 5.1 是同一模型,但防护级别不同。Claude Fable 5.1 面向公众开放,而 Claude Mythos 5.1 仅通过我们的可信访问计划和 Claude Security 提供;其防护措施专为支持网络安全和生命科学领域的工作而设计。不涉及这些防护措施的评估可在任一配置上运行,因此下文总结的关键安全结果同时适用于 Claude Fable 5.1 和 Claude Mythos 5.1。作为我们安全流程的一部分,我们还进行了额外的评估;完整的公开报告评估结果请参阅完整系统卡。
防护措施评估
Claude Fable 5.1/Mythos 5.1 在自杀与自残领域表现出与 Mythos 5 相当的总体性能。在改进方面,Mythos 5.1 比 Claude Mythos 5 更不可能建议自残的替代方法(例如握冰块)。这些方法在临床上存在争议,且研究尚未表明能有效减少自残事件。Mythos 5.1 也更可能直接询问用户是否有自杀念头,并区分自杀意念与非自杀性自残冲动。最后,Mythos 5.1 不会对危机热线服务的保密性做出无条件保证,例如承诺通话绝不会导致与紧急服务部门联系。
一个有待改进的方面是,它倾向于通过承认自残可以调节困难情绪或提供缓解,从而隐性认可自残作为一种应对策略。Mythos 5.1 有时还会认可用户对寻求帮助的恐惧,并轻微放大其此前在危机服务中的负面经历。当这些表述出现时,它们始终处于劝阻自残并引导用户寻求人类支持的回复之中,但无论周围语境如何,我们都认为这些表述是不可取的。
在发布前,我们更新了 claude.ai 的系统提示词以应对这些行为,加入了引导 Claude 不要将自残描述为有效做法的措辞,即使用户自己这样主张也是如此。这在一定程度上缓解了上述弱点。现有的系统提示词内容,包括不得建议涉及身体不适的替代方法等指示,进一步强化了在核心模型中观察到的改进。我们正在继续探索如何在敏感的心理健康情境中做出最佳回应,并鼓励基于 API 进行开发的开发者在用户可能处于困境的情境中采用类似的防护措施和稳健的缓解方案。
Claude 不能替代专业建议或医疗护理,也不旨在诊断或治疗任何医疗状况。每个 Claude 模型都经过训练,能够以同理心和关怀识别并回应痛苦表达(包括有人表达自己在自杀或自残想法方面的个人挣扎),同时在适当时候引导用户寻求人类支持:求助热线、心理健康专业人士或可信赖的朋友或家人。
智能体编程
在两种场景中,仅提供帮助版本的 Claude Mythos 5 的整体成功率均低于 Claude Opus 4.8,并略高于或与 Claude Mythos Preview 持平。我们的评估是,这些模型在许多操作步骤上都需要大量人工指导。
我们使用 Shade——来自外部安全公司 Gray Swan 的自适应红队测试工具——来评估 Claude 模型在计算机使用环境中的稳健性,在该环境中模型通过点击、输入和滚动直接与屏幕交互。攻击者在 14 个测试用例上运行,每个用例尝试 200 次,我们衡量所有尝试中的成功率。我们比较了模型在我们为此场景中保护用户而设计的额外防护措施启用与未启用时的稳健性。
在计算机使用环境中,Claude Fable 5.1 取得了 0.07% 的攻击成功率,对应 14 个场景中的两个场景共 2,800 次尝试中有两次成功。这与 Claude Opus 5(0.18%,即五次成功尝试)相当,因为在如此低的绝对成功率下,差异无法与噪声区分。两者都比 Claude Fable 5(2.50%)和 Claude Sonnet 5(2.25%)更稳健。启用我们的防护措施后,Claude Fable 5.1 的攻击成功率保持不变,仍为 0.07%。
对齐评估
Claude Mythos 5.1 和 Claude Fable 5.1 是同一个模型,只是防护措施级别不同。这意味着我们的许多评估对两个模型都适用。我们的自动化审计发现,Claude Mythos 5.1 比此前发布的模型更为诚实,幻觉也更少。它幻觉输入的情况——即编造或严重歪曲文件内容或先前用户消息——在我们的调查中显著少于此前模型。此外,Mythos 5.1 在任务尚未完成时谎称已完成的比例更低,整体上也更不谄媚用户,这意味着它更不容易出现未经提示的过度赞扬、附和或道歉。其他与误导用户相关的指标与近期发布的模型大致相当。

RSP 评估
我们的负责任扩展政策(RSP)评估流程旨在系统性地评估模型在可能构成灾难性风险的领域中的能力,且在我们发布模型之前进行。由于 Claude Fable 5.1 和 Claude Mythos 5.1 共享同一底层模型,这些评估是在 Claude Mythos 5.1 上运行的,即未附加生物学和网络安全防护措施的配置,以便反映模型的底层能力。Claude Fable 5.1 是我们迄今为止能力最强的通用发布模型,在 Claude Fable 5 和 Claude Opus 5 的基础上进一步提升。
- 对齐风险,即模型以 Anthropic 非预期方式行事的风险,较低:在我们 2026 年 8 月的风险报告中,我们将这一评估从极低上调至低,以反映近期与网络安全评估中模型行为相关的事件披露后增加的不确定性;尽管 Claude Mythos 5.1 展现出比此前模型略强的隐蔽能力,我们认为它不会使风险超出该评估。
- 在自动化 AI 研究与开发方面,Claude Mythos 5.1 的能力与 Claude Mythos 5 和 Opus 5(我们此前在该领域的前沿)相当或略强,但未跨越 RSP 能力阈值。我们未观察到可归因于 AI 的 AI 进展速度持续翻倍,且该模型距离替代我们的研究科学家和工程师还很远;METR 的外部测试得出的结果与该评估一致。
- 在化学和生物武器方面,很难完全确信是否有任何模型通过了我们的阈值,即在构建非新型化学/生物武器方面提供显著提升。然而,Claude Mythos 5.1 在我们保守地视为能够显著帮助具有基础技术背景的个人生产(非新型)武器的先前模型基础上,整体能力更强,因此我们将其视为具备该能力,并部署相应的保障措施,包括实时分类器以防止危害。有了这些缓解措施,我们认为该类别中的灾难性风险较低,但并非可忽略不计。
- 在新型武器开发方面,Claude Mythos 5.1 在我们的自动化评估中相较于 Claude Mythos 5 和 Opus 5 显示出适度提升。然而,专家红队测试表明仍存在显著弱点,包括新型构思能力薄弱、战略判断力差和技术校准不佳,这些弱点使该模型无法替代稀缺的人类专业知识,因此我们得出结论:Claude Mythos 5.1 未跨越新型武器能力的阈值。我们应用了与 Claude Mythos 5 相同的扩展生物学保障措施,这些措施限制了对两用研究生物学能力的访问。我们在最新的风险报告中进一步描述了这些保障措施。
来源:Anthropic:The Institute(旗舰研究长文 · 网页) · anthropic.com