跳到正文
原文
METR:Blog(网页)·· 15 小时前AI 评分33

METR 前沿 AI 模型自主能力风险评估:Claude Opus 5.5、GPT-5.6 Sol 等评测一览

Risk Assessment

AI 导读

METR 公布了对前沿 AI 模型自主能力的系列评测,其中 Claude Opus 5.5(2026 年 9 月 22 日)、GPT-5.6 Sol(2026 年 6 月 26 日)等与 Anthropic、OpenAI 合作完成,DeepSeek、Qwen、DeepSeek-R1、DeepSeek-V3 等则在无公司参与下独立评测。

来源:METR:Blog(网页) · metr.org