METR:Blog(网页)·· 15 小时前AI 评分33
METR 前沿 AI 模型自主能力风险评估:Claude Opus 5.5、GPT-5.6 Sol 等评测一览
Risk Assessment
AI 导读
METR 公布了对前沿 AI 模型自主能力的系列评测,其中 Claude Opus 5.5(2026 年 9 月 22 日)、GPT-5.6 Sol(2026 年 6 月 26 日)等与 Anthropic、OpenAI 合作完成,DeepSeek、Qwen、DeepSeek-R1、DeepSeek-V3 等则在无公司参与下独立评测。
来源:METR:Blog(网页) · metr.org