热点事件持续更新
METR发布Claude 3.7 Sonnet自主能力评估
2 篇报道1 个报道来源13 小时前更新
先了解这件事
AI 综述
2026年9月30日,METR发布了对Claude 3.7 Sonnet的自主能力评估报告,这是该事件的首次报道。METR对Claude 3.7 Sonnet开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的5项RE-Bench AI研发任务上表现出较强能力。同日,METR还发布了RE-Bench基准,包含7个ML研究工程环境、71次人类专家尝试,以及Claude 3.5 Sonnet和o1-preview智能体的结果,全部开源。目前事件进展为METR公布初步评估结论并开源RE-Bench基准,尚无后续报道。
AI 根据报道生成 · 10 小时前更新
最新进展9月30日 23:28
METR同日发布并开源RE-Bench基准,含7个环境、71次人类专家尝试及两个智能体结果。事件进展
2 个进展
- 9月30日 23:28 · 1 篇报道METR发布RE-Bench评估AI研发能力METR:Research:METR 发布 RE-Bench 基准,对比 Claude 3.5 Sonnet、o1-preview 与人类专家的 ML 研究工程能力
- 9月30日 23:28 · 1 篇报道METR发布Claude 3.7 Sonnet初步评估报告METR:Research:METR 发布 Claude 3.7 Sonnet 自主能力评估报告
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- METR:ResearchMETR 发布 RE-Bench 基准,对比 Claude 3.5 Sonnet、o1-preview 与人类专家的 ML 研究工程能力
METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。
- METR:ResearchMETR 发布 Claude 3.7 Sonnet 自主能力评估报告
METR 对 Claude 3.7 Sonnet 开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的 5 项 RE-Bench AI 研发任务上表现出较强能力。
本事件热度走势
当前热度 7·可比范围峰值 9(10月1日 02:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。