跳到正文
热点事件持续更新

METR发布Claude 3.7 Sonnet自主能力评估

2 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年9月30日,METR发布了对Claude 3.7 Sonnet的自主能力评估报告,这是该事件的首次报道。METR对Claude 3.7 Sonnet开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的5项RE-Bench AI研发任务上表现出较强能力。同日,METR还发布了RE-Bench基准,包含7个ML研究工程环境、71次人类专家尝试,以及Claude 3.5 Sonnet和o1-preview智能体的结果,全部开源。目前事件进展为METR公布初步评估结论并开源RE-Bench基准,尚无后续报道。

AI 根据报道生成 · 10 小时前更新

事件进展

2 个进展
  1. 9月30日 23:28 · 1 篇报道
    METR发布RE-Bench评估AI研发能力
    METR:Research:METR 发布 RE-Bench 基准,对比 Claude 3.5 Sonnet、o1-preview 与人类专家的 ML 研究工程能力
  2. 9月30日 23:28 · 1 篇报道
    METR发布Claude 3.7 Sonnet初步评估报告
    METR:Research:METR 发布 Claude 3.7 Sonnet 自主能力评估报告

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. METR:Research
    METR 发布 RE-Bench 基准,对比 Claude 3.5 Sonnet、o1-preview 与人类专家的 ML 研究工程能力

    METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。

  2. METR:Research
    METR 发布 Claude 3.7 Sonnet 自主能力评估报告

    METR 对 Claude 3.7 Sonnet 开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的 5 项 RE-Bench AI 研发任务上表现出较强能力。

本事件热度走势

当前热度 7·可比范围峰值 9(10月1日 02:00)·近 24 小时可比范围变化 –

02.557.51010月1日02:0010月1日05:0010月1日08:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。