跳到正文
热点事件持续更新

METR发布GPT-4o自主能力初步评估

2 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年9月30日,METR发布对GPT-4o自主能力的初步评估。该评估使用简单的agent scaffolding,在30个任务族共77项自主能力任务上测试GPT-4o,结果显示其表现强于Claude 3 Sonnet和GPT-4-Turbo,略弱于Claude 3.5 Sonnet,整体与人类30分钟基线相当;METR同时指出约半数失败任务属于可修复类型。同日,METR还发布了通用自主能力评估更新,新增约50项自动评分任务,覆盖网络安全、软件工程和机器学习等技能,并收集约200条人类基线。初步结果显示,基于Claude 3.5 Sonnet和GPT-4o的智能体完成任务的比例与人类基线者约30分钟的表现相当;其中GPT-4o智能体可完成约60%人类15分钟内完成的任务,以及约10%人类耗时超4小时的任务。

AI 根据报道生成 · 10 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. METR:Research
    METR 更新通用能力评估:新增约 50 项任务与人类基线,公布 GPT-4o 和 Claude 初步结果

    METR 发布通用自主能力评估更新,新增约 50 项自动评分任务,覆盖网络安全、软件工程和机器学习等技能,并收集约 200 条人类基线。初步结果显示,基于 Claude 3.5 Sonnet 和 GPT-4o 的智能体完成任务的比例与人类基线者约 30 分钟的表现相当;GPT-4o 智能体可完成约 60% 人类 15 分钟内完成的任务,以及约 10% 人类耗时超 4 小时的任务。

  2. METR:Research
    METR 对 GPT-4o 自主能力初步评估详情:77 项任务、约半数失败可修复

    METR 用简单 agent scaffolding 在 30 个任务族共 77 项自主能力任务上评测 GPT-4o,表现强于 Claude 3 Sonnet 和 GPT-4-Turbo,略弱于 Claude 3.5 Sonnet,与人类 30 分钟基线相当。

本事件热度走势

当前热度 7·可比范围峰值 9(10月1日 02:00)·近 24 小时可比范围变化 –

02.557.51010月1日02:0010月1日05:0010月1日08:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。