跳到正文
热点事件持续更新

METR悬赏征集LLM智能体高难度评测任务

2 篇报道2 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年9月30日,METR(原ARC Evals)发布博客,公开悬赏征集用于衡量自主LLM智能体能力的任务,形式包括任务创意、详细规格和经过测试的实现。METR对任务难度提出要求:人类专业人士完成需超过2小时,理想情况超过20小时,且最好能通过写代码、命令行等文本交互完成。奖励方面,创意奖励20美元,规格200美元,实现按人工完成成本3倍起付,并叠加最高50%的加分。目前该计划处于公开征集阶段,尚无已采纳任务或后续进展的报道。

AI 根据报道生成 · 11 小时前更新

事件进展

2 个进展
  1. 9月30日 23:28 · 1 篇报道
    METR发布AI智能体评估任务标准
    METR:Research:METR 发布 AI 智能体评估任务标准 METR Task Standard
  2. 9月30日 23:28 · 1 篇报道
    METR发布LLM Agent高难度任务悬赏计划
    METR:Blog:METR 悬赏征集用于评测自主 LLM 智能体的多样化高难度任务

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. METR:Research
    METR 发布 AI 智能体评估任务标准 METR Task Standard

    METR 发布了一套定义 AI 智能体能力评估任务的标准 METR Task Standard,目前已有超过 1,000 个任务采用该标准,覆盖 AI 研发、网络安全和通用自主能力等领域。英国 AI Safety Institute 等机构也在使用该标准,以便与 METR 交换任务。该标准通过 2–6 个函数和一个常量完整定义任务族,支持任务可移植性与代码复用,未来计划成为公共资源。

  2. METR:Blog
    METR 悬赏征集用于评测自主 LLM 智能体的多样化高难度任务

    METR(原 ARC Evals)公开悬赏征集用于衡量自主 LLM 智能体能力的任务,包括任务创意、详细规格和经过测试的实现。任务需足够难,人类专业人士完成需超过 2 小时、理想情况超过 20 小时,且最好能通过写代码、命令行等文本交互完成。创意奖励 $20,规格 $200,实现按人工完成成本 3 倍起付并叠加最高 50% 的加分。

本事件热度走势

当前热度 14·可比范围峰值 19(10月1日 02:00)·近 24 小时可比范围变化 –

0510152010月1日01:0010月1日04:0010月1日08:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。