热点事件持续更新
METR悬赏征集LLM智能体高难度评测任务
2 篇报道2 个报道来源13 小时前更新
先了解这件事
AI 综述
2026年9月30日,METR(原ARC Evals)发布博客,公开悬赏征集用于衡量自主LLM智能体能力的任务,形式包括任务创意、详细规格和经过测试的实现。METR对任务难度提出要求:人类专业人士完成需超过2小时,理想情况超过20小时,且最好能通过写代码、命令行等文本交互完成。奖励方面,创意奖励20美元,规格200美元,实现按人工完成成本3倍起付,并叠加最高50%的加分。目前该计划处于公开征集阶段,尚无已采纳任务或后续进展的报道。
AI 根据报道生成 · 11 小时前更新
最新进展9月30日 23:28
METR公开悬赏征集高难度LLM智能体评测任务,创意20美元、规格200美元、实现按人工成本3倍起付。事件进展
2 个进展
- 9月30日 23:28 · 1 篇报道METR发布AI智能体评估任务标准METR:Research:METR 发布 AI 智能体评估任务标准 METR Task Standard
- 9月30日 23:28 · 1 篇报道METR发布LLM Agent高难度任务悬赏计划METR:Blog:METR 悬赏征集用于评测自主 LLM 智能体的多样化高难度任务
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- METR:ResearchMETR 发布 AI 智能体评估任务标准 METR Task Standard
METR 发布了一套定义 AI 智能体能力评估任务的标准 METR Task Standard,目前已有超过 1,000 个任务采用该标准,覆盖 AI 研发、网络安全和通用自主能力等领域。英国 AI Safety Institute 等机构也在使用该标准,以便与 METR 交换任务。该标准通过 2–6 个函数和一个常量完整定义任务族,支持任务可移植性与代码复用,未来计划成为公共资源。
- METR:BlogMETR 悬赏征集用于评测自主 LLM 智能体的多样化高难度任务
METR(原 ARC Evals)公开悬赏征集用于衡量自主 LLM 智能体能力的任务,包括任务创意、详细规格和经过测试的实现。任务需足够难,人类专业人士完成需超过 2 小时、理想情况超过 20 小时,且最好能通过写代码、命令行等文本交互完成。创意奖励 $20,规格 $200,实现按人工完成成本 3 倍起付并叠加最高 50% 的加分。
本事件热度走势
当前热度 14·可比范围峰值 19(10月1日 02:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。