跳到正文
原文
METR:Research(网页)·· 12 小时前AI 评分43

METR 发布 AI 智能体评估任务标准 METR Task Standard

Portable Evaluation Tasks via the METR Task Standard February 29, 2024 METR has published a standard way to define tasks for evaluating the capabilities of AI agents. Read more

AI 导读

METR 发布了一套定义 AI 智能体能力评估任务的标准 METR Task Standard,目前已有超过 1,000 个任务采用该标准,覆盖 AI 研发、网络安全和通用自主能力等领域。英国 AI Safety Institute 等机构也在使用该标准,以便与 METR 交换任务。该标准通过 2–6 个函数和一个常量完整定义任务族,支持任务可移植性与代码复用,未来计划成为公共资源。

来源:METR:Research(网页) · metr.org