跳到正文
原文
METR:Research(网页)·· 12 小时前AI 评分46

METR 发布前沿模型自主能力评估资源集,含任务套件与评估协议

Autonomy Evaluation Resources March 15, 2024 A collection of resources for evaluating potentially dangerous autonomous capabilities of frontier models. Read more

AI 导读

METR 公开了一套用于评估前沿模型潜在危险自主能力的资源,包括任务套件、软件工具、能力激发指南和评估协议示例。任务覆盖软件工程、ML 工程、网络安全与研究领域,难度从人类几分钟到一周不等,仅开源约 20 个示例任务的源码。该协议被定位为“beta”,METR 计划持续迭代改进。

来源:METR:Research(网页) · metr.org