METR:Research(网页)·· 12 小时前AI 评分46
METR 发布前沿模型自主能力评估资源集,含任务套件与评估协议
Autonomy Evaluation Resources March 15, 2024 A collection of resources for evaluating potentially dangerous autonomous capabilities of frontier models. Read more
AI 导读
METR 公开了一套用于评估前沿模型潜在危险自主能力的资源,包括任务套件、软件工具、能力激发指南和评估协议示例。任务覆盖软件工程、ML 工程、网络安全与研究领域,难度从人类几分钟到一周不等,仅开源约 20 个示例任务的源码。该协议被定位为“beta”,METR 计划持续迭代改进。
来源:METR:Research(网页) · metr.org