跳到正文
原文
METR:Research(网页)·· 12 小时前AI 评分54

METR 发布 AI 自主能力评估示例协议

Example autonomy evaluation protocol March 15, 2024 An example protocol for the whole evaluation process, based on our task suite, elicitation protocol, and scoring methods. Read more

AI 导读

METR 发布一份评估 AI 模型自主风险能力的示例协议,覆盖任务套件、引导流程和评分方法。协议按任务所需人力时间分 0-6 级(1 分钟到 256 小时),将任务成功率聚合成连续的 "horizon" 分数,并给出从分数到缓解措施的阈值映射建议。

来源:METR:Research(网页) · metr.org