METR发布AI自主能力评估资源集与示例协议
先了解这件事
2026年9月30日,METR发布一份评估AI模型自主风险能力的示例协议,覆盖任务套件、引导流程和评分方法。协议按任务所需人力时间划分0至6级,跨度从1分钟到256小时,并将任务成功率聚合成连续的“horizon”分数,同时给出从分数到缓解措施的阈值映射建议。同日稍后,METR进一步公开一套评估前沿模型潜在危险自主能力的资源集,包括任务套件、软件工具、能力激发指南和评估协议示例。任务覆盖软件工程、ML工程、网络安全与研究领域,难度从人类几分钟到一周不等,仅开源约20个示例任务的源码。该协议被定位为“beta”,METR计划持续迭代改进。同日,METR还公开Example Task Suite,包含31个示例任务、覆盖10个任务族,另有186个任务的摘要信息,用于评测AI智能体的危险自主能力;早先报道称仅开源约20个示例任务的源码,后续报道称示例任务为31个。
AI 根据报道生成 · 5 小时前更新
事件进展
- 9月30日 23:28 · 1 篇报道METR 发布公开自主性任务套件METR:Research:METR 发布 Example Task Suite:31 个智能体自主能力评测任务
- 9月30日 23:28 · 2 篇报道METR发布AI自主性风险评估协议示例METR:Research:METR 发布前沿模型自主能力评估资源集,含任务套件与评估协议
报道时间线
沿着报道,了解事件的不同侧面。
- METR:ResearchMETR 发布 Example Task Suite:31 个智能体自主能力评测任务
METR 公开 Example Task Suite,包含 31 个示例任务、覆盖 10 个任务族,另有 186 个任务的摘要信息,用于评测 AI 智能体的危险自主能力。
- METR:ResearchMETR 发布 AI 自主能力评估示例协议
METR 发布一份评估 AI 模型自主风险能力的示例协议,覆盖任务套件、引导流程和评分方法。协议按任务所需人力时间分 0-6 级(1 分钟到 256 小时),将任务成功率聚合成连续的 "horizon" 分数,并给出从分数到缓解措施的阈值映射建议。
- METR:ResearchMETR 发布前沿模型自主能力评估资源集,含任务套件与评估协议
METR 公开了一套用于评估前沿模型潜在危险自主能力的资源,包括任务套件、软件工具、能力激发指南和评估协议示例。任务覆盖软件工程、ML 工程、网络安全与研究领域,难度从人类几分钟到一周不等,仅开源约 20 个示例任务的源码。该协议被定位为“beta”,METR 计划持续迭代改进。
本事件热度走势
当前热度 7·可比范围峰值 9(10月1日 02:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。