跳到正文
原文
METR:Research(网页)·· 13 小时前精选AI 评分65

METR 研究列表:模型自主能力评测与开发者生产力研究汇总

Español

AI 导读

METR 的研究页面汇总了其评测与研究项目,包括对 GPT-5、Claude 3.7、DeepSeek 和 Qwen 等模型的危险自主能力评测,以及 time horizon 估计、RE-Bench、HCAST 基准和开发者生产力随机对照试验等研究。其中一项试验发现,经验丰富的开源开发者使用 AI 工具后耗时反而增加 19%。

推荐理由

这是 METR 的研究索引页,汇总了其在模型自主能力评测、time horizon 与开发者生产力等方向的代表性论文。

来源:METR:Research(网页) · metr.org