METR:Research(网页)·· 13 小时前精选AI 评分65
METR 研究列表:模型自主能力评测与开发者生产力研究汇总
Español
AI 导读
METR 的研究页面汇总了其评测与研究项目,包括对 GPT-5、Claude 3.7、DeepSeek 和 Qwen 等模型的危险自主能力评测,以及 time horizon 估计、RE-Bench、HCAST 基准和开发者生产力随机对照试验等研究。其中一项试验发现,经验丰富的开源开发者使用 AI 工具后耗时反而增加 19%。
推荐理由
这是 METR 的研究索引页,汇总了其在模型自主能力评测、time horizon 与开发者生产力等方向的代表性论文。
来源:METR:Research(网页) · metr.org