METR:Research(网页)·· 13 小时前AI 评分58
METR 发布 MirrorCode 初步结果:AI 智能体可完成数周级编码任务
MirrorCode: Evidence that AI can already do some weeks-long coding tasks April 10, 2026 Early results from MirrorCode benchmark with METR: AI agents can complete weeks-long coding tasks, including reimplementing a 16,000-line codebase. Read more
AI 导读
METR 发布 MirrorCode 基准初步结果,显示 AI 智能体可完成数周时长的编码任务,包括重新实现一个 16000 行代码库。同页还汇总了 349 名技术工作者调查,自报因 AI 工具工作价值中位数提升 1.4–2x,以及跨 9 个基准的时间跨度研究和监测性评测初步结果。
来源:METR:Research(网页) · metr.org