跳到正文
原文
METR:Research(网页)·· 13 小时前AI 评分52

METR 发布 RE-Bench 基准,对比 Claude 3.5 Sonnet、o1-preview 与人类专家的 ML 研究工程能力

Evaluating frontier AI R&D capabilities of language model agents against human experts November 22, 2024 We’re releasing RE-Bench, a new benchmark for measuring the performance of humans and frontier model agents on ML research engineering tasks. We also share data from 71 human expert attempts and results for Anthropic’s Claude 3.5 Sonnet and OpenAI’s o1-preview. Read more

AI 导读

METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。

来源:METR:Research(网页) · metr.org