Epoch AI· @EpochAIResearch · X·· 13 天前AI 评分53
AI 导读
Epoch AI 推出 Benchmark Reviews,一项审计 AI 基准的新计划,首批覆盖 15 个基准。分类结果为 4 个 Verified(含 WeirdML v2、ExploitBench v0.1、PostTrainBench v1.1、SimpleQA Verified),9 个 Flawed(含 Terminal-Bench 4.0.0、SWE-Bench Verified、SWE-Bench Pro、Humanity's Last Exam 等),2 个因信息不足暂未审核(CritPt、FrontierCode)。
正文
Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information for a review.
来源:Epoch AI · x.com