跳到正文
原文
ARC Prize:官方博客·· 13 小时前精选AI 评分66

ARC Prize 发布 ARC-AGI-2 技术报告,前沿模型得分不足 5%

ARC-AGI-2 A New Challenge for Frontier AI Reasoning Systems

AI 导读

ARC Prize 发布 ARC-AGI-2 技术报告,推出比 ARC-AGI-1 更细粒度评估抽象推理的新基准。400 人实测 1,417 个任务全部可被人类解出,平均每题约 2.3 分钟;发布时所有前沿模型成功率不足 5%,而同类模型在 ARC-AGI-1 上通常达 20%-50%。

推荐理由

原文给出人类与当前模型在同一新基准上的实测对比,读者可以据此评估推理能力的差距所在。

来源:ARC Prize:官方博客 · arcprize.org