跳到正文
原文
ARC Prize:官方博客·· 12 小时前精选AI 评分66

ARC Prize 用 ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

Analyzing GPT-5.5 & Opus 4.7 with ARC-AGI-3

AI 导读

ARC Prize 通过 160 段回放与推理轨迹分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现,分数分别为 0.43% 和 0.18%(半私域数据集测试),并开源分析包。

推荐理由

ARC Prize 基于 160 段推理回放拆解两大模型的失败模式,指出总分掩盖了两者截然不同的推理缺陷。

来源:ARC Prize:官方博客 · arcprize.org