跳到正文
原文
ARC Prize:官方博客·· 13 小时前AI 评分44

ARC Prize 推出 SnakeBench:50 个 LLM 贪吃蛇对战基准

ARC Prize Side Quest - Snakebench

AI 导读

ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。

来源:ARC Prize:官方博客 · arcprize.org