ARC Prize 推出 SnakeBench:50 个 LLM 贪吃蛇对战基准
ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。
ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。
The Economist 用 1981 年以来覆盖 100 国的世界价值观问卷测试 25 个前沿 AI 模型,按世俗到传统、生存到自我表达两轴绘制分布。
ARC Prize 基金会向美国 OSTP 的 AI 行动计划 RFI 提交正式回应,主张将 AI 基准测试纳入美国 AI 战略核心。其提出三项建议:主导 ISO、ITU、IEC 等国际 AI 标准制定;在 AISI/NIST 等机构内设立 AI 基准测试中心;以类似 NSF、DARPA 的公共私营合作模式培育基准测试生态。
ARC Prize 基金会发布 ARC-AGI-2 基准并同步启动 ARC Prize 2025 竞赛,总奖金 100 万美元,Kaggle 赛程为 3 月 26 日至 11 月 3 日。
推荐理由:官方同步给出人机对比分数和成本数据,读者可以据此了解 AI 推理系统在新基准上的真实差距。
ARC Prize Foundation 发布 o3 和 o4-mini 在 ARC-AGI 上的首次公开评测:o3-medium 在 ARC-AGI-1 Semi Private Eval 得 53%,o4-mini-medium 得 42%,两者在 ARC-AGI-2 上均低于 3%。
推荐理由:ARC Prize 官方实测给出了 o3 与 o4-mini 在 ARC-AGI 两代基准上的准确率、成本和 high 推理不完整覆盖的数据细节。
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。
ARC Prize 基金会称其 3 月向白宫 OSTP 提交的三项建议——建立独立 AI 评估组织生态、设立联邦 AI 基准测试中心、确保美国主导全球 AI 标准——全部被纳入白宫 AI 行动计划。OSTP 已责成 NIST、CAISI、DOE 和 NSF 牵头评估科学、建设测试平台并召集社区。该基金会同时发布首个"交互推理"评测 ARC-AGI-3,用于衡量模型在陌生环境中的技能获取效率。
ARC Prize Foundation 宣布推出 ARC Prize Verified 计划,通过官方隐藏测试集认证模型在 ARC-AGI 上的成绩,通过者可进入官方榜单并获得认证徽章。
ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。
推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。
ARC Prize 发布 ARC-AGI-3,这是 ARC-AGI 系列首个全交互式基准,包含数百个人工设计的回合制环境和数千个游戏式关卡,无指令、无规则、无既定目标,要求智能体自行探索并跨关卡迁移所学。
推荐理由:ARC-AGI-3 用无指令的交互环境测探索学习能力,人类 100% 对前沿 AI 0.51%,可据此思考指令跟随之外的智能差距。
ARC Prize 通过 160 段回放与推理轨迹分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现,分数分别为 0.43% 和 0.18%(半私域数据集测试),并开源分析包。
推荐理由:ARC Prize 基于 160 段推理回放拆解两大模型的失败模式,指出总分掩盖了两者截然不同的推理缺陷。
ARC Prize 公布首个 3.75 万美元 ARC-AGI-3 里程碑奖(截至 6 月 30 日)前三名。冠军 Tufa Labs "The Duck" 用本地 Qwen 3.6 27B FP8 在 REPL 中写代码玩游戏,通过逐出旧消息实现无限游玩,团队称手工工具反而损害模型表现。
ARC Prize 官方博客汇总了面向 ARC-AGI 社区的论文、视频、工具、代码库与教程资源。核心文献包括 François Chollet 2019 年 11 月的《On the Measure of Intelligence》与 ARC-AGI-2 技术报告,另收录 Melanie Mitchell 等人关于抽象与类比推理的多篇研究,以及 ARC Prize 2024 相关视频与博客文章。
ARC Prize 官网新增 User Scorecards(用户成绩单)功能,页面显示为加载状态。该平台同时提供 ARC-AGI-1、ARC-AGI-2、ARC-AGI-3 系列基准与 ARC Prize 2024/2025/2026 竞赛入口。
ARC Prize 2026 提供 200 万美元奖金、设 3 条赛道,面向开源 AGI 进展。同期 ARC Prize 2025 为 100 万美元竞赛,目标是开源 ARC-AGI-2 的解法;ARC-AGI-3 已开放开发者预览,供开发者构建并测试智能体。
ARC Prize 公布 2024 论文奖获奖名单,一等奖由 Li 等人的《Combining Induction and Transduction for Abstract Reasoning》获得。
ARC-AGI-1 是 François Chollet 于 2019 年提出的推理基准,包含 800 道网格类谜题任务,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
针对 AI 编程智能体,端到端基准(如 Terminal-Bench、DeepSWE)只能给出综合分数,无法解释涨跌原因,行为评估则断言具体可观测动作,如提示词不明确时是否反问、改构建文件前是否跑本地校验。
Every 评测负责人介绍如何为自己的工作搭建个人 AI 基准测试,指出 MMLU-Pro 等常用基准衡量不了模型能否帮到你自己的工作。作者以写文案、建仪表盘和做幻灯片为例,说明个人基准分三个层次,可帮助判断何时在 Astra 与 Fable 之间切换,以及能否用 Luna 或 Haiku 等更便宜的模型省钱。
Every 发布对 GPT-6 Astra 的 Vibe Check 评测,认为它是大幅升级,写作、软件操作和视觉设计表现令人印象深刻,但也存在一些坏习惯。
OpenAI 的 GPT-6 Sol 与 Anthropic 的 Claude Opus 5.5 同日发布,Every 基于日常工作的实测与评测对两者做了对比,结论是存在一个明确的取舍。该对比旨在回答该用 Sol 6 还是 Opus 5.5 的问题,完整内容需订阅阅读。
Eugene Yan 让 gpt-4、gpt-3.5-turbo-0301、claude-v1.2、cohere-xlarge 等 LLM 根据训练数据为他写传记,以观察各模型学到了什么。gpt3.5/4 整体表现最好,主旨正确但细节多有事实错误,且部分模型比其他模型更多地背诵和复述训练数据。这些模型无法联网,输出完全基于训练数据。
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
Eugene Yan 发布长文,基于约二十篇论文系统讲解如何应用和评估 LLM-as-Judge(LLM 评估器)。
Eugene Yan 指出,指望再加一个工具、指标或 LLM-as-Judge 来解决产品问题,只会绕开核心难题、回避真正的工作。产品评估不是静态产物或速效药,而是把科学方法、评估驱动开发(EDD)和 AI 输出监控落到实处的实践:从观察数据、标注成败样本(理想为 50:50 的通过/失败分布)开始,再提出假设、设计实验、量化结果并迭代。
研究者发布 EngiWorld 基准,围绕完整设计闭环构建 1301 个专家任务,覆盖 CAD、CAE、CAM、BIM、EDA 和 3D 可视化 6 个工程领域、26 个专业软件平台,并提供 GUI 与 CLI 接口。
研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。
研究揭示关系型上下文学习(ICL)中的支持集目标泄漏问题:当支持上下文包含目标衍生特征而查询端不可用时,评估结果会失真。作者构造 20 个目标衍生特征,在 13 个 RelBench 任务和 5 种关系 ICL 配置上测试,发现 0-hop 与 Full 泄漏造成最大偏差,且泄漏效应高度依赖任务与模型,甚至可逆转模型变体间的相对结论。
研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,其环境将高难度任务与作弊机会结合,用于研究智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,并已公开发布。
研究者提出 OTROPE,一种无需似然函数的 LLM 离线策略评估方法,通过最优传输在语义空间做分布校正,将行为策略的标注样本与目标策略的无标注样本对齐。它结合校正后的人类标注残差与代理预测器,无需行为策略建模或密度比估计,即可实现双重鲁棒式评估。实验显示 OTROPE 持续优于基线,并能让较弱 LLM 评估器集成逼近甚至超越更强评估器,代码已开源。
研究者推出 GeoOutageBench,一个评估 LLM 地理时空 KGQA 的基准,其时空知识图谱融合停电记录、遥感、气象观测、风暴与电力事件、地理实体及领域本体等多模态数据。
一项 arXiv 研究独立复现了某不确定性感知道路级事故预测模型的数据流程,在三个伦敦行政区评估其 11 项设计决策,仅 4 项在第二个行政区复现成功,7 项失败且其中 4 项符号反转。
研究者推出 CineSubBench,一个基于多语言电影字幕评测 LLM 长上下文电影理解能力的基准,含 1,012 部电影、六种语言共 6,072 条字幕轨和 8.13M 条带时间戳字幕。
PADMÉ 是一种面向智能体场景的元评估数据合成方法,将元评估重构为偏好判断问题,仅用小型语言模型、无需人工参与且计算开销低。其原型在四个智能体领域、三项评估标准上合成 1000 条样本,150 条子集的人工验证显示与人类判断的一致率从基线 73% 提升至 85%。该数据集对 25 个常见模型的元评估揭示了评估表现与打分粒度、宽松度及模型规模等因素的相关性。
研究者提出 CruxBench,一个按信息价值(VOI)给 LLM 生成问题打分的基准,衡量模型提出的关键子问题能在多大程度上更新对目标预测问题的信念。该基准抗污染、开放式且基于真实世界信念变化,在 293 个预测问题上评测了 8 个模型,VOI 与独立能力指标相关性达 r=0.90,但前沿 LLM 仅略微超过随机时机基线。
研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。