ARC Prize 2026 - ARC-AGI-2 竞赛排行榜公布
ARC Prize 2026 - ARC-AGI-2 竞赛当前排行榜显示,Tufa Labs 以 83.06 分位居第一,rabbithole 以 79.72 分排名第二,nvbanana 以 75.42 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。
ARC Prize 2026 - ARC-AGI-2 竞赛当前排行榜显示,Tufa Labs 以 83.06 分位居第一,rabbithole 以 79.72 分排名第二,nvbanana 以 75.42 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。
ARC Prize 2026 - ARC-AGI-3 竞赛当前排行榜显示,Tufa Labs 以 45.33 分位居第一,Yi-Chia Chen 以 40.80 分排名第二,Daniel Franzen 以 27.24 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。
ARC Prize 公布 ARC-AGI 社区排行榜,Tycho 在 ARC-AGI-3 Public Demo 上取得 100.0% 成绩、成本 $2,986,位列榜首。
ARC Prize 更新了 ARC-AGI 排行榜,新增验证政策,并只展示运行成本低于 $10,000 的系统。榜单覆盖 ARC-AGI-1、ARC-AGI-2 与 ARC-AGI-3,其中 ARC-AGI-3 要求 AI 智能体在全新交互环境中即时适应,结果使用 Standard 或 Provider Adapter harness。
ARC Prize 发布发展时间线,回顾 ARC-AGI 从 2019 年 François Chollet 论文《On the Measure of Intelligence》到 2026 年推出 ARC-AGI-3 的历程。
ARC Prize Foundation 是一个致力于加速 AGI 发展的非营利组织,主张真正的 AGI 不能只靠扩大现有模型规模,而需要转向具备流体智能的系统。该组织通过创建和策划人类校准的基准来衡量人类与 AI 之间的能力差距,并推动研究者探索超越模式匹配与记忆的方法。其团队由 ARC-AGI 创造者 François Chollet 等人组成,并维护开源协作生态。
ARC Prize Foundation 发起捐赠,用于扩展其工作并打造更具影响力的 AI 基准,捐款可抵税。该机构称 ARC-AGI 是唯一针对"人类能解、AI 尚不能解"这一关键缺口的基准。Google AI Studio 产品负责人 Logan Kilpatrick 表示已个人支持该基金会,以更好判断通往 AGI 的进展。
AI 能看出你把宜家家具装错了吗?我们的新基准——家具组装基准(FAB)——给模型提供说明书和一张半成品家具的照片,让它们找出错误。 最高分在短短 10 个月内从 28% 提升到了 80%。
OpenAI 于 2026 年 9 月 23 日推出开放基准 MentalHealthBench,与来自 22 个国家、超过 80 名持证心理健康专家共同创建,用于评估 AI 在真实心理健康对话中的表现。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开评测结果。
如果你在用 AI 构建产品,你应该花超过 25% 的时间来做基准测试,并努力让模型实验室关注这些基准测试 这是加速公司进展的最简单路径
Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information for a review.
上海人工智能实验室 InternLM 开源 SciDocBench,一个以工作流为中心的科学文档理解基准。该基准的官方仓库已公开,用于评测科学文档理解任务。
研究者提出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,在未被告知各基准测什么的情况下自行恢复出安全与通用推理两个主导维度。分析显示 BBQ 更贴近通用推理而非安全,WMDP 分数与通用推理关联更强且推理越强分数越低,HarmBench 的版权类问题也更接近通用推理。
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
Together AI 在全部 113 个 DeepSWE 任务上对 GLM-5.3 (max) 与 GPT-5.6 Sol (max) 各跑 4 次试验,共 904 次 rollout。
推荐理由:原文基于904次实测给出两模型在成本、速度和任务类型上的具体差异,并提供了可直接套用的级联路由方案。
Grok 4.6 在 DiligenceBench 金融测试中以约 52–53% 位列第 2,与 Claude Opus 5 基本持平,Sonnet 5 以 46.2% 落后。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。
Nous Research 在 GitHub 开源 hermes-toolperf-evals,为 hermes-agent #77056 的 15-PR 工具效率追踪提供核心工具集 A/B 评测框架与基准用例。该框架的数据来自 session-DB 挖掘、NeMo Relay traces 和生产错误分类体系。
Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。
推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。
MIT 航空航天系举办 JARVIS Challenge,让 31 名本科生分 7 队在四周内设计、制造并测试可产生 50–100 磅推力的单轴微型涡喷发动机,以 AI 为主要工程伙伴。
蚂蚁 inclusionAI 在 GitHub 开源 PIBench,一个用于评估 AI 编程智能体在真实端到端支付集成任务中表现的基准。该基准聚焦支付集成这一实际开发场景,目前以开源形式发布。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1,331 个专家测试。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可跨平台发布并回溯至完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。贡献者可通过转换器将 EEE 记录提交至 Community Evals,经组织官方账号提交的结果会显示验证标记。
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
上海人工智能实验室 InternLM 项目开源 RNGBench,用于在可控非马尔可夫博弈中评估多模态大语言模型,相关论文已被 EMNLP 2026 收录。该基准聚焦"超越当前观测"的评测场景,官方实现已随项目公开。
Together AI 发布面向编码智能体的高并发推理基准,用 4×NVIDIA B200 在 Kimi K2.5 上对比 Together Inference Engine、TensorRT-LLM 与 SGLang。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
Sierra 开源 μ-Bench,包含五种语言 locale、五家 provider、来自 250 段真实 8 kHz 电话录音的 4,270 条人工标注语料。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
OpenAI 发布首个完整版 Model Spec Evals,用于衡量模型对 Model Spec 行为规范的遵循程度,并开源 596 条提示词的评测数据集和评测代码。