ARC Prize 成立非营利基金会,Greg Kamradt 出任主席并筹备 2025 年赛事
ARC Prize 宣布转型为 501(c)(3) 非营利基金会,2024 年联合负责人 Greg Kamradt 出任主席并加入董事会。ARC-AGI-2 基准与论文将于 2025 年第一季度末发布并用于 2025 年赛事,ARC-AGI-3 已在开发中;2024 年赛事有超过 1400 支队伍提交 1.7 万份方案,基金会还计划与前沿实验室合作并在 1 月中旬启动募资。
ARC Prize 宣布转型为 501(c)(3) 非营利基金会,2024 年联合负责人 Greg Kamradt 出任主席并加入董事会。ARC-AGI-2 基准与论文将于 2025 年第一季度末发布并用于 2025 年赛事,ARC-AGI-3 已在开发中;2024 年赛事有超过 1400 支队伍提交 1.7 万份方案,基金会还计划与前沿实验室合作并在 1 月中旬启动募资。
ARC Prize Foundation 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得 14% 和 15.8%,与 o1 低算力的 20.5% 接近,而 GPT-4o 为 5%。
推荐理由:ARC Prize 一手实测了 R1-Zero 与 R1 在 ARC-AGI-1 上的表现,提出 SFT 与纯 RL 的角色区分这一可讨论的判断。
ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。
ARC Prize 基金会发布 ARC-AGI-2 基准并同步启动 ARC Prize 2025 竞赛,总奖金 100 万美元,Kaggle 赛程为 3 月 26 日至 11 月 3 日。
推荐理由:官方同步给出人机对比分数和成本数据,读者可以据此了解 AI 推理系统在新基准上的真实差距。
ARC Prize Foundation 发布 o3 和 o4-mini 在 ARC-AGI 上的首次公开评测:o3-medium 在 ARC-AGI-1 Semi Private Eval 得 53%,o4-mini-medium 得 42%,两者在 ARC-AGI-2 上均低于 3%。
推荐理由:ARC Prize 官方实测给出了 o3 与 o4-mini 在 ARC-AGI 两代基准上的准确率、成本和 high 推理不完整覆盖的数据细节。
ARC Prize 发布 ARC-AGI-2 技术报告,推出比 ARC-AGI-1 更细粒度评估抽象推理的新基准。400 人实测 1,417 个任务全部可被人类解出,平均每题约 2.3 分钟;发布时所有前沿模型成功率不足 5%,而同类模型在 ARC-AGI-1 上通常达 20%-50%。
推荐理由:原文给出人类与当前模型在同一新基准上的实测对比,读者可以据此评估推理能力的差距所在。
Theory Ventures 在成立三周年回顾中提出,AI 正在压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 的主导市场。该机构认为 seed 轮规模已从 100 万美元延伸至 5 亿美元,传统融资阶段分类不再代表公司成熟度;闭源与开源、云端与本地模型的差距也在收窄,本地运行可降低成本、改善延迟并减少数据治理顾虑。
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。
Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。
推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。
ARC Prize 在 ARC-AGI Semi-Private 隐藏集上复测 Hierarchical Reasoning Model,得分为 ARC-AGI-1 32%、ARC-AGI-2 2%,大体复现论文声明(原文声称 41%)。
ARC Prize 基金会总结 ARC-AGI-3 Preview 上线 30 天的发现,首个交互式推理基准显示人类大多能通关游戏,AI 智能体则难以高效推进。竞赛收到 12 份提交,冠军 StochasticGoose 得分 12.58%,完成 18 个关卡,团队还提出以行动效率衡量智能,并计划增加撤销、离线引擎等改进。
推荐理由:原文给出了人类与 AI 在交互式推理基准上的行动效率差距和评分框架,读者可以据此理解智能评测的新方向。
Tomer Tunguz 撰文认为开源权重模型已多次追平闭源前沿模型,从 DeepSeek R1 到 GLM-4.6、GLM-5.2 和 Kimi K3,但 GPT-5.2 级闭源模型与 Opus 仍率先制造跃迁时刻。
ARC Prize Foundation 宣布推出 ARC Prize Verified 计划,通过官方隐藏测试集认证模型在 ARC-AGI 上的成绩,通过者可进入官方榜单并获得认证徽章。
ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。
推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。
ARC Prize Foundation 发布 ARC-AGI-3 人类数据集,这是一项 458 名普通参与者参加的对照测试,也是 ARC-AGI 系列迄今最大规模的人类测试研究。
ARC Prize 通过 160 段回放与推理轨迹分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现,分数分别为 0.43% 和 0.18%(半私域数据集测试),并开源分析包。
推荐理由:ARC Prize 基于 160 段推理回放拆解两大模型的失败模式,指出总分掩盖了两者截然不同的推理缺陷。
ARC Prize 公布首个 3.75 万美元 ARC-AGI-3 里程碑奖(截至 6 月 30 日)前三名。冠军 Tufa Labs "The Duck" 用本地 Qwen 3.6 27B FP8 在 REPL 中写代码玩游戏,通过逐出旧消息实现无限游玩,团队称手工工具反而损害模型表现。
ARC Prize 发布 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。
推荐理由:ARC Prize 官方实测数据完整,读者可以据此比较 GPT-6 Astra 在两种评测条件下的得分、成本与人类动作效率差异。
Anthropic 宣布未来的 Claude 模型生成文本将带水印,以遵守欧盟 AI Act 对 AI 生成内容标记的要求,采用 Google DeepMind 2024 年 Nature 论文中的 SynthID-Text 方法,并随 2026 年 7 月约 190 个签署方的 EU Code of Practice 一同公布。
推荐理由:官方解释了水印只改变选词随机性来源这一原理,以及质量、价格、检测 API 和各类边界情况的影响。
ARC Prize 基金会发布面向研究者的 ARC-AGI 入门指南,覆盖 ARC-AGI-1、ARC-AGI-2 静态推理基准与首个交互式推理基准 ARC-AGI-3。
Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。
推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。
ARC Prize 公布 2024 论文奖获奖名单,一等奖由 Li 等人的《Combining Induction and Transduction for Abstract Reasoning》获得。
ARC Prize 官方公布 2025 Paper Award 获奖名单:A. Jolicoeur-Martineau 凭《Less is More: Recursive Reasoning with Tiny Networks》获第一名 5 万美元,第二名 2 万美元、第三名 5000 美元及多篇 Runners Up 和 Honorable Mentions 论文同步公布。
Tom Tunguz 用 25 个 VC 任务对比 DeepSeek V4 云端模型与两个本地模型,judge 模型盲评显示三者质量接近(8.0 左右),但路径不同。
推荐理由:作者以 25 个真实 VC 任务实测云端与本地模型,用质量、token 用量和延迟数据解释小模型靠更多推理弥补知识差距。
ARC Prize 官方公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3 交互推理基准、ARC-AGI-2 静态推理基准和论文奖三条赛道。
Tom Tunguz 引用 Stanford 与 Together AI 的研究,提出 intelligence-per-watt 将像当年的 performance-per-watt 一样推动 AI 从云端走向端侧。
推荐理由:原文引用研究数据解释 intelligence-per-watt 趋势如何推动 AI 向端侧迁移,并给出本地加路由方案相对全云的能效与成本收益。
ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。
推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。
Tomer Tunguz 撰文分析 AI 基础设施短缺正按牛鞭效应依次传导:2023 年初 H100 租金曾超 $9/小时,2023 年服务器出货量下滑 22%。
推荐理由:作者用多年价格和产能数据梳理 AI 硬件短缺的接力顺序,读者可以据此理解瓶颈传导的时滞机制。
ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。
推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。
ARC-AGI-1 是 François Chollet 于 2019 年提出的推理基准,包含 800 道网格类谜题任务,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。
推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。
Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。
月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。
Z.AI 发布 GLM-5.3,定位智能体工程,与 GLM-5.2 使用相同的 744B-A40B MoE 底座,全部能力提升来自在更多样真实任务环境(完整代码库、文档、测试工具、多步工作流)上的规模化后训练。
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练以获得视觉理解能力。
DeepSeek V3.2 是 DeepSeek 推出的混合推理模型,主打高效长上下文扩展,已可通过 Baseten Inference Stack 的 OpenAI 兼容 API 端点调用。
Eugene Yan 总结九个机器学习系统设计模式,包括原始数据只处理一次、Human-In-The-Loop 标注、数据增强、难负例挖掘、问题重构、级联、数据飞轮、业务规则层和上线前评估。每条模式给出优缺点并结合 Meta、DoorDash、Twitter、Stack Exchange、ChatGPT 等案例,并探讨这些模式在 LLM 系统中的适用性。
文章用图书馆检索的类比解释 Attention 中的 query、key、value 向量:query 与各 key 做点积衡量相关性,经 softmax 归一化后对 value 加权求和。相比把整句压进固定向量的 encoder-decoder 循环模型,Attention 让解码器每步都能看到整个输入句,缓解信息瓶颈与长距离依赖,并支持并行计算。多头机制则让模型同时关注多个词。
在 Factual Inconsistency Benchmark(FIB)上,先用 Wikipedia 摘要微调 3 个 epoch 再在 FIB 上微调 10 个 epoch,PR AUC 达 0.85,比仅在 FIB 上微调提升 23%。