ARC Prize 2026 启动,设 200 万美元奖金和三条赛道
ARC Prize 官方公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3 交互推理基准、ARC-AGI-2 静态推理基准和论文奖三条赛道。
ARC Prize 官方公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3 交互推理基准、ARC-AGI-2 静态推理基准和论文奖三条赛道。
Tom Tunguz 引用 Stanford 与 Together AI 的研究,提出 intelligence-per-watt 将像当年的 performance-per-watt 一样推动 AI 从云端走向端侧。
推荐理由:原文引用研究数据解释 intelligence-per-watt 趋势如何推动 AI 向端侧迁移,并给出本地加路由方案相对全云的能效与成本收益。
ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。
推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。
Tomer Tunguz 撰文分析 AI 基础设施短缺正按牛鞭效应依次传导:2023 年初 H100 租金曾超 $9/小时,2023 年服务器出货量下滑 22%。
推荐理由:作者用多年价格和产能数据梳理 AI 硬件短缺的接力顺序,读者可以据此理解瓶颈传导的时滞机制。
ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。
推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。
ARC-AGI-1 是 François Chollet 于 2019 年提出的推理基准,包含 800 道网格类谜题任务,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。
推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。
Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。
月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。
Z.AI 发布 GLM-5.3,定位智能体工程,与 GLM-5.2 使用相同的 744B-A40B MoE 底座,全部能力提升来自在更多样真实任务环境(完整代码库、文档、测试工具、多步工作流)上的规模化后训练。
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练以获得视觉理解能力。
DeepSeek V3.2 是 DeepSeek 推出的混合推理模型,主打高效长上下文扩展,已可通过 Baseten Inference Stack 的 OpenAI 兼容 API 端点调用。
TensorZero 用三个真实任务(CoNLL++ 命名实体识别、terminal-bench 智能体编码、τ-bench retail 客服工具调用)对比 o4-mini 上的 RFT 与 GPT-4.1 mini 的 SFT。
RadixArk SGLang 团队与 Ant Ling Infra 团队在 4 张 NVIDIA Blackwell GPU 上为混合线性注意力 MoE 模型 Ling-3.0-flash 优化 batch-1 解码,NEXTN/MTP 路径将单请求吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。
推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 推出 LongevityBench,一个覆盖五个生物数据领域的 17 项任务开放基准,并用它评估了来自六个开发团队的 18 个前沿 AI 系统。同期研究还包括 In-Place Tokenizer Expansion,可在不损失质量的前提下将非英文 token 数量最多减少 4 倍。
Z.AI 发布面向智能体工程的新模型 GLM-5.3,沿用与 GLM-5.2 相同的 744B-A40B MoE 底座,能力提升全部来自在更多样真实任务环境上的规模化后训练。
Baseten Base Labs 推出 Inkling 模型,API 中模型标识为 inferact/inkling-nvfp4,返回结果包含 reasoning_content 字段,可输出推理过程。示例请求中 prompt_tokens 为 9、completion_tokens 为 295,其中 reasoning_tokens 占 182。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
Fireworks AI 基于 DeepSWE v1.1 的 113 个任务分析称,按任务选模型的 oracle 路由在 18 个模型上可达 97.6% 通过率、每任务 $1.88,比最佳单模型 GPT-6 Astra(74.1%、$6.52)高 23 分且成本不到三分之一;仅用开源权重模型也能达 90.3%、$1.45。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Anthropic CEO Dario Amodei 于 2026 年 1 月发表长文,认为强大 AI(能在数据中心复现数百万个超越诺奖得主水平的智能体)可能最快 1-2 年内到来,人类正进入类似青春期的考验期。
推荐理由:Dario 以当事方身份系统梳理五类 AI 风险及 Anthropic 已落地的对齐、可解释性和监管实践,可帮助读者建立务实的风险框架。
Cognition 发布 SWE-2,其最强编码模型在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 差距不到 1 分且便宜 64%。
NVIDIA 在 IFA 2026 宣布与 Microsoft 及伙伴合作加速本地 AI,包括 Hermes Agent、OpenClaw 和 Perplexity Portable Computer 的简化本地模型配置,llama.cpp 与 vLLM 带来最高 1.9x 推理提升,并推出开源工具 NVIDIA PAIR 在局域网内分发推理请求。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
Ant Group 发布基于 Ling-3.0-flash 的金融开源权重模型 Ling-3.0-flash-Fin,MIT 协议,124B 总参数、每 token 激活 5.1B(MoE),256K 上下文,纯文本输入输出,可经 OpenRouter 调用。
Artificial Analysis 评测 Grok 4.7(xhigh),在 Intelligence Index 得 46 分(较 Grok 4.6 +2),使 SpaceXAI 进入前四。
推荐理由:独立评测给出了 Grok 4.7 在智能指数与编码 Agent 指数的具体得分、排名变化和 token 用量,可用于对比选型。
Artificial Analysis 评测 GPT-6 Sol 和 Luna,两者价格较 GPT-5.6 减半,Intelligence Index 持平,Sol 编码指数升 2 分至 57,Luna 降 2 分至 41。
推荐理由:原文以统一基准实测两款新模型的成本与能力变化,读者可据此判断价格减半后智能与编码表现的取舍。
Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数得分 56(max 档较 Sonnet 5 提升 18 分),仅次于 Opus 5.5 (max)。
推荐理由:原文给出 Sonnet 5.5 在智能指数、token 用量和成本上的具体数据,读者可据此对比其与 Opus 5.5 和 GPT-6 系列的实际取舍。
Artificial Analysis 评测 GPT-6.1 Sol:智能指数比 GPT-6 Sol 高 4 分,距 GPT-6 Astra 仅 1 分,每任务成本 $0.72 不到 GPT-6 Astra 的四分之一。
推荐理由:原文给出 Intelligence Index 得分、Cost per Task 与各基准的逐项对比,读者可据此判断 GPT-6.1 Sol 在成本效率前沿上的位置。
ARC Prize 2026 - ARC-AGI-3 竞赛当前排行榜显示,Tufa Labs 以 45.33 分位居第一,Yi-Chia Chen 以 40.80 分排名第二,Daniel Franzen 以 27.24 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。
ARC Prize 公布 ARC-AGI 社区排行榜,Tycho 在 ARC-AGI-3 Public Demo 上取得 100.0% 成绩、成本 $2,986,位列榜首。
物理学家 Matt von Hippel 发起挑战后,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 配合 Claude Science 平台算出了 planar N=4 super Yang-Mills 的九环六粒子振幅。
推荐理由:作者亲历发起挑战到被 Claude 算出九环结果的全过程,给出预算、验证方式和人类团队对比等一手细节。
Anthropic 前沿红队发布对智谱 GLM-5.3 的评测,发现它能自主构建端到端网络漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。
推荐理由:Anthropic以第一手评测数据给出GLM-5.3的攻击能力与防护绕过率,读者可据此权衡开源权重模型在网络攻防两侧的风险。
GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。
Apple 研究者提出往返协议,测试语言模型将树结构算术表达式序列化为自然语言后能保留多少信息。评估 16 个模型的所有两两组合发现,通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本可将所有开源权重模型提升至未训练 Gemini-3.1-Pro 之上。