ARC-AGI 基准系列:从 ARC-AGI-1 到 ARC-AGI-3
先了解这件事
ARC-AGI 基准源自 François Chollet 于 2019 年提出的 ARC-AGI-1,包含 800 道网格类谜题,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。ARC Prize 发布 ARC-AGI 系列,称其延续该基准,用于衡量流体智能与技能获取效率,仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则;ARC Prize 将 AGI 定义为学习效率可匹配人类的系统。ARC-AGI-2 围绕符号解释、组合推理和上下文规则应用设计任务,评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告附带以成本衡量的效率指标,官方目标为 85% 准确率。ARC-AGI-3 为交互式推理基准,测试智能体探索新环境、即时获取目标并持续学习,100% 分数要求智能体像人类一样高效通关所有游戏,提供可回放运行记录、开发者工具包和集成文档,通过规划长度、记忆压缩和信念更新衡量 AI 与人类学习的差距。ARC Prize 公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3、ARC-AGI-2 和论文奖三条赛道。此前报道显示,ARC Prize 基金会发布面向研究者的 ARC-AGI 入门指南,覆盖 ARC-AGI-1、ARC-AGI-2 与 ARC-AGI-3。最新报道称,ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。
AI 根据报道生成 · 2 天前更新
事件进展
2 个进展
- 9月30日 23:27 · 1 篇报道GPT-6 Astra在ARC-AGI-3基准测试中表现优异ARC Prize:官方博客:OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 99.9% 最高分并超越人类动作效率基线
- 9月30日 23:27 · 6 篇报道ARC-AGI基准定义与核心设计理念ARC Prize:官方博客:ARC-AGI-2 基准发布,设计用于测试 AI 推理系统的符号解释与组合推理能力
报道时间线
沿着报道,了解事件的不同侧面。
- ARC Prize:官方博客精选OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 99.9% 最高分并超越人类动作效率基线
ARC Prize 发布 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。
- ARC Prize:官方博客ARC Prize 发布 ARC-AGI 研究入门指南:从 ARC-AGI-1 到 ARC-AGI-3
ARC Prize 基金会发布面向研究者的 ARC-AGI 入门指南,覆盖 ARC-AGI-1、ARC-AGI-2 静态推理基准与首个交互式推理基准 ARC-AGI-3。
- ARC Prize:官方博客ARC Prize 2026 启动,设 200 万美元奖金和三条赛道
ARC Prize 官方公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3 交互推理基准、ARC-AGI-2 静态推理基准和论文奖三条赛道。
- ARC Prize:官方博客精选ARC-AGI-3 交互式推理基准发布
ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。
- ARC Prize:官方博客精选ARC-AGI-2 基准发布,设计用于测试 AI 推理系统的符号解释与组合推理能力
ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。
- ARC Prize:官方博客ARC-AGI-1:从 2019 年提出到被 o3-preview 攻破的推理基准
ARC-AGI-1 是 François Chollet 于 2019 年提出的推理基准,包含 800 道网格类谜题任务,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。
- ARC Prize:官方博客ARC Prize 发布 ARC-AGI 系列:以核心知识先验衡量通用智能
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。