跳到正文
原文
ARC Prize:官方博客·· 2 小时前精选AI 评分68

ARC Prize 发布:百万美元奖金征集 ARC-AGI 开源解决方案

Announcing ARC Prize

AI 导读

François Chollet 与 Mike Knoop 宣布 ARC Prize,设立超 100 万美元奖金池,奖励攻克并开源 ARC-AGI 评测的方案。文章认为 LLM 本质是记忆而非推理,ARC-AGI 自 2019 年 SOTA 仅 20%,如今也只有 34%,而人类轻松完成;比赛旨在推动开源 AGI 研究、普及客观的 AGI 进展度量。

推荐理由

Chollet 与 Knoop 官方宣布百万美元 ARC Prize,主张 LLM 靠记忆而非推理,借此激励开源新架构探索。

正文 · AI 翻译

一场奖金超过 1,000,000 美元、面向开放 AGI 进展的竞赛。

AGI 进展已经停滞。需要新的想法。

智能 vs 记忆

现代 AI(LLM)已被证明是强大的记忆引擎。它们能够记住训练数据中的高维模式,并将这些模式应用到相邻的上下文中。它们表面上的推理能力也是如此运作的。LLM 实际上并没有在推理。相反,它们记住推理模式,并将这些推理模式应用到相邻的上下文中。但它们无法基于新情境生成新的推理。

更多的训练数据让你可以在基于记忆的基准测试(MMLU、GSM8K、ImageNet、GLUE 等)上“买”到性能。但仅靠记忆并不是通用智能。通用智能是高效获取新技能的能力。

更大的规模不会让 LLM 学会新技能。我们需要新的架构或算法,使 AI 系统能够在测试时学习。这正是人类能够适应新情境的方式。

在 LLM 之外,多年来,我们已经有了能在扑克、国际象棋、围棋和其他游戏中击败人类的 AI 系统。然而,没有任何一个被训练为在某一游戏中取得成功的 AI 系统可以简单地被重新训练用于另一个游戏。相反,研究人员不得不为每个游戏重新设计架构并构建全新的系统。

这是泛化能力的失败。

没有这种能力,AI 将永远受限于循环中的人类通用智能。我们想要能够与人类一起发现和发明的 AGI,以推动人类前进。

鉴于 LLM 在过去 4 年中的成功和已被证明的经济效用,上述说法可能显得非同寻常。强有力的主张需要强有力的证据。


ARC-AGI

由 François Chollet 在其颇具影响力的论文“On the Measure of Intelligence”中提出,ARC-AGI 是唯一衡量通用智能的 AI 评估:一个能够高效获取新技能并解决新颖、开放式问题的系统。

ARC-AGI 创建于 2019 年,当时最先进(SOTA)的高分是 20%。如今,仅为 34%。

然而人类——甚至儿童——都能快速掌握任务。

ARC-AGI 对人类来说很容易,对现代 AI 来说却不可能。

大多数 AI 基准测试会迅速饱和至人类表现水平,因为它们只测试记忆,而这是 AI 超越人类的能力。

ARC-AGI 并未饱和,事实上当前进展正在放缓。它被设计用来抵抗记忆,并已被证明对最大的基础 transformer 模型以及为攻克 ARC-AGI 而定制的 AI 系统都极具挑战性。

ARC-AGI Benchmark Comparison

ARC-AGI 的解决方案至少会开启一种全新的编程范式,使程序能够从任意一组先验中完美且可靠地泛化。我们也相信,解决方案正处于通往 AGI 的关键路径上

3 ARC-AGI Tasks


开源 AGI 进展

如果你接受需要新的想法,那就让我们考虑如何提高新想法的产生速度。不幸的是,AI 的趋势正朝着错误的方向发展。

闭源 vs 开源

从 GPT-4 发布开始,前沿 AGI 进展已转向闭源。GPT-4 技术报告令人惊讶地不包含任何技术细节。OpenAI 表示,“竞争”原因是首要原因。Google 的 Gemini 技术报告也不包含关于长上下文窗口前沿创新的任何技术细节。

LLM 还使研究注意力的大部分从新架构和新算法上转移开。2023 年,超过 200 亿美元被投入非通用 AI 公司,许多 DeepMind 前沿研究人员被重新调配到 Gemini(以与 OpenAI 竞争)。

领先实验室有强烈的动机大声宣称“规模就是你所需要的一切”,以及“不要试图在前沿研究上与我们竞争”,尽管他们私下都认为需要新想法才能实现 AGI。他们赌的是,他们能在自己的实验室里发现所有必要的新想法。

LLM 历史

但让我们看看 LLM 的历史。具体来说,是 transformer 架构。Transformer 是在机器翻译研究(例如英语到西班牙语)多年之后才出现的。

  • 2014:Sutskever 等人(Google)发表了 Seq2Seq Learning,使用 RNN 和 CNN 处理可变长度的输入与输出(英语和西班牙语单词长度不同)。
  • 2016:Bahdanau 等人(Jacobs University)推广了 “注意力”的概念,使系统能够考虑输入的不同部分来预测输出(英语形容词在名词前,西班牙语在名词后)。
  • 2017:Vaswani 等人(Google)意识到 “注意力就是你所需要的一切”,放弃 RNN 和 CNN,优化架构,实现新的规模
  • 2018:Radford 等人(OpenAI)创建了 GPT-2,建立在前沿规模的 transformer 架构之上,展现出涌现能力

Transformer 的故事就是科学的故事。不同实验室和团队的研究人员发表并建立在他人的工作之上。

虽然一个实验室有可能独自发现 AGI,但这极不可能。如果我们接受现状,全球发现 AGI 的机会已经减少,并将继续减少。

进展

在过去一年里,我与许多年轻学生和潜在研究人员交谈过。许多人感到沮丧。有一种恐惧感,认为一切都已经弄清楚了。但这不是真的!AI 生态系统故意讲述部分真相,以提升其相对竞争地位,却损害了通往 AGI 的实际进展。

更糟糕的是,不准确的“规模就是你所需要的一切”信念现在正在影响 AI 监管环境。监管机构正在考虑在前沿 AI 研究上设置障碍,其错误假设是 AGI 即将到来。事实是,没有人知道如何构建 AGI。

我们应该努力激励新想法,而不是减缓它们。互联网和开源是世界上见过的最强大的创新引擎。

通过激励开源,我们提高新想法的产生速度,增加发现 AGI 的机会,并确保这些新想法广泛传播,以在小型和大型 AI 公司之间建立更公平的竞争环境。

我们希望 ARC Prize 能帮助抵消这些趋势。


ARC Prize

宣布 ARC Prize,一个奖金池超过 1,000,000 美元的竞赛,旨在击败并开源 ARC-AGI 评估的解决方案。

由 Mike Knoop 和 François Chollet 主办。由 Infinite Monkey 和 Lab42 呈现。

François Chollet and Mike Knoop

François Chollet & Mike Knoop

ARC Prize 目标

  1. 增加从事前沿 AGI 研究的人数。
  2. 推广一种客观衡量 AGI 进展的标准。
  3. 解决 ARC-AGI,并了解关于智能本质的新知识。

开始使用

准备好迈出多年来迈向 AGI 的第一大步了吗?无论你是谁,来自哪里,以什么为生,都欢迎加入这场竞赛。新想法可能来自任何地方。也许就是你?

在此处查看 ARC Prize 2024 的竞赛形式和奖金详情。

有关如何开始解决 ARC-AGI 的更多信息,请访问指南。

要了解更多关于 ARC-AGI 如何衡量通用智能的信息,请访问 ARC-AGI。

在 X/Twitter、YouTube、Email 和 Discord 上随时了解 ARC Prize 的进展和 SOTA 解决方案。你也可以通过 team@arcprize.org 联系我们。

来源:ARC Prize:官方博客 · arcprize.org