跳到正文
原文
The Decoder:AI News(RSS)· Maximilian Schreiner·· 3 小时前精选AI 评分78

Ataraxos 击败 Stratego 史上最强人类选手,训练成本不到 8000 美元

AI beats Stratego's greatest player, ending one of the last human strongholds in board games

AI 导读

研究团队开发的 Ataraxos 在三周对局中以 85% 有效胜率击败 Stratego 史上最负盛名的选手 Niemeijer,后者曾获四届世界冠军并在世界排名第一超过 600 周。

推荐理由

原文给出 Ataraxos 以不到 DeepNash 五百分之一的算力成本击败人类最强 Stratego 选手的关键细节,方法也可迁移到其他不完全信息博弈。

正文 · AI 翻译

Niemeijer被认为是这项运动历史上荣誉最多的选手。他赢得过四次世界冠军、15次荷兰全国冠军和两次线上世界冠军,并在世界排名第一的位置上停留了600多周。George Franka是自1997年以来唯一一位参加过每一届世界锦标赛的选手,他称Niemeijer为"有史以来最伟大的Stratego选手"。

Stratego对AI来说是一项格外艰难的考验,因为双方都要将自己的40枚棋子面朝下布置。根据该论文,可能的布局超过10^33种。在这类信息不完整的博弈中,一步棋的价值不仅取决于之后的走法如何发展,还取决于决策之前和决策过程中发生了什么,第一作者Samuel Sokota在X上写道。

双方都秘密布置自己的棋子。棋子的等级只有在与对方棋子相遇时才会揭晓。谁夺取了对方的军旗谁就获胜。 | 图片:Sokota, S., Vinitsky, E., Hu, H. et al.

据Sokota称,源自扑克AI的方法确实绕过了这个问题,但仅限于隐藏信息很少的情况。在德州扑克中,只有1,326种可能的起手牌,而根据该论文,这些方法所需的计算量会随着隐藏信息的增加而增加。因此,Stratego是人类仍优于AI的最后几款主要竞技棋类游戏之一。

大学预算击败了DeepMind数百万美元都做不到的事

DeepMind此前正是在这款游戏中未能突破顶尖人类选手的水平。根据该论文,其DeepNash系统在1,024个TPU节点上训练了两到三个月,这是相应的DeepNash作者回忆的。Ataraxos的作者估计,按2025年的价格计算,这需要花费300万到450万美元。

相比之下,Ataraxos在16块Nvidia H100 GPU上只需一周时间,其所谓的信念网络再在4块GPU上多花四天。按2025年的价格计算,这不到8,000美元。研究人员称其计算成本约为前者的1/500,自我对弈局数约为1/30,训练样本数约为1/100。他们将此归功于自己编写的定制GPU模拟器,但也归功于高得多的样本效率。Sokota写道,该团队受限于学术计算资源,多年来积累了大量技巧。

两套系统之间没有进行过正面对比。研究人员表示他们曾提出搭建必要的基础设施,但DeepMind告诉他们这不可能,因为DeepNash的代码已无法运行。在2023年世界锦标赛上,DeepNash在28局中赢了19局,但输给了大多数顶尖选手,包括Niemeijer。

迫使AI变换打法可以防止它陷入僵局

Ataraxos不依赖任何人类数据,完全通过自我对弈学习。根据该论文,关键在于系统被逼着变换打法的力度有多大。训练期间的一个额外条件使AI分散其布局和走法,而不是早早锁定在固定策略上。这被称为正则化。作者们说,这在Stratego中很重要,因为高水平的对弈需要大量随机性,而打法可预测的选手会被利用。

随着训练的进行,研究人员会放松这种压力,并相应调整学习步长的大小。早期,Ataraxos 的走法变化很大,学习时步子也迈得很大。到了后期,它的走法更加审慎,只做小幅修正。这样可以防止学习过程原地打转或变得混乱——在不完全信息博弈中,这种情况往往会发生。研究人员将正则化比作一种能量储备。如果 AI 消耗得太快,它会在早期取得快速进展,但随后就会失去继续学习的能力,并且往往变得容易被利用。

Ataraxos 还使用一个信念网络来预测对手的隐藏棋子是什么。在每一步棋之前,AI 用它来生成可能的棋局状态,推演候选走法,并专门为这一决策额外执行一步学习。作者表示,此前的工作跳过了这类搜索,因为人们认为在如此多的隐藏信息下这太难了。

尽管存在固有劣势,AI 仍大获全胜

研究人员将对抗 Niemeijer 的系列赛分散在三周内进行,以避免疲劳,并给他时间准备。Niemeijer 知道 Ataraxos 不会适应他的风格。他因参赛获得 1000 美元,另外每胜一局得 100 美元,每平一局得 50 美元,因此他有经济动力去全力以赴。

作者写道,将平局按半胜计算,85% 的有效胜率在最高水平上是前所未有的。三届世界锦标赛亚军 Max Roelofs 表示,顶尖水平的差距极其微小,因为这款游戏迫使玩家冒险。AI 还在结构性上处于劣势。Niemeijer 可以在多局比赛中适应它,但它却无法适应他。根据论文,三届世界冠军 Vincent de Boer 认为这是一个重大障碍。

在 2025 年 Stratego 世界锦标赛的表演赛上,Ataraxos 还在对阵参赛选手的 40 局比赛中赢下了 38 局。选手们形容它的风格难以捉摸。AI 会做出人类认为风险太大的虚张声势,而当它落后时,它会顽固地拖延,以至于一些选手觉得这很无礼。它还似乎幸运得近乎诡异,因为它的棋子似乎总是恰好出现在正确的位置。这些对阵 Niemeijer 的对局可以在网上找到。

该方法远不止适用于 Stratego

研究人员用同样的方法构建了其他系统。在 Barrage Stratego 变体中,他们的 AI 在对阵三位顶尖选手的四个 50 局系列赛中全部获胜,这三位都是两届 Barrage 世界冠军。在合作卡牌游戏 Hanabi 中,它在每个变体中都创下了新纪录,而在双人版本中,它所需的计算量比之前领先者少了两个数量级。在中国卡牌游戏斗地主中,它击败了此前的基准系统 PerfectDou 和 DouZero。

作者从这些结果中得出了一个宏大的结论。他们认为,大量隐藏信息不再是强化学习和搜索的障碍。只要能为这些决策问题构建快速而准确的模拟器,这将使实用 AI 在许多战略决策问题上触手可及。论文指出,金融市场、军事冲突和谈判就是不完全信息情境的例子。

研究人员承认了一个局限性。由于该搜索仅模拟单个学习步骤,其性能无法仅通过增加计算时间而持续提升。更复杂的搜索方法可能会改变这一点。团队已将 Ataraxos 的代码公开。

来源:The Decoder:AI News(RSS) · the-decoder.com