MIT 等机构发布 Ataraxos,以极低成本战胜顶级人类 Stratego 选手
This game-playing AI is the new champ at Stratego
MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。
原文解释了 Ataraxos 如何用自博弈强化学习和决策时规划以远低于以往的训练成本战胜顶级 Stratego 选手,方法细节可直接对照其他隐藏信息博弈场景。
一种擅长处理隐藏信息类高难度游戏的新型AI系统,未来或能帮助人类决策者在军事演习等复杂局势中选出克敌制胜的理想策略。
借助机器学习领域的进展,来自麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员开发出一种AI,以巨大优势击败了棋盘战争游戏《Stratego》的顶尖人类玩家——这是此前任何AI系统都未能做到的。
《Stratego》是一种信息不完美的双人游戏,对手棋子的身份始终隐藏,常被用作测试强大AI模型战略思维能力的基准。
为构建该模型,研究人员将高效训练算法与专为隐藏信息环境下的审慎决策量身定制的新技术相结合。
该AI系统在《Stratego》中的表现优于次优模型,同时训练成本远更低、算力需求也小得多。该系统还在规则和设计各异的其他策略游戏中击败了顶尖人类玩家,表明其可泛化应用于多种场景。
该AI系统可经调整用于帮助人类解决许多具有隐藏信息的现实问题,如商业谈判或网络安全。
“在现实中会遇到的这类信息不完美任务里,你往往没有条件穷举所有可能性。可能性实在太多了。拥有通用且能可证明地出色完成这一挑战性任务的AI算法,是向前迈出的一大步,”麻省理工学院电气工程与计算机科学系(EECS)助理教授、信息与决策系统实验室(LIDS)首席研究员、该AI系统论文的资深作者Gabriele Farina说。
与他共同撰写该论文的还有第一作者、卡内基梅隆大学研究生Samuel Sokota;纽约大学助理教授Eugene Vinitsky;卡内基梅隆大学教授Zico Kolter;斯坦福大学研究生Hengyuan Hu;以及麻省理工学院EECS研究生Zhiyuan Fan。这项研究今日发表于《自然》。
隐藏信息
这个世界充满了信息不完美的问题。
在这类互动中,一些参与方掌握着其他方所没有的信息。例如,金融市场中的交易者可能不知道他人交易背后的理由,而军事力量很可能并不完全掌握敌方位置。
在存在隐藏信息的情况下,各方所做的决策以及他们选择不做的决策彼此交织,使得确定下一步最佳行动极为困难。
“你虚张声势越多,对手就越会预料到,每次虚张声势的价值也就越低。如何对此进行推理并不显而易见,”Sokota解释道。“这与国际象棋之类的场景非常不同,在国际象棋中,无论你下过多少次,最佳着法仍然是最佳着法。”
《Stratego》常被用来模拟信息不完美的情境。在这款类似军棋的棋盘战争游戏中,玩家在己方一侧布置40枚棋子,然后移动棋子穿越棋盘,夺取对手的军旗。
但所有棋子的身份在相撞之前都保持秘密,相撞后级别较低的棋子被淘汰。
可能的棋子配置数量超过 10 的 66 次方——比国际象棋的数量呈指数级增长——这使得 AI 系统极难在 Stratego 中表现出色。
过去的努力,例如谷歌的 DeepMind,依赖于计算量大且成本高昂的复杂运算。但即使投入数百万美元的培训成本,这些模型仍然不够强大,无法击败顶尖的人类 Stratego 玩家。
“对于 Stratego 来说,可能存在大量你不得不应对的宇宙。为扑克等游戏开发的 AI 技术在这种设定下绝对无法扩展,”Farina 说。
麻省理工学院的研究人员着手开发一个完整的人工智能系统,能够以更低的成本实现超人表现,他们将其命名为 Ataraxos(一个希腊词,用来形容不受打扰或无忧无虑的人)。
双管齐下的方法
为了构建 Ataraxos,研究人员使用一种称为自我对弈强化学习的技术来训练模型。该模型与自己对弈多次,以学习如何在 Stratego 中脱颖而出的强大“蓝图策略”。
他们设计了特别高效的算法,使 Ataraxos 的学习速度比先前方法快得多,同时确保它不会陷入试图预测每一种可能走法的困境。这降低了训练成本并提升了性能。
“我们的系统达到了严格高于 DeepNash(DeepMind 的系统)的对弈强度,同时使用的训练样本不到其百分之一,自我对弈局数不到其三十分之一,这表明效率有了巨大提升,”Farina 说。
在对局中,Ataraxos 使用蓝图策略作为起点来布置棋盘,并在每一轮对局中开始思考其下一步走法。
但在行动之前,它会使用一种称为决策时规划的技术即时优化其选择。该系统采用一个生成模型,利用概率来估计对手隐藏棋子的可能身份,然后在选择下一步走法之前评估未来的选择。
“我们不是盲目猜测,而是使用决策时规划来找到最可能的棋盘状态。使用这个生成模型使我们能够真正聚焦于我们面对的具体棋盘和对手,”Farina 说。
这种将生成模型创新性地用于决策时规划,正是使 Ataraxos 实现超人表现的关键缺失环节。
Ataraxos 以 15-1-4 的创纪录比分击败了世界上最强的 Stratego 玩家,并在 Stratego 世界锦标赛上对阵顶尖人类玩家取得了 39-2 的战绩。“Ataraxos 擅长以人类所不具备的方式计算风险。如果一个人最有价值的棋子暴露了,他可能会开始惊慌失措,但这个机器人却能出奇地镇定。它不会过度纠正并泄露自己的秘密,”Farina 说。
研究人员还将 Ataraxos 适配到其他不完全信息博弈中,包括 Barrage Stratego(一种节奏更快、棋子更少的变体)、Hanabi(一种多人合作的卡牌游戏)以及斗地主(一种两名玩家合作对抗第三名玩家的游戏)。
该系统在每种情况下都实现了超人表现,证明了这种方法的通用性。
未来,研究人员希望将可解释性措施纳入 Ataraxos,以便系统能够以人类可以理解的方式解释其决策。
“人类必须对是否采纳推荐拥有最终决定权,因此在采用之前,我们需要一种审计模型决策的方法。我们还有很长的路要走,但我希望这些算法能成为未来更多研究的基础,”Farina 说。
这项研究部分由美国海军研究办公室、纽约大学土木与城市工程系、C2SMART 中心、美国国家科学基金会以及 Schmidt Sciences AI2050 早期职业奖学金资助。
来源:MIT News(RSS) · news.mit.edu