前天一大早,OpenAI Five在Dota2的赛场上完虐人类方的消息不胫而走。算上由观众组成的业余队和由前职业选手和现役职业选手组成的半职业队,人类方先是被血虐4局,最后一场尊严之战则是在给AI方挑选上一支前期线上吃亏、己方上场5位对线强势的阵容后才勉强取得胜利。 毫不夸张地说,这一次的人类方,一败涂地。 Dota2作为世界上最受欢迎同时也最复杂的电子竞技游戏之一,全球最有天赋的职业选手日夜训练去和别的选手争夺每年4千万美元的奖金池,这在当前所有电竞游戏的奖金中是最高标准。 然而和人类不同的是,人工智能OpenAI Five每天都与自己在对战,一天甚至能打200万场比赛。按照开发人员所述,这是“自我博弈(self-play)”。高强度的训练对机器并不会造成负担和负面影响,仅仅只会让它在不断实战中变得更聪明。 Dota这个AI有何不一样? 虽然同属人工智能,但是OpenAI Five和之前精通棋类的AlphaGo不同,对于它们来说在《星际争霸》或者《Dota2》这种复杂的电子游戏中超越人类,是AI发展史上重要的里程碑。 AlphaGo横扫人类围棋圈引起了很大的轰动 和棋盘上的博弈比起来,Dota2作为一款5V5的多人对战游戏,每名玩家都要控制一个英雄,导致AI的上手门槛和需要精通的标准高了太多。 高强度指令运算: 假设Dota2以30帧每秒运行,平均对局时间在45分钟。那么一场比赛下来就有8万帧可以操作。而大部分的操作比如移动英雄,每一帧的操作对整体战局的影响较为微弱,但像是回城等行为则是在战术层面左右战局结果。 如果人工智能每4帧操作一下,那么一场比赛下来需要操作2万步。并且这每一步都是经过战略上逻辑运算后的结果。如果你对两万步没什么概念,那么这里举个例子,国际象棋通常40步就能结束“战斗”,而围棋则需要150步。相比较之下,Dota2的运算量真的是远超前者。 有限的可视状态: Dota的战局被战争迷雾笼罩,单位和建筑物只能看到周围的区域,黑暗区域隐藏着敌人和蠢动的策略。而玩家就需要根据这不完全的数据做出推论,模拟出对手可能要做的事情,并作出针对性计划。在这点,国际象棋和围棋的棋盘信息都是完全暴露的。 高维连续动作空间: 在Dota中,每个英雄可以采取数十个行动,许多行动要么针对另一个单位,要么针对地面上的一个位置。我们将每个英雄的空间离散为17万个可能的动作(并不是每一次行动都是有效的,比如使用一个冷却中的技能),平均每个行动会有1000个有效的动作。但是对于国际象棋和围棋来说,这个数字仅仅是35和250,差距巨大可见一斑。 高维连续可视空间: Dota是在一个巨大的动态地图上进行比赛的游戏,包括十个英雄,几十个建筑,几十个NPC和多变的游戏功能,如符文、树木、区域等。OpenAI
Continue reading完虐职业Dota选手的OpenAI Five到底有什么神通?