Oriol Vinyals:AlphaStar如何学会玩《星际争霸》

DeepMind研究科学家Oriol Vinyals回顾了AlphaStar项目,分享了从个人游戏经历到领导团队击败职业《星际争霸》选手的历程。他深入探讨了游戏的核心挑战(如庞大行动空间、部分可观察性)、AlphaStar的技术架构(模仿学习、序列建模、自博弈联盟)以及AI与人类玩家的异同。

奥里奥尔·维尼亚尔斯

导语

Oriol Vinyals是Google DeepMind的高级研究科学家,也是AlphaStar项目的负责人,该智能体首次在《星际争霸II》这一复杂的实时策略游戏中击败了人类职业选手。在这次访谈中,Vinyals从个人对电子游戏的热爱谈起,回顾了AlphaStar项目的起源、技术挑战与突破。他详细阐述了《星际争霸》游戏本身的复杂性、AlphaStar如何通过模仿学习和序列建模来理解游戏,以及通过“AlphaStar联盟”实现多样化的策略探索,最终达到了大师级玩家的水平。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

引言:嘉宾背景与项目概述

  • 主持人介绍嘉宾奥里奥尔·维尼亚尔斯是谷歌DeepMind高级研究科学家
  • 嘉宾是AlphaStar项目负责人,曾带领团队击败星际争霸顶尖职业选手
  • 访谈属于人工智能播客系列
02

早期经历:电子游戏与编程热情

01:08
  • 嘉宾最早接触的是电子游戏而非编程,通过破坏和修复电脑来学习
  • 他十岁左右开始沉迷电子游戏,特别是《星际争霸》初代
  • 他在98年的欧洲以准职业水平玩《星际争霸》
深读这一段

讨论的问题:是什么最初激发了奥里奥尔对计算机和电子游戏的兴趣?

论据 / 案例:嘉宾在90年代末的欧洲以准职业水平玩《星际争霸》初代

03

解释《星际争霸》的游戏机制

02:50
  • 《星际争霸》是实时战略游戏,类似看不见对方棋盘的国际象棋
  • 玩家需要收集资源、建造单位,并在实时决策中管理经济与侦察
  • 游戏具有部分可观察性、实时性和高强度的操作要求
深读这一段

讨论的问题:如何向从未玩过电子游戏的人解释《星际争霸》?

论据 / 案例:游戏在22赫兹的频率下离散化时间,玩家需要每分钟执行数百次操作

04

在线游戏与社会影响

05:19
  • 嘉宾回忆从局域网到战网的过渡,强调在线游戏的社交变革性
  • 他在《魔兽世界》等游戏中通过虚拟角色与来自不同背景的人建立真实友谊
  • 在线游戏,特别是《星际争霸》,在韩国等地较早成为主流文化现象
深读这一段

讨论的问题:在线游戏如何影响了社会互动和个人体验?

论据 / 案例:嘉宾提到韩国在1999-2000年左右因《星际争霸》就已形成网络咖啡馆文化,玩家可成为名人

05

AlphaStar项目的起源与目标

07:59
  • 项目灵感始于2014年谷歌大脑与DeepMind合并时的一次讨论
  • 2016年随着AlphaGo的成功和暴雪的邀请,项目正式启动
  • 核心目标是让神经网络通过学习,而非基于规则,来掌握这款复杂游戏
深读这一段

讨论的问题:AlphaStar项目是如何启动和构思的?

论据 / 案例:暴雪向DeepMind提供了一个挑战,暴雪对AI如何应用于游戏感兴趣,而DeepMind利用游戏推动AI进步

06

核心挑战:探索、感知与行动空间

09:52
  • 最大的技术挑战是巨大的动作空间和探索问题,随机行动在早期几乎都是负面的
  • 游戏的部分可观察性和实时性要求长期规划和记忆
  • 人类回放数据集是宝贵的资源,可用于监督学习以模仿人类行为
深读这一段

讨论的问题:解决《星际争霸》AI最困难的方面是什么?

论据 / 案例:在《星际争霸》中,几乎任何早期游戏的随机动作都是糟糕的,因为会破坏采矿经济

07

AlphaStar架构与模仿学习

11:20
  • AlphaStar的输入包括游戏画面和可见单位列表,类似于计算机视觉中的Transformer架构
  • 序力建模和动作预测问题类似于机器翻译,使用LSTM和Transformer架构
  • 第一阶段使用人类回放进行模仿学习,并通过MMR等级标签控制策略水平
深读这一段

讨论的问题:AlphaStar的神经网络架构和训练方法是什么?

论据 / 案例:通过输入MMR等级标签,可以让网络模仿不同水平玩家的行为,但模仿策略的胜率仍远低于人类

08

AlphaStar联盟与自对弈策略

13:15
  • 纯粹自对弈会陷入局部最优,因此创建了AlphaStar联盟以培养多样化的‘人格’
  • 联盟中包括执行‘大招’(cheese)、‘孤注一掷’(all-in)等不同策略的代理
  • 这种联盟模拟了人类在战网中遇到各种策略的环境,促进代理全面成长
深读这一段

讨论的问题:如何通过AlphaStar联盟避免训练陷入僵局并培养多样化策略?

论据 / 案例:在AlphaStar联盟中,代理会发展出不同的策略人格,以覆盖游戏中可能出现的各种情况

09

比赛结果、局限性与未来方向

14:20
  • AlphaStar在Protoss内战中5-0击败职业选手,展示了大师级水平
  • 比赛并非完美,代理在侦察、应对隐形单位等方面仍有漏洞,且动作速率和精度与人类有差异
  • 嘉宾认为未来挑战在于元学习(快速学会新种族)、减少经验需求以及更深入的智力探索
深读这一段

讨论的问题:AlphaStar的成就意味着什么,它还有哪些局限和未来挑战?

论据 / 案例:AlphaStar使用单个GPU运行,但在某些情况下动作速率可能超过人类,引发了关于是否应施加更多限制的讨论

金句

  • ""The problem is exactly the same. You're translating essentially a prefix of observations and actions onto what's going to happen next, which is exactly how you would train a model to translate or to generate language." ——问题完全相同。你本质上是在将一个由观察和行动组成的前缀,翻译成接下来将发生什么——这与训练模型进行翻译或生成语言完全一致。
  • ""Can we create a Battle.net for agents?" ——我们能为智能体创建一个‘战网’吗?
  • ""The agents play at Grandmaster level. They definitely understand the game enough to play extremely well. But are they unbeatable? Do they play perfect? No." ——智能体达到了宗师级水平。它们绝对足够理解游戏,能表现得极其出色。但它们是无敌的吗?它们打得完美吗?不。
  • ""This moment will resonate forever as a researcher and as a person." ——这一刻将作为研究者,也作为一个人,永远在我心中回响。

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · Oriol Vinyals:AlphaStar如何学会玩《星际争霸》