奥里奥尔·维尼亚尔斯
立场时间线 7 条 · 7 个议题
同一议题按时间排列,说法变化一目了然。
Vinyals认为《星际争霸》因实时性、战争迷雾和长期规划需求比围棋等棋类更具挑战性,是探索通用人工智能的绝佳试验场。
“游戏的实时性、庞大行动空间、部分可观察性(战争迷雾)以及需要长期规划的特点,使其比围棋等棋类游戏更具挑战性。这为探索通用人工智能提供了绝佳的试验场。”
来源访谈 →他认为《星际争霸》的核心挑战在于探索:随机尝试很难获得胜利奖励,因此先用人类录像做模仿学习解决冷启动问题。
“在《星际争霸》中,随机尝试行动很难获得正向奖励(胜利)。AlphaStar通过利用人类录像数据进行模仿学习来解决早期探索难题,避免了智能体在随机尝试中一无所获。”
来源访谈 →他明确指出模仿学习只是起点,仅能让智能体达到黄金/白金级水平,必须靠后续自博弈才能继续提升。
“通过向网络输入玩家等级信息,智能体能模仿不同水平的行为,但这仅能使其达到黄金/白金级,需要后续的自博弈来提升。”
来源访谈 →Vinyals认为AlphaStar的核心是把观察与行动的序列建模为预测下一步的问题,与机器翻译在本质上完全相同。
“问题完全相同。你本质上是在将一个由观察和行动组成的前缀,翻译成接下来将发生什么——这与训练模型进行翻译或生成语言完全一致。(The problem is exactly the same. You're translating essentially a prefix of observations and actions onto what's going to happen next, which is exactly how you would train a model to translate or to generate language.)”
来源访谈 →他主张用多种不同“性格”的智能体组成联盟对战,以克服单一自博弈策略陷入局部最优的问题。
“为了克服单一自博弈策略易陷入局部最优的问题,DeepMind创建了由多个不同“性格”(如激进、贪婪)的智能体组成的联盟进行对战。这确保了智能体能遇到并学会应对《星际争霸》中各种多样的策略(如“大招”),从而变得更全面。”
来源访谈 →他承认AlphaStar虽已达宗师级水平、足够理解游戏,但并非无敌、决策并不完美,仍存在可被利用的弱点。
“智能体达到了宗师级水平。它们绝对足够理解游戏,能表现得极其出色。但它们是无敌的吗?它们打得完美吗?不。”
来源访谈 →他提出设想:为智能体打造一个类似“战网”的在线对战平台。
“我们能为智能体创建一个“战网”吗?(Can we create a Battle.net for agents?)”
来源访谈 →金句墙 4 条
“The problem is exactly the same. You're translating essentially a prefix of observations and actions onto what's going to happen next, which is exactly how you would train a model to translate or to generate language.”
问题完全相同。你本质上是在将一个由观察和行动组成的前缀,翻译成接下来将发生什么——这与训练模型进行翻译或生成语言完全一致。
Oriol Vinyals:AlphaStar如何学会玩《星际争霸》 · 2019/4/29“Can we create a Battle.net for agents?”
我们能为智能体创建一个‘战网’吗?
Oriol Vinyals:AlphaStar如何学会玩《星际争霸》 · 2019/4/29“The agents play at Grandmaster level. They definitely understand the game enough to play extremely well. But are they unbeatable? Do they play perfect? No.”
智能体达到了宗师级水平。它们绝对足够理解游戏,能表现得极其出色。但它们是无敌的吗?它们打得完美吗?不。
Oriol Vinyals:AlphaStar如何学会玩《星际争霸》 · 2019/4/29“This moment will resonate forever as a researcher and as a person.”
这一刻将作为研究者,也作为一个人,永远在我心中回响。
Oriol Vinyals:AlphaStar如何学会玩《星际争霸》 · 2019/4/29