阿尔法狗的奥秘:十层网络征服围棋

Eric Jang,前1X Technologies AI副总裁、Google DeepMind Robotics资深研究科学家,在休假期间从零重建AlphaGo。本期播客中,他深

埃里克·张

导语

Eric Jang,前1X Technologies AI副总裁、Google DeepMind Robotics资深研究科学家,在休假期间从零重建AlphaGo。本期播客中,他深入拆解了AlphaGo的核心算法——蒙特卡洛树搜索(MCTS)、价值网络与策略网络如何协同工作,并探讨了这一经典AI系统对现代大语言模型RL训练及通用人工智能研究的深刻启示。

核心观点

  • AlphaGo的核心理念是利用神经网络将大规模搜索问题压缩为可处理的规模。围棋博弈树规模远超宇宙原子数量,但通过深度神经网络对局面进行快速价值评估和落子概率预测,可大幅削减搜索的深度与广度。
  • 蒙特卡洛树搜索(MCTS)并非试图直接优化胜率,而是为每个已执行的动作提供更优的替代标签。算法通过选择、扩展、评估和回溯四步迭代,最终输出比初始策略网络更尖锐的落子概率分布。
  • 策略网络与价值网络共享表征,两者在训练中应保持一致。如果策略网络高概率推荐的落点被价值网络判定为低价值,则说明模型内部存在矛盾,这种一致性约束提升了学习效率。
  • 将搜索过程蒸馏回神经网络,可实现测试时计算与训练时计算的相互替代。通过训练网络直接预测MCTS搜索结果,可将1000步搜索的成果“压缩”进网络前向传播中,从而在相同推理成本下获得更强的棋力。
  • AlphaGo的训练本质上是一个纯监督学习过程,而非传统的策略梯度强化学习。每个动作都能获得一个由MCTS生成的改进标签,这种低方差的学习信号避免了稀疏奖励带来的信用分配难题。
  • 相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。
  • 从零训练AlphaGo的关键是先获得可靠的价值函数。初期可使用专家棋谱或小型棋盘随机对弈预训练,待终局价值判断准确后再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。
  • 非线性动力学系统(如围棋、天气)虽对初始条件高度敏感,但其宏观结构(胜率、飓风路径)仍可预测。十层神经网络能高保真地逼近难以处理的搜索问题,暗示了复杂系统模拟可被极大压缩的可能性。
  • 自动编码工具目前最擅长的是超参数优化与实验执行,能以近乎研究生的灵活性搜索开放性问题并持续提升性能指标,但在判断研究路线是否值得深入方面仍显不足。

金句

  • "Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic simulation." —— “显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。”
  • "The major reason is that you never have to initialize at a 0% success rate and solve the exploration problem of how to get a non-zero success rate." —— “(AlphaGo优雅的)主要原因在于,你永远不必从0%的胜率起步,去解决如何获得非零胜率的探索难题。”
  • "It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point." —— “这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。”

本内容由 AI 根据访谈字幕提炼,观点归嘉宾所有。

完整内容见原文:Dwarkesh Podcast · 阿尔法狗的奥秘:十层网络征服围棋