AlphaGo核心原理与现代AI研究的启示

Eric Jang在播客中拆解了从零构建AlphaGo的全过程,从围棋基础规则到蒙特卡洛树搜索(MCTS)的工作原理,再到策略网络与价值网络如何协同加速搜索。他对比了AlphaGo的MCTS方法与现代大语言模型强化学习的信用分配问题,并探讨了AI研究自动化的现状与边界。

导语

前1X Technologies AI副总裁Eric Jang在Dwarkesh Podcast中,结合亲手重建AlphaGo的经历,深入剖析了这一划时代AI系统的核心工作原理。他从围棋的基本规则讲起,逐步拆解蒙特卡洛树搜索(MCTS)如何通过神经网络变得可解,并阐释了策略网络与价值网络在其中的作用。访谈不仅回顾了AlphaGo的技术突破,更将其与当前大语言模型(LLM)的强化学习(RL)挑战进行对比,探讨了信用分配问题的差异。此外,Eric还分享了在项目中尝试AI研究自动化的初步观察,为理解未来AI研发模式提供了独特视角。

大纲与深读 7 章

展开「深读」看每一段讨论的问题与论据。

01

AlphaGo项目背景与围棋基础

  • Eric Jang选择在休假期间重建并改进AlphaGo,因其是理解智能原语的典范
  • 围棋规则简洁但计算复杂,计算机长期认为本世纪内无法解决
  • 介绍了围棋的基本规则、不同规则集(如Tromp-Taylor)以及人类与计算机在计分上的差异
深读这一段

讨论的问题:为什么AlphaGo是一个值得深入研究的项目,它揭示了智能系统的哪些核心要素?

论据 / 案例:AlphaGo通过深度学习解决了长期被认为对搜索来说难以处理的问题;开源项目KataGo(David Wu)在2020年实现了训练强大围棋AI所需计算量的40倍减少。

02

蒙特卡洛树搜索原理

08:17
  • 解释了围棋巨大的状态空间(361^300)和搜索树的复杂性
  • 介绍了MCTS的核心数据结构:节点(状态)存储访问计数、动作价值和概率
  • 详细讲解了PUCT选择准则,平衡利用(Q值)与探索(访问计数)
深读这一段

讨论的问题:蒙特卡洛树搜索如何使在巨大动作空间中寻找最佳着法成为可能?

论据 / 案例:AlphaGo使用PUCT(Predicted Upper Confidence with Trees)动作选择准则,其形式为:argmax_a [Q(s, a) + C_PUCT * P(a) * sqrt(N / (1 + N_a))]。

03

神经网络在AlphaGo中的作用

32:04
  • 介绍了价值网络(预测胜率)和策略网络(推荐动作分布)的双头架构
  • 对比了ResNet与Transformer架构在围棋任务上的表现,ResNet在数据有限时更具优势
  • 解释了如何用人类专家棋谱数据初始化网络,作为研究项目的良好起点
深读这一段

讨论的问题:神经网络如何加速MCTS搜索,使其变得可处理?

论据 / 案例:一个用数百万参数训练的、十层深的ResNet,仅凭其原始策略推荐(取argmax)就能击败大多数人类玩家。

04

MCTS的模拟迭代过程

56:24
  • 详细拆解了每次模拟的四个步骤:选择、扩展、评估、备份
  • 解释了价值网络如何作为终端评估的快捷方式,避免将游戏进行到底
  • 说明了搜索策略如何随模拟次数增加而变得更集中(峰值化)
深读这一段

讨论的问题:在单个回合中,MCTS如何通过迭代模拟来构建和优化决策树?

论据 / 案例:在AlphaGo对阵李世石的比赛中,每个着法使用了数万次模拟以最大化模型强度;而训练中通常使用数百到2048次模拟。

05

自博弈与强化学习循环

60:33
  • 核心思想是将MCTS搜索产生的更优策略(π)蒸馏回策略网络,使其无需搜索也能做出更好决策
  • 类比了机器人学习中的DAgger算法:即使在失败轨迹中,也能为每一步标注一个更优的修正动作
  • 解释了AlphaZero训练损失的两个组成部分:策略模仿MCTS,价值预测实际胜负
深读这一段

讨论的问题:AlphaGo如何通过自我博弈实现持续的自我改进?

论据 / 案例:MCTS保证在价值函数正确的前提下,为当前状态提供一个比初始策略网络更优的改进策略,从而形成训练信号。

06

RL在LLM中的挑战与MCTS的启示

80:17
  • 对比了LLM中朴素的策略梯度RL与AlphaGo的MCTS,后者在每一步都提供了更优的动作目标
  • 讨论了信用分配问题:RL需要从轨迹中识别出导致最终正确答案的关键令牌,而MCTS每一步都提供了改进目标
  • 指出人类学习方式更接近MCTS提供的逐步改进,而非一次性的结果反馈
深读这一段

讨论的问题:为什么MCTS的信用分配机制比LLM中标准的强化学习更高效?

论据 / 案例:在LLM的轨迹中,可能有超过10万个令牌,朴素的策略梯度RL必须从中找出哪些令牌导致了正确答案;而MCTS每一步都建议一个严格更优的动作,直接绕过了信用分配问题。

07

自动化AI研究的能力边界

95:32
  • LLM可以较好地自动化实验实现、运行和超参数优化等环节
  • LLM仍然难以自主选择正确的研究问题或逃离研究死胡同
  • 讨论了这对“智能爆炸”预期的影响,以及内部视角下的可能形态
深读这一段

讨论的问题:当前LLM作为自动化研究助手的能力边界在哪里?

论据 / 案例:Eric Jang在其项目上启动了一个自动化研究循环(Autoresearch loop),并讨论了LLM在哪些研究部分表现出色或挣扎。

金句

  • "AlphaGo is still the cleanest worked example of the primitives of intelligence: search, learning from experience, and self-play." —— AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。
  • "Thanks to LLM coding, what took a whole team of research scientists at DeepMind and millions of dollars of research and compute can now be done for a few thousand dollars of rented compute." —— 得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。
  • "The way humans learn is surely closer to the second." —— 人类的学习方式无疑更接近后者。
  • "In deep learning, initialization is everything. You always want to initialize your research project to something as close to success as possible." —— 在深度学习中,初始化就是一切。你总希望将研究项目初始化到尽可能接近成功的地方。

原文链接

查看完整访谈

=== SUGGEST

  • topic | stance | quote | date
  • 智能基本原理 | AlphaGo是研究搜索、经验学习与自我对弈的最佳范例 | "AlphaGo is still the cleanest worked example of the primitives of intelligence: search, learning from experience, and self-play." | 2026-08-29
  • LLM强化学习瓶颈 | 策略梯度RL在信用分配上效率低下,MCTS提供了严格更优的监督信号 | "naive policy gradient RL has to figure out which of the 100k+ tokens in your trajectory actually got you the right answer, while AlphaGo’s MCTS suggests a strictly better action every single move" | 2026-08-29
  • AI研究自动化 | LLM擅长自动化实验执行与优化,但不擅长选择研究问题和突破僵局 | "which parts of AI research LLMs can already automate pretty well... and which they still struggle with" | 2026-08-29
  • 神经网络架构选择 | 在小数据、低预算下,ResNet凭借局部归纳偏置优于Transformer | "For small data regimes, my experience is that ResNets still outperform transformers and give you more bang for the buck at lower budgets." | 2026-08-29
完整内容见原文:Dwarkesh Podcast · AlphaGo核心原理与现代AI研究的启示