埃里克·张
立场时间线 16 条 · 16 个议题
同一议题按时间排列,说法变化一目了然。
AlphaGo的核心理念是用神经网络把超大规模搜索问题压缩为可处理的规模,而非直接穷举博弈树。
“AlphaGo的核心理念是利用神经网络将大规模搜索问题压缩为可处理的规模。围棋博弈树规模远超宇宙原子数量,但通过深度神经网络对局面进行快速价值评估和落子概率预测,可大幅削减搜索的深度与广度。”
来源访谈 →MCTS并非直接优化胜率,而是为每个已执行动作生成更优的替代标签,输出比初始策略网络更尖锐的落子概率分布。
“蒙特卡洛树搜索(MCTS)并非试图直接优化胜率,而是为每个已执行的动作提供更优的替代标签。算法通过选择、扩展、评估和回溯四步迭代,最终输出比初始策略网络更尖锐的落子概率分布。”
来源访谈 →AlphaGo的训练本质上是纯监督学习过程,而不是传统的策略梯度强化学习。
“AlphaGo的训练本质上是一个纯监督学习过程,而非传统的策略梯度强化学习。每个动作都能获得一个由MCTS生成的改进标签,这种低方差的学习信号避免了稀疏奖励带来的信用分配难题。”
来源访谈 →相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。
“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”
来源访谈 →把搜索成果蒸馏回策略网络,可将1000步搜索摊销进前向传播,实现测试时计算与训练时计算的相互替代。
“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。(It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.)”
来源访谈 →从零训练AlphaGo的关键是先获得可靠的价值函数,再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。
“从零训练AlphaGo的关键是先获得可靠的价值函数。初期可使用专家棋谱或小型棋盘随机对弈预训练,待终局价值判断准确后再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。”
来源访谈 →非线性动力学系统虽对初始条件高度敏感,但其宏观结构(如胜率、飓风路径)仍可预测,感觉极难的问题可能被简单的宏观模拟攻克。
“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。(Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic”
来源访谈 →AlphaGo之所以优雅,在于永远不必从0%成功率起步去解决如何获得非零成功率的探索问题。
“(AlphaGo优雅的)主要原因在于,你永远不必从0%的胜率起步,去解决如何获得非零胜率的探索难题。(The major reason is that you never have to initialize at a 0% success rate and solve the exploration problem of how to get a non-zero success rate.)”
来源访谈 →AlphaGo是搜索、从经验中学习与自我对弈这三大智能核心要素最清晰的范例,理解它有助于洞察未来更通用AI系统的学习路径
“AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。”
来源访谈 →围棋决策树过于庞大无法穷举,价值网络与策略网络通过压缩搜索的宽度和深度使问题变得可解
“围棋的决策树过于庞大,无法穷举搜索。AlphaGo通过价值网络(快速评估棋局胜率)和策略网络(推荐可能的好棋)极大地压缩了搜索的宽度和深度,使问题变得可解。”
来源访谈 →MCTS在每个决策点都能建议严格更优的动作,为训练提供清晰监督信号,绕过了LLM策略梯度RL面临的信用分配难题
“与LLM使用的策略梯度RL不同,AlphaGo的MCTS在每个决策点都能建议一个严格更优的动作,这为训练提供了一个清晰的监督信号,有效绕过了信用分配难题。”
来源访谈 →自我对弈生成数据并把MCTS的更强策略蒸馏回策略网络,相当于把搜索的计算量预先烘焙进网络的直觉
“系统通过自我对弈生成数据,并将MCTS搜索得到的更强策略“蒸馏”回策略网络。这相当于将搜索的计算量预先“烘焙”进网络,使网络本身的“直觉”越来越强。”
来源访谈 →数据与计算预算决定架构取舍:有限条件下ResNet的局部归纳偏置优于Transformer,需要全局上下文理解时Transformer潜力更大
“在数据和计算有限的实验中,ResNet的局部归纳偏置使其表现优于Transformer。但随着对全局上下文理解需求的增加(如大规模棋盘、不完全信息游戏),Transformer的潜力更大。”
来源访谈 →LLM已能较好地自动化实验实现、运行和超参数优化等执行环节,但选择研究问题、突破研究僵局等创造性决策目前仍显不足
“LLM可以较好地自动化实验实现、运行和超参数优化等环节,但在选择研究问题、突破研究僵局等需要判断力的创造性工作上,目前仍显不足。”
来源访谈 →借助LLM编程,过去需要DeepMind整支团队和数百万美元的研究工作,如今几千美元租用算力即可完成
“得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。”
来源访谈 →金句墙 7 条
“Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic simulation.”
“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。”
阿尔法狗的奥秘:十层网络征服围棋 · 2026/8/5“The major reason is that you never have to initialize at a 0% success rate and solve the exploration problem of how to get a non-zero success rate.”
“(AlphaGo优雅的)主要原因在于,你永远不必从0%的胜率起步,去解决如何获得非零胜率的探索难题。”
阿尔法狗的奥秘:十层网络征服围棋 · 2026/8/5“It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.”
“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。”
阿尔法狗的奥秘:十层网络征服围棋 · 2026/8/5“AlphaGo is still the cleanest worked example of the primitives of intelligence: search, learning from experience, and self-play.”
AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。
AlphaGo核心原理与现代AI研究的启示 · 2026/5/15“Thanks to LLM coding, what took a whole team of research scientists at DeepMind and millions of dollars of research and compute can now be done for a few thousand dollars of rented compute.”
得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。
AlphaGo核心原理与现代AI研究的启示 · 2026/5/15“The way humans learn is surely closer to the second.”
人类的学习方式无疑更接近后者。
AlphaGo核心原理与现代AI研究的启示 · 2026/5/15“In deep learning, initialization is everything. You always want to initialize your research project to something as close to success as possible.”
在深度学习中,初始化就是一切。你总希望将研究项目初始化到尽可能接近成功的地方。
AlphaGo核心原理与现代AI研究的启示 · 2026/5/15