埃里克·张

埃里克·张

Eric Jang
Dwarkesh Podcast 嘉宾
海外PB 优先级✓ 已收录 2 期访谈

立场时间线 16 条 · 16 个议题

同一议题按时间排列,说法变化一目了然。

搜索压缩
2026-08

AlphaGo的核心理念是用神经网络把超大规模搜索问题压缩为可处理的规模,而非直接穷举博弈树。

“AlphaGo的核心理念是利用神经网络将大规模搜索问题压缩为可处理的规模。围棋博弈树规模远超宇宙原子数量,但通过深度神经网络对局面进行快速价值评估和落子概率预测,可大幅削减搜索的深度与广度。”

来源访谈 →
相关观点 (3)迈克尔·尼尔森 · AI与科学:AlphaFold的成功主要归功于数十年实验积累的蛋白质数据库,AI只是整个故事的一小部分,它也不具有广义相对论那样的解释力。德米斯·哈萨比斯 · 混合搜索:以AlphaEvolve为例主张将大语言模型等基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。昊天 · AI4S核心价值:认为通用科学AI的核心是将科学家从繁琐的工程化问题中解放出来,而非取代科学家。
MCTS本质
2026-08

MCTS并非直接优化胜率,而是为每个已执行动作生成更优的替代标签,输出比初始策略网络更尖锐的落子概率分布。

“蒙特卡洛树搜索(MCTS)并非试图直接优化胜率,而是为每个已执行的动作提供更优的替代标签。算法通过选择、扩展、评估和回溯四步迭代,最终输出比初始策略网络更尖锐的落子概率分布。”

来源访谈 →
训练范式
2026-08

AlphaGo的训练本质上是纯监督学习过程,而不是传统的策略梯度强化学习。

“AlphaGo的训练本质上是一个纯监督学习过程,而非传统的策略梯度强化学习。每个动作都能获得一个由MCTS生成的改进标签,这种低方差的学习信号避免了稀疏奖励带来的信用分配难题。”

来源访谈 →
相关观点 (1)杨立昆 · 自监督学习:当前强化学习和纯监督学习效率低下,源于缺乏对世界运作的直觉模型;自监督学习通过预测视频帧、填补文本缺失让模型掌握世界内在规律与不确定性,是通往更智能系统的必由之路。
样本效率
2026-08

相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。

“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”

来源访谈 →
测试时计算
2026-08

把搜索成果蒸馏回策略网络,可将1000步搜索摊销进前向传播,实现测试时计算与训练时计算的相互替代。

“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。(It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.)”

来源访谈 →
相关观点 (2)德瓦克什·帕特尔 · 在线自蒸馏:在线策略自蒸馏(OPSD)让基础模型模仿积累了上下文经验的教师模型,可将会话所学蒸馏回权重,不需要外部可验证奖励且监督信号比朴素RL更密集。Dwarkesh Patel · 自蒸馏方案:提出在线策略自蒸馏(OPSD)作为无需外部验证奖励的持续学习方法:让基础模型模仿长会话中积累丰富上下文的“资深”模型,比SFT更优。
从零训练
2026-08

从零训练AlphaGo的关键是先获得可靠的价值函数,再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。

“从零训练AlphaGo的关键是先获得可靠的价值函数。初期可使用专家棋谱或小型棋盘随机对弈预训练,待终局价值判断准确后再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。”

来源访谈 →
相关观点 (1)Dwarkesh Patel · 盈利模式:Michael Li认为AI实验室靠API提供基础模型服务可能永远无法收回训练成本,应像香港地铁靠车站周边地产盈利那样,捕获发生在模型“周围”的价值增值
复杂系统
2026-08

非线性动力学系统虽对初始条件高度敏感,但其宏观结构(如胜率、飓风路径)仍可预测,感觉极难的问题可能被简单的宏观模拟攻克。

“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。(Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic”

来源访谈 →
相关观点 (2)Anima Anandkumar · 物理先验:融入物理结构能提升模型稳定性:直接在网格上做全球天气预测会很快失效,而基于球面谐波自然基函数的Fourier Neural Operator可保持长期稳定。朴俊成 · 社会模拟:模拟整个社会仅靠提示工程不够,必须通过后训练让模型学习人类社会的'社会物理学',未来可能需要数据中心规模的算力,其解决气候变化等问题的价值使之成为必然方向。
探索难题
2026-08

AlphaGo之所以优雅,在于永远不必从0%成功率起步去解决如何获得非零成功率的探索问题。

“(AlphaGo优雅的)主要原因在于,你永远不必从0%的胜率起步,去解决如何获得非零胜率的探索难题。(The major reason is that you never have to initialize at a 0% success rate and solve the exploration problem of how to get a non-zero success rate.)”

来源访谈 →
智能基本原理
2026-05

AlphaGo是搜索、从经验中学习与自我对弈这三大智能核心要素最清晰的范例,理解它有助于洞察未来更通用AI系统的学习路径

“AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。”

来源访谈 →
相关观点 (1)德瓦克什·帕特尔 · 智能多样性:持续学习将打破当前AI智能体因相似数据集而同质化的局面,不同AI会因独特交互经验发展出真正多样化的智能与性格
搜索可行性
2026-05

围棋决策树过于庞大无法穷举,价值网络与策略网络通过压缩搜索的宽度和深度使问题变得可解

“围棋的决策树过于庞大,无法穷举搜索。AlphaGo通过价值网络(快速评估棋局胜率)和策略网络(推荐可能的好棋)极大地压缩了搜索的宽度和深度,使问题变得可解。”

来源访谈 →
相关观点 (1)陶哲轩 · 广度能力:人类擅长深度钻研、AI擅长大规模试错与遍历,应让大量中等能力AI清扫数学图谱中的容易问题、人类专家集中攻克难度孤岛,为此必须重新设计科学研究方式
信用分配
2026-05

MCTS在每个决策点都能建议严格更优的动作,为训练提供清晰监督信号,绕过了LLM策略梯度RL面临的信用分配难题

“与LLM使用的策略梯度RL不同,AlphaGo的MCTS在每个决策点都能建议一个严格更优的动作,这为训练提供了一个清晰的监督信号,有效绕过了信用分配难题。”

来源访谈 →
自我对弈
2026-05

自我对弈生成数据并把MCTS的更强策略蒸馏回策略网络,相当于把搜索的计算量预先烘焙进网络的直觉

“系统通过自我对弈生成数据,并将MCTS搜索得到的更强策略“蒸馏”回策略网络。这相当于将搜索的计算量预先“烘焙”进网络,使网络本身的“直觉”越来越强。”

来源访谈 →
相关观点 (1)德瓦克什·帕特尔 · 在线自蒸馏:在线策略自蒸馏(OPSD)让基础模型模仿积累了上下文经验的教师模型,可将会话所学蒸馏回权重,不需要外部可验证奖励且监督信号比朴素RL更密集。
架构选择
2026-05

数据与计算预算决定架构取舍:有限条件下ResNet的局部归纳偏置优于Transformer,需要全局上下文理解时Transformer潜力更大

“在数据和计算有限的实验中,ResNet的局部归纳偏置使其表现优于Transformer。但随着对全局上下文理解需求的增加(如大规模棋盘、不完全信息游戏),Transformer的潜力更大。”

来源访谈 →
相关观点 (3)王绍迪 · topic: 与AI大模型的协同:stance: Transformer模型的1:1读写比和低精度要求极大利好存算一体技术谢炎 · 架构选择:采用数据流架构是基于AI计算本质的第一性原理选择,比指令驱动的冯诺依曼架构更高效。德瓦克什·帕特尔 · 开源追赶:开放模型仅落后前沿四个月,是因为数据是进步的主要驱动力且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。
研究自动化
2026-05

LLM已能较好地自动化实验实现、运行和超参数优化等执行环节,但选择研究问题、突破研究僵局等创造性决策目前仍显不足

“LLM可以较好地自动化实验实现、运行和超参数优化等环节,但在选择研究问题、突破研究僵局等需要判断力的创造性工作上,目前仍显不足。”

来源访谈 →
相关观点 (3)陶哲轩 · 验证瓶颈:验证环节无法大规模自动化是当前最大障碍,每天生成上千个新理论的速度远超现有同行评议体系所能支撑的验证速度Dwarkesh Patel · 研究自动化:AI实验室应对样本效率问题的路径是先实现AI研究自动化,再让自动化AI去解决效率问题本身,但可行性仍是未知数。安德烈·卡帕奇 · LLM本质:LLM是新的操作系统和可编程的个人计算机。

金句墙 7 条

“Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic simulation.”

“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。”

阿尔法狗的奥秘:十层网络征服围棋 · 2026/8/5

“The major reason is that you never have to initialize at a 0% success rate and solve the exploration problem of how to get a non-zero success rate.”

“(AlphaGo优雅的)主要原因在于,你永远不必从0%的胜率起步,去解决如何获得非零胜率的探索难题。”

阿尔法狗的奥秘:十层网络征服围棋 · 2026/8/5

“It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.”

“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。”

阿尔法狗的奥秘:十层网络征服围棋 · 2026/8/5

“AlphaGo is still the cleanest worked example of the primitives of intelligence: search, learning from experience, and self-play.”

AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。

AlphaGo核心原理与现代AI研究的启示 · 2026/5/15

“Thanks to LLM coding, what took a whole team of research scientists at DeepMind and millions of dollars of research and compute can now be done for a few thousand dollars of rented compute.”

得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。

AlphaGo核心原理与现代AI研究的启示 · 2026/5/15

“The way humans learn is surely closer to the second.”

人类的学习方式无疑更接近后者。

AlphaGo核心原理与现代AI研究的启示 · 2026/5/15

“In deep learning, initialization is everything. You always want to initialize your research project to something as close to success as possible.”

在深度学习中,初始化就是一切。你总希望将研究项目初始化到尽可能接近成功的地方。

AlphaGo核心原理与现代AI研究的启示 · 2026/5/15

访谈收录

阿尔法狗的奥秘:十层网络征服围棋