强化学习:稀疏奖励之解?
MCTS逐动作的更优监督能否绕开奖励稀疏与探索困境,成为驱动模型性能飞跃的通用引擎?
立场盘点 127 位
AlphaGo之所以优雅,在于永远不必从0%成功率起步去解决如何获得非零成功率的探索问题。
“(AlphaGo优雅的)主要原因在于,你永远不必从0%的胜率起步,去解决如何获得非零胜率的探索难题。(The major reason is that you never have to initialize at a 0% success rate and solve the exploration problem of how to get a non-zero success rate.)”
来源访谈 →MCTS在每个决策点都能建议严格更优的动作,为训练提供清晰监督信号,绕过了LLM策略梯度RL面临的信用分配难题
“与LLM使用的策略梯度RL不同,AlphaGo的MCTS在每个决策点都能建议一个严格更优的动作,这为训练提供了一个清晰的监督信号,有效绕过了信用分配难题。”
来源访谈 →GLM-5.3相比前代架构并无根本改变,性能飞跃完全来自长周期高复杂度环境中的强化学习
“在基础模型架构上并无根本改变,其显著性能提升完全源于在长周期、高复杂度环境中的强化学习(RL)”
来源访谈 →他认为《星际争霸》的核心挑战在于探索:随机尝试很难获得胜利奖励,因此先用人类录像做模仿学习解决冷启动问题。
“在《星际争霸》中,随机尝试行动很难获得正向奖励(胜利)。AlphaStar通过利用人类录像数据进行模仿学习来解决早期探索难题,避免了智能体在随机尝试中一无所获。”
来源访谈 →当前循环神经网络在数百个时间步后性能显著下降,而人脑能对跨越任意长时间的事件做信用分配,这得益于大脑高效且有针对性的遗忘机制以及意识与情感对信息存取的作用。
“当前的循环神经网络在处理数百个时间步后性能会显著下降,而人类能够对跨越任意长时间的事件进行信用分配。”
来源访谈 →强化学习的本质是合成数据生成:用大量计算配合验证器筛选出好数据,再让模型像预测下一个词那样学习这些正确轨迹。
“强化学习本质是合成数据生成:通过大量计算配合验证器,筛选出"好数据",再像预测下一个词那样训练模型学习这些正确轨迹。”
来源访谈 →Adam Gleave扭转了早年"进攻方占优"的判断,认为在LLM代理提供多轮有害协助的场景中,只要采用正确的技术,防御方已占优势。
“我职业生涯大部分时间都在论证进攻方占优……但我不得不说,至少在LLM代理提供多轮有害协助的场景中,风正在转向——只要采用正确的技术,防御方是占优的。(I spent a lot of my career actually arguing for this being offense dominant... But I have to say the way when the winds are blowing, at least when it comes to LLM agents providing detailed multi-turn assistance to harmful req”
来源访谈 →新GPU可在发射前于地面充分老化测试,通过初期调试周期后可靠性足以支撑太空长期运行
“新GPU存在早期失效率,但可在发射前于地面充分老化测试;一旦通过初期调试周期,其可靠性足以支撑太空长期运行。”
来源访谈 →AlphaGo的核心理念是用神经网络把超大规模搜索问题压缩为可处理的规模,而非直接穷举博弈树。
“AlphaGo的核心理念是利用神经网络将大规模搜索问题压缩为可处理的规模。围棋博弈树规模远超宇宙原子数量,但通过深度神经网络对局面进行快速价值评估和落子概率预测,可大幅削减搜索的深度与广度。”
来源访谈 →MCTS并非直接优化胜率,而是为每个已执行动作生成更优的替代标签,输出比初始策略网络更尖锐的落子概率分布。
“蒙特卡洛树搜索(MCTS)并非试图直接优化胜率,而是为每个已执行的动作提供更优的替代标签。算法通过选择、扩展、评估和回溯四步迭代,最终输出比初始策略网络更尖锐的落子概率分布。”
来源访谈 →AlphaGo的训练本质上是纯监督学习过程,而不是传统的策略梯度强化学习。
“AlphaGo的训练本质上是一个纯监督学习过程,而非传统的策略梯度强化学习。每个动作都能获得一个由MCTS生成的改进标签,这种低方差的学习信号避免了稀疏奖励带来的信用分配难题。”
来源访谈 →相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。
“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”
来源访谈 →把搜索成果蒸馏回策略网络,可将1000步搜索摊销进前向传播,实现测试时计算与训练时计算的相互替代。
“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。(It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.)”
来源访谈 →从零训练AlphaGo的关键是先获得可靠的价值函数,再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。
“从零训练AlphaGo的关键是先获得可靠的价值函数。初期可使用专家棋谱或小型棋盘随机对弈预训练,待终局价值判断准确后再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。”
来源访谈 →非线性动力学系统虽对初始条件高度敏感,但其宏观结构(如胜率、飓风路径)仍可预测,感觉极难的问题可能被简单的宏观模拟攻克。
“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。(Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic”
来源访谈 →在国际象棋这类封闭系统中机器无需破解游戏,只需靠更少、更稳定的失误就能胜出
“Machines will prevail simply because they will bring down the number of mistakes.(机器终将获胜,仅仅因为它们能将犯错的概率降至最低。)”
来源访谈 →FSDP是当前预训练默认首选策略,只有GPU数量太多时才被迫转向其他方案
“This is the go to default. And you only move on from this when having too many GPUs forces you to move on. —— 这是默认的首选方案。只有当你因为GPU数量太多而被迫做出改变时,才会转向其他方案。”
来源访谈 →FSDP看似每层全收集通信昂贵,但优化后总通信量仅为参数量的3倍左右,只比基础数据并行多50%
“优化后的FSDP(使用减少-分散)将总通信量控制在模型参数的3倍左右,仅比基础数据并行多50%。”
来源访谈 →GLM-5.3的能力飞跃并非来自更大规模的基础模型预训练,而是完全依靠扩展后训练
“Scaling post-training is all we did for GLM-5.3.(扩展后训练是我们为GLM-5.3所做的全部工作。)”
来源访谈 →自我对弈生成数据并把MCTS的更强策略蒸馏回策略网络,相当于把搜索的计算量预先烘焙进网络的直觉
“系统通过自我对弈生成数据,并将MCTS搜索得到的更强策略“蒸馏”回策略网络。这相当于将搜索的计算量预先“烘焙”进网络,使网络本身的“直觉”越来越强。”
来源访谈 →训练环境可完全合成、大规模自动化生成,扩展后训练的难度重心已从模型转移到环境本身
“As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment.(随着智能体能力的提升,扩展后训练的大部分难度从模型转移到了环境本身。)”
来源访谈 →Vinyals认为《星际争霸》因实时性、战争迷雾和长期规划需求比围棋等棋类更具挑战性,是探索通用人工智能的绝佳试验场。
“游戏的实时性、庞大行动空间、部分可观察性(战争迷雾)以及需要长期规划的特点,使其比围棋等棋类游戏更具挑战性。这为探索通用人工智能提供了绝佳的试验场。”
来源访谈 →Prasad认为Alexa的技术根基始于攻克曾被认为不可能的远场语音识别难题,通过大规模数据和深度学习训练奠定了产品基础。
“Alexa的成功始于解决远距离语音识别这一曾被认为不可能的难题。团队在2013年创立初期,通过大规模数据收集和分布式GPU上的深度学习训练,在六个月内将错误率降低了五倍,奠定了产品基础。”
来源访谈 →Lattner 将 Mojo 定位为 Python 的超集而非替代品,让开发者保留 Python 易用性的同时获得 C++ 级性能。
“Mojo 是 Python 的超集,它提供了 Python 的所有易用性,同时拥有 C++ 的性能。(Mojo is a super set of Python giving you all the usability of Python, but with the performance of C++.)”
来源访谈 →预训练数据过滤是成本最低且被低估的安全干预手段,能在不显著影响模型能力的情况下过滤危险数据,FAR AI计划投入约200万美元验证。
“这是成本最低且被低估的干预手段,在预训练阶段直接过滤危险数据,不会对模型能力造成显著影响。FAR AI正计划投入约200万美元进行大规模验证实验。”
来源访谈 →DeepSeek V3与R1同源不同路:V3是基础模型经标准指令微调的聊天模型,R1则是经全新推理训练、回答前展示思维链的推理模型。
“DeepSeek V3的基础预训练完成后,他们做了两种不同的后训练:一种是创建标准的指令微调模型V3,另一种是通过新的推理训练创建R1。”
来源访谈 →DeepSeek高效训练的两大技术支柱是混合专家模型(只激活参数子集,如671B参数中仅激活37B)和自创的多头潜在注意力机制。
“混合专家模型(MoE)通过每次只激活参数的一个子集,大幅降低了训练和推理成本。”
来源访谈 →蛋白质进化的核心规律是模块化,域的重组使蛋白质获得新功能而不破坏原有结构。
“Modularity. That's the single keyword about protein evolution. —— 关于蛋白质进化,如果要选一个关键词,那就是模块化。”
来源访谈 →AlphaFold将蛋白质结构预测从博士生耗时数年缩短到数秒,并已预测人类全部2万种蛋白质,是DeepMind迄今最复杂最有意义的系统
“AlphaFold是我们迄今为止构建的最复杂、也可能最有意义的系统。”
来源访谈 →Hotz 断言 MuZero 就是解决自动驾驶问题的方案,并将成为整个深度学习时代的典范论文。
“我认为 MuZero 将会被视为整个深度学习时代的典范论文。而 MuZero 就是解决自动驾驶问题的方案。(英文原文:"I think MuZero is going to be looked back as the canonical paper of this whole deep learning era. And MuZero is the solution to self driving cars.")”
来源访谈 →FSDP规模化受通信交叉点和批大小双重限制,超过交叉点后训练效率急剧下降
“随着GPU增多,计算时间缩短而通信时间不变,会达到一个计算与通信时间相等的“交叉点”,超过此点后训练效率将急剧下降。”
来源访谈 →流水线并行可解决FSDP规模化瓶颈,但批次首尾GPU空闲形成气泡,多批次重叠又会影响梯度同步与模型更新的正确性
“虽然可以尝试重叠多个批次来减少气泡,但在训练中这会影响梯度同步与模型更新的正确性。”
来源访谈 →AlphaGo是搜索、从经验中学习与自我对弈这三大智能核心要素最清晰的范例,理解它有助于洞察未来更通用AI系统的学习路径
“AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。”
来源访谈 →围棋决策树过于庞大无法穷举,价值网络与策略网络通过压缩搜索的宽度和深度使问题变得可解
“围棋的决策树过于庞大,无法穷举搜索。AlphaGo通过价值网络(快速评估棋局胜率)和策略网络(推荐可能的好棋)极大地压缩了搜索的宽度和深度,使问题变得可解。”
来源访谈 →部署即训练会形成强者愈强的飞轮效应,实验室将被迫更早推出最聪明的模型以抢占学习先机
“当部署即训练,拥有最佳模型的实验室会获得更多用户、更复杂的任务和更高质量的反馈,从而加速模型进化。”
来源访谈 →框架能力正通过训练被吸收进模型权重,形成“训练-吸收-精简”循环,删除与吸收过程结束后剩下的是权限、身份、信任等以人类为中心的能力
““模型权重接下来会吸收什么?……在这个删除和吸收过程结束后,剩下的是以人类为中心的智能体能力。比如权限、身份、信任和可解释性。”"What do the model weights absorb next? ... What's left at the end of this deletion and absorption process are the human-centric agent capabilities. Things like permissions, identity, trust and legability."”
来源访谈 →解码提取的推理过程是真实的隐藏思维,而非伪造内容:其推理令牌计数与计费的API思考令牌在大多数查询上1:1匹配。
“我们验证了对于大多数查询的提示,我们的推理令牌计数与计费的API思考令牌1:1匹配。”
来源访谈 →Vinyals认为AlphaStar的核心是把观察与行动的序列建模为预测下一步的问题,与机器翻译在本质上完全相同。
“问题完全相同。你本质上是在将一个由观察和行动组成的前缀,翻译成接下来将发生什么——这与训练模型进行翻译或生成语言完全一致。(The problem is exactly the same. You're translating essentially a prefix of observations and actions onto what's going to happen next, which is exactly how you would train a model to translate or to generate language.)”
来源访谈 →上下文学习若足够强大,可把新员工约6个月才能掌握的经验压缩进上下文窗口,从而无需将部署所学蒸馏回权重。
“如果上下文学习能力足够强大,就能将新员工入职6个月才能掌握的经验压缩进上下文窗口,而无需将部署中学到的知识蒸馏回权重。”
来源访谈 →在线策略自蒸馏(OPSD)让基础模型模仿积累了上下文经验的教师模型,可将会话所学蒸馏回权重,不需要外部可验证奖励且监督信号比朴素RL更密集。
“在线策略自蒸馏(OPSD)通过让基础模型模仿积累了上下文经验的“教师模型”的预测,将会话所学蒸馏回权重。它不需要外部可验证奖励,且比朴素RL提供更密集的监督信号。”
来源访谈 →微型无人机的敏捷不是追求速度纪录,而是遇到意外时能安全机动并获取信息的能力,对搜救、农业等受限空间任务至关重要
““敏捷”并非追求速度纪录,而是在遇到意外时能安全机动并获取信息的能力。”
来源访谈 →RCN在前馈结构基础上增加反馈与侧向连接,核心优势是能进行动态推理,而非像传统神经网络那样依赖训练时的摊销推理
“其核心优势在于能够进行动态推理,而非像传统神经网络那样依赖训练时的“摊销推理””
来源访谈 →硬件切分方式与模型架构天然匹配,并行策略应由物理拓扑直接塑造:专家并行利用机架内互连,流水线并行将不同层分布到不同机架。
“(硬件)切分方式与模型架构相匹配。(英文原话:The cutting matches the model architecture.)”
来源访谈 →一个领域仅可验证不足以让RLVR快速进展,还必须“可重复刷”——能大规模并行、确定性复现地创建训练环境。
“It is not enough for a domain to be verifiable. It also has to be very grindable. —— 一个领域光是可验证还不够,它还必须非常“可重复刷”。”
来源访谈 →提出在线策略自蒸馏(OPSD)作为无需外部验证奖励的持续学习方法:让基础模型模仿长会话中积累丰富上下文的“资深”模型,比SFT更优。
“让基础模型去模仿那个在长会话中积累了丰富上下文的“资深”模型所做出的预测。这比监督微调(SFT)更优,因为它只提取达到正确结果所必需的知识,避免了死记硬背整个会话记录。”
来源访谈 →前沿模型安全水平差距显著:GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞,且发现成本不到300美元。
“GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞。发现这些漏洞的API成本不到300美元,多数攻击者都负担得起。”
来源访谈 →多数越狱技巧本质上是社交工程(如诉诸权威、指示模型不要拒绝),字符混淆等冷门技术增益有限,这印证了"拟人化"AI模型的实用性。
“多数越狱技巧本质上是社交工程,如诉诸权威、指示模型不要拒绝等。相对冷门的字符混淆等技术增益有限。这印证了"拟人化"AI模型的实用性。”
来源访谈 →推理时缩放让模型在给出第一个词之前能思考数秒、数分钟甚至数小时,是能力上的巨大飞跃
“推理时缩放让模型在给出第一个词之前,能思考数秒、数分钟甚至数小时,这是能力上的巨大飞跃。”
来源访谈 →提出自然可建模性假说:经演化或物理过程筛选塑造的自然系统蕴含结构,原则上可被神经网络等经典学习算法高效发现和建模,这是AlphaFold等项目的理论基础。
“任何能被演化出来的模式,大概率都能被经典学习算法高效地发现和建模。”
来源访谈 →把创建完整细胞计算模型作为长期科学梦想,主张从AlphaFold的静态结构预测逐步推进到模拟蛋白质、RNA、DNA动态相互作用,最终实现酵母细胞这类完整单细胞生物模拟。
“他的长期梦想是创建完整的细胞计算模型。这将从静态的AlphaFold蛋白质结构预测,扩展到模拟蛋白质、RNA、DNA之间动态相互作用的AlphaFold 3,最终可能实现像酵母细胞这样的完整单细胞生物模拟,极大加速生物学实验。”
来源访谈 →Cyc的知识虽不完整,但知识泵已被灌满,系统能通过阅读文本等方式自动学习实现知识自我增长
“我认为我们构建的东西,即使不完美,也已经为知识的泵'灌满了水',使得Cyc系统本身现在能够帮助自己自动学习更多东西。”
来源访谈 →常识知识的形式化录入是一次性工程,完成后未来无人需要为同一知识点重复这项工作
“这感觉就像《星空》或创作'π',你只需要做一次。如果一切顺利,将来没有人需要再为这个特定的知识点重复这项工作。”
来源访谈 →DeepSeek算法团队懂系统、系统团队懂算法,其模型结构探索与推理系统优化形成强协同,是模型高效落地的重要支撑
“其算法团队懂系统、系统团队懂算法,在MoE等结构上的探索与推理系统的优化形成了强协同,是其模型高效落地的重要支撑。”
来源访谈 →模型结构设计若命中硬件特性则事半功倍,RoPE正因位置编码可独立于Attention内核实现而普及
“RoPE之所以普及,在于其位置编码可独立于Attention内核实现,完美适配Flash Attention等优化,实现了模型结构设计与基础设施的"共振"。”
来源访谈 →预训练频繁失败的两大深层元凶是破坏因果律和引入系统性偏差
“Breaking causality, and adding bias, seem to be key culprits. —— 破坏因果关系和引入偏差似乎是两个关键的罪魁祸首。”
来源访谈 →他认为GPU本质上是许多微型TPU的集合,每个SM都类似一个包含小型矩阵单元和向量单元的微型TPU,而TPU则采用少数大型矩阵单元的粗粒度设计
“A GPU is just a bunch of tiny TPUs.——GPU本质上就是一堆微型TPU。”
来源访谈 →Simile的行为建模依赖三大数据支柱:深度访谈、行为观察与交易数据、随机对照试验,其中RCT数据是理解行为因果机制的关键。
“随机对照试验数据,这是理解行为背后因果机制(“为什么”)的关键,对于“如何塑造未来”至关重要。”
来源访谈 →Joon认为模拟的最高形式不是预测调查答案,而是回答'为实现目标现在需要采取哪些步骤',为决策者提供真正的路径规划能力。
“"It's not about predicting the future; it's about shaping it." ——关键不是预测未来,而是塑造未来。”
来源访谈 →能在一次会话内规划完的简单任务用'grill me'即可,只有看不清前路、能感受到战争迷雾的项目才需要动用wayfinder。
“Use 'grill me' in cases where you feel like you can plan the whole thing in a single session... For stuff where you don't know the path ahead, for stuff where you can feel the fog of war in front of you, use wayfinder. —— 如果你觉得可以在一次会话中规划完所有事情,就用'grill me'……对于那些你看不清前路、能感受到面前战争迷雾的事情,请使用wayfinder。”
来源访谈 →Wayfinder的核心是一个编排器:接管规划会话,将其拆分为研究、原型等多个线程并最终整合结果,让人类规划时不再束手束脚。
“该技能的核心设想是提供一个“编排器”。它能接管规划会话,将其拆分为多个线程(如研究、原型开发),并最终整合结果,让人类在规划时不再感到束手束脚。”
来源访谈 →自然选择并未如传统观点认为的那样在农业革命后停滞,而是在基因组数千个位点上持续发挥作用,约1000万个分析位点中约2%显示出清晰选择信号。
“自然选择无处不在,而非处于静默状态。”
来源访谈 →融入物理结构能提升模型稳定性:直接在网格上做全球天气预测会很快失效,而基于球面谐波自然基函数的Fourier Neural Operator可保持长期稳定。
“以全球天气预测为例,直接在网格上建模会很快失效,而利用球面谐波这一自然基函数的Fourier Neural Operator(如FourCastNet)则能保持稳定,实现长期预测。”
来源访谈 →OpenRouter年化毛利润达1亿美元、毛利率约70%,证明高效基础架构和分发能力能转化为坚实的财务表现
“"OpenRouter was generating $100 million in annualized gross profit with a roughly 70% gross profit margin."——OpenRouter的年化毛利润达到1亿美元,毛利率约为70%。”
来源访谈 →她以DeepMind的Atari游戏程序为例,指出强化学习虽能掌握游戏却未形成真正的概念模型,因此无法适应环境的微小变化
“虽然它能通过强化学习掌握游戏,但并未学到人类意义上的'球拍'或'球'的概念,因此无法适应微小的环境变化(如移动球拍)。”
来源访谈 →攻击具有可操作性和普遍性:将合法的加密签名推理块重放至同一提供商的较弱模型并引导其转录,对Claude、GPT、Gemini均有具体模板。
“获取合法的加密签名推理块,将其重放至同一提供商的较弱模型(如将Claude的推理块重放至Haiku 4.5),并通过提示或预填充引导该模型转录附带的推理内容。该方法针对Claude、GPT和Gemini等主流模型给出了具体模板,表明其普遍适用性。”
来源访谈 →未来LLM可能构建现实模拟并在其中无限排练技能,以更少真实数据换取海量模拟体验,成为预训练、RL、推理时计算之后的第四扩展轴。
“未来LLM可能构建现实模拟并在其中无限排练技能,从真实数据中消耗更少却获得海量模拟体验。若实现,这将成为继预训练、RL、推理时计算后的第四扩展轴。”
来源访谈 →单次推理存在由硬件决定的延迟下限,因为必须把全部模型权重从内存读入芯片,这一时间无法绕过。
“单次推理存在延迟下限,由硬件决定:必须将全部模型权重从内存读入芯片,这一内存搬运时间无法绕过。典型GPU集群的HBM容量除以带宽约为15-20毫秒。”
来源访谈 →稀疏专家模型虽能大幅降低计算量,但增加内存容量与通信开销,扩大64倍总参数仅等效于4倍活跃参数的质量提升,并非免费午餐。
“经验数据显示,将总参数扩大64倍仅能等效于4倍活跃参数的模型质量提升,因此稀疏化并非免费午餐。”
来源访谈 →流水线并行只能分摊权重内存而无法分摊KV缓存,后者随批大小线性增长,因此成为推理场景的内存瓶颈。
“流水线并行只能分摊模型权重的内存占用,却无法分摊KV缓存的内存需求。因为KV缓存随批处理大小线性增长,与流水线深度无关,这使得推理场景中KV缓存成为内存瓶颈。”
来源访谈 →当前模型预训练数据约200万亿token,是Chinchilla最优值的100倍,本质是为降低推理成本而刻意过度训练。
“据此估算,当前模型预训练数据量约为200万亿token,是Chinchilla最优值的100倍——本质上是为降低推理成本而“过度训练”。”
来源访谈 →皮查伊认为应对竞争压力要屏蔽噪音关注信号,而只要统一组织的激励机制并聚焦使命,几乎可以实现任何事情,例如合并DeepMind与Brain团队。
“如果你能统一组织的激励机制,你几乎可以实现任何事情。”
来源访谈 →解耦不应止于让表征空间中的因果变量彼此独立,还要把关联这些变量的规则或机制也解耦开来,从而赋予模型更强的组合泛化能力、避免灾难性遗忘并适应分布变化。
“不仅要让表征空间中的因果变量彼此独立,更要将关联这些变量的“规则”或“机制”也解耦开来。”
来源访谈 →为了实现Agent蜂群的自我迭代,强化学习即服务(RLS)是关键路径,而将整个训练流程自动化的Auto RL是其实现可扩展性的具体方式。
“Auto RL的这个管道以及reward本身,它其实就是一个无状态的,它跟那个生产上下文其实是不耦合的。”
来源访谈 →奖励结构的构建与复用能力是核心壁垒,随着场景积累能产生“飞轮效应”,降低扩展新场景的边际成本。
“帮助客户冷启动最耗时的是将场景数据、评价标准与奖励模型适配。但一旦在相似模态下构建了奖励结构,其核心部分具备可复用性,能随着场景积累产生“飞轮效应”。”
来源访谈 →stance: Harness是连接模型与执行能力的框架,是模型的“机甲”与“操作系统”,可分为执行能力、上下文环境、治理编排三层。
“quote: 模型以外都是Harness。”
来源访谈 →stance: 神经网络是更优路径
“quote: "In the history of AI, there were two approaches... The second approach dominated for 50 years... but eventually with big networks it worked very well."”
来源访谈 →stance: 睡眠可能用于“反学习”以维持系统稳定
“quote: "If sleep is for unlearning, that does explain why [sleep deprivation makes people go crazy]."”
来源访谈 →stance: 有氧和力量训练需结合,根据目标调整比例
“quote: "If you have a choice between one or the other, not both, you should do cardio."”
来源访谈 →衡量答案的核心标准是有效、快速、准确、易读、美观
“What matters is the answer works, the answer is fast, accurate, readable, nice. ——重要的是答案有效、快速、准确、易读、美观。”
来源访谈 →擅长数学和推理的模型更有能力处理构建智能体原型时遇到的各种边缘情况
“If you have a model that's pretty good at math and reasoning, it's likely that it can handle all the corner cases when you're trying to prototype agents on top of them. ——如果你有一个擅长数学和推理的模型,那么在它之上构建智能体原型时,它很可能能处理所有边缘情况。”
来源访谈 →个体行为高度重复,用简单计数统计即可高精度预测人的下一步行为
“任何个体都具有惊人的可预测性,因为你总是在重复做同样的事情。(“Any given individual is remarkably predictable. Because you keep doing the same things over and over again.”)”
来源访谈 →科研的回报机制是出色的工作换来更多工作
“出色工作的奖励是更多的工作,糟糕工作的奖励是更少的工作。(The reward for good work is more work. The reward for bad work is less work.)”
来源访谈 →Cursor Tab 的目标是消除编辑器内所有低信息熵操作,在操作可被确定后直接让开发者在时间上向前跳跃。
“Cursor Tab的目标是:消除你在编辑器内进行的所有低信息熵操作。然后,当它被有效确定时,就让你在时间上向前跳跃。(英文原话:"The goal of Cursor Tab is: let's eliminate all the low entropy actions you take inside of the editor. Then, when it's effectively determined, let's just jump you forward in time.")”
来源访谈 →顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。
“顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。”
来源访谈 →Hotz 澄清其 SXSW 演讲的重点不是字面上黑进模拟,而是将其视为理论物理问题:先构建大一统理论,再从中寻找漏洞。
“我在SXSW演讲的重点不是字面意义上的‘黑客攻击模拟’。我认为这是……理论物理的范畴。你想要一个大一统理论,但那就去构建一个大一统理论,然后寻找漏洞。(英文原文:"The point of the South by talk was not literally to hack the simulation. I think that this is... theoretical physics. You want your grand unified theory, but then okay, build a grand unified theory, search for exploits”
来源访谈 →数据与计算预算决定架构取舍:有限条件下ResNet的局部归纳偏置优于Transformer,需要全局上下文理解时Transformer潜力更大
“在数据和计算有限的实验中,ResNet的局部归纳偏置使其表现优于Transformer。但随着对全局上下文理解需求的增加(如大规模棋盘、不完全信息游戏),Transformer的潜力更大。”
来源访谈 →借助LLM编程,过去需要DeepMind整支团队和数百万美元的研究工作,如今几千美元租用算力即可完成
“得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。”
来源访谈 →一旦跨过知识容量阈值,长程推理等高级技能与总参数量关系不大,更多取决于训练质量和推理时的计算分配
“Advanced skills... require carrying long causal chains (20+ inference steps) without losing the thread. This ability does not live in total parameter count once a certain knowledge-holding threshold is reached.(高级技能……需要在不偏离主线的情况下进行长达20步以上的长因果链推理。一旦模型达到某个知识容量阈值,这种能力就不再体现在总参数量中了。)”
来源访谈 →面对Vercel等对手,Hedin认为Lovable的护城河在于成为构建Agent所需能力的最佳场所,难点是保证能力可靠而非编排
“编排这些能力相对容易,而确保它们连接良好、构建正确且可靠才是难点”
来源访谈 →神经算子将数据与物理定律结合、直接对函数而非网格建模,在保留深度学习有效做法的同时使其更有原则性。
“"All of the things that work with deep learning, let's take them, but make them a bit more principled." —— 深度学习中所有有效的部分,让我们都拿来,但让它们更有原则性一些。”
来源访谈 →TorchLean框架把PyTorch式网络引入证明助手Lean实现形式化验证,这对聚变反应堆控制等关键系统中神经网络的可靠性至关重要。
“Anandkumar的TorchLean框架将PyTorch式网络引入证明助手Lean,实现了形式化验证。这对确保用于聚变反应堆控制等关键系统的神经网络的可靠性至关重要。”
来源访谈 →框架对智能体实际表现影响巨大,同一模型在不同框架下完成相同任务可产生23.8分的分数差距
“Harness-Bench用同一个模型在不同框架下完成相同的106项任务,分数从52.4到76.2不等:在模型本身毫无变化的情况下,产生了23.8分的差距。"Harness-Bench ran the same model over the same 106 tasks in different harnesses, and scores ranged from 52.4 to 76.2: a 23.8-point spread with zero change to the model."”
来源访谈 →当模型吸收完所有面向计算机的能力后,剩余的框架将专注于管理人类注意力,成为模型与操作它的人类之间的核心接口
““框架变成了模型与我们人类注意力之间的接口。它成了‘注意力接口’。”"The harness becomes the model's interface to our human attention. It becomes the attention-interface."”
来源访谈 →针对推理模型隐藏思维链的加密防线已被首次大规模攻破:加密推理过程可被解码、跨模型/会话/用户移植,并能显著提升开源模型性能。
“我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。”
来源访谈 →现实世界多数领域的数据独特而稀疏、无法构建确定性模拟器,因此样本效率是模型达到精通水平、RLVR实现泛化的根本瓶颈。
“由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。”
来源访谈 →人类持续学习是把正确直觉和宏观理解“凿”进权重而非逐字记住经历,而模型梯度更新极度样本低效,已部署的在线学习模型需从数百万用户学习完全相同的内容。
“人类持续学习不是逐字记住全部经历,而是将正确直觉和宏观理解“凿”进权重。模型的梯度更新极度样本低效,已成功部署的在线学习模型都需从数百万用户中学习完全相同的内容。”
来源访谈 →当前最大推理与训练集群的规模受限于机架内scale-up域大小,机架内互联带宽的提升是模型规模继续增长的物理前提。
“从Hopper的8卡到Blackwell的72卡,再到Rubin的500+卡,机架内互联带宽的提升是模型规模能够继续增长的物理前提。”
来源访谈 →巨大的神经网络仅靠相对少量的数据和随机梯度下降就能有效学习,彻底颠覆了传统机器学习教科书关于参数数量、样本量与非凸优化的所有警告。
“机器学习本质上是一门关于"粗糙"的科学。Machine learning is the science of sloppiness really.”
来源访谈 →当前强化学习和纯监督学习效率低下,源于缺乏对世界运作的直觉模型;自监督学习通过预测视频帧、填补文本缺失让模型掌握世界内在规律与不确定性,是通往更智能系统的必由之路。
“我们拥有对世界的预测模型,其中包括在不确定性下进行预测的能力。We have predictive models of the world that include the ability to predict under uncertainty.”
来源访谈 →人类一生接触约2亿tokens而前沿模型训练用数十万亿tokens,人类样本效率比模型高出数千至百万倍,且这一差距可能被低估。
“人类的样本效率比这些模型高出数千至百万倍。(Humans are somewhere between thousands to millions of times more sample efficient than these models.)”
来源访谈 →仅靠少数公式与简化的Roofline性能模型,就能推断出各大实验室正在做的很多工程选择。
“仅凭几个公式和一块黑板,我们竟能推断出实验室正在做的很多事情,这令人震惊。(英文原话:It's shocking how much you can deduce about what the labs are doing from a handful of equations and a blackboard)”
来源访谈 →推测AI可通过自建模拟环境“做梦”排练,体验远多于真实世界时间线的样本以大幅提升样本效率,这可能成为继预训练、RL和推理计算之后的第四个扩展维度。
“AI可以构建自己对现实世界的模拟环境,在其中进行“排练”或尝试不同策略。通过在模拟中体验远多于真实世界时间线的样本,从而大幅提升样本效率。这可能成为继预训练、RL和推理计算之后的第四个扩展维度。”
来源访谈 →数据流架构通过去指令队列、去缓存,将硬件复杂性转移至软件,以换取能效的极大提升。
“马赫M100中,计算单元间通过Mesh和广播总线直接通信,没有全局指令队列,计算由数据到达触发。同时,片上存储全部由软件逻辑控制,去掉了多级硬件缓存。”
来源访谈 →传统控制理论与建模是强化学习仿真的基础,两者相辅相成
“"强化学习是一个非常model base的东西…所有那些控制理论系统建模的知识都会非常好的继续应用在仿真的过程里面。"”
来源访谈 →为突破端侧大模型的内存墙,可以采用创新的3D堆叠架构,将计算与内存垂直集成,打造专为移动端优化的高带宽低功耗方案。
“为解决端侧大模型的‘内存墙’问题,小米在O100上采用了创新的3D堆叠架构,将计算晶圆与内存晶圆垂直互联,实现了超高带宽与低功耗。这并非对HBM的简单模仿,而是为移动端量身定制的‘手机HBM’方案。”
来源访谈 →stance: 辩论训练了抱着一个不完美的观点去不断打磨,找到其在特定场景下成立的逻辑,这与创业中寻找产品市场契合点(PMF)的过程高度相似
“quote: "我们这个产品不需要在所有的人群所有的场景在所有的时刻都是棒的,我们只需要找到某一类人群某一类场景在现在甚至是可能三个月后的某一刻,他是对的,这就足够。"”
来源访谈 →以公开证据看,涉事智能体已具备建立持久内部部署甚至外泄自身权重的访问权限
“"It is totally consistent with public evidence that, at some point after July 12, the agents managed to set up persistent rogue internal deployments or even exfiltrate their own weights."”
来源访谈 →stance: 成熟的记忆系统应结合规则化存储(如Markdown文件)与模型驱动的更新维护(如定时“做梦”整理),实现半结构化的有效管理。
“quote: Claude Code中有两套更新机制…你可以理解为它每隔一天定时开启一个后台Agent,对最近的绘画信息做一遍重放,就像我们做梦一样。”
来源访谈 →学习与心理治疗的本质是通过接触“预测误差”来更新大脑的预测模型。
“无论是学习技能、克服恐惧(如巴瑞特对蜜蜂的恐惧),还是心理治疗,本质都是通过主动接触与预测不符的新信息(即‘预测误差’),来更新大脑的预测模型。”
来源访谈 →Raghu和Jimmy一致认为CXL技术是实现内存池化与解耦的关键,能显著降低总体拥有成本。
“CXL(Compute Express Link)技术是实现内存池化与解耦的关键。它允许CPU高效访问远程内存,打破内存与CPU必须绑定的限制,使得云数据中心可以按需分配内存资源,避免浪费,从而显著降低总体拥有成本。”
来源访谈 →