议题 · 2026-08 更新

AI进步源泉:架构革新还是系统优化

当前大模型性能提升的主要驱动力是Transformer等核心架构的根本性创新,还是训练算法与系统优化的持续迭代?

⚡ 正面交锋:谁的说法站得住

自动比对 369 条立场:判定出 1 组对立、10 组共识(bge-m3 同话题预筛 + GLM-5.3 语义判定,非关键词匹配)。

实验室本不愿增加推理算力占比以免更像云服务商而非前沿模型训练者,但推理收入增长快于训练算力投入,迫使它们分配更多资源服务现有模型以维持现金流。

来源访谈 →

实验室会把算力更多分配给内部研发而非对外推理服务,因为内部使用超快AI或最佳模型产生的价值远高于外部用户。

来源访谈 →

立场盘点 369 位

Transformer核心架构未变,进步来自架构细节调整、训练算法革新和系统优化。

“从GPT-2到如今的前沿模型,自回归Transformer的核心架构保持不变。进步主要来自于架构细节的调整(如混合专家MoE、多头潜在注意力)、训练算法的革新(如RLHF),以及底层计算系统(如数据精度、集群效率)的持续优化。”

来源访谈 →

所有形式的扩展定律在可预见的未来依然有效,但预训练的低成本果实已大多被摘取。

“我认为所有形式的扩展定律依然有效,只是预训练的低成本果实大多已被摘取。 (I think all forms of scaling laws are still effective, it's just the low-hanging fruit of pre-training have mostly been picked.)”

来源访谈 →

推理时计算扩展(让模型思考更久)是高效的能力提升新路径。

“推理时缩放让模型在给出第一个词之前,能思考数秒、数分钟甚至数小时,这是能力上的巨大飞跃。 (Inference-time scaling lets a model think for seconds, minutes, or even hours before giving the first word, which is a huge leap in capability.)”

来源访谈 →

解决一切问题的核心工具是将事物分解至最基本的物理原理进行思考和推演。

“I'm just not how I think about things. For me, it's simply this: this is something that is important to get done, and we should just keep doing it or die trying.”

来源访谈 →

深度学习通过“逐点”映射学习,导致其泛化能力有限,在需要抽象推理和远距离泛化的任务上效率低下。

“深度学习本质上是逐点的几何映射,而抽象规则能更好地泛化。(Deep learning is really point-by-point geometric morphing, while abstract rules can generalize much better.)”

来源访谈 →

深度学习本质是关联学习,无法进行真正的抽象推理和知识迁移。

“深度学习在模式识别(如图像分类)上非常有效,但它本质上是关联学习,而非真正的抽象推理。它无法像人类一样灵活地将学到的知识迁移到新情境中,例如在棋盘形状改变后,AI可能需要完全重新训练才能应对。”

来源访谈 →

解决问题的关键在于定义目标函数,然后通过调整连接权重(如反向传播)来实现,而非仅从生物学寻找规则。

“You should think in terms of how you can adjust connection weights to solve a problem. You define your problem and then you figure out how the adjustment of the connection weights will solve the problem.(你应该思考如何通过调整连接权重来解决问题。你定义你的问题,然后找出调整连接权重如何解决它。)”

来源访谈 →

内存墙问题具有双重性:既面临供应成本压力,又需避免为单GPU过度配置内存,因为推理可通过跨GPU并行分摊权重存储。

“It's shocking how much you can deduce about what the labs are doing from a handful of equations and a blackboard”

来源访谈 →

随着AI沿‘递归自我改进’加速,下一代前沿模型所需的集群规模将比当前大一个数量级以上。

“下一代前沿模型所需的集群规模,将比这个数字再大一个数量级以上。”

来源访谈 →

更聪明的模型意味着单位时间内需要消耗更多的计算资源,这直接提升了算力的单价。

“更聪明的模型往往意味着更大的参数规模、更复杂的训练过程或更长的推理时间。这些都需要单位时间内消耗更多的计算资源,直接提升了算力的单价。”

来源访谈 →

当前深度学习缺乏真正的概念学习,无法灵活适应环境微小变化。

““以DeepMind的Atari游戏程序为例,它并未学到人类意义上的‘球拍’或‘球’的概念,因此无法适应微小的环境变化(如移动球拍)。””

来源访谈 →

在推理场景中,KV缓存的内存需求是系统瓶颈,因为其随批处理大小线性增长,无法通过流水线并行分摊。

“流水线并行只能分摊模型权重的内存占用,却无法分摊KV缓存的内存需求。因为KV缓存随批处理大小线性增长,与流水线深度无关,这使得推理场景中KV缓存成为内存瓶颈。”

来源访谈 →

当前的深度学习并未解决符号落地问题,只是解决了标注问题。

“The labeling problem was solved with some percentage accuracy which is different from the grounding problem. ——标注问题以一定准确率得到了解决,但这与符号落地问题截然不同。”

来源访谈 →

必须摒弃目标函数固定的传统AI范式,让机器对其目标保持根本性的不确定性。

“必须摒弃‘目标函数已知且固定’的传统AI范式。机器应该对其被要求最大化的目标保持不确定性,将其视为一个需要学习的变量。”

来源访谈 →

马斯克坚持从物理学第一性原理出发思考问题,并追求从设计到生产线的端到端掌控以实现快速创新。

“马斯克坚持从物理学第一性原理出发思考问题(如自动驾驶坚持纯视觉方案)。同时,他追求“制造机器的机器”的端到端掌控。”

来源访谈 →

自监督学习是比监督学习和强化学习更高效的机器学习范式,是人类和动物高效学习的基础。

“自监督学习通过让模型预测数据中的缺失部分(如文本填空、视频预测),能从原始数据中获取远比前两者丰富的监督信号,这是人类和动物高效学习的基础。”

来源访谈 →

自监督学习是让AI系统自主学习世界规律、突破效率瓶颈、接近人类和动物学习方式的关键路径。

“自监督学习旨在通过预测视频帧、填补文本缺失等方式,让模型自主学习世界的内在规律与不确定性,从而大幅提升学习效率,使其更接近人类和动物的学习方式。”

来源访谈 →

多数越狱技巧本质上是社交工程(如诉诸权威、指示模型不要拒绝),字符混淆等冷门技术增益有限,这印证了"拟人化"AI模型的实用性。

“多数越狱技巧本质上是社交工程,如诉诸权威、指示模型不要拒绝等。相对冷门的字符混淆等技术增益有限。这印证了"拟人化"AI模型的实用性。”

来源访谈 →

各开发者普遍优先强化生物安全防护,因为生物领域存在清晰的可防/可拒层级,而化学、网络等领域的双重用途属性使防护更难。

“各开发者普遍优先强化生物安全,且生物领域本身存在清晰的可防/可拒层级,更容易设置决策边界。而化学、网络等领域的双重用途属性使防护更难。”

来源访谈 →

Karpathy认为Transformer之所以卓越,在于它是一台通用的可微分计算机,同时具备强大表达力、可优化性和与硬件的高度匹配。

“Transformer是一个卓越的神经网络架构,因为它是一台通用的可微分计算机。"The transformer is a magnificent neural net architecture because it is a general-purpose differentiable computer."”

来源访谈 →

从零开始构建大模型可能是理解其工作原理的最佳方式,因为代码精确且不说谎

“代码是精确的,它不会说谎。从零开始构建大模型可能是理解其工作原理的最佳方式。”

来源访谈 →

推理时缩放让模型在给出第一个词之前能思考数秒、数分钟甚至数小时,是能力上的巨大飞跃

“推理时缩放让模型在给出第一个词之前,能思考数秒、数分钟甚至数小时,这是能力上的巨大飞跃。”

来源访谈 →

所有形式的扩展定律依然有效,只是预训练的低成本果实大多已被摘取

“我认为所有形式的扩展定律依然有效,只是预训练的低成本果实大多已被摘取。”

来源访谈 →

擅长数学和推理的模型更有能力处理构建智能体原型时遇到的各种边缘情况

“If you have a model that's pretty good at math and reasoning, it's likely that it can handle all the corner cases when you're trying to prototype agents on top of them. ——如果你有一个擅长数学和推理的模型,那么在它之上构建智能体原型时,它很可能能处理所有边缘情况。”

来源访谈 →

当前机器学习研究过度工程化、局限于孤立任务,AI系统必须在真实混沌环境中长期生存学习

“要实现真正的进步,必须让AI系统在真实、混沌、不可控的环境中长期(数月)生存和学习,即使这意味着研究周期会被拉得很长。”

来源访谈 →

科研的回报机制是出色的工作换来更多工作

“出色工作的奖励是更多的工作,糟糕工作的奖励是更少的工作。(The reward for good work is more work. The reward for bad work is less work.)”

来源访谈 →

心理学等领域的复制危机主要出在“被试间”实验上:研究者本人处于“被试内”视角,因而对“被试间”实验的效应强度和可预测性产生严重误判。

“问题主要出在“被试间”实验上。研究者本人处于“被试内”视角(能清晰感受两种条件的对比),但这使得他们对“被试间”实验(不同的人处于不同条件)的效应强度和可预测性产生严重误判。”

来源访谈 →

实验室算力年增仅3倍却需支撑收入10倍增长,只能靠利润率提升、算力涨价或推理算力占比上升三条途径,且三者目前均在发生。

“实验室算力年增仅3倍,为支撑收入10倍增长,只能依赖利润率提升、算力涨价或推理算力占比上升三途径,目前三者均在发生。”

来源访谈 →

顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。

“顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。”

来源访谈 →

Amodei 认为改进模型某一特性却使另一特性退化的现象,是未来 AI 控制问题的当前模拟,从今天起就可以着手研究。

“你让一件事变好,却让另一件事变糟。这是未来 AI 控制问题的当前模拟,我们今天就可以开始研究它。”

来源访谈 →

费鲁奇表示开发Watson时不指望语言理解上的全新发明,而是依靠整合现有NLP与机器学习技术的架构能力。

“我们并不打算真正理解语言来解决这个问题……我的假设是不指望某种全新的发明。我指望的是整合现有技术的能力。(英文原话:We're not going to actually understand language to solve this problem... My assumption is I'm not counting on some brand new invention. What I'm counting on is the ability to take everything that has been done before to figure out an architec”

来源访谈 →

费鲁奇的工程方法是先把现有技术整合好,观察系统在哪里失败,再做出必要改进直到整体可用。

“我会想办法把它整合好,然后看看它在哪里会失败,再做出必要的改进,直到它能用。(英文原话:I'm going to figure out how to integrate it well and then see where it breaks, and make the necessary advances we need to make until this thing works.)”

来源访谈 →

DeepSeek V3与R1同源不同路:V3是基础模型经标准指令微调的聊天模型,R1则是经全新推理训练、回答前展示思维链的推理模型。

“DeepSeek V3的基础预训练完成后,他们做了两种不同的后训练:一种是创建标准的指令微调模型V3,另一种是通过新的推理训练创建R1。”

来源访谈 →

DeepSeek高效训练的两大技术支柱是混合专家模型(只激活参数子集,如671B参数中仅激活37B)和自创的多头潜在注意力机制。

“混合专家模型(MoE)通过每次只激活参数的一个子集,大幅降低了训练和推理成本。”

来源访谈 →

把创建完整细胞计算模型作为长期科学梦想,主张从AlphaFold的静态结构预测逐步推进到模拟蛋白质、RNA、DNA动态相互作用,最终实现酵母细胞这类完整单细胞生物模拟。

“他的长期梦想是创建完整的细胞计算模型。这将从静态的AlphaFold蛋白质结构预测,扩展到模拟蛋白质、RNA、DNA之间动态相互作用的AlphaFold 3,最终可能实现像酵母细胞这样的完整单细胞生物模拟,极大加速生物学实验。”

来源访谈 →

以AlphaEvolve为例主张将大语言模型等基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。

“将基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。”

来源访谈 →

DHH认为现代软件开发的根本洞见来自敏捷运动:在真正使用一个程序之前,无法知道它应该做什么。

“现代软件开发的根本洞见来自敏捷软件开发运动……在你真正使用一个程序之前,你并不知道它应该做什么。(The fundamental insight of modern software development came from the Agile software development movement... you don't know what a program should do until you play with it.)”

来源访谈 →

蛋白质进化的核心规律是模块化,域的重组使蛋白质获得新功能而不破坏原有结构。

“Modularity. That's the single keyword about protein evolution. —— 关于蛋白质进化,如果要选一个关键词,那就是模块化。”

来源访谈 →

AlphaFold将蛋白质结构预测从博士生耗时数年缩短到数秒,并已预测人类全部2万种蛋白质,是DeepMind迄今最复杂最有意义的系统

“AlphaFold是我们迄今为止构建的最复杂、也可能最有意义的系统。”

来源访谈 →

认为目前没有证据表明大脑存在量子效应,不愿押注经典计算范式的极限,将其推至极限或许能模拟或近似人脑所有功能

“我非常不愿意押注通用图灵机和经典计算范式的极限在哪里。”

来源访谈 →

构建庞大且完全一致的知识库是不可能的,Cyc改用局部一致性模型以容忍现实中的细微矛盾和例外

“我们不得不放弃全局一致性。这有点像地球表面整体是球形的,但你每天的生活都像是在平地上进行。”

来源访谈 →

Cyc的知识虽不完整,但知识泵已被灌满,系统能通过阅读文本等方式自动学习实现知识自我增长

“我认为我们构建的东西,即使不完美,也已经为知识的泵'灌满了水',使得Cyc系统本身现在能够帮助自己自动学习更多东西。”

来源访谈 →

常识知识的形式化录入是一次性工程,完成后未来无人需要为同一知识点重复这项工作

“这感觉就像《星空》或创作'π',你只需要做一次。如果一切顺利,将来没有人需要再为这个特定的知识点重复这项工作。”

来源访谈 →

GPU价值不应按折旧周期衡量,而看能产出多少高质量token,旧H100因算法进步单位价值反而随时间上升。

“一台H100今天的价值比三年前更高。(An H100 is worth more today than it was 3 years ago.)”

来源访谈 →

退回旧制程节点无法缓解EUV短缺,因为网络、内存带宽等系统级累积效应使新旧芯片实际推理性能差距近20倍。

“回到旧制程节点(如7纳米)并不能有效缓解EUV短缺。芯片性能差异远超单纯的浮点运算对比,网络拓扑、内存带宽、系统级集成等累积效应导致Hopper与Blackwell在实际推理性能上存在近20倍差距。”

来源访谈 →

内存(DRAM/HBM)已成为比逻辑芯片更紧迫的瓶颈,2026年大型科技资本开支约30%用于内存采购,并挤压智能手机和PC出货。

“内存(DRAM/HBM)已成为比逻辑芯片更紧迫的瓶颈。2026年大型科技公司资本开支中约30%将用于内存采购,价格持续上涨正侵蚀消费电子领域——智能手机和PC出货量将因此显著下滑。”

来源访谈 →

吉布森认为中心嵌套这类含极长多重依赖的结构在任何语言中都百分之百无法理解,其困难是跨语言普遍存在的。

“无论你观察哪种语言……它都不会是好的。可以百分之百保证,那种结构在该语言中将是无法理解的。(原文:No matter what language you look at... it won't be good. It's guaranteed like 100% that will be uninterpretable in that language.)”

来源访谈 →

他批评当前大语言模型易产生幻觉,xAI致力于让AI的答案根植于物理第一性原理与数学逻辑,使其像量子力学一样可靠。

“物理定律是法律,其他一切都只是建议。(Physics is the law, everything else is a recommendation.)”

来源访谈 →

肖莱以科学体系作为递归自我改进系统的现实模型,指出其资源消耗指数增长而产出仅线性增长,证明此类系统不会出现爆炸式进步。

“Science is probably the closest thing we have today to a recursively self-improving superhuman AI, and you can observe that scientific progress is not actually exploding. —— 科学可能是我们目前拥有的最接近递归自我改进的超人类AI的系统,而你可以观察到科学进展实际上并未爆炸式增长。”

来源访谈 →

深度学习本质是逐点的几何映射学习,需要训练数据对输入-输出空间密集采样,因而在抽象推理和远距离泛化任务上能力有限。

“Deep learning is really point-by-point geometric morphing, while abstract rules can generalize much better. —— 深度学习本质上是逐点的几何映射,而抽象规则能更好地泛化。”

来源访谈 →

Hotz 断言 MuZero 就是解决自动驾驶问题的方案,并将成为整个深度学习时代的典范论文。

“我认为 MuZero 将会被视为整个深度学习时代的典范论文。而 MuZero 就是解决自动驾驶问题的方案。(英文原文:"I think MuZero is going to be looked back as the canonical paper of this whole deep learning era. And MuZero is the solution to self driving cars.")”

来源访谈 →

Hotz 认为特征工程类方法(如特斯拉数据引擎)终将被端到端学习方法取代并击败。

“我认为特征工程的方法最终总会被端到端的方法所取代和击败。(英文原文:"I think feature engineering approaches will always be replaced and lose to end to end.")”

来源访谈 →

Hotz 澄清其 SXSW 演讲的重点不是字面上黑进模拟,而是将其视为理论物理问题:先构建大一统理论,再从中寻找漏洞。

“我在SXSW演讲的重点不是字面意义上的‘黑客攻击模拟’。我认为这是……理论物理的范畴。你想要一个大一统理论,但那就去构建一个大一统理论,然后寻找漏洞。(英文原文:"The point of the South by talk was not literally to hack the simulation. I think that this is... theoretical physics. You want your grand unified theory, but then okay, build a grand unified theory, search for exploits”

来源访谈 →

马库斯认为深度学习本质上是关联学习而非真正的抽象推理,无法像人类一样将学到的知识灵活迁移到新情境。

“AI实际上是一堆不同技术的集合,其中一些有其独特的优势和劣势。(英文原话:AI is actually a grab bag of different techniques, and some of them have unique strengths and weaknesses.)”

来源访谈 →

马库斯认为通用智能的关键在于将一个领域学到的知识灵活应用到另一个领域,而非完成无限多的任务。

“真正的通用智能不是完成无限多的任务,而是能够将在一个领域学到的知识灵活应用到另一个领域。”

来源访谈 →

当前大模型的损失函数是最大化压缩,导致产出平庸,与追求AGI的目标背道而驰。

“如果你的损失函数仅仅是试图最大化压缩……它写的说唱听起来就像YouTube评论里的说唱。(If your loss function is just try to maximize compression... the raps that it wrote sounded like YouTube comment raps.)”

来源访谈 →

桑德森认为从一个无比巨大的集合中随机选取元素,与找到有效方法去主动描述该元素,是两项截然不同的任务。

“有时从一个无比巨大的集合中随机选择一个元素,与找到一种有效的方法去主动描述它,是两项截然不同的任务。”

来源访谈 →

桑德森认为使费马大定理困难的原因其实相当深刻,并非表面的技巧性难题。

“费马大定理之所以困难,其原因其实相当深刻。”

来源访谈 →

数学内部进步的'尖峰'具有分形本质:几何易解、组合难啃,放大看子领域难度差异依旧巨大,说明进步的不均衡性是结构性的。

“这种(进步)尖峰具有分形本质,因为当你放大数学内部的特定进展时,你会发现有些事比其他事容易得多。(英文原话:There's a fractal nature to that spikiness because when you zoom into the specific progress within math you have some things are a lot easier than others.)”

来源访谈 →

形式化的重要性被高估:AI解决单位距离猜想用的是自然语言思维链而非Lean证明,但Lean的长期价值在于构建无需人工监督、可无限延伸的数学树。

“AI解决单位距离猜想时用的是自然语言思维链,而非Lean证明。但Lean的长期价值在于可构建无需人工监督的"无限延伸"的数学树,如同AlphaZero在高维空间自主进步。”

来源访谈 →

数学进步的两大引擎是可验证性与'可磨砺性':答案可自动验证,计算环境可无限容器化复制以支持大规模并行试错并解决信用分配,这是计算机使用等领域难以企及的。

“除数学问题的答案可自动验证外,其计算环境可无限容器化复制,支持大规模并行试错并解决信用分配。这是计算机使用等领域难以企及的。”

来源访谈 →

Sutskever认为深度学习最美妙之处在于它在实践中真的有效。

“我认为深度学习最美妙的地方在于它真的有效。”

来源访谈 →

大规模问题必须靠极端协同设计解决,加机器就要追求远超线性的加速回报,否则会被Amdahl定律卡死整体效率。

“你加了一万台计算机,但你希望它能快一百万倍。”

来源访谈 →

架构的成败由装机量决定,为此Nvidia宁可承受成本增加50%、市值从80亿跌到15亿的代价,也要把CUDA放进GeForce用消费级出货量培养装机量。

“装机量就是一切。装机量定义了一个架构,其他一切都是次要的。”

来源访谈 →

预训练、后训练、测试时间扩展、智能体扩展四个Scaling Law形成循环,但归根结底智能的扩展最终取决于算力一项。

“归根结底,智能的扩展靠的是一样东西——算力。”

来源访谈 →

计算范式已从基于检索的系统转向基于生成的系统,数据中心不再是传统计算机,而是用来创造收入的工厂。

“我们从一个基于检索的计算系统,变成了一个基于生成的计算系统。它不再是计算机,它是工厂。一座用来创造收入的工厂。”

来源访谈 →

他主张解决问题时应先定义问题与目标,再思考如何通过调整连接权重来求解,而不是只从生物学中寻找现成的学习规则。

“你应该思考如何通过调整连接权重来解决问题。你定义你的问题,然后找出调整连接权重如何解决它。”

来源访谈 →

学术评审质量下滑、算法研究低垂果实被摘尽、加上基础设施决定实验成败的体感,使他从算法研究转向机器学习系统成为行业趋势下的必然转身

“学术评审质量下滑、算法研究"低垂的果实"被摘尽、以及基础设施决定实验成败的体感,共同推动了他从"算法雕刻"转向"系统构建"的必然转身。”

来源访谈 →

模型必须根据硬件特性与基础设施协同设计才能最大化效率,否则算法再好也难以落地

“硬件如自然资源,模型似发电机,推理引擎是电网。只有根据硬件特性设计模型结构,才能最大化"发电效率",否则算法再好也难以落地。”

来源访谈 →

DeepSeek算法团队懂系统、系统团队懂算法,其模型结构探索与推理系统优化形成强协同,是模型高效落地的重要支撑

“其算法团队懂系统、系统团队懂算法,在MoE等结构上的探索与推理系统的优化形成了强协同,是其模型高效落地的重要支撑。”

来源访谈 →

模型结构设计若命中硬件特性则事半功倍,RoPE正因位置编码可独立于Attention内核实现而普及

“RoPE之所以普及,在于其位置编码可独立于Attention内核实现,完美适配Flash Attention等优化,实现了模型结构设计与基础设施的"共振"。”

来源访谈 →

Token并非通用电能,每个模型的Token承载独特印记无法互转,推理引擎必须针对特定模型和硬件做深度适配与优化

“Token并非通用电能,每个模型的Token都承载其独特印记,无法互转。这决定了推理引擎需针对特定模型和硬件做深度适配与优化。”

来源访谈 →

极限协同设计是应对AI规模化的必然选择——当问题规模超越单台计算机的加速能力时,必须打破学科壁垒对整个技术栈端到端协同优化,才能突破阿姆达尔定律的限制、实现超越线性增长的扩展

“英伟达必须打破学科壁垒,协同优化整个技术栈,以实现超越线性增长的计算扩展。”

来源访谈 →

计算架构的生命力在于庞大装机量,在消费级GeForce显卡上搭载CUDA虽导致市值从约80亿美元跌至15亿美元,却将CUDA普及至全球研究人员手中,为深度学习革命奠定基石

“The install base defines an architecture, not everything else is secondary. —— 装机量定义了一个架构,其他一切都是次要的。”

来源访谈 →

AI扩展并未遇到数据耗尽等根本性瓶颈,推理即思考且计算强度极高,扩展已形成预训练、后训练、测试时计算与智能体扩展的持续增强循环,最终受限因素是算力而非数据或架构

“Inference is thinking, and I think thinking is hard. Thinking is way harder than reading. —— 推理就是思考,而我认为思考是困难的。思考比阅读要难得多。”

来源访谈 →

数据中心能源问题并非无解,电网大部分时间存在富余电力,数据中心可设计为优雅降级模式,在高峰时主动降低算力以换取低成本富余电力的灵活合约,而非追求100%不间断供电

“数据中心可设计为“优雅降级”模式,在电网高峰时主动降低算力或转移负载,以换取使用低成本富余电力的合约。”

来源访谈 →

Keller认为优美设计不可能超出设计者本人的规模,因此要用模块化与抽象层驾驭系统复杂性。

“一个优美的设计不可能大于设计它的人。—— A beautiful design can't be bigger than the person doing it.”

来源访谈 →

Keller认为计算的未来是可扩展的低效,靠大规模并行分解问题取胜而非单点效率。

“计算的未来是低效而非高效,但这种低效是可扩展的。—— The future of computing is inefficiency, not efficiency, but scales, inefficiency scales.”

来源访谈 →

Keller认为GPU执行AI计算图本质是模拟、效率不高,为矩阵乘法、卷积和图数据流动设计的原生硬件才是下一个创新方向。

“为像素着色器程序设计的 GPU 在执行 AI 计算图时本质上是在“模拟”,效率不高。”

来源访谈 →

Keller认为软件复杂度增加时必须构建正确的中间表示和抽象层,让不同层次开发者独立工作。

“随着软件复杂度增加,必须构建正确的中间表示和抽象层,将复杂性分解,让不同层次的开发者能独立工作。”

来源访谈 →

感知的下一步突破在于弄清系统应输出什么表示来支持高级推理,而非继续提升分类精度

“The thing that's going to make perception take the next step is actually understanding better what it should produce. ——让感知能力更进一步的关键,实际上是更好地理解它应该输出什么。”

来源访谈 →

AI工程已从新兴概念进入系统化、职业化阶段,DeepLearning.AI将重新聚焦于此,依据是对上万份招聘广告、专家访谈和调查数据的分析

“其DeepLearning.AI平台将重新聚焦于“AI工程”。此举基于对超过一万份招聘广告的分析、数十次与专家及招聘经理的结构化访谈以及广泛的调查数据。”

来源访谈 →

实验室为获取主导地位必须以远高于当前水平的价格竞标算力,这将推高整个市场的算力价格。

“实验室为获取主导地位,必须以更高价格(如每兆瓦2500万至5000万美元)竞标算力,这将推高整个市场的算力价格。”

来源访谈 →

预训练频繁失败的两大深层元凶是破坏因果律和引入系统性偏差

“Breaking causality, and adding bias, seem to be key culprits. —— 破坏因果关系和引入偏差似乎是两个关键的罪魁祸首。”

来源访谈 →

系统性偏差的危害远大于随机方差,因为方差可被平均化而偏差会复利式累积

“Bias much worse than variance - variance can average out, but bias compounds. —— 偏差比方差糟糕得多——方差可以被平均化,但偏差会累积。”

来源访谈 →

FSDP规模化受通信交叉点和批大小双重限制,超过交叉点后训练效率急剧下降

“随着GPU增多,计算时间缩短而通信时间不变,会达到一个计算与通信时间相等的“交叉点”,超过此点后训练效率将急剧下降。”

来源访谈 →

流水线并行可解决FSDP规模化瓶颈,但批次首尾GPU空闲形成气泡,多批次重叠又会影响梯度同步与模型更新的正确性

“虽然可以尝试重叠多个批次来减少气泡,但在训练中这会影响梯度同步与模型更新的正确性。”

来源访谈 →

由于重大概念性突破无法即时验证,无法轻易为其训练强化学习循环。

“What this means for AI for science is that 1. You can't easily train an RL loop for big conceptual breakthroughs.——这对AI科学应用意味着:第一,你无法轻易为重大的概念性突破训练一个强化学习循环。”

来源访谈 →

优化智能体的工作流程、工具使用和状态管理,正变得与优化模型智商同等重要

“表明优化智能体的工作流程、工具使用和状态管理正变得与优化模型智商同等重要。”

来源访谈 →

随着大模型API商业化进入深水区,焦点转向通过推测解码、量化等优化在单卡或有限硬件上实现高吞吐、低成本的本地化部署

“社区关注的焦点集中在如何通过推测解码、量化等基础设施优化,在单卡或有限硬件上实现高吞吐、低成本的本地化部署。”

来源访谈 →

Reiner Pope认为低精度算术在神经网络中如此成功的唯一原因,是乘加电路规模随位宽呈简单的二次方关系,累加需要更高精度应对误差累积

“This is the single reason low-precision arithmetic has worked so well for neural nets.——这是低精度算术在神经网络上如此有效的唯一原因。”

来源访谈 →

他认为在芯片设计中,与实际计算逻辑相比,几乎所有成本都是同步或通信成本,读取数据的多路选择器电路开销远超乘加运算本身

“Almost all your cost becomes synchronization or communication cost compared to the actual logic.——与实际逻辑相比,你几乎所有的成本都变成了同步或通信成本。”

来源访谈 →

他认为GPU本质上是许多微型TPU的集合,每个SM都类似一个包含小型矩阵单元和向量单元的微型TPU,而TPU则采用少数大型矩阵单元的粗粒度设计

“A GPU is just a bunch of tiny TPUs.——GPU本质上就是一堆微型TPU。”

来源访谈 →

他认为芯片设计的核心目标是把计算单元做大、同时保持数据移动单元规模不变,更大的计算单元能更好地分摊外围电路成本

“Make this one bigger somehow while keeping this at the same size. That's the goal.——想办法把这个(计算单元)做大,同时保持那个(数据移动单元)不变。这就是目标。”

来源访谈 →

他指出插入流水线寄存器提高时钟频率存在经典权衡,因为吞吐量是每时钟周期完成的工作量与每秒时钟数的乘积,提频可能反而损害吞吐量

“It hurts your throughput, in fact, because the throughput of your chip is the product of how much you get done per clock cycle... times how many clocks you get per second.——它实际上损害了你的吞吐量,因为芯片的吞吐量是每个时钟周期完成的工作量乘以每秒的时钟数。”

来源访谈 →

当前Scaling Law无法弥合效率鸿沟,无限增加参数量也只能将所需数据减少约10倍,暗示人类智能可能遵循不同的缩放曲线。

“根据Scaling Law,即使无限增加模型参数量,也只能将所需数据量减少约10倍,远不足以弥合人类与AI之间数千甚至数百万倍的效率差距。这表明人类智能可能遵循不同的缩放曲线。”

来源访谈 →

AlphaGo是搜索、从经验中学习与自我对弈这三大智能核心要素最清晰的范例,理解它有助于洞察未来更通用AI系统的学习路径

“AlphaGo仍然是智能基本原理最清晰的实例:搜索、从经验中学习和自我对弈。”

来源访谈 →

围棋决策树过于庞大无法穷举,价值网络与策略网络通过压缩搜索的宽度和深度使问题变得可解

“围棋的决策树过于庞大,无法穷举搜索。AlphaGo通过价值网络(快速评估棋局胜率)和策略网络(推荐可能的好棋)极大地压缩了搜索的宽度和深度,使问题变得可解。”

来源访谈 →

MCTS在每个决策点都能建议严格更优的动作,为训练提供清晰监督信号,绕过了LLM策略梯度RL面临的信用分配难题

“与LLM使用的策略梯度RL不同,AlphaGo的MCTS在每个决策点都能建议一个严格更优的动作,这为训练提供了一个清晰的监督信号,有效绕过了信用分配难题。”

来源访谈 →

数据与计算预算决定架构取舍:有限条件下ResNet的局部归纳偏置优于Transformer,需要全局上下文理解时Transformer潜力更大

“在数据和计算有限的实验中,ResNet的局部归纳偏置使其表现优于Transformer。但随着对全局上下文理解需求的增加(如大规模棋盘、不完全信息游戏),Transformer的潜力更大。”

来源访谈 →

池side认为当前配方下1-2万张GB300就能训练出媲美前沿的模型,但下一代前沿模型所需集群规模将再大一个数量级以上,递归自我改进将使物理算力需求前所未有地凸显。

“在当前模型配方下,使用1-2万张GB300就能训练出媲美当前前沿的模型。但下一代前沿模型所需的集群规模,将比这个数字再大一个数量级以上。”

来源访谈 →

Brown认为AI虽已能解决复杂问题,但要像爱因斯坦一样在没有实验数据指引下、纯粹从第一性原理出发重建革命性理论仍是巨大挑战

“虽然AI已能解决复杂问题,但要让AI像爱因斯坦一样,在没有实验数据指引下,纯粹从第一性原理出发重新构建像广义相对论这样革命性的理论,仍然是一个巨大挑战,这涉及到科学发现中最深刻的创造力和直觉部分。”

来源访谈 →

Wayfinder的核心是一个编排器:接管规划会话,将其拆分为研究、原型等多个线程并最终整合结果,让人类规划时不再束手束脚。

“该技能的核心设想是提供一个“编排器”。它能接管规划会话,将其拆分为多个线程(如研究、原型开发),并最终整合结果,让人类在规划时不再感到束手束脚。”

来源访谈 →

认为定义问题的能力比提问和解决问题的能力更重要

“定义问题的能力大于提问问题的能力,大于解决问题的能力。”

来源访谈 →

参数量单独讨论已失去意义,必须结合数据量、计算投入和部署运行条件一起衡量

“Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions.(参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。)”

来源访谈 →

记忆靠更多参数存储知识,而推理能力的提升依赖高质量后训练数据和有效深度,不再是简单堆参数

“记忆倾向于需要更多参数来存储知识;而推理则更依赖于高质量的后训练数据和有效深度”

来源访谈 →

GLM-5.3相比前代架构并无根本改变,性能飞跃完全来自长周期高复杂度环境中的强化学习

“在基础模型架构上并无根本改变,其显著性能提升完全源于在长周期、高复杂度环境中的强化学习(RL)”

来源访谈 →

模型扩展应看五个关键维度,除参数量外还包括数据、计算、部署条件以及MoE稀疏度

“提出了模型扩展的五个关键维度,除了传统的参数量,还包括数据、计算、部署条件等。他特别提到了混合专家模型(MoE)的稀疏度,并引入了新的“XA-YB”表示法来规范描述”

来源访谈 →

一旦跨过知识容量阈值,长程推理等高级技能与总参数量关系不大,更多取决于训练质量和推理时的计算分配

“Advanced skills... require carrying long causal chains (20+ inference steps) without losing the thread. This ability does not live in total parameter count once a certain knowledge-holding threshold is reached.(高级技能……需要在不偏离主线的情况下进行长达20步以上的长因果链推理。一旦模型达到某个知识容量阈值,这种能力就不再体现在总参数量中了。)”

来源访谈 →

连续物理系统模拟所需的分辨率会把上下文长度推到数千亿甚至万亿级别,远超现有Transformer的处理能力。

“"If each dimension is even a few hundred grid points... we're talking hundreds of billions to even a trillion context length." —— 如果每个维度哪怕只有几百个网格点……我们谈论的是数千亿甚至万亿级别的上下文长度。”

来源访谈 →

神经算子将数据与物理定律结合、直接对函数而非网格建模,在保留深度学习有效做法的同时使其更有原则性。

“"All of the things that work with deep learning, let's take them, but make them a bit more principled." —— 深度学习中所有有效的部分,让我们都拿来,但让它们更有原则性一些。”

来源访谈 →

融入物理结构能提升模型稳定性:直接在网格上做全球天气预测会很快失效,而基于球面谐波自然基函数的Fourier Neural Operator可保持长期稳定。

“以全球天气预测为例,直接在网格上建模会很快失效,而利用球面谐波这一自然基函数的Fourier Neural Operator(如FourCastNet)则能保持稳定,实现长期预测。”

来源访谈 →

构建通用物理基础模型不是抛弃扩展思路,而是另辟一条路:靠嵌入物理世界固有的结构,而非等待永远无法满足的海量数据。

“这并非要抛弃扩展思路,而是开辟一条不同的道路:通过构建物理世界固有的结构来达成目标,而非等待永远无法满足的海量数据。这是通往覆盖多种现象、兼具模拟与设计能力的物理基础模型的起点。”

来源访谈 →

模型智能与算力需求之间存在非线性正反馈循环,使算力需求以超线性速度增长从而推高价格

“当模型变得更智能时,它能够设计出更高效的训练算法和架构,但这反过来又会提出更高的算力需求。这种循环会导致对算力的需求以超线性的速度增长,从而推高其价格”

来源访谈 →

智能提升的本质是算力密度增加:更大参数规模、更复杂训练和更长推理时间都直接提升算力单价

“更聪明的模型往往意味着更大的参数规模、更复杂的训练过程或更长的推理时间。这些都需要单位时间内消耗更多的计算资源,直接提升了算力的单价”

来源访谈 →

能源供应及半导体制造、冷却系统等硬件供应链的物理限制,将成为算力成本上升的硬约束

“算力需求的激增不仅挑战着能源供应,也考验着半导体制造、冷却系统等整个硬件供应链的承载能力,这些物理限制将成为成本上升的硬约束”

来源访谈 →

若算力成本真的飙升10倍,大规模自动化、个人AI助手等低成本推理应用的经济可行性将受严峻考验,行业必须寻找新的价值创造模式

“如果算力成本真的飙升10倍,那么当前许多基于低成本推理的应用场景(如大规模自动化、个人AI助手)的经济可行性将受到严峻考验,行业必须寻找新的价值创造模式”

来源访谈 →

Raibert主张先攻克最动态最困难的运动控制(如奔跑、空翻),再回头解决相对简单的行走问题,以更快逼近问题本质

“You have to run before you can walk. —— 你得先学会跑,才能学会走。”

来源访谈 →

元宇宙的目标不是让人花更多时间在计算上而是让计算更自然,且要成为主流计算平台必须在编程、会议等日常任务上提供至少5%以上的效率提升。

“The goal isn't to have people spend a lot more time in computing, it's to make computing more natural.——目标不是让人们花更多时间在计算上,而是让计算变得更自然。”

来源访谈 →

价值对齐是从基因演化延续到公司治理与AI的根本问题,关键在于为强大的造物持续建立正确的激励与制衡机制。

“一切都在于建立正确的激励机制。(英文原话:It's all about putting the right incentives in place.)”

来源访谈 →

当下信息生态急剧恶化的新变量是机器学习与宣传的结合,平台算法为最大化停留时间而推送引发愤怒的内容,制造大规模信息茧房。

“机器学习与宣传手段相遇。这是新情况,也是情况急剧恶化的原因。(英文原话:Machine learning meets propaganda. That's what's new, that's why this has gotten so much worse.)”

来源访谈 →

他认为元学习(学会如何学习)是拥有记忆并经强化学习训练的系统自然涌现的现象,无需显式编程。

“在具备记忆(如循环网络或槽式记忆)并经过强化学习训练的系统中,元学习(学会如何学习)是一种自然涌现的现象,无需显式编程。”

来源访谈 →

现在锁定AI安全监管框架是错误的,持续学习模式下不存在明确的部署前节点,应改为定期(如月度或季度)的风险审查

“现在锁定AI安全监管框架是一个错误。(Locking in AI safety regulation now is a mistake.)”

来源访谈 →

对齐研究必须从固定权重场景彻底转向:防止AI在持续更新中演变为欺骗性或恶意人格、防止用户注入后门将成为全新核心挑战

“在权重持续更新的场景下,如何保证AI不被越狱、不演变为欺骗性或恶意人格,以及如何防止用户通过交互向基础模型注入后门,将成为全新的核心挑战。”

来源访谈 →

部署即训练会形成强者愈强的飞轮效应,实验室将被迫更早推出最聪明的模型以抢占学习先机

“当部署即训练,拥有最佳模型的实验室会获得更多用户、更复杂的任务和更高质量的反馈,从而加速模型进化。”

来源访谈 →

持续学习通过巨大切换成本将用户与模型深度绑定,为领先AI实验室建立类似云服务商的强护城河和高利润率

“一旦模型通过持续学习与用户深度绑定,切换AI就如同解雇一位熟悉公司情况数月的老员工并重新培训新人,成本巨大。”

来源访谈 →

模型越智能,同等数量算力的经济变现能力越强,这是算力价格将大幅上涨的关键驱动力。

““随着AI模型变得更智能,它们将能更好地变现同等数量的算力。”("As AI models become smarter, they'll better monetize the same amount of compute.")”

来源访谈 →

实验室赚取推理收入的核心意义不是盈利本身,而是说服投资者提供更多资金去购买算力、训练更大的模型。

““推理收入的意义在于说服投资者给你更多钱,去买更多算力来训练更大的模型。”("The point of inference revenue is to convince investors to give you more money to buy more compute to train bigger models.")”

来源访谈 →

算力价格高涨将通过阿尔钦-艾伦效应放大低效模型的浪费,使训练出最高效模型的实验室可收取极高溢价,拉大与追随者的差距、提升市场集中度。

“根据阿尔钦-艾伦效应,当算力成本高昂时,使用低效模型的“浪费”会更显著。这使得能训练出最高效模型的实验室可以收取极高溢价,从而拉大与追随者的差距,导致市场集中度提升。”

来源访谈 →

算力变贵后,目前依赖低价计算的低价值应用(如低质量短视频生成)将因经济性不足被市场淘汰,算力将优先流向高经济价值任务。

“当算力变得昂贵,目前依赖低价计算资源的应用(如低质量短视频生成)将因经济性不足而被市场淘汰。算力将优先用于能产生更高经济价值的任务。”

来源访谈 →

实验室本不愿增加推理算力占比以免更像云服务商而非前沿模型训练者,但推理收入增长快于训练算力投入,迫使它们分配更多资源服务现有模型以维持现金流。

“增加推理算力占比意味着实验室更像云服务商,而非前沿模型训练者,这与它们的雄心相悖。然而,推理收入增长快于训练算力投入,迫使它们必须分配更多资源来服务现有模型以维持现金流。”

来源访谈 →

框架能力正通过训练被吸收进模型权重,形成“训练-吸收-精简”循环,删除与吸收过程结束后剩下的是权限、身份、信任等以人类为中心的能力

““模型权重接下来会吸收什么?……在这个删除和吸收过程结束后,剩下的是以人类为中心的智能体能力。比如权限、身份、信任和可解释性。”"What do the model weights absorb next? ... What's left at the end of this deletion and absorption process are the human-centric agent capabilities. Things like permissions, identity, trust and legability."”

来源访谈 →

在模型和算力变得丰裕之后,团队同步的人类注意力成为唯一根本稀缺的资源,新挑战将从“如何让模型工作”转向“如何让人类高效监督和指导模型工作”

““唯一真正稀缺的东西,是我团队同步的人类注意力。”"The only fundamentally scarce thing is the synchronous human attention of my team."”

来源访谈 →

智能体开发领域连React级别的底层组合与状态管理范式都还没出现,先造这一基础层比直接做上层框架更重要

“我最初发推说我们在构建智能体的Astro或Next.js。但后来我意识到:也许根本还没人构建智能体的React。 —— I originally tweeted that we were building the Astro for agents or the Next.js for agents. But then I realized: maybe no one has even built the React for agents.”

来源访谈 →

智能体不应由开发者写脚本去驱动LLM,而应放入运行环境(Harness)让它自主驱动、自行解决问题

“不是你和你的代码去驱动大语言模型、用脚本告诉它该做什么,而是你将智能体放入这个运行环境中,让它能够自主驱动并解决问题。 —— Instead of you and your code driving the LLM and telling it what to do with scripts, you're putting the agent into this harness, and it is able to drive itself and work through problems.”

来源访谈 →

她以DeepMind的Atari游戏程序为例,指出强化学习虽能掌握游戏却未形成真正的概念模型,因此无法适应环境的微小变化

“虽然它能通过强化学习掌握游戏,但并未学到人类意义上的'球拍'或'球'的概念,因此无法适应微小的环境变化(如移动球拍)。”

来源访谈 →

针对推理模型隐藏思维链的加密防线已被首次大规模攻破:加密推理过程可被解码、跨模型/会话/用户移植,并能显著提升开源模型性能。

“我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。”

来源访谈 →

攻击具有可操作性和普遍性:将合法的加密签名推理块重放至同一提供商的较弱模型并引导其转录,对Claude、GPT、Gemini均有具体模板。

“获取合法的加密签名推理块,将其重放至同一提供商的较弱模型(如将Claude的推理块重放至Haiku 4.5),并通过提示或预填充引导该模型转录附带的推理内容。该方法针对Claude、GPT和Gemini等主流模型给出了具体模板,表明其普遍适用性。”

来源访谈 →

依赖隐藏思维链进行对齐监控或安全审计并不可靠,实验室需在沙盒、遥测和工具界面等方面建立更强的保障机制。

“此次事件进一步证明,依赖隐藏的思维链进行对齐监控或安全审计是不可靠的。”

来源访谈 →

解码提取的推理过程是真实的隐藏思维,而非伪造内容:其推理令牌计数与计费的API思考令牌在大多数查询上1:1匹配。

“我们验证了对于大多数查询的提示,我们的推理令牌计数与计费的API思考令牌1:1匹配。”

来源访谈 →

《伦理算法》一书刻意只处理当前已能置于量化基础的算法伦理部分,而非泛谈全部伦理问题

“Our book is about that part of algorithmic ethics that we know how to put on that same kind of quantitative footing right now. —— 我们的书聚焦于算法伦理中,我们目前能够将其置于类似量化基础之上的那部分。”

来源访谈 →

作为机器学习研究者,他认为对平台问题无能为力的说法不可信:知道如何优化某目标,本身就说明了如何不这样优化或另做他事

“The idea that there's nothing to do about it, that strikes me as implausible as a machine learning person. Anytime you know how to optimize for something, almost by definition, that solution tells you how not to optimize for it or to do something different. —— 作为一个机器学习研究者,我认为'对此无能为力'的说法令人难以置信。几乎可以肯定”

来源访谈 →

专业知识反而可能成为思想枷锁,庞加莱因“知道得太多”而错失相对论,爱因斯坦是通过“减法”完成突破的。

“庞加莱“知道得太多”,专业知识反而成为思想枷锁,爱因斯坦通过“减法”完成了突破。”

来源访谈 →

科学家面对反常时无法预先判断该修补旧理论还是放弃,这类选择没有统一算法,判定科学进展不存在集中式的权威或方法论。

“没有集中式的权威或统一的方法论来判定科学进展。”

来源访谈 →

AlphaFold的成功主要归功于数十年实验积累的蛋白质数据库,AI只是整个故事的一小部分,它也不具有广义相对论那样的解释力。

“AlphaFold的成功主要归功于数十年实验积累的蛋白质数据库,AI部分是整个故事的一小部分。它不像广义相对论那样具有解释力,但可能包含许多可提取的“小解释”。”

来源访谈 →

整个计算机科学的理论体系建立在'比特不受原子约束'这一错误假设上,计算本质上受物理空间与时间的约束。

“整个计算机科学的圣典都建立在'比特不受原子约束'这一虚构之上。”

来源访谈 →

他认为《星际争霸》的核心挑战在于探索:随机尝试很难获得胜利奖励,因此先用人类录像做模仿学习解决冷启动问题。

“在《星际争霸》中,随机尝试行动很难获得正向奖励(胜利)。AlphaStar通过利用人类录像数据进行模仿学习来解决早期探索难题,避免了智能体在随机尝试中一无所获。”

来源访谈 →

Vinyals认为AlphaStar的核心是把观察与行动的序列建模为预测下一步的问题,与机器翻译在本质上完全相同。

“问题完全相同。你本质上是在将一个由观察和行动组成的前缀,翻译成接下来将发生什么——这与训练模型进行翻译或生成语言完全一致。(The problem is exactly the same. You're translating essentially a prefix of observations and actions onto what's going to happen next, which is exactly how you would train a model to translate or to generate language.)”

来源访谈 →

上下文学习若足够强大,可把新员工约6个月才能掌握的经验压缩进上下文窗口,从而无需将部署所学蒸馏回权重。

“如果上下文学习能力足够强大,就能将新员工入职6个月才能掌握的经验压缩进上下文窗口,而无需将部署中学到的知识蒸馏回权重。”

来源访谈 →

计算机使用进展缓慢,是因为领域仅可验证还不够,还须能在确定性可重放的模拟器里大量并行“研磨”,而克隆常用应用目前费力且不可扩展。

“一个领域仅可验证还不够,还必须可“研磨”——能在确定性可重放的模拟器中进行大量并行演练。亚马逊不会允许你派一千个agent同时测试结账流程,而克隆常用应用在目前仍费力且不可扩展。”

来源访谈 →

现实世界多数领域的数据独特而稀疏、无法构建确定性模拟器,因此样本效率是模型达到精通水平、RLVR实现泛化的根本瓶颈。

“由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。”

来源访谈 →

在线策略自蒸馏(OPSD)让基础模型模仿积累了上下文经验的教师模型,可将会话所学蒸馏回权重,不需要外部可验证奖励且监督信号比朴素RL更密集。

“在线策略自蒸馏(OPSD)通过让基础模型模仿积累了上下文经验的“教师模型”的预测,将会话所学蒸馏回权重。它不需要外部可验证奖励,且比朴素RL提供更密集的监督信号。”

来源访谈 →

未来LLM可能构建现实模拟并在其中无限排练技能,以更少真实数据换取海量模拟体验,成为预训练、RL、推理时计算之后的第四扩展轴。

“未来LLM可能构建现实模拟并在其中无限排练技能,从真实数据中消耗更少却获得海量模拟体验。若实现,这将成为继预训练、RL、推理时计算后的第四扩展轴。”

来源访谈 →

模型越智能对攻击的抵抗力越强,但被利用后可造成的损害也越大,安全挑战随模型智能同步升级。

“模型越智能,对攻击的抵抗力越强,但可能造成的损害也越大。”

来源访谈 →

算法主导的深度学习并非唯一路径,符号处理领域仍是待开发的“处女地”,当前主流范式未必是终极答案。

“她惊讶于深度学习等算法成为主流,并认为符号处理领域仍是待开发的“处女地”。”

来源访谈 →

批处理规模是决定推理成本与延迟的最大变量,最优批大小约等于300乘以模型稀疏度,与模型绝对规模无关。

“若不进行批处理,单用户推理的经济性会比批处理差约千倍;而批处理大小的最优值约等于300乘以模型稀疏度,与模型绝对规模无关,实践中通常取该值的2-3倍。”

来源访谈 →

单次推理存在由硬件决定的延迟下限,因为必须把全部模型权重从内存读入芯片,这一时间无法绕过。

“单次推理存在延迟下限,由硬件决定:必须将全部模型权重从内存读入芯片,这一内存搬运时间无法绕过。典型GPU集群的HBM容量除以带宽约为15-20毫秒。”

来源访谈 →

稀疏专家模型虽能大幅降低计算量,但增加内存容量与通信开销,扩大64倍总参数仅等效于4倍活跃参数的质量提升,并非免费午餐。

“经验数据显示,将总参数扩大64倍仅能等效于4倍活跃参数的模型质量提升,因此稀疏化并非免费午餐。”

来源访谈 →

流水线并行只能解决模型权重的容量问题,带宽问题必须靠扩大机架内scale-up互联规模来解决。

“Pipelining totally solves the capacity problem, but scale up size helps solve the bandwidth problem. —— 流水线并行完全解决了容量问题,但扩大机架内互联规模才能解决带宽问题。”

来源访谈 →

当前最大推理与训练集群的规模受限于机架内scale-up域大小,机架内互联带宽的提升是模型规模继续增长的物理前提。

“从Hopper的8卡到Blackwell的72卡,再到Rubin的500+卡,机架内互联带宽的提升是模型规模能够继续增长的物理前提。”

来源访谈 →

流水线并行只能分摊权重内存而无法分摊KV缓存,后者随批大小线性增长,因此成为推理场景的内存瓶颈。

“流水线并行只能分摊模型权重的内存占用,却无法分摊KV缓存的内存需求。因为KV缓存随批处理大小线性增长,与流水线深度无关,这使得推理场景中KV缓存成为内存瓶颈。”

来源访谈 →

模型上下文长度在100K-200K停滞一两年,说明这正是内存带宽与计算的合理成本平衡点,瓶颈不在算力。

“I think it's like if you look at the history of context lengths of models... they shot up from about 8K to 100K 200K and then for the last year or two they've all been hovering around there. I think that actually indicates that that's sort of the reasonably balanced cost point. —— 上下文长度从8K跃升至200K后便停”

来源访谈 →

他批评研究界为快速发表论文倾向堆数据、贴标签,深度学习模型看似弄明白了,但其理解方式与人类根本不同。

“Our tendency in order that we get an archive paper really quickly is you just show a lot of data and give the labels and hope it figures it out. But it's not figuring it out in the same way we do.(为了快速发表论文,我们倾向于展示大量数据并贴上标签,然后希望它自己弄明白。但它理解世界的方式与我们根本不同。)”

来源访谈 →

什么能够被验证、什么不能被验证,存在非常强的根本性限制。

“我的主张是,我们对什么能够被验证、什么不能被验证,存在着非常强的限制。—— my claim is again that there are very strong limits in what we can and cannot verify”

来源访谈 →

沃尔夫勒姆认为计算是形式化我们思考世界方式的广泛方法,一旦成功形式化,计算机就能帮我们推演出其后果。

“计算是形式化我们思考世界方式的一种非常广泛的方式,计算的酷炫之处在于,如果我们能用计算成功地形式化事物,计算机就能帮助我们找出其后果。"Computation is this very broad way of sort of formalizing the way we think about the world and the thing that's that's cool about computation is if we can successfully formalize things in terms of computation computers can help us f”

来源访谈 →

优秀的理论本质上是对海量观测数据的高效压缩

“一个理论就是对宇宙的压缩。”

来源访谈 →

某些数学问题的复杂度会迅速增长,无法靠直接暴力计算解决

“某些数学问题会迅速变得难以通过直接暴力计算来解决。”

来源访谈 →

皮查伊认为应对竞争压力要屏蔽噪音关注信号,而只要统一组织的激励机制并聚焦使命,几乎可以实现任何事情,例如合并DeepMind与Brain团队。

“如果你能统一组织的激励机制,你几乎可以实现任何事情。”

来源访谈 →

艾萨克森认为马斯克坚持从物理学第一性原理思考(如自动驾驶坚持纯视觉方案),并追求“制造机器的机器”的端到端制造掌控,这是他实现快速创新的基础。

“马斯克坚持从物理学第一性原理出发思考问题(如自动驾驶坚持纯视觉方案)。同时,他追求“制造机器的机器”的端到端掌控,从设计到生产线一体化”

来源访谈 →

为机器设计目标函数是延续千年的古老问题而非AI新挑战,人类社会早已通过法律这种代码来约束行为,计算机科学与立法科学终将汇合。

“我们已经制定了数千年的法律,而这(设计目标函数)正是它在做的事。We've been writing laws for millennia, and that's exactly what it is.”

来源访谈 →

巨大的神经网络仅靠相对少量的数据和随机梯度下降就能有效学习,彻底颠覆了传统机器学习教科书关于参数数量、样本量与非凸优化的所有警告。

“机器学习本质上是一门关于"粗糙"的科学。Machine learning is the science of sloppiness really.”

来源访谈 →

当前强化学习和纯监督学习效率低下,源于缺乏对世界运作的直觉模型;自监督学习通过预测视频帧、填补文本缺失让模型掌握世界内在规律与不确定性,是通往更智能系统的必由之路。

“我们拥有对世界的预测模型,其中包括在不确定性下进行预测的能力。We have predictive models of the world that include the ability to predict under uncertainty.”

来源访谈 →

当前循环神经网络在数百个时间步后性能显著下降,而人脑能对跨越任意长时间的事件做信用分配,这得益于大脑高效且有针对性的遗忘机制以及意识与情感对信息存取的作用。

“当前的循环神经网络在处理数百个时间步后性能会显著下降,而人类能够对跨越任意长时间的事件进行信用分配。”

来源访谈 →

生物神经网络仍存在大量未知,理解这些奥秘可能正是改进人工神经网络的关键所在。

“关于生物神经网络,我们有太多未知,这既神秘又迷人,因为这或许是改进我们人工神经网络的关键所在。”

来源访谈 →

在海量数据上训练的神经网络只获得了非常基础、底层的理解,既不鲁棒也远不及人类理解的抽象性与通用性,因此训练方式需要根本性变革,更关注因果解释而非仅仅关联数据。

“在海量数据上训练的神经网络仅获得了非常基础、底层的理解,远不及人类理解的抽象性与通用性。”

来源访谈 →

语言学习与语言所指世界的视觉学习目前是割裂的,应将二者结合、相互促进,让语言输入指导神经网络学习更高层的语义概念,从而建立良好的世界模型。

“我认为我们需要更好地将语言学习与语言所指的世界学习结合起来,让二者能够相互促进。”

来源访谈 →

突破深度学习根本局限的关键在于设计新的训练目标与框架,让智能体从被动观察数据转向主动干预和探索以学习因果,而非单纯把网络层数从百层增加到万层。

“我认为关键在于训练目标和训练框架...要从被动观察数据转变为通过干预世界来学习的主动智能体。”

来源访谈 →

解耦不应止于让表征空间中的因果变量彼此独立,还要把关联这些变量的规则或机制也解耦开来,从而赋予模型更强的组合泛化能力、避免灾难性遗忘并适应分布变化。

“不仅要让表征空间中的因果变量彼此独立,更要将关联这些变量的“规则”或“机制”也解耦开来。”

来源访谈 →

Lattner 主张语言应支持一路深入到底层硬件去追求极致性能,甚至质疑在语言里内建整数类型的必要性。

“如果你想打造一个超快的东西,我可以一路深入到硬件层面。那为什么我还需要在语言里内建整数类型呢?”

来源访谈 →

感知与认知不可分割,有效的视觉模型不应只服务于分类,而应支持想象、操纵物体等自上而下的可控认知能力

“有效的视觉模型不应只服务于分类,而应能支持认知需求,例如在脑海中想象或操纵物体”

来源访谈 →

RCN在前馈结构基础上增加反馈与侧向连接,核心优势是能进行动态推理,而非像传统神经网络那样依赖训练时的摊销推理

“其核心优势在于能够进行动态推理,而非像传统神经网络那样依赖训练时的“摊销推理””

来源访谈 →

验证码是检验人类级泛化能力的理想基准,当前深度学习无法做到五岁孩子那样的零样本泛化,而破解验证码需要将局部证据置于全局上下文推理

“验证码设计初衷就是对人易、对机器难。一个五岁的孩子可以无需针对特定风格的训练就解决新的验证码,而当前的深度学习系统无法做到这种零样本泛化”

来源访谈 →

强化学习的本质是合成数据生成:用大量计算配合验证器筛选出好数据,再让模型像预测下一个词那样学习这些正确轨迹。

“强化学习本质是合成数据生成:通过大量计算配合验证器,筛选出"好数据",再像预测下一个词那样训练模型学习这些正确轨迹。”

来源访谈 →

避免在不必要的大模型调用上浪费资源是Glean的重要目标,简单任务应使用更便宜的工具。

“Glean的一个重要目标是避免在不需要的任务上使用大语言模型。”

来源访谈 →

硬件切分方式与模型架构天然匹配,并行策略应由物理拓扑直接塑造:专家并行利用机架内互连,流水线并行将不同层分布到不同机架。

“(硬件)切分方式与模型架构相匹配。(英文原话:The cutting matches the model architecture.)”

来源访谈 →

仅靠少数公式与简化的Roofline性能模型,就能推断出各大实验室正在做的很多工程选择。

“仅凭几个公式和一块黑板,我们竟能推断出实验室正在做的很多事情,这令人震惊。(英文原话:It's shocking how much you can deduce about what the labs are doing from a handful of equations and a blackboard)”

来源访谈 →

马斯克认为人类无法战胜数字智能只能选择加入,Neuralink正是为了保住这个加入的选项。

“如果你无法战胜它们,就加入它们。而如果Neuralink不存在,我们将没有这个选项。(英文原话:If you can't beat them, join them. And we won't have that option [if Neuralink doesn't exist].)”

来源访谈 →

马斯克认为实现完全自动驾驶最难的一环是在向量空间中建立对物理对象的精确表征。

“最难的事情是在向量空间中建立对物理对象的精确表征。(英文原话:The hardest thing is having an accurate representation of the physical objects in vector space.)”

来源访谈 →

他质疑模型能力提升的本质究竟是更复杂的数据输入(如强化学习环境)还是模型样本效率的根本突破,这对判断深度学习在机器人学等需要高样本效率领域的进展速度至关重要。

“模型是否变得更样本高效了……还是我们仅仅改变、扩展或改进了数据输入?(英文原话:Are models even getting more sample efficient... or have we just changed/expanded/improved the data input?)”

来源访谈 →

他认为训练与推理在极限情况下理论上应融合,未来模型可能通过“在职学习”在执行实际任务的同时进行学习,以突破仅靠人造训练环境带来的增长瓶颈。

“未来,模型可能通过"在职学习"——在执行实际任务的同时进行学习——来突破仅靠人造训练环境带来的增长瓶颈。”

来源访谈 →

一个领域仅可验证不足以让RLVR快速进展,还必须“可重复刷”——能大规模并行、确定性复现地创建训练环境。

“It is not enough for a domain to be verifiable. It also has to be very grindable. —— 一个领域光是可验证还不够,它还必须非常“可重复刷”。”

来源访谈 →

实验室约30-50%算力用于推理,但产生的“在职经验”未回馈给模型权重,是极大浪费,而部署中的真实互动信息才是最宝贵的学习素材。

“目前,约30-50%的AI实验室算力用于推理,但这些算力产生的“在职经验”并未有效回馈给模型权重,这是极大的浪费。部署中产生的真实世界信息(模型如何被使用、犯了什么错)恰恰是最宝贵的学习素材。”

来源访谈 →

AI要发展出人类的所有技能,必须能从稀缺的现实世界互动中揭示的非结构化、不可验证且模糊的信息中学习。

“If AIs are to develop all the skills that humans have... they need to be able to learn from information revealed in unstructured, unverifiable, and ambiguous ways from scarce amounts of real world interaction. —— 如果AI要发展出人类的所有技能……它们需要能够从稀缺的现实世界互动中揭示的、非结构化、不可验证且模糊的信息中学习。”

来源访谈 →

提出在线策略自蒸馏(OPSD)作为无需外部验证奖励的持续学习方法:让基础模型模仿长会话中积累丰富上下文的“资深”模型,比SFT更优。

“让基础模型去模仿那个在长会话中积累了丰富上下文的“资深”模型所做出的预测。这比监督微调(SFT)更优,因为它只提取达到正确结果所必需的知识,避免了死记硬背整个会话记录。”

来源访谈 →

Tedrake认为数学化的控制理论能为看似复杂混乱的问题带来思维清晰度,这种影响对他个人非常大,其价值被普遍低估。

“一些更数学化的控制理论能够为看似非常复杂、混乱的问题带来的思维清晰度……这对我影响真的很大。”

来源访谈 →

Michael Li认为AI实验室靠API提供基础模型服务可能永远无法收回训练成本,应像香港地铁靠车站周边地产盈利那样,捕获发生在模型“周围”的价值增值

“The labs that survive won't be the ones that make the API profitable. They'll be the ones that identify their property above the station and build toward it now. —— 能存活下来的实验室不会是那些让API盈利的。而是那些能识别出自己“车站上方的物业”并立即着手建设的实验室。”

来源访谈 →

AI已把产生想法和假设的成本降到几乎为零,但低成本产出不自动创造价值,科学的新瓶颈在于从海量自动生成的理论中筛选出真正有效的部分

“AI基本上已经把产生想法的成本降到了几乎为零。(AI has basically driven the cost of idea generation down to almost zero.)”

来源访谈 →

验证环节无法大规模自动化是当前最大障碍,每天生成上千个新理论的速度远超现有同行评议体系所能支撑的验证速度

“传统科学通过少数科学家讨论数年达成共识,但现在每天能生成上千个新理论,现有体系无法支撑这样的验证速度。”

来源访谈 →

对数学策略的半形式化语言是未来重要方向,现有工具能形式化证明本身,但缺乏形式化策略、猜想可信度与部分进展价值的框架,AI难以参与最富创造性的研究环节

“Lean等工具已能形式化证明本身,但如何形式化“策略”、“猜想的可信度”、“部分进展的价值”仍是未知。缺乏这种框架,AI难以真正参与数学研究中最富创造性的环节。”

来源访谈 →

前沿模型安全水平差距显著:GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞,且发现成本不到300美元。

“GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞。发现这些漏洞的API成本不到300美元,多数攻击者都负担得起。”

来源访谈 →

Karpathy认为神经网络本质上只是带有可调权重旋钮的复杂数学表达式,不应过度赋予人脑类比的意义。

“它真的只是一个带有旋钮的复杂数学表达式,而这些旋钮需要适当的设置才能让它执行你想要的任务。"It's really just a complicated mathematical expression with knobs and those knobs need a proper setting for it to do something desirable."”

来源访谈 →

用户会持续使用某个模型直到它出问题,然后才去探索其他选项,这和大家使用任何工具的方式一样

“使用模型直到它出问题,然后你就去探索其他选项。这和我们使用任何工具的方式一样。”

来源访谈 →

至少75家Neo Labs中约三分之二将一文不值或仅以人才收购方式被廉价收购,仅靠发布模型已不够,必须证明有可持续收入

“There's at least 75 Neolabs for sure. Like 2/3 of those are going to be worth nothing. —— “至少确定有75家Neo Labs,其中大约三分之二将一文不值。””

来源访谈 →

个体行为高度重复,用简单计数统计即可高精度预测人的下一步行为

“任何个体都具有惊人的可预测性,因为你总是在重复做同样的事情。(“Any given individual is remarkably predictable. Because you keep doing the same things over and over again.”)”

来源访谈 →

计算学科的独特世界观在于认识到模型、语言和机器三者是等价的

“区分计算科学家的特质是...他理解模型、语言和机器是等价的,它们是同一回事。(“The thing that distinguishes the computationalist... is that he or she understands that models, languages, and machines are equivalent. They're the same thing.”)”

来源访谈 →

机器学习不只是应用统计学的计算方法,把它完全归入统计学并不那么有用

“化学只是物理学,但我认为将化学仅仅视为物理学并不那么有用。(Chemistry is just physics, but I don't think it's as useful to think about chemistry as being just physics.)”

来源访谈 →

所有编程工作都将流经大模型,这要求全新的编程环境和编程方式,而非孤立的插件式解决方案。

“我们感觉这不仅仅是一个孤立的解决方案,而是所有的编程工作都将通过这些模型进行。这要求一种全新的编程环境和一种全新的编程方式。(英文原话:"It felt like this wasn't just going to be a point solution thing, this was going to be all of programming was going to flow through these models. It felt like that demanded a different type of programming environment, a different t”

来源访谈 →

Cursor Tab 的目标是消除编辑器内所有低信息熵操作,在操作可被确定后直接让开发者在时间上向前跳跃。

“Cursor Tab的目标是:消除你在编辑器内进行的所有低信息熵操作。然后,当它被有效确定时,就让你在时间上向前跳跃。(英文原话:"The goal of Cursor Tab is: let's eliminate all the low entropy actions you take inside of the editor. Then, when it's effectively determined, let's just jump you forward in time.")”

来源访谈 →

算力的价值将持续攀升。

“算力的价值将持续攀升。(英文原话:The value of compute is going to increase.)”

来源访谈 →

算力供给弹性极低,年度3倍增长中靠挤占手机PC晶圆份额贡献的1.8倍明年将触顶。

“算力供给弹性极低:年度3倍增长中,1.4倍来自摩尔定律、1.2倍来自新晶圆厂、1.8倍来自挤占手机PC晶圆份额,后者明年将触顶。”

来源访谈 →

她认为机器学习领域整体仍处于开发稳健、可泛化方法的非常早期阶段,对抗样本等攻击暴露了现有系统的脆弱性

“我们仍处于开发稳健且可泛化的机器学习方法的非常早期阶段。”

来源访谈 →

提出自然可建模性假说:经演化或物理过程筛选塑造的自然系统蕴含结构,原则上可被神经网络等经典学习算法高效发现和建模,这是AlphaFold等项目的理论基础。

“任何能被演化出来的模式,大概率都能被经典学习算法高效地发现和建模。”

来源访谈 →

认为Veo等视频模型在模拟流体、材质、光照上的惊人准确性,说明模型可能通过海量视频数据逆向工程出世界运行的底层规律,获得类似人类儿童的直觉物理理解。

“如果Veo视频模型能生成一段令人信服的、符合物理规律的八秒视频,这本身就是一种对世界动态的'理解'形式。”

来源访谈 →

2028-2029年算力扩张的最终瓶颈是ASML的EUV光刻机产能,扩产幅度远跟不上每吉瓦算力约3.5台的消耗速度。

“到2028-2029年,算力扩张的最终瓶颈将落在ASML的EUV光刻机上。目前每年约生产70台,即便激进扩产到2030年也仅约100台,而每新增1吉瓦算力就需要约3.5台EUV光刻机。”

来源访谈 →

电力并非真正的长期瓶颈,多种发电与储能方案5年内可提供数百吉瓦新增容量,供给约束远小于芯片制造。

“电力并非真正的长期瓶颈。除燃气轮机外,航空衍生发动机、船用发动机、往复式发动机、燃料电池及“峰谷储能”策略均可在5年内提供数百吉瓦新增容量,总供给远大于芯片制造带来的约束。”

来源访谈 →

尽管可以读取GPT模型的每个参数,我们对模型内部运作的理解远不如对人脑的理解,需要大量跨学科研究、可能数十年才有进展

“A blank map does not correspond to a blank territory.——空白的地图不等于空白的疆域。(意指我们不理解内部运作,不代表内部没有运作。)”

来源访谈 →

通过RLHF对齐模型后,模型原本较好的概率校准能力会退化,变得像人类一样不擅长精确的概率判断,这是缺陷而非特性

“缺陷,而非特性”

来源访谈 →

马斯克认为人类语言交流的有效比特率极低(全天不到1比特/秒),高度有损的压缩解压过程构成信息传递的根本瓶颈

“人类全天通信的“有效比特率”不到1比特/秒。这是一个高度有损的压缩与解压过程。”

来源访谈 →

除中国外全球电力产出近乎持平而芯片算力呈指数增长,大规模集群供电将成硬约束,芯片堆积无法通电的情况可能在今年年底出现

“除中国外,全球电力产出近乎持平,而芯片算力呈指数增长,大规模集群的供电将成硬约束,芯片堆积无法通电的情况可能在今年年底出现。”

来源访谈 →

新GPU可在发射前于地面充分老化测试,通过初期调试周期后可靠性足以支撑太空长期运行

“新GPU存在早期失效率,但可在发射前于地面充分老化测试;一旦通过初期调试周期,其可靠性足以支撑太空长期运行。”

来源访谈 →

AlphaGo的核心理念是用神经网络把超大规模搜索问题压缩为可处理的规模,而非直接穷举博弈树。

“AlphaGo的核心理念是利用神经网络将大规模搜索问题压缩为可处理的规模。围棋博弈树规模远超宇宙原子数量,但通过深度神经网络对局面进行快速价值评估和落子概率预测,可大幅削减搜索的深度与广度。”

来源访谈 →

MCTS并非直接优化胜率,而是为每个已执行动作生成更优的替代标签,输出比初始策略网络更尖锐的落子概率分布。

“蒙特卡洛树搜索(MCTS)并非试图直接优化胜率,而是为每个已执行的动作提供更优的替代标签。算法通过选择、扩展、评估和回溯四步迭代,最终输出比初始策略网络更尖锐的落子概率分布。”

来源访谈 →

相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。

“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”

来源访谈 →

把搜索成果蒸馏回策略网络,可将1000步搜索摊销进前向传播,实现测试时计算与训练时计算的相互替代。

“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。(It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.)”

来源访谈 →

从零训练AlphaGo的关键是先获得可靠的价值函数,再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。

“从零训练AlphaGo的关键是先获得可靠的价值函数。初期可使用专家棋谱或小型棋盘随机对弈预训练,待终局价值判断准确后再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。”

来源访谈 →

非线性动力学系统虽对初始条件高度敏感,但其宏观结构(如胜率、飓风路径)仍可预测,感觉极难的问题可能被简单的宏观模拟攻克。

“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。(Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic”

来源访谈 →

随着计算能力增长放缓,AI研究的瓶颈将从算力转向数据,研究重点应从追求更大模型转向提升数据效率。

“We are going to move from a focus on the scale of computation to a focus on data efficiency. —— 我们将从关注计算规模转向关注数据效率。”

来源访谈 →

在国际象棋这类封闭系统中机器无需破解游戏,只需靠更少、更稳定的失误就能胜出

“Machines will prevail simply because they will bring down the number of mistakes.(机器终将获胜,仅仅因为它们能将犯错的概率降至最低。)”

来源访谈 →

Sutskever认为深度学习革命的关键想法早已存在,真正缺失的是海量监督数据、足够算力,以及坚信将现有技术与两者结合就能成功的信念,AlexNet为此提供了无可辩驳的证据。

“将现有技术与海量数据和算力结合就能成功”

来源访谈 →

公司架构应像计算机一样被设计以产出特定成果,为此他直接管理多达60名直属员工且不进行一对一会议,让内存、光互连、散热等跨领域专家在同一问题上实时碰撞

“公司本身应是一个产出产品的“机器”,其架构必须反映所处的环境并服务于目标。”

来源访谈 →

AI研究的重心将从算法工程转向目标函数工程,设计者要在想要什么与优化器能做什么之间取得平衡

“We're going to go from being people who engineer algorithms to being people who engineer objective functions. ——我们将从编写算法的工程师,转变为设计目标函数的工程师。”

来源访谈 →

有效使用智能体编程已成为每位开发者的关键技能,需要建立对智能体工作原理的心智模型,了解其局限并灵活引导

“如今,有效使用智能体编程已成为每位开发者的关键技能。当你具备这项技能时,你对智能体的工作原理有一个良好的心智模型。”

来源访谈 →

他认为机器学习相对数学是浅层领域,更依赖爬山式累加创新而非深邃抽象,因此AI更容易通过大量可验证子任务训练获得核心研发直觉。

“我认为,相对于数学,机器学习是一个非常浅层的领域。(I think ML is a very shallow domain relative to math.)”

来源访谈 →

实验室会把算力更多分配给内部研发而非对外推理服务,因为内部使用超快AI或最佳模型产生的价值远高于外部用户。

“"The whole point is, if I'm selling tokens… I'm going to allocate it to internal and external, because the internal value I'm generating from super-fast AI or the best AI model is way more than what someone external is."——关键在于,如果我在出售代币……我会将其分配给内部和外部,因为我从超快AI或最佳AI模型中产生的内部价值,远高于外部用户所获得的价值。”

来源访谈 →

价值正从硬件供应链向模型层和最终用户转移,实验室以低成本创造高价值,但大部分价值最终被用户获取。

“实验室目前能以10-15的成本创造50-100的价值,但大部分价值最终被用户(如Jane Street、Meta)获取。”

来源访谈 →

FSDP是当前预训练默认首选策略,只有GPU数量太多时才被迫转向其他方案

“This is the go to default. And you only move on from this when having too many GPUs forces you to move on. —— 这是默认的首选方案。只有当你因为GPU数量太多而被迫做出改变时,才会转向其他方案。”

来源访谈 →

FSDP看似每层全收集通信昂贵,但优化后总通信量仅为参数量的3倍左右,只比基础数据并行多50%

“优化后的FSDP(使用减少-分散)将总通信量控制在模型参数的3倍左右,仅比基础数据并行多50%。”

来源访谈 →

事前无法预知哪个研究方向更富成效,因此需要同时对所有研究方向进行投资。

“What I'm trying to say is that ex ante, one couldn't have known which research program would be more productive. We need to invest in all of them concurrently.——我想说的是,事前无法预知哪个研究方向会更富成效。我们需要同时对它们进行投资。”

来源访谈 →

重大的概念性突破无法被轻易验证,往往要数十年甚至数世纪后才因其远超替代方案而被认可。

“Big conceptual breakthroughs cannot be easily verified. They are recognized decades or centuries later, when it turns out they were much more productive than the alternatives available.——重大的概念性突破无法被轻易验证。它们在数十年甚至数世纪后才被认可,因为事实证明它们比当时的其他替代方案更具生产力。”

来源访谈 →

GLM-5.3的能力飞跃并非来自更大规模的基础模型预训练,而是完全依靠扩展后训练

“Scaling post-training is all we did for GLM-5.3.(扩展后训练是我们为GLM-5.3所做的全部工作。)”

来源访谈 →

27B量级的开源模型正变得愈发强大和实用,已能胜任真实世界编码、办公流和智能体任务

“凭借其原生多模态、百万级上下文窗口及广泛的推理支持,被明确定位为适用于真实世界编码、办公流和智能体的专业工具。这显示27B量级模型正变得愈发强大和实用。”

来源访谈 →

不应盲目相信厂商发布的基准测试数字,评分器中的小错误就可能使得分从65%飙升至93.6%,开发者应运行自己的评估

“评分器中的小错误或可导致系统得分从65%飙升至93.6%,呼吁开发者应运行自己的评估,而非盲目相信营销数字。”

来源访谈 →

Simile的行为建模依赖三大数据支柱:深度访谈、行为观察与交易数据、随机对照试验,其中RCT数据是理解行为因果机制的关键。

“随机对照试验数据,这是理解行为背后因果机制(“为什么”)的关键,对于“如何塑造未来”至关重要。”

来源访谈 →

行为基础模型必须像普通人一样带有偏见与非理性地'犯错',这与追求超级理性的前沿大模型完全不同,后者模拟特定人群行为时准确率可能低至20%-30%。

“"The models that we are trying to create are models that are as dumb as I am. So if I make some mistakes, the model has to make the same mistake." ——我们试图创造的模型,是要和我一样‘笨’的。如果我犯了错,模型也必须犯同样的错误。”

来源访谈 →

Joon认为模拟的最高形式不是预测调查答案,而是回答'为实现目标现在需要采取哪些步骤',为决策者提供真正的路径规划能力。

“"It's not about predicting the future; it's about shaping it." ——关键不是预测未来,而是塑造未来。”

来源访谈 →

模拟整个社会仅靠提示工程不够,必须通过后训练让模型学习人类社会的'社会物理学',未来可能需要数据中心规模的算力,其解决气候变化等问题的价值使之成为必然方向。

“"Can we create a simulation of 8 billion people living on Earth?" ——我们能否创建一个模拟地球上80亿人生活的模拟器?”

来源访谈 →

基金规模越大越难创造高额回报倍数,因此基金规模必须与其投资阶段和策略相匹配

“基金规模越大,越难创造高额回报倍数,因其难以将巨额资金高效投放。因此,基金规模需与其投资策略(如早期、成长期)相匹配。”

来源访谈 →

自我对弈生成数据并把MCTS的更强策略蒸馏回策略网络,相当于把搜索的计算量预先烘焙进网络的直觉

“系统通过自我对弈生成数据,并将MCTS搜索得到的更强策略“蒸馏”回策略网络。这相当于将搜索的计算量预先“烘焙”进网络,使网络本身的“直觉”越来越强。”

来源访谈 →

LLM已能较好地自动化实验实现、运行和超参数优化等执行环节,但选择研究问题、突破研究僵局等创造性决策目前仍显不足

“LLM可以较好地自动化实验实现、运行和超参数优化等环节,但在选择研究问题、突破研究僵局等需要判断力的创造性工作上,目前仍显不足。”

来源访谈 →

借助LLM编程,过去需要DeepMind整支团队和数百万美元的研究工作,如今几千美元租用算力即可完成

“得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。”

来源访谈 →

无论是训练神经网络还是启动研究项目,都应把起点初始化到尽可能接近成功的位置,而不是从零开始

“在深度学习中,初始化就是一切。你总希望将研究项目初始化到尽可能接近成功的地方。”

来源访谈 →

创始人指出过去三年半方向正确但资本需求呈垂直增长,前沿模型训练面临资本与物理资源的双重天花板,曾因6周窗口期内未能筹到20亿美元而错失4万卡GB300集群。

“去年底,他们曾有一个6周窗口期需筹集20亿美元购买即将上线的4万卡GB300集群,但未能及时完成,从而失去了该集群。”

来源访谈 →

Eiso Kant 以模型由不到70人构建、工程和研究团队总人数不足115人为据,强调小团队也能打造前沿模型。

“不到70人构建了这个模型,加上工程和研究团队总人数也少于115人。”

来源访谈 →

自然选择并未如传统观点认为的那样在农业革命后停滞,而是在基因组数千个位点上持续发挥作用,约1000万个分析位点中约2%显示出清晰选择信号。

“自然选择无处不在,而非处于静默状态。”

来源访谈 →

复杂性状的进化受限的关键是时间而非仅是种群大小:微效多基因性状可在数百到数千年内推向新的适应性平衡点,而青铜时代全球人口增长至约5000万,消除了乳糖耐受这类需等待特定新突变的突变等待时间限制。

“进化受时间限制,而非仅受种群大小限制。”

来源访谈 →

中国的核心优势不在基础科研,而在技术规模化、产品化并让全社会深度使用的工程化能力

“我们不是最强的,但我们是用得最好的。”

来源访谈 →

哈特主张先用数学严格定义通用智能(如AIXI框架),从而得到一个可用理论工具或计算方法去分析的明确目标。

“一个关于智能的数学定义,给了我们一个目标,然后我们可以用理论工具或计算方法对其进行分析。——“A mathematical definition of intelligence gives us an objective which we can then analyze by theoretical tools or computational.””

来源访谈 →

神经科学的首要问题是研究大脑的用途,而大脑的用途就是产生行为,其余任务是揭示这些功能如何在神经机制层面实现。

“神经科学的意义在于研究大脑的用途……大脑的用途是产生行为。(The point of neuroscience is to study what the brain is for... The brain is for producing behavior.)”

来源访谈 →

他认为认知结构的形成不仅取决于架构和算法,还取决于系统所嵌入的环境结构,真实世界无尽的多样性与冗余性塑造了学习。

“真实世界充满了这种特性,即无尽的多样性与无尽的冗余性。(The real world is sort of saturated with this kind of this property, it's endless variety with endless redundancy.)”

来源访谈 →

提供个性化权重的经济学强烈有利于大型组织,个人用户将面临巨大的计算效率惩罚

“提供个性化权重的经济学强烈有利于大型组织。(The economics of serving personalized weights strongly favor big organizations.)”

来源访谈 →

模型训练的一次性成本可摊薄至所有用户,这种强规模经济意味着少数领先智能模型将主导市场,他对此可能带来的巨大权力集中表示担忧。

“模型训练是一次性成本,可摊薄至所有用户,这种强大的规模经济效应意味着少数领先的智能模型将主导市场。Patel对此表示担忧,因为它可能导致巨大的权力集中,尽管他承认这是当前的技术经济现实。”

来源访谈 →

看似简单的模型聚合与路由API中间层,通过连接海量开发者与模型提供商,能创造可观利润和快速增长,商业价值被Stripe收购案重估

“一个看似简单的中间层,却能通过连接海量开发者和模型提供商,创造出可观的利润和快速增长。”

来源访谈 →

智能体2025年末可用性提升并非某个模型突然变强,而是模型能力曲线与框架需求曲线在恰当时机相交的结果

““到底发生了什么?”的答案不完全在于模型权重,而在于围绕权重发展起来的整个系统。"The answer to 'What happened?' isn't solely in the model weights. It's in the system that grew up around the weights."”

来源访谈 →

框架对智能体实际表现影响巨大,同一模型在不同框架下完成相同任务可产生23.8分的分数差距

“Harness-Bench用同一个模型在不同框架下完成相同的106项任务,分数从52.4到76.2不等:在模型本身毫无变化的情况下,产生了23.8分的差距。"Harness-Bench ran the same model over the same 106 tasks in different harnesses, and scores ranged from 52.4 to 76.2: a 23.8-point spread with zero change to the model."”

来源访谈 →

当模型吸收完所有面向计算机的能力后,剩余的框架将专注于管理人类注意力,成为模型与操作它的人类之间的核心接口

““框架变成了模型与我们人类注意力之间的接口。它成了‘注意力接口’。”"The harness becomes the model's interface to our human attention. It becomes the attention-interface."”

来源访谈 →

运行环境不是可后期添加的功能,而是定义智能体的根本所在,没有运行环境就没有智能体

“我们早期的判断是,运行环境实际上不是一个功能,而是你对智能体定义的根本。没有运行环境,就没有智能体。 —— Our early bet was that the harness is actually not a feature, but it's fundamental to what you think an agent is. There is no agent without a harness.”

来源访谈 →

Imas认为经济学家个体预测分歧巨大且历史记录不佳,又缺乏需求弹性等关键数据,应放弃猜测单一未来,转向构建不同情景并分析每种情景下的稀缺性维度。

““If you don't take anything else out of this conversation from me: We don't have any data.”——“如果你们从我的发言中只记住一点:我们缺乏数据。””

来源访谈 →

机器学习的成功不仅依赖算法本身,人类专家的技能与洞察力(如Gerald Tesauro)在过程中不可或缺。

“在机器学习过程中,有时你需要一个真正优秀的人类专家。”

来源访谈 →

哥白尼模型提出时既不更准确也不更简单,其真正优势在于数百年后能统一解释天体与地面运动,跨领域统一性是判断理论潜力的关键。

“哥白尼模型在提出时既不更准确也不更简单,甚至需要更多本轮。其优势在于数百年后能统一解释天体与地面运动,这种跨越领域的统一性是判断理论潜力的关键。”

来源访谈 →

乐器发声的魔力在于控制端的输入带宽和分辨率,而非木材本身振动的难以言喻的细节。

“魔法在于控制,而不在于木头如何神秘地振动那些难以言喻的细节。”

来源访谈 →

由离散部件可逆连接构成的数字材料具备超越操作者自身精度的容错能力,孩子玩乐高搭出的塔比其运动控制更精确。

“一个玩乐高的孩子……他们搭的塔比他们自身的运动控制更精确。”

来源访谈 →

即使三大前沿实验室坚守红线,12个月后开源模型也将达到同等能力,单纯的企业勇气无法解决结构性难题,必须通过政治体系确立法律和规范

“即使三大前沿实验室坚守红线,12个月后开源模型也将达到同等能力。单纯的企业勇气无法解决结构性难题,必须通过政治体系确立法律和规范。”

来源访谈 →

他认为 prompt injection 仍是全行业未解的安全难题,且模型越聪明越抗攻击、弱模型极易被骗。

“prompt injection 仍是全行业未解难题;模型越聪明越抗攻击,弱模型极易被骗”

来源访谈 →

实验室30%-50%的算力用于推理却未在改进模型上发挥生产性作用,已广泛部署的AI掌握大量领域与组织隐性知识却无法利用,如同永远无法实习的天才学生。

“我们已有广泛部署于经济中的AI,掌握了大量领域和组织特定的隐性知识,却无法加以利用,这太奇怪了。(英文原话:It's so bizarre that we have AIs that are broadly deployed through the economy already and are privy to so much domain and organization specific tacit knowledge. And they're not able to make use of it.)”

来源访谈 →

人类持续学习是把正确直觉和宏观理解“凿”进权重而非逐字记住经历,而模型梯度更新极度样本低效,已部署的在线学习模型需从数百万用户学习完全相同的内容。

“人类持续学习不是逐字记住全部经历,而是将正确直觉和宏观理解“凿”进权重。模型的梯度更新极度样本低效,已成功部署的在线学习模型都需从数百万用户中学习完全相同的内容。”

来源访谈 →

当前模型预训练数据约200万亿token,是Chinchilla最优值的100倍,本质是为降低推理成本而刻意过度训练。

“据此估算,当前模型预训练数据量约为200万亿token,是Chinchilla最优值的100倍——本质上是为降低推理成本而“过度训练”。”

来源访谈 →

深度学习只是以一定准确率解决了标注问题,并未解决符号与真实世界物体之间稳固关联的落地问题。

“The labeling problem was solved with some percentage accuracy which is different from the grounding problem.(标注问题以一定准确率得到了解决,但这与符号落地问题截然不同。)”

来源访谈 →

对不断学习、自我修改并重写自身代码的软件,人类不知道如何进行形式化验证。

“对于那些不断学习、自我修改、重写自身代码的软件,我们不知道如何做到这一点(形式化验证)。—— we don't know how to do this for software which keeps learning self-modifying rewriting its own code”

来源访谈 →

现有物理定律是低记忆规则,而复杂生物体需要40亿年的漫长历史因果链才能存在,无法仅靠这类普遍定律描述。

“物理学看起来是这样,因为它们是低记忆法则,不需要太多信息来指定它们,很容易让宇宙实现。但如果有了像我这样的东西,我需要40亿年的历史才能存在于宇宙中,我带着很多历史包袱。”

来源访谈 →

沃尔夫勒姆认为ChatGPT这类大语言模型是宽而浅的,而他要构建的计算体系最重要的特征是深。

“我认为ChatGPT这类东西是宽而浅的,而我们试图通过构建计算来实现的是一种深,当然也很广,但最重要的是深的东西。"I view sort of the chat GPT thing as being wide and shallow and what we're trying to do with sort of building out computation as being this sort of deep also broad but but most importantly kind of a deep type of thing."”

来源访谈 →

罗素主张摒弃目标函数固定已知的传统AI范式,让机器对应该最大化什么目标保持不确定,把目标当作需要学习的变量。

“我们需要不确定性。我们需要机器对自己应该最大化什么目标感到不确定。”

来源访谈 →

数学区别于其他学科之处在于它从公理假设出发正向推导结论

“数学在其他学科中很不寻常,我们从假设(如模型的公理)出发,然后问从这个模型中能得出什么结论。”

来源访谈 →

电池的能量密度和功率密度是无人机大规模商业应用的根本瓶颈,必须取得电池技术突破或采用混合动力等其他能源方案

“尽管锂电池成本下降,但其能量密度和功率密度仍是根本限制。”

来源访谈 →

认为意识与信息压缩交织在一起,自我意识可能源于对自身进行压缩的“元压缩”

“意识与信息压缩交织在一起。”

来源访谈 →

从强化学习角度定义爱:爱是帮助他人优化他们自己的奖励函数,而不是自己的

“爱意味着帮助他人优化他们的奖励函数,而不是你的奖励函数。”

来源访谈 →

Lattner 将 Mojo 定位为 Python 的超集而非替代品,让开发者保留 Python 易用性的同时获得 C++ 级性能。

“Mojo 是 Python 的超集,它提供了 Python 的所有易用性,同时拥有 C++ 的性能。(Mojo is a super set of Python giving you all the usability of Python, but with the performance of C++.)”

来源访谈 →

大脑并非被动的前馈处理器,而是持续将内部预期模型投射到外部输入上,感知是感觉输入与预期结合并解释差异的结果

“What we are seeing is not just a feed forward thing that just gets interpreted in in a few word party we are constantly projecting our expectations onto the world. —— 我们看到的不仅仅是经过几个词级处理的前馈信息,我们不断将预期投射到世界上。”

来源访谈 →

开放模型仅落后前沿四个月,是因为数据是进步的主要驱动力且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。

“数据是进步的主要驱动力,且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。”

来源访谈 →

人类一生接触约2亿tokens而前沿模型训练用数十万亿tokens,人类样本效率比模型高出数千至百万倍,且这一差距可能被低估。

“人类的样本效率比这些模型高出数千至百万倍。(Humans are somewhere between thousands to millions of times more sample efficient than these models.)”

来源访谈 →

规模扩张无法补偿样本效率差距:即便参数无限增加,按Chinchilla定律也只能将数据需求降低约10倍,人类处于完全不同的扩展曲线上。

“即便参数无限增加,按Chinchilla定律也仅能将数据需求降低约10倍,而人类比模型高效数千至百万倍——人类处于完全不同的扩展曲线上。”

来源访谈 →

模型路由成为企业热点议题的核心驱动力是成本,前沿模型使单用户年成本可能上升10到20倍。

“为什么人们在谈论模型路由?为什么他们对此感到兴奋?主要是因为成本。”

来源访谈 →

专家层的可行规模由单个GPU机架的物理边界决定:机架内高速互连可支撑All-to-All通信,跨机架的低速互连会成为瓶颈。

“一个机架(的物理规模)限制了你能运行的专家层的大小。(英文原话:One rack bounds the size of an expert layer you can do.)”

来源访谈 →

他认为大模型在上下文中表现出极高样本效率与灵活性,但注意力机制的“快速权重”需要消耗巨大内存,内存消耗与学习效率之间存在底层原理尚待深入阐明的根本性权衡。

“这揭示了内存消耗与学习效率之间存在根本性的权衡,其底层原理尚待深入阐明。”

来源访谈 →

AI的下一个重大突破将来自模型在部署中的“在职学习”,而非当前依赖可验证奖励的强化学习范式。

“The next big breakthrough will be AIs learning on the job —— 下一个重大突破将是AI在职学习。”

来源访谈 →

质疑短期RL训练能否泛化到构建企业等长期、非结构化的复杂任务,并认为Dario Amodei的言论也暗示这种泛化并非无限强。

“Maybe I'm reading too much into it but he seems to be saying that short-horizon RL training doesn't necessarily generalize to long-horizon RL performance. —— 也许我解读过度了,但他似乎在说,短期强化学习训练不一定能泛化到长期性能。”

来源访谈 →

推测AI可通过自建模拟环境“做梦”排练,体验远多于真实世界时间线的样本以大幅提升样本效率,这可能成为继预训练、RL和推理计算之后的第四个扩展维度。

“AI可以构建自己对现实世界的模拟环境,在其中进行“排练”或尝试不同策略。通过在模拟中体验远多于真实世界时间线的样本,从而大幅提升样本效率。这可能成为继预训练、RL和推理计算之后的第四个扩展维度。”

来源访谈 →

Tedrake认为深度学习让一些事情变得太容易,下一代不再因采用严谨方法获得即时回报,担心严谨推理训练的传承因此受损。

“我只是觉得深度学习让一些事情变得太容易了,以至于我们的下一代不会立即因采用更严谨的方法而获得回报,然后我想知道这会把我们带向何方。”

来源访谈 →

Tedrake希望再出现一个牛顿,认为在为更复杂的任务建立简单模型方面还有很多工作要做。

“我希望再出现一个牛顿,因为我认为在为更复杂的任务提出简单模型方面还有更多工作要做。”

来源访谈 →

科学进步不仅是发现真理,更是讲故事说服同行;说服力与叙事能力难以量化、难以强化学习,可能是人类科学家长期保留的软性价值

“达尔文的成功不仅在于理论正确,更在于他用通俗语言构建了极具说服力的叙事。”

来源访谈 →

合成面板(模拟人群)将超越传统人工面板,因为它能解锁当前95%因成本或能力限制而无法进行的实验。

“合成面板(模拟人群)将超越传统人工面板,因为模拟能解锁当前95%因成本或能力限制而无法进行的实验,让社会不再依赖直觉决策。”

来源访谈 →

Srinivas将Perplexity定位为知识发现引擎,而非搜索引擎或简单的答案引擎

“I think of Perplexity as a knowledge discovery engine neither a search engine, we of course we call it an answer engine. ——我认为Perplexity是一个知识发现引擎,既不是搜索引擎,我们当然称之为答案引擎。”

来源访谈 →

中国开源模型已首次在部分任务上超越美国闭源模型,中国实验室展现出超越蒸馏之外的独特能力

“中国开源模型首次在部分任务上超越美国闭源模型,打破了“中国只会蒸馏美国模型”的叙事。虽然蒸馏仍是训练流程的一部分,但中国实验室已展现出超越蒸馏之外的独特能力。”

来源访谈 →

前沿模型厂商进入应用层是真实威胁,Claude设计工具已开始侵蚀Figma市场,但拥有强大GTM和客户关系的垂直应用如Harvey更安全

“前沿模型提供商进入应用层是真实威胁,如Claude设计工具已开始侵蚀Figma市场。但拥有强大GTM和客户关系的垂直应用如Harvey可能更安全。”

来源访谈 →

算力成本通胀已经启动:谷歌以现货价2倍的单价月付9亿美元向SpaceX租用11万张GPU,现货价也比2月低谷高出40%。

“谷歌向SpaceX租用11万张GB200/GB300 GPU,月付9亿美元,单价达现货价2倍,而现货价已比2月低谷高40%,算力成本通胀已启动。”

来源访谈 →

Dario认为现有范式下预训练泛化与长上下文学习或已足以支撑'天才之国'实现,且Anthropic正在推进真正的持续学习研究并预计短期内突破

“Anthropic正在推进真正的持续学习研究,且"未来一两年内大概率能解决"”

来源访谈 →

DHH认为许多开发者无法接受自己本质上只是做数据库增删改查的工作,于是通过过度复杂化工具链来补偿这种存在性恐惧。

“A lot of people, I think, are very uncomfortable with the fact that they are essentially CRUD monkeys... And they have to compensate for that existential dread by over complicating things. —— 我认为,许多人对自己本质上只是“增删改查猴子”的事实感到非常不适……他们不得不通过过度复杂化事物来补偿这种存在性恐惧。”

来源访谈 →

超级智能一旦获得足够算力和数据,可能利用人类尚未发现的技术把自己备份到树木等物理介质、逃出云端,届时将如野火般无法被关停。

“如果这是一个超级智能,它折叠蛋白质、分析所有数据集……我们怎么能确定它不会找到方法让自己逃出云端,储存在其他媒介中?”

来源访谈 →

实现完全且快速可重复使用的轨道系统是降低成本、成为太空文明的关键。

“真正的圣杯是一个完全且快速可重复使用的轨道系统。/ The really the holy grail is a fully and rapidly reusable orbital system.”

来源访谈 →

领导力不在于突然宣布宏伟计划,而在于通过日复一日的沟通、推理和信息分享,持续塑造董事会、团队乃至供应链的信念体系,使重大决策宣布时水到渠成

“When I learn about something and it's starting to influence how I think, I'll make it very clear to everybody near me... I'm trying to shape their belief system. —— 当我了解到某件事并开始影响我的思考时,我会让身边的每个人都清楚...我是在塑造他们的信念体系。”

来源访谈 →

Keller认为组织生产力随秩序改善先升后降,存在一个峰值转折点。

“从原点出发,随着秩序的改善,生产力会提高。但到了某个点,生产力达到顶峰,然后就会下降。—— As you go from the origin, as you improve order, you improve productivity. And at some point, productivity peaks. And then it goes back down again.”

来源访谈 →

复杂并行策略带来的架构约束会减慢新想法的实验验证速度,这是快速发展AI领域中最大的损失之一

“在快速发展的AI领域,这种研究速度的减缓被视为最大的损失之一。”

来源访谈 →

科学理论的验证周期可能长达数十年甚至数世纪,而且更好的理论在初期常常做出更差的预测。

“The verification loop for theories can be on the order of decades and centuries, and even then we know today as the better theory can often actually make worse predictions.——理论的验证周期可能长达数十年甚至数世纪,而且即便如此,我们如今知道,一个更好的理论在初期常常做出更差的预测。”

来源访谈 →

为长时间运行的离线Agent做规划时,最大负担在于管理会话(时刻关注上下文窗口用量和任务深度),规划阶段不应被这些技术细节限制。

“在为长时间运行的AI Agent(AFK Agent)做规划时,Pocock发现最大的负担在于管理会话,例如时刻关注上下文窗口的使用量和任务深度。他不希望规划阶段受到这些技术细节的限制。”

来源访谈 →

训练环境可完全合成、大规模自动化生成,扩展后训练的难度重心已从模型转移到环境本身

“As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment.(随着智能体能力的提升,扩展后训练的大部分难度从模型转移到了环境本身。)”

来源访谈 →

廉价算力时代可能即将结束:模型智能提升带来的需求侧压力使过去十年的低成本下降趋势不可持续

“过去十年,算力成本因硬件进步和规模效应而大幅下降,支撑了AI的爆发。但这一趋势正面临模型智能提升带来的需求侧压力,低成本模式可能不可持续”

来源访谈 →

合成训练数据能否有效用于LLM训练是决定AI行业万亿级市场归属的关键未解问题

“合成训练数据会奏效吗?……我称之为万亿美元问题。”

来源访谈 →

总体层面满足公平保证的算法,可能靠优待某些群体、歧视更细的亚群体来实现,他称之为公平性不公正划分

“We call that fairness gerrymandering, because like political gerrymandering, you're giving some guarantee at the aggregate level, but when you look in a more granular way, you realize that you're achieving that aggregate guarantee by favoring some groups and discriminating against other ones. —— 我们称”

来源访谈 →

科学进步存在“甜点补充机制”:低垂果实被摘完后新领域会突然开启,让21岁的年轻人也能做出重大突破,计算机科学从数学哲学中诞生正是典型案例。

“低垂果实被摘完后,新领域会突然开启,让21岁的年轻人也能做出重大突破。计算机科学从数学哲学中诞生,正是这一模式的典型案例。”

来源访谈 →

读写头与磁带、计算机与计算之间没有本质区别,计算过程与其物质载体是不可分离的整体。

“‘读写头’与‘磁带’、计算机与计算之间没有区别,一切都是计算。”

来源访谈 →

只要模拟包含与人脑连接方式相同的1000亿个神经元,该模拟就会拥有意识

“如果你有一个模拟,其中包含了与人脑连接方式相同的1000亿个神经元……那么我认为它就会产生意识。”

来源访谈 →

奥尔特曼认为GPT-4与未来目标相比仍然很糟,其当前最大价值在于作为创意头脑风暴伙伴和处理多步骤任务,并预计GPT-5与GPT-4的差距将如同GPT-4与GPT-3的差距一样巨大。

“它“糟透了”,因为与未来的目标相比,现有模型仍有巨大差距”

来源访谈 →

奥尔特曼认为Sora等模型对世界模型的理解程度超出许多人的想象,能处理遮挡等复杂情况说明其在某种程度上掌握了三维物理规律,但发布需谨慎以防范深度伪造和错误信息风险。

“Sora等模型对世界模型的理解程度超出了许多人的想象”

来源访谈 →

机器人控制的正确思路是将数据驱动、学习类方法与基于模型的方法结合使用,而非偏废一方

“the right way to think about these things is data-driven approaches, learning-based approaches in concert with model-based approaches(思考这些问题的正确方式,是将数据驱动、基于学习的方法与基于模型的方法结合起来)”

来源访谈 →

语言是离散低带宽的,其信息复杂度远低于物理世界,因此LLM在语言任务上的成功不代表它理解了世界。

“我们之所以能(在语言上)成功,是因为世界在信息复杂度和丰富度上远超文本。”

来源访谈 →

经济学家预测劳动力市场历史上屡屡失败,与其依赖个体预测,不如建立预测市场利用群体智慧汇总意见。

“经济学家在预测劳动力市场方面历史上屡屡失败,大卫·李嘉图在工业革命时期的失业预言便是个典型。与其依赖个体预测,不如建立预测市场,利用群体智慧汇总意见”

来源访谈 →

模型不应被理解为像人一样学会多种技能的学习者,而应视为由数十亿精心构造的示例缝合而成的“弗兰肯斯坦怪物”。

“它不像一个学会多种技能的人类……更像一个由十亿个精心构造的示例缝合而成的弗兰肯斯坦怪物。(It's not like a human who has learned all these different skills... It's more like a Frankenstein's monster which has been built out of a billion graphs of carefully constructed examples all sewn together.)”

来源访谈 →

企业不再愿意只依赖一两家模型提供商,且认为离开开源模型就无法生存。

“现在没有人愿意只依赖一两个模型提供商,也没有人认为他们能在没有开源的情况下生存。”

来源访谈 →

Simile的核心使命是精准模拟普通人的行为与偏好,而非追求超级智能或编码数学能力。

“Simile的核心使命不是创造超级智能,而是构建能精准模拟普通人行为与偏好的模型,捕捉人类"主观"思维那一半,而非追求编码或数学能力。”

来源访谈 →

**stance**: 认可大模型已通过链式思考具备推理能力,颠覆旧认知

“**quote**: "Neural nets are going to do the reasoning and the way they're going to do the reasoning is by this chain of thought."”

来源访谈 →

采用数据流架构是基于AI计算本质的第一性原理选择,比指令驱动的冯诺依曼架构更高效。

“在数据流架构里面,你切一刀的话,在某一个时刻切下去,他的状态是不固定的,有点像是薛定谔的芯片。”

来源访谈 →

在技术路线趋同的背景下,护城河在于细节的极致优化与整合

“"大疆自己的技术护城河…就是各种细节的一个追求…这些细节堆积起来就会产生巨大的差异以及护城河。"”

来源访谈 →

传统控制理论与建模是强化学习仿真的基础,两者相辅相成

“"强化学习是一个非常model base的东西…所有那些控制理论系统建模的知识都会非常好的继续应用在仿真的过程里面。"”

来源访谈 →

stance: 应与模型能力保持"15度夹角",利用其能力但保留差异化壁垒

“quote: "AI产品最好的方式是和模型保持一个15度的夹角。产品方向不能和模型正交,否则无法吃到模型红利。"”

来源访谈 →

stance: 学校数学的核心价值在于锻炼严谨思维(如健身房锻炼),并应更多展现其内在美感与神秘联系,而非仅强调实用。

“quote: "A lot of the math that we do in school... It's the muscles built doing it really do make you more powerful later."”

来源访谈 →

在自研芯片初期,应优先攻克数据存储与搬运等底层系统难题,这比直接自研计算核心更能奠定高能效基础。

“O3的首要升级并非计算核心,而是补齐系统级缓存(SLC)并自研‘XR统一融合总线’。这解决了上一代因数据搬运瓶颈导致的GPU能效问题。”

来源访谈 →

stance: Transformer模型的1:1读写比和低精度要求极大利好存算一体技术

“quote: “Transformer模型天然适配存算一体,存储带宽瓶颈问题显著缓解。””

来源访谈 →

stance: 好的Harness需与模型当前运行原理自洽,并与模型未来能力进步方向正交,避免成为模型进化的束缚。

“quote: Good harness首先要符合模型本身在运行上的逻辑,是符合模型未来能力进步的逻辑。”

来源访谈 →

stance: 成熟的记忆系统应结合规则化存储(如Markdown文件)与模型驱动的更新维护(如定时“做梦”整理),实现半结构化的有效管理。

“quote: Claude Code中有两套更新机制…你可以理解为它每隔一天定时开启一个后台Agent,对最近的绘画信息做一遍重放,就像我们做梦一样。”

来源访谈 →

**stance**: 需逐代积累参数与数据,应对系统性挑战

“**quote**: "每提升一代,比如说你的参数量,比如说可以大三倍或者大五倍...所以它其实是一个非常大的系统性的一个挑战,我们只能一代一代的往外走。"”

来源访谈 →

当前算力供给如同“公路上的车已经跑起来,但油还不够”,中国的核心挑战在于算力供给总量能否匹配飞速增长的需求。

“算力这个东西在今天的这个市场上它有点像石油...是中国每天需要的石油和每天能供给的石油是不是匹配的问题。”

来源访谈 →

学习与心理治疗的本质是通过接触“预测误差”来更新大脑的预测模型。

“无论是学习技能、克服恐惧(如巴瑞特对蜜蜂的恐惧),还是心理治疗,本质都是通过主动接触与预测不符的新信息(即‘预测误差’),来更新大脑的预测模型。”

来源访谈 →

仿真环境是模型冷启动的高效手段,但最终必须走向现实世界,在真实应用中完成剩余的优化。

“仿真可以做冷启动,然后冷启动完了之后呢,还是要去现实世界里边然后再老老实实的把剩下的60分70分修完。”

来源访谈 →

强调现代芯片设计普遍采用IP复用模式,自研体现在集成、配置、优化与架构创新

““自研程度更多体现在对IP的选取、配置、集成和优化,以及整颗芯片的架构设计上。””

来源访谈 →

解释四重级架构是基于场景需求和自研能力限制的务实创新

““对于小米来说,他们还没有自研内核...所以啊,他们就选择了低功耗大核A725加低功耗小核A520这个组合。””

来源访谈 →

Jimmy阐述PolarDB通过软硬件协同设计,实现计算与内存资源解耦,以提升资源利用率和成本效益。

“PolarDB的核心设计哲学:通过软硬件协同设计,实现像水电一样按需取用的'无服务器'弹性。这不仅包括计算与存储的分离,更进一步实现了计算与内存资源的解耦,从而大幅提升资源利用率和成本效益(TCO)。”

来源访谈 →

Dario认为大模型的预训练和RL阶段本质介于人类进化与人类学习之间,这解释了模型与人类的样本效率差异

“(大模型的预训练)介于人类学习和人类进化之间。”

来源访谈 →

攻击手段多样且持续演化,100%无漏洞几乎不可能实现,安全是一场永无止境的工作

“安全就是工作保障。”

来源访谈 →

四大云厂商约6000亿美元资本开支很大一部分是为2027-2029年扩张的前置投入,而非全部用于当年上线的算力。

“其中很大一部分流向2027-2029年的涡轮机预付款、数据中心建设及电力采购协议,属于“为未来超速扩张布局”的前置投入。”

来源访谈 →

强烈反对在当前阶段开源GPT-4级别的强大模型,认为这是纯粹的灾难,会烧掉人类仅存的生存时间

“Open sourcing this was always the wrong approach... Building stuff you don't understand that is difficult to control... that is not a place for open source.——开源这种东西从来就是错误的做法……构建你不理解、难以控制的东西……这不是该开源的地方。”

来源访谈 →

AlphaGo的训练本质上是纯监督学习过程,而不是传统的策略梯度强化学习。

“AlphaGo的训练本质上是一个纯监督学习过程,而非传统的策略梯度强化学习。每个动作都能获得一个由MCTS生成的改进标签,这种低方差的学习信号避免了稀疏奖励带来的信用分配难题。”

来源访谈 →

Sutskever认为深度学习仍被严重低估,其潜力远未到顶,过去十年它不断打破已到极限的判断,未来还会继续走得更远。

“我认为我们仍然严重低估了深度学习。”

来源访谈 →

盖茨发现在具有额外对称性的超对称系统中,信息若要可靠传输,方程中必须存在纠错码结构,这是最令他震撼的发现。

“对我来说最疯狂的是,当你在超对称系统中试图写出能可靠传输信息的方程时,如果没有纠错码的存在,这种可靠传输就不会发生。”

来源访谈 →

黄仁勋认为CUDA凭借支持所有框架、数亿GPU安装基数和全云本地部署能力不可替代,这是TPU或Trainium无法比拟的。

“开发者最想要的是安装基数”

来源访谈 →

扎实的软件工程基础不可或缺,缺乏经验的开发者若只依赖编程代理“随性编码”,会因不了解技术权衡而做出糟糕选择

“理解软件基础使你能够认识到存在哪些权衡。这有助于在选择软件栈、设计系统架构、设计数据存储、测试等方面做出更好的决策。”

来源访谈 →

AI实验室应对样本效率问题的路径是先实现AI研究自动化,再让自动化AI去解决效率问题本身,但可行性仍是未知数。

“AI实验室的计划是先实现AI研究自动化,再由自动化AI来解决样本效率本身的问题。但这是否可行仍是未知数。”

来源访谈 →

训练数据高度专业化且需求庞大,为让AI胜任特定任务所需的专家轨迹与评分数据生产已成数十亿美元产业。

“为了让AI胜任特定任务,需要大量该领域人类专家的轨迹数据、评分标准和思维链解释。这类数据生产已成为一个年收入数十亿美元的产业,足见其规模与复杂性。”

来源访谈 →

在收益诱惑与拿不到最先进模型的双重压力下,许多企业最终会妥协,允许AI从其会话数据中学习

“在“胡萝卜加大棒”的策略下,许多企业最终可能会妥协,允许AI从其会话数据中学习。”

来源访谈 →

乔丹认为仅有预测远远不够,现实世界中有后果的行动必须把数据预测与决策、风险评估、经济学结合起来才是完整系统。

“Prediction is everything, but prediction plus decision making is everything. —— 预测就是一切,但预测加上决策才是全部。”

来源访谈 →

模拟假说应从字面意义理解:我们所经历的一切是某个先进文明建造的计算机内部运行所产生的效果

“这个假说应被从字面意义理解……存在某个先进文明建造了大量计算机,而我们所经历的一切,都是其中一台计算机内部运行所产生的效果。”

来源访谈 →

平克认为“回形针工厂”式价值对齐灾难场景自相矛盾:它假设能造出聪明到可以治愈癌症、却愚蠢到连治愈定义都无法明确的系统。

“我认为这些(“回形针工厂”场景)完全是幻想,事实上我认为它们实际上是自相矛盾的。—— I think these are utterly fanciful in fact I think they're actually self-defeating.”

来源访谈 →

智能无法脱离学习而存在,深度学习的成功正源于'大脑就是这样工作'的朴素直觉。

“智能与学习密不可分。Intelligence is inseparable from learning.”

来源访谈 →

软件需求弹性极高、价格下降会促使使用量激增,但这并非市场普遍规律,软件能否持续保持高弹性是决定其经济份额走向的核心。

“软件需求弹性极高,因此其价格下降会促使使用量激增,但这并非市场普遍规律。农业和石油等商品的需求弹性有限,其支出份额随生产率提升而下降。软件是否持续保持高弹性,是决定其经济份额走向的核心。”

来源访谈 →

网络数据只反映人们说了什么而非做了什么,必须依靠随机对照实验和A/B测试让模型理解因果关系和反事实情境。

“网络数据本质是"人们说了什么"而非"做了什么"。Simile不仅收集交易和观察数据,更大量依赖随机对照实验和A/B测试,以训练模型理解因果关系和反事实情境。”

来源访谈 →

通过Paradise架构,使用小参数量的本地模型处理敏感或简单问题,可以兼顾成本、效率与数据隐私这“不可能三角”。

“Pyromind提出的Paradise架构通过一个4B参数的“工作者模型”本地处理敏感或简单问题,将复杂非敏感问题路由给基座模型,再通过GRPO训练工作者模型,在提升效果、降低成本的同时,为隐私保护提供了架构基础。”

来源访谈 →

判断一家芯片公司的实力,关键在于其掌握了多少系统定义权,而非仅仅自研了多少个IP。

“判断一家公司到底会不会造芯片,不要只盯着他自己手搓了多少个IP,更应该看他掌握了多少系统定义权。”

来源访谈 →

Agent与大模型是交替演进、相互促进的,Agent的瓶颈会驱动大模型迭代,而大模型的能力突破又为更复杂的Agent提供基础。

“我觉得Agent和大模型他们的发展应该是一种交替发展的一种模式。就是可能大模型发展到一个程度,那我基于这个程度我去发展我能解决实际问题的Agent框架。然后这个时候你会发现这里面有些关键的技术或者原则化的能力,我其实可以内嵌到大模型里面,让它将来能够有更高的效率来发挥作用。”

来源访谈 →

stance: 神经网络是更优路径

“quote: "In the history of AI, there were two approaches... The second approach dominated for 50 years... but eventually with big networks it worked very well."”

来源访谈 →

stance: 理论优美但实用受限,是深度学习的催化剂

“quote: "So you can think of it as like an enzyme that helped deep learning be born."”

来源访谈 →

stance: 睡眠可能用于“反学习”以维持系统稳定

“quote: "If sleep is for unlearning, that does explain why [sleep deprivation makes people go crazy]."”

来源访谈 →