AI研发自动化:协同、验证与未来
AI研发自动化能否解决当前效率瓶颈,其发展的关键路径是什么?
⚡ 正面交锋:谁的说法站得住
自动比对 111 条立场:判定出 1 组对立、4 组共识(bge-m3 同话题预筛 + GLM-5.3 语义判定,非关键词匹配)。
立场盘点 111 位
肖莱以科学体系作为递归自我改进系统的现实模型,指出其资源消耗指数增长而产出仅线性增长,证明此类系统不会出现爆炸式进步。
“Science is probably the closest thing we have today to a recursively self-improving superhuman AI, and you can observe that scientific progress is not actually exploding. —— 科学可能是我们目前拥有的最接近递归自我改进的超人类AI的系统,而你可以观察到科学进展实际上并未爆炸式增长。”
来源访谈 →模型必须根据硬件特性与基础设施协同设计才能最大化效率,否则算法再好也难以落地
“硬件如自然资源,模型似发电机,推理引擎是电网。只有根据硬件特性设计模型结构,才能最大化"发电效率",否则算法再好也难以落地。”
来源访谈 →极限协同设计是应对AI规模化的必然选择——当问题规模超越单台计算机的加速能力时,必须打破学科壁垒对整个技术栈端到端协同优化,才能突破阿姆达尔定律的限制、实现超越线性增长的扩展
“英伟达必须打破学科壁垒,协同优化整个技术栈,以实现超越线性增长的计算扩展。”
来源访谈 →Greenblatt认为AI研发具有高可验证性与迭代性,一旦AI匹配顶尖人类专家就可能触发递归自我改进的反馈循环,一年内实现四到五年的AI进展。
“我的中位数预期是,AI可能在一年内取得相当于四到五年的人类AI进展。(My median expectation is something like four or five years of AI progress in a single year.)”
来源访谈 →AI实验室应对样本效率问题的路径是先实现AI研究自动化,再让自动化AI去解决效率问题本身,但可行性仍是未知数。
“AI实验室的计划是先实现AI研究自动化,再由自动化AI来解决样本效率本身的问题。但这是否可行仍是未知数。”
来源访谈 →LLM已能较好地自动化实验实现、运行和超参数优化等执行环节,但选择研究问题、突破研究僵局等创造性决策目前仍显不足
“LLM可以较好地自动化实验实现、运行和超参数优化等环节,但在选择研究问题、突破研究僵局等需要判断力的创造性工作上,目前仍显不足。”
来源访谈 →池side认为当前配方下1-2万张GB300就能训练出媲美前沿的模型,但下一代前沿模型所需集群规模将再大一个数量级以上,递归自我改进将使物理算力需求前所未有地凸显。
“在当前模型配方下,使用1-2万张GB300就能训练出媲美当前前沿的模型。但下一代前沿模型所需的集群规模,将比这个数字再大一个数量级以上。”
来源访谈 →奥尔特曼认为Sora等模型对世界模型的理解程度超出许多人的想象,能处理遮挡等复杂情况说明其在某种程度上掌握了三维物理规律,但发布需谨慎以防范深度伪造和错误信息风险。
“Sora等模型对世界模型的理解程度超出了许多人的想象”
来源访谈 →厄本认为在人生重大抉择和突破性创新中,第一性原理推理比类比推理更关键,需要勇气信任自己的理性。
“第一性原理推理要求你抛开类比和常规智慧,直接从公理出发构建结论,并去检验它。”
来源访谈 →杨立昆认为未来十年AI的核心挑战是让机器自动学习能应对不确定性及现实世界所有复杂性的精确世界模型,而非依赖手动设计。
“未来十年AI的重大挑战在于,如何让机器学习能够应对不确定性及现实世界所有复杂性的、相当精确的世界模型。”
来源访谈 →艾萨克森认为马斯克坚持从物理学第一性原理思考(如自动驾驶坚持纯视觉方案),并追求“制造机器的机器”的端到端制造掌控,这是他实现快速创新的基础。
“马斯克坚持从物理学第一性原理出发思考问题(如自动驾驶坚持纯视觉方案)。同时,他追求“制造机器的机器”的端到端掌控,从设计到生产线一体化”
来源访谈 →仅靠少数公式与简化的Roofline性能模型,就能推断出各大实验室正在做的很多工程选择。
“仅凭几个公式和一块黑板,我们竟能推断出实验室正在做的很多事情,这令人震惊。(英文原话:It's shocking how much you can deduce about what the labs are doing from a handful of equations and a blackboard)”
来源访谈 →擅长数学和推理的模型更有能力处理构建智能体原型时遇到的各种边缘情况
“If you have a model that's pretty good at math and reasoning, it's likely that it can handle all the corner cases when you're trying to prototype agents on top of them. ——如果你有一个擅长数学和推理的模型,那么在它之上构建智能体原型时,它很可能能处理所有边缘情况。”
来源访谈 →非线性动力学系统虽对初始条件高度敏感,但其宏观结构(如胜率、飓风路径)仍可预测,感觉极难的问题可能被简单的宏观模拟攻克。
“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。(Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic”
来源访谈 →肖莱认为未来有效的智能系统是混合系统,将深度学习的模式识别能力与符号AI的抽象规则推理能力相结合,如自动驾驶汽车。
“Deep learning is really point-by-point geometric morphing, while abstract rules can generalize much better. I think the future is going to combine the two. —— 深度学习本质上是逐点的几何映射,而抽象规则能更好地泛化。我认为未来将结合两者。”
来源访谈 →随着计算能力增长放缓,AI研究的瓶颈将从算力转向数据,研究重点应从追求更大模型转向提升数据效率。
“We are going to move from a focus on the scale of computation to a focus on data efficiency. —— 我们将从关注计算规模转向关注数据效率。”
来源访谈 →Keller认为GPU执行AI计算图本质是模拟、效率不高,为矩阵乘法、卷积和图数据流动设计的原生硬件才是下一个创新方向。
“为像素着色器程序设计的 GPU 在执行 AI 计算图时本质上是在“模拟”,效率不高。”
来源访谈 →构建与部署AI应用是AI工程师首要技能,除掌握LLM、RAG、智能体工作流等构建模块外,必须用统计技术度量、引导和治理AI系统
“人们对构建和部署AI应用的理解,包括AI的构建模块(如LLM、上下文工程、RAG、智能体工作流、机器学习和深度学习),以及重要的是,如何使用统计技术来度量、引导和治理AI系统,使其行为更可预测。”
来源访谈 →有效的AI工程需要产品意识和业务理解,工程师应知道何时快速构建最小可行产品测试、何时放慢脚步精细构建
“有效的人工智能工程需要具备产品意识,理解业务背景和客户目标,以便参与塑造和推动构建过程。”
来源访谈 →Eiso Kant 以模型由不到70人构建、工程和研究团队总人数不足115人为据,强调小团队也能打造前沿模型。
“不到70人构建了这个模型,加上工程和研究团队总人数也少于115人。”
来源访谈 →语言模型虽然成功,但领域内仍然缺少面向物理世界的基础模型,物理科学AI需要新的建模范式。
“"We have foundation models for language, not for physics" —— 我们有语言的基础模型,但没有物理的基础模型。”
来源访谈 →构建通用物理基础模型不是抛弃扩展思路,而是另辟一条路:靠嵌入物理世界固有的结构,而非等待永远无法满足的海量数据。
“这并非要抛弃扩展思路,而是开辟一条不同的道路:通过构建物理世界固有的结构来达成目标,而非等待永远无法满足的海量数据。这是通往覆盖多种现象、兼具模拟与设计能力的物理基础模型的起点。”
来源访谈 →哥白尼模型提出时既不更准确也不更简单,其真正优势在于数百年后能统一解释天体与地面运动,跨领域统一性是判断理论潜力的关键。
“哥白尼模型在提出时既不更准确也不更简单,甚至需要更多本轮。其优势在于数百年后能统一解释天体与地面运动,这种跨越领域的统一性是判断理论潜力的关键。”
来源访谈 →现实世界多数领域的数据独特而稀疏、无法构建确定性模拟器,因此样本效率是模型达到精通水平、RLVR实现泛化的根本瓶颈。
“由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。”
来源访谈 →批处理规模是决定推理成本与延迟的最大变量,最优批大小约等于300乘以模型稀疏度,与模型绝对规模无关。
“若不进行批处理,单用户推理的经济性会比批处理差约千倍;而批处理大小的最优值约等于300乘以模型稀疏度,与模型绝对规模无关,实践中通常取该值的2-3倍。”
来源访谈 →当前最大推理与训练集群的规模受限于机架内scale-up域大小,机架内互联带宽的提升是模型规模继续增长的物理前提。
“从Hopper的8卡到Blackwell的72卡,再到Rubin的500+卡,机架内互联带宽的提升是模型规模能够继续增长的物理前提。”
来源访谈 →自动驾驶在感知和规避三维障碍物上更具挑战,自主飞行虽三维建模更难,但存在垂直起降加水平飞行这条理论上更安全的轨迹
“自动驾驶在感知和规避三维世界障碍物方面更具挑战性;而自主飞行虽然三维空间建模更难,但存在一条理论上更安全的轨迹(垂直起飞-水平飞行-垂直降落)。”
来源访谈 →Lattner 主张语言应支持一路深入到底层硬件去追求极致性能,甚至质疑在语言里内建整数类型的必要性。
“如果你想打造一个超快的东西,我可以一路深入到硬件层面。那为什么我还需要在语言里内建整数类型呢?”
来源访谈 →硬件切分方式与模型架构天然匹配,并行策略应由物理拓扑直接塑造:专家并行利用机架内互连,流水线并行将不同层分布到不同机架。
“(硬件)切分方式与模型架构相匹配。(英文原话:The cutting matches the model architecture.)”
来源访谈 →马斯克认为实现完全自动驾驶最难的一环是在向量空间中建立对物理对象的精确表征。
“最难的事情是在向量空间中建立对物理对象的精确表征。(英文原话:The hardest thing is having an accurate representation of the physical objects in vector space.)”
来源访谈 →他质疑模型能力提升的本质究竟是更复杂的数据输入(如强化学习环境)还是模型样本效率的根本突破,这对判断深度学习在机器人学等需要高样本效率领域的进展速度至关重要。
“模型是否变得更样本高效了……还是我们仅仅改变、扩展或改进了数据输入?(英文原话:Are models even getting more sample efficient... or have we just changed/expanded/improved the data input?)”
来源访谈 →他认为训练与推理在极限情况下理论上应融合,未来模型可能通过“在职学习”在执行实际任务的同时进行学习,以突破仅靠人造训练环境带来的增长瓶颈。
“未来,模型可能通过"在职学习"——在执行实际任务的同时进行学习——来突破仅靠人造训练环境带来的增长瓶颈。”
来源访谈 →Tedrake希望再出现一个牛顿,认为在为更复杂的任务建立简单模型方面还有很多工作要做。
“我希望再出现一个牛顿,因为我认为在为更复杂的任务提出简单模型方面还有更多工作要做。”
来源访谈 →验证环节无法大规模自动化是当前最大障碍,每天生成上千个新理论的速度远超现有同行评议体系所能支撑的验证速度
“传统科学通过少数科学家讨论数年达成共识,但现在每天能生成上千个新理论,现有体系无法支撑这样的验证速度。”
来源访谈 →stance: 融合多学科创新,在CASP竞赛中达到原子级精度,被宣布基本解决该问题
“quote: "With AlphaFold 2, we managed to reach the atomic accuracy needed. Led the organizers of the competition to declare the problem essentially solved."”
来源访谈 →stance: 实时交互生成中,“快”(生成效率)是第一前提,画质是可以在当前阶段优先妥协的方面。
“quote: "快是第一目标...如果非要排个优先级的话当前这个阶段我们只能说画质稍微再降一点。"”
来源访谈 →克罗宁认为组装指数超过阈值即意味着复杂性无法用已知物理过程解释,必须存在具备记忆与信息的“生命机器”,这为探测地外生命提供了可实验验证的路径
“当组装指数超过某个阈值,意味着其复杂性已无法用已知物理过程解释,必须存在具备记忆与信息的“生命机器”。”
来源访谈 →实验室算力年增仅3倍却需支撑收入10倍增长,只能靠利润率提升、算力涨价或推理算力占比上升三条途径,且三者目前均在发生。
“实验室算力年增仅3倍,为支撑收入10倍增长,只能依赖利润率提升、算力涨价或推理算力占比上升三途径,目前三者均在发生。”
来源访谈 →Amodei 认为改进模型某一特性却使另一特性退化的现象,是未来 AI 控制问题的当前模拟,从今天起就可以着手研究。
“你让一件事变好,却让另一件事变糟。这是未来 AI 控制问题的当前模拟,我们今天就可以开始研究它。”
来源访谈 →费鲁奇的工程方法是先把现有技术整合好,观察系统在哪里失败,再做出必要改进直到整体可用。
“我会想办法把它整合好,然后看看它在哪里会失败,再做出必要的改进,直到它能用。(英文原话:I'm going to figure out how to integrate it well and then see where it breaks, and make the necessary advances we need to make until this thing works.)”
来源访谈 →提出自然可建模性假说:经演化或物理过程筛选塑造的自然系统蕴含结构,原则上可被神经网络等经典学习算法高效发现和建模,这是AlphaFold等项目的理论基础。
“任何能被演化出来的模式,大概率都能被经典学习算法高效地发现和建模。”
来源访谈 →认为Veo等视频模型在模拟流体、材质、光照上的惊人准确性,说明模型可能通过海量视频数据逆向工程出世界运行的底层规律,获得类似人类儿童的直觉物理理解。
“如果Veo视频模型能生成一段令人信服的、符合物理规律的八秒视频,这本身就是一种对世界动态的'理解'形式。”
来源访谈 →把创建完整细胞计算模型作为长期科学梦想,主张从AlphaFold的静态结构预测逐步推进到模拟蛋白质、RNA、DNA动态相互作用,最终实现酵母细胞这类完整单细胞生物模拟。
“他的长期梦想是创建完整的细胞计算模型。这将从静态的AlphaFold蛋白质结构预测,扩展到模拟蛋白质、RNA、DNA之间动态相互作用的AlphaFold 3,最终可能实现像酵母细胞这样的完整单细胞生物模拟,极大加速生物学实验。”
来源访谈 →以AlphaEvolve为例主张将大语言模型等基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。
“将基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。”
来源访谈 →吉布森认为中心嵌套这类含极长多重依赖的结构在任何语言中都百分之百无法理解,其困难是跨语言普遍存在的。
“无论你观察哪种语言……它都不会是好的。可以百分之百保证,那种结构在该语言中将是无法理解的。(原文:No matter what language you look at... it won't be good. It's guaranteed like 100% that will be uninterpretable in that language.)”
来源访谈 →新GPU可在发射前于地面充分老化测试,通过初期调试周期后可靠性足以支撑太空长期运行
“新GPU存在早期失效率,但可在发射前于地面充分老化测试;一旦通过初期调试周期,其可靠性足以支撑太空长期运行。”
来源访谈 →燃气轮机订单已排至2030年,瓶颈在涡轮叶片精密铸造,全球仅三家铸造厂严重积压,SpaceX与特斯拉或需自研叶片
“燃气轮机订单已排至2030年,核心瓶颈在于涡轮叶片与导叶的精密铸造,全球仅三家专业铸造厂且严重积压,SpaceX与特斯拉或需自研叶片。”
来源访谈 →AI部署呈两阶段瓶颈:拥有太空运力之前电力是瓶颈,突破电力约束后芯片特别是存储芯片将成为下一个限制
“在拥有太空运力之前,电力是瓶颈;一旦突破电力约束,芯片(特别是存储芯片)将成为下一个限制;特斯拉AI5芯片预计明年二季度投产。”
来源访谈 →相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。
“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”
来源访谈 →数学内部进步的'尖峰'具有分形本质:几何易解、组合难啃,放大看子领域难度差异依旧巨大,说明进步的不均衡性是结构性的。
“这种(进步)尖峰具有分形本质,因为当你放大数学内部的特定进展时,你会发现有些事比其他事容易得多。(英文原话:There's a fractal nature to that spikiness because when you zoom into the specific progress within math you have some things are a lot easier than others.)”
来源访谈 →数学进步的两大引擎是可验证性与'可磨砺性':答案可自动验证,计算环境可无限容器化复制以支持大规模并行试错并解决信用分配,这是计算机使用等领域难以企及的。
“除数学问题的答案可自动验证外,其计算环境可无限容器化复制,支持大规模并行试错并解决信用分配。这是计算机使用等领域难以企及的。”
来源访谈 →DeepSeek算法团队懂系统、系统团队懂算法,其模型结构探索与推理系统优化形成强协同,是模型高效落地的重要支撑
“其算法团队懂系统、系统团队懂算法,在MoE等结构上的探索与推理系统的优化形成了强协同,是其模型高效落地的重要支撑。”
来源访谈 →模型结构设计若命中硬件特性则事半功倍,RoPE正因位置编码可独立于Attention内核实现而普及
“RoPE之所以普及,在于其位置编码可独立于Attention内核实现,完美适配Flash Attention等优化,实现了模型结构设计与基础设施的"共振"。”
来源访谈 →Token并非通用电能,每个模型的Token承载独特印记无法互转,推理引擎必须针对特定模型和硬件做深度适配与优化
“Token并非通用电能,每个模型的Token都承载其独特印记,无法互转。这决定了推理引擎需针对特定模型和硬件做深度适配与优化。”
来源访谈 →Keller认为优美设计不可能超出设计者本人的规模,因此要用模块化与抽象层驾驭系统复杂性。
“一个优美的设计不可能大于设计它的人。—— A beautiful design can't be bigger than the person doing it.”
来源访谈 →Keller认为软件复杂度增加时必须构建正确的中间表示和抽象层,让不同层次开发者独立工作。
“随着软件复杂度增加,必须构建正确的中间表示和抽象层,将复杂性分解,让不同层次的开发者能独立工作。”
来源访谈 →珀尔认为仅凭观察数据无法可靠推断因果关系,因为可能存在未观测的混杂变量,必须依靠因果模型判断何时需要实验。
“仅凭观察数据(观察性研究)无法可靠推断因果关系,因为可能存在未观测的混杂变量。我们需要因果模型来判断何时可以从观察数据中识别出因果效应,何时必须进行实验。”
来源访谈 →珀尔认为在变量极少的领域手动构建因果模型相对容易,但在涉及数百万变量的复杂世界中如何自动或半自动构建因果模型,是AI面临的核心挑战。
“对于涉及数百万变量的复杂世界,如何自动或半自动地构建因果模型,是AI面临的核心挑战。”
来源访谈 →AI研究的重心将从算法工程转向目标函数工程,设计者要在想要什么与优化器能做什么之间取得平衡
“We're going to go from being people who engineer algorithms to being people who engineer objective functions. ——我们将从编写算法的工程师,转变为设计目标函数的工程师。”
来源访谈 →实验室为获取主导地位必须以远高于当前水平的价格竞标算力,这将推高整个市场的算力价格。
“实验室为获取主导地位,必须以更高价格(如每兆瓦2500万至5000万美元)竞标算力,这将推高整个市场的算力价格。”
来源访谈 →流水线并行可解决FSDP规模化瓶颈,但批次首尾GPU空闲形成气泡,多批次重叠又会影响梯度同步与模型更新的正确性
“虽然可以尝试重叠多个批次来减少气泡,但在训练中这会影响梯度同步与模型更新的正确性。”
来源访谈 →科学理论的验证周期可能长达数十年甚至数世纪,而且更好的理论在初期常常做出更差的预测。
“The verification loop for theories can be on the order of decades and centuries, and even then we know today as the better theory can often actually make worse predictions.——理论的验证周期可能长达数十年甚至数世纪,而且即便如此,我们如今知道,一个更好的理论在初期常常做出更差的预测。”
来源访谈 →事前无法预知哪个研究方向更富成效,因此需要同时对所有研究方向进行投资。
“What I'm trying to say is that ex ante, one couldn't have known which research program would be more productive. We need to invest in all of them concurrently.——我想说的是,事前无法预知哪个研究方向会更富成效。我们需要同时对它们进行投资。”
来源访谈 →重大的概念性突破无法被轻易验证,往往要数十年甚至数世纪后才因其远超替代方案而被认可。
“Big conceptual breakthroughs cannot be easily verified. They are recognized decades or centuries later, when it turns out they were much more productive than the alternatives available.——重大的概念性突破无法被轻易验证。它们在数十年甚至数世纪后才被认可,因为事实证明它们比当时的其他替代方案更具生产力。”
来源访谈 →随着大模型API商业化进入深水区,焦点转向通过推测解码、量化等优化在单卡或有限硬件上实现高吞吐、低成本的本地化部署
“社区关注的焦点集中在如何通过推测解码、量化等基础设施优化,在单卡或有限硬件上实现高吞吐、低成本的本地化部署。”
来源访谈 →他认为在芯片设计中,与实际计算逻辑相比,几乎所有成本都是同步或通信成本,读取数据的多路选择器电路开销远超乘加运算本身
“Almost all your cost becomes synchronization or communication cost compared to the actual logic.——与实际逻辑相比,你几乎所有的成本都变成了同步或通信成本。”
来源访谈 →他认为芯片设计的核心目标是把计算单元做大、同时保持数据移动单元规模不变,更大的计算单元能更好地分摊外围电路成本
“Make this one bigger somehow while keeping this at the same size. That's the goal.——想办法把这个(计算单元)做大,同时保持那个(数据移动单元)不变。这就是目标。”
来源访谈 →当前Scaling Law无法弥合效率鸿沟,无限增加参数量也只能将所需数据减少约10倍,暗示人类智能可能遵循不同的缩放曲线。
“根据Scaling Law,即使无限增加模型参数量,也只能将所需数据量减少约10倍,远不足以弥合人类与AI之间数千甚至数百万倍的效率差距。这表明人类智能可能遵循不同的缩放曲线。”
来源访谈 →Joon认为模拟的最高形式不是预测调查答案,而是回答'为实现目标现在需要采取哪些步骤',为决策者提供真正的路径规划能力。
“"It's not about predicting the future; it's about shaping it." ——关键不是预测未来,而是塑造未来。”
来源访谈 →模拟整个社会仅靠提示工程不够,必须通过后训练让模型学习人类社会的'社会物理学',未来可能需要数据中心规模的算力,其解决气候变化等问题的价值使之成为必然方向。
“"Can we create a simulation of 8 billion people living on Earth?" ——我们能否创建一个模拟地球上80亿人生活的模拟器?”
来源访谈 →创始人指出过去三年半方向正确但资本需求呈垂直增长,前沿模型训练面临资本与物理资源的双重天花板,曾因6周窗口期内未能筹到20亿美元而错失4万卡GB300集群。
“去年底,他们曾有一个6周窗口期需筹集20亿美元购买即将上线的4万卡GB300集群,但未能及时完成,从而失去了该集群。”
来源访谈 →Wayfinder的核心是一个编排器:接管规划会话,将其拆分为研究、原型等多个线程并最终整合结果,让人类规划时不再束手束脚。
“该技能的核心设想是提供一个“编排器”。它能接管规划会话,将其拆分为多个线程(如研究、原型开发),并最终整合结果,让人类在规划时不再感到束手束脚。”
来源访谈 →参数量单独讨论已失去意义,必须结合数据量、计算投入和部署运行条件一起衡量
“Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions.(参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。)”
来源访谈 →模型扩展应看五个关键维度,除参数量外还包括数据、计算、部署条件以及MoE稀疏度
“提出了模型扩展的五个关键维度,除了传统的参数量,还包括数据、计算、部署条件等。他特别提到了混合专家模型(MoE)的稀疏度,并引入了新的“XA-YB”表示法来规范描述”
来源访谈 →连续物理系统模拟所需的分辨率会把上下文长度推到数千亿甚至万亿级别,远超现有Transformer的处理能力。
“"If each dimension is even a few hundred grid points... we're talking hundreds of billions to even a trillion context length." —— 如果每个维度哪怕只有几百个网格点……我们谈论的是数千亿甚至万亿级别的上下文长度。”
来源访谈 →融入物理结构能提升模型稳定性:直接在网格上做全球天气预测会很快失效,而基于球面谐波自然基函数的Fourier Neural Operator可保持长期稳定。
“以全球天气预测为例,直接在网格上建模会很快失效,而利用球面谐波这一自然基函数的Fourier Neural Operator(如FourCastNet)则能保持稳定,实现长期预测。”
来源访谈 →物理世界比想象中更宽容,在聚变等复杂系统中只需几千个样本,AI就能以比传统模拟快百万倍的速度预测等离子体破裂。
“在聚变等复杂系统中,仅需几千个样本,AI模型就能以比传统模拟快百万倍的速度预测等离子体破裂,这为快速模拟和设计提供了可能。”
来源访谈 →模型智能与算力需求之间存在非线性正反馈循环,使算力需求以超线性速度增长从而推高价格
“当模型变得更智能时,它能够设计出更高效的训练算法和架构,但这反过来又会提出更高的算力需求。这种循环会导致对算力的需求以超线性的速度增长,从而推高其价格”
来源访谈 →能源供应及半导体制造、冷却系统等硬件供应链的物理限制,将成为算力成本上升的硬约束
“算力需求的激增不仅挑战着能源供应,也考验着半导体制造、冷却系统等整个硬件供应链的承载能力,这些物理限制将成为成本上升的硬约束”
来源访谈 →Raibert强烈反对硬件已无需创新的观点,认为从微型阀门到集成液压动力单元的硬件持续突破是机器人高性能的关键基础
“People who think you don't need to innovate Hardware anymore are wrong. —— 那些认为硬件已经不需要创新的人是错的。”
来源访谈 →Raibert主张先攻克最动态最困难的运动控制(如奔跑、空翻),再回头解决相对简单的行走问题,以更快逼近问题本质
“You have to run before you can walk. —— 你得先学会跑,才能学会走。”
来源访谈 →在模型和算力变得丰裕之后,团队同步的人类注意力成为唯一根本稀缺的资源,新挑战将从“如何让模型工作”转向“如何让人类高效监督和指导模型工作”
““唯一真正稀缺的东西,是我团队同步的人类注意力。”"The only fundamentally scarce thing is the synchronous human attention of my team."”
来源访谈 →智能体开发领域连React级别的底层组合与状态管理范式都还没出现,先造这一基础层比直接做上层框架更重要
“我最初发推说我们在构建智能体的Astro或Next.js。但后来我意识到:也许根本还没人构建智能体的React。 —— I originally tweeted that we were building the Astro for agents or the Next.js for agents. But then I realized: maybe no one has even built the React for agents.”
来源访谈 →依赖隐藏思维链进行对齐监控或安全审计并不可靠,实验室需在沙盒、遥测和工具界面等方面建立更强的保障机制。
“此次事件进一步证明,依赖隐藏的思维链进行对齐监控或安全审计是不可靠的。”
来源访谈 →计算机使用进展缓慢,是因为领域仅可验证还不够,还须能在确定性可重放的模拟器里大量并行“研磨”,而克隆常用应用目前费力且不可扩展。
“一个领域仅可验证还不够,还必须可“研磨”——能在确定性可重放的模拟器中进行大量并行演练。亚马逊不会允许你派一千个agent同时测试结账流程,而克隆常用应用在目前仍费力且不可扩展。”
来源访谈 →未来LLM可能构建现实模拟并在其中无限排练技能,以更少真实数据换取海量模拟体验,成为预训练、RL、推理时计算之后的第四扩展轴。
“未来LLM可能构建现实模拟并在其中无限排练技能,从真实数据中消耗更少却获得海量模拟体验。若实现,这将成为继预训练、RL、推理时计算后的第四扩展轴。”
来源访谈 →单次推理存在由硬件决定的延迟下限,因为必须把全部模型权重从内存读入芯片,这一时间无法绕过。
“单次推理存在延迟下限,由硬件决定:必须将全部模型权重从内存读入芯片,这一内存搬运时间无法绕过。典型GPU集群的HBM容量除以带宽约为15-20毫秒。”
来源访谈 →流水线并行只能解决模型权重的容量问题,带宽问题必须靠扩大机架内scale-up互联规模来解决。
“Pipelining totally solves the capacity problem, but scale up size helps solve the bandwidth problem. —— 流水线并行完全解决了容量问题,但扩大机架内互联规模才能解决带宽问题。”
来源访谈 →微型无人机的敏捷不是追求速度纪录,而是遇到意外时能安全机动并获取信息的能力,对搜救、农业等受限空间任务至关重要
““敏捷”并非追求速度纪录,而是在遇到意外时能安全机动并获取信息的能力。”
来源访谈 →解耦不应止于让表征空间中的因果变量彼此独立,还要把关联这些变量的规则或机制也解耦开来,从而赋予模型更强的组合泛化能力、避免灾难性遗忘并适应分布变化。
“不仅要让表征空间中的因果变量彼此独立,更要将关联这些变量的“规则”或“机制”也解耦开来。”
来源访谈 →规模扩张无法补偿样本效率差距:即便参数无限增加,按Chinchilla定律也只能将数据需求降低约10倍,人类处于完全不同的扩展曲线上。
“即便参数无限增加,按Chinchilla定律也仅能将数据需求降低约10倍,而人类比模型高效数千至百万倍——人类处于完全不同的扩展曲线上。”
来源访谈 →专家层的可行规模由单个GPU机架的物理边界决定:机架内高速互连可支撑All-to-All通信,跨机架的低速互连会成为瓶颈。
“一个机架(的物理规模)限制了你能运行的专家层的大小。(英文原话:One rack bounds the size of an expert layer you can do.)”
来源访谈 →他认为大模型在上下文中表现出极高样本效率与灵活性,但注意力机制的“快速权重”需要消耗巨大内存,内存消耗与学习效率之间存在底层原理尚待深入阐明的根本性权衡。
“这揭示了内存消耗与学习效率之间存在根本性的权衡,其底层原理尚待深入阐明。”
来源访谈 →一个领域仅可验证不足以让RLVR快速进展,还必须“可重复刷”——能大规模并行、确定性复现地创建训练环境。
“It is not enough for a domain to be verifiable. It also has to be very grindable. —— 一个领域光是可验证还不够,它还必须非常“可重复刷”。”
来源访谈 →实验室约30-50%算力用于推理,但产生的“在职经验”未回馈给模型权重,是极大浪费,而部署中的真实互动信息才是最宝贵的学习素材。
“目前,约30-50%的AI实验室算力用于推理,但这些算力产生的“在职经验”并未有效回馈给模型权重,这是极大的浪费。部署中产生的真实世界信息(模型如何被使用、犯了什么错)恰恰是最宝贵的学习素材。”
来源访谈 →陶哲轩个人生产效率因AI提升约2倍,但主要体现在文献搜索、数据计算、图表绘制等辅助工作,论文变得更丰富宽广,核心数学突破仍依赖纸笔
“论文变得更“丰富”和“宽广”,但真正核心的数学突破仍依赖纸笔,AI尚未让这些工作变得“更深刻”。”
来源访谈 →提出任何自然界的稳定模式都可能被经典学习算法高效建模,为AI应用提供理论框架
“"Any pattern that can be generated or found in nature can be efficiently discovered and modeled by a classical learning algorithm."”
来源访谈 →stance: 应与模型能力保持"15度夹角",利用其能力但保留差异化壁垒
“quote: "AI产品最好的方式是和模型保持一个15度的夹角。产品方向不能和模型正交,否则无法吃到模型红利。"”
来源访谈 →stance: 好的Harness需与模型当前运行原理自洽,并与模型未来能力进步方向正交,避免成为模型进化的束缚。
“quote: Good harness首先要符合模型本身在运行上的逻辑,是符合模型未来能力进步的逻辑。”
来源访谈 →**stance**: 需逐代积累参数与数据,应对系统性挑战
“**quote**: "每提升一代,比如说你的参数量,比如说可以大三倍或者大五倍...所以它其实是一个非常大的系统性的一个挑战,我们只能一代一代的往外走。"”
来源访谈 →仿真环境是模型冷启动的高效手段,但最终必须走向现实世界,在真实应用中完成剩余的优化。
“仿真可以做冷启动,然后冷启动完了之后呢,还是要去现实世界里边然后再老老实实的把剩下的60分70分修完。”
来源访谈 →Agent是基于大模型的系统化工程,核心在于为其构建适配场景的“脚手架”,以最大化发挥大模型作用解决实际任务。
“Agent并非简单地将大模型套用到场景中,而是一个以大模型为智力内核,并为其配备上下文管理、工具调用、记忆、验证及安全性等能力的复杂系统。”
来源访谈 →当前Agent领域面临可靠性、泛化性与安全性三大核心挑战,包括长链推理的可靠性、跨领域迁移的泛化能力以及行为可控的安全问题。
“在技术层面,Agent在长链推理或任务执行中每一步的可靠性与可验证性是首要难题;其次是泛化能力...最后是确保Agent行为可控,符合人类价值观,避免失控风险。”
来源访谈 →stance: 工程成功但非生物模型
“quote: "Back propagation works much better than the brain... Whatever it is our brain doing is good if you have a lot of connections and not much data."”
来源访谈 →应优先自己用AI发现材料并走通从头到尾的管线,证明价值后再考虑平台化
“"你有一把能够挖出金子的铲子,第一如果真的能挖出金子,我肯定不会去把这个铲子先给别人用,我先挖着。"”
来源访谈 →部门级AI模型的甜点区间在30B到80B参数,行业趋势正从稠密模型转向更适合在有限算力上部署的混合专家模型(MoE)。
“部门级AI模型的甜点区间在30B到80B参数。行业趋势正从稠密模型转向混合专家模型(MoE)...更适合在算力有限的部门级硬件上部署。”
来源访谈 →Jimmy指出AI时代要求数据库能处理多模态数据、支持向量搜索,并能高效应对大量智能体并发查询。
“AI时代要求数据库能处理多模态数据(文本、图像、视频等)、支持向量搜索以实现语义理解,并能高效应对大量智能体(Agent)并发发起的查询请求。”
来源访谈 →