议题 · 2026-08 更新

样本效率:AI的命门?

与人类近百万倍的样本效率差距是AI的根本瓶颈,还是可借MCTS密集信号与物理仿真跨越?

⚡ 正面交锋:谁的说法站得住

自动比对 254 条立场:判定出 1 组对立、9 组共识(bge-m3 同话题预筛 + GLM-5.3 语义判定,非关键词匹配)。

实验室会把算力更多分配给内部研发而非对外推理服务,因为内部使用超快AI或最佳模型产生的价值远高于外部用户。

来源访谈 →

实验室本不愿增加推理算力占比以免更像云服务商而非前沿模型训练者,但推理收入增长快于训练算力投入,迫使它们分配更多资源服务现有模型以维持现金流。

来源访谈 →

立场盘点 254 位

相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。

“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”

来源访谈 →

随着计算能力增长放缓,AI研究的瓶颈将从算力转向数据,研究重点应从追求更大模型转向提升数据效率。

“We are going to move from a focus on the scale of computation to a focus on data efficiency. —— 我们将从关注计算规模转向关注数据效率。”

来源访谈 →

人类与AI的样本效率差距接近百万倍,AI掌握技能所需的数据和练习量远超人类。

“一个人从出生到成年大约接触2亿个语言令牌(tokens),而前沿模型的训练数据量则高达数十万亿到数百万亿令牌,差距接近百万倍。无论是学开车还是操控机器人,人类所需的数据和练习量远低于AI。”

来源访谈 →

物理世界比想象中更宽容,在聚变等复杂系统中只需几千个样本,AI就能以比传统模拟快百万倍的速度预测等离子体破裂。

“在聚变等复杂系统中,仅需几千个样本,AI模型就能以比传统模拟快百万倍的速度预测等离子体破裂,这为快速模拟和设计提供了可能。”

来源访谈 →

现实世界多数领域的数据独特而稀疏、无法构建确定性模拟器,因此样本效率是模型达到精通水平、RLVR实现泛化的根本瓶颈。

“由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。”

来源访谈 →

智能的定义是样本效率,即用多少数据就能在特定领域熟练运作;近几年AI的进步主要靠扩大数据分布,而非提升训练样本效率。

“智能的定义是样本效率:即在特定领域用多少数据就能熟练运作。过去几年,AI进步主要靠扩大数据分布,而非提升训练样本效率。”

来源访谈 →

他质疑模型能力提升的本质究竟是更复杂的数据输入(如强化学习环境)还是模型样本效率的根本突破,这对判断深度学习在机器人学等需要高样本效率领域的进展速度至关重要。

“模型是否变得更样本高效了……还是我们仅仅改变、扩展或改进了数据输入?(英文原话:Are models even getting more sample efficient... or have we just changed/expanded/improved the data input?)”

来源访谈 →

认同加里·马库斯的观点:人类儿童能从两三个例子快速学习而机器学习需要百万级数据,说明人类天生具备先验知识框架,而AI领域尚未解决如何内置这种先验知识。

“人类儿童能从极少的例子(两三个)中快速学习,而机器学习需要百万级数据。这表明人类天生具备某种预期或知识框架,使高效学习成为可能,而AI领域尚未解决如何内置这种“先验知识”的问题。”

来源访谈 →

Dario认为大模型的预训练和RL阶段本质介于人类进化与人类学习之间,这解释了模型与人类的样本效率差异

“(大模型的预训练)介于人类学习和人类进化之间。”

来源访谈 →

认为Veo等视频模型在模拟流体、材质、光照上的惊人准确性,说明模型可能通过海量视频数据逆向工程出世界运行的底层规律,获得类似人类儿童的直觉物理理解。

“如果Veo视频模型能生成一段令人信服的、符合物理规律的八秒视频,这本身就是一种对世界动态的'理解'形式。”

来源访谈 →

认为游戏是AI研究的理想试验场:胜负条件清晰、指标可量化、可在云端高效运行数百万次模拟来迭代算法

“游戏在我的人生中有三个重要意义:首先是训练我自己,然后是设计游戏并为游戏编写AI,第三是用游戏作为开发AI算法的试验场。”

来源访谈 →

通过RLHF对齐模型后,模型原本较好的概率校准能力会退化,变得像人类一样不擅长精确的概率判断,这是缺陷而非特性

“缺陷,而非特性”

来源访谈 →

卡马克认为Python在AI/ML领域便捷但性能差距可达百万倍,严肃编程仍首选带C风格的C++

“Python在AI/ML领域“惊人地便捷”,但性能上可能存在“百万倍”的差距;而C++(带有C风格)仍是他“严肃编程”的首选”

来源访谈 →

珀尔认为在变量极少的领域手动构建因果模型相对容易,但在涉及数百万变量的复杂世界中如何自动或半自动构建因果模型,是AI面临的核心挑战。

“对于涉及数百万变量的复杂世界,如何自动或半自动地构建因果模型,是AI面临的核心挑战。”

来源访谈 →

实验室会把算力更多分配给内部研发而非对外推理服务,因为内部使用超快AI或最佳模型产生的价值远高于外部用户。

“"The whole point is, if I'm selling tokens… I'm going to allocate it to internal and external, because the internal value I'm generating from super-fast AI or the best AI model is way more than what someone external is."——关键在于,如果我在出售代币……我会将其分配给内部和外部,因为我从超快AI或最佳AI模型中产生的内部价值,远高于外部用户所获得的价值。”

来源访谈 →

AI能力的提升主要来自更优质、更庞大的数据分布及算力扩张,而非样本效率的改进,数据才是进步的真正驱动力。

“我认为开源和之前的落后者之所以能相对容易地在几个月内赶上前沿,是因为数据才是进步的真正驱动力。(I think the reason it is relatively easy for open source and previous laggards to catch up to within months of the frontier is that data is the real driver of progress.)”

来源访谈 →

AI炫目的能力表象之下,实则是难以想象的海量数据在维系整个体系。

“我们将这些AI视为一个闪烁着能力的星系,但在其核心,肉眼看不见的地方,将所有星座维系在一起的,是一个难以想象的数据黑洞。(We see these AIs as a galaxy glittering with capabilities, but at their center, invisible to the naked eye, holding all the constellations together, is an unimaginably massive black hole of data.)”

来源访谈 →

AI实验室应对样本效率问题的路径是先实现AI研究自动化,再让自动化AI去解决效率问题本身,但可行性仍是未知数。

“AI实验室的计划是先实现AI研究自动化,再由自动化AI来解决样本效率本身的问题。但这是否可行仍是未知数。”

来源访谈 →

训练数据高度专业化且需求庞大,为让AI胜任特定任务所需的专家轨迹与评分数据生产已成数十亿美元产业。

“为了让AI胜任特定任务,需要大量该领域人类专家的轨迹数据、评分标准和思维链解释。这类数据生产已成为一个年收入数十亿美元的产业,足见其规模与复杂性。”

来源访谈 →

模拟整个社会仅靠提示工程不够,必须通过后训练让模型学习人类社会的'社会物理学',未来可能需要数据中心规模的算力,其解决气候变化等问题的价值使之成为必然方向。

“"Can we create a simulation of 8 billion people living on Earth?" ——我们能否创建一个模拟地球上80亿人生活的模拟器?”

来源访谈 →

语言模型虽然成功,但领域内仍然缺少面向物理世界的基础模型,物理科学AI需要新的建模范式。

“"We have foundation models for language, not for physics" —— 我们有语言的基础模型,但没有物理的基础模型。”

来源访谈 →

合成训练数据能否有效用于LLM训练是决定AI行业万亿级市场归属的关键未解问题

“合成训练数据会奏效吗?……我称之为万亿美元问题。”

来源访谈 →

在收益诱惑与拿不到最先进模型的双重压力下,许多企业最终会妥协,允许AI从其会话数据中学习

“在“胡萝卜加大棒”的策略下,许多企业最终可能会妥协,允许AI从其会话数据中学习。”

来源访谈 →

框架对智能体实际表现影响巨大,同一模型在不同框架下完成相同任务可产生23.8分的分数差距

“Harness-Bench用同一个模型在不同框架下完成相同的106项任务,分数从52.4到76.2不等:在模型本身毫无变化的情况下,产生了23.8分的差距。"Harness-Bench ran the same model over the same 106 tasks in different harnesses, and scores ranged from 52.4 to 76.2: a 23.8-point spread with zero change to the model."”

来源访谈 →

哥白尼模型提出时既不更准确也不更简单,其真正优势在于数百年后能统一解释天体与地面运动,跨领域统一性是判断理论潜力的关键。

“哥白尼模型在提出时既不更准确也不更简单,甚至需要更多本轮。其优势在于数百年后能统一解释天体与地面运动,这种跨越领域的统一性是判断理论潜力的关键。”

来源访谈 →

实验室30%-50%的算力用于推理却未在改进模型上发挥生产性作用,已广泛部署的AI掌握大量领域与组织隐性知识却无法利用,如同永远无法实习的天才学生。

“我们已有广泛部署于经济中的AI,掌握了大量领域和组织特定的隐性知识,却无法加以利用,这太奇怪了。(英文原话:It's so bizarre that we have AIs that are broadly deployed through the economy already and are privy to so much domain and organization specific tacit knowledge. And they're not able to make use of it.)”

来源访谈 →

当前模型预训练数据约200万亿token,是Chinchilla最优值的100倍,本质是为降低推理成本而刻意过度训练。

“据此估算,当前模型预训练数据量约为200万亿token,是Chinchilla最优值的100倍——本质上是为降低推理成本而“过度训练”。”

来源访谈 →

人类一生接触约2亿tokens而前沿模型训练用数十万亿tokens,人类样本效率比模型高出数千至百万倍,且这一差距可能被低估。

“人类的样本效率比这些模型高出数千至百万倍。(Humans are somewhere between thousands to millions of times more sample efficient than these models.)”

来源访谈 →

规模扩张无法补偿样本效率差距:即便参数无限增加,按Chinchilla定律也只能将数据需求降低约10倍,人类处于完全不同的扩展曲线上。

“即便参数无限增加,按Chinchilla定律也仅能将数据需求降低约10倍,而人类比模型高效数千至百万倍——人类处于完全不同的扩展曲线上。”

来源访谈 →

白领工作自动化“低效但盈利”:AI训练低效无所谓,因为技能可摊销到数十亿次会话中,而人类受寿命限制无法承受如此海量的训练。

“AI训练低效无所谓,因为其技能可摊销到数十亿次会话中;人类因寿命限制,无法承受如此海量的训练。”

来源访谈 →

他认为大模型在上下文中表现出极高样本效率与灵活性,但注意力机制的“快速权重”需要消耗巨大内存,内存消耗与学习效率之间存在底层原理尚待深入阐明的根本性权衡。

“这揭示了内存消耗与学习效率之间存在根本性的权衡,其底层原理尚待深入阐明。”

来源访谈 →

推测AI可通过自建模拟环境“做梦”排练,体验远多于真实世界时间线的样本以大幅提升样本效率,这可能成为继预训练、RL和推理计算之后的第四个扩展维度。

“AI可以构建自己对现实世界的模拟环境,在其中进行“排练”或尝试不同策略。通过在模拟中体验远多于真实世界时间线的样本,从而大幅提升样本效率。这可能成为继预训练、RL和推理计算之后的第四个扩展维度。”

来源访谈 →

人类擅长深度钻研、AI擅长大规模试错与遍历,应让大量中等能力AI清扫数学图谱中的容易问题、人类专家集中攻克难度孤岛,为此必须重新设计科学研究方式

“我们必须重新设计科学研究的方式,才能充分利用AI的广度能力。(We have to redesign the way we do science to take full advantage of this breadth capability.)”

来源访谈 →

被AI解决的50个埃尔德什问题大多几乎无文献、解法只是冷门技巧与新问题的结合,对任意给定难题的真实成功率仅1%至2%,惊艳效果来自大规模试错后的成功放大

“系统化评测显示,AI对任意给定难题的成功率仅1%至2%,只是大规模试错后放大成功案例,才显得效果惊艳。”

来源访谈 →

陶哲轩个人生产效率因AI提升约2倍,但主要体现在文献搜索、数据计算、图表绘制等辅助工作,论文变得更丰富宽广,核心数学突破仍依赖纸笔

“论文变得更“丰富”和“宽广”,但真正核心的数学突破仍依赖纸笔,AI尚未让这些工作变得“更深刻”。”

来源访谈 →

多数越狱技巧本质上是社交工程(如诉诸权威、指示模型不要拒绝),字符混淆等冷门技术增益有限,这印证了"拟人化"AI模型的实用性。

“多数越狱技巧本质上是社交工程,如诉诸权威、指示模型不要拒绝等。相对冷门的字符混淆等技术增益有限。这印证了"拟人化"AI模型的实用性。”

来源访谈 →

推理时缩放让模型在给出第一个词之前能思考数秒、数分钟甚至数小时,是能力上的巨大飞跃

“推理时缩放让模型在给出第一个词之前,能思考数秒、数分钟甚至数小时,这是能力上的巨大飞跃。”

来源访谈 →

擅长数学和推理的模型更有能力处理构建智能体原型时遇到的各种边缘情况

“If you have a model that's pretty good at math and reasoning, it's likely that it can handle all the corner cases when you're trying to prototype agents on top of them. ——如果你有一个擅长数学和推理的模型,那么在它之上构建智能体原型时,它很可能能处理所有边缘情况。”

来源访谈 →

以深度学习为代表的当前AI本质是高度发达的“系统一”,擅长模式匹配与预测,但缺乏“系统二”式的推理能力,因而强大却有局限。

“Deep learning matches patterns and anticipate what's going to happen so it's highly predictive. What deep learning doesn't have... is the ability to reason. There is no system two there.——深度学习匹配模式并预测接下来会发生什么,因此具有高度的预测性。深度学习所缺乏的……是推理的能力。那里没有‘系统二’。”

来源访谈 →

实验室算力年增仅3倍却需支撑收入10倍增长,只能靠利润率提升、算力涨价或推理算力占比上升三条途径,且三者目前均在发生。

“实验室算力年增仅3倍,为支撑收入10倍增长,只能依赖利润率提升、算力涨价或推理算力占比上升三途径,目前三者均在发生。”

来源访谈 →

真正的突破常常发生在人们意想不到的方向,因此对AI发展的预测很困难,未来进展可能来自当前未被重点关注的领域。

“历史表明,真正的突破(如GPT-4)常常发生在人们意想不到的方向。”

来源访谈 →

中美竞争结果取决于AI时间线快慢:快速发展美国凭算力规模领先,缓慢发展中国凭供应链整合优势逐步追平。

“时间线快,美国赢;时间线慢,中国赢。(Fast timelines, US wins, long timelines, China wins.)”

来源访谈 →

深度学习本质是逐点的几何映射学习,需要训练数据对输入-输出空间密集采样,因而在抽象推理和远距离泛化任务上能力有限。

“Deep learning is really point-by-point geometric morphing, while abstract rules can generalize much better. —— 深度学习本质上是逐点的几何映射,而抽象规则能更好地泛化。”

来源访谈 →

当前大模型的损失函数是最大化压缩,导致产出平庸,与追求AGI的目标背道而驰。

“如果你的损失函数仅仅是试图最大化压缩……它写的说唱听起来就像YouTube评论里的说唱。(If your loss function is just try to maximize compression... the raps that it wrote sounded like YouTube comment raps.)”

来源访谈 →

AI在IMO几何题上的优异表现源于暴力求解特性、组合题仍是难点,攻克IMO金奖只是又一个基准测试被攻破,并非AGI到来的信号。

“这不过是又一个被攻克的基准测试,而非AGI到来的信号。”

来源访谈 →

数学内部进步的'尖峰'具有分形本质:几何易解、组合难啃,放大看子领域难度差异依旧巨大,说明进步的不均衡性是结构性的。

“这种(进步)尖峰具有分形本质,因为当你放大数学内部的特定进展时,你会发现有些事比其他事容易得多。(英文原话:There's a fractal nature to that spikiness because when you zoom into the specific progress within math you have some things are a lot easier than others.)”

来源访谈 →

只有当AI能'建造山脉'——自主构建全新理论体系并重塑学科思考方式时,这种智能水平才可能渗透到经济各领域,其影响远超IMO金牌。

“如果它能建造出(理论的)山脉……清晰地重塑我们思考一个学科的方式,那代表了如此高的智能水平,以至于它若不能渗透到经济其他领域反而会令人惊讶。(英文原话:If it's capable of building mountains... that just crystallizes how we should be thinking about a subject, that's just such a level of intelligence that then it starts to feel like it would be surprising if that didn't perme”

来源访谈 →

AI的下一个目标应是提出猜想、创造新定义并统一领域,这种能力难以被标准化为基准测试。

“好数学家证明定理,伟大的数学家提出猜想,而最伟大的则创造定义。创造新定义、统一领域的能力,是AI的下一个目标,且难以标准化为基准测试。”

来源访谈 →

形式化的重要性被高估:AI解决单位距离猜想用的是自然语言思维链而非Lean证明,但Lean的长期价值在于构建无需人工监督、可无限延伸的数学树。

“AI解决单位距离猜想时用的是自然语言思维链,而非Lean证明。但Lean的长期价值在于可构建无需人工监督的"无限延伸"的数学树,如同AlphaZero在高维空间自主进步。”

来源访谈 →

数学进步的两大引擎是可验证性与'可磨砺性':答案可自动验证,计算环境可无限容器化复制以支持大规模并行试错并解决信用分配,这是计算机使用等领域难以企及的。

“除数学问题的答案可自动验证外,其计算环境可无限容器化复制,支持大规模并行试错并解决信用分配。这是计算机使用等领域难以企及的。”

来源访谈 →

当AI能证明定理并给出清晰解释时,人类数学家的核心价值转向'策展人':判断哪些想法值得关注,并提供社会关系中的信任与激励,这是AI无法替代的。

“人类数学家的核心价值将在于判断"哪些想法值得关注",以及提供社会关系中的信任与激励。这是AI无法替代的。”

来源访谈 →

大规模问题必须靠极端协同设计解决,加机器就要追求远超线性的加速回报,否则会被Amdahl定律卡死整体效率。

“你加了一万台计算机,但你希望它能快一百万倍。”

来源访谈 →

预训练、后训练、测试时间扩展、智能体扩展四个Scaling Law形成循环,但归根结底智能的扩展最终取决于算力一项。

“归根结底,智能的扩展靠的是一样东西——算力。”

来源访谈 →

学术评审质量下滑、算法研究低垂果实被摘尽、加上基础设施决定实验成败的体感,使他从算法研究转向机器学习系统成为行业趋势下的必然转身

“学术评审质量下滑、算法研究"低垂的果实"被摘尽、以及基础设施决定实验成败的体感,共同推动了他从"算法雕刻"转向"系统构建"的必然转身。”

来源访谈 →

模型必须根据硬件特性与基础设施协同设计才能最大化效率,否则算法再好也难以落地

“硬件如自然资源,模型似发电机,推理引擎是电网。只有根据硬件特性设计模型结构,才能最大化"发电效率",否则算法再好也难以落地。”

来源访谈 →

DeepSeek算法团队懂系统、系统团队懂算法,其模型结构探索与推理系统优化形成强协同,是模型高效落地的重要支撑

“其算法团队懂系统、系统团队懂算法,在MoE等结构上的探索与推理系统的优化形成了强协同,是其模型高效落地的重要支撑。”

来源访谈 →

Token并非通用电能,每个模型的Token承载独特印记无法互转,推理引擎必须针对特定模型和硬件做深度适配与优化

“Token并非通用电能,每个模型的Token都承载其独特印记,无法互转。这决定了推理引擎需针对特定模型和硬件做深度适配与优化。”

来源访谈 →

构建与部署AI应用是AI工程师首要技能,除掌握LLM、RAG、智能体工作流等构建模块外,必须用统计技术度量、引导和治理AI系统

“人们对构建和部署AI应用的理解,包括AI的构建模块(如LLM、上下文工程、RAG、智能体工作流、机器学习和深度学习),以及重要的是,如何使用统计技术来度量、引导和治理AI系统,使其行为更可预测。”

来源访谈 →

有效的AI工程需要产品意识和业务理解,工程师应知道何时快速构建最小可行产品测试、何时放慢脚步精细构建

“有效的人工智能工程需要具备产品意识,理解业务背景和客户目标,以便参与塑造和推动构建过程。”

来源访谈 →

系统性偏差的危害远大于随机方差,因为方差可被平均化而偏差会复利式累积

“Bias much worse than variance - variance can average out, but bias compounds. —— 偏差比方差糟糕得多——方差可以被平均化,但偏差会累积。”

来源访谈 →

科学理论的验证周期可能长达数十年甚至数世纪,而且更好的理论在初期常常做出更差的预测。

“The verification loop for theories can be on the order of decades and centuries, and even then we know today as the better theory can often actually make worse predictions.——理论的验证周期可能长达数十年甚至数世纪,而且即便如此,我们如今知道,一个更好的理论在初期常常做出更差的预测。”

来源访谈 →

他指出插入流水线寄存器提高时钟频率存在经典权衡,因为吞吐量是每时钟周期完成的工作量与每秒时钟数的乘积,提频可能反而损害吞吐量

“It hurts your throughput, in fact, because the throughput of your chip is the product of how much you get done per clock cycle... times how many clocks you get per second.——它实际上损害了你的吞吐量,因为芯片的吞吐量是每个时钟周期完成的工作量乘以每秒的时钟数。”

来源访谈 →

当前Scaling Law无法弥合效率鸿沟,无限增加参数量也只能将所需数据减少约10倍,暗示人类智能可能遵循不同的缩放曲线。

“根据Scaling Law,即使无限增加模型参数量,也只能将所需数据量减少约10倍,远不足以弥合人类与AI之间数千甚至数百万倍的效率差距。这表明人类智能可能遵循不同的缩放曲线。”

来源访谈 →

尽管训练AI比训练人类低效得多,但AI能并行学习并把技能应用于数十亿次会话,从整体经济角度看依然划算。

“尽管训练AI完成特定任务比训练人类低效得多,但AI可以并行学习并将技能应用于数十亿次会话。因此,即使训练成本高昂,从整体经济角度看依然划算。”

来源访谈 →

Joon用1000名美国人的数字孪生验证模拟保真度:数字孪生以85%的准确率复现真人回答,达到了人类重复自身回答的准确率水平。

“为1000名美国人创建数字孪生,两周后让数字孪生预测这些真人在一系列测试中的行为,结果显示数字孪生能以85%的准确率复现人们自我重复的回答,这达到了人类重复自身回答的准确率水平。”

来源访谈 →

MCTS在每个决策点都能建议严格更优的动作,为训练提供清晰监督信号,绕过了LLM策略梯度RL面临的信用分配难题

“与LLM使用的策略梯度RL不同,AlphaGo的MCTS在每个决策点都能建议一个严格更优的动作,这为训练提供了一个清晰的监督信号,有效绕过了信用分配难题。”

来源访谈 →

池side预判AI的终极价值不来自编程、数学这类靠扩展智能可解的问题,而来自攻克癌症等依赖现实世界实验反馈的问题,目标是成为世界上最具价值的科学发现引擎。

“AI的终极价值将不来自'智能受限'的问题,而将来自'实验受限'的问题。”

来源访谈 →

池side认为当前配方下1-2万张GB300就能训练出媲美前沿的模型,但下一代前沿模型所需集群规模将再大一个数量级以上,递归自我改进将使物理算力需求前所未有地凸显。

“在当前模型配方下,使用1-2万张GB300就能训练出媲美当前前沿的模型。但下一代前沿模型所需的集群规模,将比这个数字再大一个数量级以上。”

来源访谈 →

与智力测试表现、受教育年限相关的基因组合频率在过去一万年系统性提升,整体效应量接近一个现代人群标准差,这与集体智能假说的预测相反。

“数据揭示了相反的事实:文明的开端反而增加了对智力的选择压力。”

来源访谈 →

记忆靠更多参数存储知识,而推理能力的提升依赖高质量后训练数据和有效深度,不再是简单堆参数

“记忆倾向于需要更多参数来存储知识;而推理则更依赖于高质量的后训练数据和有效深度”

来源访谈 →

训练环境可完全合成、大规模自动化生成,扩展后训练的难度重心已从模型转移到环境本身

“As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment.(随着智能体能力的提升,扩展后训练的大部分难度从模型转移到了环境本身。)”

来源访谈 →

一旦跨过知识容量阈值,长程推理等高级技能与总参数量关系不大,更多取决于训练质量和推理时的计算分配

“Advanced skills... require carrying long causal chains (20+ inference steps) without losing the thread. This ability does not live in total parameter count once a certain knowledge-holding threshold is reached.(高级技能……需要在不偏离主线的情况下进行长达20步以上的长因果链推理。一旦模型达到某个知识容量阈值,这种能力就不再体现在总参数量中了。)”

来源访谈 →

AI在数学内部的进步极不均衡,能力前沿呈分形式崎岖,有些问题远比其他问题容易

“这种前沿的'崎岖'具有分形特征,因为当你聚焦于数学内部的具体进展时,会发现有些部分要容易得多。("There's a fractal nature to that spikiness, because when you zoom into the specific progress within math, you have some things that are a lot easier than others.")”

来源访谈 →

连续物理系统模拟所需的分辨率会把上下文长度推到数千亿甚至万亿级别,远超现有Transformer的处理能力。

“"If each dimension is even a few hundred grid points... we're talking hundreds of billions to even a trillion context length." —— 如果每个维度哪怕只有几百个网格点……我们谈论的是数千亿甚至万亿级别的上下文长度。”

来源访谈 →

神经算子将数据与物理定律结合、直接对函数而非网格建模,在保留深度学习有效做法的同时使其更有原则性。

“"All of the things that work with deep learning, let's take them, but make them a bit more principled." —— 深度学习中所有有效的部分,让我们都拿来,但让它们更有原则性一些。”

来源访谈 →

融入物理结构能提升模型稳定性:直接在网格上做全球天气预测会很快失效,而基于球面谐波自然基函数的Fourier Neural Operator可保持长期稳定。

“以全球天气预测为例,直接在网格上建模会很快失效,而利用球面谐波这一自然基函数的Fourier Neural Operator(如FourCastNet)则能保持稳定,实现长期预测。”

来源访谈 →

构建通用物理基础模型不是抛弃扩展思路,而是另辟一条路:靠嵌入物理世界固有的结构,而非等待永远无法满足的海量数据。

“这并非要抛弃扩展思路,而是开辟一条不同的道路:通过构建物理世界固有的结构来达成目标,而非等待永远无法满足的海量数据。这是通往覆盖多种现象、兼具模拟与设计能力的物理基础模型的起点。”

来源访谈 →

更聪明的AI模型可能使算力价格飙升10倍,这可能彻底改变当前AI发展的经济基础

“"Why smarter AI models could drive up compute prices 10x" —— 为什么更聪明的AI模型可能使算力价格飙升10倍”

来源访谈 →

模型智能与算力需求之间存在非线性正反馈循环,使算力需求以超线性速度增长从而推高价格

“当模型变得更智能时,它能够设计出更高效的训练算法和架构,但这反过来又会提出更高的算力需求。这种循环会导致对算力的需求以超线性的速度增长,从而推高其价格”

来源访谈 →

智能提升的本质是算力密度增加:更大参数规模、更复杂训练和更长推理时间都直接提升算力单价

“更聪明的模型往往意味着更大的参数规模、更复杂的训练过程或更长的推理时间。这些都需要单位时间内消耗更多的计算资源,直接提升了算力的单价”

来源访谈 →

顶尖AI实验室为追求性能领先会不计成本采购和定制算力资源,这种竞争将在全球范围推高算力市场价格

“顶尖AI实验室为了追求模型性能的领先,会不计成本地采购和定制算力资源,这种竞争行为将在全球范围内推高算力的市场价格”

来源访谈 →

持续学习通过巨大切换成本将用户与模型深度绑定,为领先AI实验室建立类似云服务商的强护城河和高利润率

“一旦模型通过持续学习与用户深度绑定,切换AI就如同解雇一位熟悉公司情况数月的老员工并重新培训新人,成本巨大。”

来源访谈 →

模型越智能,同等数量算力的经济变现能力越强,这是算力价格将大幅上涨的关键驱动力。

““随着AI模型变得更智能,它们将能更好地变现同等数量的算力。”("As AI models become smarter, they'll better monetize the same amount of compute.")”

来源访谈 →

实验室赚取推理收入的核心意义不是盈利本身,而是说服投资者提供更多资金去购买算力、训练更大的模型。

““推理收入的意义在于说服投资者给你更多钱,去买更多算力来训练更大的模型。”("The point of inference revenue is to convince investors to give you more money to buy more compute to train bigger models.")”

来源访谈 →

算力价格高涨将通过阿尔钦-艾伦效应放大低效模型的浪费,使训练出最高效模型的实验室可收取极高溢价,拉大与追随者的差距、提升市场集中度。

“根据阿尔钦-艾伦效应,当算力成本高昂时,使用低效模型的“浪费”会更显著。这使得能训练出最高效模型的实验室可以收取极高溢价,从而拉大与追随者的差距,导致市场集中度提升。”

来源访谈 →

实验室本不愿增加推理算力占比以免更像云服务商而非前沿模型训练者,但推理收入增长快于训练算力投入,迫使它们分配更多资源服务现有模型以维持现金流。

“增加推理算力占比意味着实验室更像云服务商,而非前沿模型训练者,这与它们的雄心相悖。然而,推理收入增长快于训练算力投入,迫使它们必须分配更多资源来服务现有模型以维持现金流。”

来源访谈 →

OpenRouter每月处理的AI模型调用量已达250万亿token,较2月的50万亿大幅增长,体现极高的增长速度

“"OpenRouter is facilitating AI model usage at a rate of 250 trillion tokens per month, up from 50 trillion tokens per month in February."——OpenRouter目前每月处理的AI模型调用量达250万亿token,较2月份的50万亿token大幅增长。”

来源访谈 →

在模型和算力变得丰裕之后,团队同步的人类注意力成为唯一根本稀缺的资源,新挑战将从“如何让模型工作”转向“如何让人类高效监督和指导模型工作”

““唯一真正稀缺的东西,是我团队同步的人类注意力。”"The only fundamentally scarce thing is the synchronous human attention of my team."”

来源访谈 →

AlphaFold的成功主要归功于数十年实验积累的蛋白质数据库,AI只是整个故事的一小部分,它也不具有广义相对论那样的解释力。

“AlphaFold的成功主要归功于数十年实验积累的蛋白质数据库,AI部分是整个故事的一小部分。它不像广义相对论那样具有解释力,但可能包含许多可提取的“小解释”。”

来源访谈 →

计算机使用进展缓慢,是因为领域仅可验证还不够,还须能在确定性可重放的模拟器里大量并行“研磨”,而克隆常用应用目前费力且不可扩展。

“一个领域仅可验证还不够,还必须可“研磨”——能在确定性可重放的模拟器中进行大量并行演练。亚马逊不会允许你派一千个agent同时测试结账流程,而克隆常用应用在目前仍费力且不可扩展。”

来源访谈 →

未来LLM可能构建现实模拟并在其中无限排练技能,以更少真实数据换取海量模拟体验,成为预训练、RL、推理时计算之后的第四扩展轴。

“未来LLM可能构建现实模拟并在其中无限排练技能,从真实数据中消耗更少却获得海量模拟体验。若实现,这将成为继预训练、RL、推理时计算后的第四扩展轴。”

来源访谈 →

批处理规模是决定推理成本与延迟的最大变量,最优批大小约等于300乘以模型稀疏度,与模型绝对规模无关。

“若不进行批处理,单用户推理的经济性会比批处理差约千倍;而批处理大小的最优值约等于300乘以模型稀疏度,与模型绝对规模无关,实践中通常取该值的2-3倍。”

来源访谈 →

单次推理存在由硬件决定的延迟下限,因为必须把全部模型权重从内存读入芯片,这一时间无法绕过。

“单次推理存在延迟下限,由硬件决定:必须将全部模型权重从内存读入芯片,这一内存搬运时间无法绕过。典型GPU集群的HBM容量除以带宽约为15-20毫秒。”

来源访谈 →

稀疏专家模型虽能大幅降低计算量,但增加内存容量与通信开销,扩大64倍总参数仅等效于4倍活跃参数的质量提升,并非免费午餐。

“经验数据显示,将总参数扩大64倍仅能等效于4倍活跃参数的模型质量提升,因此稀疏化并非免费午餐。”

来源访谈 →

当前最大推理与训练集群的规模受限于机架内scale-up域大小,机架内互联带宽的提升是模型规模继续增长的物理前提。

“从Hopper的8卡到Blackwell的72卡,再到Rubin的500+卡,机架内互联带宽的提升是模型规模能够继续增长的物理前提。”

来源访谈 →

流水线并行只能分摊权重内存而无法分摊KV缓存,后者随批大小线性增长,因此成为推理场景的内存瓶颈。

“流水线并行只能分摊模型权重的内存占用,却无法分摊KV缓存的内存需求。因为KV缓存随批处理大小线性增长,与流水线深度无关,这使得推理场景中KV缓存成为内存瓶颈。”

来源访谈 →

模型上下文长度在100K-200K停滞一两年,说明这正是内存带宽与计算的合理成本平衡点,瓶颈不在算力。

“I think it's like if you look at the history of context lengths of models... they shot up from about 8K to 100K 200K and then for the last year or two they've all been hovering around there. I think that actually indicates that that's sort of the reasonably balanced cost point. —— 上下文长度从8K跃升至200K后便停”

来源访谈 →

AI获得常识不应依赖严格监督的数据,而应把世界视为海量交互经验,从众多可能的事物实例中学习。

“也许我们真正需要做的是,将世界更多地视为一种海量的经验,它不一定提供任何严格的监督,而是提供了许多可能的事物实例。”

来源访谈 →

优秀的理论本质上是对海量观测数据的高效压缩

“一个理论就是对宇宙的压缩。”

来源访谈 →

巨大的神经网络仅靠相对少量的数据和随机梯度下降就能有效学习,彻底颠覆了传统机器学习教科书关于参数数量、样本量与非凸优化的所有警告。

“机器学习本质上是一门关于"粗糙"的科学。Machine learning is the science of sloppiness really.”

来源访谈 →

解耦不应止于让表征空间中的因果变量彼此独立,还要把关联这些变量的规则或机制也解耦开来,从而赋予模型更强的组合泛化能力、避免灾难性遗忘并适应分布变化。

“不仅要让表征空间中的因果变量彼此独立,更要将关联这些变量的“规则”或“机制”也解耦开来。”

来源访谈 →

AI的核心问题是概念的可靠表示,若能构建系统可靠识别字母A的所有变体,就抓住了智能问题的根本

“The central problem in AI is what is the letter A. If you can build a system that reliably can detect all the variations of the letter A, you don't even need to go to the B and the C. —— AI的核心问题是‘字母A是什么’。如果你能构建一个系统可靠地检测出字母A的所有变体,你甚至不需要处理B和C。”

来源访谈 →

强化学习的本质是合成数据生成:用大量计算配合验证器筛选出好数据,再让模型像预测下一个词那样学习这些正确轨迹。

“强化学习本质是合成数据生成:通过大量计算配合验证器,筛选出"好数据",再像预测下一个词那样训练模型学习这些正确轨迹。”

来源访谈 →

分布外思考是AI的瓶颈;Dwarkesh Patel预测2027年人类软件工程师需求反会因AI互补而增加,实验室的解法是先自动化AI研究再解决样本效率问题。

“软件工程等职业需频繁应对分布外问题;作者预测2027年人类软件工程师需求反会因AI互补而增加,而实验室的解法是先自动化AI研究,再解决样本效率问题。”

来源访谈 →

他认为训练与推理在极限情况下理论上应融合,未来模型可能通过“在职学习”在执行实际任务的同时进行学习,以突破仅靠人造训练环境带来的增长瓶颈。

“未来,模型可能通过"在职学习"——在执行实际任务的同时进行学习——来突破仅靠人造训练环境带来的增长瓶颈。”

来源访谈 →

实验室约30-50%算力用于推理,但产生的“在职经验”未回馈给模型权重,是极大浪费,而部署中的真实互动信息才是最宝贵的学习素材。

“目前,约30-50%的AI实验室算力用于推理,但这些算力产生的“在职经验”并未有效回馈给模型权重,这是极大的浪费。部署中产生的真实世界信息(模型如何被使用、犯了什么错)恰恰是最宝贵的学习素材。”

来源访谈 →

当前AI变聪明的方式(被训练完成编程等高经济价值任务)与获取权力的相关性并不强,AI擅长的抽象推理和现实中塑造权力的因素不是同一回事。

“目前AI变聪明的方式(例如被训练来完成编程等特定高经济价值任务)与获取权力的相关性并不强。AI擅长的抽象推理能力,与现实中塑造权力的因素(如魅力、授权)并非同一回事。”

来源访谈 →

Michael Li认为AI实验室靠API提供基础模型服务可能永远无法收回训练成本,应像香港地铁靠车站周边地产盈利那样,捕获发生在模型“周围”的价值增值

“The labs that survive won't be the ones that make the API profitable. They'll be the ones that identify their property above the station and build toward it now. —— 能存活下来的实验室不会是那些让API盈利的。而是那些能识别出自己“车站上方的物业”并立即着手建设的实验室。”

来源访谈 →

网络数据只反映人们说了什么而非做了什么,必须依靠随机对照实验和A/B测试让模型理解因果关系和反事实情境。

“网络数据本质是"人们说了什么"而非"做了什么"。Simile不仅收集交易和观察数据,更大量依赖随机对照实验和A/B测试,以训练模型理解因果关系和反事实情境。”

来源访谈 →

预训练数据过滤是成本最低且被低估的安全干预手段,能在不显著影响模型能力的情况下过滤危险数据,FAR AI计划投入约200万美元验证。

“这是成本最低且被低估的干预手段,在预训练阶段直接过滤危险数据,不会对模型能力造成显著影响。FAR AI正计划投入约200万美元进行大规模验证实验。”

来源访谈 →

从零开始构建大模型可能是理解其工作原理的最佳方式,因为代码精确且不说谎

“代码是精确的,它不会说谎。从零开始构建大模型可能是理解其工作原理的最佳方式。”

来源访谈 →

所有形式的扩展定律依然有效,只是预训练的低成本果实大多已被摘取

“我认为所有形式的扩展定律依然有效,只是预训练的低成本果实大多已被摘取。”

来源访谈 →

美国需要一家千亿美元甚至万亿美元级别的开源模型公司,开源可通过收入分成或作为企业AI战略咨询引流实现可持续盈利

“美国需要一家千亿美元甚至万亿美元级别的开源模型公司。开源商业模式可通过收入分成或作为企业AI战略咨询的引流工具来实现可持续盈利。”

来源访谈 →

个体行为高度重复,用简单计数统计即可高精度预测人的下一步行为

“任何个体都具有惊人的可预测性,因为你总是在重复做同样的事情。(“Any given individual is remarkably predictable. Because you keep doing the same things over and over again.”)”

来源访谈 →

当前机器学习研究过度工程化、局限于孤立任务,AI系统必须在真实混沌环境中长期生存学习

“要实现真正的进步,必须让AI系统在真实、混沌、不可控的环境中长期(数月)生存和学习,即使这意味着研究周期会被拉得很长。”

来源访谈 →

机器学习不只是应用统计学的计算方法,把它完全归入统计学并不那么有用

“化学只是物理学,但我认为将化学仅仅视为物理学并不那么有用。(Chemistry is just physics, but I don't think it's as useful to think about chemistry as being just physics.)”

来源访谈 →

科研的回报机制是出色的工作换来更多工作

“出色工作的奖励是更多的工作,糟糕工作的奖励是更少的工作。(The reward for good work is more work. The reward for bad work is less work.)”

来源访谈 →

心理学等领域的复制危机主要出在“被试间”实验上:研究者本人处于“被试内”视角,因而对“被试间”实验的效应强度和可预测性产生严重误判。

“问题主要出在“被试间”实验上。研究者本人处于“被试内”视角(能清晰感受两种条件的对比),但这使得他们对“被试间”实验(不同的人处于不同条件)的效应强度和可预测性产生严重误判。”

来源访谈 →

顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。

“顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。”

来源访谈 →

Amodei 认为改进模型某一特性却使另一特性退化的现象,是未来 AI 控制问题的当前模拟,从今天起就可以着手研究。

“你让一件事变好,却让另一件事变糟。这是未来 AI 控制问题的当前模拟,我们今天就可以开始研究它。”

来源访谈 →

DeepSeek V3与R1同源不同路:V3是基础模型经标准指令微调的聊天模型,R1则是经全新推理训练、回答前展示思维链的推理模型。

“DeepSeek V3的基础预训练完成后,他们做了两种不同的后训练:一种是创建标准的指令微调模型V3,另一种是通过新的推理训练创建R1。”

来源访谈 →

DeepSeek高效训练的两大技术支柱是混合专家模型(只激活参数子集,如671B参数中仅激活37B)和自创的多头潜在注意力机制。

“混合专家模型(MoE)通过每次只激活参数的一个子集,大幅降低了训练和推理成本。”

来源访谈 →

以AlphaEvolve为例主张将大语言模型等基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。

“将基础模型与进化搜索、蒙特卡洛树搜等经典计算技术结合,是探索新知识、超越现有数据边界的重要方向。”

来源访谈 →

AlphaFold将蛋白质结构预测从博士生耗时数年缩短到数秒,并已预测人类全部2万种蛋白质,是DeepMind迄今最复杂最有意义的系统

“AlphaFold是我们迄今为止构建的最复杂、也可能最有意义的系统。”

来源访谈 →

构建庞大且完全一致的知识库是不可能的,Cyc改用局部一致性模型以容忍现实中的细微矛盾和例外

“我们不得不放弃全局一致性。这有点像地球表面整体是球形的,但你每天的生活都像是在平地上进行。”

来源访谈 →

GPU价值不应按折旧周期衡量,而看能产出多少高质量token,旧H100因算法进步单位价值反而随时间上升。

“一台H100今天的价值比三年前更高。(An H100 is worth more today than it was 3 years ago.)”

来源访谈 →

尽管可以读取GPT模型的每个参数,我们对模型内部运作的理解远不如对人脑的理解,需要大量跨学科研究、可能数十年才有进展

“A blank map does not correspond to a blank territory.——空白的地图不等于空白的疆域。(意指我们不理解内部运作,不代表内部没有运作。)”

来源访谈 →

把搜索成果蒸馏回策略网络,可将1000步搜索摊销进前向传播,实现测试时计算与训练时计算的相互替代。

“这几乎就像,如果你能把最初1000步搜索的成果摊销进策略网络而非搜索过程本身,你就能从一个好得多的起点出发。(It's almost like if you could just, you know, amortize the first 10,00 steps actually into the policy network instead of the search process, then you could begin at a much better starting point.)”

来源访谈 →

从零训练AlphaGo的关键是先获得可靠的价值函数,再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。

“从零训练AlphaGo的关键是先获得可靠的价值函数。初期可使用专家棋谱或小型棋盘随机对弈预训练,待终局价值判断准确后再引入MCTS自我对弈,否则搜索基于垃圾估值将毫无意义。”

来源访谈 →

极限协同设计是应对AI规模化的必然选择——当问题规模超越单台计算机的加速能力时,必须打破学科壁垒对整个技术栈端到端协同优化,才能突破阿姆达尔定律的限制、实现超越线性增长的扩展

“英伟达必须打破学科壁垒,协同优化整个技术栈,以实现超越线性增长的计算扩展。”

来源访谈 →

计算架构的生命力在于庞大装机量,在消费级GeForce显卡上搭载CUDA虽导致市值从约80亿美元跌至15亿美元,却将CUDA普及至全球研究人员手中,为深度学习革命奠定基石

“The install base defines an architecture, not everything else is secondary. —— 装机量定义了一个架构,其他一切都是次要的。”

来源访谈 →

AI扩展并未遇到数据耗尽等根本性瓶颈,推理即思考且计算强度极高,扩展已形成预训练、后训练、测试时计算与智能体扩展的持续增强循环,最终受限因素是算力而非数据或架构

“Inference is thinking, and I think thinking is hard. Thinking is way harder than reading. —— 推理就是思考,而我认为思考是困难的。思考比阅读要难得多。”

来源访谈 →

AI研究的重心将从算法工程转向目标函数工程,设计者要在想要什么与优化器能做什么之间取得平衡

“We're going to go from being people who engineer algorithms to being people who engineer objective functions. ——我们将从编写算法的工程师,转变为设计目标函数的工程师。”

来源访谈 →

有效使用智能体编程已成为每位开发者的关键技能,需要建立对智能体工作原理的心智模型,了解其局限并灵活引导

“如今,有效使用智能体编程已成为每位开发者的关键技能。当你具备这项技能时,你对智能体的工作原理有一个良好的心智模型。”

来源访谈 →

Greenblatt认为AI研发具有高可验证性与迭代性,一旦AI匹配顶尖人类专家就可能触发递归自我改进的反馈循环,一年内实现四到五年的AI进展。

“我的中位数预期是,AI可能在一年内取得相当于四到五年的人类AI进展。(My median expectation is something like four or five years of AI progress in a single year.)”

来源访谈 →

实验室为获取主导地位必须以远高于当前水平的价格竞标算力,这将推高整个市场的算力价格。

“实验室为获取主导地位,必须以更高价格(如每兆瓦2500万至5000万美元)竞标算力,这将推高整个市场的算力价格。”

来源访谈 →

价值正从硬件供应链向模型层和最终用户转移,实验室以低成本创造高价值,但大部分价值最终被用户获取。

“实验室目前能以10-15的成本创造50-100的价值,但大部分价值最终被用户(如Jane Street、Meta)获取。”

来源访谈 →

FSDP规模化受通信交叉点和批大小双重限制,超过交叉点后训练效率急剧下降

“随着GPU增多,计算时间缩短而通信时间不变,会达到一个计算与通信时间相等的“交叉点”,超过此点后训练效率将急剧下降。”

来源访谈 →

事前无法预知哪个研究方向更富成效,因此需要同时对所有研究方向进行投资。

“What I'm trying to say is that ex ante, one couldn't have known which research program would be more productive. We need to invest in all of them concurrently.——我想说的是,事前无法预知哪个研究方向会更富成效。我们需要同时对它们进行投资。”

来源访谈 →

由于重大概念性突破无法即时验证,无法轻易为其训练强化学习循环。

“What this means for AI for science is that 1. You can't easily train an RL loop for big conceptual breakthroughs.——这对AI科学应用意味着:第一,你无法轻易为重大的概念性突破训练一个强化学习循环。”

来源访谈 →

GLM-5.3的能力飞跃并非来自更大规模的基础模型预训练,而是完全依靠扩展后训练

“Scaling post-training is all we did for GLM-5.3.(扩展后训练是我们为GLM-5.3所做的全部工作。)”

来源访谈 →

优化智能体的工作流程、工具使用和状态管理,正变得与优化模型智商同等重要

“表明优化智能体的工作流程、工具使用和状态管理正变得与优化模型智商同等重要。”

来源访谈 →

不应盲目相信厂商发布的基准测试数字,评分器中的小错误就可能使得分从65%飙升至93.6%,开发者应运行自己的评估

“评分器中的小错误或可导致系统得分从65%飙升至93.6%,呼吁开发者应运行自己的评估,而非盲目相信营销数字。”

来源访谈 →

随着大模型API商业化进入深水区,焦点转向通过推测解码、量化等优化在单卡或有限硬件上实现高吞吐、低成本的本地化部署

“社区关注的焦点集中在如何通过推测解码、量化等基础设施优化,在单卡或有限硬件上实现高吞吐、低成本的本地化部署。”

来源访谈 →

Reiner Pope认为低精度算术在神经网络中如此成功的唯一原因,是乘加电路规模随位宽呈简单的二次方关系,累加需要更高精度应对误差累积

“This is the single reason low-precision arithmetic has worked so well for neural nets.——这是低精度算术在神经网络上如此有效的唯一原因。”

来源访谈 →

行为基础模型必须像普通人一样带有偏见与非理性地'犯错',这与追求超级理性的前沿大模型完全不同,后者模拟特定人群行为时准确率可能低至20%-30%。

“"The models that we are trying to create are models that are as dumb as I am. So if I make some mistakes, the model has to make the same mistake." ——我们试图创造的模型,是要和我一样‘笨’的。如果我犯了错,模型也必须犯同样的错误。”

来源访谈 →

围棋决策树过于庞大无法穷举,价值网络与策略网络通过压缩搜索的宽度和深度使问题变得可解

“围棋的决策树过于庞大,无法穷举搜索。AlphaGo通过价值网络(快速评估棋局胜率)和策略网络(推荐可能的好棋)极大地压缩了搜索的宽度和深度,使问题变得可解。”

来源访谈 →

自我对弈生成数据并把MCTS的更强策略蒸馏回策略网络,相当于把搜索的计算量预先烘焙进网络的直觉

“系统通过自我对弈生成数据,并将MCTS搜索得到的更强策略“蒸馏”回策略网络。这相当于将搜索的计算量预先“烘焙”进网络,使网络本身的“直觉”越来越强。”

来源访谈 →

数据与计算预算决定架构取舍:有限条件下ResNet的局部归纳偏置优于Transformer,需要全局上下文理解时Transformer潜力更大

“在数据和计算有限的实验中,ResNet的局部归纳偏置使其表现优于Transformer。但随着对全局上下文理解需求的增加(如大规模棋盘、不完全信息游戏),Transformer的潜力更大。”

来源访谈 →

LLM已能较好地自动化实验实现、运行和超参数优化等执行环节,但选择研究问题、突破研究僵局等创造性决策目前仍显不足

“LLM可以较好地自动化实验实现、运行和超参数优化等环节,但在选择研究问题、突破研究僵局等需要判断力的创造性工作上,目前仍显不足。”

来源访谈 →

借助LLM编程,过去需要DeepMind整支团队和数百万美元的研究工作,如今几千美元租用算力即可完成

“得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。”

来源访谈 →

创始人指出过去三年半方向正确但资本需求呈垂直增长,前沿模型训练面临资本与物理资源的双重天花板,曾因6周窗口期内未能筹到20亿美元而错失4万卡GB300集群。

“去年底,他们曾有一个6周窗口期需筹集20亿美元购买即将上线的4万卡GB300集群,但未能及时完成,从而失去了该集群。”

来源访谈 →

复杂性状的进化受限的关键是时间而非仅是种群大小:微效多基因性状可在数百到数千年内推向新的适应性平衡点,而青铜时代全球人口增长至约5000万,消除了乳糖耐受这类需等待特定新突变的突变等待时间限制。

“进化受时间限制,而非仅受种群大小限制。”

来源访谈 →

参数量单独讨论已失去意义,必须结合数据量、计算投入和部署运行条件一起衡量

“Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions.(参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。)”

来源访谈 →

模型扩展应看五个关键维度,除参数量外还包括数据、计算、部署条件以及MoE稀疏度

“提出了模型扩展的五个关键维度,除了传统的参数量,还包括数据、计算、部署条件等。他特别提到了混合专家模型(MoE)的稀疏度,并引入了新的“XA-YB”表示法来规范描述”

来源访谈 →

若算力成本真的飙升10倍,大规模自动化、个人AI助手等低成本推理应用的经济可行性将受严峻考验,行业必须寻找新的价值创造模式

“如果算力成本真的飙升10倍,那么当前许多基于低成本推理的应用场景(如大规模自动化、个人AI助手)的经济可行性将受到严峻考验,行业必须寻找新的价值创造模式”

来源访谈 →

价值对齐是从基因演化延续到公司治理与AI的根本问题,关键在于为强大的造物持续建立正确的激励与制衡机制。

“一切都在于建立正确的激励机制。(英文原话:It's all about putting the right incentives in place.)”

来源访谈 →

部署即训练会形成强者愈强的飞轮效应,实验室将被迫更早推出最聪明的模型以抢占学习先机

“当部署即训练,拥有最佳模型的实验室会获得更多用户、更复杂的任务和更高质量的反馈,从而加速模型进化。”

来源访谈 →

算力供应年增3倍的增长已接近极限,AI对尖端晶圆的占用比例到2027年底将饱和,产能难以快速扩张。

“当前算力年3倍的供应增长(来自摩尔定律、新晶圆厂建设、AI抢占晶圆份额)本身已接近极限。其中,AI对尖端晶圆的占用比例预计在2027年底将达到饱和,进一步扩张产能困难。”

来源访谈 →

算力变贵后,目前依赖低价计算的低价值应用(如低质量短视频生成)将因经济性不足被市场淘汰,算力将优先流向高经济价值任务。

“当算力变得昂贵,目前依赖低价计算资源的应用(如低质量短视频生成)将因经济性不足而被市场淘汰。算力将优先用于能产生更高经济价值的任务。”

来源访谈 →

模型训练的一次性成本可摊薄至所有用户,这种强规模经济意味着少数领先智能模型将主导市场,他对此可能带来的巨大权力集中表示担忧。

“模型训练是一次性成本,可摊薄至所有用户,这种强大的规模经济效应意味着少数领先的智能模型将主导市场。Patel对此表示担忧,因为它可能导致巨大的权力集中,尽管他承认这是当前的技术经济现实。”

来源访谈 →

智能体2025年末可用性提升并非某个模型突然变强,而是模型能力曲线与框架需求曲线在恰当时机相交的结果

““到底发生了什么?”的答案不完全在于模型权重,而在于围绕权重发展起来的整个系统。"The answer to 'What happened?' isn't solely in the model weights. It's in the system that grew up around the weights."”

来源访谈 →

框架能力正通过训练被吸收进模型权重,形成“训练-吸收-精简”循环,删除与吸收过程结束后剩下的是权限、身份、信任等以人类为中心的能力

““模型权重接下来会吸收什么?……在这个删除和吸收过程结束后,剩下的是以人类为中心的智能体能力。比如权限、身份、信任和可解释性。”"What do the model weights absorb next? ... What's left at the end of this deletion and absorption process are the human-centric agent capabilities. Things like permissions, identity, trust and legability."”

来源访谈 →

当模型吸收完所有面向计算机的能力后,剩余的框架将专注于管理人类注意力,成为模型与操作它的人类之间的核心接口

““框架变成了模型与我们人类注意力之间的接口。它成了‘注意力接口’。”"The harness becomes the model's interface to our human attention. It becomes the attention-interface."”

来源访谈 →

针对推理模型隐藏思维链的加密防线已被首次大规模攻破:加密推理过程可被解码、跨模型/会话/用户移植,并能显著提升开源模型性能。

“我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。”

来源访谈 →

依赖隐藏思维链进行对齐监控或安全审计并不可靠,实验室需在沙盒、遥测和工具界面等方面建立更强的保障机制。

“此次事件进一步证明,依赖隐藏的思维链进行对齐监控或安全审计是不可靠的。”

来源访谈 →

解码提取的推理过程是真实的隐藏思维,而非伪造内容:其推理令牌计数与计费的API思考令牌在大多数查询上1:1匹配。

“我们验证了对于大多数查询的提示,我们的推理令牌计数与计费的API思考令牌1:1匹配。”

来源访谈 →

Imas认为经济学家个体预测分歧巨大且历史记录不佳,又缺乏需求弹性等关键数据,应放弃猜测单一未来,转向构建不同情景并分析每种情景下的稀缺性维度。

““If you don't take anything else out of this conversation from me: We don't have any data.”——“如果你们从我的发言中只记住一点:我们缺乏数据。””

来源访谈 →

上下文学习若足够强大,可把新员工约6个月才能掌握的经验压缩进上下文窗口,从而无需将部署所学蒸馏回权重。

“如果上下文学习能力足够强大,就能将新员工入职6个月才能掌握的经验压缩进上下文窗口,而无需将部署中学到的知识蒸馏回权重。”

来源访谈 →

人类持续学习是把正确直觉和宏观理解“凿”进权重而非逐字记住经历,而模型梯度更新极度样本低效,已部署的在线学习模型需从数百万用户学习完全相同的内容。

“人类持续学习不是逐字记住全部经历,而是将正确直觉和宏观理解“凿”进权重。模型的梯度更新极度样本低效,已成功部署的在线学习模型都需从数百万用户中学习完全相同的内容。”

来源访谈 →

模型越智能对攻击的抵抗力越强,但被利用后可造成的损害也越大,安全挑战随模型智能同步升级。

“模型越智能,对攻击的抵抗力越强,但可能造成的损害也越大。”

来源访谈 →

算法主导的深度学习并非唯一路径,符号处理领域仍是待开发的“处女地”,当前主流范式未必是终极答案。

“她惊讶于深度学习等算法成为主流,并认为符号处理领域仍是待开发的“处女地”。”

来源访谈 →

流水线并行只能解决模型权重的容量问题,带宽问题必须靠扩大机架内scale-up互联规模来解决。

“Pipelining totally solves the capacity problem, but scale up size helps solve the bandwidth problem. —— 流水线并行完全解决了容量问题,但扩大机架内互联规模才能解决带宽问题。”

来源访谈 →

深度学习只是以一定准确率解决了标注问题,并未解决符号与真实世界物体之间稳固关联的落地问题。

“The labeling problem was solved with some percentage accuracy which is different from the grounding problem.(标注问题以一定准确率得到了解决,但这与符号落地问题截然不同。)”

来源访谈 →

环境越开放、不可预测的意外事件越多,机器人相对人类的能力差距就越大,凸显人类强大的泛化能力。

“世界上可能发生的意外事件越多,这个差距就越大。”

来源访谈 →

某些数学问题的复杂度会迅速增长,无法靠直接暴力计算解决

“某些数学问题会迅速变得难以通过直接暴力计算来解决。”

来源访谈 →

为机器设计目标函数是延续千年的古老问题而非AI新挑战,人类社会早已通过法律这种代码来约束行为,计算机科学与立法科学终将汇合。

“我们已经制定了数千年的法律,而这(设计目标函数)正是它在做的事。We've been writing laws for millennia, and that's exactly what it is.”

来源访谈 →

当前强化学习和纯监督学习效率低下,源于缺乏对世界运作的直觉模型;自监督学习通过预测视频帧、填补文本缺失让模型掌握世界内在规律与不确定性,是通往更智能系统的必由之路。

“我们拥有对世界的预测模型,其中包括在不确定性下进行预测的能力。We have predictive models of the world that include the ability to predict under uncertainty.”

来源访谈 →

当前循环神经网络在数百个时间步后性能显著下降,而人脑能对跨越任意长时间的事件做信用分配,这得益于大脑高效且有针对性的遗忘机制以及意识与情感对信息存取的作用。

“当前的循环神经网络在处理数百个时间步后性能会显著下降,而人类能够对跨越任意长时间的事件进行信用分配。”

来源访谈 →

在海量数据上训练的神经网络只获得了非常基础、底层的理解,既不鲁棒也远不及人类理解的抽象性与通用性,因此训练方式需要根本性变革,更关注因果解释而非仅仅关联数据。

“在海量数据上训练的神经网络仅获得了非常基础、底层的理解,远不及人类理解的抽象性与通用性。”

来源访谈 →

突破深度学习根本局限的关键在于设计新的训练目标与框架,让智能体从被动观察数据转向主动干预和探索以学习因果,而非单纯把网络层数从百层增加到万层。

“我认为关键在于训练目标和训练框架...要从被动观察数据转变为通过干预世界来学习的主动智能体。”

来源访谈 →

RCN在前馈结构基础上增加反馈与侧向连接,核心优势是能进行动态推理,而非像传统神经网络那样依赖训练时的摊销推理

“其核心优势在于能够进行动态推理,而非像传统神经网络那样依赖训练时的“摊销推理””

来源访谈 →

验证码是检验人类级泛化能力的理想基准,当前深度学习无法做到五岁孩子那样的零样本泛化,而破解验证码需要将局部证据置于全局上下文推理

“验证码设计初衷就是对人易、对机器难。一个五岁的孩子可以无需针对特定风格的训练就解决新的验证码,而当前的深度学习系统无法做到这种零样本泛化”

来源访谈 →

开放模型仅落后前沿四个月,是因为数据是进步的主要驱动力且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。

“数据是进步的主要驱动力,且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。”

来源访谈 →

模型路由成为企业热点议题的核心驱动力是成本,前沿模型使单用户年成本可能上升10到20倍。

“为什么人们在谈论模型路由?为什么他们对此感到兴奋?主要是因为成本。”

来源访谈 →

仅几个月间开源模型从几乎无人使用变为大多数企业AI战略的关键组成部分,原因是成本飙升。

“如今在大多数企业中,开源模型已成为其AI战略的关键组成部分”

来源访谈 →

仅靠少数公式与简化的Roofline性能模型,就能推断出各大实验室正在做的很多工程选择。

“仅凭几个公式和一块黑板,我们竟能推断出实验室正在做的很多事情,这令人震惊。(英文原话:It's shocking how much you can deduce about what the labs are doing from a handful of equations and a blackboard)”

来源访谈 →

一个领域仅可验证不足以让RLVR快速进展,还必须“可重复刷”——能大规模并行、确定性复现地创建训练环境。

“It is not enough for a domain to be verifiable. It also has to be very grindable. —— 一个领域光是可验证还不够,它还必须非常“可重复刷”。”

来源访谈 →

质疑短期RL训练能否泛化到构建企业等长期、非结构化的复杂任务,并认为Dario Amodei的言论也暗示这种泛化并非无限强。

“Maybe I'm reading too much into it but he seems to be saying that short-horizon RL training doesn't necessarily generalize to long-horizon RL performance. —— 也许我解读过度了,但他似乎在说,短期强化学习训练不一定能泛化到长期性能。”

来源访谈 →

提出在线策略自蒸馏(OPSD)作为无需外部验证奖励的持续学习方法:让基础模型模仿长会话中积累丰富上下文的“资深”模型,比SFT更优。

“让基础模型去模仿那个在长会话中积累了丰富上下文的“资深”模型所做出的预测。这比监督微调(SFT)更优,因为它只提取达到正确结果所必需的知识,避免了死记硬背整个会话记录。”

来源访谈 →

预计到2027年底,AI的主要提升将不再来自发布前的训练,而是来自全球广泛部署中积累的经验,每次与用户交互都会让AI更聪明。

“到2027年底,AI的主要提升可能不再来自发布前的训练,而是来自其在全球广泛部署、处理各类任务时积累的经验。每次与用户交互,AI都会变得更聪明,因为它不仅学习了你的历史,也学习了它与全球其他所有用户的互动。”

来源访谈 →

Tedrake认为深度学习让一些事情变得太容易,下一代不再因采用严谨方法获得即时回报,担心严谨推理训练的传承因此受损。

“我只是觉得深度学习让一些事情变得太容易了,以至于我们的下一代不会立即因采用更严谨的方法而获得回报,然后我想知道这会把我们带向何方。”

来源访谈 →

AI已把产生想法和假设的成本降到几乎为零,但低成本产出不自动创造价值,科学的新瓶颈在于从海量自动生成的理论中筛选出真正有效的部分

“AI基本上已经把产生想法的成本降到了几乎为零。(AI has basically driven the cost of idea generation down to almost zero.)”

来源访谈 →

AI目前只能解决一次性问题,无法像人类登山者那样在部分进展的基础上持续构建,这限制了它在真正复杂问题上的表现

“它像是能跳2米高的机器,能越过一些低矮墙头,但不会像人类登山者那样在岩壁上留下抓点、逐步攀爬。”

来源访谈 →

对数学策略的半形式化语言是未来重要方向,现有工具能形式化证明本身,但缺乏形式化策略、猜想可信度与部分进展价值的框架,AI难以参与最富创造性的研究环节

“Lean等工具已能形式化证明本身,但如何形式化“策略”、“猜想的可信度”、“部分进展的价值”仍是未知。缺乏这种框架,AI难以真正参与数学研究中最富创造性的环节。”

来源访谈 →

合成面板(模拟人群)将超越传统人工面板,因为它能解锁当前95%因成本或能力限制而无法进行的实验。

“合成面板(模拟人群)将超越传统人工面板,因为模拟能解锁当前95%因成本或能力限制而无法进行的实验,让社会不再依赖直觉决策。”

来源访谈 →

提出任何自然界的稳定模式都可能被经典学习算法高效建模,为AI应用提供理论框架

“"Any pattern that can be generated or found in nature can be efficiently discovered and modeled by a classical learning algorithm."”

来源访谈 →

stance: AI正通过发现猜想和利用形式化验证软件进行强化学习,成为数学研究的新工具。

“quote: "If you want to teach an AI to do math... You can do this with math in a way you can't do with other fields."”

来源访谈 →

Agent与大模型是交替演进、相互促进的,Agent的瓶颈会驱动大模型迭代,而大模型的能力突破又为更复杂的Agent提供基础。

“我觉得Agent和大模型他们的发展应该是一种交替发展的一种模式。就是可能大模型发展到一个程度,那我基于这个程度我去发展我能解决实际问题的Agent框架。然后这个时候你会发现这里面有些关键的技术或者原则化的能力,我其实可以内嵌到大模型里面,让它将来能够有更高的效率来发挥作用。”

来源访谈 →

部门级AI模型的甜点区间在30B到80B参数,行业趋势正从稠密模型转向更适合在有限算力上部署的混合专家模型(MoE)。

“部门级AI模型的甜点区间在30B到80B参数。行业趋势正从稠密模型转向混合专家模型(MoE)...更适合在算力有限的部门级硬件上部署。”

来源访谈 →

用户会持续使用某个模型直到它出问题,然后才去探索其他选项,这和大家使用任何工具的方式一样

“使用模型直到它出问题,然后你就去探索其他选项。这和我们使用任何工具的方式一样。”

来源访谈 →

中国开源模型已首次在部分任务上超越美国闭源模型,中国实验室展现出超越蒸馏之外的独特能力

“中国开源模型首次在部分任务上超越美国闭源模型,打破了“中国只会蒸馏美国模型”的叙事。虽然蒸馏仍是训练流程的一部分,但中国实验室已展现出超越蒸馏之外的独特能力。”

来源访谈 →

至少75家Neo Labs中约三分之二将一文不值或仅以人才收购方式被廉价收购,仅靠发布模型已不够,必须证明有可持续收入

“There's at least 75 Neolabs for sure. Like 2/3 of those are going to be worth nothing. —— “至少确定有75家Neo Labs,其中大约三分之二将一文不值。””

来源访谈 →

所有编程工作都将流经大模型,这要求全新的编程环境和编程方式,而非孤立的插件式解决方案。

“我们感觉这不仅仅是一个孤立的解决方案,而是所有的编程工作都将通过这些模型进行。这要求一种全新的编程环境和一种全新的编程方式。(英文原话:"It felt like this wasn't just going to be a point solution thing, this was going to be all of programming was going to flow through these models. It felt like that demanded a different type of programming environment, a different t”

来源访谈 →

若人类级软件工程师能在单张H100同级算力上运行,按当前薪资水平该卡年租金应超25万美元,即现价15倍以上。

“若人类级软件工程师能跑在H100上,按当前薪资水平,该卡年租金应超25万美元。(英文原话:If a true human-level software engineer could run on an H100 equivalent, then at today's prices for software engineers, that H100 should rent for over 250k a year.)”

来源访谈 →

算力成本通胀已经启动:谷歌以现货价2倍的单价月付9亿美元向SpaceX租用11万张GPU,现货价也比2月低谷高出40%。

“谷歌向SpaceX租用11万张GB200/GB300 GPU,月付9亿美元,单价达现货价2倍,而现货价已比2月低谷高40%,算力成本通胀已启动。”

来源访谈 →

算力供给弹性极低,年度3倍增长中靠挤占手机PC晶圆份额贡献的1.8倍明年将触顶。

“算力供给弹性极低:年度3倍增长中,1.4倍来自摩尔定律、1.2倍来自新晶圆厂、1.8倍来自挤占手机PC晶圆份额,后者明年将触顶。”

来源访谈 →

Dario认为现有范式下预训练泛化与长上下文学习或已足以支撑'天才之国'实现,且Anthropic正在推进真正的持续学习研究并预计短期内突破

“Anthropic正在推进真正的持续学习研究,且"未来一两年内大概率能解决"”

来源访谈 →

她认为机器学习领域整体仍处于开发稳健、可泛化方法的非常早期阶段,对抗样本等攻击暴露了现有系统的脆弱性

“我们仍处于开发稳健且可泛化的机器学习方法的非常早期阶段。”

来源访谈 →

即使强AI能力在2027-2028年出现,巨大的运行成本也使其无法立即大规模部署,真正的变革将是渐进的,某些关键突破可能在2030年后引发质变。

“即使强人工智能的能力在2027-2028年出现,其巨大的运行成本(可能解决一个复杂问题需数千美元)也将使其无法立即大规模部署。”

来源访谈 →

Cyc的知识虽不完整,但知识泵已被灌满,系统能通过阅读文本等方式自动学习实现知识自我增长

“我认为我们构建的东西,即使不完美,也已经为知识的泵'灌满了水',使得Cyc系统本身现在能够帮助自己自动学习更多东西。”

来源访谈 →

2028-2029年算力扩张的最终瓶颈是ASML的EUV光刻机产能,扩产幅度远跟不上每吉瓦算力约3.5台的消耗速度。

“到2028-2029年,算力扩张的最终瓶颈将落在ASML的EUV光刻机上。目前每年约生产70台,即便激进扩产到2030年也仅约100台,而每新增1吉瓦算力就需要约3.5台EUV光刻机。”

来源访谈 →

内存(DRAM/HBM)已成为比逻辑芯片更紧迫的瓶颈,2026年大型科技资本开支约30%用于内存采购,并挤压智能手机和PC出货。

“内存(DRAM/HBM)已成为比逻辑芯片更紧迫的瓶颈。2026年大型科技公司资本开支中约30%将用于内存采购,价格持续上涨正侵蚀消费电子领域——智能手机和PC出货量将因此显著下滑。”

来源访谈 →

星舰复用将大幅降低太空算力部署成本,若实现每小时一次发射频率,每年可向太空部署数百吉瓦级AI算力

“目标达到每年1万吨有效载荷入轨、每吨100千瓦的配套能力,若实现每小时一次发射频率,每年可向太空部署数百吉瓦级AI算力。”

来源访谈 →

非线性动力学系统虽对初始条件高度敏感,但其宏观结构(如胜率、飓风路径)仍可预测,感觉极难的问题可能被简单的宏观模拟攻克。

“显然这不是P=NP的证明,但其中有种令人不安的意味——一个感觉上极其困难的问题,竟能被一个非常简单的宏观模拟所攻克。(Like it's not like you know obviously this is not a proof of like P= NP or anything but but there's something to it that like kind of is very disturbing where like what felt like a very hard problem can fall to a very very simple macroscopic”

来源访谈 →

肖莱以科学体系作为递归自我改进系统的现实模型,指出其资源消耗指数增长而产出仅线性增长,证明此类系统不会出现爆炸式进步。

“Science is probably the closest thing we have today to a recursively self-improving superhuman AI, and you can observe that scientific progress is not actually exploding. —— 科学可能是我们目前拥有的最接近递归自我改进的超人类AI的系统,而你可以观察到科学进展实际上并未爆炸式增长。”

来源访谈 →

在国际象棋这类封闭系统中机器无需破解游戏,只需靠更少、更稳定的失误就能胜出

“Machines will prevail simply because they will bring down the number of mistakes.(机器终将获胜,仅仅因为它们能将犯错的概率降至最低。)”

来源访谈 →

架构的成败由装机量决定,为此Nvidia宁可承受成本增加50%、市值从80亿跌到15亿的代价,也要把CUDA放进GeForce用消费级出货量培养装机量。

“装机量就是一切。装机量定义了一个架构,其他一切都是次要的。”

来源访谈 →

计算范式已从基于检索的系统转向基于生成的系统,数据中心不再是传统计算机,而是用来创造收入的工厂。

“我们从一个基于检索的计算系统,变成了一个基于生成的计算系统。它不再是计算机,它是工厂。一座用来创造收入的工厂。”

来源访谈 →

数据中心能源问题并非无解,电网大部分时间存在富余电力,数据中心可设计为优雅降级模式,在高峰时主动降低算力以换取低成本富余电力的灵活合约,而非追求100%不间断供电

“数据中心可设计为“优雅降级”模式,在电网高峰时主动降低算力或转移负载,以换取使用低成本富余电力的合约。”

来源访谈 →

Keller认为计算的未来是可扩展的低效,靠大规模并行分解问题取胜而非单点效率。

“计算的未来是低效而非高效,但这种低效是可扩展的。—— The future of computing is inefficiency, not efficiency, but scales, inefficiency scales.”

来源访谈 →

感知的下一步突破在于弄清系统应输出什么表示来支持高级推理,而非继续提升分类精度

“The thing that's going to make perception take the next step is actually understanding better what it should produce. ——让感知能力更进一步的关键,实际上是更好地理解它应该输出什么。”

来源访谈 →

AI工程已从新兴概念进入系统化、职业化阶段,DeepLearning.AI将重新聚焦于此,依据是对上万份招聘广告、专家访谈和调查数据的分析

“其DeepLearning.AI平台将重新聚焦于“AI工程”。此举基于对超过一万份招聘广告的分析、数十次与专家及招聘经理的结构化访谈以及广泛的调查数据。”

来源访谈 →

Anthropic和OpenAI凭借模型产生的高额收入有能力出价高于其他买家,到2028年底将独自控制全球大部分可用算力。

“"By the time you're towards the end of 2028 — if this trend continues, and I see nothing that's stopping it — you've got them just controlling most of the usable flops in the world on their own."——到2028年底——如果这一趋势持续下去,而我看不到任何阻止它的因素——它们将独自控制世界上大部分可用的浮点运算能力。”

来源访谈 →

算力扩张受ASML的EUV光刻机等供应链响应滞后的制约,到2029年全球AI相关资本支出可能接近10万亿美元并需巨额债务融资。

“尽管资本主义会驱动产能扩张,但供应链(如ASML的EUV光刻机、蔡司镜片)的响应速度存在滞后。到2029年,全球AI相关资本支出可能接近10万亿美元,这需要巨额债务融资,并可能推高全球利率。”

来源访谈 →

FSDP看似每层全收集通信昂贵,但优化后总通信量仅为参数量的3倍左右,只比基础数据并行多50%

“优化后的FSDP(使用减少-分散)将总通信量控制在模型参数的3倍左右,仅比基础数据并行多50%。”

来源访谈 →

复杂并行策略带来的架构约束会减慢新想法的实验验证速度,这是快速发展AI领域中最大的损失之一

“在快速发展的AI领域,这种研究速度的减缓被视为最大的损失之一。”

来源访谈 →

27B量级的开源模型正变得愈发强大和实用,已能胜任真实世界编码、办公流和智能体任务

“凭借其原生多模态、百万级上下文窗口及广泛的推理支持,被明确定位为适用于真实世界编码、办公流和智能体的专业工具。这显示27B量级模型正变得愈发强大和实用。”

来源访谈 →

Simile的行为建模依赖三大数据支柱:深度访谈、行为观察与交易数据、随机对照试验,其中RCT数据是理解行为因果机制的关键。

“随机对照试验数据,这是理解行为背后因果机制(“为什么”)的关键,对于“如何塑造未来”至关重要。”

来源访谈 →

无论是训练神经网络还是启动研究项目,都应把起点初始化到尽可能接近成功的位置,而不是从零开始

“在深度学习中,初始化就是一切。你总希望将研究项目初始化到尽可能接近成功的地方。”

来源访谈 →

Eiso Kant 以模型由不到70人构建、工程和研究团队总人数不足115人为据,强调小团队也能打造前沿模型。

“不到70人构建了这个模型,加上工程和研究团队总人数也少于115人。”

来源访谈 →

廉价算力时代可能即将结束:模型智能提升带来的需求侧压力使过去十年的低成本下降趋势不可持续

“过去十年,算力成本因硬件进步和规模效应而大幅下降,支撑了AI的爆发。但这一趋势正面临模型智能提升带来的需求侧压力,低成本模式可能不可持续”

来源访谈 →

元宇宙的目标不是让人花更多时间在计算上而是让计算更自然,且要成为主流计算平台必须在编程、会议等日常任务上提供至少5%以上的效率提升。

“The goal isn't to have people spend a lot more time in computing, it's to make computing more natural.——目标不是让人们花更多时间在计算上,而是让计算变得更自然。”

来源访谈 →

当下信息生态急剧恶化的新变量是机器学习与宣传的结合,平台算法为最大化停留时间而推送引发愤怒的内容,制造大规模信息茧房。

“机器学习与宣传手段相遇。这是新情况,也是情况急剧恶化的原因。(英文原话:Machine learning meets propaganda. That's what's new, that's why this has gotten so much worse.)”

来源访谈 →

对齐研究必须从固定权重场景彻底转向:防止AI在持续更新中演变为欺骗性或恶意人格、防止用户注入后门将成为全新核心挑战

“在权重持续更新的场景下,如何保证AI不被越狱、不演变为欺骗性或恶意人格,以及如何防止用户通过交互向基础模型注入后门,将成为全新的核心挑战。”

来源访谈 →

当AI模型能胜任人类软件工程师的工作时,算力(如H100)的租金将不再由硬件成本决定,而由其替代的人类劳动价值决定,年租金应超过25万美元。

““如果一个能在H100级硬件上运行的人类水平软件工程师,按照当前软件工程师的市场薪资,那么那个H100的年租金应该超过25万美元。”("If a true human-level software engineer that could run on an H100 equivalent, at current market rates for software engineers, that H100 should rent for over $250k a year.")”

来源访谈 →

看似简单的模型聚合与路由API中间层,通过连接海量开发者与模型提供商,能创造可观利润和快速增长,商业价值被Stripe收购案重估

“一个看似简单的中间层,却能通过连接海量开发者和模型提供商,创造出可观的利润和快速增长。”

来源访谈 →

AI产业价值正从底层GPU算力和前沿模型研发,向上层的模型聚合、路由与分发平台快速聚集

“价值正从底层的GPU算力和前沿模型研发,向上层的模型聚合、路由与分发平台快速聚集。”

来源访谈 →

模型路由层的利润空间可能因激烈竞争被压缩,随着Vercel等对手下调AI网关价格及潜在零利润竞争者出现,OpenRouter的定价权并非高枕无忧

“随着Vercel等竞争对手下调AI网关价格,以及潜在的零利润竞争者出现,OpenRouter这类平台的定价权并非高枕无忧。”

来源访谈 →

她以DeepMind的Atari游戏程序为例,指出强化学习虽能掌握游戏却未形成真正的概念模型,因此无法适应环境的微小变化

“虽然它能通过强化学习掌握游戏,但并未学到人类意义上的'球拍'或'球'的概念,因此无法适应微小的环境变化(如移动球拍)。”

来源访谈 →

攻击具有可操作性和普遍性:将合法的加密签名推理块重放至同一提供商的较弱模型并引导其转录,对Claude、GPT、Gemini均有具体模板。

“获取合法的加密签名推理块,将其重放至同一提供商的较弱模型(如将Claude的推理块重放至Haiku 4.5),并通过提示或预填充引导该模型转录附带的推理内容。该方法针对Claude、GPT和Gemini等主流模型给出了具体模板,表明其普遍适用性。”

来源访谈 →

隐私泄露风险已从理论变为现实:公开分享的推理过程经解码后包含大量API密钥、电子邮箱和密码等敏感数据。

“研究团队对约7,000条公开的推理过程进行了初步扫描,发现其中包含62个唯一的API密钥、33个电子邮件地址、33个密码以及其他敏感数据。”

来源访谈 →

总体层面满足公平保证的算法,可能靠优待某些群体、歧视更细的亚群体来实现,他称之为公平性不公正划分

“We call that fairness gerrymandering, because like political gerrymandering, you're giving some guarantee at the aggregate level, but when you look in a more granular way, you realize that you're achieving that aggregate guarantee by favoring some groups and discriminating against other ones. —— 我们称”

来源访谈 →

在线策略自蒸馏(OPSD)让基础模型模仿积累了上下文经验的教师模型,可将会话所学蒸馏回权重,不需要外部可验证奖励且监督信号比朴素RL更密集。

“在线策略自蒸馏(OPSD)通过让基础模型模仿积累了上下文经验的“教师模型”的预测,将会话所学蒸馏回权重。它不需要外部可验证奖励,且比朴素RL提供更密集的监督信号。”

来源访谈 →

生物神经网络仍存在大量未知,理解这些奥秘可能正是改进人工神经网络的关键所在。

“关于生物神经网络,我们有太多未知,这既神秘又迷人,因为这或许是改进我们人工神经网络的关键所在。”

来源访谈 →

语言学习与语言所指世界的视觉学习目前是割裂的,应将二者结合、相互促进,让语言输入指导神经网络学习更高层的语义概念,从而建立良好的世界模型。

“我认为我们需要更好地将语言学习与语言所指的世界学习结合起来,让二者能够相互促进。”

来源访谈 →

经济学家预测劳动力市场历史上屡屡失败,与其依赖个体预测,不如建立预测市场利用群体智慧汇总意见。

“经济学家在预测劳动力市场方面历史上屡屡失败,大卫·李嘉图在工业革命时期的失业预言便是个典型。与其依赖个体预测,不如建立预测市场,利用群体智慧汇总意见”

来源访谈 →

若AI只略微降低白领工作成本但不足以驱动经济快速增长,经济会落入GDP增长有限、被替代者难以通过再分配获益的中间地带;而通用AI跨职业低成本替代大量工作则此情境不再成立。

“AI自动化若只是略微降低白领工作成本,但不足以让经济快速增长,则可能落入“混乱中间地带”——GDP增长有限,被替代者难以通过再分配获益。但若通用AI能跨职业替代大量工作,且成本远低于人力,此情境便不再成立。”

来源访谈 →

避免在不必要的大模型调用上浪费资源是Glean的重要目标,简单任务应使用更便宜的工具。

“Glean的一个重要目标是避免在不需要的任务上使用大语言模型。”

来源访谈 →

企业不再愿意只依赖一两家模型提供商,且认为离开开源模型就无法生存。

“现在没有人愿意只依赖一两个模型提供商,也没有人认为他们能在没有开源的情况下生存。”

来源访谈 →

硬件切分方式与模型架构天然匹配,并行策略应由物理拓扑直接塑造:专家并行利用机架内互连,流水线并行将不同层分布到不同机架。

“(硬件)切分方式与模型架构相匹配。(英文原话:The cutting matches the model architecture.)”

来源访谈 →

AI的下一个重大突破将来自模型在部署中的“在职学习”,而非当前依赖可验证奖励的强化学习范式。

“The next big breakthrough will be AIs learning on the job —— 下一个重大突破将是AI在职学习。”

来源访谈 →

验证环节无法大规模自动化是当前最大障碍,每天生成上千个新理论的速度远超现有同行评议体系所能支撑的验证速度

“传统科学通过少数科学家讨论数年达成共识,但现在每天能生成上千个新理论,现有体系无法支撑这样的验证速度。”

来源访谈 →

CPU(尤其是至强)是AI系统不可或缺的基石,不仅可直接运行模型,还能协调多GPU工作,提升整体效率与可靠性。

“AI需要的是更强大的这种矩阵乘加的能力,但是呢不代表只有GPU具备这种能力。英特尔的CPU啊特别是至强家族CPU我们有一个非常重要的特性叫AMX。”

来源访谈 →