黄仁勋谈英伟达极限协同设计与AI未来

英伟达CEO黄仁勋在访谈中深入阐述了公司从单一加速器到AI工厂的转型之路,强调了‘极限协同设计’在解决大规模分布式计算挑战中的核心作用。他分享了将CUDA置于GeForce显卡上的关键决策、通过塑造信念系统引领组织与行业变革的领导哲学,并展望了AI推理、智能体扩展以及能源解决方案等未来方向。

黄仁勋

导语

英伟达CEO黄仁勋在最新访谈中,系统性地回顾了英伟达如何从一家图形芯片公司,一步步演变为驱动全球AI革命的计算平台巨头。他将这一成功的核心归因于“极限协同设计”的哲学——即对从芯片、系统、软件到算法的整个技术栈进行端到端的协同优化。黄仁勋详细解释了这种设计模式如何应对AI模型规模远超单台计算机极限的挑战,并分享了英伟达在组织架构、战略决策和供应链管理上如何贯彻这一理念,以持续引领计算前沿。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

从加速器到AI工厂的战略转型

32:38
  • Nvidia从单一GPU加速器公司,通过可编程像素着色器、FP32兼容、CUDA等步骤,逐步转型为计算平台公司。
  • 将CUDA放在消费级GeForce显卡上是关键但痛苦的战略决策,虽然短期消耗了所有毛利,但建立了庞大的安装基础。
  • 安装基础决定了计算架构的成功,而非架构的优雅程度,x86架构就是例证。
深读这一段

讨论的问题:Nvidia如何从专注GPU的加速器公司,演变为驱动整个AI革命的计算平台公司?

论据 / 案例:将CUDA集成到GeForce显卡上导致公司市值从约80亿美元一度降至约15亿美元,但最终建立了庞大的开发者安装基础,成为CUDA生态的基石。

02

极端协同设计的必要性与流程

01:07
  • 现代AI问题规模远超单GPU计算能力,需要分布式计算,这带来了阿姆达尔定律问题,即计算仅占总工作量的一部分时,无限加速计算对总性能提升有限。
  • 极端协同设计需优化从软件、芯片、系统到算法、应用的全栈,包括CPU、GPU、网络、存储、供电和散热等所有组件。
  • Nvidia的组织架构服务于协同设计:CEO直接管理约60名专家,通过集体讨论问题而非一对一会议,确保跨领域实时协作。
深读这一段

讨论的问题:实现GPU、CPU、网络、存储、散热等多组件极端协同设计的最大挑战是什么?

论据 / 案例:Jensen Huang直接管理约60名直属员工,几乎全部具有工程背景,是内存、CPU、光学、GPU架构、算法等领域的专家。

03

领导力:塑造信念与预见未来

34:16
  • 领导力的核心是基于深度推理和好奇心,清晰地预见未来,并通过日常沟通持续塑造团队和行业的信念系统。
  • 在正式宣布重大战略(如All in深度学习、收购Mellanox、推出Grok)前,已通过多年的铺垫让所有人觉得‘你早该这么做了’。
  • 这种方法不仅适用于公司内部,也通过GTC等会议塑造合作伙伴和整个产业链的预期,使其与Nvidia共同走向未来。
深读这一段

讨论的问题:Jensen Huang如何做出并推动像‘将CUDA放在GeForce上’、‘All in深度学习’这样高风险、高回报的未来性决策?

论据 / 案例:关于Grok(代理系统)的构想和铺垫,在正式发布前已持续了两年半。

04

AI扩展定律与未来计算瓶颈

44:33
  • AI智能扩展遵循四条定律:预训练、后训练、测试时计算以及代理扩展,且它们形成数据生成与训练的增强循环。
  • 推理(测试时计算)是思考、规划和解决问题,远比预训练的‘阅读’更复杂,因此计算密集度极高。
  • 未来扩展的主要瓶颈是计算,解决方案是通过极端协同设计,将每瓦性能每年提升数个数量级,从而持续降低令牌成本。
深读这一段

讨论的问题:面对‘数据墙’和‘推理复杂度’,AI模型和算力的扩展将如何继续?未来的扩展瓶颈是什么?

论据 / 案例:过去十年,摩尔定律使计算性能提升约100倍,而Nvidia通过极端协同设计使计算扩展了100万倍。

05

供应链管理与生态系统塑造

58:32
  • Nvidia与全球几乎所有AI公司合作,通过倾听行业需求并进行前瞻性推理,来预判未来硬件架构需求。
  • CEO主动向供应链伙伴(如TSMC、SK Hynix等)解释未来趋势,说服他们提前数年进行数十亿美元的资本投资,以支持HBM等新技术。
  • 通过这种方式,Nvidia不仅塑造自身产品,也主动塑造了从上游半导体到下游数据中心基础设施的整个供应链生态。
深读这一段

讨论的问题:Nvidia如何确保其以史无前例的速度和规模增长时,其极其复杂的供应链(涉及数百家供应商、数百万个组件)能够同步甚至加速扩张?

论据 / 案例:一个Vera Rubin机架包含130万个组件,来自200家供应商;Nvidia说服DRAM行业CEO将HBM和低功耗手机内存(LPDDR5)大规模应用于数据中心。

06

能源解决方案与数据中心设计哲学

66:44
  • 电网为极端情况设计,99%时间存在过剩容量,数据中心应利用此灵活性,与电网签订动态功率协议,而非要求100%峰值供电。
  • 数据中心应能优雅降级:当电网供电不足时,可动态迁移关键工作负载、降低非关键计算速率或使用备用发电机。
  • 数据中心建筑商和云服务商需要向最终用户(企业CEO)重新解释‘五个九’可用性的实际代价,推动更务实的合同条款。
深读这一段

讨论的问题:如何解决AI数据中心日益增长的能源需求与现有电网能力的矛盾?

论据 / 案例:电网在99%的时间内运行在峰值容量的约60%左右,存在大量闲置的过剩容量。

07

极速工程哲学:光速思考与第一性原理

72:56
  • ‘光速’是指导原则:衡量一切工作(速度、成本、延迟等)与物理定律极限的差距,并以此作为设计基准。
  • 摒弃‘持续改进’思维(如从74天优化到72天),而是从第一性原理重新出发(如思考6天的可能性),这往往能带来颠覆性效率提升。
  • 工程设计的准则是‘如必要,极复杂;如可能,尽简单’,必须挑战所有复杂性的必要性。
深读这一段

讨论的问题:Nvidia和埃隆·马斯克在系统工程和超级计算机构建方面有哪些共同的方法论?

论据 / 案例:埃隆·马斯克在4个月内建成拥有20万GPU的Colossus超级计算机;Nvidia从零开始设计Vera Rubin机架,而非在旧架构上改进。

08

对中国科技生态系统的观察

82:53
  • 中国拥有全球约50%的AI研究人员,且在数学和科学教育方面基础雄厚。
  • 中国科技产业崛起于移动互联网和软件时代,且内部存在激烈的区域竞争(如各省市间),催生了大量公司。
  • 中国文化强调家庭、朋友、公司的紧密联系,促进了知识(尤其是开源)的快速流通与共享,而非技术保密。
深读这一段

讨论的问题:Jensen Huang如何理解中国在过去十年中构建起世界级技术生态系统和公司的能力?

论据 / 案例:全球约50%的AI研究人员是中国人,且大部分仍在中国;中国的开放源代码贡献极高,这与紧密的社交和校友网络文化有关。

金句

  • "Inference is thinking, and I think thinking is hard. Thinking is way harder than reading." —— 推理就是思考,而我认为思考是困难的。思考比阅读要难得多。
  • "The install base defines an architecture, not everything else is secondary." —— 装机量定义了一个架构,其他一切都是次要的。
  • "When I learn about something and it's starting to influence how I think, I'll make it very clear to everybody near me... I'm trying to shape their belief system." —— 当我了解到某件事并开始影响我的思考时,我会让身边的每个人都清楚...我是在塑造他们的信念体系。
  • "We need things to be as complex as necessary but as simple as possible." —— 我们需要事物在必要时保持复杂,但在可能时尽可能简单。

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · 黄仁勋谈英伟达极限协同设计与AI未来