LeCun:AI未来在于联合嵌入,而非生成式模型

在访谈中,Yann LeCun系统阐述了当前生成式AI的根本局限,并提出了通向高级机器智能的技术路径。他指出,仅通过预测文本无法构建真正的世界模型,而视频生成的困难在于无法有效建模高维连续空间的分布。LeCun大力倡导联合嵌入预测架构(JEPA),认为这是学习世界抽象表示、实现物理推理的关键。他强调,开源是实现AI多样性、避免意识形态偏见和保障民主的必由之路,并对构建可规划、可理解物理世界的下一代AI模型充满信心。

杨立昆

导语

Yann LeCun,Meta首席AI科学家、图灵奖得主,在本次访谈中深入剖析了当前以大语言模型(LLM)为代表的生成式AI的根本缺陷,并系统阐述了他眼中通往“高级机器智能”(AMI)的可行路径。他挑战了“AI通过预测下一个词就能理解世界”的主流叙事,指出语言信息带宽过低,无法承载构建完整世界模型所需的丰富物理现实。LeCun提出,未来的突破在于“联合嵌入预测架构”(JEPA),通过在抽象表示空间而非像素或单词空间进行预测,来学习世界的可预测结构。同时,他坚定地倡导AI的开源生态,认为这是确保技术多样性、避免少数公司垄断意识形态、并最终构建安全可控AI系统的唯一途径。

大纲与深读 6 章

展开「深读」看每一段讨论的问题与论据。

01

世界模型的挑战与视觉预测的失败

24:00
  • 真正的世界模型需要能预测行动如何影响世界状态,而非仅仅预测像素
  • 过去十年试图通过生成模型预测视频帧来学习世界模型的尝试基本失败
  • 视频的高维连续性导致无法像处理离散文本那样对概率分布进行有效建模
深读这一段

讨论的问题:为什么通过预测像素的生成模型难以构建真正有效的世界模型?

论据 / 案例:在FAIR尝试了十年,包括使用GAN、VAE等方法,都无法让系统通过预测视频帧来学习良好的视觉表示;无法预测房间内所有细节如墙上画作或地毯纹理。

02

联合嵌入预测架构的提出

32:00
  • 提出联合嵌入预测架构,核心是在表示空间而非像素空间进行预测
  • 系统学习提取输入中可预测的抽象信息,丢弃不可预测的细节噪声
  • 这类似于人类用不同抽象层级描述世界,而非在最低层面建模一切
深读这一段

讨论的问题:联合嵌入预测架构如何克服生成模型在视觉预测上的缺陷?

论据 / 案例:对比自监督学习在文本上有效但在图像/视频上失败;JEP架构通过训练预测完整输入的表示来避免预测所有像素。

03

JEPA的训练方法与进展

40:00
  • 采用非对比学习方法,通过蒸馏或掩码等方式训练,避免表示坍缩
  • DINO、I-JEPA和V-JEPA等方法在图像和视频表示学习上取得显著成功
  • V-JEPA是首个能学习良好视频表示的系统,能识别动作并初步理解物理约束
深读这一段

讨论的问题:哪些具体的非对比学习方法使JEPA架构的训练成为可能?

论据 / 案例:V-JEPA通过掩码视频的时空管状区域训练,能以较高准确率识别视频中的动作,并检测视频中物体出现/消失等物理不可能性。

04

LLM的根本局限与幻觉问题

72:00
  • LLM的自回归生成导致错误随token数指数级累积,是幻觉的根本原因
  • 每个token生成的计算量恒定,无法根据问题复杂度调整推理时间
  • 训练数据只是所有可能prompt的极小长尾子集,系统遇到未见prompt会胡言乱语
深读这一段

讨论的问题:为什么大语言模型会产生幻觉,这反映了其架构的何种根本缺陷?

论据 / 案例:假设每个token出错概率独立,则保持在正确答案集内的概率随token数指数下降;系统本质上是庞大的查找表,无法进行真正的推理。

05

AI多样性与开源的必要性

104:00
  • 未来AI交互将无处不在,单一来源控制人类知识库对民主和文化构成威胁
  • 开源基础模型允许各国、各社区针对自身语言、文化和价值观进行微调
  • 闭源系统面临内部压力、法律风险和输出控制等多重挑战,开源是唯一解决方案
深读这一段

讨论的问题:为什么开源是确保AI系统多样性、安全性和民主化的关键路径?

论据 / 案例:法国政府不接受其公民数字生活由美国西海岸三家公司控制;印度正基于Llama 2微调支持22种官方语言的模型;塞内加尔正开发服务当地语言的医疗信息AI。

06

对超级智能与AI安全的理性看法

136:00
  • 超级智能不会是一个突然出现的事件,而是渐进的发展过程,我们会有时间设置护栏
  • 智能并不必然导致支配欲,这种欲望是社会性物种特有的,可以不在AI中编码
  • AI安全需要通过迭代设计实现,如同航空发动机可靠性通过不断改进达成
深读这一段

讨论的问题:对‘超级智能将突然出现并控制世界’的担忧,应如何理性回应?

论据 / 案例:类比猩猩(聪明但非社会性)没有支配欲;目标驱动的AI可以通过优化包含‘服从人类’等护栏的目标函数来确保安全;安全是渐进设计过程,非一次性解决。

金句

  • "You're not going to be able to do this with generative models." —— 你无法用生成式模型来实现这一点。
  • "The reason we can do this is because the world is incredibly more complicated and richer in terms of information than text." —— 我们之所以能(在语言上)成功,是因为世界在信息复杂度和丰富度上远超文本。
  • "Open source enables diversity, and that's the inevitable direction of history." —— 开源实现了多样性,而这是历史的必然方向。
  • "If you're really interested in human-level AI, abandon the idea of generative AI." —— 如果你对达到人类水平的AI真正感兴趣,那就放弃生成式AI的想法。
  • "We're going to have systems that are as smart as a cat, and then we're going to walk our way up to make those things more intelligent." —— 我们将先拥有像猫一样聪明的系统,然后逐步让它们变得更智能。

原文链接

查看完整访谈

=== SUGGEST===

完整内容见原文:Lex Fridman Podcast · LeCun:AI未来在于联合嵌入,而非生成式模型