Aether AI创始人黄碧薇:因果世界模型是机器人智能终局

Aether AI创始人黄碧薇教授分享其因果世界模型范式。他认为,当前基于相关性的LLM和视频生成模型无法真正理解物理规律,而通过学习因果变量、结构和动力学,因果世界模型可实现零样本泛化与复杂推理,是突破具身智能天花板的关键路径。

黄碧薇

导语

在AI浪潮中,“世界模型”已成为最热门却也最模糊的术语之一。从视频生成到3D生成,不同技术路线都在争夺这一定义的解释权。本期《十字路口》访谈中,Aether AI创始人、CMU博士黄碧薇教授提出了清晰的第四条路线——因果世界模型。他认为,真正的世界模型必须理解物理世界背后的因果结构、变量和动态变化,而非仅仅模仿数据表层的相关性。本文将提炼黄碧薇教授对因果AI范式的洞察,以及他如何从学术研究走向创业,试图为机器人装上真正理解物理规律的“大脑”。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

开场与背景介绍

  • 黄碧薇教授是Aether AI创始人,曾在上海、德国、CMU、UCSD学习和工作,主攻因果AI领域。
  • 公司使命是构建真正的因果世界模型,让AI理解物理世界背后的因果规律,首个落地场景是具身智能。
  • 公司近期获得顶级美元基金支持,短期内融资约2000万美元。
深读这一段

讨论的问题:黄教授的个人学术背景、创业动机以及Aether AI的初始定位是什么?

论据 / 案例:融资额:2000万美金。学术背景:从上海华师大到马普所,再到CMU读博,最后在UCSD做助理教授,12年因果发现与因果AI研究。

02

世界模型定义与主流路线

02:34
  • 世界模型需理解背后物理规律、因果关系,能模拟世界随时间或动作的状态变化。
  • 主流路线包括视频生成、3D生成和Yann LeCun的JEPA,但都尚未完全理解底层规律。
  • Aether AI提出第四条路线——因果世界模型,在隐空间学习因果变量、结构及动态转换。
深读这一段

讨论的问题:当前对‘世界模型’的定义有何分歧?主要技术路线有哪些?

论据 / 案例:对比视频生成、3D生成和JEPA路线。核心差异化:学习因果变量(如物体形状、速度)、因果结构(如影响抓取的握力、角度)和动态转换。

03

因果理解的重要性与范式差异

04:27
  • 大语言模型在语言和代码任务上成功,因其数据离散且逻辑表层,但无法应对物理世界复杂交互。
  • 具身智能(如机器人)的每次交互都是因果干预过程,必须理解因果才能泛化。
  • 举例:机器人做煎饼,锅温、面糊厚度等变量变化需因果理解才能灵活应对,而非机械模仿视频。
深读这一段

讨论的问题:为什么因果理解对物理世界任务(如机器人操作)至关重要,而大语言模型的范式在此不足?

论据 / 案例:案例:机器人煎饼任务。LLM依赖离散token和表层数据;具身任务需处理连续动作空间和不可预测的物理变量。

04

自循环数据系统与训练策略

05:55
  • 数据输入:从因果角度高效采集模型所需数据(如1万条中精选100条关键数据)。
  • 数据输出:训练后的因果世界模型可作为模拟器,生成高质量、长程、包含边界案例的数据反哺训练。
  • 数据来源分四类:模拟数据、自我中心视频、通用视频、遥操作数据,配比约80%(前三类)和20%(遥操作)。
深读这一段

讨论的问题:Aether AI如何构建‘自循环数据系统’来训练因果世界模型?数据构成和算力需求如何?

论据 / 案例:第一版模型目标数据量:七八千小时;算力:约四百张卡。数据四类:模拟数据(含模型自生成)、Ego-centric数据、视频数据、遥操作数据。

05

模型泛化能力与初步验证

07:12
  • 第一版模型目标:能执行长程任务、具备自主推理能力(如整理房间)、并能泛化到未见物体和任务。
  • 初步验证信号:在学会lift和pick-and-place任务后,能零样本泛化完成从未训练过的stacking(堆叠)任务。
  • 泛化前提是新任务所用的物理规律需在训练数据覆盖范围内。
深读这一段

讨论的问题:因果世界模型第一版的目标是什么?已观察到哪些验证其泛化能力的信号?

论据 / 案例:案例:零样本泛化完成stacking任务。论文:ICML 2025投稿《Learning Causal World Models by Sufficient...》等。实验目前主要在模拟环境,计划年内展示真机demo。

06

创业契机与个人心路

09:01
  • 科研与创业是黄教授唯二想做的事,科研成果需通过创业转化为服务大众的系统性产品。
  • 2025年初与朋友交流中得知工厂机器人因缺乏智慧大脑而被退回,触发其创业决心。
  • 反思:LLM成功证明数据量有用,但应结合因果深入挖掘,开创以因果智能为核心的下一代AI范式。
深读这一段

讨论的问题:促使黄教授从学术转向创业的关键触发点和心路历程是什么?

论据 / 案例:触发事件:2025年初朋友讲述工厂机器人退回案例。反思:ChatGPT发布后,意识到数据量与深层因果方法应结合。

07

学术传承、大模型反思与未来

12:38
  • 学术上师承CMU因果学派(Peter Spirtes等),与Judea Pearl(图灵奖得主)有过深度探讨。
  • 观察到杨立昆、李飞飞等学者近期强调‘pixel level’因果,学术界开始关注因果路线。
  • 认为VLA是五分,WAM是六点五分的中间态,因果世界模型才是最终方向。
深读这一段

讨论的问题:黄教授如何看待学术界对因果AI的关注趋势?其技术路线相比VLA、WAM有何优势?

论据 / 案例:学术传承:CMU学派。同行关注:杨立昆在访谈中强调像素级因果。技术对比:VLA因连续空间数据难收集而天花板低;WAM是中间过渡;因果模型更符合世界运行规律。

08

资金规划与人才招募

14:35
  • 2000万美金将主要投入算力、数据和人才招聘三大块。
  • 急需三类人才:对因果算法有热情和经验的AI算法人才、视频模型训练经验丰富的工程师、同时精通机器人控制与AI算法的复合型人才。
  • 公司定位为前沿实验室(Frontier Lab),通过底层技术突破解决机器人大脑难题。
深读这一段

讨论的问题:Aether AI将如何使用本轮融资?最急需哪方面的人才?

论据 / 案例:资金分配:算力、数据、人才招聘。人才需求:因果AI算法专家、视频模型训练工程师、机器人控制与AI复合型人才。

09

结语与展望

15:50
  • VLA、WAM等现有范式非终局,但会留下有用的建模方式作为中间成果。
  • 终极哲学问题:因果是客观存在,还是人类理解世界的工具?
  • 期待未来基于因果世界模型的真机demo,展示长程任务泛化和推理能力。
深读这一段

讨论的问题:如何看待当前世界模型热潮中的错误与未来方向?

论据 / 案例:展望:计划年内推出真机demo。哲学思考:因果是否客观存在?

金句

  • "我们要开创这下一代以因果智能为核心的AI范式。"
  • "VLA天花板可能是五分,WAM可能是六点五分,但它一定是个中间路线。"
  • "只有真正对研究有渴望的人才应该来读PhD。"
  • "因果是客观存在的呢,还是它是可能人基于这个理解他可以更好的去understand这个世界?"

原文链接

查看完整访谈

完整内容见原文:Koji杨远骋at十字路口 · Aether AI创始人黄碧薇:因果世界模型是机器人智能终局