导语
在AI浪潮中,“世界模型”已成为最热门却也最模糊的术语之一。从视频生成到3D生成,不同技术路线都在争夺这一定义的解释权。本期《十字路口》访谈中,Aether AI创始人、CMU博士黄碧薇教授提出了清晰的第四条路线——因果世界模型。他认为,真正的世界模型必须理解物理世界背后的因果结构、变量和动态变化,而非仅仅模仿数据表层的相关性。本文将提炼黄碧薇教授对因果AI范式的洞察,以及他如何从学术研究走向创业,试图为机器人装上真正理解物理规律的“大脑”。
Aether AI创始人黄碧薇教授分享其因果世界模型范式。他认为,当前基于相关性的LLM和视频生成模型无法真正理解物理规律,而通过学习因果变量、结构和动力学,因果世界模型可实现零样本泛化与复杂推理,是突破具身智能天花板的关键路径。

在AI浪潮中,“世界模型”已成为最热门却也最模糊的术语之一。从视频生成到3D生成,不同技术路线都在争夺这一定义的解释权。本期《十字路口》访谈中,Aether AI创始人、CMU博士黄碧薇教授提出了清晰的第四条路线——因果世界模型。他认为,真正的世界模型必须理解物理世界背后的因果结构、变量和动态变化,而非仅仅模仿数据表层的相关性。本文将提炼黄碧薇教授对因果AI范式的洞察,以及他如何从学术研究走向创业,试图为机器人装上真正理解物理规律的“大脑”。
展开「深读」看每一段讨论的问题与论据。
讨论的问题:黄教授的个人学术背景、创业动机以及Aether AI的初始定位是什么?
论据 / 案例:融资额:2000万美金。学术背景:从上海华师大到马普所,再到CMU读博,最后在UCSD做助理教授,12年因果发现与因果AI研究。
讨论的问题:当前对‘世界模型’的定义有何分歧?主要技术路线有哪些?
论据 / 案例:对比视频生成、3D生成和JEPA路线。核心差异化:学习因果变量(如物体形状、速度)、因果结构(如影响抓取的握力、角度)和动态转换。
讨论的问题:为什么因果理解对物理世界任务(如机器人操作)至关重要,而大语言模型的范式在此不足?
论据 / 案例:案例:机器人煎饼任务。LLM依赖离散token和表层数据;具身任务需处理连续动作空间和不可预测的物理变量。
讨论的问题:Aether AI如何构建‘自循环数据系统’来训练因果世界模型?数据构成和算力需求如何?
论据 / 案例:第一版模型目标数据量:七八千小时;算力:约四百张卡。数据四类:模拟数据(含模型自生成)、Ego-centric数据、视频数据、遥操作数据。
讨论的问题:因果世界模型第一版的目标是什么?已观察到哪些验证其泛化能力的信号?
论据 / 案例:案例:零样本泛化完成stacking任务。论文:ICML 2025投稿《Learning Causal World Models by Sufficient...》等。实验目前主要在模拟环境,计划年内展示真机demo。
讨论的问题:促使黄教授从学术转向创业的关键触发点和心路历程是什么?
论据 / 案例:触发事件:2025年初朋友讲述工厂机器人退回案例。反思:ChatGPT发布后,意识到数据量与深层因果方法应结合。
讨论的问题:黄教授如何看待学术界对因果AI的关注趋势?其技术路线相比VLA、WAM有何优势?
论据 / 案例:学术传承:CMU学派。同行关注:杨立昆在访谈中强调像素级因果。技术对比:VLA因连续空间数据难收集而天花板低;WAM是中间过渡;因果模型更符合世界运行规律。
讨论的问题:Aether AI将如何使用本轮融资?最急需哪方面的人才?
论据 / 案例:资金分配:算力、数据、人才招聘。人才需求:因果AI算法专家、视频模型训练工程师、机器人控制与AI复合型人才。
讨论的问题:如何看待当前世界模型热潮中的错误与未来方向?
论据 / 案例:展望:计划年内推出真机demo。哲学思考:因果是否客观存在?