陈天奇:长期主义与开源系统创新之路

本期访谈中,陈天奇回顾了从高中自学编程到成为CMU教授的完整历程。他分享了在XGBoost、MXNet、TVM等里程碑项目背后的技术思考与人生哲学,探讨了如何在不确定性中保持初心,以及开源项目如何从学术研究走向商业落地。

陈天奇

导语

陈天奇是华人AI系统领域的标志性人物,其名字与XGBoost、MXNet、TVM、MLC LLM等一系列定义时代的开源项目紧密相连。在本期访谈中,他罕见地串联起了自己近二十年的技术人生:从浙江小城县城中学的自学者,到上海交大ACM班的学员,再到华盛顿大学的博士、OctoML的联合创始人与CMU的教授。他不仅分享了这些著名项目诞生的幕后故事,更深入剖析了其“问题驱动、长期主义”的底层价值观。在技术路径快速更迭的今天,陈天奇的思考为那些在不确定性中探索的科研者与创业者,提供了一份关于勇气、初心与系统思维的珍贵参考。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

童年启蒙与计算机兴趣

  • 在县城中学通过互联网自学编程,从C语言入门并参加信息学竞赛
  • 高二时出于兴趣自学写了一个能将Pascal转译为C语言的迷你编译器
  • 这段经历培养了不畏挑战、敢从零开始的自信心
深读这一段

讨论的问题:如何在一个资源有限的环境中,通过互联网和自驱力打开计算机世界的大门?

论据 / 案例:高二时花费一个暑假,从零开始写了一个能运行的Pascal到C的迷你编译器,没有现成教程和GitHub。

02

ACM班与科研启蒙

08:00
  • 高考考入上海交大ACM班,受于勇老师“低调做人,高调做事”理念影响
  • 参与传承式的编译原理大作业,从零构建编译器,奠定了系统级训练基础
  • 本科加入APEX实验室,对科研感到困惑,但在KDD Cup比赛中首次接触深度学习与GPU加速
深读这一段

讨论的问题:ACM班的训练如何塑造了陈天齐的技术基础和做事风格?

论据 / 案例:编译原理大作业由学生设计并代代传承;为做深度学习实验,自行购买GTX 380显卡和外部电源,搭建了实验室第一台GPU服务器。

03

早期科研挫折与醒悟

16:00
  • 本科至研究生阶段,坚持用限制玻尔兹曼机在ImageNet上做分类,两年未出成果
  • 错误地将正确的问题(大规模图像识别)与错误的方法(受限玻尔兹曼机)锁定在一起
  • 参加KDD Cup转机,并赴香港实习后,才意识到“科研视野”比解决问题本身更重要
深读这一段

讨论的问题:早期科研失败的核心教训是什么?

论据 / 案例:在ImageNet分类任务上坚持了两年,始终无法超越SVM基线;后来在KDD Cup中通过切换至矩阵分解方法才取得好成绩。

04

XGBoost:从挑战到极致

32:00
  • 为验证“数据与计算规模比算法更重要”的假说,开始做决策树系统的极致优化
  • 秉持“做一件事做到极致”的信念,在速度和易用性上做到当时世界第一
  • 内置自动处理缺失值的特性,极大提升了开箱即用的体验
深读这一段

讨论的问题:XGBoost成功的关键因素是什么?

论据 / 案例:论文引用量接近7万;在发布时是世界上最快的GBDT工具;内置了让模型自动处理缺失值的机制。

05

MXNet:协作与巅峰

40:00
  • 集结多位博士生(李沐、许昕等),融合CXXNet与Minerva,打造混合编程模式的深度学习框架
  • 在TensorFlow发布前已立项,凭借多卡并行性能优势成为NVIDIA官方推荐框架
  • 从巅峰到淡出,认识到用户体验和持续工程投入比纯性能更重要
深读这一段

讨论的问题:MXNet从众多框架中脱颖而出的原因,以及它后来没落的教训是什么?

论据 / 案例:框架名称来自CXXNet与Minerva的混合(Mix);NVIDIA曾长期在内部用MXNet进行基准测试;最终因用户体验不及PyTorch而逐渐退出主流。

06

TVM:解决部署瓶颈

56:00
  • 为解决不同硬件平台手动编写底层算子(kernel)的瓶颈,创立深度学习编译器TVM
  • 秉持“用更少资源自动化做更多事”的理念,挑战从头设计硬件指令集与编译器
  • 核心创新包括自动调度和针对NPU设计的VTA可编程加速器
深读这一段

讨论的问题:TVM的诞生是为了解决什么样的核心技术瓶颈?

论据 / 案例:为NPU设计了支持超线程(Hyperthreading)和指令级编程的VTA架构;项目从构想到首个可用版本耗时约11个月。

07

MLC:大模型时代的部署

80:00
  • 面对大模型部署挑战,将TVM技术延伸为MLC-LLM,实现跨平台统一推理引擎
  • 坚信端侧部署因隐私和实时性需求将变得至关重要
  • 通过编译技术降低机器学习系统开发门槛,目标是让写系统像写神经网络一样简单
深读这一段

讨论的问题:在后GPT时代,MLC-LLM项目如何应对模型趋同与硬件多样化的挑战?

论据 / 案例:MLC-LLM已实现在iPhone、安卓、AMD显卡及MacBook上部署大模型;项目核心目标是让更少的人用更少的工程资源解决部署问题。

08

开源、创业与教授之路

112:00
  • 坚信开源是高校成果落地和学生获得架构训练的最佳途径
  • 创办OctoML是为反哺开源社区,但商业模式最终转向API服务并被NVIDIA收购
  • 作为CMU教授,坚持写代码以保持一线手感,并认为“做优秀的技术始终没有错”
深读这一段

讨论的问题:如何平衡开源社区的成功与商业公司的利益,以及教授与创业者的双重身份?

论据 / 案例:OctoML商业模式从硬件部署工具转变为模型API服务商;2024年底被NVIDIA收购;目前仍坚持使用Cursor等AI工具编写核心代码。

09

长期主义与人生智慧

136:00
  • 认为“做一件平庸的事和一件重要的事花的时间是一样的”,因此必须选择重要的问题
  • 最难的事情是“保持初心”,并接受失败是科研和创业中的常态
  • 成功是“问心无愧”地影响世界,理想状态是“和大家一起解决想解决的问题”
深读这一段

讨论的问题:在跨越科研、创业与教职后,陈天齐认为支撑他走过不确定性的核心价值观是什么?

论据 / 案例:引用随机过程理论,认为只要付出足够时间和耐心,随机过程总会收敛到和付出相称的稳态;认为勇气往往来自于过去自己给自己的约定。

金句

  • "You do a mediocre problem and an important problem, the time spent is almost the same. Time is limited, so you must do what you want to do." ——你去做一件比较平庸的问题和一个重要的问题,花的时间几乎是一样的。时间是有限的,说一定要做想要做的事情。
  • "Many times, your courage is a promise you made to your past self." ——我觉得很多时候你的勇气可能是你过去的自己给你自己的约定。
  • "After you start a startup, what you want to do and what you end up doing will definitely be different. You have to be able to reinvent yourself." ——所有东西你都去必须要能够reinvent yourself。继续抱着我们原来的技术路线,就是继续去优化resnet。这个我觉得最后我们会输的很惨。
  • "Failure isn't that scary, and you have to accept the fact that you can fail." ——失败也没那么可怕,然后要接受可以失败这个事实。
  • "I think the hardest thing for me now is still to stay true to my original intention." ——其实我觉得现在的我最难的事情还是要保持初心。

原文链接

查看完整访谈

完整内容见原文:WhynotTV · 陈天奇:长期主义与开源系统创新之路