从清华学子到vLLM核心:尤恺超谈开源、创业与AI推理的未来

本文提炼了vLLM核心维护者尤恺超的深度访谈。他分享了从清华学霸到开源项目关键维护者的心路历程,详述了vLLM从伯克利实验室项目发展为InfraAct公司背后的故事,并深入探讨了AI推理引擎、模型与Infra协同设计、开源社区治理以及中美AI基础设施发展差异等前沿话题。

尤恺超

导语

尤恺超,清华大学毕业,vLLM大模型推理引擎的核心维护者,AI推理初创公司InfraAct的联合创始人兼首席科学家。他的个人轨迹——从对算法研究感到幻灭,到坚定地投身于机器学习系统工程——不仅是个人选择,也映射了AI领域从追求算法创新到重视系统效率的时代变迁。这篇访谈深度梳理了他如何从一个开源项目的贡献者,成长为一家获得巨额种子轮融资公司的创始人,并分享了他对AI基础设施、模型与硬件协同设计,以及开源生态未来的深刻洞察。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

访谈开场与嘉宾介绍

  • 主持人小俊介绍嘉宾尤凯超为infract联合创始人、前首席科学家,及其背景
  • 介绍infract公司源自伯克利开源项目VLLM的演进历程
  • 提及公司获得1.5亿美元种子轮融资,并点明访谈将探讨开源项目商业化与AI infra技术前沿
深读这一段

论据 / 案例:infract公司获得了1.5亿美元的种子轮融资

02

个人经历与学术背景

08:00
  • 尤凯超自述清华本科及博士毕业,目前负责维护以VLLM为核心的开源大模型推理引擎生态
  • 回顾从2015年接触编程,通过在线课程学习Python,奠定编程基础
  • 分享在清华的学习经历,强调对知识本身的追求而非应试刷题
03

从算法研究到系统工程的转变

08:00
  • 因对学术界论文发表“礼乐崩坏”的失望,逐渐失去对算法研究的兴趣
  • 认识到大规模实验和机器学习系统是AI算法成功的关键,超越了单纯算法创新
  • 受工业界朋友反馈启发,认识到适配复杂硬件、编写高效算子的系统工程挑战更为关键
  • 最终在博士期间将研究方向从人工智能算法转向机器学习系统工程
深读这一段

讨论的问题:是什么促使你从一个算法研究者转变为深度参与系统工程的人?

论据 / 案例:2022年WAIC大会上,旷视首席科学家张祥雨谈及工程师每天最头疼的是英伟达CUDA代码问题和为硬件写算子

04

VLLM项目的诞生与早期参与

32:00
  • 2019年暑期在伯克利交流时认识VLLM发起人李卓瀚及Ion Stoica教授,埋下合作种子
  • 2024年再次前往伯克利Skylab交流,适逢VLLM项目快速发展,决定全职投入维护
  • 作为第四位主要成员加入,与Simon等人共同推动项目,应对模型和硬件飞速发展带来的挑战
深读这一段

讨论的问题:你是什么时候以及如何加入VLLM这个开源项目的?

论据 / 案例:VLLM项目诞生于2023年年中,由伯克利Skylab实验室的李卓瀚等人发起

05

VLLM核心技术与开源生态发展

48:00
  • VLLM的核心是PagedAttention算法,借鉴操作系统虚拟内存管理来管理大模型推理中的KV Cache
  • 项目已从单一算法演变为完整的大模型推理引擎系统,是模型高效运行的底座
  • 2025年中国开源模型爆发,VLLM支持了DeepSeek、千问等众多模型发布,成为GitHub上最活跃项目
深读这一段

讨论的问题:VLLM的核心原理是什么?它解决了什么问题?

论据 / 案例:VLLM项目源自2023年投稿SOSP会议的PagedAttention论文

06

开源项目商业化:成立infract公司

64:00
  • Ion Stoica教授明确指出,像VLLM这样体量的开源项目需要公司支持才能长期发展
  • 创始团队经历长时间讨论和犹豫,最终为保障项目长远发展,决定成立公司
  • 公司创立后,获得了社区期待,解决了开源状态下签署保密协议、获取算力资源等实际困难
深读这一段

讨论的问题:为什么一个成功的开源项目需要成立一家商业公司来支持?

论据 / 案例:Ion Stoica教授以Linux(Red Hat支持)、Kubernetes(Google支持)、PyTorch(Meta支持)等项目为例,说明公司支持的必要性

07

模型与Infra的Co-design

120:00
  • 将硬件比作自然资源,模型比作发电机,推理引擎比作电力系统,强调模型与Infra协同设计对效率的决定性影响
  • 硬件进入专用时代,算法必须主动适配硬件以获取性能红利(硬件彩票理论)
  • DeepSeek因强大的Infra团队和算法工程师懂Infra,成为模型与Infra Co-design的典范
  • 以DeepSeek V3的FP8量化和MoE架构优化为例,说明深度协同设计带来的性能优势
深读这一段

讨论的问题:什么是模型结构与Infra的Code Design?为什么需要它们一起设计?

论据 / 案例:DeepSeek的Infra团队在FP8量化、MoE专家并行等方面做到了极致优化

08

推理引擎面临的新挑战与未来

144:00
  • MoE架构带来细粒度专家、动态选择、专家并行三大系统挑战
  • Test-time scaling(测试时计算扩展)在Agent场景下兴起,对前缀缓存和推理状态管理提出新要求
  • 推理引擎需支持数百种模型结构,并持续删减优化以聚焦主流模型和硬件
  • Harness框架设计需与推理引擎协同,优化前缀缓存等机制
深读这一段

讨论的问题:当前大模型推理领域面临哪些新的技术挑战?

论据 / 案例:VLLM团队删除了不适应当前主流AI工作负载的Beam Search功能

09

行业格局与中国开源生态

160:00
  • 中国开源生态扛起了全球开源大旗,对世界产生深远影响
  • 中美AI基础设施各有优劣:中国高端算力紧缺但土地电力充足;美国算力充足但面临电力供应挑战
  • 认为开源模型最终会赢,因为用户使用数据可反哺训练,打破闭源模型的长期垄断
深读这一段

讨论的问题:中国开源生态对全球AI格局产生了什么影响?中美AI基础设施竞争走向如何?

金句

  • "我们这些人都是比较共性的,就是大家追求的是‘意义’。就是我做的事情是不是有意义?"
  • "十年之后,vLLM项目失败了,你赚到了很多钱,但是你是开心还是不开心?"
  • "如果你的这个算法没有利用到这些专用的算力,你就没有抽中硬件的那个彩票,你就吃不到这个时代的红利。"
  • "算法团队要懂Infra。这是可学习的、可借鉴的核心。"
  • "我觉得开源模型最后会赢的。"

原文链接

查看完整访谈

完整内容见原文:张小珺商业访谈录 · 从清华学子到vLLM核心:尤恺超谈开源、创业与AI推理的未来