导语
翁家翌 2022 年 7 月加入 OpenAI,是 ChatGPT 3.5、GPT-4、4o 到 GPT-5 每一次模型跃迁背后的核心贡献者,自述工作可用三个词概括:强化学习、后训练、Infra。在此之前,这位清华校友已靠开源“出圈”:公开作业资料打破信息差、写下强化学习框架天授、做出累计点击上千万的签证工具退学.online。本期 WhynotTV 从奥数童年聊到 OpenAI 内部:RLHF 如何先在 GPT-4 上调通、修 bug 的速度为何决定模型好坏、开源与 AGI 的权衡。
“OpenAI 后训练 RL Infra 核心贡献者翁家翌,从清华开源作业、天授框架到 ChatGPT 与 GPT-5 背后的工程功臣。他谈修 bug 速度为何决定模型好坏、工程能力为何胜过论文、开源与闭源的权衡,及 OpenAI 内部的迭代与组织挑战。”

翁家翌 2022 年 7 月加入 OpenAI,是 ChatGPT 3.5、GPT-4、4o 到 GPT-5 每一次模型跃迁背后的核心贡献者,自述工作可用三个词概括:强化学习、后训练、Infra。在此之前,这位清华校友已靠开源“出圈”:公开作业资料打破信息差、写下强化学习框架天授、做出累计点击上千万的签证工具退学.online。本期 WhynotTV 从奥数童年聊到 OpenAI 内部:RLHF 如何先在 GPT-4 上调通、修 bug 的速度为何决定模型好坏、开源与 AGI 的权衡。
打破信息差是一种慈善 他把在清华收集的作业和资料整理后全部开源到 GitHub(除有版权问题的之外),理由是“信息差在清华生存很有用,但每个人都应该平等拥有”。后来做天授、退学.online 都循同一逻辑:自己有需求、找不到现成工具,就手写一个免费开放。他自称这是 nonprofit 的“做慈善”,“哪怕是亏钱也行”。
GPA 够用就行,要造自己的评价体系 他记下导师给计算机系的三个指标:论文、比赛、GitHub 三位数 star,并习惯从“需求方视角”看问题——招人看重匹配的经验,相关项目甚至能抵几年工作经历。对 GPA 他只做最低限度投入:“87 分就很满足,多一分都不想花时间。”
想进工业界,读 PhD 是浪费生命 他很早就排除学术界:太卷、要拉 funding、限制多。路径是以 master 为跳板,靠开源项目和 citation 攒出与同期 PhD 候选人同台竞技的差异化。他引用同事的话支撑判断:“教一个 researcher 做好 engineering,远比教一个 engineer 做好 research 难”——idea 非常便宜,验证才昂贵。求职时他手握 Google、幻方(后来的 DeepSeek)、英伟达等 offer,最终选择了当时还没发布 ChatGPT 的 OpenAI。
RL 学术界在 toy benchmark 上空转 入门项目 ViZDoom 拿了冠军,但他“很不享受”:环境单一、疯狂 overfit、调参如炼丹,“比 CV 难十倍一百倍,全是玄学”,改算法并不本质。他因此把重心转向“帮科研跑得更顺”的工具建设;2022 年 8 月意识到工业界关心的是用 RL 解决真实问题后,他停止了天授的开发,转入内部 RL Infra。
迭代速度是生死线,修 bug 就是练模型 他给职业生涯定的 reward 是“最大化在 OpenAI blog 上出现名字的次数”,于是选择做人人都依赖的 post-training RL Infra,成为每个大 release 的署名者。在他看来每家 Infra 都有 bug,“谁修得多谁的模型训得好”;RLHF 的 PPO 也是 2022 年 9 月先在 GPT-4 上调通,3.5 用的还是旧管线。代价是强度:他曾加班到进急诊,如今每周跑两次 3000 米。
一致性是代码与组织的共同命门 天授第一版他一个人两周写完,而几十万行的 RLlib 他看了一个月就放弃——项目腐化多源于多人协作中的不一致,早期靠一个人拍板保持 consistent。同样的逻辑适用于公司:OpenAI 从他入职时的 280 人涨到 3000 多人,瓶颈不在人才密度而在 context 共享;一把手要深入技术细节保证信息无损流通,终极解法或许是“拥有无限 context 的 agent 来当 CEO”。
开源是生存权衡,AGI 还没到 他把 OpenAI 使命拆成两段:AGI 靠 RL、pre-training 和算力 scale up,“造福全人类”则靠便宜甚至免费的产品开放给普通人,而非丢出裸模型权重——开源会被立刻蒸馏反超,危及融资与生存;DeepSeek 开源权重后 OpenAI 内部确实重新做过评估,他个人“当然会很开心开源”。他对 AGI 的定义是完成八九成他认可的有意义任务,但现在“还不放心让 AI 直接上手改我的 Infra 代码”——太 out of distribution、验证成本太高。
用“记得你名字的人数”度量人生 高三某天他突然想通:如果人生是一场游戏,结算分数就是离开时记得你名字的人的数量,此后做开源、做慈善都由此获得正反馈——但这只律己、不律人。如今 RL Infra 趋于稳定、“已经看到头了”,他坦言又想不通自己想要什么,策略是投资未来、攒够资本提前退休,并把这个问题描述为“值得一生去思考”。