导语
在本期播客中,Dwarkesh Patel深入探讨了当前AI实验室的核心赌注——通过RLVR(强化学习+可验证奖励)训练生成通用智能体。他提出,尽管这一路径已取得显著进展,但AI在现实世界中持续学习的能力仍面临根本瓶颈。文章分析了样本效率、持续学习与架构创新的关系,并展望2027-2028年AI进化的可能图景。
在本期播客中,Dwarkesh Patel深入探讨了当前AI实验室的核心赌注——通过RLVR(强化学习+可验证奖励)训练生成通用智能体。他提出,尽管这一路径已取得显著进展,但AI在

在本期播客中,Dwarkesh Patel深入探讨了当前AI实验室的核心赌注——通过RLVR(强化学习+可验证奖励)训练生成通用智能体。他提出,尽管这一路径已取得显著进展,但AI在现实世界中持续学习的能力仍面临根本瓶颈。文章分析了样本效率、持续学习与架构创新的关系,并展望2027-2028年AI进化的可能图景。
实验室的大赌注:各大AI实验室相信,在数千种多样化RL环境中训练AI完成数百万个可验证任务,就能基本实现AGI。这种训练将创造出能在面对错误和模糊性时连续数周处理开放式问题的通用问题解决智能体。
样本效率可被规模碾压:支持当前训练范式的人认为,模型训练期间的低样本效率只是一次性成本,可通过数十亿次使用分摊。真正重要的是模型在实际会话中的智能程度和样本效率,而这已随着RL训练持续提升。
上下文学习可替代持续学习:如果上下文学习能力足够强大,就能将新员工入职6个月才能掌握的经验压缩进上下文窗口,而无需将部署中学到的知识蒸馏回权重。
计算机使用进展缓慢的原因:一个领域仅可验证还不够,还必须可“研磨”——能在确定性可重放的模拟器中进行大量并行演练。亚马逊不会允许你派一千个agent同时测试结账流程,而克隆常用应用在目前仍费力且不可扩展。
样本效率是根本瓶颈:由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。
短视距RL不必然泛化到长视距:Dario的评论暗示,短视距RL训练可能不会泛化到长视距RL表现。若如此,如何期望agent从训练于白领任务泛化到能在现实世界中从零建立像山姆·沃尔顿那样的商业帝国?
推理算力白白浪费:实验室30%-50%的算力用于推理,且未在改善模型上发挥生产性作用。部署中才揭示的宝贵信息——组织实际情况、常见失败模式——全部被浪费,如同永远无法实习的天才学生。
人类式压缩学习的启示:人类持续学习不是逐字记住全部经历,而是将正确直觉和宏观理解“凿”进权重。模型的梯度更新极度样本低效,已成功部署的在线学习模型都需从数百万用户中学习完全相同的内容。
OPSD提供新路径:在线策略自蒸馏(OPSD)通过让基础模型模仿积累了上下文经验的“教师模型”的预测,将会话所学蒸馏回权重。它不需要外部可验证奖励,且比朴素RL提供更密集的监督信号。
“做梦”作为第四扩展轴:未来LLM可能构建现实模拟并在其中无限排练技能,从真实数据中消耗更少却获得海量模拟体验。若实现,这将成为继预训练、RL、推理时计算后的第四扩展轴。
本内容由 AI 根据访谈字幕提炼,观点归嘉宾所有。