AI进化的下一步:从训练到“做梦”

在本期播客中,Dwarkesh Patel深入探讨了当前AI实验室的核心赌注——通过RLVR(强化学习+可验证奖励)训练生成通用智能体。他提出,尽管这一路径已取得显著进展,但AI在

德瓦克什·帕特尔

导语

在本期播客中,Dwarkesh Patel深入探讨了当前AI实验室的核心赌注——通过RLVR(强化学习+可验证奖励)训练生成通用智能体。他提出,尽管这一路径已取得显著进展,但AI在现实世界中持续学习的能力仍面临根本瓶颈。文章分析了样本效率、持续学习与架构创新的关系,并展望2027-2028年AI进化的可能图景。

核心观点

  • 实验室的大赌注:各大AI实验室相信,在数千种多样化RL环境中训练AI完成数百万个可验证任务,就能基本实现AGI。这种训练将创造出能在面对错误和模糊性时连续数周处理开放式问题的通用问题解决智能体。

  • 样本效率可被规模碾压:支持当前训练范式的人认为,模型训练期间的低样本效率只是一次性成本,可通过数十亿次使用分摊。真正重要的是模型在实际会话中的智能程度和样本效率,而这已随着RL训练持续提升。

  • 上下文学习可替代持续学习:如果上下文学习能力足够强大,就能将新员工入职6个月才能掌握的经验压缩进上下文窗口,而无需将部署中学到的知识蒸馏回权重。

  • 计算机使用进展缓慢的原因:一个领域仅可验证还不够,还必须可“研磨”——能在确定性可重放的模拟器中进行大量并行演练。亚马逊不会允许你派一千个agent同时测试结账流程,而克隆常用应用在目前仍费力且不可扩展。

  • 样本效率是根本瓶颈:由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。

  • 短视距RL不必然泛化到长视距:Dario的评论暗示,短视距RL训练可能不会泛化到长视距RL表现。若如此,如何期望agent从训练于白领任务泛化到能在现实世界中从零建立像山姆·沃尔顿那样的商业帝国?

  • 推理算力白白浪费:实验室30%-50%的算力用于推理,且未在改善模型上发挥生产性作用。部署中才揭示的宝贵信息——组织实际情况、常见失败模式——全部被浪费,如同永远无法实习的天才学生。

  • 人类式压缩学习的启示:人类持续学习不是逐字记住全部经历,而是将正确直觉和宏观理解“凿”进权重。模型的梯度更新极度样本低效,已成功部署的在线学习模型都需从数百万用户中学习完全相同的内容。

  • OPSD提供新路径:在线策略自蒸馏(OPSD)通过让基础模型模仿积累了上下文经验的“教师模型”的预测,将会话所学蒸馏回权重。它不需要外部可验证奖励,且比朴素RL提供更密集的监督信号。

  • “做梦”作为第四扩展轴:未来LLM可能构建现实模拟并在其中无限排练技能,从真实数据中消耗更少却获得海量模拟体验。若实现,这将成为继预训练、RL、推理时计算后的第四扩展轴。

金句

  • "If you train at a small context length and then try to serve at a long context length, like maybe you get these degradations." —— “如果你在短上下文长度上训练,然后试图在长上下文长度上服务,你可能会得到这些退化。”
  • "It's so bizarre that we have AIs that are broadly deployed through the economy already and are privy to so much domain and organization specific tacit knowledge. And they're not able to make use of it." —— “我们已有广泛部署于经济中的AI,掌握了大量领域和组织特定的隐性知识,却无法加以利用,这太奇怪了。”
  • "Every time that you interact with an AI, it'll be smarter. Not only because it's been learning from your previous sessions, but also because it's been learning from all its interactions with all of the other users in the world." —— “每次你与AI互动,它都会更聪明。不仅因为它从你之前的会话中学习,还因为它从与全球所有其他用户的互动中学习。”

本内容由 AI 根据访谈字幕提炼,观点归嘉宾所有。

完整内容见原文:Dwarkesh Podcast · AI进化的下一步:从训练到“做梦”