当前观察 › 来源档案 › Dwarkesh Patel AI下一次突破:从在职学习开始 本文探讨了AI领域下一个重大突破可能在于“在职学习”。作者认为,当前实验室押注的强化学习与可验证奖励(RLVR)方法存在局限性,尤其是在需要从稀缺、模糊的真实世界互动中学习的领域。文章提出了“在职学习”的必要性,分析了当前在线学习的困境,并探讨了诸如“在线策略自蒸馏”和“做梦”等前沿技术,展望了到2027年底,AI可能通过持续部署和学习实现能力质的飞跃。
这份材料帮助我们理解什么? 访谈/对话 · 原站转录 · 已找到对应文本,不代表完整性或事实已经核验
以下保留原有自动整理内容,尚未完成逐句复核;日期与人物沿用档案记录。当前答案和重新核对的依据,请看上方问题页。
导语 当前AI实验室的核心押注是:通过在大量可验证任务和环境中训练,就能构建出通用人工智能(AGI)。然而,播客主持人兼科技博主Dwarkesh Patel在其最新文章中指出,这种依赖强化学习与可验证奖励(RLVR)的范式存在根本局限。他提出,AI的下一个重大突破将来自“在职学习”——即模型在部署中从真实、复杂且不可验证的世界互动中持续学习并更新自身权重。这需要解决样本效率、持续学习和架构创新等一系列挑战。
大纲与深读 8 章 展开「深读」看每一段讨论的问题与论据。
01
实验室的核心押注与乐观派观点 实验室当前押注通过在海量可验证的强化学习环境中训练AI来实现通用人工智能。 乐观派认为数据效率低下和缺乏持续学习等根本缺陷可以通过扩大训练规模来克服。 训练是一次性成本,可摊薄至数十亿用户会话中,关键在于模型在会话内的智能和样本效率。 随着更多强化学习训练,模型在会话内解决复杂问题和长时间跨度问题的能力正在持续提升。 深读这一段 讨论的问题: 实验室实现AGI的核心研究押注是什么?乐观派如何看待当前范式的缺陷?
论据 / 案例: 模型在训练时比人类样本效率低百万分之一,但训练成本可摊薄至数十亿用户会话。
02
可验证性不足,需“可磨练性” 01:03 计算机使用领域的进展为何远慢于编码和数学等同样可验证的领域? 一个被低估的原因是领域不仅需要可验证,还需要“可磨练”——即能针对确定性和可重放的模拟器进行大量并行推演。 例如,编码可以创建成千上万个并行AI智能体尝试解决同一问题,但计算机使用无法轻易对亚马逊结账流程进行并行重放。 构建高保真度的通用应用克隆是解决此问题的途径,但这目前非常劳动密集且不可扩展。 深读这一段 讨论的问题: 为什么计算机使用领域的AI进步速度远慢于编码等同样可验证的领域?
论据 / 案例: 无法在亚马逊网站上并行运行一千个智能体尝试相同的结账流程,因为会被检测和关闭。
03
样本效率是现实世界任务的核心瓶颈 02:35 如果无法为某个领域构建可重放的训练目标,模型将难以取得太大进展,根源在于训练时极低的样本效率。 构建业务、打赢官司、日内交易或赢得选举等任务需要与世界交互,无法在数据中心内重放和验证。 这类非平稳、无重置的强化学习环境是已知的开放性问题,其数据具有特异性和稀疏性。 要在这些领域发展技能,AI必须能从稀缺、非结构化、不可验证的现实交互中学习。 深读这一段 讨论的问题: 对于需要与世界交互、无法在模拟器中重放的复杂任务,AI训练的核心瓶颈是什么?
论据 / 案例: 构建商业、打赢官司、日内交易等任务的验证可能需要数月或数年的现实世界行动才能得出。
04
RLVR能否泛化至开放世界? 04:05 实验室押注在足够多的可重现环境中训练的RLVR能发展出通用智能体,使其能在会话内制定计划、快速学习。 一个核心的实证问题是:如果将环境训练的投入从数十亿增加到万亿美元,能否获得完全通用、类人的智能? Dario Amodei的言论暗示短时RL训练未必能泛化到长时表现,这质疑了从白领任务泛化到现实世界从零建立业务的能力。 即使AI通过上下文学习能成为天才,若无法将学习成果写回权重,这些能力也将是短暂和浪费的。 深读这一段 讨论的问题: 仅靠在可验证环境中训练的RLVR,能否泛化到需要长期规划和现实交互的开放世界任务?
论据 / 案例: Dario Amodei表示,在短上下文长度下训练的模型在提供长上下文服务时性能会下降,暗示短时训练不易泛化。
05
持续学习必须回归权重 05:40 持续学习需要将学习成果写回模型权重,而不仅仅是无限增长的上下文缓存,后者不可扩展。 人类学习是将知识压缩回权重,这有助于泛化;而类似人类自闭症学者的超高保真回忆反而会损害抽象理解能力。 当前在线学习的瓶颈在于,梯度更新非常低效,且单一用户会话提供的数据量不足以训练更强的AI。 样本效率和持续学习是深度关联的问题:模型在部署中“在职学习”的数据是稀缺的。 深读这一段 讨论的问题: 为什么真正的持续学习必须将从上下文中获得的知识更新回模型权重?当前面临什么瓶颈?
论据 / 案例: Cursor Tab模型通过预测相同的目标(哪些编辑被接受)进行在线学习,每天处理超过4亿个请求,但这是单一任务。
06
OPSD:一种更优的持续学习方案 07:20 OPSD鼓励基础模型在解决现实问题时做出与积累经验的“教师模型”相同的预测,从而将会话知识蒸馏回权重。 OPSD相比RLVR有两个优势:不需要外部可验证的奖励,并且提供比朴素RL更密集的监督信号。 OPSD优于有监督微调,因为它不是死记硬背会话记录,而是提取改善工作的关键知识。 RL的梯度更新是稀疏的,只改变模型达到目标所必需的部分,这有利于避免灾难性遗忘。 深读这一段 讨论的问题: 什么是“在策略自蒸馏”?它为何可能是实现持续学习的一个更优方案?
论据 / 案例: 基于策略自蒸馏,训练基础模型匹配在长会话后做出的预测,无需外部奖励信号。
07
“做梦”:第四维扩展的投机性设想 08:40 “做梦”指AI构建现实模拟进行演练,从而在相同墙钟时间内体验指数级更多的模拟样本。 EfficientZero模型在模拟中玩游戏的速度远快于人类,这展示了通过内部模拟提升效率的可能性。 这将成为继预训练、RL和推理时间计算之后的第四个扩展维度:模型花费算力构建并训练用于生产演练的强化学习环境。 这非常具有投机性,因为构建整个世界的模拟比模拟围棋要困难得多。 深读这一段 讨论的问题: 什么是“做梦”作为AI扩展的第四个维度?它面临的主要挑战是什么?
论据 / 案例: EfficientZero模型在2小时内通过内部模拟玩大量游戏,可能击败同样是新手的人类。
08
展望2027年的持续学习图景 09:50 RLVR训练产生的智能体已具备应对陌生问题、尝试策略并迭代的能力,这是将其部署到现实世界的关键。 到2027年底,有效上下文长度可能支持AI与人类进行为期一周的实时协作,之后通过反馈进行蒸馏学习。 AI将能在其通过RLVR训练的领域相邻的领域中学习并提升能力,实现能力范围的持续扩展。 未来AI的主要提升方式将不再是发布前的训练,而是从广泛部署和全球用户交互中积累的经验。 深读这一段 讨论的问题: 到2027年底,基于持续学习范式的AI能力提升路径可能是什么样子的?
论据 / 案例: 通过OPSD、做梦或其他技术,将AI在一周协作中学到的所有内容蒸馏回基础模型。
金句
"The next big breakthrough will be AIs learning on the job" —— 下一个重大突破将是AI在职学习。
"It is not enough for a domain to be verifiable. It also has to be very grindable." —— 一个领域光是可验证还不够,它还必须非常“可重复刷”。
"If AIs are to develop all the skills that humans have... they need to be able to learn from information revealed in unstructured, unverifiable, and ambiguous ways from scarce amounts of real world interaction." —— 如果AI要发展出人类的所有技能……它们需要能够从稀缺的现实世界互动中揭示的、非结构化、不可验证且模糊的信息中学习。
"Maybe I’m reading too much into it but he seems to be saying that short-horizon RL training doesn’t necessarily generalize to long-horizon RL performance." —— 也许我解读过度了,但他似乎在说,短期强化学习训练不一定能泛化到长期性能。
"We’ve got some genius grad student who has never been allowed to take an internship." —— 我们培养了一个天才研究生,却从不允许他去实习。
← 上一篇 罗永浩谈借钱哲学:不借钱给朋友,可能既失去朋友也失去钱 下一篇 → 零跑朱江明:技术自研如何打造‘中国版阿尔法’MPV