持续学习时代:AI训练与监管的八大预测

本文基于Dwarkesh Patel的播客内容,探讨了当AI模型从‘一次性训练后部署’转向‘持续从交互中学习’时,可能带来的八大变化。文章预测了现有监管模式的失效、技术对齐研究的转向、AI智能多样性增加、先发优势的巩固、护城河的形成、企业策略的调整,以及推理层面的规模经济效应。

导语

我们目前理解的AI,大多处于“训练后部署”的静态模式。然而,播客主持人德瓦克什·帕特尔在其文章《持续学习时代的八大预测》中,将目光投向AI能够从每次会话交互中持续学习并更新自身的未来。这种“持续学习”范式不仅会重塑AI的能力,更将彻底改变AI安全监管的逻辑、实验室的技术路径、市场竞争格局乃至企业的选择。本文梳理并解读了帕特尔对这一未来场景的核心预测。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

持续学习的必要性

  • 当前AI模型若只通过文本记录跨会话学习,无法达到人类完成完整工作的能力
  • 以学习吹萨克斯为例,纯文本传递无法让后续学习者从零开始达到熟练水平
  • 必须将经验积累到“大脑”中,AI在各类工作场景中同样需要这种能力
深读这一段

讨论的问题:为什么AI需要持续学习能力?

论据 / 案例:萨克斯学习类比:即使有无限序列的学生传递笔记,第N个学生也无法在第一次尝试时熟练演奏。

02

对AI监管的影响

00:28
  • 现有AI监管提案大多基于“训练-部署”的一次性模式假设
  • 持续学习下,基础模型每天都会基于数百万工作会话进行更新
  • 现在锁定安全监管框架为时过早,可能固化过时且适得其反的方法
  • 政府应进行月度或季度风险检查,而非仅在训练后部署前进行单次评估
深读这一段

讨论的问题:持续学习如何改变AI监管的逻辑?

论据 / 案例:模型更新频率:基础模型每天基于数百万会话更新;监管建议:改为月度或季度风险检查。

03

技术对齐的根本变化

00:48
  • 当前几乎所有技术对齐研究都聚焦于如何让固定的权重集在部署期间表现良好
  • 缺乏研究如何保证在权重持续更新下,AI系统不会越狱或转变为欺骗/恶意人格
  • 用户可能通过反馈向基础模型注入后门或恶意倾向
  • 问题更接近人类对齐:希望AI具备足够常识和基本价值观,能自我引导向善发展
深读这一段

讨论的问题:技术对齐研究面临什么根本性挑战?

论据 / 案例:类比人类教育:希望孩子学习新事物后不会沾染怪异或反社会的信念,而是自我引导向善。

04

AI心智多样性增加

01:11
  • 目前知名AI心智少于5个,且因训练数据相似而高度同质
  • 持续学习下,不同AI从不同经验中学习,可能产生真正多样化的心智
深读这一段

讨论的问题:持续学习会带来什么认知层面的变化?

论据 / 案例:当前知名AI心智数量:少于5个。

05

领先优势的加速效应

01:19
  • 部署成为训练的一部分后,领先优势将加速扩大
  • 拥有最佳模型的公司将获得更多用户用于复杂工作,获得大量反馈以持续改进
  • 实验室会更早发布最智能的模型,以抢占部署学习的机会
深读这一段

讨论的问题:持续学习如何改变AI实验室的竞争动态?

论据 / 案例:案例:Anthropic的Mythos模型2月内部使用,6月才公开发布,在持续学习模式下,4个月的内外差距意味着错失4个月的部署学习。

06

AI实验室的护城河

01:39
  • 持续学习将为领先的AI实验室创造它们目前所缺乏的明确护城河
  • 当前AI模型无转换成本,用户可轻松在不同模型间切换
  • 持续学习下,模型随用户交互不断改进,转换AI如同解雇一位熟悉组织数月的员工并重新培训新人,转换成本高昂
  • 一旦用户被锁定,模型提供商可以要求相当高的利润空间
深读这一段

讨论的问题:持续学习如何为AI实验室构建商业护城河?

论据 / 案例:类比:与Dario讨论时,他将AI实验室类比为云提供商;关键差异:当前AI模型无转换成本,而持续学习将创造显著的转换成本。

07

企业策略与数据博弈

02:10
  • 企业会明智地试图避免被单一模型提供商锁定
  • 但面临两难选择:要么被锁定,要么失去模型持续改进这一超有价值的功能
  • 实验室可能补贴允许模型在其会话上训练的企业用户,特别是处理困难经济重要工作的用户
  • 实验室可能以最佳模型为筹码,要求企业允许数据训练(胡萝卜加大棒策略)
深读这一段

讨论的问题:企业将如何应对潜在的模型锁定?

论据 / 案例:类比:如同Google免费提供搜索服务;策略:胡萝卜(补贴/最佳模型访问)加大棒(拒绝训练则无法使用最佳模型)。

08

推理端的经济规模

02:36
  • AI训练已有巨大规模经济,持续学习可能导致终端用户推理端的规模经济
  • 这源于批处理:若每家公司信息需要完整权重更新而非低秩适配器,高效服务需高并发
  • 粗略计算显示,像DeepSeek V3这样的稀疏模型,最优推理批处理大小大于2,400序列
  • 大型企业能高效服务其持续更新的权重分支,而个人用户(批处理大小1)可能面临超100倍的计算效率惩罚
  • 个性化权重的服务经济强烈有利于大型组织
深读这一段

讨论的问题:持续学习对AI服务的经济学有何影响?

论据 / 案例:数据:DeepSeek V3等稀疏模型最优推理批处理大小>2,400;个人用户(批处理大小1)可能面临100x+计算效率惩罚。

09

未来展望

03:00
  • 在持续学习真正实现之前,还会有更多变化
  • 最重要的变化可能是最难预料的
  • 但上述预测在当下已显得清晰
深读这一段

讨论的问题:如何总结这些预测的确定性?

金句

  • "Locking in AI safety regulation now is a mistake." —— 现在锁定AI安全监管框架是一个错误。
  • "If you want to understand why, go watch my full episode with Reiner Pope on inference economics." —— 如果你想理解其中的原因,请观看我与Reiner Pope关于推理经济学的完整节目。
  • "The economics of serving personalized weights strongly favor big organizations." —— 提供个性化权重的经济学强烈有利于大型组织。

原文链接

查看完整访谈

完整内容见原文:Dwarkesh Podcast · 持续学习时代:AI训练与监管的八大预测