嵌套学习:AI持续学习与架构幻觉的新范式
在本次访谈中,康奈尔大学博士生Ali Behrouz介绍了其颠覆性工作“嵌套学习”。该范式受人类记忆系统启发,通过让模型不同层以不同频率更新,实现了在保留核心知识的同时快速适应新上下文,解决了传统AI的灾难性遗忘问题。文章深入探讨了该架构的核心思想、实现机制(如“希望”架构)、“AI睡眠”概念,以及其对隐私、对齐和AGI路径的深远影响。
AAli Behrouz · 康奈尔大学博士生、谷歌研究员
查看原文 ↗ 导语
在人工智能向通用智能迈进的征途中,一个核心瓶颈在于当前模型无法像人类一样进行“持续学习”——即在获取新知识的同时不遗忘旧技能。康奈尔大学博士生、谷歌研究员Ali Behrouz提出的“嵌套学习”范式,为解决这一难题提供了极具潜力的路径。该工作被谷歌AI负责人Jeff Dean誉为可能带来范式转变。嵌套学习的核心思想是让AI模型的不同部分以不同频率更新,模仿人脑从工作记忆到长期记忆的多层次处理机制。本期访谈深入探讨了该架构的设计哲学、技术细节、其最新衍生研究“语言模型需要睡眠”,以及它可能对AI隐私、对齐和未来生态产生的深远影响。
大纲与深读 9 章
展开「深读」看每一段讨论的问题与论据。
01
引言:新架构与持续学习
- 访谈聚焦于Ali Behrouz的“嵌套学习”论文及其对持续学习架构的潜在变革性影响。
- 核心议题是解决当前AI模型无法持续学习、更新知识和适应环境的根本缺陷。
- 讨论范围涵盖从生物启发的架构设计到其对隐私、对齐和AGI的深远影响。
深读这一段
论据 / 案例:Ali Behrouz是康奈尔大学研究生和Google研究员。其论文《嵌套学习》被杰夫·迪恩誉为可能的范式转变。
02
生物启发与当前AI的局限
05:44- Ali的研究灵感源于大脑和进化,但旨在获取高层规则而非精确复制大脑机制。
- 当前大语言模型的核心缺陷是缺乏持续学习能力,存在知识截止日期和灾难性遗忘问题。
- 模型无法高效地在参数中长期整合新知识,导致其在真实世界应用中受限。
深读这一段
讨论的问题:当前AI系统在适应环境和持续学习方面存在哪些根本性缺失?
论据 / 案例:例如,如果直接询问GPT关于特定信息且禁止使用工具,会暴露出其知识截止日期。
03
理想AI的双阶段学习模型
16:01- 真正的持续学习者不应区分训练和测试阶段,但模型仍需要两个不同功能的阶段。
- 第一阶段是“活跃阶段”:模型主动接收和处理来自用户或环境的信息。
- 第二阶段是“睡眠阶段”:模型在无外部输入时进行自我处理,巩固记忆并发现知识间的潜在联系。
深读这一段
讨论的问题:理想的持续学习AI模型在技术上应具备哪两个核心阶段?
04
嵌套学习的核心范式
27:15- 嵌套学习通过引入不同更新频率的“层级”而非“层”,来实现更高的表达性和计算深度。
- 核心在于允许系统部分(如快更新网络)实时适应,同时另一部分(如慢更新网络)保留核心知识。
- 这种设计旨在解决效率问题:每个时间步只需更新一小部分参数,而非全部。
深读这一段
讨论的问题:嵌套学习范式如何通过不同更新频率的层级结构,解决传统模型的表达性和效率问题?
05
HOPE架构详解
40:42- HOPE注意力:在Transformer中保留注意力机制,但将单个MLP块替换为多个以不同频率更新的MLP块,形成持续记忆系统。
- HOPE架构:用“自修改泰坦”模块替换注意力机制,该模块能生成自己的值函数,实现更深度的序列理解和适应性。
- “自修改”意味着模型能控制并修改自身的更新规则,其值组件是当前权重状态的函数,而非预先投影的固定向量。
深读这一段
讨论的问题:HOPE注意力和HOPE架构的具体结构是什么?“自修改”模块与传统注意力机制有何本质区别?
论据 / 案例:在梯度下降中,权重更新过程(W_{t+1} = W_t - K * V)本身可视为一种关联记忆,其中值V是损失对输出的梯度,是当前权重W_t的函数。
06
嵌套学习与深度学习之幻象
60:05- Ali将深度学习架构视为一种“幻象”,认为所有组件(如反向传播、注意力)本质上都是关联记忆的不同形式。
- 这种统一视角将“上下文学习”置于核心,预训练、推理等过程均可理解为在上下文中的学习。
- 嵌套学习通过增加每个参数的计算量(多个计算步骤)和提升模型适应性来实现更强性能。
深读这一段
讨论的问题:为什么Ali将深度学习架构称为“幻象”?这种观点如何统一解释了不同的机器学习组件?
论据 / 案例:反向传播可以被形式化为一种关联记忆过程,类似于线性注意力。
07
性能表现与微技能优势
100:25- 新架构在标准基准测试中与Transformer竞争力相当,但在某些困难任务上表现更优。
- 微技能优势体现在处理超长上下文(如1000万令牌的回忆)和同时学习多门未见过语言等任务上。
- 这些结果表明,嵌套学习可能提供了传统架构所不具备的质的不同能力。
深读这一段
讨论的问题:嵌套学习架构在哪些具体任务上展现出超越传统Transformer的“微技能”优势?
论据 / 案例:架构在处理多达1000万令牌的上下文回忆和同时学习多个新语言翻译任务上表现出色。
08
持续学习对隐私与对齐的挑战
135:41- 持续学习带来的模型进化能力既是机遇也是巨大风险,尤其对用户隐私和AI对齐构成挑战。
- 模型通过长期交互学习个体需求,可能变得更个性化、更有效,但也可能固化偏见或产生不可预测的行为。
- Ali持谨慎乐观态度,认为这可能催生更多样化、更稳定的AI生态系统,但需要仔细权衡利弊。
深读这一段
讨论的问题:持续学习能力的实现对AI的隐私保护和对齐(Alignment)带来了哪些潜在风险与机遇?
09
意识、生态系统与总结
168:36- 讨论触及了AI意识问题,但Ali更关注构建能理解人类需求的新形式智能,而非复制人类智能本身。
- 持续学习可能推动AI向更自主的生态系统发展,模型可基于交互不断自我改进。
- 嵌套学习代表了一个关键的新研究方向,可能使当前关于现有架构能否扩展至AGI的争论变得过时。
深读这一段
讨论的问题:持续学习范式最终将把AI引向何方?它如何可能改变我们关于AGI发展路径的讨论?
金句
- "过去40年的整个文献大部分都建立在这样一个范式上:我们有一个预训练或训练阶段,以及一个测试阶段。但关键在于,如果我们实现了持续学习……一个真正的持续学习者没有测试和训练时间之分。"
- "我们所知的一切在某种程度上都是上下文学习的一种形式。"
- "值组件并非来自此递归公式之前的另一个组件,而是由该递归过程每次生成的。"
- "我们不想复制人类能做的事。但另一方面,我们想拥有一种新的智能形式,它被很好地设计,能真正理解人类需求。"