Hinton谈神经网络:从反向传播到玻尔兹曼机

辛顿回顾了神经网络发展的两条路径:成功的反向传播与有趣的玻尔兹曼机。他详细解释了反向传播如何通过链式法则并行调整权重,并以2012年AlexNet为里程碑。随后,他转向基于统计物理的玻尔兹曼机,阐述其通过“唤醒-睡眠”学习规则获取梯度的优美理论,以及受限玻尔兹曼机如何作为“酶”帮助初始化深度网络,为现代AI的诞生铺路。

杰弗里·辛顿

导语

在本次演讲中,诺贝尔物理学奖得主杰弗里·辛顿带领我们回顾了神经网络发展史上两个关键的学习程序:一个“奏效”并奠定了当前AI基础(反向传播),另一个则“非常有趣”但未能广泛成功(玻尔兹曼机)。辛顿以其特有的物理学视角,深入浅出地剖析了反向传播的工作原理及其局限性,随后转向基于统计物理的玻尔兹曼机,阐释了其优美的理论框架、学习规则以及最终如何通过一种“酶”的形式,间接催化了深度学习革命的到来。

大纲与深读 10 章

展开「深读」看每一段讨论的问题与论据。

01

开场与讲座结构

  • Hinton将讲座分为两部分:先讲实际有效的反向传播,再讲更有趣但效果不佳的统计物理方法。
  • 反向传播是深度学习和当前AI的基础。
  • 另一个学习程序基于统计物理,灵感来自赫布理论。
深读这一段

讨论的问题:本次讲座的主要内容和结构是什么?

论据 / 案例:讲座被明确划分为两部分,分别对应反向传播和基于统计物理的程序。

02

AI历史与神经网络基础

00:55
  • AI历史上存在两种路径:逻辑符号主义(强调推理)和神经网络(强调学习连接权重)。
  • 神经网络由多层神经元和可学习的连接权重构成,目标是输入图像像素后输出正确的物体标签。
  • 反向传播通过链式法则并行计算所有权重的梯度,解决了逐个调整权重效率低下的问题。
深读这一段

讨论的问题:神经网络和反向传播的核心思想是什么?

论据 / 案例:提到了神经网络的结构(层、神经元、权重)和反向传播的工作原理(前向传播、误差反向传播、链式法则)。

03

AlexNet与语言模型突破

03:58
  • 2012年,我的学生Ilya Sutskever和Alex Krizhevsky开发的AlexNet将图像识别错误率降低一半,开启了神经网络的浪潮。
  • 许多符号AI专家曾断言神经网络无法处理语言,但大规模语言模型证明了这一观点的错误。
  • 乔姆斯基的语言学理论(强调先天语法)与基于数据的语言学习存在根本冲突。
深读这一段

讨论的问题:神经网络在视觉和语言领域取得了哪些关键突破?

论据 / 案例:案例:AlexNet(2012年,错误率减半);提及了GPT-4反驳关于语言的早期引述;乔姆斯基的理论。

04

意义理论与早期语言模型

08:00
  • 存在两种意义理论:结构主义(词义由与其他词的关系决定)和特征主义(词义是大量特征的集合)。
  • 我在1985年开发了一个微型语言模型,将这两种理论统一:将词转换为特征向量,并预测下一个词的特征。
  • 该模型通过反向传播学习,并能从家族树数据中自动学习出国籍、世代等有意义的特征。
深读这一段

讨论的问题:意义的两种理论是什么?微型语言模型如何统一它们?

论据 / 案例:1985年的微型语言模型;使用了家族树数据;学习到了“意大利人只与意大利人通婚”等隐含的国籍特征。

05

反向传播的生物学局限

16:00
  • 反向传播难以用神经科学上合理的方式在大脑中实现。
  • 大脑使用二进制脉冲信号,且感知过程是连续的,无法轻易中断以发送误差信号。
  • 反向传播在信息压缩效率上远超大脑,但大脑在少量经验下学习(我们寿命约20亿秒)。
  • 核心问题:是否存在一种完全不同的、无需反向传播的梯度计算方法?
深读这一段

讨论的问题:为什么反向传播可能不是大脑的学习方式?大脑学习可能有何不同?

论据 / 案例:对比了反向传播(需要真实值误差信号、中断处理流)与大脑(二进制脉冲、终身学习)的特点;提到了连接数(大脑约100万亿,大型模型约1万亿)。

06

霍普菲尔德网络与能量模型

19:31
  • 霍普菲尔德网络使用二进制神经元和对称权重,其构型具有“能量”,局部极小值可作为记忆存储。
  • 特里·赛诺夫斯基和我提出将其用于感知推断:用可见层表示输入图像,隐藏层表示解释,通过寻找低能量状态进行解读。
  • 解决歧义(如Necker立方体)需要引入先验假设,例如:图像中相交的线在3D空间中通常也相交,且常以直角相交。
深读这一段

讨论的问题:霍普菲尔德网络是什么?如何将其用于感知推断?

论据 / 案例:霍普菲尔德网络;内容可寻址记忆;Necker立方体歧义;基于光学和世界常识(线在3D中相交)的先验假设。

07

玻尔兹曼机与热力学均衡

32:00
  • 使用带噪声的神经元(模拟“温度”)可以跳出局部极小值,使系统趋向更深的能量极小值。
  • 系统经过足够长时间运行后会达到“热平衡”:虽然单个网络状态在变化,但所有可能状态的概率分布(直方图)趋于稳定。
  • 在热平衡下,一个状态的概率仅取决于其能量相对于所有其他状态的能量。
深读这一段

讨论的问题:为什么需要带噪声的神经元?热平衡状态有何意义?

论据 / 案例:引入“温度”的概率性决策规则;热平衡的统计定义(稳态分布);能量与概率的关系(玻尔兹曼分布)。

08

玻尔兹曼机学习规则

40:00
  • 学习目标是使模型在自由生成时,能产生与训练数据相似的样本。
  • 学习规则分为“清醒”相和“睡眠”相:清醒时固定输入数据,让网络达到热平衡后增加同时激活的神经元对之间的连接权重;睡眠时让网络自由生成,达到热平衡后减弱同时激活的神经元对之间的连接权重。
  • 该规则在数学上对应最大化数据似然的精确梯度:梯度等于数据下的相关性与模型生成下的相关性之差。
深读这一段

讨论的问题:玻尔兹曼机的学习算法是什么?它如何近似梯度?

论据 / 案例:学习规则:清醒相(增加共激活权重)、睡眠相/反学习(减弱共激活权重);数学公式:梯度等于数据下的期望相关性与模型下的期望相关性之差。

09

受限玻尔兹曼机与历史作用

48:00
  • 标准玻尔兹曼机因达到热平衡耗时过长,在实际中效果不佳。
  • 受限玻尔兹曼机(RBM)限制隐藏单元之间无连接,使得“清醒”相(从数据推断隐藏状态)可以一步完成,极大提高了效率。
  • 使用对比散度算法(仅进行“上-下-上”少量步)进行近似学习,在Netflix推荐系统等任务中取得成功。
  • 通过堆叠RBM可以逐层预训练深度网络,这在2006-2010年左右是训练深层网络的有效方法,为深度学习热潮奠定了基础。
深读这一段

讨论的问题:玻尔兹曼机有何实际应用?其简化版本如何推动了深度学习发展?

论据 / 案例:受限玻尔兹曼机(RBM);对比散度算法;Netflix百万美元竞赛获奖方案(结合RBM与矩阵分解);RBM堆叠用于深度网络预训练(作为“酶”)。

10

睡眠的潜在功能与总结

58:20
  • 尽管玻尔兹曼机在工程上已被反向传播取代,但其“睡眠期反学习”的思想对理解大脑功能仍有启发。
  • 睡眠剥夺会导致严重精神问题,这可能与“反学习”机制失效有关。
  • 讲座总结了两种学习程序:反向传播奠定了当前AI基础,而玻尔兹曼机虽效果不佳,但其思想具有深刻启发性。
深读这一段

讨论的问题:睡眠的“反学习”假设是什么?对理解大脑有何启示?

论据 / 案例:睡眠剥夺导致精神病;将睡眠期类比为“反学习”以平衡连接强度;总结两种学习程序的不同角色。

金句

  • "One of them was very interesting, and the other one worked." ——其中一个非常有趣,另一个则真正奏效。
  • "The point is to show that even in a tiny net that you can have two different minima." ——目的是表明,即使在一个微小的网络中,你也可以有两个不同的最小值。
  • "The way we're going to interpret a binary image is we're going to clamp the binary image on the visible units and then we're going to go round updating neurons using this probabilistic decision rule." ——我们解释二值图像的方法是:将图像固定在可见单元上,然后使用这个概率决策规则循环更新神经元。
  • "So the answer is everything it needs to know about the other weights is conveyed by letting the system settle to the equilibrium in these two phases." ——答案是,它需要了解的关于其他权重的所有信息,都是通过让系统在这两个阶段稳定到平衡状态来传递的。
  • "So you can think of it as like an enzyme that helped deep learning be born." ——所以你可以把它想象成一种酶,帮助了深度学习的诞生。

原文链接

查看完整访谈

完整内容见原文:GAGATalk · Hinton谈神经网络:从反向传播到玻尔兹曼机