脑启发AI:从视觉皮层到递归皮层网络

神经科学家Dileep George探讨了理解大脑对构建真正智能AI的重要性。他批评了‘蓝脑计划’等纯模拟方法,主张必须从计算和信息处理角度理解大脑。其团队开发的递归皮层网络(RCN)受视觉皮层启发,具备反馈连接和动态推理能力,能以极少样本学习,并在验证码破解等任务上展现出强大的泛化能力。

迪利普·乔治

导语

在人工智能追求通用智能的道路上,“脑启发”是一个既充满希望又备受争议的方向。神经科学家兼人工智能研究员Dileep George在本期访谈中,深入阐述了为何理解大脑的工作原理是构建真正智能AI的必经之路。他批判了仅靠堆砌神经元细节的模拟项目(如“蓝脑计划”),认为必须从计算和信息处理的视角去理解大脑。他分享了其团队受大脑视觉皮层启发而开发的“递归皮层网络”(RCN)模型,该模型不仅在验证码破解等任务上表现出色,更重要的是,它体现了大脑处理信息的关键原则:反馈连接、动态推理以及感知与认知的不可分割性。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

访谈引言与广告

  • 主持人Lex Fridman介绍嘉宾Subutai Ahmad,其背景是神经科学与AI交叉领域的研究员,曾联合创立Vicarious和Numenta。
  • 介绍访谈将探讨从层级时间记忆到递归皮层网络的脑启发AI发展历程。
  • 主持人提到赞助商Babbel、Raycon耳机和Masterclass,并鼓励听众通过特定链接支持播客。
02

理解大脑与构建大脑

02:14
  • Subutai Ahmad认为,要构建大脑,就必须理解其工作原理,不能像蓝脑计划那样仅靠堆砌细节进行模拟。
  • 蓝脑计划试图基于详细的生物物理神经元模型和连接统计数据来模拟大脑,但缺乏功能理论指导,难以调试。
  • 即使单个神经元模型非常精确(如Hodgkin-Huxley模型),也无法仅凭此构建出功能性的大脑系统,这类似于仅知道晶体管模型却无法构建微处理器。
深读这一段

讨论的问题:我们需要理解大脑才能构建它吗?

论据 / 案例:蓝脑计划试图通过详细生物物理模型和连接统计数据模拟大脑,但缺乏功能性理论指导。类比微处理器:理解晶体管模型不足以构建微处理器,需理解布尔逻辑等更高层次原理。

03

神经科学方法论的局限

05:02
  • 引用论文《神经科学家能理解微处理器吗?》说明,仅用神经科学的工具和方法可能无法理解像微处理器这样的系统架构。
  • 神经科学家确实能通过观察大脑获得有价值的见解和假设,但需要将其置于计算和信息处理的框架中整合,不能仅靠模拟。
  • 理解大脑是一个迭代过程:利用神经科学线索构建功能模型,模型反过来指导新的神经科学实验。
深读这一段

讨论的问题:当前神经科学方法在理解大脑功能方面的局限是什么?

论据 / 案例:论文《神经科学家能理解微处理器吗?》表明,神经科学工具难以揭示微处理器的布尔逻辑、时钟等架构功能。理解需结合神经科学观察与计算建模的迭代循环。

04

视觉皮层反馈连接与推断

08:18
  • 视觉皮层中反馈连接比前馈连接更多,大脑通过不断将世界模型投射回感觉输入来进行推断。
  • 实验展示了视觉处理的动态过程,例如在区分纹理三角形时,大脑先确定边缘轮廓,再填充内部表面。
  • 侧抑制和反馈机制解释了错觉(如Kanizsa三角)的产生,以及大脑如何通过竞争性假设解释感觉证据(如“解释消除”)。
深读这一段

讨论的问题:大脑视觉皮层中反馈连接的作用和动态是什么?

论据 / 案例:视觉皮层处理中反馈连接多于前馈连接。实验显示,在感知纹理三角形时,大脑先确定边缘再填充表面。Kanizsa三角错觉表明,反馈连接驱动了对幻觉边缘的延迟响应。大脑采用概率图模型式的推断来解释感觉证据。

05

皮层微环路与概念表征

12:41
  • 假说认为,皮层柱编码一个“概念”(如边缘或物体的存在),是二元随机变量。
  • 皮层柱之间的连接编码了不同概念变量之间的关系知识。
  • 皮层柱内部神经元结构和丘脑共同实现推断计算,包括假设竞争和解释消除,这得到了神经科学实验的支持。
深读这一段

讨论的问题:皮层微环路如何编码知识和进行推断计算?

论据 / 案例:假设:皮层柱编码二元概念变量,其连接编码概念关系。柱内神经元和丘脑实现推断计算。实验表明,刺激高层神经元可通过丘脑回路抑制其他皮层柱。

06

递归皮层网络模型

14:22
  • 递归皮层网络是受视觉皮层启发的计算机视觉模型,能同时处理分类、分割和查询,而非单一任务。
  • 模型核心约束是自上而下的可控性,支持想象和场景模拟,其生成模型并非追求逼真,而是可操作的结构化表征。
  • 模型因子化表征世界,如区分前景/背景、物体/部分、形状/纹理,这些因子化源自自然信号的连续性等基本属性。
深读这一段

讨论的问题:递归皮层网络的核心设计思想和架构特点是什么?

论据 / 案例:递归皮层网络是受视觉皮层启发的计算机视觉模型,能同时处理分类、分割等任务。模型强调自上而下的可控性,支持想象。其结构因子化表征世界(如前景/背景、形状/纹理),这些因子化源于自然信号的基本属性。

07

在验证码识别上的应用

16:53
  • 递归皮层网络成功应用于破解文本验证码,这需要模型具有强大的分布外泛化和动态推断能力。
  • 验证码通过字符变形和重叠来混淆计算机,但人类能轻松解决,这要求模型进行全局推断,协调局部矛盾证据。
  • 模型通过动态推断(而非仅前馈)整合局部证据与全局上下文,能提供可解释的、类似人类的错误模式。
深读这一段

讨论的问题:递归皮层网络如何解决验证码这类需要强泛化的视觉问题?

论据 / 案例:模型在2014-15年破解文本验证码。验证码字符重叠会造成局部混淆(如‘r’和‘n’看起来像‘m’)。模型通过动态推断,整合全局上下文解决局部矛盾。其错误模式与人类相似,且能提供可解释的场景解释。

08

模型性能与领域质疑

19:28
  • 同一模型在MNIST等数据集上,仅需几十到几百个训练样本即可达到95%准确率,数据效率远超当时其他系统。
  • 选择验证码这类问题,是为了挑战模型在训练集远小于测试集的场景下的强泛化能力。
  • Subutai Ahmad承认脑启发AI领域存在炒作,但认为其方法基于扎实的原理,其怀疑是合理的,但需要通过实际成果来验证。
深读这一段

讨论的问题:模型的性能表现如何,以及如何看待对脑启发AI的批评?

论据 / 案例:模型在MNIST上仅需几十到几百个样本即可达到95%准确率。选择验证码问题是为了研究强泛化能力(训练集远小于测试集)。嘉宾承认脑启发AI存在炒作,但认为其方法基于扎实原理,成果有待验证。

金句

  • ""If you want to build the brain we definitely need to understand how it works." —— 如果你想构建大脑,我们绝对需要理解它是如何工作的。
  • ""What we are seeing is not just a feed forward thing that just gets interpreted in in a few word party we are constantly projecting our expectations onto the world." —— 我们看到的不仅仅是经过几个词级处理的前馈信息,我们不断将预期投射到世界上。
  • ""The central problem in AI is what is the letter A. If you can build a system that reliably can detect all the variations of the letter A, you don't even need to go to the B and the C." —— AI的核心问题是‘字母A是什么’。如果你能构建一个系统可靠地检测出字母A的所有变体,你甚至不需要处理B和C。

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · 脑启发AI:从视觉皮层到递归皮层网络