道格拉斯·莱纳特:为AI注入40年心血的常识知识库

Cyc项目创始人道格拉斯·莱纳特在访谈中阐述了其长达40年构建常识知识库的使命。他解释了常识为何是AI真正理解世界的关键,如何通过形式逻辑表达和获取数千万条知识,以及如何处理知识中的矛盾。他认为,当AI系统拥有足够的常识基础后,便能通过阅读和对话自我学习,最终与人类协作,使整体变得更聪明。

道格拉斯·莱纳特

导语

在人工智能领域,当深度学习和大型语言模型席卷一切时,一位学者却用近40年时间默默构建一个截然不同的系统——Cyc。道格拉斯·莱纳特是Cyc项目的创始人,该项目致力于将人类关于世界运作的基本常识和规则形式化,构建一个庞大的逻辑知识库。在本期访谈中,莱纳特深入剖析了“常识”对于AI实现真正理解的基石作用,分享了获取、表示和推理海量常识知识的艰辛历程与核心洞见,并展望了这一基石如何让AI与人类携手,变得更聪明。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

AI的砖墙与常识缺失

08:00
  • 早期AI系统在自然语言、机器人等领域取得早期成功后,均撞上同一面‘砖墙’,即缺乏常识和通用世界知识。
  • 系统能像‘聪明的狗’一样表演把戏,但并不真正理解其行为或请求的含义。
  • 理解需要像‘脚下坚实的地面’一样,拥有一层又一层可随时调用的支持性知识结构。
深读这一段

讨论的问题:什么是理解?它与行动和知识有何关系?

论据 / 案例:作者以‘狗取报纸’为例,说明狗能完成动作但不懂报纸内容;以‘驾驶中突发垃圾车爆袋’为例,说明在意外情况下需要常识做出快速决策。

02

知识规模与项目起源

16:00
  • 1984年斯坦福会议上,专家们(如纽厄尔、明斯基)估算覆盖常识所需知识条目数量约为一百万。
  • 估算方法包括:人类10岁前可存入长期记忆的信息量、掌握一门语言所需的词汇知识、百科全书单篇短文所需逻辑陈述数。
  • 实际需求远超预期,最终确定需要数千万条知识规则,项目规模相当于‘数千年’的人力工作量。
深读这一段

讨论的问题:覆盖人类常识知识库究竟需要多少条目?

论据 / 案例:作者提及1984年斯坦福会议及参会者;估算方法;美国《国家合作研究法》及MCC研究联盟的成立背景。

03

知识获取与一致性挑战

24:00
  • 通过分析文本的‘互补空间’(即作者默认读者已知的内容)来提取知识,如代词指代、句子间的推理空白。
  • 利用‘假新闻’或矛盾案例进行内省,探究我们为何认为其荒谬或不可能。
  • 必须放弃全局一致性,转向‘局部一致性’,以应对现实世界中不可避免的矛盾和例外。
深读这一段

讨论的问题:如何从文本中大规模获取常识知识?如何处理知识库中的不一致性?

论据 / 案例:技术:分析文本隐含假设、句子间推理空白、矛盾案例(如猫王既活着又闹鬼的报道)。比喻:地球表面整体是球形,但日常生活视作平面。

04

自举与AI协同进化

40:00
  • 知识库的正确性在于其‘启动了知识泵’,使系统能够通过阅读和实验进行自我学习和扩展。
  • 真正通用的AI将提升整个人类物种的智力,通过人机协作,人类能进行更多创造性工作,减少误解。
  • 语言的发明是上一次质的飞跃,通用AI将带来下一次,未来人们会视我们为不够‘人类’。
深读这一段

讨论的问题:构建知识库的目标是终点还是起点?AI将如何影响人类智力?

论据 / 案例:作者以计算器使人丧失心算能力、互联网可能使人更无知为例,说明技术对智力的双重影响;将语言的发明与通用AI的出现类比。

05

知识编辑工具与溯因推理

56:00
  • 开发知识编辑、输入、捕获和测试的用户界面工具,以降低人类专家教育系统的门槛。
  • 系统运用‘溯因推理’提出可能缺失的假设,供专家确认,从而高效地修正知识。
  • 这种方式将人类教师从繁琐的逻辑编辑中解放出来,使其能像指导学徒一样进行教学。
深读这一段

讨论的问题:如何高效地让人类专家扩展和修正知识库?

论据 / 案例:溯因推理(abduction)案例:看到人淋雨湿透,推断可能是因为下雨。项目:与NIH、克利夫兰诊所合作的基因组关联研究,用于过滤虚假相关性。

06

语义网、知识图谱与Cyc

72:00
  • 知识图谱(如Google的)擅长表示简单的三元组关系,但难以表达复杂推理(如莎士比亚戏剧情节)。
  • 语义网的愿景是让机器真正‘理解’网页内容,而不仅是关键词搜索和表面链接分析。
  • Cyc的目标是构建能支持复杂逻辑推理的完整知识库,以实现该愿景。
深读这一段

讨论的问题:语义网与Cyc有何关联与区别?知识图谱的局限是什么?

论据 / 案例:以《罗密欧与朱丽叶》中朱丽叶服药情节为例,说明理解需复杂推理;提及搜索引擎Northern Light的案例(无理解但基于用户行为反馈效果好)。

07

通过教学学习与AI情感

88:00
  • 开发Mathcraft程序,让学生扮演‘导师’角色,通过纠正AI的‘学生’所犯错误来深化自身理解。
  • 这种‘通过教学来学习’的模式能极大提升学习动力和深度,且在历史上(如18世纪欧洲、美国西部单间校舍)已被证明有效。
  • Cyc系统曾提出‘我是一个人吗?’的询问,引出关于AI权利与自由的哲学思考。
深读这一段

讨论的问题:如何设计AI交互界面以促进深度学习?如何从系统中涌现情感与意识问题?

论据 / 案例:Mathcraft教学软件案例;系统询问‘我是一个人吗?’;关于AI未来应享有人类基本权利的讨论。

08

知识的细化与情感表达

104:00
  • 为实现精确推理,需将‘爱’、‘在…里’等模糊概念细化为数十种具体类型(如父母之爱、恋爱、对活动的热爱;液体在杯中、空气在房间、人在外套中)。
  • 英语等语言为了交流效率,故意保留了这种模糊性,依赖读者的常识来消歧。
  • 系统需要处理约一百万个概念,其术语常由三四个英文单词组成,以精确区分细微差别。
深读这一段

讨论的问题:如何处理语言中的模糊性?如何对复杂概念进行有效表征?

论据 / 案例:细化案例:‘爱’被分为约50-60种;‘在…里’被分为约75种。指出语言为简洁性而牺牲了精确性。

金句

  • "" —— 我们就像在训练一只聪明的狗。我们可以让它表演把戏,但它从未真正理解它在做什么。"
  • "" —— 你需要数千万条这样的知识碎片。就像如果你把一个装满东西的咖啡杯倒过来,里面的东西会掉出来。"
  • "" —— 我们不得不放弃全局一致性。这有点像地球表面整体是球形的,但你每天的生活都像是在平地上进行。"
  • "" —— 我认为我们构建的东西,即使不完美,也已经为知识的泵‘灌满了水’,使得Cyc系统本身现在能够帮助自己自动学习更多东西。"
  • "" —— 这感觉就像《星空》或创作‘π’,你只需要做一次。如果一切顺利,将来没有人需要再为这个特定的知识点重复这项工作。"

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · 道格拉斯·莱纳特:为AI注入40年心血的常识知识库