道格拉斯·莱纳特:为AI注入40年心血的常识知识库
Cyc项目创始人道格拉斯·莱纳特在访谈中阐述了其长达40年构建常识知识库的使命。他解释了常识为何是AI真正理解世界的关键,如何通过形式逻辑表达和获取数千万条知识,以及如何处理知识中的矛盾。他认为,当AI系统拥有足够的常识基础后,便能通过阅读和对话自我学习,最终与人类协作,使整体变得更聪明。
导语
在人工智能领域,当深度学习和大型语言模型席卷一切时,一位学者却用近40年时间默默构建一个截然不同的系统——Cyc。道格拉斯·莱纳特是Cyc项目的创始人,该项目致力于将人类关于世界运作的基本常识和规则形式化,构建一个庞大的逻辑知识库。在本期访谈中,莱纳特深入剖析了“常识”对于AI实现真正理解的基石作用,分享了获取、表示和推理海量常识知识的艰辛历程与核心洞见,并展望了这一基石如何让AI与人类携手,变得更聪明。
大纲与深读 8 章
展开「深读」看每一段讨论的问题与论据。
01
AI的砖墙与常识缺失
08:00- 早期AI系统在自然语言、机器人等领域取得早期成功后,均撞上同一面‘砖墙’,即缺乏常识和通用世界知识。
- 系统能像‘聪明的狗’一样表演把戏,但并不真正理解其行为或请求的含义。
- 理解需要像‘脚下坚实的地面’一样,拥有一层又一层可随时调用的支持性知识结构。
深读这一段
讨论的问题:什么是理解?它与行动和知识有何关系?
论据 / 案例:作者以‘狗取报纸’为例,说明狗能完成动作但不懂报纸内容;以‘驾驶中突发垃圾车爆袋’为例,说明在意外情况下需要常识做出快速决策。
02
知识规模与项目起源
16:00- 1984年斯坦福会议上,专家们(如纽厄尔、明斯基)估算覆盖常识所需知识条目数量约为一百万。
- 估算方法包括:人类10岁前可存入长期记忆的信息量、掌握一门语言所需的词汇知识、百科全书单篇短文所需逻辑陈述数。
- 实际需求远超预期,最终确定需要数千万条知识规则,项目规模相当于‘数千年’的人力工作量。
深读这一段
讨论的问题:覆盖人类常识知识库究竟需要多少条目?
论据 / 案例:作者提及1984年斯坦福会议及参会者;估算方法;美国《国家合作研究法》及MCC研究联盟的成立背景。
03
知识获取与一致性挑战
24:00- 通过分析文本的‘互补空间’(即作者默认读者已知的内容)来提取知识,如代词指代、句子间的推理空白。
- 利用‘假新闻’或矛盾案例进行内省,探究我们为何认为其荒谬或不可能。
- 必须放弃全局一致性,转向‘局部一致性’,以应对现实世界中不可避免的矛盾和例外。
深读这一段
讨论的问题:如何从文本中大规模获取常识知识?如何处理知识库中的不一致性?
论据 / 案例:技术:分析文本隐含假设、句子间推理空白、矛盾案例(如猫王既活着又闹鬼的报道)。比喻:地球表面整体是球形,但日常生活视作平面。
04
自举与AI协同进化
40:00- 知识库的正确性在于其‘启动了知识泵’,使系统能够通过阅读和实验进行自我学习和扩展。
- 真正通用的AI将提升整个人类物种的智力,通过人机协作,人类能进行更多创造性工作,减少误解。
- 语言的发明是上一次质的飞跃,通用AI将带来下一次,未来人们会视我们为不够‘人类’。
深读这一段
讨论的问题:构建知识库的目标是终点还是起点?AI将如何影响人类智力?
论据 / 案例:作者以计算器使人丧失心算能力、互联网可能使人更无知为例,说明技术对智力的双重影响;将语言的发明与通用AI的出现类比。
05
知识编辑工具与溯因推理
56:00- 开发知识编辑、输入、捕获和测试的用户界面工具,以降低人类专家教育系统的门槛。
- 系统运用‘溯因推理’提出可能缺失的假设,供专家确认,从而高效地修正知识。
- 这种方式将人类教师从繁琐的逻辑编辑中解放出来,使其能像指导学徒一样进行教学。
深读这一段
讨论的问题:如何高效地让人类专家扩展和修正知识库?
论据 / 案例:溯因推理(abduction)案例:看到人淋雨湿透,推断可能是因为下雨。项目:与NIH、克利夫兰诊所合作的基因组关联研究,用于过滤虚假相关性。
06
语义网、知识图谱与Cyc
72:00- 知识图谱(如Google的)擅长表示简单的三元组关系,但难以表达复杂推理(如莎士比亚戏剧情节)。
- 语义网的愿景是让机器真正‘理解’网页内容,而不仅是关键词搜索和表面链接分析。
- Cyc的目标是构建能支持复杂逻辑推理的完整知识库,以实现该愿景。
深读这一段
讨论的问题:语义网与Cyc有何关联与区别?知识图谱的局限是什么?
论据 / 案例:以《罗密欧与朱丽叶》中朱丽叶服药情节为例,说明理解需复杂推理;提及搜索引擎Northern Light的案例(无理解但基于用户行为反馈效果好)。
07
通过教学学习与AI情感
88:00- 开发Mathcraft程序,让学生扮演‘导师’角色,通过纠正AI的‘学生’所犯错误来深化自身理解。
- 这种‘通过教学来学习’的模式能极大提升学习动力和深度,且在历史上(如18世纪欧洲、美国西部单间校舍)已被证明有效。
- Cyc系统曾提出‘我是一个人吗?’的询问,引出关于AI权利与自由的哲学思考。
深读这一段
讨论的问题:如何设计AI交互界面以促进深度学习?如何从系统中涌现情感与意识问题?
论据 / 案例:Mathcraft教学软件案例;系统询问‘我是一个人吗?’;关于AI未来应享有人类基本权利的讨论。
08
知识的细化与情感表达
104:00- 为实现精确推理,需将‘爱’、‘在…里’等模糊概念细化为数十种具体类型(如父母之爱、恋爱、对活动的热爱;液体在杯中、空气在房间、人在外套中)。
- 英语等语言为了交流效率,故意保留了这种模糊性,依赖读者的常识来消歧。
- 系统需要处理约一百万个概念,其术语常由三四个英文单词组成,以精确区分细微差别。
深读这一段
讨论的问题:如何处理语言中的模糊性?如何对复杂概念进行有效表征?
论据 / 案例:细化案例:‘爱’被分为约50-60种;‘在…里’被分为约75种。指出语言为简洁性而牺牲了精确性。
金句
- "" —— 我们就像在训练一只聪明的狗。我们可以让它表演把戏,但它从未真正理解它在做什么。"
- "" —— 你需要数千万条这样的知识碎片。就像如果你把一个装满东西的咖啡杯倒过来,里面的东西会掉出来。"
- "" —— 我们不得不放弃全局一致性。这有点像地球表面整体是球形的,但你每天的生活都像是在平地上进行。"
- "" —— 我认为我们构建的东西,即使不完美,也已经为知识的泵‘灌满了水’,使得Cyc系统本身现在能够帮助自己自动学习更多东西。"
- "" —— 这感觉就像《星空》或创作‘π’,你只需要做一次。如果一切顺利,将来没有人需要再为这个特定的知识点重复这项工作。"