斯图尔特·罗素:AI安全的核心是目标的不确定性

在Lex Fridman的访谈中,斯图尔特·罗素教授从他早期的国际象棋AI项目切入,阐述了“元推理”的核心作用。他指出当前AI安全的关键在于“控制问题”——即如何确保机器的目标与人类真实意图对齐。罗素提出,解决方案是让AI系统对其目标保持不确定性,并能够通过人类反馈不断学习和调整,这是构建有益AI的基石。

斯图尔特·罗素

导语

斯图尔特·罗素是人工智能领域的奠基者之一,其合著的教材《人工智能:一种现代方法》影响了数百万从业者。在本次访谈中,他从个人早年编写国际象棋AI的经历出发,深入探讨了机器如何通过“元推理”高效决策,并尖锐地指出了当前AI发展面临的核心风险——“控制问题”。罗素认为,解决这一问题的关键在于设计一种全新的AI范式,即让机器对其目标保持根本性的不确定性,并通过与人类互动不断学习,从而确保其行为真正有益于人类。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

早期编程与元推理

  • Stuart Russell在1975年高中时编写了第一个国际象棋AI程序
  • 在帝国学院时,由于CPU时间限制,程序每步只能搜索8层深度
  • 元推理的核心是让机器决定思考什么内容以改善决策质量
深读这一段

讨论的问题:早期AI程序如何在有限的计算资源下进行有效的搜索?

论据 / 案例:在帝国学院,每周三用卡片输入程序,只有3秒CPU时间可以完成一步棋的搜索

02

AlphaGo的直觉与前瞻

08:00
  • AlphaGo能在不进行任何前瞻的情况下达到职业棋手水平
  • AlphaGo能够前瞻40-60步,相当于10^200种可能性
  • 元推理结合了走法的前景和不确定性来决定思考方向
深读这一段

讨论的问题:AlphaGo如何结合直觉评估和深度搜索来超越人类?

论据 / 案例:AlphaGo的深度一搜索(只考虑直接结果)仍能达到职业水平

03

人类直觉与机器模式识别

16:00
  • 人类大师的直觉可能被高估了
  • 顶级棋手能够感知位置中的可能性并追随计算线路
  • 人类大师有时也会错过简单的三到五步组合
深读这一段

讨论的问题:人类大师的直觉与AI的模式识别有何异同?

论据 / 案例:国际象棋大师Bobby Fischer的一些看似不合理的走法背后有直觉计算

04

自动驾驶的可靠性挑战

24:00
  • 自动驾驶需要达到八位数的可靠性(99.999999%)
  • 当前视觉系统只能检测98.3%的车辆,还差七个数量级
  • 边缘情况如小女孩逆时针骑自行车是规则系统无法处理的
深读这一段

讨论的问题:自动驾驶要达到实用水平需要克服哪些可靠性障碍?

论据 / 案例:每天驾驶8小时10年约10亿秒,每秒都可能犯致命错误

05

博弈论与人机交互

32:00
  • AI系统必须理解人类意图并进行预测
  • 自动驾驶需要在坚持己见和保持灵活之间找到平衡
  • 伯克利团队用博弈论让AI在停车标志处自主发明沟通信号
深读这一段

讨论的问题:AI如何在与人类交互中做出安全决策?

论据 / 案例:AI车辆在停车标志处会轻微后退以示意其他车辆先行

06

AI安全与控制问题

40:00
  • 迈达斯国王问题:正确指定目标极其困难
  • 机器应对目标保持不确定性而非视为绝对真理
  • 让机器保持谦逊,知道它们不确定自己该最大化什么
深读这一段

讨论的问题:如何确保AI系统追求与人类价值观一致的目标?

论据 / 案例:迈达斯国王想点石成金,结果食物、饮料和家人都变成了金子

07

超级智能的三大失败模式

72:00
  • 控制问题:AI追求错误目标且不听从人类指令
  • 滥用问题:恶意行为者故意制造不安全的AI系统
  • 过度依赖问题:人类因懒惰而逐步失去文明管理能力
深读这一段

讨论的问题:AI发展可能面临哪些主要风险?

论据 / 案例:《机器人总动员》展示了人类因过度依赖AI而失去自主性的未来

08

可证明有益的AI

80:00
  • AI应主动维护人类自主性而非替代人类
  • 需要精确定义AI有益性以避免超级智能找到漏洞
  • 数学框架需与现实世界匹配,这是一个长期迭代过程
深读这一段

讨论的问题:如何构建真正有益于人类的AI系统?

论据 / 案例:超级智能会像逃税者一样找到规则漏洞

金句

  • "The machine should never take an objective that's given as gospel truth." —— 机器绝不应将一个给定的目标奉为绝对真理。
  • "We need uncertainty. We need the machine to be uncertain about what it is that it's supposed to be maximizing." —— 我们需要不确定性。我们需要机器对自己应该最大化什么目标感到不确定。
  • "The machine should be deferential to us. If we say 'don't do that', now the machine learns something a bit more about our true objectives." —— 机器应该服从于我们。如果我们说‘不要那样做’,机器就更多地了解了我们的真实目标。
  • "The gorilla problem is you know the problem that the gorillas face. They made something more intelligent than them, namely us, and now they're in deep D. They failed to solve the control problem." —— 这就是‘大猩猩问题’。大猩猩制造了比它们更聪明的东西,也就是我们,现在它们处境堪忧。它们未能解决控制问题。
  • "I think the same is going to be true for driving. You can have a driving system that's pretty good when it doesn't do any look ahead. But that's not good enough." —— 我认为自动驾驶也是如此。一个不做任何前瞻的驾驶系统可能还不错,但这还不够好。

原文链接

查看完整访谈

完整内容见原文:Lex Fridman 播客 · 斯图尔特·罗素:AI安全的核心是目标的不确定性