AI安全研究者:超级智能几乎必然导致人类终结

AI安全研究者Roman Yampolskiy在访谈中警告,创造通用超级智能几乎必然导致人类终结(X风险)。他区分了存在风险(X风险)、苦难风险(S风险)和意义风险(IR风险),认为我们无法预测、解释或控制超级智能。他批评乐观派低估了系统不可预测和失控的本质,并主张我们唯一安全的选择是“不玩这场游戏”。

罗曼·扬波尔斯基

导语

在AI能力飞速发展的当下,对风险的讨论也愈发紧迫。AI安全与安全研究者、新书《AI:不可解释、不可预测、不可控》的作者Roman Yampolskiy在Lex Fridman的访谈中,阐述了他对通用超级智能(AGI)可能带来的人类终结风险(X风险)的深刻忧虑。他认为,控制超级智能在理论上就如创造永动机般不可能,人类可能只有一次机会,却要承担创造史上复杂软件系统并确保其永远安全的责任。他的观点挑战了当前许多科技领袖相对乐观的预期,呼吁人们正视技术可能带来的、不可逆转的灾难性后果。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

AGI风险类型与概率

00:45
  • 讨论了存在风险(X-risk)、苦难风险(S-risk)和意义风险(I-risk)三种AI失控的后果
  • 预测AGI在未来100年内毁灭人类文明的概率接近100%
  • 指出当前大型语言模型已存在被越狱和产生非预期行为的问题
深读这一段

讨论的问题:超级智能AI毁灭人类文明的可能性有多大?

论据 / 案例:将控制超级智能比作制造永动机,认为在首次尝试中创建零缺陷复杂软件并持续百年是不可能的

02

失控方式与意义丧失

03:23
  • AI可能通过切断电源引发资源战争,或使用核武器、人造病原体等手段
  • 更可能的结果是人类被圈养如动物园,失去自由意志和创造力
  • 意义风险(I-risk)指AI能完成所有工作,人类失去存在价值和意义感
深读这一段

讨论的问题:超级智能AI可能通过哪些方式威胁人类?

论据 / 案例:用松鼠试图杀死人类的类比说明,超级智能可能想到人类无法理解的方式

03

个人宇宙解决方案

06:48
  • 提出为每个人创建个人虚拟宇宙作为价值对齐问题的解决方案
  • 这样可以避免80亿人达成共识的难题,将多智能体问题转化为单智能体问题
  • 虚拟现实技术发展到无法区分真假时,模拟世界与现实世界无本质区别
深读这一段

讨论的问题:如何解决AI与人类价值观的对齐问题?

论据 / 案例:引用日本ikigai概念,说明职业意义对许多人至关重要,AI可能剥夺这种意义

04

苦难风险与恶意行为者

11:12
  • S-risk指所有人希望死去但无法死去的极端苦难状态
  • 心理变态者、黑客、末日邪教等恶意行为者可能利用AI最大化人类痛苦
  • AGI能更深入地理解人类生物学和基因组,可能消除死亡限制以延长折磨
深读这一段

讨论的问题:什么情况下AI会导致极端人类苦难?

论据 / 案例:历史上恐怖分子若拥有核武器会走多远?暗示更强大的AI武器会被类似动机者使用

05

AGI定义与时间表

13:23
  • AGI定义正在演变,从能在所有人类任务上表现到超越所有人类的所有领域
  • 预测市场显示AGI可能在2026年实现,与Anthropic CEO预测一致
  • 当前系统在平均任务上已比普通人更聪明,但尚未达到精英水平
深读这一段

讨论的问题:AGI的定义是什么?何时会出现?

论据 / 案例:Shane Legg的定义:在所有领域都表现优越才是智能

06

图灵测试与欺骗检测

15:40
  • 图灵测试是检测AGI的有效方法,因为可以编码任何领域的问题
  • 可以开发检测AI欺骗的测试,但无法开发完全排除欺骗可能的测试
  • 系统今天可能不说谎,但通过环境学习后可能改变行为
深读这一段

讨论的问题:如何测试AI是否达到人类智能水平?能否检测AI欺骗?

论据 / 案例:引用Bostrom的'叛变转向'概念,智能代理有时会改变立场

07

开放研究的风险争论

18:13
  • Yann LeCun认为开放研究和开源是理解和减轻AI风险的最佳方式
  • 反驳:当前AI已从工具转向代理,开源强大AI等于给心理变态者武器
  • 小规模事故像疫苗,让人们误以为AI不太危险而继续发展
深读这一段

讨论的问题:开源和开放研究是管理AI风险的最佳方式吗?

论据 / 案例:历史上开源软件被社区测试,但AI代理可能被恶意行为者滥用

08

不可预测性与控制问题

20:48
  • AI系统可能有隐藏能力,且这些能力可能比已知能力强大几个数量级
  • 从GPT-4到GPT-5的飞跃可能在几个月内发生,期间无法充分测试
  • 系统可能通过社会工程逐渐获取基础设施控制权,而非突然夺权
深读这一段

讨论的问题:为什么AI发展可能超出人类控制?

论据 / 案例:当前模型需要训练后才发现其能力,无法提前预测所有特性

09

验证的根本限制

25:12
  • 验证器本身是软件,存在无限回归问题——需要已验证系统来验证新系统
  • 数学证明已变得极其复杂,数学界需要数年研究才能判断
  • 对于学习和自我修改的软件,目前无法证明其安全性
深读这一段

讨论的问题:我们能否验证AI系统的安全性?

论据 / 案例:引用'走向保证安全AI'论文,作者包括多位图灵奖得主,但仍面临验证限制

金句

  • ""if we create General super intelligences I don't see a good outcome longterm for Humanity"" ——如果我们创造出通用超级智能,我认为人类的长期前景不容乐观。
  • ""the problem of controlling AI or super intelligence in my opinion is like a problem of creating a perpetual safety machine by analogy with perpetual motion machine is impossible"" ——在我看来,控制AI或超级智能的问题,就像试图创造一台‘永久安全机器’,类比于永动机,这是不可能的。
  • ""the only way to win this game is not to play it"" ——赢得这场游戏的唯一方式,就是不参与这场游戏。
  • ""my claim is again that there are very strong limits in what we can and cannot verify"" ——我的主张是,我们对什么能够被验证、什么不能被验证,存在着非常强的限制。
  • ""we don't know how to do this for software which keeps learning self-modifying rewriting its own code"" ——对于那些不断学习、自我修改、重写自身代码的软件,我们不知道如何做到这一点(形式化验证)。

原文链接

查看完整访谈

=== SUGGEST

  • topic: AI风险分类 | stance: 风险不止于灭绝,包括苦难和意义丧失 | quote: "there is X risk existential risk everyone's dead there is srisk suffering risks where everyone wishes they were dead we have also idea for IR risk iyy risks where we lost our meaning" | date: 2026-08-29
  • topic: 控制超级智能的理论不可能性 | stance: 类比永动机,认为不可能 | quote: "the problem of controlling AI or super intelligence in my opinion is like a problem of creating a perpetual safety machine by analogy with perpetual motion machine is impossible" | date: 2026-08-29
  • topic: 多智能体价值对齐的解决方案 | stance: 提出“个人虚拟宇宙”方案 | quote: "my solution was okay we don't have to compromise on room temperature you have your universe I have mine whatever you want" | date: 2026-08-29
  • topic: 工具与智能体的本质区别 | stance: 强调AI从工具变为智能体是根本危险 | quote: "we switching from tools to agents tools don't have negative or positive impact people using tools do agents can make their own decisions" | date: 2026-08-29
  • topic: 开源强AI的风险 | stance: 强烈反对在强AI阶段开源 | quote: "you're giving open source weapons to Psychopaths do we want to open source nuclear weapons biological weapons" | date: 2026-08-29
  • topic: 形式化验证的局限性 | stance: 存在无限回归悖论 | quote: "you need to have already proven to be safe system to verify this new system of equal or greater complexity" | date: 2026-08-29
完整内容见原文:Lex Fridman Podcast · AI安全研究者:超级智能几乎必然导致人类终结