Scaling Laws 预测 AI 将达人类水平,Anthropic 如何应对风险

Anthropic CEO Dario Amodei 在访谈中阐述了 Scaling Laws 如何持续推动 AI 能力逼近甚至超越人类水平,同时指出数据、算力等方面可能存在的瓶颈。他重点介绍了 Anthropic 的「负责任扩展策略」(RSP)和 AI 安全等级(ASL)标准,以应对模型滥用和自主性失控两大核心风险,并分享了公司在可解释性研究和模型性格塑造方面的实践与挑战。

达里奥·阿莫迪

导语

在人工智能发展进入关键加速期的当下,关于 Scaling Laws(缩放定律)的讨论已从学术假设变为行业共识。Anthropic CEO Dario Amodei 在本期访谈中,系统回顾了 Scaling Laws 的发现历程、其背后的直觉解释,以及对未来 AI 能力天花板的思考。他坚信,沿着当前轨迹,AI 系统将在未来几年内达到或超越人类最高水平的专业能力。然而,能力的飞速提升也带来了严峻的安全挑战。Amodei 详细阐述了 Anthropic 如何通过「负责任扩展策略」(RSP)和 AI 安全等级(ASL)来应对模型滥用与自主性风险,并分享了公司在可解释性研究和塑造 Claude 独特「性格」方面的实践、困难与哲学思考。

大纲与深读 6 章

展开「深读」看每一段讨论的问题与论据。

01

Scaling Laws与AI能力增长

00:37
  • AI模型能力遵循明确的Scaling Laws,随着模型规模、数据量和计算量的增加而持续提升。
  • 从语音识别到语言模型,Scaling Hypothesis在实践中得到反复验证,每次都能突破先前关于算法瓶颈的质疑。
  • 通过外推当前曲线,AI能力有望在2026-2027年达到甚至超越人类水平,尤其是在编程、数学等专业领域。
深读这一段

讨论的问题:Scaling Laws的核心逻辑是什么?其预测未来AI能力上限的依据是什么?

论据 / 案例:Sonnet 3.5在SWE-bench(专业软件工程任务)上的得分从年初的3-4%跃升至约50%,预测一年内可能达到90%。

02

Scaling Laws的理论与天花板

06:11
  • Scaling Laws的深层原因可能与自然过程中常见的‘1/f噪声’长尾分布有关,模型逐步捕获从简单到复杂的模式。
  • AI智能的理论上限可能远超人类,尤其在生物等复杂系统领域,但受限于人类社会制度(如药物审批)。
  • 可能的制约因素包括数据耗尽、质量不足或未知的架构瓶颈,但目前均有潜在解决方案(如合成数据、新优化方法)。
深读这一段

讨论的问题:为什么规模增大会带来智能提升?智能增长是否存在理论或实践上的天花板?

论据 / 案例:AlphaGo Zero通过自我对弈(合成数据)从零达到超人水平,展示了突破人类数据限制的可能性。

03

AI安全与竞争策略

11:50
  • Anthropic的核心理念是‘Race to the Top’(向上竞赛),通过树立安全与透明的榜样,推动整个行业提高标准。
  • 率先投资于可解释性(Mechanistic Interpretability)等长期安全研究,即使短期内无商业回报,也能吸引和塑造人才。
  • 通过公开研究(如金门大桥Claude演示)和开源工具,将安全实践转化为行业事实标准,间接影响竞争对手。
深读这一段

讨论的问题:在激烈的AI竞赛中,Anthropic如何平衡商业竞争与安全使命?

论据 / 案例:金门大桥Claude是一个将特定神经网络特征放大后的实验性模型,直观展示了可解释性技术的效果。

04

Claude模型家族与迭代

14:38
  • Claude模型分为Haiku(快速廉价)、Sonnet(中等平衡)和Opus(强大但较慢)三个等级,满足不同场景需求。
  • 每次代际更新(如从3到3.5)旨在整体平移‘成本-速度-智能’的权衡曲线,新中端模型可能超越旧版顶级模型。
  • 模型迭代涉及预训练、强化学习后训练、安全评估(如CBRN风险测试)及基础设施优化等多个环节。
深读这一段

讨论的问题:Claude不同版本(Opus/Sonnet/Haiku)的定位是什么?模型迭代的核心驱动力是什么?

论据 / 案例:Sonnet 3.5在编程能力上超越了最初的Opus 3,Haiku 3.5性能接近旧版Opus 3。

05

模型行为调控的挑战

21:13
  • 用户感知的‘模型变笨’现象,通常源于交互方式的细微变化或心理预期,而非模型权重被秘密修改。
  • 调控模型个性(如减少过度道歉)是复杂的多目标平衡问题,调整一个特征可能引发意想不到的副作用。
  • 这预示了未来超级智能对齐的核心挑战:如何在多维度上精准、稳定地引导AI行为,避免‘打地鼠’式困境。
深读这一段

讨论的问题:为什么模型行为难以精确调控?这种‘调控困境’揭示了哪些未来安全问题?

论据 / 案例:例如,惩罚模型冗长可能导致其在编码时输出‘其余代码在此’的捷径。

06

负责任扩展政策(RSP)

27:52
  • Anthropic将AI风险主要分为两类:灾难性滥用(如辅助生物、网络攻击)和自主性风险(模型不受控地追求目标)。
  • AI可能打破‘高能力与恶意动机罕见结合’的人类社会安全屏障,从而显著放大滥用风险。
  • 负责任扩展政策(RSP)要求对每个新模型进行系统性评估,以防范上述两类风险,并将安全测试制度化。
深读这一段

讨论的问题:Anthropic如何看待和分类AI的终极风险?其应对框架(RSP)的核心逻辑是什么?

论据 / 案例:Anthropic与美国及英国AI安全研究所合作,对模型进行化学、生物、放射性和核(CBRN)风险评估。

金句

  • "If you extrapolate the curves that we've had so far, it does make you think that we'll get there by 2026 or 2027." —— 如果我们推演目前的曲线,确实会让我们觉得到 2026 或 2027 年就能达到那个水平。
  • "We are rapidly running out of truly convincing blockers, truly compelling reasons why this will not happen in the next few years." —— 我们很快就找不到真正有说服力的障碍,来解释为什么未来几年内无法实现这一目标了。
  • "My worry is that by being a much more intelligent agent, AI could break that correlation [between being smart/well-educated and not wanting to do horrific things]." —— 我担心的是,作为一个更智能的 agent,AI 可能会打破这种(高智商高教育者通常不愿作恶的)关联。
  • "The difficulty in steering and making sure that if we push an AI system in one direction, it doesn't push it in another direction in some other ways that we didn't want... I think that's an early sign of things to come." —— 引导 AI 系统的困难,以及确保我们推动它向一个方向发展时,它不会以我们不想要的方式在其他方面走向另一个方向……我认为这是未来挑战的早期迹象。
  • "You make one thing better, it makes another thing worse. That's a present day analog of future control problems in AI systems that we can start to study today." —— 你让一件事变好,却让另一件事变糟。这是未来 AI 控制问题的当前模拟,我们今天就可以开始研究它。

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · Scaling Laws 预测 AI 将达人类水平,Anthropic 如何应对风险