2026 AI前沿对话:模型、架构与未来

本期访谈中,Sebastian Raschka与Nathan Lambert深入探讨了当前AI领域的竞争格局、开源模型的发展、大模型架构的演进以及扩展定律的未来。他们分析了DeepSeek时刻后的中美AI竞赛,比较了主流闭源模型的使用体验,并深入浅出地解释了混合专家、注意力机制等关键技术原理。

塞巴斯蒂安·拉什卡, 内森·兰伯特

导语

在AI技术日新月异的2026年,我们邀请了两位备受尊敬的机器学习研究者与工程师——Sebastian Raschka和Nathan Lambert,与Lex Fridman一同深入探讨当前人工智能的前沿状态。对话从引爆行业讨论的“DeepSeek时刻”切入,剖析了中美在AI研发与产品化层面的激烈竞争。两位嘉宾从自身实践经验出发,分享了对ChatGPT、Gemini、Claude等主流闭源模型的看法,以及如何在不同任务中选择和使用它们。访谈的核心部分转向技术深水区,详细拆解了自GPT-2以来Transformer架构的演进、混合专家(MoE)等关键技术的作用,并对扩展定律的过去、现在与未来进行了乐观而审慎的评估。

大纲与深读 9 章

展开「深读」看每一段讨论的问题与论据。

01

DeepSeek时刻与AI竞争格局

00:55
  • DeepSeek R1的发布以更低成本达到或接近顶尖性能,成为行业分水岭事件
  • 国际AI竞争已从研究和产品两个层面全面白热化
  • 中美两国在开放权重模型和封闭商业模型两个赛道上展开激烈角逐
深读这一段

讨论的问题:DeepSeek时刻如何改变了AI领域的竞争格局?

论据 / 案例:2025年1月,中国公司DeepSeek发布了开放权重的R1模型,据称以更低的计算成本实现了顶尖性能,震惊业界。

02

谁在赢得AI竞赛?

01:55
  • 技术本身难以形成垄断,因为研究人员在实验室间频繁流动
  • 预算和硬件获取能力正在成为真正的差异化因素
  • 目前没有一家公司能独占鳌头,竞争呈现动态领先的特点
深读这一段

讨论的问题:在国际AI竞赛中,谁是赢家?是美国公司还是中国公司?

论据 / 案例:DeepSeek赢得了开放权重模型爱好者的心,但Anthropic的Claude Opus 4.5在编码领域也获得了极高的关注度和实际应用。

03

2025与2026年模型展望

05:50
  • 在消费者聊天机器人领域,押注Gemini可能比押注ChatGPT风险更高,因为OpenAI是强大的在位者
  • 预计2026年Gemini将继续取得相对于ChatGPT的进展
  • Anthropic在软件和企业侧预计将保持持续成功
深读这一段

讨论的问题:你认为哪个模型会赢得2025年和2026年?

论据 / 案例:GPT-5的“路由器”功能帮助OpenAI节省了大量GPU成本;Google在TPU和数据中心方面拥有历史成本优势。

04

智能与速度的权衡

08:25
  • 用户需要快速的简单回答和深度的智能分析两种模式的结合
  • “自动”模式能根据问题复杂度智能路由到合适的模型
  • 用户会根据具体任务在不同模型间切换,直至遇到问题
深读这一段

讨论的问题:用户究竟更需要模型的智能还是回答的速度?

论据 / 案例:Sebastian提到为紧急任务使用非思考模式快速生成bash脚本;Nathan则只使用思考模式进行信息查询,因为他认为非思考模式的错误率更高。

05

编程工具的使用实践

12:05
  • Cursor和Claude Code提供了根本不同的编程体验,两者都有用
  • 使用Claude Code有助于培养用英语进行宏观设计的编程思维
  • Claude Code似乎能比同类工具更好地利用Claude Opus 4.5的性能
深读这一段

讨论的问题:在编程中,你们目前使用什么工具?

论据 / 案例:Sebastian使用VS Code的Codex插件,因为它在辅助和完全接管之间取得了平衡;Nathan则偏好Claude Code,以练习宏观层面的设计思维。

06

开源模型生态概览

19:10
  • 中国公司发布更大、性能更高的开放权重模型,西方则专注于更透明、完全开源的模型
  • 开源生态正变得极其丰富,涵盖了从中国到欧美的众多参与者
  • 工具使用能力是开源模型的一个关键突破方向,可大幅减少幻觉
深读这一段

讨论的问题:当前开源大语言模型的生态是怎样的?哪些模型脱颖而出?

论据 / 案例:被提及的开源模型包括:DeepSeek、Qwen 3、GPT-OSS、Mistral、Gemma、Nvidia NeMo Tron、AI2的OLMO、Hugging Face的SmolLM等。

07

开源模型的动机与价值

24:35
  • 中国公司希望通过开源模型在全球获得影响力和市场份额
  • 西方公司发布开源模型以利用社区GPU算力并扩大分发
  • 开放权重模型允许企业进行定制、微调和本地化部署
深读这一段

讨论的问题:模型开源爆炸式增长背后的动机是什么?

论据 / 案例:许多美国科技公司出于安全考虑,不会为中国公司的API订阅付费,这为中国开源模型创造了市场机会;像Llama这样的模型有用户数量限制条款。

08

从GPT-2到今天的架构演进

27:30
  • 核心架构仍是从“注意力就是你所需要的”论文衍生出的自回归Transformer
  • 主要演进在于对注意力机制的调整(如分组查询注意力)和引入混合专家层
  • 改进重点是提高训练和推理效率,而非根本性的架构变革
深读这一段

讨论的问题:从GPT-2到今天,模型架构发生了哪些根本性变化?

论据 / 案例:架构演进例子包括:从多头注意力到分组查询注意力、引入混合专家层、将层归一化替换为RMS归一化、改变非线性激活函数。

09

扩展定律的三大前沿

33:20
  • 传统的预训练扩展(模型与数据规模)仍有效,但已非低垂果实
  • 强化学习扩展和推理时计算扩展是新的性能增长点
  • 推理时扩展使模型能生成更长的思考链,从而获得新能力
深读这一段

讨论的问题:扩展定律在预训练、后训练、推理等各阶段是否仍然成立?

论据 / 案例:DeepSeek预训练成本约500万美元;Gemma 3的预训练租用集群成本约200万美元;新超算集群的建设周期长达两到三年。

金句

  • "" —— "我不认为在2026年,会有任何公司拥有其他公司无法获取的独家技术。差异化因素将是预算和硬件限制。"
  • "" —— "代码是精确的,它不会说谎。从零开始构建大模型可能是理解其工作原理的最佳方式。"
  • "" —— "使用模型直到它出问题,然后你就去探索其他选项。这和我们使用任何工具的方式一样。"
  • "" —— "推理时缩放让模型在给出第一个词之前,能思考数秒、数分钟甚至数小时,这是能力上的巨大飞跃。"
  • "" —— "我认为所有形式的扩展定律依然有效,只是预训练的低成本果实大多已被摘取。"

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · 2026 AI前沿对话:模型、架构与未来