DeepSeek如何用开源和创新挑战AI前沿
两位专家深入探讨了DeepSeek模型的技术创新、开源策略及其影响。他们分析了DeepSeek V3与R1的区别,解释了其低成本训练的关键技术(如混合专家模型和MLA注意力机制),并讨论了DeepSeek作为一家中国对冲基金子公司如何取得突破。对话还延伸至AI硬件、出口管制、地缘政治影响以及AGI的未来时间线。
D迪伦·帕特尔 & 内森·兰伯特 · SemiAnalysis创始人兼CEO & 艾伦人工智能研究所研究员
查看原文 ↗ 导语
在本期Lex Fridman播客中,SemiAnalysis创始人迪伦·帕特尔与艾伦人工智能研究所研究员内森·兰伯特,深入剖析了中国AI实验室DeepSeek及其模型引发的全球震动。他们从技术内核出发,拆解了DeepSeek V3与R1模型的区别、其高效训练背后的关键创新(如混合专家模型与MLA注意力机制),并探讨了DeepSeek这家脱胎于对冲基金的公司如何以相对有限的硬件资源,在前沿模型竞争中取得突破。对话进一步延伸至AI硬件供应链、中美地缘政治博弈下的出口管制,以及对AGI时间线的冷静评估。
大纲与深读 8 章
展开「深读」看每一段讨论的问题与论据。
01
开源AI的定义与争议
16:00- 开源AI模型与传统开源软件在自由度和定义上存在差异,目前社区未达成共识
- Allen AI认为真正开源需公开训练数据、代码和权重,其中数据质量决定模型质量
- 开源权重意味着用户可完全控制数据,与依赖API的数据托管模式形成本质区别
深读这一段
讨论的问题:什么是真正开源的AI模型?它与传统开源软件及闭源API模式有何本质区别?
论据 / 案例:Allen AI倡导发布训练数据、代码和权重;DeepSeek R1采用MIT许可证,无下游商业限制;通过Hugging Face下载权重后可在无网络电脑上运行,数据完全自主控制
02
DeepSeek模型谱系解析
32:00- DeepSeek V3是基于大规模互联网文本预训练的基础模型,经指令微调和人类反馈强化学习后成为高性能聊天模型
- DeepSeek R1在V3基础上引入推理训练,通过链式思维实现自我反思和深度推理
- R1的推理过程类似意识流,能挑战自身生成更具独创性的内容,最终产出富有哲学深度的结论
深读这一段
讨论的问题:DeepSeek V3与R1在架构和训练目标上有何根本差异?推理模型如何实现链式思维?
论据 / 案例:R1对‘关于人类的真正新颖洞见’问题思考1517秒,通过质疑自身实现认知分层,最终提出‘人类将自私欲望转化为合作系统’的结论;技术报告详述了CUDA层以下的硬件级优化
03
MoE架构的效率革命
40:00- 混合专家模型每次仅激活约37B参数(总671B),相比稠密模型Llama 405B需激活全部参数,大幅降低计算成本
- 专家路由机制使模型能根据任务动态分配计算资源,类似大脑不同区域分工处理不同信息
- Transformer中MoE主要应用于多层感知机部分,因其占据模型大部分权重,效率提升最为显著
深读这一段
讨论的问题:混合专家模型如何实现计算效率的指数级提升?其架构创新对训练和推理成本的影响是什么?
论据 / 案例:DeepSeek V3总参数671B,实际激活仅37B;相比Llama系列全参数激活,MoE架构可减少约30%计算需求;实验阶段需进行2-4倍于正式训练的算力投入
04
YOLO Run与训练博弈
56:00- 小规模实验积累直觉后,将全部资源押注于关键超参数组合的‘YOLO Run’是前沿突破的必经之路
- 训练失败是迭代成本的必要组成部分,研究团队通过海量消融实验缩小搜索空间
- 成功模型需要平衡方法论严谨性与研究者直觉,前者确保可靠性后者实现突破
深读这一段
讨论的问题:如何在理论严谨性与突破性创新间取得平衡?前沿实验室如何管理高风险训练决策?
论据 / 案例:OpenAI 2022年将全部资金投入GPT4架构验证;DeepSeek论文详述CUDA层优化细节;研究阶段GPU消耗可达正式训练的300%-400%
05
硬件约束与创新适应
64:00- H800芯片虽限制互联带宽但保留计算性能,DeepSeek通过软件优化弥补硬件限制
- 美国出口管制从双指标限缩至单指标计算性能,促使中国芯片设计针对性调整
- 华为7纳米芯片Ascend 910在MLPerf基准测试中展现竞争力,引发技术管制博弈
深读这一段
讨论的问题:出口管制如何重塑芯片设计路径?硬件限制如何催生软件层创新?
论据 / 案例:H800采购于2023年末,训练周期延长至2024年;华为Ascend 910采用7纳米工艺;管制从互联带宽+浮点运算双指标改为仅限浮点运算
06
AGI时间线的地缘博弈
80:00- Dario认为2026年可能实现AGI,但军事应用与商业部署存在成本鸿沟
- 当前AI推理单任务成本高达5-20美元,规模化部署面临物理基础设施瓶颈
- 中国在无人机等不对称武器领域已形成代差优势,可能加速军事AI应用
深读这一段
讨论的问题:AGI的实际部署时间与能力边界在哪里?地缘政治如何影响技术发展路径?
论据 / 案例:单次Arc-AGI问题求解成本5-20美元;美国军事体系仍依赖传统战机体系;中国农村单身男性比例达30:1
07
半导体供应链博弈
88:00- TSMC代工模式颠覆了传统芯片设计制造一体化体系,Nvidia成为纯设计公司典范
- 尖端晶圆厂建设成本超300亿美元,摩尔定律的经济成本曲线比技术曲线更陡峭
- 美国通过管制芯片工具链实现全产业链封锁,中国加速构建自主制造体系
深读这一段
讨论的问题:半导体产业链的哪些环节最具战略价值?技术封锁将如何重塑全球制造版图?
论据 / 案例:3纳米芯片厂建设成本超300亿美元;华为Ascend 910采用7纳米工艺;管制范围覆盖光刻机、蚀刻机等细分设备
08
技术冷战的临界点
96:00- 出口管制已从芯片延伸至云计算和人才流动,形成技术铁幕雏形
- 台海问题与半导体供应链高度绑定,任何军事冲突将引发全球产业链地震
- 中国在关键材料领域实施对等反制,镓、锗等战略资源成为博弈筹码
深读这一段
讨论的问题:技术脱钩的临界点在哪里?半导体依赖如何影响地缘冲突风险评估?
论据 / 案例:美国禁止向台湾出口特定电池;中国限制镓、锗出口;台积电承担全球80%先进制程芯片生产
金句
- "开源权重模型能让你将数据的命运掌握在自己手中,这与开源的灵魂深度相连。"
- "开源不是模型在窃取你的数据,而是托管模型的主机在窃取。"
- "DeepSeek V3的基础预训练完成后,他们做了两种不同的后训练:一种是创建标准的指令微调模型V3,另一种是通过新的推理训练创建R1。"
- "混合专家模型(MoE)通过每次只激活参数的一个子集,大幅降低了训练和推理成本。"
- "如果你相信未来5到10年内AI会带来重大变革,那么出口管制是确保美国优势的关键;如果AI发展缓慢,长期来看中国会胜出。"