DeepSeek.

公司 提及它的 4 位嘉宾,在这些议题上怎么说

Dylan Patel & Nathan LambertLao ShiSebastian Raschka, Nathan LambertYou Kaichao

开源模型 1 条

塞巴斯蒂安·拉什卡, 内森·兰伯特2026-02

以DeepSeek、Kimi、MiniMax为代表的中国公司正通过发布性能强劲的开源模型获得全球影响力

“以DeepSeek、Kimi、MiniMax等为代表的中国公司,通过发布性能强劲的开源模型,成功获得了全球影响力。”

来源访谈 →

V3与R1 1 条

迪伦·帕特尔 & 内森·兰伯特2025-02

DeepSeek V3与R1同源不同路:V3是基础模型经标准指令微调的聊天模型,R1则是经全新推理训练、回答前展示思维链的推理模型。

“DeepSeek V3的基础预训练完成后,他们做了两种不同的后训练:一种是创建标准的指令微调模型V3,另一种是通过新的推理训练创建R1。”

来源访谈 →

低成本训练 1 条

迪伦·帕特尔 & 内森·兰伯特2025-02

DeepSeek高效训练的两大技术支柱是混合专家模型(只激活参数子集,如671B参数中仅激活37B)和自创的多头潜在注意力机制。

“混合专家模型(MoE)通过每次只激活参数的一个子集,大幅降低了训练和推理成本。”

来源访谈 →

DeepSeek 1 条

游凯超2026-07

DeepSeek算法团队懂系统、系统团队懂算法,其模型结构探索与推理系统优化形成强协同,是模型高效落地的重要支撑

“其算法团队懂系统、系统团队懂算法,在MoE等结构上的探索与推理系统的优化形成了强协同,是其模型高效落地的重要支撑。”

来源访谈 →

DeepSeek的技术意义 1 条

老石2025-02-21

认为其推进了行业新范式

““DeepSeek虽然没有发明新范式,但却推进整个行业进入了新范式。””

来源访谈 →