唐杰

唐杰

Jie Tang
Z.ai CEO / 清华大学教授
海外PC 优先级✓ 已收录 1 期访谈

立场时间线 6 条 · 6 个议题

同一议题按时间排列,说法变化一目了然。

参数规模
2026-08

参数量单独讨论已失去意义,必须结合数据量、计算投入和部署运行条件一起衡量

“Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions.(参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。)”

来源访谈 →
相关观点 (3)游凯超 · 协同设计:模型必须根据硬件特性与基础设施协同设计才能最大化效率,否则算法再好也难以落地赖纳·波普 · 稀疏模型:稀疏专家模型虽能大幅降低计算量,但增加内存容量与通信开销,扩大64倍总参数仅等效于4倍活跃参数的质量提升,并非免费午餐。闫俊杰 · * **topic**: 大模型迭代方法论:**stance**: 需逐代积累参数与数据,应对系统性挑战
强化学习
2026-08

GLM-5.3相比前代架构并无根本改变,性能飞跃完全来自长周期高复杂度环境中的强化学习

“在基础模型架构上并无根本改变,其显著性能提升完全源于在长周期、高复杂度环境中的强化学习(RL)”

来源访谈 →
相关观点 (1)Aman Sanger · 后训练:GLM-5.3的能力飞跃并非来自更大规模的基础模型预训练,而是完全依靠扩展后训练
扩展五要素
2026-08

模型扩展应看五个关键维度,除参数量外还包括数据、计算、部署条件以及MoE稀疏度

“提出了模型扩展的五个关键维度,除了传统的参数量,还包括数据、计算、部署条件等。他特别提到了混合专家模型(MoE)的稀疏度,并引入了新的“XA-YB”表示法来规范描述”

来源访谈 →
相关观点 (2)赖纳·波普 · 稀疏模型:稀疏专家模型虽能大幅降低计算量,但增加内存容量与通信开销,扩大64倍总参数仅等效于4倍活跃参数的质量提升,并非免费午餐。游凯超 · 协同设计:模型必须根据硬件特性与基础设施协同设计才能最大化效率,否则算法再好也难以落地
长程推理
2026-08

一旦跨过知识容量阈值,长程推理等高级技能与总参数量关系不大,更多取决于训练质量和推理时的计算分配

“Advanced skills... require carrying long causal chains (20+ inference steps) without losing the thread. This ability does not live in total parameter count once a certain knowledge-holding threshold is reached.(高级技能……需要在不偏离主线的情况下进行长达20步以上的长因果链推理。一旦模型达到某个知识容量阈值,这种能力就不再体现在总参数量中了。)”

来源访谈 →
相关观点 (3)黄仁勋 · AI扩展:AI扩展并未遇到数据耗尽等根本性瓶颈,推理即思考且计算强度极高,扩展已形成预训练、后训练、测试时计算与智能体扩展的持续增强循环,最终受限因素是算力而非数据或架构Dwarkesh Patel · AI发展路径:当前AI变聪明的方式(被训练完成编程等高经济价值任务)与获取权力的相关性并不强,AI擅长的抽象推理和现实中塑造权力的因素不是同一回事。Dwarkesh Patel · 算力密度:智能提升的本质是算力密度增加:更大参数规模、更复杂训练和更长推理时间都直接提升算力单价

金句墙 3 条

访谈收录