AI模型进入后训练时代:参数规模不再是唯一标尺

Z.ai CEO唐杰指出,AI模型发展进入新阶段,单纯追求参数规模已过时。他提出扩展的五个关键维度,并以GLM-5.3为例,展示通过长期环境强化学习实现性能飞跃。模型能力提升的核心正从参数量转向数据质量、推理计算和后训练配方,特别是合成环境与奖励信号的规模化。

导语

Z.ai CEO、清华大学教授唐杰近日在X平台发文,对当前AI领域普遍存在的“参数规模至上”论调提出系统性反思。他认为,随着模型能力进入新的发展阶段,单纯讨论参数量已失去实际意义。唐杰以最新发布的GLM-5.3为案例,阐述了他所提出的“扩展五要素”,强调模型进步的驱动力已从参数规模转向数据质量、推理计算、后训练方法以及部署条件,特别是通过构建可合成、可验证的长周期强化学习环境,模型能在复杂实际任务中实现端到端的自主工作,这标志着AI发展进入了“后训练扩展定律”主导的新阶段。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

GLM-5.3与训练扩展法新认知

05:04
  • 参数数量不再是衡量模型能力的唯一指标,需结合数据、计算、部署条件综合判断。
  • GLM-5.3性能提升完全来自长时间序列的强化学习训练。
  • 强化学习训练环境模拟真实工程师多日工作流程,涵盖计算集群、文档库等完整环境。
深读这一段

讨论的问题:为什么当前对模型规模的讨论需要超越单纯的参数数量?

论据 / 案例:GLM-5.3仅基于与GLM-5.2相同的基础架构,通过约一个月的额外强化学习训练获得显著性能提升。

02

新训练方法的工程实践

07:00
  • 构建可执行、可验证、贴近真实专业工作的任务环境是扩展后训练的关键。
  • 研究代理从真实工作模式中收集任务,生成具有多步依赖和隐藏状态的长期环境。
  • 验证器合成过程无需参考解,求解器轨迹用于发现并关闭奖励捷径。
深读这一段

讨论的问题:如何系统性地构建和扩展用于强化学习训练的任务环境?

论据 / 案例:环境合成流水线与验证器合成流水线实现端到端自动化,二元奖励信号足够可靠以直接用于训练。

03

扩展的五个关键维度

09:00
  • 提出包含MoE稀疏性(采用新XA-YB表示法)的五个扩展旋钮。
  • 高级能力(如发现软件漏洞)需要维持超过20个推理步骤的长因果链。
  • 在达到知识容纳阈值后,该能力不再依赖于总参数数量。
深读这一段

讨论的问题:除了参数数量,还有哪些维度是模型扩展的关键?

论据 / 案例:高级技能是需要长因果链的推理问题,而非检索/记忆问题。

04

开源模型与压缩技术动态

10:00
  • Ornith-1.5发布涵盖9B到397B参数的MIT开源模型家族。
  • Unsloth发布Qwen3.8-27B Dynamic V3量化,声称相同大小下精度提升约10%。
  • 发布1-bit量化模型,在8GB RAM上运行仍保持约77%的BF16精度。
深读这一段

讨论的问题:开源模型和压缩技术近期有哪些重要进展?

论据 / 案例:Ornith-1.5在Terminal-Bench 2.1上得分86.1,在SWE-Bench Verified上得分86。

05

智能体框架成为新竞争层

12:00
  • DeepSeek Harness(DSH)采用极简设计,所有功能(包括代理循环)均为插件。
  • TrueForge开源提供供应商中立的生产级智能体框架。
  • 托管框架通过更精细的可观测性和控制进行优化,如多代理会话查看器。
深读这一段

讨论的问题:智能体框架如何成为AI应用的新竞争焦点?

论据 / 案例:TrueForge在14项任务的企业基准测试上,匹配Claude Managed Agents在Opus 4.8上的表现,同时减少约30%的token使用;路由到GLM-5.2可将成本降低约75%。

06

后训练与强化学习系统进展

14:00
  • 微软的Agent Lightning通过端点代理将任意框架与强化学习连接。
  • 使用约6K训练样本,可将Qwen3.5-9B在SWE-Bench Verified上的表现从41.8%提升至56.4%。
  • 在TRL中,通过生成缓冲、批量教师调用和二进制对数概率编码,策略蒸馏速度提升40倍。
深读这一段

讨论的问题:强化学习训练基础设施有哪些关键改进?

论据 / 案例:中期训练正被更明确地视为优化层面,需优化数据混合、持续时间、阶段排序、序列长度和可训练性。

07

生产环境中的关键基础设施

16:00
  • Qdrant提出可过滤HNSW,在1M向量的1%过滤下实现99.8%召回率,延迟1.0ms。
  • Sentence Transformers v6.0反映了从单向量检索到多向量检索的实际转变。
  • 生产级智能体延迟中,非LLM组件在一半应用中占主导地位。
深读这一段

讨论的问题:在生产部署中,哪些基础设施细节至关重要?

论据 / 案例:任务感知服务可将延迟降低29-40%,状态卸载可将内存需求减少4.6倍,工具结果缓存可移除35.2%的冗余搜索调用。

08

巨头的产品化竞赛

18:00
  • Gemini 3.7 Flash在AA-AnalystAgent基准测试中排名第一,平均成本为$0.54/任务。
  • OpenAI推出私有安全处理,旨在为前沿模型保持零数据保留。
  • Anthropic在Claude Code中增加简洁输出风格,将响应格式作为一级用户体验变量进行调优。
深读这一段

讨论的问题:Google、OpenAI和Anthropic在产品化方面有哪些最新举措?

论据 / 案例:Gemini 3.7 Flash在80个表格/文档密集型定量任务上的平均成本为$0.54。

金句

  • "Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions." —— 参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。
  • "Advanced skills... require carrying long causal chains (20+ inference steps) without losing the thread. This ability does not live in total parameter count once a certain knowledge-holding threshold is reached." —— 高级技能……需要在不偏离主线的情况下进行长达20步以上的长因果链推理。一旦模型达到某个知识容量阈值,这种能力就不再体现在总参数量中了。
  • "As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment." —— 随着智能体能力的提升,扩展后训练的大部分难度从模型转移到了环境本身。

原文链接

查看完整访谈

完整内容见原文:Latent Space · AI模型进入后训练时代:参数规模不再是唯一标尺