当前观察 › 来源档案 › 唐杰 AI模型进入后训练时代:参数规模不再是唯一标尺 Z.ai CEO唐杰指出,AI模型发展进入新阶段,单纯追求参数规模已过时。他提出扩展的五个关键维度,并以GLM-5.3为例,展示通过长期环境强化学习实现性能飞跃。模型能力提升的核心正从参数量转向数据质量、推理计算和后训练配方,特别是合成环境与奖励信号的规模化。
这份材料帮助我们理解什么? 暂未纳入当前六个问题,保留为研究资料,不代表本站结论。
访谈/对话 · 对话文本 · 已找到对应文本,不代表完整性或事实已经核验
以下保留原有自动整理内容,尚未完成逐句复核;日期与人物沿用档案记录。当前答案和重新核对的依据,请看上方问题页。
导语 Z.ai CEO、清华大学教授唐杰近日在X平台发文,对当前AI领域普遍存在的“参数规模至上”论调提出系统性反思。他认为,随着模型能力进入新的发展阶段,单纯讨论参数量已失去实际意义。唐杰以最新发布的GLM-5.3为案例,阐述了他所提出的“扩展五要素”,强调模型进步的驱动力已从参数规模转向数据质量、推理计算、后训练方法以及部署条件,特别是通过构建可合成、可验证的长周期强化学习环境,模型能在复杂实际任务中实现端到端的自主工作,这标志着AI发展进入了“后训练扩展定律”主导的新阶段。
大纲与深读 8 章 展开「深读」看每一段讨论的问题与论据。
01
GLM-5.3与训练扩展法新认知 05:04 参数数量不再是衡量模型能力的唯一指标,需结合数据、计算、部署条件综合判断。 GLM-5.3性能提升完全来自长时间序列的强化学习训练。 强化学习训练环境模拟真实工程师多日工作流程,涵盖计算集群、文档库等完整环境。 深读这一段 讨论的问题: 为什么当前对模型规模的讨论需要超越单纯的参数数量?
论据 / 案例: GLM-5.3仅基于与GLM-5.2相同的基础架构,通过约一个月的额外强化学习训练获得显著性能提升。
02
新训练方法的工程实践 07:00 构建可执行、可验证、贴近真实专业工作的任务环境是扩展后训练的关键。 研究代理从真实工作模式中收集任务,生成具有多步依赖和隐藏状态的长期环境。 验证器合成过程无需参考解,求解器轨迹用于发现并关闭奖励捷径。 深读这一段 讨论的问题: 如何系统性地构建和扩展用于强化学习训练的任务环境?
论据 / 案例: 环境合成流水线与验证器合成流水线实现端到端自动化,二元奖励信号足够可靠以直接用于训练。
03
扩展的五个关键维度 09:00 提出包含MoE稀疏性(采用新XA-YB表示法)的五个扩展旋钮。 高级能力(如发现软件漏洞)需要维持超过20个推理步骤的长因果链。 在达到知识容纳阈值后,该能力不再依赖于总参数数量。 深读这一段 讨论的问题: 除了参数数量,还有哪些维度是模型扩展的关键?
论据 / 案例: 高级技能是需要长因果链的推理问题,而非检索/记忆问题。
04
开源模型与压缩技术动态 10:00 Ornith-1.5发布涵盖9B到397B参数的MIT开源模型家族。 Unsloth发布Qwen3.8-27B Dynamic V3量化,声称相同大小下精度提升约10%。 发布1-bit量化模型,在8GB RAM上运行仍保持约77%的BF16精度。 深读这一段 讨论的问题: 开源模型和压缩技术近期有哪些重要进展?
论据 / 案例: Ornith-1.5在Terminal-Bench 2.1上得分86.1,在SWE-Bench Verified上得分86。
05
智能体框架成为新竞争层 12:00 DeepSeek Harness(DSH)采用极简设计,所有功能(包括代理循环)均为插件。 TrueForge开源提供供应商中立的生产级智能体框架。 托管框架通过更精细的可观测性和控制进行优化,如多代理会话查看器。 深读这一段 讨论的问题: 智能体框架如何成为AI应用的新竞争焦点?
论据 / 案例: TrueForge在14项任务的企业基准测试上,匹配Claude Managed Agents在Opus 4.8上的表现,同时减少约30%的token使用;路由到GLM-5.2可将成本降低约75%。
06
后训练与强化学习系统进展 14:00 微软的Agent Lightning通过端点代理将任意框架与强化学习连接。 使用约6K训练样本,可将Qwen3.5-9B在SWE-Bench Verified上的表现从41.8%提升至56.4%。 在TRL中,通过生成缓冲、批量教师调用和二进制对数概率编码,策略蒸馏速度提升40倍。 深读这一段 讨论的问题: 强化学习训练基础设施有哪些关键改进?
论据 / 案例: 中期训练正被更明确地视为优化层面,需优化数据混合、持续时间、阶段排序、序列长度和可训练性。
07
生产环境中的关键基础设施 16:00 Qdrant提出可过滤HNSW,在1M向量的1%过滤下实现99.8%召回率,延迟1.0ms。 Sentence Transformers v6.0反映了从单向量检索到多向量检索的实际转变。 生产级智能体延迟中,非LLM组件在一半应用中占主导地位。 深读这一段 讨论的问题: 在生产部署中,哪些基础设施细节至关重要?
论据 / 案例: 任务感知服务可将延迟降低29-40%,状态卸载可将内存需求减少4.6倍,工具结果缓存可移除35.2%的冗余搜索调用。
08
巨头的产品化竞赛 18:00 Gemini 3.7 Flash在AA-AnalystAgent基准测试中排名第一,平均成本为$0.54/任务。 OpenAI推出私有安全处理,旨在为前沿模型保持零数据保留。 Anthropic在Claude Code中增加简洁输出风格,将响应格式作为一级用户体验变量进行调优。 深读这一段 讨论的问题: Google、OpenAI和Anthropic在产品化方面有哪些最新举措?
论据 / 案例: Gemini 3.7 Flash在80个表格/文档密集型定量任务上的平均成本为$0.54。
金句
"Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions." —— 参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。
"Advanced skills... require carrying long causal chains (20+ inference steps) without losing the thread. This ability does not live in total parameter count once a certain knowledge-holding threshold is reached." —— 高级技能……需要在不偏离主线的情况下进行长达20步以上的长因果链推理。一旦模型达到某个知识容量阈值,这种能力就不再体现在总参数量中了。
"As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment." —— 随着智能体能力的提升,扩展后训练的大部分难度从模型转移到了环境本身。
← 上一篇 Matt Pocock的Wayfinder技能:拨开项目规划的战争迷雾 下一篇 → AI驱动内存需求激增,价格一年暴涨500%