💬 观点Latent Space
[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 — GLM 5.3 揭示后训练新缩放定律:参数不再是唯一关键,环境合成与长程 RL
GLM 5.3 揭示后训练新缩放定律:参数不再是唯一关键,环境合成与长程 RL 才是新战场。
2026-08-20原文
本文为要点摘要,完整细节以原文为准。
- GLM 5.3 的进步主要来自长时程环境的强化学习,任务模拟真实工程工作,如诊断训练栈瓶颈并优化,模型需端到端负责,而非依赖用户分解步骤。
- 环境合成成为扩展瓶颈:为规模化后训练,zAI 构建全合成环境生成管线,研究代理从真实工作提取任务模式,验证器确保可解性,合成奖励信号可靠,推动模型能力提升。
- 参数规模不再是唯一杠杆:智谱提出 5 个缩放旋钮,包括 MoE 稀疏性等,高级技能如漏洞挖掘需 20+ 步推理链,依赖有效深度而非总参数,对开发者意味着应关注训练数据与推理效率。
原文:[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law · 作者 Latent Space