GLM-5.3 深度分析报告
后训练 Scaling 的极致实践
数据来源:智谱AI官方文档、IT之家、澎湃新闻、新浪财经、雪球、知乎等
一、概述
2026年8月14日,智谱(2513.HK)正式发布旗舰大语言模型 GLM-5.3。与此前市场传闻的万亿参数升级不同,GLM-5.3 沿用与 GLM-5.2 完全相同的 743B 参数基座模型,所有性能提升均来自后训练(Post-Training)阶段的持续扩展。
智谱将其定位为”编程能力最强的开源模型”,在多项主流基准测试中取得开源模型最高排名,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。
二、核心参数
| 参数 | 数值 |
|---|---|
| 总参数量 | ~743B(7400亿) |
| Active 参数 | ~40B |
| 上下文窗口 | 1M Tokens |
| 最大输出 | 128K Tokens |
| 输入/输出模态 | 文本 / 文本 |
| 思考模式 | low / high / max 三档 |
| 功能支持 | 流式输出、Function Calling、上下文缓存、结构化输出、MCP |
三、基准测试表现
3.1 主要基准对比(GLM-5.2 → GLM-5.3)
| 基准测试 | GLM-5.2 | GLM-5.3 | 提升幅度 | 说明 |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +515% | 真实终端环境中完成复杂任务 |
| DeepSWE v1.1 | 46.2 | 66.9 | +44.8% | 长程软件工程与持续代码修改 |
| Agents’ Last Exam | 23.8 | 28.5 | +19.7% | 跨工具协作与长程任务 |
| GDPval-AA v2 | — | 1769 | — | 覆盖 44 种职业的知识工作基准 |
3.2 Z.ai Code Bench 编程体感评测
GLM-5.3 在自研的 Z.ai Code Bench 上将模型置于真实本地开发环境,执行端到端编程任务:
| 档位 | GLM-5.3 | Claude Opus 4.8 | Claude Fable 5 |
|---|---|---|---|
| High 准确率 | 31.4% | 29.5% | — |
| High Token 消耗 | ~5万/任务 | ~12万/任务 | — |
| Max 准确率 | 34.5% | — | 39.5% |
| Max Token 消耗 | ~7.5万/任务 | — | — |
关键发现: GLM-5.3 在 High 档位下以不到 Opus 4.8 一半的 Token 消耗实现了更高的准确率,Token 利用效率显著领先。但在最高难度下仍落后 Fable 5 约 5 个百分点。
四、网络安全能力涌现
后训练环境扩展至安全任务后,GLM-5.3 涌现出超预期的漏洞发现与验证能力。
4.1 安全基准得分
| 基准 | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym(白盒审查) | 77.2% | 84.5% | 83.8% | 83.6% |
| ExploitBench(漏洞推理) | 24.4% | 54.4% | 78.0% | 76.5% |
| ExploitGym 2h(利用任务数) | 29 | 105 | 181 | — |
| ExploitGym 6h(利用任务数) | 39 | 130 | 247 | — |
4.2 真实漏洞发现成果
自 GLM-5.2 发布以来,智谱联合清华大学、南开大学及多家安全团队(云起无垠、绿盟科技、赛博昆仑、DARKNAVY、腾讯玄武),在真实代码库中:
- 累计识别漏洞:2,436 个
- 其中中高危漏洞:1,097 个
- 涉及项目:269 个
- 涉及领域:系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议
- 最早漏洞追溯至约 40 年前(1983 年 DNS 协议)
- 已建立”Z.ai 安全披露账本”,持续公开披露
4.3 能力边界
智谱明确指出,GLM-5.3 的安全优势主要集中在漏洞利用链的前半段(代码审查、漏洞识别与验证)。在需要更深层推理的 ExploitBench 上,仍与 Mythos 5 和 GPT-5.6 Sol 有明显差距。模型”会找漏洞”,但”打穿系统”仍有距离。
五、技术路线
5.1 核心策略:后训练 Scaling
GLM-5.3 的全部提升来自后训练阶段,具体包括:
- 数十倍长程任务环境 — 环境数量大幅扩展,部分任务相当于资深工程师连续数天工作量
- 更多样化的环境类型 — 从发现问题、分析方案到实施、验证和交付的完整流程
- 超长训练周期 — 模型使用真实计算集群、存储系统、内部文档与代码库完成任务
- 自动化训练流水线 — 端到端合成训练环境及强化学习奖励信号
基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架,在与 GLM-5.2 完全相同的基座上高效推进强化学习。
5.2 三层安全架构
| 层级 | 机制 | 说明 |
|---|---|---|
| 外层 | 轻量分类器 | 标记并拦截大规模滥用请求 |
| 中间 | 推理监控器 | 推理过程中实时审查任务意图 |
| 内层 | 模型安全对齐 | 自主识别并拒绝恶意请求 |
注:外层和中间层依赖服务端,下载权重本地部署后仅保留最内层防线。
六、竞争格局(2026.08.14 同期)
| 事件 | 时间 | 要点 |
|---|---|---|
| 智谱 GLM-5.3 发布 | 8月14日 | 后训练突破,开源 SOTA,编程接近 Fable 5 |
| DeepSeek V4 Pro 更新 | 8月13日 | Agent 能力增强,DeepSWE 62.7,上线 Harness 智能体 |
| SpaceXAI Grok 4.6 发布 | 8月14日 | 基于 Grok 4.5 升级,重点提升长流程任务 |
| DeepSeek 提价 | 8月13日 | V4 Flash/Pro 价格上调最高四倍,给智谱留出竞争窗口 |
据 Artificial Analysis 评分,DeepSeek 顶级模型与 GLM-5.2 同为 53 分智能评分,均落后于 Kimi K3、Claude Fable 5、GPT 5.6 等模型。
七、产品落地与开源计划
| 项目 | 状态 |
|---|---|
| ZCode(官方编程工具) | ✅ 已上线 |
| AutoClaw(效率工具) | ✅ 已上线 |
| GLM Coding Plan | ✅ 全量开放,额度已重置 |
| 第三方平台(TraeWork、扣子、QwenWork 等) | ✅ 开放抢先体验 |
| API | ⏳ 即将上线 |
| 完整模型权重开源 | ⏳ 两周内(需完成安全加固) |
八、市场与商业背景
- 智谱港股代码:2513.HK,发布当日股价跌超 4%
- 智谱此前市值一度冲至 1,370 亿美元,超越拼多多和网易,后回落至约 800 亿美元
- 年度经常性收入(ARR)于 2026年7月达到 10 亿美元
- 已完成数据中心建设,部署至少 1 万枚国产芯片用于研发与推理
九、总结
GLM-5.3 再次证明:Post-Training 仍然可以继续 Scaling。
在相同基座上,通过将后训练环境扩展到真实工程师的完整工作流,智谱实现了 50% 的性能跃升,让 743B 参数的模型追上了前沿水平。这印证了行业正在形成的路线分化:
- 土豪路线 — 以参数规模扩张讲故事(如 Kimi K3 的 2.8T 参数)
- 技术流 — 在现有能力基础上做到极致(GLM-5.3、Grok 4.6、DeepSeek V4)
值得关注的遗憾:
- GLM-5.3 仍缺少原生多模态视觉能力,重心完全押在 Coding / Agent 方向
- 完整权重尚未开源,安全加固期间存在不确定性
- 发布当日市场反应偏冷(股价跌超 4%)
万亿参数的升级或许留给了 GLM-5.5。
本报告基于公开信息整理,仅供参考,不构成投资建议。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





