mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1837 字
5 分钟
GLM-5.3:深度分析报告
2026-08-14

GLM-5.3 深度分析报告#

后训练 Scaling 的极致实践

数据来源:智谱AI官方文档、IT之家、澎湃新闻、新浪财经、雪球、知乎等


一、概述#

2026年8月14日,智谱(2513.HK)正式发布旗舰大语言模型 GLM-5.3。与此前市场传闻的万亿参数升级不同,GLM-5.3 沿用与 GLM-5.2 完全相同的 743B 参数基座模型,所有性能提升均来自后训练(Post-Training)阶段的持续扩展。

智谱将其定位为”编程能力最强的开源模型”,在多项主流基准测试中取得开源模型最高排名,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。

二、核心参数#

参数数值
总参数量~743B(7400亿)
Active 参数~40B
上下文窗口1M Tokens
最大输出128K Tokens
输入/输出模态文本 / 文本
思考模式low / high / max 三档
功能支持流式输出、Function Calling、上下文缓存、结构化输出、MCP

三、基准测试表现#

3.1 主要基准对比(GLM-5.2 → GLM-5.3)#

基准测试GLM-5.2GLM-5.3提升幅度说明
Terminal-Bench 3.04.628.3+515%真实终端环境中完成复杂任务
DeepSWE v1.146.266.9+44.8%长程软件工程与持续代码修改
Agents’ Last Exam23.828.5+19.7%跨工具协作与长程任务
GDPval-AA v21769覆盖 44 种职业的知识工作基准

3.2 Z.ai Code Bench 编程体感评测#

GLM-5.3 在自研的 Z.ai Code Bench 上将模型置于真实本地开发环境,执行端到端编程任务:

档位GLM-5.3Claude Opus 4.8Claude Fable 5
High 准确率31.4%29.5%
High Token 消耗~5万/任务~12万/任务
Max 准确率34.5%39.5%
Max Token 消耗~7.5万/任务

关键发现: GLM-5.3 在 High 档位下以不到 Opus 4.8 一半的 Token 消耗实现了更高的准确率,Token 利用效率显著领先。但在最高难度下仍落后 Fable 5 约 5 个百分点。

四、网络安全能力涌现#

后训练环境扩展至安全任务后,GLM-5.3 涌现出超预期的漏洞发现与验证能力。

4.1 安全基准得分#

基准GLM-5.2GLM-5.3Mythos 5GPT-5.6 Sol
CyberGym(白盒审查)77.2%84.5%83.8%83.6%
ExploitBench(漏洞推理)24.4%54.4%78.0%76.5%
ExploitGym 2h(利用任务数)29105181
ExploitGym 6h(利用任务数)39130247

4.2 真实漏洞发现成果#

自 GLM-5.2 发布以来,智谱联合清华大学、南开大学及多家安全团队(云起无垠、绿盟科技、赛博昆仑、DARKNAVY、腾讯玄武),在真实代码库中:

  • 累计识别漏洞:2,436 个
  • 其中中高危漏洞:1,097 个
  • 涉及项目:269 个
  • 涉及领域:系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议
  • 最早漏洞追溯至约 40 年前(1983 年 DNS 协议)
  • 已建立”Z.ai 安全披露账本”,持续公开披露

4.3 能力边界#

智谱明确指出,GLM-5.3 的安全优势主要集中在漏洞利用链的前半段(代码审查、漏洞识别与验证)。在需要更深层推理的 ExploitBench 上,仍与 Mythos 5 和 GPT-5.6 Sol 有明显差距。模型”会找漏洞”,但”打穿系统”仍有距离。

五、技术路线#

5.1 核心策略:后训练 Scaling#

GLM-5.3 的全部提升来自后训练阶段,具体包括:

  1. 数十倍长程任务环境 — 环境数量大幅扩展,部分任务相当于资深工程师连续数天工作量
  2. 更多样化的环境类型 — 从发现问题、分析方案到实施、验证和交付的完整流程
  3. 超长训练周期 — 模型使用真实计算集群、存储系统、内部文档与代码库完成任务
  4. 自动化训练流水线 — 端到端合成训练环境及强化学习奖励信号

基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架,在与 GLM-5.2 完全相同的基座上高效推进强化学习。

5.2 三层安全架构#

层级机制说明
外层轻量分类器标记并拦截大规模滥用请求
中间推理监控器推理过程中实时审查任务意图
内层模型安全对齐自主识别并拒绝恶意请求

注:外层和中间层依赖服务端,下载权重本地部署后仅保留最内层防线。

六、竞争格局(2026.08.14 同期)#

事件时间要点
智谱 GLM-5.3 发布8月14日后训练突破,开源 SOTA,编程接近 Fable 5
DeepSeek V4 Pro 更新8月13日Agent 能力增强,DeepSWE 62.7,上线 Harness 智能体
SpaceXAI Grok 4.6 发布8月14日基于 Grok 4.5 升级,重点提升长流程任务
DeepSeek 提价8月13日V4 Flash/Pro 价格上调最高四倍,给智谱留出竞争窗口

据 Artificial Analysis 评分,DeepSeek 顶级模型与 GLM-5.2 同为 53 分智能评分,均落后于 Kimi K3、Claude Fable 5、GPT 5.6 等模型。

七、产品落地与开源计划#

项目状态
ZCode(官方编程工具)✅ 已上线
AutoClaw(效率工具)✅ 已上线
GLM Coding Plan✅ 全量开放,额度已重置
第三方平台(TraeWork、扣子、QwenWork 等)✅ 开放抢先体验
API⏳ 即将上线
完整模型权重开源⏳ 两周内(需完成安全加固)

八、市场与商业背景#

  • 智谱港股代码:2513.HK,发布当日股价跌超 4%
  • 智谱此前市值一度冲至 1,370 亿美元,超越拼多多和网易,后回落至约 800 亿美元
  • 年度经常性收入(ARR)于 2026年7月达到 10 亿美元
  • 已完成数据中心建设,部署至少 1 万枚国产芯片用于研发与推理

九、总结#

GLM-5.3 再次证明:Post-Training 仍然可以继续 Scaling。

在相同基座上,通过将后训练环境扩展到真实工程师的完整工作流,智谱实现了 50% 的性能跃升,让 743B 参数的模型追上了前沿水平。这印证了行业正在形成的路线分化:

  • 土豪路线 — 以参数规模扩张讲故事(如 Kimi K3 的 2.8T 参数)
  • 技术流 — 在现有能力基础上做到极致(GLM-5.3、Grok 4.6、DeepSeek V4)

值得关注的遗憾:

  • GLM-5.3 仍缺少原生多模态视觉能力,重心完全押在 Coding / Agent 方向
  • 完整权重尚未开源,安全加固期间存在不确定性
  • 发布当日市场反应偏冷(股价跌超 4%)

万亿参数的升级或许留给了 GLM-5.5


本报告基于公开信息整理,仅供参考,不构成投资建议。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

GLM-5.3:深度分析报告
https://mizuki-eaf.pages.dev/posts/glm/glm-53深度分析报告/
作者
无名之子
发布于
2026-08-14
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录