GLM-5 论文解读:从”追赶者”到”全球第一”,智谱用三个版本完成了质变
论文:GLM-5 Technical Report 作者:智谱AI(Zhipu AI) arXiv: 2602.15763 这篇是 2026 年 2 月的技术报告。745B 总参数、44B 激活的 MoE,200K 上下文,MIT 协议开源。但真正炸裂的不是 GLM-5 本身——而是它后面的两个版本:GLM-5.1 拿下 SWE-Bench Pro 全球第一并实现 8 小时自主编程,GLM-5.2 在 FrontierSWE 上以 74.4% 超越 GPT-5.5 的 72.6%,成本只要六分之一。从”追赶”到”超越”,只用了四个月。
一、背景:GLM-4.5 之后,下一步是什么
GLM-4.5 已经把”推理+编程+Agent”三合一的框架立起来了,355B/32B 在开源里是第一梯队。但放到 2026 年初的竞争格局里看,问题很清楚:闭源模型在长上下文、Agent 自主性和推理深度上还在拉开差距。
GLM-5 的任务不是”再涨几个点”,是要从架构层面解决三个根本瓶颈:
- 长上下文的计算成本——200K 以上的窗口,vanilla attention 根本扛不住
- Agent 任务的自主性——不是”调一次工具”,是”连续自主工作数小时”
- 推理效率——不能为了性能无限堆参数
三个问题,三个答案:DSA(动态稀疏注意力)、异步 Agent RL、国产芯片全栈适配。
二、架构:从 355B 到 745B,但真正的杀招是 DSA
基本规格
- 总参数:~745B(比 GLM-4.5 的 355B 翻倍还多)
- 激活参数:~44B(只比 32B 多了 12B)
- 上下文:200K
- 协议:MIT
- 预训练语料:27T+ tokens(比 GLM-4.5 的 23T 又多了 4T+)
- 优化器:Muon Split(从 GLM-4.5 的 Muon 进化)
参数翻倍但激活只多了三分之一——这说明 GLM-5 把”深而不宽”的路线走得更极端了。更多专家、更精细的路由、更少的激活开销。
DSA(Dynamic Sparse Attention,动态稀疏注意力)
这是 GLM-5 架构上最重要的创新,也是它能把上下文拉到 200K 的关键。
先说问题。传统注意力机制是”全连接”的——每个新 token 都要回头看前面所有 token,计算量是序列长度的平方(O(L²))。当上下文从 4K 拉到 128K,计算量涨了 1000 倍;再拉到 200K,就是 2500 倍。这不是”加几张卡”能解决的问题,是根本性的计算瓶颈。
打个比方:传统注意力像是”每说一句话都要把整本百科全书从头翻到尾”。DSA 的思路是:“你不需要翻整本书,只需要翻最相关的那几页。”
原理:对每个当前 token,不是跟前面所有 token 做注意力(那是 O(L²) 的),而是只挑选最相关的 top-K 个先前 token做注意力。复杂度从 O(L²) 降到 O(LK),K 远小于 L。比如上下文 200K token,但每个 token 只看最相关的 2048 个——计算量直接降了两个数量级。
关键是”动态”二字:不是固定看某个窗口(比如只看最近 4096 个 token),而是根据内容相关性动态选择。写代码时可能需要看 5000 行前的函数定义,写文章时可能需要看开头的论点——DSA 能自动判断该看哪里。
具体实现分两步:
- 训练初期用稠密注意力(类似 MLA 的变体)把基础能力打好
- 逐步过渡到稀疏注意力——不是一刀切,是渐进式地让模型适应稀疏模式
这个”先稠后稀”的训练策略很聪明。如果一开始就稀疏,模型连基本的注意力分布都学不好——它还不知道什么信息重要,你让它”只看几个 token”,它可能刚好漏掉关键信息。等稠密阶段把能力底座打牢了,再切稀疏,模型已经知道”哪些 token 重要”,稀疏化就不会掉性能。
论文验证了等性能(parity):换成稀疏注意力后,标准 benchmark 成绩基本不掉,长上下文场景反而因为计算更高效可以跑更长的序列。
上下文扩展:从 4K 到 200K
跟 GLM-4.5 一样是渐进式扩展,但目标从 128K 提升到了 200K。不是一步插值到位,而是分多个阶段逐步提升 RoPE 基频并加入长序列数据。
中期训练:Agent 数据的比重大幅增加
中期训练(mid-training)加入了大量 Agent 导向的数据:
- 长多步工具调用轨迹:文件浏览、代码搜索、测试运行
- 仓库级数据:跨文件链接、commit 历史、issue 修复
- 长技术文档和多轮对话
这些不是传统的”问答对”,而是完整的 Agent 工作流记录。模型在预训练阶段就开始学习”怎么当一个 Agent”。
三、Agent RL:异步 + 三阶段 + 容错奖励
异步 Agent 强化学习
GLM-5 的 Agent RL 跟 GLM-4.5 最大的区别是:完全异步。
传统 RL 是同步的——模型生成轨迹、等环境反馈、更新策略,串行执行。问题是 Agent 任务动辄需要几十步工具调用,每步都有环境延迟,同步训练慢得离谱。
GLM-5 的做法:推理 worker 和训练 worker 完全解耦。推理 worker 可以用稍旧一点的策略版本生成轨迹(通过重要性采样修正偏差),训练 worker 持续从轨迹池里取数据更新。两边不等对方,各自跑。
这个设计让 Agent RL 的训练吞吐量大幅提升。
三阶段后训练
跟 GLM-4.5 类似但更深入:
阶段一:推理 RL
- 数学竞赛(AIME、MATH)和竞赛编程(Codeforces)
- 难度课程学习
阶段二:Agent RL
- 软件工程环境:SWE-bench 和内部 CC-Bench-V2
- 课程从”单文件小修”到”多文件 SWE-bench 级任务”
- 奖励设计:
- 最终正确性:隐藏测试通过与否
- 过程质量:过程奖励模型(PRM)或规则
- 容错恢复奖励:模型遇到错误后能合理恢复给小分
- 动作空间包含”思考 token”——工具调用前先推理
- 用熵奖励保持探索性
阶段三:通用 RL
- 指令遵循、安全、对话
跨阶段蒸馏:防遗忘
三阶段训练有个经典问题:后面的阶段会覆盖前面的能力(灾难性遗忘)。
GLM-5 的解法:跨阶段蒸馏(Cross-stage Distillation)。具体做法:
- 进入新阶段时,用上一阶段的模型生成”锚点数据”
- 把锚点数据混进新阶段的训练数据里
- 损失函数加 KL 正则化,或者对冻结的教师快照做蒸馏
同样的方法在”Agent RL → 通用 RL”的过渡中重复使用。
“Try-then-Recover”:不怕犯错,怕的是放弃
Agent RL 的一个核心设计哲学:奖励”尝试后恢复”而不是”永不犯错”。
模型调工具失败了,如果能合理分析错误、调整策略、重试成功,照样拿分。这比”一步到位”的奖励设计更贴近真实 Agent 场景——现实中工具调用失败是常态,关键是能不能从失败中恢复。
四、国产芯片适配:7 大平台全栈支持
这是 GLM-5 论文里一个非常”中国特色”的部分:全面适配 7 大国产芯片平台,包括华为昇腾、寒武纪、摩尔线程等。
为什么这很重要?因为 2025-2026 年,高端 GPU 出口管制越来越严,国产 AI 公司如果只能在 NVIDIA 上跑模型,就是把自己的命脉交给别人。GLM-5 从训练到推理都做了国产芯片适配,意味着:
- 训练不完全依赖 NVIDIA
- 推理部署可以在国产硬件上跑
- 论文还提到推理成本降了约 50%
这不只是一个技术选择,是一个战略选择。
五、GLM-5.1:SWE-Bench Pro 全球第一,8 小时自主编程
2026 年 4 月,GLM-5.1 发布。规格:
- 744B 总参数 / 40B 激活
- 核心突破:SWE-Bench Pro 全球第一
- 标志性能力:8 小时自主编程——不是”给你一个问题等 5 分钟出答案”,是”给你一个复杂项目,模型自己规划、搜索、编码、测试、调试,连续工作 8 小时”
8 小时自主编程意味着什么?意味着模型不是在”回答问题”,是在独立完成一个软件工程任务。它需要:
- 理解整个代码仓库的结构
- 制定多步计划
- 在执行中不断修正
- 遇到 bug 自己诊断和修复
- 最终交付可工作的代码
这已经不是”辅助编程”了,是自主编程。
六、GLM-5.2:FrontierSWE 超越 GPT-5.5,成本六分之一
2026 年 6 月,GLM-5.2 发布。这是真正”炸场”的一个版本。
规格
- 总参数:753B
- 激活参数:40B
- 上下文:1M token(从 200K 直接拉到百万)
- 最大单次生成:12.8 万 token
- 协议:MIT
- 架构创新:IndexShare——4 层稀疏注意力共享一个轻量级索引器,单 token 计算量降 2.9 倍,推测解码接受率提升 20%
核心成绩
| 基准 | GLM-5.2 | GPT-5.5 | 备注 |
|---|---|---|---|
| FrontierSWE | 74.4% | 72.6% | 超越 |
| PostTrainBench | 34.3 | 28.4 | |
| Terminal-Bench 2.1 | 81.0 | ||
| SWE-bench Pro | 62.1 | ||
| MCP-Atlas | 76.8 | ||
| AIME 2026 | 99.2 | 接近满分 |
FrontierSWE 74.4% 超越 GPT-5.5 的 72.6%——这是开源模型第一次在顶级软件工程基准上正面击败闭源旗舰。
这个”第一次”的重量需要强调一下。FrontierSWE 不是那种”给个函数写个实现”的简单编程题,它是真实世界的复杂软件工程任务——大型代码仓库、多文件修改、需要理解项目架构、跑测试、处理边界情况。在这上面超越 GPT-5.5,意味着开源模型在”最接近真实软件开发”的场景里已经不比闭源差了。
而且注意,Claude Opus 4.8 是 75.1%,GLM-5.2 是 74.4%——差距只有 0.7 个百分点。考虑到 GLM-5.2 是开源的、可以本地部署的、可以免费微调的,这个 0.7% 的差距在实际应用中完全可以忽略。
成本:六分之一
API 定价:输入 $1.4/百万 token,输出 $4.4/百万 token。
对比:
- GPT-5.5:约 $8/$24
- Claude Opus 4.8:约 $10/$30
GLM-5.2 的成本是闭源旗舰的 1/4 到 1/6。性能更强,价格更低,还开源。这个组合拳太狠了。
生态支持
支持 transformers、vLLM、SGLang、xLLM、ktransformers、Ollama 等主流框架。集成 Claude Code、OpenCode、Cline、ZCode 等 Agent 工具。
推理努力等级分 High 和 Max 两档——简单任务用 High 省算力,极难任务用 Max 全力输出。
七、从 GLM-5 到 GLM-5.2:四个月的质变
把三个版本放在一起看:
| GLM-5(2026.02) | GLM-5.1(2026.04) | GLM-5.2(2026.06) | |
|---|---|---|---|
| 总参数 | ~745B | 744B | 753B |
| 激活 | ~44B | 40B | 40B |
| 上下文 | 200K | - | 1M |
| 核心突破 | DSA + 异步 Agent RL | SWE-Bench Pro 第一 | FrontierSWE 超 GPT-5.5 |
| 定位 | 追赶 | 并跑 | 超越 |
从 2 月到 6 月,四个月时间,从”追赶闭源”到”正面无视闭源”。这个速度在 AI 领域是罕见的。
收尾:我的一点看法
GLM-5 系列让我想到一个词:后发制人。
2025 年中 GLM-4.5 发布的时候,智谱在开源圈已经很强了,但跟顶级闭源(GPT-5 系列、Claude 4 系列)还有明显差距。当时的叙事是”开源追赶闭源”。但到了 2026 年 6 月 GLM-5.2 发布,叙事变了——不再是”追赶”,而是”在特定维度上超越”。FrontierSWE 74.4% vs GPT-5.5 的 72.6%,这不是”接近”,是”超过”。
第二个让我深思的点是DSA 的战略价值。GLM-5 把上下文从 128K 拉到 200K,GLM-5.2 直接拉到 1M——这不是简单的”数字变大”。在 Agent 场景里,1M 上下文意味着模型可以把一整个大型代码仓库装进脑子里。配合 8 小时自主编程能力,这已经不是”AI 辅助”了,是”AI 独立工程师”。DSA 让这在计算上变得可行。
第三个值得说的点是国产芯片适配的战略意义。论文里轻描淡写地说”支持 7 大国产芯片平台”,但这背后的工程量是巨大的。在 GPU 出口管制的大背景下,能在国产硬件上跑通 745B MoE 的训练和推理,这不只是技术突破,是生存能力的保障。如果有一天 NVIDIA 芯片完全断供,GLM 系列还能继续迭代——这个”保险”的价值,可能比任何跑分都大。
第四点是成本优势的碾压性。GLM-5.2 的 API 价格是 GPT-5.5 的六分之一,Claude Opus 4.8 的七分之一,性能还更强。当”更便宜且更好”同时成立时,市场选择是没有任何悬念的。这对闭源模型的商业模式是一个根本性的挑战——你凭什么收 6 倍的钱,性能还不如开源的?
最后一点个人感受:GLM-5 系列让我看到了中国 AI 团队的一种新气质。不是”对标谁谁谁”的跟随者心态,而是”我定义自己的路线”的自信。ARC 框架、DSA、异步 Agent RL、国产芯片适配——这些选择都不是在模仿谁,是在走自己的路。而且走通了。
从 GLM-4.5 到 GLM-5.2,智谱完成了一次完整的质变。如果说 GLM-4.5 证明了”开源可以三合一”,那 GLM-5 系列证明的是”开源可以超越闭源”。这个信号的重量,比任何单一跑分都重。
附:核心数据速查
GLM-5 核心规格
| 指标 | 数值 |
|---|---|
| 总参数 | ~745B |
| 激活参数 | ~44B |
| 上下文 | 200K |
| 预训练语料 | 27T+ tokens |
| 架构 | MoE + DSA(动态稀疏注意力) |
| 优化器 | Muon Split |
| 协议 | MIT |
| 芯片适配 | 7 大国产平台(华为昇腾、寒武纪、摩尔线程等) |
| 推理成本降幅 | ~50% |
GLM-5.1 核心规格(2026.04)
| 指标 | 数值 |
|---|---|
| 总参数 | 744B |
| 激活参数 | 40B |
| 核心突破 | SWE-Bench Pro 全球第一 |
| 标志能力 | 8 小时自主编程 |
GLM-5.2 核心规格(2026.06)
| 指标 | 数值 |
|---|---|
| 总参数 | 753B |
| 激活参数 | 40B |
| 上下文 | 1M token |
| 最大单次生成 | 12.8 万 token |
| 架构创新 | IndexShare(4 层共享索引器,计算量降 2.9x) |
| 推测解码提升 | 接受率 +20% |
| 协议 | MIT |
GLM-5.2 性能
| 基准 | GLM-5.2 | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| FrontierSWE | 74.4% | 72.6% | 75.1% |
| PostTrainBench | 34.3 | 28.4% | - |
| Terminal-Bench 2.1 | 81.0 | - | - |
| SWE-bench Pro | 62.1 | - | - |
| MCP-Atlas | 76.8 | - | - |
| AIME 2026 | 99.2% | - | - |
API 定价对比
| 模型 | 输入($/M token) | 输出($/M token) |
|---|---|---|
| GLM-5.2 | $1.4 | $4.4 |
| GPT-5.5 | ~$8 | ~$24 |
| Claude Opus 4.8 | ~$10 | ~$30 |
GLM-5 Agent RL 设计
| 设计要素 | 内容 |
|---|---|
| 训练模式 | 异步(推理/训练 worker 解耦) |
| 奖励 | 最终正确性 + 过程质量 + 容错恢复 |
| 动作空间 | 思考 token + 工具调用 + 错误反馈 |
| 课程 | 单文件小修 → 多文件 SWE-bench 级 |
| 防遗忘 | 跨阶段蒸馏(锚点数据 + KL 正则) |
| 探索 | 熵奖励 |
关键概念清单
- DSA = Dynamic Sparse Attention(动态稀疏注意力,每 token 只关注 top-K 相关先前 token)
- IndexShare = 多层稀疏注意力共享一个轻量索引器(GLM-5.2 创新)
- Muon Split = GLM-5 使用的优化器(从 Muon 进化)
- 异步 Agent RL = 推理 worker 与训练 worker 解耦的强化学习
- 跨阶段蒸馏 = Cross-stage Distillation(防灾难性遗忘)
- Try-then-Recover = 容错奖励哲学(奖励失败后恢复,而非只奖励一次成功)
- 熵奖励 = Entropy Bonus(保持探索性,防止策略坍缩)
- CC-Bench-V2 = 智谱内部 Agent 编程评测
- FrontierSWE = 前沿软件工程基准(真实复杂项目)
- SWE-bench Pro = 进阶软件工程基准
- Terminal-Bench = 终端操作基准
- MCP-Atlas = 模型上下文协议评测
- PostTrainBench = 后训练效果评测
- 8 小时自主编程 = 模型连续独立工作 8 小时完成复杂工程任务
- MIT 协议 = 最宽松开源协议(商用无限制)
- 国产芯片适配 = 华为昇腾、寒武纪、摩尔线程等 7 大平台支持
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





