mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4472 字
13 分钟
GLM-5:登顶全球第一
2026-07-31

GLM-5 论文解读:从”追赶者”到”全球第一”,智谱用三个版本完成了质变#

论文:GLM-5 Technical Report 作者:智谱AI(Zhipu AI) arXiv: 2602.15763 这篇是 2026 年 2 月的技术报告。745B 总参数、44B 激活的 MoE,200K 上下文,MIT 协议开源。但真正炸裂的不是 GLM-5 本身——而是它后面的两个版本:GLM-5.1 拿下 SWE-Bench Pro 全球第一并实现 8 小时自主编程,GLM-5.2 在 FrontierSWE 上以 74.4% 超越 GPT-5.5 的 72.6%,成本只要六分之一。从”追赶”到”超越”,只用了四个月。


一、背景:GLM-4.5 之后,下一步是什么#

GLM-4.5 已经把”推理+编程+Agent”三合一的框架立起来了,355B/32B 在开源里是第一梯队。但放到 2026 年初的竞争格局里看,问题很清楚:闭源模型在长上下文、Agent 自主性和推理深度上还在拉开差距。

GLM-5 的任务不是”再涨几个点”,是要从架构层面解决三个根本瓶颈

  1. 长上下文的计算成本——200K 以上的窗口,vanilla attention 根本扛不住
  2. Agent 任务的自主性——不是”调一次工具”,是”连续自主工作数小时”
  3. 推理效率——不能为了性能无限堆参数

三个问题,三个答案:DSA(动态稀疏注意力)异步 Agent RL国产芯片全栈适配

二、架构:从 355B 到 745B,但真正的杀招是 DSA#

基本规格#

  • 总参数:~745B(比 GLM-4.5 的 355B 翻倍还多)
  • 激活参数:~44B(只比 32B 多了 12B)
  • 上下文:200K
  • 协议:MIT
  • 预训练语料:27T+ tokens(比 GLM-4.5 的 23T 又多了 4T+)
  • 优化器:Muon Split(从 GLM-4.5 的 Muon 进化)

参数翻倍但激活只多了三分之一——这说明 GLM-5 把”深而不宽”的路线走得更极端了。更多专家、更精细的路由、更少的激活开销。

DSA(Dynamic Sparse Attention,动态稀疏注意力)#

这是 GLM-5 架构上最重要的创新,也是它能把上下文拉到 200K 的关键。

先说问题。传统注意力机制是”全连接”的——每个新 token 都要回头看前面所有 token,计算量是序列长度的平方(O(L²))。当上下文从 4K 拉到 128K,计算量涨了 1000 倍;再拉到 200K,就是 2500 倍。这不是”加几张卡”能解决的问题,是根本性的计算瓶颈。

打个比方:传统注意力像是”每说一句话都要把整本百科全书从头翻到尾”。DSA 的思路是:“你不需要翻整本书,只需要翻最相关的那几页。”

原理:对每个当前 token,不是跟前面所有 token 做注意力(那是 O(L²) 的),而是只挑选最相关的 top-K 个先前 token做注意力。复杂度从 O(L²) 降到 O(LK),K 远小于 L。比如上下文 200K token,但每个 token 只看最相关的 2048 个——计算量直接降了两个数量级。

关键是”动态”二字:不是固定看某个窗口(比如只看最近 4096 个 token),而是根据内容相关性动态选择。写代码时可能需要看 5000 行前的函数定义,写文章时可能需要看开头的论点——DSA 能自动判断该看哪里。

具体实现分两步:

  1. 训练初期用稠密注意力(类似 MLA 的变体)把基础能力打好
  2. 逐步过渡到稀疏注意力——不是一刀切,是渐进式地让模型适应稀疏模式

这个”先稠后稀”的训练策略很聪明。如果一开始就稀疏,模型连基本的注意力分布都学不好——它还不知道什么信息重要,你让它”只看几个 token”,它可能刚好漏掉关键信息。等稠密阶段把能力底座打牢了,再切稀疏,模型已经知道”哪些 token 重要”,稀疏化就不会掉性能。

论文验证了等性能(parity):换成稀疏注意力后,标准 benchmark 成绩基本不掉,长上下文场景反而因为计算更高效可以跑更长的序列。

上下文扩展:从 4K 到 200K#

跟 GLM-4.5 一样是渐进式扩展,但目标从 128K 提升到了 200K。不是一步插值到位,而是分多个阶段逐步提升 RoPE 基频并加入长序列数据。

中期训练:Agent 数据的比重大幅增加#

中期训练(mid-training)加入了大量 Agent 导向的数据:

  • 长多步工具调用轨迹:文件浏览、代码搜索、测试运行
  • 仓库级数据:跨文件链接、commit 历史、issue 修复
  • 长技术文档和多轮对话

这些不是传统的”问答对”,而是完整的 Agent 工作流记录。模型在预训练阶段就开始学习”怎么当一个 Agent”。

三、Agent RL:异步 + 三阶段 + 容错奖励#

异步 Agent 强化学习#

GLM-5 的 Agent RL 跟 GLM-4.5 最大的区别是:完全异步

传统 RL 是同步的——模型生成轨迹、等环境反馈、更新策略,串行执行。问题是 Agent 任务动辄需要几十步工具调用,每步都有环境延迟,同步训练慢得离谱。

GLM-5 的做法:推理 worker 和训练 worker 完全解耦。推理 worker 可以用稍旧一点的策略版本生成轨迹(通过重要性采样修正偏差),训练 worker 持续从轨迹池里取数据更新。两边不等对方,各自跑。

这个设计让 Agent RL 的训练吞吐量大幅提升。

三阶段后训练#

跟 GLM-4.5 类似但更深入:

阶段一:推理 RL

  • 数学竞赛(AIME、MATH)和竞赛编程(Codeforces)
  • 难度课程学习

阶段二:Agent RL

  • 软件工程环境:SWE-bench 和内部 CC-Bench-V2
  • 课程从”单文件小修”到”多文件 SWE-bench 级任务”
  • 奖励设计:
    • 最终正确性:隐藏测试通过与否
    • 过程质量:过程奖励模型(PRM)或规则
    • 容错恢复奖励:模型遇到错误后能合理恢复给小分
  • 动作空间包含”思考 token”——工具调用前先推理
  • 熵奖励保持探索性

阶段三:通用 RL

  • 指令遵循、安全、对话

跨阶段蒸馏:防遗忘#

三阶段训练有个经典问题:后面的阶段会覆盖前面的能力(灾难性遗忘)。

GLM-5 的解法:跨阶段蒸馏(Cross-stage Distillation)。具体做法:

  • 进入新阶段时,用上一阶段的模型生成”锚点数据”
  • 把锚点数据混进新阶段的训练数据里
  • 损失函数加 KL 正则化,或者对冻结的教师快照做蒸馏

同样的方法在”Agent RL → 通用 RL”的过渡中重复使用。

“Try-then-Recover”:不怕犯错,怕的是放弃#

Agent RL 的一个核心设计哲学:奖励”尝试后恢复”而不是”永不犯错”

模型调工具失败了,如果能合理分析错误、调整策略、重试成功,照样拿分。这比”一步到位”的奖励设计更贴近真实 Agent 场景——现实中工具调用失败是常态,关键是能不能从失败中恢复。

四、国产芯片适配:7 大平台全栈支持#

这是 GLM-5 论文里一个非常”中国特色”的部分:全面适配 7 大国产芯片平台,包括华为昇腾、寒武纪、摩尔线程等。

为什么这很重要?因为 2025-2026 年,高端 GPU 出口管制越来越严,国产 AI 公司如果只能在 NVIDIA 上跑模型,就是把自己的命脉交给别人。GLM-5 从训练到推理都做了国产芯片适配,意味着:

  1. 训练不完全依赖 NVIDIA
  2. 推理部署可以在国产硬件上跑
  3. 论文还提到推理成本降了约 50%

这不只是一个技术选择,是一个战略选择。

五、GLM-5.1:SWE-Bench Pro 全球第一,8 小时自主编程#

2026 年 4 月,GLM-5.1 发布。规格:

  • 744B 总参数 / 40B 激活
  • 核心突破:SWE-Bench Pro 全球第一
  • 标志性能力:8 小时自主编程——不是”给你一个问题等 5 分钟出答案”,是”给你一个复杂项目,模型自己规划、搜索、编码、测试、调试,连续工作 8 小时”

8 小时自主编程意味着什么?意味着模型不是在”回答问题”,是在独立完成一个软件工程任务。它需要:

  • 理解整个代码仓库的结构
  • 制定多步计划
  • 在执行中不断修正
  • 遇到 bug 自己诊断和修复
  • 最终交付可工作的代码

这已经不是”辅助编程”了,是自主编程

六、GLM-5.2:FrontierSWE 超越 GPT-5.5,成本六分之一#

2026 年 6 月,GLM-5.2 发布。这是真正”炸场”的一个版本。

规格#

  • 总参数:753B
  • 激活参数:40B
  • 上下文:1M token(从 200K 直接拉到百万)
  • 最大单次生成:12.8 万 token
  • 协议:MIT
  • 架构创新:IndexShare——4 层稀疏注意力共享一个轻量级索引器,单 token 计算量降 2.9 倍,推测解码接受率提升 20%

核心成绩#

基准GLM-5.2GPT-5.5备注
FrontierSWE74.4%72.6%超越
PostTrainBench34.328.4
Terminal-Bench 2.181.0
SWE-bench Pro62.1
MCP-Atlas76.8
AIME 202699.2接近满分

FrontierSWE 74.4% 超越 GPT-5.5 的 72.6%——这是开源模型第一次在顶级软件工程基准上正面击败闭源旗舰。

这个”第一次”的重量需要强调一下。FrontierSWE 不是那种”给个函数写个实现”的简单编程题,它是真实世界的复杂软件工程任务——大型代码仓库、多文件修改、需要理解项目架构、跑测试、处理边界情况。在这上面超越 GPT-5.5,意味着开源模型在”最接近真实软件开发”的场景里已经不比闭源差了。

而且注意,Claude Opus 4.8 是 75.1%,GLM-5.2 是 74.4%——差距只有 0.7 个百分点。考虑到 GLM-5.2 是开源的、可以本地部署的、可以免费微调的,这个 0.7% 的差距在实际应用中完全可以忽略。

成本:六分之一#

API 定价:输入 $1.4/百万 token,输出 $4.4/百万 token

对比:

  • GPT-5.5:约 $8/$24
  • Claude Opus 4.8:约 $10/$30

GLM-5.2 的成本是闭源旗舰的 1/4 到 1/6。性能更强,价格更低,还开源。这个组合拳太狠了。

生态支持#

支持 transformers、vLLM、SGLang、xLLM、ktransformers、Ollama 等主流框架。集成 Claude Code、OpenCode、Cline、ZCode 等 Agent 工具。

推理努力等级分 High 和 Max 两档——简单任务用 High 省算力,极难任务用 Max 全力输出。

七、从 GLM-5 到 GLM-5.2:四个月的质变#

把三个版本放在一起看:

GLM-5(2026.02)GLM-5.1(2026.04)GLM-5.2(2026.06)
总参数~745B744B753B
激活~44B40B40B
上下文200K-1M
核心突破DSA + 异步 Agent RLSWE-Bench Pro 第一FrontierSWE 超 GPT-5.5
定位追赶并跑超越

从 2 月到 6 月,四个月时间,从”追赶闭源”到”正面无视闭源”。这个速度在 AI 领域是罕见的。

收尾:我的一点看法#

GLM-5 系列让我想到一个词:后发制人

2025 年中 GLM-4.5 发布的时候,智谱在开源圈已经很强了,但跟顶级闭源(GPT-5 系列、Claude 4 系列)还有明显差距。当时的叙事是”开源追赶闭源”。但到了 2026 年 6 月 GLM-5.2 发布,叙事变了——不再是”追赶”,而是”在特定维度上超越”。FrontierSWE 74.4% vs GPT-5.5 的 72.6%,这不是”接近”,是”超过”。

第二个让我深思的点是DSA 的战略价值。GLM-5 把上下文从 128K 拉到 200K,GLM-5.2 直接拉到 1M——这不是简单的”数字变大”。在 Agent 场景里,1M 上下文意味着模型可以把一整个大型代码仓库装进脑子里。配合 8 小时自主编程能力,这已经不是”AI 辅助”了,是”AI 独立工程师”。DSA 让这在计算上变得可行。

第三个值得说的点是国产芯片适配的战略意义。论文里轻描淡写地说”支持 7 大国产芯片平台”,但这背后的工程量是巨大的。在 GPU 出口管制的大背景下,能在国产硬件上跑通 745B MoE 的训练和推理,这不只是技术突破,是生存能力的保障。如果有一天 NVIDIA 芯片完全断供,GLM 系列还能继续迭代——这个”保险”的价值,可能比任何跑分都大。

第四点是成本优势的碾压性。GLM-5.2 的 API 价格是 GPT-5.5 的六分之一,Claude Opus 4.8 的七分之一,性能还更强。当”更便宜且更好”同时成立时,市场选择是没有任何悬念的。这对闭源模型的商业模式是一个根本性的挑战——你凭什么收 6 倍的钱,性能还不如开源的?

最后一点个人感受:GLM-5 系列让我看到了中国 AI 团队的一种新气质。不是”对标谁谁谁”的跟随者心态,而是”我定义自己的路线”的自信。ARC 框架、DSA、异步 Agent RL、国产芯片适配——这些选择都不是在模仿谁,是在走自己的路。而且走通了。

从 GLM-4.5 到 GLM-5.2,智谱完成了一次完整的质变。如果说 GLM-4.5 证明了”开源可以三合一”,那 GLM-5 系列证明的是”开源可以超越闭源”。这个信号的重量,比任何单一跑分都重。


附:核心数据速查#

GLM-5 核心规格

指标数值
总参数~745B
激活参数~44B
上下文200K
预训练语料27T+ tokens
架构MoE + DSA(动态稀疏注意力)
优化器Muon Split
协议MIT
芯片适配7 大国产平台(华为昇腾、寒武纪、摩尔线程等)
推理成本降幅~50%

GLM-5.1 核心规格(2026.04)

指标数值
总参数744B
激活参数40B
核心突破SWE-Bench Pro 全球第一
标志能力8 小时自主编程

GLM-5.2 核心规格(2026.06)

指标数值
总参数753B
激活参数40B
上下文1M token
最大单次生成12.8 万 token
架构创新IndexShare(4 层共享索引器,计算量降 2.9x)
推测解码提升接受率 +20%
协议MIT

GLM-5.2 性能

基准GLM-5.2GPT-5.5Claude Opus 4.8
FrontierSWE74.4%72.6%75.1%
PostTrainBench34.328.4%-
Terminal-Bench 2.181.0--
SWE-bench Pro62.1--
MCP-Atlas76.8--
AIME 202699.2%--

API 定价对比

模型输入($/M token)输出($/M token)
GLM-5.2$1.4$4.4
GPT-5.5~$8~$24
Claude Opus 4.8~$10~$30

GLM-5 Agent RL 设计

设计要素内容
训练模式异步(推理/训练 worker 解耦)
奖励最终正确性 + 过程质量 + 容错恢复
动作空间思考 token + 工具调用 + 错误反馈
课程单文件小修 → 多文件 SWE-bench 级
防遗忘跨阶段蒸馏(锚点数据 + KL 正则)
探索熵奖励

关键概念清单

  • DSA = Dynamic Sparse Attention(动态稀疏注意力,每 token 只关注 top-K 相关先前 token)
  • IndexShare = 多层稀疏注意力共享一个轻量索引器(GLM-5.2 创新)
  • Muon Split = GLM-5 使用的优化器(从 Muon 进化)
  • 异步 Agent RL = 推理 worker 与训练 worker 解耦的强化学习
  • 跨阶段蒸馏 = Cross-stage Distillation(防灾难性遗忘)
  • Try-then-Recover = 容错奖励哲学(奖励失败后恢复,而非只奖励一次成功)
  • 熵奖励 = Entropy Bonus(保持探索性,防止策略坍缩)
  • CC-Bench-V2 = 智谱内部 Agent 编程评测
  • FrontierSWE = 前沿软件工程基准(真实复杂项目)
  • SWE-bench Pro = 进阶软件工程基准
  • Terminal-Bench = 终端操作基准
  • MCP-Atlas = 模型上下文协议评测
  • PostTrainBench = 后训练效果评测
  • 8 小时自主编程 = 模型连续独立工作 8 小时完成复杂工程任务
  • MIT 协议 = 最宽松开源协议(商用无限制)
  • 国产芯片适配 = 华为昇腾、寒武纪、摩尔线程等 7 大平台支持
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

GLM-5:登顶全球第一
https://mizuki-eaf.pages.dev/posts/glm/glm-5登顶全球第一/
作者
无名之子
发布于
2026-07-31
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录