ChatGLM 技术报告解读:从6B小模型到逼近GPT-4,中国最成功的开源大模型系列是怎么一步步走来的
论文:ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 作者:THUDM(清华大学知识工程实验室 / 智谱AI) arXiv: 2406.12793 这是智谱在2024年6月发布的一份”全家桶”技术报告,把 ChatGLM 系列从第一代到第四代的完整演进讲了一遍。从2023年3月 ChatGLM-6B 横空出世,到2024年 GLM-4 逼近 GPT-4,中间经历了三次重大架构升级和对齐策略迭代。如果你想理解中国开源大模型是怎么从零开始追赶的,这份报告就是最好的教材。不需要前置知识,但如果你读过 GLM-130B 的论文会更亲切。
一、先说背景:ChatGLM 系列为什么重要
2023年初,ChatGPT 刚火起来那会儿,中国 AI 圈集体焦虑——我们有没有自己的对话模型?能不能开源?能不能让普通开发者在自己电脑上跑起来?
ChatGLM-6B 是第一个正面回答这三个问题的国产模型。2023年3月14日开源,6GB 显存就能跑,Apache 2.0 协议随便商用。它不是最强的,但它是第一个让国内开发者真正”用得上”的对话大模型。
从那天起,ChatGLM 系列就成了中国开源大模型的标杆。一年后 HuggingFace 下载量破千万,无数公司的第一个 AI 应用都是基于 ChatGLM 搭的。这份技术报告就是对这个系列的完整复盘。
二、GLM-130B:一切的起点
故事要从 GLM-130B 说起。
GLM-130B 是智谱在2022年训练的百亿级基础模型,参数量超过 100B,用的是 GLM(General Language Model) 架构——一种结合了自回归和自编码的统一预训练框架。简单说,它既能像 GPT 一样从左到右生成文本,也能像 BERT 一样做填空。
训练数据:4000亿 tokens。
性能:在 HELM 基准上接近 GPT-3 水平。
但 GLM-130B 有个致命问题:太大了,普通用户根本跑不动。所以它虽然学术上很成功,但实际影响力有限。智谱需要一个更轻量的方案——这就是 ChatGLM-6B 诞生的直接原因。
三、ChatGLM-6B:小身板,大能量
基本规格
ChatGLM-6B 在2023年3月14日开源,核心参数:
- 参数量:6.2B
- 层数:28层
- 隐藏层维度:4,096
- 注意力头数:32(头维度 128)
- FFN 中间维度:16,384
- 词表大小:130,528
- 位置编码:绝对位置嵌入
- 归一化:LayerNorm
- 激活函数:GELU
- 训练数据:~1T tokens(中英双语)
- 上下文长度:2,048 tokens
为什么是6B?
因为这是消费级显卡的甜区。FP16 需要约 14.6GB 显存,INT4 量化后只需要 6GB。这意味着一张 RTX 3060 就能跑起来,甚至 MacBook 也能勉强推理。
智谱的策略很明确:不追求最强,追求最普及。事实证明这个策略极其成功——ChatGLM-6B 迅速成为国内部署量最大的开源对话模型。
对齐方式
ChatGLM-6B 的对齐比较简单,主要是 SFT(Supervised Fine-Tuning,监督微调),配合少量 RLHF。数据以中英双语对话为主。
局限性也很明显:2K 上下文太短,稍微长点的对话就丢了前文;推理能力弱;多轮对话容易跑偏。但作为第一代产品,这些都可以接受。
四、ChatGLM2-6B:架构三连跳
ChatGLM2-6B 是2023年6月发布的第二代,改动之大堪称”脱胎换骨”。
三大架构升级
第一,MQA(Multi-Query Attention,多查询注意力)。
原版 ChatGLM 用的是标准 MHA——32个 Query 头配32个 Key/Value 头。ChatGLM2 改成 32个 Query 头共享 1个 Key/Value 头。
这意味着什么?推理时 KV Cache 的显存占用直接降到 1/32。对于长序列推理来说,这是质的飞跃。实测推理速度提升 42%。
第二,FlashAttention。
用 FlashAttention 替换了标准注意力实现,减少显存读写次数,训练和推理都更快。
第三,纯 RoPE 位置编码。
从 ChatGLM 的绝对位置嵌入切换到 RoPE(Rotary Position Embedding,旋转位置编码)。RoPE 的好处是天然支持长度外推——训练时只见过短序列,推理时可以扩展到更长。
训练数据和效果
- 训练数据:1.4T tokens(比第一代的1T多了40%)
- 上下文长度:从 2K 扩展到 32K
- MMLU 提升 +23%
- GSM8K 提升 +571%(数学推理质的飞跃)
- BBH 提升 +60%
GSM8K 提升 571% 这个数字太夸张了。从”基本不会做数学题”到”能做小学数学题”,这就是架构升级+数据扩充的威力。
为什么这次升级这么成功?
我的理解是:ChatGLM2 的核心思路是”用更高效的架构吃更多数据”。MQA 让推理更高效,RoPE 让上下文更长,FlashAttention 让训练更快——三者叠加,同样的参数量能干更多事。
五、ChatGLM3-6B:从”会说话”到”会干活”
ChatGLM3-6B 是2023年10月发布的第三代。如果说 ChatGLM2 是”更好地说话”,ChatGLM3 就是”学会干活”。
架构微调
- 归一化:从 LayerNorm 换成 RMSNorm(更稳定、更快)
- 词表:扩展到 65K(更好地覆盖多语言和代码token)
- 其他架构基本沿用 ChatGLM2
核心能力:Function Call + Code Interpreter + Agent
这是 ChatGLM3 最大的突破。它原生支持:
- Function Call(函数调用):模型能识别什么时候该调用外部工具,生成结构化的调用请求。
- Code Interpreter(代码解释器):模型可以写代码、执行代码、根据执行结果继续推理。
- Agent 任务:多步规划、工具组合使用。
这三件事的组合意味着 ChatGLM3 不再只是一个”问答机器”,而是一个能实际执行任务的智能体。它发布时在 42 个基准上领先同量级模型,覆盖语义理解、数学、推理、代码和知识。
对齐进化
ChatGLM3 的对齐策略明显更成熟了。不再只做简单的 SFT,而是引入了更精细的 RLHF 流程,包括奖励模型训练和 PPO 优化。
六、GLM-4:闭源旗舰,正面对标GPT-4
GLM-4 是2024年1月发布的闭源旗舰模型,也是这个系列的”天花板”。
训练规模
- 预训练数据:~10T tokens(万亿级别)
- 语言覆盖:以中英文为主,辅以 24种其他语言
- 数据处理流程:去重、过滤、分词、书籍/维基百科重加权
架构大改
GLM-4 的架构跟 ChatGLM3 相比有显著变化:
- 归一化:RMSNorm
- 激活函数:SwiGLU(替代GELU)
- 位置编码:2D RoPE
- 注意力:从 MHA/MQA 换成 GQA(Grouped-Query Attention)
- FFN 大小:隐藏层维度的 10/3 倍
- 去掉了除 QKV 以外的所有 bias
- 词表:150,000(byte-level BPE + tiktoken cl100k_base 合并)
这些改动基本对齐了 LLaMA 系列的最佳实践。说明智谱在架构设计上已经跟上了全球最新趋势。
上下文和工具
- 上下文长度:128K
- All Tools 模式:模型可以自主选择并使用以下工具:
- Web 浏览器
- Python 解释器
- 文生图模型
- 用户自定义函数
- 外部知识库
这个 All Tools 设计非常前瞻。模型不是被动地等用户指定工具,而是自己判断什么时候需要什么工具。这是 Agent 能力的终极形态。
性能对标
GLM-4 在以下基准上与 GPT-4 0613 和 Gemini 1.5 Pro 相当:
- MMLU:83.3(GPT-4 约 86.4)
- GSM8K、MATH、BBH、GPQA、HumanEval:接近或持平
- IFEval(指令遵循):接近 GPT-4-Turbo
- LongBench-Chat(长上下文):87.3 vs GPT-4-Turbo 87.2 vs Claude 3 87.7
- AlignBench(中文对齐):优于 GPT-4
在中文对齐这个维度上超过 GPT-4,这是 GLM-4 最亮眼的成就。毕竟中文场景的对齐,中国团队天然有优势。
七、GLM-4-9B:开源精神的延续
虽然 GLM-4 本体闭源,但智谱同时开源了 GLM-4-9B:
- 参数量:9B
- 层数:40层(比 ChatGLM3 的28层多了12层)
- 词表:151,552
- 上下文:128K(还有 1M 版本)
- 预训练长度:8K,通过 RoPE 外推扩展
- 性能:超越 Llama-3-8B
- 支持 All Tools
这个策略很聪明:旗舰闭源赚钱,开源版吸引社区。两条腿走路。
八、对齐技术演进:从SFT到DPO
纵观四代模型的对齐策略:
| 版本 | 对齐方法 |
|---|---|
| ChatGLM-6B | SFT + 简单 RLHF |
| ChatGLM2-6B | SFT + 反馈引导 |
| ChatGLM3-6B | SFT + 精细 RLHF |
| GLM-4 | SFT + RLHF(PPO/DPO) |
从简单到复杂,从粗糙到精细。GLM-4 阶段的对齐已经涵盖了安全性、拒绝能力、中英混合、多轮连贯性等多个维度。人类评估员从安全性、事实性、相关性、有用性和偏好五个维度打分。
这个演进过程跟全球趋势一致:大家都在从”能用就行”走向”精细打磨”。
收尾:我的一点看法
第一,ChatGLM 系列最大的贡献不是技术,是生态。 回看这四代模型,每一代的技术都不是全球最强——ChatGLM-6B 打不过 GPT-3.5,ChatGLM2 打不过 LLaMA-2,GLM-4 也只是”接近”GPT-4。但它做对了一件事:始终降低使用门槛。6GB 显存就能跑、Apache 2.0 随便商用、文档齐全、社区活跃。这让它成为中国开发者的”默认选择”,而生态一旦建立起来,技术差距是可以追的。
第二,架构演进体现了”务实主义”。 从绝对位置嵌入到 RoPE,从 MHA 到 MQA 再到 GQA,从 LayerNorm 到 RMSNorm——每一步都不是原创,而是”看到别人验证有效,迅速吸收”。这不丢人。在快速迭代的大模型时代,能跟上最佳实践本身就是竞争力。
第三,All Tools 是被低估的创新。 2024年初就把”模型自主选择工具”做到产品级,这比很多后来的 Agent 框架都要早。GLM-4 的 All Tools 不是简单的 function calling,而是让模型自己规划任务、选择工具、执行并反思。这个理念后来被整个行业追认。
第四,这份报告本身就是一种态度。 把四代模型的完整演进公之于众,包括失败的尝试和不完美的结果,这需要自信。它告诉社区:我们不是靠一个版本吃老本,而是一直在迭代。这种透明度在闭源旗舰模型越来越不透明的时代,尤为珍贵。
总的来说,ChatGLM 系列的故事就是中国 AI 产业的一个缩影:起步晚、资源少、但跑得快。从2023年3月到2024年6月,15个月时间,从”勉强能用”到”逼近GPT-4”。这个速度本身就是最好的论证。
附:核心数据速查
| 项目 | ChatGLM-6B | ChatGLM2-6B | ChatGLM3-6B | GLM-4 |
|---|---|---|---|---|
| 参数量 | 6.2B | 6.2B | 6.2B | 未公开 |
| 层数 | 28 | 28 | 28 | 未公开 |
| 隐藏维度 | 4,096 | 4,096 | 4,096 | 未公开 |
| 训练数据 | ~1T tokens | 1.4T tokens | 更多 | ~10T tokens |
| 上下文 | 2K | 32K | 32K | 128K |
| 位置编码 | 绝对 | RoPE | RoPE | 2D RoPE |
| 注意力 | MHA | MQA | MQA | GQA |
| 归一化 | LayerNorm | LayerNorm | RMSNorm | RMSNorm |
| 词表 | 130,528 | ~65K | ~65K | 150,000 |
| INT4显存 | 6GB | ~6GB | ~6GB | N/A |
| 特色能力 | 基础对话 | 长上下文 | Function Call | All Tools |
关键概念清单
| 术语 | 解释 |
|---|---|
| GLM | General Language Model,智谱的统一预训练框架,结合自回归和自编码 |
| MQA | Multi-Query Attention,多个Query头共享一组Key/Value,减少KV Cache |
| GQA | Grouped-Query Attention,MQA和MHA的折中方案,若干Query头共享一组KV |
| RoPE | Rotary Position Embedding,旋转位置编码,支持长度外推 |
| RMSNorm | Root Mean Square Normalization,比LayerNorm更快更稳定 |
| SwiGLU | 一种门控激活函数,结合了Swish和GLU的优点 |
| FlashAttention | IO-aware 注意力实现,减少显存读写,加速训练推理 |
| SFT | Supervised Fine-Tuning,监督微调 |
| RLHF | Reinforcement Learning from Human Feedback,基于人类反馈的强化学习 |
| DPO | Direct Preference Optimization,直接偏好优化,RLHF的简化替代 |
| All Tools | GLM-4的工具自主选择模式,模型自行决定调用何种工具 |
| Function Call | 模型识别并生成结构化外部工具调用指令的能力 |
| Code Interpreter | 模型编写并执行代码、根据结果继续推理的能力 |
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





