Qwen3 论文解读:一个模型两种思考,这才是推理模型该有的样子
论文:Qwen3 Technical Report 作者:An Yang, Anfeng Li, Baosong Yang 等 60+ 人(Qwen Team, Alibaba Group) 发布:2025年5月14日,arXiv<2505>2505>.09388,Apache 2.0 开源
这是 Qwen 系列迄今为止最重要的一篇技术报告。不是因为它堆了多少参数,而是它第一次把”深度思考”和”快速应答”塞进了同一个模型里,用一套统一的架构解决了推理模型和对话模型的割裂问题。36T token 的训练数据、119 种语言、8 个模型从 0.6B 到 235B 全覆盖——这不是一次常规迭代,这是一次范式级的跃迁。
一、先说结论:Qwen3 到底做了什么
1. 一个模型,两种模式
Qwen3 最核心的创新是 Built-in Thinking Mode(内建思考模式)。一个模型同时具备两种工作方式:
- 思考模式(Thinking Mode):遇到数学、代码、逻辑推理这类硬问题,模型会先生成一段完整的思维链(Chain-of-Thought),再给出最终答案。类似 DeepSeek-R1 的推理方式。
- 非思考模式(Non-thinking Mode):日常对话、创意写作、简单问答,模型直接输出,不浪费推理 token。
关键在于:这不是两个模型,是同一个模型。用户通过 /think 和 /no_think 标记切换,或者在 system message 里设定。多轮对话中,模型跟随最后一次出现的标记。
这意味着什么?意味着你不再需要部署一个 Qwen2.5-72B-Instruct 处理日常对话、再部署一个 QwQ-32B 处理推理任务。一个 Qwen3 全搞定。
2. 代际跃迁的数字证据
直接上对比:
- Qwen3-235B-A22B(MoE,激活 22B)在 15 个 base benchmark 中的 14 个击败 DeepSeek-V3(671B/37B),总参数只有对方的 1/3,激活参数只有 2/3。
- Qwen3-32B(Dense)在 15 个 benchmark 中的 10 个击败 Qwen2.5-72B,参数量不到一半。
- Qwen3-4B 在多数 benchmark 上追平甚至超越 Qwen2.5-7B。
- Qwen3-8B 在 STEM 和代码任务上全面超越 Qwen2.5-14B。
一句话总结:4B 打 7B,32B 打 72B,235B 打 671B。 每一代都在用更少的参数做更多的事。
二、模型规格:Dense + MoE 双轨并行
1. 六个 Dense 模型
| 模型 | 参数量 | 层数 | Q Heads | KV Heads | 上下文 |
|---|---|---|---|---|---|
| Qwen3-0.6B | 0.6B | 28 | 16 | 8 | 32K |
| Qwen3-1.7B | 1.7B | 28 | 16 | 8 | 32K |
| Qwen3-4B | 4B | 36 | 32 | 8 | 128K |
| Qwen3-8B | 8B | 36 | 32 | 8 | 128K |
| Qwen3-14B | 14B | 40 | 40 | 8 | 128K |
| Qwen3-32B | 32B | 64 | 64 | 8 | 128K |
所有 Dense 模型统一使用 GQA(Grouped Query Attention)、SwiGLU 激活函数、RoPE 位置编码、RMSNorm 前置归一化。0.6B 到 4B 使用 Tied Embedding(输入输出共享词表),8B 及以上取消。
2. 两个 MoE 模型
| 模型 | 总参数/激活参数 | 层数 | Q Heads | KV Heads | 专家总数/激活数 | 上下文 |
|---|---|---|---|---|---|---|
| Qwen3-30B-A3B | 30B/3B | 48 | 32 | 4 | 128/8 | 128K |
| Qwen3-235B-A22B | 235B/22B | 94 | 64 | 4 | 128/8 | 128K |
注意 KV Heads 从 Dense 的 8 降到了 4——MoE 模型在注意力层更激进地压缩 KV cache,毕竟专家层已经提供了足够的表达能力。
3. 词表
Tokenizer 采用 byte-level BPE,词表大小 151,669。跟 Qwen2.5 一脉相承,但多语言覆盖从 29 种语言扩展到 119 种,词表利用率显著提升。
三、架构创新:QK-Norm 与 MoE 简化
1. 用 QK-Norm 替代 QKV-bias
Qwen2.5 及之前的模型在注意力层使用 QKV-bias(对 Q、K、V 投影加偏置项)。Qwen3 做了一个看起来很小但影响深远的改动:
- 去掉 QKV-bias
- 加入 QK-Norm(对 Q 和 K 做 RMSNorm 归一化)
为什么这么做?因为随着模型规模增大,Q 和 K 的点积值会越来越大,导致 softmax 进入饱和区,梯度消失。QKV-bias 本质上是在缓解这个问题,但治标不治本。QK-Norm 直接对 Q、K 向量做归一化,从根源上控制了注意力分数的尺度,训练稳定性显著提升。
这不是 Qwen 首创的概念(Gemma 系列也用了类似思路),但 Qwen3 是在 235B 参数规模上验证了它的有效性。
2. MoE 设计:砍掉 Shared Experts
Qwen2.5-MoE(也就是 Qwen2.5-Turbo/Plus 的底座)使用了 Shared Experts(共享专家)——每个 MoE 层除了路由专家外,还有几个所有 token 都会经过的固定专家。
Qwen3 直接把 Shared Experts 砍了。
取而代之的是:
- 细粒度专家分割(Fine-grained Expert Segmentation):128 个专家,每次激活 8 个
- 全局批次负载均衡损失(Global-batch Load Balancing Loss):不是在一个 micro-batch 内做均衡,而是在整个 global batch 层面计算负载损失,促进专家特化
效果呢?Qwen3-30B-A3B 只激活 3B 参数,就能打平 Qwen3-14B(14B 全激活)和 Qwen2.5-32B。用 1/5 的激活参数达到同等性能,推理成本直接砍到原来的 1/5。
跟 LLaMA-4 对比更有意思:Llama-4-Scout 是 109B/17B 的 MoE,Qwen3-30B-A3B 是 30B/3B。总参数只有对方的 1/4,激活参数只有 1/6,但 15 个 benchmark 全胜。
四、36T 数据工程:真正的护城河
1. 规模与覆盖
- 总训练数据:36 万亿 token(Qwen2.5 是 18T,翻了一倍)
- 语言覆盖:119 种语言和方言(Qwen2.5 是 29 种,翻了四倍)
- 领域覆盖:代码、STEM、推理、书籍、多语言文本、合成数据
2. 数据获取的新手段
两个值得注意的操作:
PDF 文本提取:用 Qwen2.5-VL(视觉语言模型)对海量 PDF 文档做文本识别,再用 Qwen2.5 对识别结果做润色和纠错。这一套流程额外产出了数万亿 token 的高质量文本。
合成数据生成:用 Qwen2.5、Qwen2.5-Math、Qwen2.5-Coder 这些领域专精模型生成合成数据,包括教材、问答对、指令数据、代码片段。同样是数万亿 token 级别。
3. 数据标注与配比
团队构建了一套多语言标注系统,对超过 30 万亿 token 进行了教育质量、领域、主题、安全性标注。
数据配比不是简单的”代码占 20%、数学占 15%“这种粗粒度操作,而是做到了实例级别(Instance-level) 的优化——用细粒度标签配合小模型消融实验,逐条数据决定去留和权重。
4. 三阶段预训练
| 阶段 | 数据量 | 序列长度 | 重点 |
|---|---|---|---|
| 通用阶段 | >30T | 4,096 | 通用语言知识,119 种语言 |
| 推理阶段 | ~5T | 4,096 | STEM、代码、推理、合成数据,LR 加速衰减 |
| 长上下文阶段 | 数千亿 | 32,768 | 长文本能力 |
长上下文阶段的数据配比:75% 是 16K-32K token 的长文本,25% 是 4K-16K 的中等文本。
上下文扩展用了 ABF(Adjusted Base Frequency)把 RoPE 基频从 10,000 拉到 1,000,000,再配合 YARN 和 Dual Chunk Attention 实现推理时 4 倍序列长度扩展。所以训练是 32K,推理可以到 128K。
五、后训练:四阶段流水线与 GRPO
1. 旗舰模型的四阶段后训练
这是整篇论文最精华的部分。Qwen3 的后训练不是简单的”SFT + RLHF”,而是一套精心设计的四阶段流水线:
第一阶段:Long-CoT 冷启动(Cold Start)
- 数据:数学、代码、逻辑推理、STEM,所有样本都有可验证的答案或测试用例
- 查询过滤:用 Qwen2.5-72B-Instruct 剔除不可验证的、多子问题的、不需要 CoT 的查询
- 响应生成:用 QwQ-32B 生成候选回答,QwQ 失败的案例由人工标注员补全
- 响应过滤:剔除错误答案、重复内容、猜测性回答、思考与总结不一致的样本、语言混杂、可能泄露验证集的样本
- 训练策略:只用一小部分数据、限制训练步数,避免过度约束后续 RL 的探索空间
第二阶段:推理强化学习(Reasoning RL)
- 算法:GRPO(Group Relative Policy Optimization)
- 数据:精选 3,995 个查询-验证器对
- 选择标准:冷启动未使用、可学习、有难度、子领域覆盖广
- 关键设置:大 batch、每个 query 多次 rollout、off-policy 训练
- 熵控制:保持熵稳定或缓慢上升,防止策略坍缩
- 效果:Qwen3-235B-A22B 的 AIME’24 从 70.1 提升到 85.1,仅用 170 步 RL 训练
170 步。这个数字说明冷启动阶段的数据质量极高,RL 只需要做精细调优。
第三阶段:思考模式融合 SFT(Thinking Mode Fusion)
- 在 RL 模型基础上做继续 SFT
- 混合”思考模式”和”非思考模式”数据
- 思考数据:用第二阶段模型对第一阶段查询做 rejection sampling
- 非思考数据:代码、数学、指令跟随、多语言、创意写作、问答、角色扮演
- 质量控制:自动化 checklist 检查;低资源语言增加翻译数据
这一步是 Built-in Thinking 的实现关键——通过混合训练,让模型学会在两种模式间切换。
第四阶段:通用领域 RL(General-domain RL)
- 进一步提升广泛下游任务的表现
- 论文未展开细节
2. 跟 DeepSeek-R1 的路线对比
| 维度 | DeepSeek-R1 | Qwen3 |
|---|---|---|
| 推理能力来源 | 独立的推理模型,纯 RL 驱动 | 内建于统一模型,冷启动+RL+融合SFT |
| 日常对话 | 需要另一个模型(DeepSeek-V3) | 同一模型的非思考模式 |
| 部署成本 | 两套系统 | 一套系统 |
| RL 算法 | GRPO | GRPO(一致) |
| 思考控制 | 无(始终思考) | /think、/no_think、thinking budget |
| 推理-延迟权衡 | 无法调节 | thinking budget 可动态调节 |
DeepSeek-R1 证明了”纯 RL 可以涌现推理能力”,Qwen3 则证明了”推理能力可以内建于通用模型,且可以按需开关”。后者在工程落地上意义更大。
3. Thinking Budget:推理的油门
Qwen3 引入了 Thinking Budget(思考预算)机制:
- 用户可以设定思考 token 的上限
- 当思考长度触及阈值,系统中断思考,插入提示”Considering the limited time by the user”,模型基于已有部分推理直接作答
- 这种”部分推理后作答”的能力不是专门训练的,而是从模式融合中自然涌现的
- 实验表明:增大 thinking budget 会持续提升任务表现
这个设计非常优雅。它把推理深度变成了一个连续可调的旋钮,而不是 0/1 开关。在延迟敏感的场景(比如实时对话)可以限制预算,在精度敏感的场景(比如数学竞赛)可以放开。
六、Strong-to-Weak 蒸馏:小模型的捷径
1. 机制
小模型(0.6B、1.7B、4B 等)不走完整的四阶段后训练流水线,而是用 Strong-to-Weak Distillation(强到弱蒸馏):
- 从大模型(旗舰级)直接蒸馏输出 logits
- 包含 off-policy 和 on-policy 两种知识迁移
- 小模型获得大模型的推理分布,而不仅仅是硬标签
2. 效果
对比跑完整四阶段流水线:
- Pass@1 更高(单次正确率更好)
- Pass@64 更高(探索能力更强)
- GPU 耗时仅为 1/10
这个结论很重要:对于小模型,蒸馏比从头做 RL 更高效。大模型负责探索和思考,小模型负责继承和压缩。这解释了为什么 Qwen3-4B 能打出远超其参数量的表现——它继承的是 235B 旗舰模型的推理能力。
七、Benchmark 全景:数字说话
1. 旗舰对决(Base 模型)
Qwen3-235B-A22B vs DeepSeek-V3(671B/37B):
| Benchmark | DeepSeek-V3 | Qwen3-235B-A22B | 差值 |
|---|---|---|---|
| MMLU | 87.19 | 87.81 | +0.62 |
| MMLU-Pro | 59.84 | 68.18 | +8.34 |
| SuperGPQA | 41.53 | 44.06 | +2.53 |
| BBH | 86.22 | 88.87 | +2.65 |
| GPQA | 41.92 | 47.47 | +5.55 |
| GSM8K | 87.57 | 94.39 | +6.82 |
| MATH | 62.62 | 71.84 | +9.22 |
| EvalPlus | 63.75 | 77.60 | +13.85 |
| MultiPL-E | 62.26 | 65.94 | +3.68 |
| CRUX-O | 76.60 | 79.00 | +2.40 |
15 个 benchmark 赢了 14 个。MMLU-Pro 赢了 8.34 分,EvalPlus 赢了 13.85 分——这不是噪声,这是代差。
2. 中量级对决
Qwen3-32B vs Qwen2.5-72B:
| Benchmark | Qwen2.5-72B | Qwen3-32B | 胜负 |
|---|---|---|---|
| MMLU-Pro | 58.07 | 65.54 | 32B 胜 |
| SuperGPQA | 36.20 | 39.78 | 32B 胜 |
| BBH | 86.30 | 87.38 | 32B 胜 |
| GPQA | 45.88 | 49.49 | 32B 胜 |
| EvalPlus | 65.93 | 72.05 | 32B 胜 |
| MultiPL-E | 58.70 | 67.06 | 32B 胜 |
| MATH | 62.12 | 61.62 | 72B 微胜 |
32B 打 72B,15 个里赢了 10 个。参数效率提升了一倍不止。
3. 小模型的逆袭
Qwen3-4B vs Qwen2.5-7B:
| Benchmark | Qwen2.5-7B | Qwen3-4B |
|---|---|---|
| MMLU-Pro | 45.00 | 50.58 |
| BBH | 70.40 | 72.59 |
| GSM8K | 85.36 | 87.79 |
| MATH | 49.80 | 54.10 |
| EvalPlus | 62.18 | 63.53 |
| MultiPL-E | 50.73 | 53.13 |
4B 参数打 7B,在推理和代码任务上全面领先。这就是蒸馏的威力。
4. 后训练旗舰成绩
| Benchmark | Qwen3-235B-A22B |
|---|---|
| AIME’24 | 85.7 |
| AIME’25 | 81.5 |
| LiveCodeBench v5 | 70.7 |
| CodeForces Rating | 2,056 |
| BFCL v3(Agent) | 70.8 |
论文声称与 o1、o3-mini、DeepSeek-V3 后训练版本具有竞争力。CodeForces 2056 分意味着接近 Candidate Master 水平。
八、工程哲学:Qwen3 的设计取舍
1. 统一优于分裂
DeepSeek 的路线是”V3 做通用,R1 做推理”,两个模型两套部署。Qwen3 的路线是”一个模型全做”,通过模式切换适配不同场景。
从研究角度,DeepSeek-R1 更有开创性(证明了纯 RL 涌现推理)。但从产品角度,Qwen3 的统一方案更实用——API 提供商不需要维护两套推理服务,用户不需要在两个 endpoint 之间做路由。
2. 效率优于蛮力
整个 Qwen3 系列的设计哲学是”用更少的计算做更多的事”:
- MoE 砍掉 shared experts,减少无效计算
- 小模型用蒸馏而非完整 RL,GPU 耗时降 10 倍
- Thinking budget 让推理深度可调,避免简单问题也做长 CoT
- 数据配比做到实例级别,不浪费一个 token 的训练信号
3. 开源的诚意
8 个模型全部 Apache 2.0。从 0.6B(手机可跑)到 235B(集群部署),覆盖了从端侧到云端的全部场景。对比 LLaMA-4 的许可限制和 Gemini 的完全闭源,Qwen3 在开源生态上的投入是实打实的。
收尾:我的一点看法
Qwen3 这篇报告,我反复读了三遍。第一遍看数字,第二遍看架构,第三遍看后训练流程。每读一遍都有新的体会。
先说最让我震撼的一点:170 步 RL 就把 AIME 从 70 拉到 85。这个数字背后是冷启动阶段极高的数据质量。Qwen 团队没有像 DeepSeek-R1 那样用大规模 RL 从零涌现推理,而是先用高质量 CoT 数据把模型”预热”到接近最优,再用 RL 做最后 15 分的精修。这是一种更工程化、更可控的路线。DeepSeek-R1 是天才的灵感,Qwen3 是精密的工程。两者都令人敬佩,但后者更容易复制和迭代。
再说 Built-in Thinking 的范式意义。2024 年下半年以来,行业被”推理模型”这个概念牵着走——OpenAI 有 o1/o3,DeepSeek 有 R1,Google 有 Gemini 2.5 Pro 的 thinking。但这些方案本质上都是”在通用模型之外再做一个推理模型”。Qwen3 第一次在工程上证明了:推理能力可以是通用模型的一个模式,而不是一个独立的模型。这对整个行业的部署架构、API 设计、用户体验都会产生深远影响。我预期半年内,所有主流模型都会跟进这个设计。
第三,36T 数据和 119 种语言这个数字,说明 Qwen 团队在数据工程上的投入可能超过了模型架构本身。用 VL 模型提取 PDF、用领域模型生成合成数据、实例级别的数据配比优化——这些”脏活累活”才是真正难以复制的护城河。架构可以抄,数据管线抄不了。
最后说一点遗憾。论文对第四阶段”通用领域 RL”几乎没有展开,对 PPO 的使用(如果有的话)也没有明确说明。后训练的对比实验缺少完整的表格(只给了几个关键数字),让人无法精确对比 o1、o3-mini、Claude-3.5-Sonnet 的具体分数。这可能是因为商业敏感性,也可能是篇幅限制。但作为技术报告,这部分的信息密度明显低于预训练和架构部分。
总的来说,Qwen3 是 2025 年上半年最重要的开源模型发布,没有之一。它不是某一个点的突破,而是架构、数据、训练流程、后训练策略的系统性胜利。如果你只能读一篇 2025 年的模型技术报告,读这篇。
附:核心数据速查
模型规格速查
| 模型 | 类型 | 总参数 | 激活参数 | 层数 | 专家 | 上下文 |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | Dense | 0.6B | 0.6B | 28 | - | 32K |
| Qwen3-1.7B | Dense | 1.7B | 1.7B | 28 | - | 32K |
| Qwen3-4B | Dense | 4B | 4B | 36 | - | 128K |
| Qwen3-8B | Dense | 8B | 8B | 36 | - | 128K |
| Qwen3-14B | Dense | 14B | 14B | 40 | - | 128K |
| Qwen3-32B | Dense | 32B | 32B | 64 | - | 128K |
| Qwen3-30B-A3B | MoE | 30B | 3B | 48 | 128/8 | 128K |
| Qwen3-235B-A22B | MoE | 235B | 22B | 94 | 128/8 | 128K |
训练配置速查
| 项目 | 数值 |
|---|---|
| 预训练总数据量 | 36T tokens |
| 语言覆盖 | 119 种语言和方言 |
| 词表大小 | 151,669 |
| 预训练阶段数 | 3(通用/推理/长上下文) |
| 后训练阶段数 | 4(冷启动/RL/融合SFT/通用RL) |
| RL 算法 | GRPO |
| RL 训练步数 | 170 步(旗舰) |
| RL 数据 | 3,995 个查询-验证器对 |
| 蒸馏 GPU 节省 | ~10x |
| RoPE 基频 | 10,000 → 1,000,000 |
| 许可协议 | Apache 2.0 |
关键概念清单
| 概念 | 说明 |
|---|---|
| Built-in Thinking Mode | 同一模型内建思考/非思考双模式,通过 /think、/no_think 切换 |
| Thinking Budget | 可调节的思考 token 上限,平衡推理深度与延迟 |
| QK-Norm | 对 Q、K 向量做 RMSNorm,替代 QKV-bias,提升训练稳定性 |
| Global-batch Load Balancing Loss | 在 global batch 层面计算 MoE 负载均衡损失,促进专家特化 |
| GRPO | Group Relative Policy Optimization,组内相对策略优化 |
| Strong-to-Weak Distillation | 从旗舰模型蒸馏 logits 到小模型,含 off-policy 和 on-policy |
| Long-CoT Cold Start | 用高质量可验证 CoT 数据做 SFT 冷启动,为 RL 奠基 |
| Thinking Mode Fusion | 混合思考/非思考数据做 SFT,实现模式切换能力 |
| ABF + YARN + DCA | 上下文扩展三件套,实现 32K→128K 推理 |
| Instance-level Data Mixing | 实例级别的数据配比优化,超越粗粒度的领域配比 |
代际对比速查
| 对比 | 结论 |
|---|---|
| Qwen3-235B-A22B vs DeepSeek-V3 | 14/15 胜,总参数 1/3,激活 2/3 |
| Qwen3-32B vs Qwen2.5-72B | 10/15 胜,参数 <1/2 |
| Qwen3-4B vs Qwen2.5-7B | 多数胜,参数 ~1/2 |
| Qwen3-30B-A3B vs Llama-4-Scout | 15/15 全胜,总参数 1/4 |
| Qwen3 vs Qwen2.5 数据量 | 36T vs 18T,翻倍 |
| Qwen3 vs Qwen2.5 语言数 | 119 vs 29,四倍 |
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





