mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4959 字
14 分钟
Qwen3:双模式思考
2026-08-05

Qwen3 论文解读:一个模型两种思考,这才是推理模型该有的样子#

论文:Qwen3 Technical Report 作者:An Yang, Anfeng Li, Baosong Yang 等 60+ 人(Qwen Team, Alibaba Group) 发布:2025年5月14日,arXiv<2505>.09388,Apache 2.0 开源

这是 Qwen 系列迄今为止最重要的一篇技术报告。不是因为它堆了多少参数,而是它第一次把”深度思考”和”快速应答”塞进了同一个模型里,用一套统一的架构解决了推理模型和对话模型的割裂问题。36T token 的训练数据、119 种语言、8 个模型从 0.6B 到 235B 全覆盖——这不是一次常规迭代,这是一次范式级的跃迁。

一、先说结论:Qwen3 到底做了什么#

1. 一个模型,两种模式#

Qwen3 最核心的创新是 Built-in Thinking Mode(内建思考模式)。一个模型同时具备两种工作方式:

  • 思考模式(Thinking Mode):遇到数学、代码、逻辑推理这类硬问题,模型会先生成一段完整的思维链(Chain-of-Thought),再给出最终答案。类似 DeepSeek-R1 的推理方式。
  • 非思考模式(Non-thinking Mode):日常对话、创意写作、简单问答,模型直接输出,不浪费推理 token。

关键在于:这不是两个模型,是同一个模型。用户通过 /think/no_think 标记切换,或者在 system message 里设定。多轮对话中,模型跟随最后一次出现的标记。

这意味着什么?意味着你不再需要部署一个 Qwen2.5-72B-Instruct 处理日常对话、再部署一个 QwQ-32B 处理推理任务。一个 Qwen3 全搞定。

2. 代际跃迁的数字证据#

直接上对比:

  • Qwen3-235B-A22B(MoE,激活 22B)在 15 个 base benchmark 中的 14 个击败 DeepSeek-V3(671B/37B),总参数只有对方的 1/3,激活参数只有 2/3。
  • Qwen3-32B(Dense)在 15 个 benchmark 中的 10 个击败 Qwen2.5-72B,参数量不到一半。
  • Qwen3-4B 在多数 benchmark 上追平甚至超越 Qwen2.5-7B。
  • Qwen3-8B 在 STEM 和代码任务上全面超越 Qwen2.5-14B。

一句话总结:4B 打 7B,32B 打 72B,235B 打 671B。 每一代都在用更少的参数做更多的事。

二、模型规格:Dense + MoE 双轨并行#

1. 六个 Dense 模型#

模型参数量层数Q HeadsKV Heads上下文
Qwen3-0.6B0.6B2816832K
Qwen3-1.7B1.7B2816832K
Qwen3-4B4B36328128K
Qwen3-8B8B36328128K
Qwen3-14B14B40408128K
Qwen3-32B32B64648128K

所有 Dense 模型统一使用 GQA(Grouped Query Attention)、SwiGLU 激活函数、RoPE 位置编码、RMSNorm 前置归一化。0.6B 到 4B 使用 Tied Embedding(输入输出共享词表),8B 及以上取消。

2. 两个 MoE 模型#

模型总参数/激活参数层数Q HeadsKV Heads专家总数/激活数上下文
Qwen3-30B-A3B30B/3B48324128/8128K
Qwen3-235B-A22B235B/22B94644128/8128K

注意 KV Heads 从 Dense 的 8 降到了 4——MoE 模型在注意力层更激进地压缩 KV cache,毕竟专家层已经提供了足够的表达能力。

3. 词表#

Tokenizer 采用 byte-level BPE,词表大小 151,669。跟 Qwen2.5 一脉相承,但多语言覆盖从 29 种语言扩展到 119 种,词表利用率显著提升。

三、架构创新:QK-Norm 与 MoE 简化#

1. 用 QK-Norm 替代 QKV-bias#

Qwen2.5 及之前的模型在注意力层使用 QKV-bias(对 Q、K、V 投影加偏置项)。Qwen3 做了一个看起来很小但影响深远的改动:

  • 去掉 QKV-bias
  • 加入 QK-Norm(对 Q 和 K 做 RMSNorm 归一化)

为什么这么做?因为随着模型规模增大,Q 和 K 的点积值会越来越大,导致 softmax 进入饱和区,梯度消失。QKV-bias 本质上是在缓解这个问题,但治标不治本。QK-Norm 直接对 Q、K 向量做归一化,从根源上控制了注意力分数的尺度,训练稳定性显著提升。

这不是 Qwen 首创的概念(Gemma 系列也用了类似思路),但 Qwen3 是在 235B 参数规模上验证了它的有效性。

2. MoE 设计:砍掉 Shared Experts#

Qwen2.5-MoE(也就是 Qwen2.5-Turbo/Plus 的底座)使用了 Shared Experts(共享专家)——每个 MoE 层除了路由专家外,还有几个所有 token 都会经过的固定专家。

Qwen3 直接把 Shared Experts 砍了。

取而代之的是:

  • 细粒度专家分割(Fine-grained Expert Segmentation):128 个专家,每次激活 8 个
  • 全局批次负载均衡损失(Global-batch Load Balancing Loss):不是在一个 micro-batch 内做均衡,而是在整个 global batch 层面计算负载损失,促进专家特化

效果呢?Qwen3-30B-A3B 只激活 3B 参数,就能打平 Qwen3-14B(14B 全激活)和 Qwen2.5-32B。用 1/5 的激活参数达到同等性能,推理成本直接砍到原来的 1/5。

跟 LLaMA-4 对比更有意思:Llama-4-Scout 是 109B/17B 的 MoE,Qwen3-30B-A3B 是 30B/3B。总参数只有对方的 1/4,激活参数只有 1/6,但 15 个 benchmark 全胜。

四、36T 数据工程:真正的护城河#

1. 规模与覆盖#

  • 总训练数据:36 万亿 token(Qwen2.5 是 18T,翻了一倍)
  • 语言覆盖:119 种语言和方言(Qwen2.5 是 29 种,翻了四倍)
  • 领域覆盖:代码、STEM、推理、书籍、多语言文本、合成数据

2. 数据获取的新手段#

两个值得注意的操作:

PDF 文本提取:用 Qwen2.5-VL(视觉语言模型)对海量 PDF 文档做文本识别,再用 Qwen2.5 对识别结果做润色和纠错。这一套流程额外产出了数万亿 token 的高质量文本。

合成数据生成:用 Qwen2.5、Qwen2.5-Math、Qwen2.5-Coder 这些领域专精模型生成合成数据,包括教材、问答对、指令数据、代码片段。同样是数万亿 token 级别。

3. 数据标注与配比#

团队构建了一套多语言标注系统,对超过 30 万亿 token 进行了教育质量、领域、主题、安全性标注。

数据配比不是简单的”代码占 20%、数学占 15%“这种粗粒度操作,而是做到了实例级别(Instance-level) 的优化——用细粒度标签配合小模型消融实验,逐条数据决定去留和权重。

4. 三阶段预训练#

阶段数据量序列长度重点
通用阶段>30T4,096通用语言知识,119 种语言
推理阶段~5T4,096STEM、代码、推理、合成数据,LR 加速衰减
长上下文阶段数千亿32,768长文本能力

长上下文阶段的数据配比:75% 是 16K-32K token 的长文本,25% 是 4K-16K 的中等文本。

上下文扩展用了 ABF(Adjusted Base Frequency)把 RoPE 基频从 10,000 拉到 1,000,000,再配合 YARNDual Chunk Attention 实现推理时 4 倍序列长度扩展。所以训练是 32K,推理可以到 128K。

五、后训练:四阶段流水线与 GRPO#

1. 旗舰模型的四阶段后训练#

这是整篇论文最精华的部分。Qwen3 的后训练不是简单的”SFT + RLHF”,而是一套精心设计的四阶段流水线:

第一阶段:Long-CoT 冷启动(Cold Start)

  • 数据:数学、代码、逻辑推理、STEM,所有样本都有可验证的答案或测试用例
  • 查询过滤:用 Qwen2.5-72B-Instruct 剔除不可验证的、多子问题的、不需要 CoT 的查询
  • 响应生成:用 QwQ-32B 生成候选回答,QwQ 失败的案例由人工标注员补全
  • 响应过滤:剔除错误答案、重复内容、猜测性回答、思考与总结不一致的样本、语言混杂、可能泄露验证集的样本
  • 训练策略:只用一小部分数据、限制训练步数,避免过度约束后续 RL 的探索空间

第二阶段:推理强化学习(Reasoning RL)

  • 算法:GRPO(Group Relative Policy Optimization)
  • 数据:精选 3,995 个查询-验证器对
  • 选择标准:冷启动未使用、可学习、有难度、子领域覆盖广
  • 关键设置:大 batch、每个 query 多次 rollout、off-policy 训练
  • 熵控制:保持熵稳定或缓慢上升,防止策略坍缩
  • 效果:Qwen3-235B-A22B 的 AIME’24 从 70.1 提升到 85.1,仅用 170 步 RL 训练

170 步。这个数字说明冷启动阶段的数据质量极高,RL 只需要做精细调优。

第三阶段:思考模式融合 SFT(Thinking Mode Fusion)

  • 在 RL 模型基础上做继续 SFT
  • 混合”思考模式”和”非思考模式”数据
  • 思考数据:用第二阶段模型对第一阶段查询做 rejection sampling
  • 非思考数据:代码、数学、指令跟随、多语言、创意写作、问答、角色扮演
  • 质量控制:自动化 checklist 检查;低资源语言增加翻译数据

这一步是 Built-in Thinking 的实现关键——通过混合训练,让模型学会在两种模式间切换。

第四阶段:通用领域 RL(General-domain RL)

  • 进一步提升广泛下游任务的表现
  • 论文未展开细节

2. 跟 DeepSeek-R1 的路线对比#

维度DeepSeek-R1Qwen3
推理能力来源独立的推理模型,纯 RL 驱动内建于统一模型,冷启动+RL+融合SFT
日常对话需要另一个模型(DeepSeek-V3)同一模型的非思考模式
部署成本两套系统一套系统
RL 算法GRPOGRPO(一致)
思考控制无(始终思考)/think、/no_think、thinking budget
推理-延迟权衡无法调节thinking budget 可动态调节

DeepSeek-R1 证明了”纯 RL 可以涌现推理能力”,Qwen3 则证明了”推理能力可以内建于通用模型,且可以按需开关”。后者在工程落地上意义更大。

3. Thinking Budget:推理的油门#

Qwen3 引入了 Thinking Budget(思考预算)机制:

  • 用户可以设定思考 token 的上限
  • 当思考长度触及阈值,系统中断思考,插入提示”Considering the limited time by the user”,模型基于已有部分推理直接作答
  • 这种”部分推理后作答”的能力不是专门训练的,而是从模式融合中自然涌现
  • 实验表明:增大 thinking budget 会持续提升任务表现

这个设计非常优雅。它把推理深度变成了一个连续可调的旋钮,而不是 0/1 开关。在延迟敏感的场景(比如实时对话)可以限制预算,在精度敏感的场景(比如数学竞赛)可以放开。

六、Strong-to-Weak 蒸馏:小模型的捷径#

1. 机制#

小模型(0.6B、1.7B、4B 等)不走完整的四阶段后训练流水线,而是用 Strong-to-Weak Distillation(强到弱蒸馏):

  • 从大模型(旗舰级)直接蒸馏输出 logits
  • 包含 off-policy 和 on-policy 两种知识迁移
  • 小模型获得大模型的推理分布,而不仅仅是硬标签

2. 效果#

对比跑完整四阶段流水线:

  • Pass@1 更高(单次正确率更好)
  • Pass@64 更高(探索能力更强)
  • GPU 耗时仅为 1/10

这个结论很重要:对于小模型,蒸馏比从头做 RL 更高效。大模型负责探索和思考,小模型负责继承和压缩。这解释了为什么 Qwen3-4B 能打出远超其参数量的表现——它继承的是 235B 旗舰模型的推理能力。

七、Benchmark 全景:数字说话#

1. 旗舰对决(Base 模型)#

Qwen3-235B-A22B vs DeepSeek-V3(671B/37B):

BenchmarkDeepSeek-V3Qwen3-235B-A22B差值
MMLU87.1987.81+0.62
MMLU-Pro59.8468.18+8.34
SuperGPQA41.5344.06+2.53
BBH86.2288.87+2.65
GPQA41.9247.47+5.55
GSM8K87.5794.39+6.82
MATH62.6271.84+9.22
EvalPlus63.7577.60+13.85
MultiPL-E62.2665.94+3.68
CRUX-O76.6079.00+2.40

15 个 benchmark 赢了 14 个。MMLU-Pro 赢了 8.34 分,EvalPlus 赢了 13.85 分——这不是噪声,这是代差。

2. 中量级对决#

Qwen3-32B vs Qwen2.5-72B:

BenchmarkQwen2.5-72BQwen3-32B胜负
MMLU-Pro58.0765.5432B 胜
SuperGPQA36.2039.7832B 胜
BBH86.3087.3832B 胜
GPQA45.8849.4932B 胜
EvalPlus65.9372.0532B 胜
MultiPL-E58.7067.0632B 胜
MATH62.1261.6272B 微胜

32B 打 72B,15 个里赢了 10 个。参数效率提升了一倍不止。

3. 小模型的逆袭#

Qwen3-4B vs Qwen2.5-7B:

BenchmarkQwen2.5-7BQwen3-4B
MMLU-Pro45.0050.58
BBH70.4072.59
GSM8K85.3687.79
MATH49.8054.10
EvalPlus62.1863.53
MultiPL-E50.7353.13

4B 参数打 7B,在推理和代码任务上全面领先。这就是蒸馏的威力。

4. 后训练旗舰成绩#

BenchmarkQwen3-235B-A22B
AIME’2485.7
AIME’2581.5
LiveCodeBench v570.7
CodeForces Rating2,056
BFCL v3(Agent)70.8

论文声称与 o1、o3-mini、DeepSeek-V3 后训练版本具有竞争力。CodeForces 2056 分意味着接近 Candidate Master 水平。

八、工程哲学:Qwen3 的设计取舍#

1. 统一优于分裂#

DeepSeek 的路线是”V3 做通用,R1 做推理”,两个模型两套部署。Qwen3 的路线是”一个模型全做”,通过模式切换适配不同场景。

从研究角度,DeepSeek-R1 更有开创性(证明了纯 RL 涌现推理)。但从产品角度,Qwen3 的统一方案更实用——API 提供商不需要维护两套推理服务,用户不需要在两个 endpoint 之间做路由。

2. 效率优于蛮力#

整个 Qwen3 系列的设计哲学是”用更少的计算做更多的事”:

  • MoE 砍掉 shared experts,减少无效计算
  • 小模型用蒸馏而非完整 RL,GPU 耗时降 10 倍
  • Thinking budget 让推理深度可调,避免简单问题也做长 CoT
  • 数据配比做到实例级别,不浪费一个 token 的训练信号

3. 开源的诚意#

8 个模型全部 Apache 2.0。从 0.6B(手机可跑)到 235B(集群部署),覆盖了从端侧到云端的全部场景。对比 LLaMA-4 的许可限制和 Gemini 的完全闭源,Qwen3 在开源生态上的投入是实打实的。

收尾:我的一点看法#

Qwen3 这篇报告,我反复读了三遍。第一遍看数字,第二遍看架构,第三遍看后训练流程。每读一遍都有新的体会。

先说最让我震撼的一点:170 步 RL 就把 AIME 从 70 拉到 85。这个数字背后是冷启动阶段极高的数据质量。Qwen 团队没有像 DeepSeek-R1 那样用大规模 RL 从零涌现推理,而是先用高质量 CoT 数据把模型”预热”到接近最优,再用 RL 做最后 15 分的精修。这是一种更工程化、更可控的路线。DeepSeek-R1 是天才的灵感,Qwen3 是精密的工程。两者都令人敬佩,但后者更容易复制和迭代。

再说 Built-in Thinking 的范式意义。2024 年下半年以来,行业被”推理模型”这个概念牵着走——OpenAI 有 o1/o3,DeepSeek 有 R1,Google 有 Gemini 2.5 Pro 的 thinking。但这些方案本质上都是”在通用模型之外再做一个推理模型”。Qwen3 第一次在工程上证明了:推理能力可以是通用模型的一个模式,而不是一个独立的模型。这对整个行业的部署架构、API 设计、用户体验都会产生深远影响。我预期半年内,所有主流模型都会跟进这个设计。

第三,36T 数据和 119 种语言这个数字,说明 Qwen 团队在数据工程上的投入可能超过了模型架构本身。用 VL 模型提取 PDF、用领域模型生成合成数据、实例级别的数据配比优化——这些”脏活累活”才是真正难以复制的护城河。架构可以抄,数据管线抄不了。

最后说一点遗憾。论文对第四阶段”通用领域 RL”几乎没有展开,对 PPO 的使用(如果有的话)也没有明确说明。后训练的对比实验缺少完整的表格(只给了几个关键数字),让人无法精确对比 o1、o3-mini、Claude-3.5-Sonnet 的具体分数。这可能是因为商业敏感性,也可能是篇幅限制。但作为技术报告,这部分的信息密度明显低于预训练和架构部分。

总的来说,Qwen3 是 2025 年上半年最重要的开源模型发布,没有之一。它不是某一个点的突破,而是架构、数据、训练流程、后训练策略的系统性胜利。如果你只能读一篇 2025 年的模型技术报告,读这篇。

附:核心数据速查#

模型规格速查#

模型类型总参数激活参数层数专家上下文
Qwen3-0.6BDense0.6B0.6B28-32K
Qwen3-1.7BDense1.7B1.7B28-32K
Qwen3-4BDense4B4B36-128K
Qwen3-8BDense8B8B36-128K
Qwen3-14BDense14B14B40-128K
Qwen3-32BDense32B32B64-128K
Qwen3-30B-A3BMoE30B3B48128/8128K
Qwen3-235B-A22BMoE235B22B94128/8128K

训练配置速查#

项目数值
预训练总数据量36T tokens
语言覆盖119 种语言和方言
词表大小151,669
预训练阶段数3(通用/推理/长上下文)
后训练阶段数4(冷启动/RL/融合SFT/通用RL)
RL 算法GRPO
RL 训练步数170 步(旗舰)
RL 数据3,995 个查询-验证器对
蒸馏 GPU 节省~10x
RoPE 基频10,000 → 1,000,000
许可协议Apache 2.0

关键概念清单#

概念说明
Built-in Thinking Mode同一模型内建思考/非思考双模式,通过 /think、/no_think 切换
Thinking Budget可调节的思考 token 上限,平衡推理深度与延迟
QK-Norm对 Q、K 向量做 RMSNorm,替代 QKV-bias,提升训练稳定性
Global-batch Load Balancing Loss在 global batch 层面计算 MoE 负载均衡损失,促进专家特化
GRPOGroup Relative Policy Optimization,组内相对策略优化
Strong-to-Weak Distillation从旗舰模型蒸馏 logits 到小模型,含 off-policy 和 on-policy
Long-CoT Cold Start用高质量可验证 CoT 数据做 SFT 冷启动,为 RL 奠基
Thinking Mode Fusion混合思考/非思考数据做 SFT,实现模式切换能力
ABF + YARN + DCA上下文扩展三件套,实现 32K→128K 推理
Instance-level Data Mixing实例级别的数据配比优化,超越粗粒度的领域配比

代际对比速查#

对比结论
Qwen3-235B-A22B vs DeepSeek-V314/15 胜,总参数 1/3,激活 2/3
Qwen3-32B vs Qwen2.5-72B10/15 胜,参数 <1/2
Qwen3-4B vs Qwen2.5-7B多数胜,参数 ~1/2
Qwen3-30B-A3B vs Llama-4-Scout15/15 全胜,总参数 1/4
Qwen3 vs Qwen2.5 数据量36T vs 18T,翻倍
Qwen3 vs Qwen2.5 语言数119 vs 29,四倍
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Qwen3:双模式思考
https://mizuki-eaf.pages.dev/posts/qwen/qwen3双模式思考/
作者
无名之子
发布于
2026-08-05
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录