Qwen3-Omni 论文解读:全模态模型终于学会”边想边说”了
论文:Qwen3-Omni Technical Report 作者:Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu 等 38 位研究者(阿里通义千问团队) 这篇论文是 Qwen 全模态产品线的第二代技术报告,发布于 2025 年 9 月。如果说 Qwen2.5-Omni 证明了”一个模型可以处理所有模态”,那 Qwen3-Omni 要回答的问题是——它能不能在每个模态上都打赢专用模型?答案是:几乎全部打赢了。
一、一句话定位:这不是”多模态拼接”,是”原生全模态”
先说背景。市面上大多数号称”全模态”的模型,本质上是把文本模型、视觉编码器、语音识别模块用胶水代码粘在一起。用户感知上是”一个模型”,但内部各模块各训各的、推理时各算各的,延迟叠加、能力不互通。
Qwen3-Omni 走的路完全不一样。它从预训练第一天开始,就让文本、图像、音频、视频四种模态的数据在同一个 Transformer 里混合训练。论文里有个很硬气的实验叫 “无模态退化”(No Modality-Specific Degradation):把 Qwen3-Omni 的全模态基座和同规模的纯文本基座、纯视觉基座直接对比——
| Benchmark | Omni-Base | Text-Base | VL-Base |
|---|---|---|---|
| MMLU | 81.69 | 81.24 | — |
| MMStar | 69.6 | — | 67.2 |
| Video-MME | 69.25 | — | 69.22 |
全模态训练不但没拖后腿,视觉理解还比纯视觉基座高了 2.4 分。这组数据是整个架构设计的根基——“融合训练不会互相伤害,反而会互相增强”。论文还特别提到,音频数据的加入对 OCR 等视觉任务有正向提升,这暗示模态间存在某种底层的表征互补。
二、架构拆解:Thinker-Talker 的 MoE 进化
1. 整体骨架
Qwen3-Omni 的核心架构叫 Thinker-Talker,直译就是”思考者 + 说话者”。但别被名字骗了,这里的 Thinker 不只是”想”,它负责所有模态的理解和文本生成;Talker 也不只是”说”,它负责把 Thinker 的多模态表征直接转化为流式语音。
输入(文本/图像/视频/音频) ↓ ┌─────────────┐ │ Encoders │ AuT (650M) + SigLIP2 (543M) └──────┬──────┘ ↓ ┌─────────────┐ │ Thinker │ 30B 总参数 / 3B 激活 (MoE) │ 理解+推理 │ → 输出文本 + 隐状态 └──────┬──────┘ ↓ ┌─────────────┐ │ Talker │ 3B 总参数 / 0.3B 激活 (MoE) │ 语音生成 │ → Multi-codebook AR → MTP → Code2Wav └─────────────┘ ↓ 音频流输出关键数字一览:
| 模块 | 参数量 | 说明 |
|---|---|---|
| AuT(音频编码器) | 650M | 从零训练,2000 万小时监督数据 |
| SigLIP2(视觉编码器) | 543M | 图像/视频共享 |
| Thinker | 30B/3B | MoE,文本生成+多模态理解 |
| Talker | 3B/0.3B | MoE,流式语音生成 |
| MTP | 80M | 多码本预测(dense transformer) |
| Code2Wav | 200M | 轻量因果卷积网络 |
2. 相比 Qwen2.5-Omni 的三大架构升级
这是整篇论文最值得关注的部分。Qwen3-Omni 相对前代做了三个关键替换:
升级一:Whisper → AuT(自研音频编码器)
Qwen2.5-Omni 用的是 OpenAI 的 Whisper 做音频编码。Qwen3-Omni 直接换成了自研的 Audio Transformer (AuT),650M 参数,在 2000 万小时监督数据上从零训练(80% 中英 ASR,10% 其他语种 ASR,10% 音频理解)。AuT 输出 12.5Hz 的 token 速率——也就是每秒音频只产生 12.5 个 token,这对实时推理的延迟控制至关重要。
效果?Wenetspeech 的 WER 从 5.91 降到 4.69,Librispeech clean 从 1.74 降到 1.22。这两个数据集分别是中文和英文 ASR 的硬指标,提升幅度在 20%-30%。
升级二:Dense → MoE(Thinker 和 Talker 都换成混合专家)
Thinker 从稠密模型换成了 30B 总参数、3B 激活 的 MoE 结构,Talker 同样是 3B 总参数、0.3B 激活 的 MoE。这意味着推理时只激活约 10% 的参数,计算量和一个 3B 稠密模型差不多,但表征能力对标 30B。
这是能在实时对话场景落地的关键——你不能让一个全模态模型在回答用户问题时延迟 5 秒。
升级三:扩散声码器 → 因果卷积声码器(Code2Wav)
Qwen2.5-Omni 的语音合成后端用的是 block-wise 扩散模型,每个语音片段都要跑若干步去噪。Qwen3-Omni 换成了 轻量因果卷积网络(Causal ConvNet),200M 参数,可以直接从左到右逐 token 生成波形,不需要迭代。
这个改动直接让语音首包延迟从”秒级”压到了 234 毫秒。
3. TM-RoPE:异步多模态的位置编码
多模态输入有一个很烦人的问题:不同模态的采样率不一样。视频可能 2fps,音频 12.5Hz,文本是离散 token。Qwen3-Omni 提出了 TM-RoPE(Time-aligned Multimodal Rotary Position Embedding),把位置编码拆成三个维度:时间(24 维)、高度(20 维)、宽度(20 维),不同模态按自己的时间戳对齐。
这比简单的”拼在一起顺序编号”优雅得多,尤其是处理长视频+音频的异步场景时。
三、语音生成:从”能用”到”好用”的质变
1. Multi-Codebook 自回归 + MTP
Talker 的语音生成流程是这篇论文最有工程含量的部分。它没有走”先生成文本再 TTS”的路线,而是直接从 Thinker 的多模态隐状态预测语音码本。
具体来说:
- Talker 用 自回归 方式逐帧预测第一层离散码本(Layer 1)
- 然后 MTP(Multi-Token Prediction) 模块——一个 80M 的 dense transformer——并行预测剩余码本层(Layer 2-8)
- 最后 Code2Wav 把码本转成波形
关键点在于 Talker 的生成是 “left context only” 的,也就是只看左边的上下文就能输出当前帧,不需要右边的信息。这使得它可以完全流式运行。
2. 延迟数据
论文给出了详细的延迟分解,测试条件是单卡推理:
| 并发数 | 音频首包延迟 | 视频首包延迟 | Thinker TTPT | Talker TTPT | RTF |
|---|---|---|---|---|---|
| 1 | 234ms | 547ms | 88ms | 57ms | 0.47 |
| 4 | 728ms | 1517ms | — | — | 0.56 |
| 6 | 1172ms | 2284ms | — | — | 0.66 |
RTF(Real-Time Factor) 始终低于 1.0,意味着生成速度始终快于实时播放速度,不会出现”说着说着卡住”的情况。即使在 6 并发下 RTF 也只有 0.66。
234ms 的音频首包延迟是什么概念?人类对话中,200-500ms 的停顿被认为是”自然换话”,所以这个延迟在实际对话中几乎无感。
3. Benchmark 对比
在语音生成质量的评测上,Qwen3-Omni 和主流 TTS 系统的对比:
| 测试集 | 指标 | Qwen3-Omni | Qwen2.5-Omni | CosyVoice3 | ElevenLabs |
|---|---|---|---|---|---|
| SEED-en WER↓ | 内容一致性 | 1.39 | 2.33 | 1.45 | — |
| MiniMax-zh CC↓ | 内容一致性 | 0.716 | — | — | 16.026 |
| MiniMax-zh Sim↑ | 说话人相似度 | 0.772 | — | — | 0.677 |
| MiniMax-en CC↓ | 内容一致性 | 1.069 | — | — | 2.339 |
| 跨语种 en→zh WER↓ | — | 5.37 | — | 5.09 | — |
| 跨语种 zh→en WER↓ | — | 2.76 | — | 2.98 | — |
在零样本语音克隆(zero-shot voice cloning)场景下,Qwen3-Omni 的内容一致性和说话人相似度全面碾压 ElevenLabs,在英文测试集上也小胜 CosyVoice3。跨语种场景和 CosyVoice3 互有胜负。
四、“Built-in Thinking”:全模态模型开始推理了
1. 从 Qwen3 的 Thinking 到 Qwen3-Omni 的 Thinking
Qwen3 文本模型已经引入了 Thinking 模式(类似 OpenAI o1 的链式推理)。Qwen3-Omni 把这个能力扩展到了全模态——不仅能”想”文字,还能”想”图片和音频。
论文发布了三个版本:
- Qwen3-Omni-30B-A3B:基础版
- Qwen3-Omni-30B-A3B-Thinking:带推理链的思考版
- Qwen3-Omni-30B-A3B-Captioner:音频描述专用版
Thinking 版本使用了 off-policy 蒸馏 + on-policy 蒸馏 + GSPO(基于规则和 LLM-judge 的奖励信号)来训练。
2. Thinking 带来的增益
看几组数据,感受 Thinking 模式在不同任务上的效果:
| Benchmark | Instruct | Thinking | 提升 |
|---|---|---|---|
| AIME25(数学竞赛) | 65.0 | 73.7 | +8.7 |
| GPQA(研究生级QA) | 69.6 | 73.1 | +3.5 |
| MMStar(视觉综合) | 68.5 | 74.9 | +6.4 |
| MMMU-Pro(多模态理解) | 57.0 | 60.5 | +3.5 |
| MathVista | 75.9 | 80.0 | +4.1 |
| DailyOmni(音视频推理) | — | 75.8 | vs Gemini 72.7 |
| VideoHolmes | — | 57.3 | vs Gemini 49.5 |
| PolyMATH | 37.9 | 47.1 | +9.2 |
Thinking 版本在数学、视觉推理、音视频联合推理上都有显著提升。特别值得注意的是 DailyOmni 和 VideoHolmes 这两个音视频联合理解 benchmark,Thinking 版本分别超过 Gemini-2.5-Flash-Thinking 3.1 分和 7.8 分。
3. Thinking 的局限性
论文也很诚实地报告了 Thinking 不管用的场景:基础感知任务。在 ASR(语音识别)、音乐分类(GTZAN)等任务上,显式推理链不但不帮忙,反而可能引入幻觉。这很合理——你不需要”思考”一段话说了什么,你需要的是精准感知。
五、训练流程:三阶段预训练 + 精细后训练
1. 预训练三阶段
阶段一:编码器对齐 冻结 LLM 主体,只训练编码器的投影层,让 AuT 和 SigLIP2 的输出空间和 LLM 对齐。
阶段二:全参数预训练 解冻所有参数,在约 2 万亿 token 上混合训练。数据配比:
| 模态 | Token 数 | 占比 |
|---|---|---|
| 文本 | 0.57T | 26% |
| 音频 | 0.77T | 35% |
| 图像 | 0.82T | 37% |
| 视频 | 0.05T | 2.3% |
| 视频+音频 | 0.05T | 2.3% |
注意音频和图像的 token 量是文本的 1.4 倍。这不是”文本为主、其他为辅”的设计,而是真正以多模态为主体的训练。
阶段三:长上下文扩展 把上下文窗口扩展到 32,768 tokens,用大量长序列数据(40 分钟以上的音频、长视频)做持续训练。
2. 后训练
Thinker 的后训练包括:
- SFT(监督微调)
- Off-policy 蒸馏:从大规模教师模型蒸馏
- On-policy 蒸馏:从自身生成数据中学习
- GSPO:结合规则奖励和 LLM-judge 奖励的策略优化
Talker 的后训练是一个四阶段流程:
- Continual Pretraining:在更大语音数据上继续预训练
- DPO:提升多语种稳定性
- Speaker Tuning:说话人个性化微调
- Safety Alignment:安全对齐
六、Benchmark 全景:在 36 个评测中 32 个拿到开源最佳
1. 文本理解与推理
和同系列纯文本模型 Qwen3-30B-A3B 以及 GPT-4o 的对比:
| Benchmark | Qwen3-Omni Instruct | Qwen3-Omni Thinking | Qwen3-30B-A3B | GPT-4o |
|---|---|---|---|---|
| MMLU-Redux | 86.6 | 88.8 | 89.2 | 91.3 |
| GPQA | 69.6 | 73.1 | 70.4 | — |
| AIME25 | 65.0 | 73.7 | 85.0 | — |
| ZebraLogic | 76.0 | — | — | 52.6 |
| MultiPL-E | 81.4 | 80.6 | — | — |
| IFEval | 81.0 | 85.1 | — | — |
在纯文本任务上,Omni-Instruct 略低于同规模纯文本模型(AIME25 差 20 分),但 Thinking 版本大幅缩小差距。ZebraLogic 上 Omni 远超 GPT-4o(76.0 vs 52.6)。
2. 语音识别与音频理解
| Benchmark | Qwen3-Omni | Qwen2.5-Omni | Gemini-2.5-Pro | GPT-4o |
|---|---|---|---|---|
| Wenetspeech WER↓ | 4.69 | 5.91 | 14.43 | — |
| Libri-test-clean WER↓ | 1.22 | 1.74 | — | 1.39 |
| Fleurs-19lang WER↓ | 5.33 | — | 5.55 | — |
| MMAU(音频推理) | 77.5 | — | 77.4 | — |
| GTZAN(音乐分类) | 93.0 | — | — | — |
| MuchoMusic | 52.0 | — | 49.4 | — |
| VoiceBench | 89.5 | 73.6 | 89.6 | — |
Wenetspeech 上对 Gemini-2.5-Pro 的优势是碾压级的(4.69 vs 14.43)。Librispeech 上甚至超过了 GPT-4o。
3. 视觉理解
| Benchmark | Qwen3-Omni Instruct | Thinking | Qwen2.5-VL-72B |
|---|---|---|---|
| MMStar | 68.5 | 74.9 | 70.8 |
| MMMU-Pro | 57.0 | 60.5 | 51.1 |
| MathVista | 75.9 | 80.0 | — |
| Video-MME | 70.5 | — | 73.3 |
一个 30B 的全模态模型(Thinking 版)在 MMStar 和 MMMU-Pro 上超过了 72B 的纯视觉模型 Qwen2.5-VL-72B,这本身就是架构效率的证明。
4. 音视频联合理解
| Benchmark | Qwen3-Omni | Qwen2.5-Omni | Gemini-2.5-Flash |
|---|---|---|---|
| WorldSense | 54.0 | 45.4 | 50.9 |
| DailyOmni(Thinking) | 75.8 | — | 72.7 |
| VideoHolmes(Thinking) | 57.3 | — | 49.5 |
论文的核心结论:在 36 个音频和音视频评测中,32 个拿到开源模型最佳,并且超过 Seed-ASR、GPT-4o-Transcribe、Gemini-2.5-Pro 等闭源系统。
七、Audio Captioner:填补音频描述的空白
论文还发布了一个有意思的副产品——Qwen3-Omni-30B-A3B-Captioner。
动机很实际:多模态模型的训练需要大量”音频描述”数据(类似于图像的 caption),但现有的音频描述工具质量很差。团队在基础版上做了专门的微调,让它能生成准确、详细、低幻觉的音频描述。
这个 Captioner 本身不是面向终端用户的产品,更像是一个 数据飞轮 的工具——用它来生产高质量训练数据,反哺下一代全模态模型。
八、语言覆盖:真正的全球化
- 文本:支持 119 种语言
- 语音识别:支持 19 种语言
- 语音合成:支持 10 种语言
相比 Qwen2.5-Omni,语种覆盖面进一步扩展,特别是语音合成从有限的几种语言扩展到 10 种,覆盖中文、英文、日语、韩语、法语、德语、西班牙语等主要语种。
收尾:我的一点看法
把 Qwen 全模态产品线拉成一条时间线看:Qwen2.5-Omni(2025 年初)→ Qwen3-Omni(2025 年 9 月)→ 可以预期的 Qwen3.5-Omni。
Qwen2.5-Omni 的历史任务是”证明可行性”——一个模型确实可以同时处理文本、图像、音频、视频,而且不会崩。它用的是相对保守的架构:Whisper 做音频、block-wise diffusion 做语音合成、dense 模型做推理。能用,但延迟高、效率低。
Qwen3-Omni 则是一次系统性的架构升级。自研 AuT 替换 Whisper,MoE 替换 Dense,因果卷积替换扩散模型——每一步都在同时优化”能力”和”效率”两个维度。234ms 首包延迟和 0.47 的 RTF 说明这个模型是真正为实时对话场景设计的,不是实验室里的 benchmark 机器。Thinking 能力的引入则标志着全模态模型从”感知”进入”认知”阶段,虽然目前 Thinking 在基础感知任务上还不靠谱,但在复杂推理任务上的增益已经很显著。
如果要说遗憾,最大的遗憾是 纯文本推理能力和全模态能力之间仍有差距。AIME25 上 Omni-Instruct(65.0)和纯文本 Qwen3-30B-A3B(85.0)差了 20 分,Thinking 版本(73.7)也只追回了 11 分。这说明多模态混合训练对数学推理这类高度抽象的任务还是有干扰。如何在”全模态融合”和”单模态极致”之间找到更好的平衡,大概是 Qwen3.5-Omni 需要解决的课题。
另一个值得关注的信号是三个版本同时开源(Apache 2.0),包括基础版、Thinking 版和 Captioner 版。这不是”开源一个模型”,而是”开源一个全模态工具链”。特别是 Captioner 作为数据生产工具的开放,暗示 Qwen 团队在构建一个从数据生产到模型训练的完整生态。
全模态 AI 的竞争已经不只是”谁的模型更好”,而是”谁的端到端系统更完整”。Qwen3-Omni 在这场比赛里,至少目前是跑在前面的。
附:核心数据速查
模型参数速查
| 模块 | 参数量 | 激活参数 | 说明 |
|---|---|---|---|
| AuT(音频编码器) | 650M | 650M | 12.5Hz token 速率,2000万小时数据训练 |
| SigLIP2(视觉编码器) | 543M | 543M | 图像/视频共享 |
| Thinker | 30B | 3B | MoE,151,643 词表 |
| Talker | 3B | 0.3B | MoE,流式语音 |
| MTP | 80M | 80M | Dense transformer,多码本预测 |
| Code2Wav | 200M | 200M | 因果卷积网络 |
关键延迟指标
| 场景 | 首包延迟 | RTF |
|---|---|---|
| 单并发-音频 | 234ms | 0.47 |
| 单并发-视频 | 547ms | 0.47 |
| 4 并发-音频 | 728ms | 0.56 |
| 6 并发-音频 | 1172ms | 0.66 |
关键 Benchmark 速查
| 领域 | Benchmark | Qwen3-Omni 最佳 | 对比最强竞品 |
|---|---|---|---|
| 中文 ASR | Wenetspeech WER↓ | 4.69 | Gemini-2.5-Pro: 14.43 |
| 英文 ASR | Libri-clean WER↓ | 1.22 | GPT-4o: 1.39 |
| 多语种 ASR | Fleurs-19lang WER↓ | 5.33 | Gemini-2.5-Pro: 5.55 |
| 音乐分类 | GTZAN Acc↑ | 93.0 | 专用模型: 87.9 |
| 音频推理 | MMAU | 77.5 | Gemini-2.5-Pro: 77.4 |
| 视觉推理 | MMStar(Thinking) | 74.9 | Qwen2.5-VL-72B: 70.8 |
| 数学视觉 | MathVista(Thinking) | 80.0 | — |
| 音视频联合 | WorldSense | 54.0 | Gemini-2.5-Flash: 50.9 |
| 音视频推理 | DailyOmni(Thinking) | 75.8 | Gemini-2.5-Flash-Thinking: 72.7 |
| 语音克隆 | SEED-en WER↓ | 1.39 | CosyVoice3: 1.45 |
核心概念清单
| 术语 | 含义 |
|---|---|
| Thinker-Talker | 理解-生成双模块架构,Thinker 负责理解和文本生成,Talker 负责语音生成 |
| MoE(Mixture of Experts) | 混合专家模型,总参数大但推理时只激活一小部分 |
| AuT(Audio Transformer) | 自研音频编码器,650M,替代 Whisper |
| TM-RoPE | 时间对齐多模态旋转位置编码,处理异步多模态输入 |
| Multi-Codebook AR | 多层离散码本自回归生成,用于流式语音合成 |
| MTP(Multi-Token Prediction) | 并行预测剩余码本层,加速语音生成 |
| Code2Wav | 因果卷积声码器,替代扩散模型实现低延迟波形生成 |
| GSPO | 结合规则奖励和 LLM-judge 的策略优化方法 |
| RTF(Real-Time Factor) | 生成时间与音频时长的比值,<1 表示生成快于实时 |
| TTPT(Time To Process Token) | 单 token 处理时间 |
| No Modality Degradation | 全模态训练不会导致任何单模态能力下降的特性 |
| Built-in Thinking | 内置推理链能力,从 Qwen3 文本模型扩展到全模态 |
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





