mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4423 字
13 分钟
Qwen3-Omni:边想边说
2026-08-01

Qwen3-Omni 论文解读:全模态模型终于学会”边想边说”了#

论文:Qwen3-Omni Technical Report 作者:Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu 等 38 位研究者(阿里通义千问团队) 这篇论文是 Qwen 全模态产品线的第二代技术报告,发布于 2025 年 9 月。如果说 Qwen2.5-Omni 证明了”一个模型可以处理所有模态”,那 Qwen3-Omni 要回答的问题是——它能不能在每个模态上都打赢专用模型?答案是:几乎全部打赢了。


一、一句话定位:这不是”多模态拼接”,是”原生全模态”#

先说背景。市面上大多数号称”全模态”的模型,本质上是把文本模型、视觉编码器、语音识别模块用胶水代码粘在一起。用户感知上是”一个模型”,但内部各模块各训各的、推理时各算各的,延迟叠加、能力不互通。

Qwen3-Omni 走的路完全不一样。它从预训练第一天开始,就让文本、图像、音频、视频四种模态的数据在同一个 Transformer 里混合训练。论文里有个很硬气的实验叫 “无模态退化”(No Modality-Specific Degradation):把 Qwen3-Omni 的全模态基座和同规模的纯文本基座、纯视觉基座直接对比——

BenchmarkOmni-BaseText-BaseVL-Base
MMLU81.6981.24
MMStar69.667.2
Video-MME69.2569.22

全模态训练不但没拖后腿,视觉理解还比纯视觉基座高了 2.4 分。这组数据是整个架构设计的根基——“融合训练不会互相伤害,反而会互相增强”。论文还特别提到,音频数据的加入对 OCR 等视觉任务有正向提升,这暗示模态间存在某种底层的表征互补。


二、架构拆解:Thinker-Talker 的 MoE 进化#

1. 整体骨架#

Qwen3-Omni 的核心架构叫 Thinker-Talker,直译就是”思考者 + 说话者”。但别被名字骗了,这里的 Thinker 不只是”想”,它负责所有模态的理解和文本生成;Talker 也不只是”说”,它负责把 Thinker 的多模态表征直接转化为流式语音。

输入(文本/图像/视频/音频)
┌─────────────┐
│ Encoders │ AuT (650M) + SigLIP2 (543M)
└──────┬──────┘
┌─────────────┐
│ Thinker │ 30B 总参数 / 3B 激活 (MoE)
│ 理解+推理 │ → 输出文本 + 隐状态
└──────┬──────┘
┌─────────────┐
│ Talker │ 3B 总参数 / 0.3B 激活 (MoE)
│ 语音生成 │ → Multi-codebook AR → MTP → Code2Wav
└─────────────┘
音频流输出

关键数字一览:

模块参数量说明
AuT(音频编码器)650M从零训练,2000 万小时监督数据
SigLIP2(视觉编码器)543M图像/视频共享
Thinker30B/3BMoE,文本生成+多模态理解
Talker3B/0.3BMoE,流式语音生成
MTP80M多码本预测(dense transformer)
Code2Wav200M轻量因果卷积网络

2. 相比 Qwen2.5-Omni 的三大架构升级#

这是整篇论文最值得关注的部分。Qwen3-Omni 相对前代做了三个关键替换:

升级一:Whisper → AuT(自研音频编码器)

Qwen2.5-Omni 用的是 OpenAI 的 Whisper 做音频编码。Qwen3-Omni 直接换成了自研的 Audio Transformer (AuT),650M 参数,在 2000 万小时监督数据上从零训练(80% 中英 ASR,10% 其他语种 ASR,10% 音频理解)。AuT 输出 12.5Hz 的 token 速率——也就是每秒音频只产生 12.5 个 token,这对实时推理的延迟控制至关重要。

效果?Wenetspeech 的 WER 从 5.91 降到 4.69,Librispeech clean 从 1.74 降到 1.22。这两个数据集分别是中文和英文 ASR 的硬指标,提升幅度在 20%-30%。

升级二:Dense → MoE(Thinker 和 Talker 都换成混合专家)

Thinker 从稠密模型换成了 30B 总参数、3B 激活 的 MoE 结构,Talker 同样是 3B 总参数、0.3B 激活 的 MoE。这意味着推理时只激活约 10% 的参数,计算量和一个 3B 稠密模型差不多,但表征能力对标 30B。

这是能在实时对话场景落地的关键——你不能让一个全模态模型在回答用户问题时延迟 5 秒。

升级三:扩散声码器 → 因果卷积声码器(Code2Wav)

Qwen2.5-Omni 的语音合成后端用的是 block-wise 扩散模型,每个语音片段都要跑若干步去噪。Qwen3-Omni 换成了 轻量因果卷积网络(Causal ConvNet),200M 参数,可以直接从左到右逐 token 生成波形,不需要迭代。

这个改动直接让语音首包延迟从”秒级”压到了 234 毫秒

3. TM-RoPE:异步多模态的位置编码#

多模态输入有一个很烦人的问题:不同模态的采样率不一样。视频可能 2fps,音频 12.5Hz,文本是离散 token。Qwen3-Omni 提出了 TM-RoPE(Time-aligned Multimodal Rotary Position Embedding),把位置编码拆成三个维度:时间(24 维)、高度(20 维)、宽度(20 维),不同模态按自己的时间戳对齐。

这比简单的”拼在一起顺序编号”优雅得多,尤其是处理长视频+音频的异步场景时。


三、语音生成:从”能用”到”好用”的质变#

1. Multi-Codebook 自回归 + MTP#

Talker 的语音生成流程是这篇论文最有工程含量的部分。它没有走”先生成文本再 TTS”的路线,而是直接从 Thinker 的多模态隐状态预测语音码本。

具体来说:

  • Talker 用 自回归 方式逐帧预测第一层离散码本(Layer 1)
  • 然后 MTP(Multi-Token Prediction) 模块——一个 80M 的 dense transformer——并行预测剩余码本层(Layer 2-8)
  • 最后 Code2Wav 把码本转成波形

关键点在于 Talker 的生成是 “left context only” 的,也就是只看左边的上下文就能输出当前帧,不需要右边的信息。这使得它可以完全流式运行。

2. 延迟数据#

论文给出了详细的延迟分解,测试条件是单卡推理:

并发数音频首包延迟视频首包延迟Thinker TTPTTalker TTPTRTF
1234ms547ms88ms57ms0.47
4728ms1517ms0.56
61172ms2284ms0.66

RTF(Real-Time Factor) 始终低于 1.0,意味着生成速度始终快于实时播放速度,不会出现”说着说着卡住”的情况。即使在 6 并发下 RTF 也只有 0.66。

234ms 的音频首包延迟是什么概念?人类对话中,200-500ms 的停顿被认为是”自然换话”,所以这个延迟在实际对话中几乎无感。

3. Benchmark 对比#

在语音生成质量的评测上,Qwen3-Omni 和主流 TTS 系统的对比:

测试集指标Qwen3-OmniQwen2.5-OmniCosyVoice3ElevenLabs
SEED-en WER↓内容一致性1.392.331.45
MiniMax-zh CC↓内容一致性0.71616.026
MiniMax-zh Sim↑说话人相似度0.7720.677
MiniMax-en CC↓内容一致性1.0692.339
跨语种 en→zh WER↓5.375.09
跨语种 zh→en WER↓2.762.98

在零样本语音克隆(zero-shot voice cloning)场景下,Qwen3-Omni 的内容一致性和说话人相似度全面碾压 ElevenLabs,在英文测试集上也小胜 CosyVoice3。跨语种场景和 CosyVoice3 互有胜负。


四、“Built-in Thinking”:全模态模型开始推理了#

1. 从 Qwen3 的 Thinking 到 Qwen3-Omni 的 Thinking#

Qwen3 文本模型已经引入了 Thinking 模式(类似 OpenAI o1 的链式推理)。Qwen3-Omni 把这个能力扩展到了全模态——不仅能”想”文字,还能”想”图片和音频。

论文发布了三个版本:

  • Qwen3-Omni-30B-A3B:基础版
  • Qwen3-Omni-30B-A3B-Thinking:带推理链的思考版
  • Qwen3-Omni-30B-A3B-Captioner:音频描述专用版

Thinking 版本使用了 off-policy 蒸馏 + on-policy 蒸馏 + GSPO(基于规则和 LLM-judge 的奖励信号)来训练。

2. Thinking 带来的增益#

看几组数据,感受 Thinking 模式在不同任务上的效果:

BenchmarkInstructThinking提升
AIME25(数学竞赛)65.073.7+8.7
GPQA(研究生级QA)69.673.1+3.5
MMStar(视觉综合)68.574.9+6.4
MMMU-Pro(多模态理解)57.060.5+3.5
MathVista75.980.0+4.1
DailyOmni(音视频推理)75.8vs Gemini 72.7
VideoHolmes57.3vs Gemini 49.5
PolyMATH37.947.1+9.2

Thinking 版本在数学、视觉推理、音视频联合推理上都有显著提升。特别值得注意的是 DailyOmniVideoHolmes 这两个音视频联合理解 benchmark,Thinking 版本分别超过 Gemini-2.5-Flash-Thinking 3.1 分和 7.8 分。

3. Thinking 的局限性#

论文也很诚实地报告了 Thinking 不管用的场景:基础感知任务。在 ASR(语音识别)、音乐分类(GTZAN)等任务上,显式推理链不但不帮忙,反而可能引入幻觉。这很合理——你不需要”思考”一段话说了什么,你需要的是精准感知。


五、训练流程:三阶段预训练 + 精细后训练#

1. 预训练三阶段#

阶段一:编码器对齐 冻结 LLM 主体,只训练编码器的投影层,让 AuT 和 SigLIP2 的输出空间和 LLM 对齐。

阶段二:全参数预训练 解冻所有参数,在约 2 万亿 token 上混合训练。数据配比:

模态Token 数占比
文本0.57T26%
音频0.77T35%
图像0.82T37%
视频0.05T2.3%
视频+音频0.05T2.3%

注意音频和图像的 token 量是文本的 1.4 倍。这不是”文本为主、其他为辅”的设计,而是真正以多模态为主体的训练。

阶段三:长上下文扩展 把上下文窗口扩展到 32,768 tokens,用大量长序列数据(40 分钟以上的音频、长视频)做持续训练。

2. 后训练#

Thinker 的后训练包括:

  • SFT(监督微调)
  • Off-policy 蒸馏:从大规模教师模型蒸馏
  • On-policy 蒸馏:从自身生成数据中学习
  • GSPO:结合规则奖励和 LLM-judge 奖励的策略优化

Talker 的后训练是一个四阶段流程:

  1. Continual Pretraining:在更大语音数据上继续预训练
  2. DPO:提升多语种稳定性
  3. Speaker Tuning:说话人个性化微调
  4. Safety Alignment:安全对齐

六、Benchmark 全景:在 36 个评测中 32 个拿到开源最佳#

1. 文本理解与推理#

和同系列纯文本模型 Qwen3-30B-A3B 以及 GPT-4o 的对比:

BenchmarkQwen3-Omni InstructQwen3-Omni ThinkingQwen3-30B-A3BGPT-4o
MMLU-Redux86.688.889.291.3
GPQA69.673.170.4
AIME2565.073.785.0
ZebraLogic76.052.6
MultiPL-E81.480.6
IFEval81.085.1

在纯文本任务上,Omni-Instruct 略低于同规模纯文本模型(AIME25 差 20 分),但 Thinking 版本大幅缩小差距。ZebraLogic 上 Omni 远超 GPT-4o(76.0 vs 52.6)。

2. 语音识别与音频理解#

BenchmarkQwen3-OmniQwen2.5-OmniGemini-2.5-ProGPT-4o
Wenetspeech WER↓4.695.9114.43
Libri-test-clean WER↓1.221.741.39
Fleurs-19lang WER↓5.335.55
MMAU(音频推理)77.577.4
GTZAN(音乐分类)93.0
MuchoMusic52.049.4
VoiceBench89.573.689.6

Wenetspeech 上对 Gemini-2.5-Pro 的优势是碾压级的(4.69 vs 14.43)。Librispeech 上甚至超过了 GPT-4o。

3. 视觉理解#

BenchmarkQwen3-Omni InstructThinkingQwen2.5-VL-72B
MMStar68.574.970.8
MMMU-Pro57.060.551.1
MathVista75.980.0
Video-MME70.573.3

一个 30B 的全模态模型(Thinking 版)在 MMStar 和 MMMU-Pro 上超过了 72B 的纯视觉模型 Qwen2.5-VL-72B,这本身就是架构效率的证明。

4. 音视频联合理解#

BenchmarkQwen3-OmniQwen2.5-OmniGemini-2.5-Flash
WorldSense54.045.450.9
DailyOmni(Thinking)75.872.7
VideoHolmes(Thinking)57.349.5

论文的核心结论:在 36 个音频和音视频评测中,32 个拿到开源模型最佳,并且超过 Seed-ASR、GPT-4o-Transcribe、Gemini-2.5-Pro 等闭源系统。


七、Audio Captioner:填补音频描述的空白#

论文还发布了一个有意思的副产品——Qwen3-Omni-30B-A3B-Captioner

动机很实际:多模态模型的训练需要大量”音频描述”数据(类似于图像的 caption),但现有的音频描述工具质量很差。团队在基础版上做了专门的微调,让它能生成准确、详细、低幻觉的音频描述。

这个 Captioner 本身不是面向终端用户的产品,更像是一个 数据飞轮 的工具——用它来生产高质量训练数据,反哺下一代全模态模型。


八、语言覆盖:真正的全球化#

  • 文本:支持 119 种语言
  • 语音识别:支持 19 种语言
  • 语音合成:支持 10 种语言

相比 Qwen2.5-Omni,语种覆盖面进一步扩展,特别是语音合成从有限的几种语言扩展到 10 种,覆盖中文、英文、日语、韩语、法语、德语、西班牙语等主要语种。


收尾:我的一点看法#

把 Qwen 全模态产品线拉成一条时间线看:Qwen2.5-Omni(2025 年初)→ Qwen3-Omni(2025 年 9 月)→ 可以预期的 Qwen3.5-Omni

Qwen2.5-Omni 的历史任务是”证明可行性”——一个模型确实可以同时处理文本、图像、音频、视频,而且不会崩。它用的是相对保守的架构:Whisper 做音频、block-wise diffusion 做语音合成、dense 模型做推理。能用,但延迟高、效率低。

Qwen3-Omni 则是一次系统性的架构升级。自研 AuT 替换 Whisper,MoE 替换 Dense,因果卷积替换扩散模型——每一步都在同时优化”能力”和”效率”两个维度。234ms 首包延迟和 0.47 的 RTF 说明这个模型是真正为实时对话场景设计的,不是实验室里的 benchmark 机器。Thinking 能力的引入则标志着全模态模型从”感知”进入”认知”阶段,虽然目前 Thinking 在基础感知任务上还不靠谱,但在复杂推理任务上的增益已经很显著。

如果要说遗憾,最大的遗憾是 纯文本推理能力和全模态能力之间仍有差距。AIME25 上 Omni-Instruct(65.0)和纯文本 Qwen3-30B-A3B(85.0)差了 20 分,Thinking 版本(73.7)也只追回了 11 分。这说明多模态混合训练对数学推理这类高度抽象的任务还是有干扰。如何在”全模态融合”和”单模态极致”之间找到更好的平衡,大概是 Qwen3.5-Omni 需要解决的课题。

另一个值得关注的信号是三个版本同时开源(Apache 2.0),包括基础版、Thinking 版和 Captioner 版。这不是”开源一个模型”,而是”开源一个全模态工具链”。特别是 Captioner 作为数据生产工具的开放,暗示 Qwen 团队在构建一个从数据生产到模型训练的完整生态。

全模态 AI 的竞争已经不只是”谁的模型更好”,而是”谁的端到端系统更完整”。Qwen3-Omni 在这场比赛里,至少目前是跑在前面的。


附:核心数据速查#

模型参数速查#

模块参数量激活参数说明
AuT(音频编码器)650M650M12.5Hz token 速率,2000万小时数据训练
SigLIP2(视觉编码器)543M543M图像/视频共享
Thinker30B3BMoE,151,643 词表
Talker3B0.3BMoE,流式语音
MTP80M80MDense transformer,多码本预测
Code2Wav200M200M因果卷积网络

关键延迟指标#

场景首包延迟RTF
单并发-音频234ms0.47
单并发-视频547ms0.47
4 并发-音频728ms0.56
6 并发-音频1172ms0.66

关键 Benchmark 速查#

领域BenchmarkQwen3-Omni 最佳对比最强竞品
中文 ASRWenetspeech WER↓4.69Gemini-2.5-Pro: 14.43
英文 ASRLibri-clean WER↓1.22GPT-4o: 1.39
多语种 ASRFleurs-19lang WER↓5.33Gemini-2.5-Pro: 5.55
音乐分类GTZAN Acc↑93.0专用模型: 87.9
音频推理MMAU77.5Gemini-2.5-Pro: 77.4
视觉推理MMStar(Thinking)74.9Qwen2.5-VL-72B: 70.8
数学视觉MathVista(Thinking)80.0
音视频联合WorldSense54.0Gemini-2.5-Flash: 50.9
音视频推理DailyOmni(Thinking)75.8Gemini-2.5-Flash-Thinking: 72.7
语音克隆SEED-en WER↓1.39CosyVoice3: 1.45

核心概念清单#

术语含义
Thinker-Talker理解-生成双模块架构,Thinker 负责理解和文本生成,Talker 负责语音生成
MoE(Mixture of Experts)混合专家模型,总参数大但推理时只激活一小部分
AuT(Audio Transformer)自研音频编码器,650M,替代 Whisper
TM-RoPE时间对齐多模态旋转位置编码,处理异步多模态输入
Multi-Codebook AR多层离散码本自回归生成,用于流式语音合成
MTP(Multi-Token Prediction)并行预测剩余码本层,加速语音生成
Code2Wav因果卷积声码器,替代扩散模型实现低延迟波形生成
GSPO结合规则奖励和 LLM-judge 的策略优化方法
RTF(Real-Time Factor)生成时间与音频时长的比值,<1 表示生成快于实时
TTPT(Time To Process Token)单 token 处理时间
No Modality Degradation全模态训练不会导致任何单模态能力下降的特性
Built-in Thinking内置推理链能力,从 Qwen3 文本模型扩展到全模态
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Qwen3-Omni:边想边说
https://mizuki-eaf.pages.dev/posts/qwen/qwen3-omni边想边说/
作者
无名之子
发布于
2026-08-01
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录