Qwen3-Omni 论文解读:文本、图像、音频、视频全都要,还一个都不许退化
论文:Qwen3-Omni Technical Report(arXiv<2509>2509>.17765) 作者/机构:Jin Xu、Zhifang Guo、Hangrui Hu 等 / 阿里巴巴 Qwen 团队
2025 年 5 月,Qwen 团队把 Qwen3-Omni 的权重开源,四个月后的 9 月 22 日技术报告上 arXiv。这篇报告写的是一句很狂的话:单模型在文本、图像、音频、视频四个模态上同时保持 SOTA,且相对各单模态模型无任何退化。它用 Thinker-Talker 的 MoE 架构(30B-A3B)把感知与生成统一起来,冷启动端到端首包延迟 234 ms,在 36 个音频/音视频基准上拿到 32 项开源 SOTA、22 项总 SOTA,把 Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe 这些闭源选手都比了下去。这基本就是截至 2025 年开源音频多模态的天花板。
一、背景:Qwen 音频系列的三级跳
Qwen3-Omni 不是石头缝里蹦出来的,它的血缘可以一路追到 2023 年:
- Qwen-Audio(arXiv<2311>2311>.07919,2023.11):统一音频理解的开山作。当时音频语言模型都只能干窄活,Qwen-Audio 把预训练扩到 30 多个任务,覆盖人声、自然声、音乐、歌曲,还解决了多任务共训时的”一对多干扰”问题——用**层级标签(hierarchical tags)**条件化解码器,共享标签促知识共享、专属标签防互相干扰。
- Qwen2-Audio(arXiv<2407>2407>.10759,2024.07):把复杂的层级标签简化成自然语言 prompt,数据量进一步扩大,并实现了两种交互模式——语音聊天(纯语音输入,不需要打字)和音频分析(音频 + 文本指令),两者切换不靠 system prompt,模型自己判断。加上 DPO 优化,在 AIR-Bench 上超过了 Gemini-1.5-pro。还顺带做了语音对话(voice chat)。
到 Qwen3-Omni,这棵树的果子成熟了:不再只是”音频理解 + 语音对话”,而是四模态全通、还能实时语音生成。
二、Thinker-Talker:想问题的和说话的,分开
Qwen3-Omni 最核心的架构设计叫 Thinker-Talker(思考者-说话者),一个 MoE(混合专家)模型,总参数 30B,激活 3B(30B-A3B)。名字起得很形象:
- Thinker(思考者):负责感知与推理——理解文本、图像、音频、视频输入,把四模态统一成一份”思考结果”。它是个标准 LLM,四模态的输入都汇到它这里;
- Talker(说话者):负责把 Thinker 的思考转成实时语音。Talker 不是读 Thinker 输出的文字,而是直接读 Thinker 的隐状态(hidden states)——这样”怎么说”的音色、情感、停顿这些信息不会在文字序列化时丢掉。
这个分工在 Qwen2.5-Omni(arXiv<2503>2503>.20215)里已经验证过,Qwen3-Omni 把它升级并做成 30B-A3B 的 MoE。Thinker 大而全管理解,Talker 小而快管生成,两边各司其职。
三、Talker 的多码本自回归与”因果 ConvNet”
Talker 怎么做到实时流式?Qwen3-Omni 的方案是多码本(multi-codebook)自回归生成离散语音 codec,并且用了一个反直觉但极其高效的替换:把计算密集的 block-wise diffusion(逐块扩散)换成轻量因果卷积网络(causal ConvNet)。
之前的方案(包括 Qwen 自家的 Qwen2.5-Omni)在生成语音 token 后,还要过一遍扩散模型去”精修”,这既慢又耗算力。Qwen3-Omni 发现:多码本自回归产出的 token 本身已携带足够强的表征,于是用一个轻量因果 ConvNet直接做流式映射,从第一个 codec 帧就开始出音频,不再等整块。正是这个改动,把冷启动端到端首包延迟压到了 234 ms(理论上),且是从零开始的冷启动场景——不是预热后的。
四、四模态无退化:最难的”什么都行”
Qwen3-Omni 最让我服气的一句是”without any degradation relative to single-modal counterparts”——四模态能力全部在线,还不拖累彼此。这听起来简单,做起来极难:多模态训练最常见的结局是模态间互相干扰,音频学好了图像就掉,图像保住了文本又崩。
Qwen3-Omni 的解决思路是”匹配同尺寸单模态模型”——它的目标不是超过 Qwen 全尺寸旗舰,而是在 30B-A3B 这个体量上,让四模态能力都对齐 Qwen 系列同尺寸单模态模型的表现。结果就是:文本照常强,图像不拉胯,音频特别能打——36 个音频/音视频基准里 32 项开源 SOTA、22 项总 SOTA,甚至压过了 Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe 这些闭源重器。
五、语种覆盖:119 / 19 / 10
多语种是三组数字:文本交互支持 119 种语言,语音理解支持 19 种,语音生成支持 10 种。这是目前开源语音多模态模型里少见的宽覆盖——文本 119 语种继承自 Qwen 的多语底子,语音侧的理解与生成则专门扩了语言。对做全球化语音应用的团队来说,这组数字直接决定能不能”开箱即用”。
六、Thinking 与 Captioner:两个支线
报告还带了两件附赠品:
- Qwen3-Omni-30B-A3B-Thinking:一个显式推理版本,可以对任何模态的输入进行多步推理(chain-of-thought)。多模态问题的复杂度一上去,“先想后答”就是刚需;
- Qwen3-Omni-30B-A3B-Captioner:一个音频描述模型。社区一直缺一个通用的音频描述(audio captioning)模型,作者直接从 Qwen3-Omni 微调出一个,能对任意音频生成详细、低幻觉的文字描述。它顺手还解决了音频领域的”看图说话”缺失问题。
三个模型(基础版、Thinking、Captioner)全部 Apache 2.0 开源,商用友好度直接拉满。
收尾:我的一点看法
Qwen3-Omni 的技术报告,与其说是介绍一个模型,不如说是给 2025 年的语音多模态定了调:单模态 SOTA 不是终点,多模态”全都要且不塌”才是。它 22 项总 SOTA 的成绩,放在开源圈是断层领先,放在整个行业(含闭源)也是第一梯队。Gemini-2.5-Pro 都被它压下去,含金量不用多说。
我最欣赏的是那个”因果 ConvNet 替掉扩散”的工程直觉。业界为了音质把扩散模型堆了又堆,Qwen3-Omni 却看穿了”多码本 token 已经够好,扩散是过剩的保险”这一点,砍掉它、省下算力、换回 234 ms 的首包延迟。这种”做减法换速度”的魄力,和 DeepSeek 砍辅助损失、砍 critic 是同一类气质。
局限也摆在明面上:30B-A3B 是”总参 30B、激活 3B”,开源的是 MoE,对部署框架(vLLM 等)有要求,个人开发者跑起来仍有门槛;首包延迟 234 ms 是冷启动理论值,真实网络下要打折;语音生成 10 语种和文本 119 语种之间的落差,说明语音侧的扩展仍是瓶颈。但瑕不掩瑜——它就是 2025 年开源语音多模态的那根标杆,后续论文都要拿它当参照系。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 架构 | Thinker-Talker MoE,30B-A3B(总参 30B / 激活 3B) |
| 模态 | 文本 / 图像 / 音频 / 视频 |
| 延迟 | 冷启动端到端首包 234 ms(理论值) |
| 语种 | 文本 119 / 语音理解 19 / 语音生成 10 |
| 时间线 | 模型 2025.05 开源;技术报告 2025.09.22 提交 |
| 许可 | Apache 2.0(基础版 / Thinking / Captioner 三个模型) |
核心创新
| 创新 | 要点 |
|---|---|
| Thinker-Talker | Talker 直接读 Thinker 隐状态生成语音,不丢副语言信息 |
| 多码本自回归 + 因果 ConvNet | 砍掉 block-wise diffusion,首个 codec 帧即开始流式 |
| 四模态无退化 | 各模态对齐 Qwen 同尺寸单模态模型,互不拖累 |
| Captioner | 从 Qwen3-Omni 微调出的通用低幻觉音频描述模型 |
关键成绩
- 36 个音频/音视频基准:32 项开源 SOTA、22 项总 SOTA
- 超越 Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe 等闭源模型
- 音频任务为相对强项,同时文本/图像/视频不退化
Qwen 音频系列背景
| 模型 | arXiv | 要点 |
|---|---|---|
| Qwen-Audio | 2311.07919(2023.11) | 30+ 任务统一音频理解,层级标签抗干扰 |
| Qwen2-Audio | 2407.10759(2024.07) | 自然语言 prompt、语音聊天/音频分析双模式、AIR-Bench 超 Gemini-1.5-pro |
| Qwen3-Omni | 2509.17765(2025.09.22) | 四模态 Thinker-Talker,语音多模态天花板 |
关键概念清单
- Thinker-Talker = 思考者-说话者双模块架构
- MoE = Mixture of Experts,混合专家
- 30B-A3B = 总参数 30B、激活 3B
- hidden states = 隐状态(Thinker 传给 Talker 的中间表示)
- multi-codebook = 多码本(语音离散化的多层表示)
- causal ConvNet = 因果卷积网络
- block-wise diffusion = 逐块扩散(被替代的重型精修模块)
- first-packet latency = 首包延迟
- chain-of-thought = 思维链 / 多步推理
- audio captioning = 音频描述
- SOTA = State-Of-The-Art,最优水平
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





