mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2518 字
7 分钟
[语音多模态] Qwen3-Omni:四模态不退化
2026-08-05

Qwen3-Omni 论文解读:文本、图像、音频、视频全都要,还一个都不许退化#

论文:Qwen3-Omni Technical Report(arXiv<2509>.17765) 作者/机构:Jin Xu、Zhifang Guo、Hangrui Hu 等 / 阿里巴巴 Qwen 团队

2025 年 5 月,Qwen 团队把 Qwen3-Omni 的权重开源,四个月后的 9 月 22 日技术报告上 arXiv。这篇报告写的是一句很狂的话:单模型在文本、图像、音频、视频四个模态上同时保持 SOTA,且相对各单模态模型无任何退化。它用 Thinker-Talker 的 MoE 架构(30B-A3B)把感知与生成统一起来,冷启动端到端首包延迟 234 ms,在 36 个音频/音视频基准上拿到 32 项开源 SOTA、22 项总 SOTA,把 Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe 这些闭源选手都比了下去。这基本就是截至 2025 年开源音频多模态的天花板。


一、背景:Qwen 音频系列的三级跳#

Qwen3-Omni 不是石头缝里蹦出来的,它的血缘可以一路追到 2023 年:

  • Qwen-Audio(arXiv<2311>.07919,2023.11):统一音频理解的开山作。当时音频语言模型都只能干窄活,Qwen-Audio 把预训练扩到 30 多个任务,覆盖人声、自然声、音乐、歌曲,还解决了多任务共训时的”一对多干扰”问题——用**层级标签(hierarchical tags)**条件化解码器,共享标签促知识共享、专属标签防互相干扰。
  • Qwen2-Audio(arXiv<2407>.10759,2024.07):把复杂的层级标签简化成自然语言 prompt,数据量进一步扩大,并实现了两种交互模式——语音聊天(纯语音输入,不需要打字)和音频分析(音频 + 文本指令),两者切换不靠 system prompt,模型自己判断。加上 DPO 优化,在 AIR-Bench 上超过了 Gemini-1.5-pro。还顺带做了语音对话(voice chat)。

到 Qwen3-Omni,这棵树的果子成熟了:不再只是”音频理解 + 语音对话”,而是四模态全通、还能实时语音生成。

二、Thinker-Talker:想问题的和说话的,分开#

Qwen3-Omni 最核心的架构设计叫 Thinker-Talker(思考者-说话者),一个 MoE(混合专家)模型,总参数 30B,激活 3B(30B-A3B)。名字起得很形象:

  • Thinker(思考者):负责感知与推理——理解文本、图像、音频、视频输入,把四模态统一成一份”思考结果”。它是个标准 LLM,四模态的输入都汇到它这里;
  • Talker(说话者):负责把 Thinker 的思考转成实时语音。Talker 不是读 Thinker 输出的文字,而是直接读 Thinker 的隐状态(hidden states)——这样”怎么说”的音色、情感、停顿这些信息不会在文字序列化时丢掉。

这个分工在 Qwen2.5-Omni(arXiv<2503>.20215)里已经验证过,Qwen3-Omni 把它升级并做成 30B-A3B 的 MoE。Thinker 大而全管理解,Talker 小而快管生成,两边各司其职。

三、Talker 的多码本自回归与”因果 ConvNet”#

Talker 怎么做到实时流式?Qwen3-Omni 的方案是多码本(multi-codebook)自回归生成离散语音 codec,并且用了一个反直觉但极其高效的替换:把计算密集的 block-wise diffusion(逐块扩散)换成轻量因果卷积网络(causal ConvNet)

之前的方案(包括 Qwen 自家的 Qwen2.5-Omni)在生成语音 token 后,还要过一遍扩散模型去”精修”,这既慢又耗算力。Qwen3-Omni 发现:多码本自回归产出的 token 本身已携带足够强的表征,于是用一个轻量因果 ConvNet直接做流式映射,从第一个 codec 帧就开始出音频,不再等整块。正是这个改动,把冷启动端到端首包延迟压到了 234 ms(理论上),且是从零开始的冷启动场景——不是预热后的。

四、四模态无退化:最难的”什么都行”#

Qwen3-Omni 最让我服气的一句是”without any degradation relative to single-modal counterparts”——四模态能力全部在线,还不拖累彼此。这听起来简单,做起来极难:多模态训练最常见的结局是模态间互相干扰,音频学好了图像就掉,图像保住了文本又崩。

Qwen3-Omni 的解决思路是”匹配同尺寸单模态模型”——它的目标不是超过 Qwen 全尺寸旗舰,而是在 30B-A3B 这个体量上,让四模态能力都对齐 Qwen 系列同尺寸单模态模型的表现。结果就是:文本照常强,图像不拉胯,音频特别能打——36 个音频/音视频基准里 32 项开源 SOTA、22 项总 SOTA,甚至压过了 Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe 这些闭源重器。

五、语种覆盖:119 / 19 / 10#

多语种是三组数字:文本交互支持 119 种语言,语音理解支持 19 种,语音生成支持 10 种。这是目前开源语音多模态模型里少见的宽覆盖——文本 119 语种继承自 Qwen 的多语底子,语音侧的理解与生成则专门扩了语言。对做全球化语音应用的团队来说,这组数字直接决定能不能”开箱即用”。

六、Thinking 与 Captioner:两个支线#

报告还带了两件附赠品:

  1. Qwen3-Omni-30B-A3B-Thinking:一个显式推理版本,可以对任何模态的输入进行多步推理(chain-of-thought)。多模态问题的复杂度一上去,“先想后答”就是刚需;
  2. Qwen3-Omni-30B-A3B-Captioner:一个音频描述模型。社区一直缺一个通用的音频描述(audio captioning)模型,作者直接从 Qwen3-Omni 微调出一个,能对任意音频生成详细、低幻觉的文字描述。它顺手还解决了音频领域的”看图说话”缺失问题。

三个模型(基础版、Thinking、Captioner)全部 Apache 2.0 开源,商用友好度直接拉满。

收尾:我的一点看法#

Qwen3-Omni 的技术报告,与其说是介绍一个模型,不如说是给 2025 年的语音多模态定了调:单模态 SOTA 不是终点,多模态”全都要且不塌”才是。它 22 项总 SOTA 的成绩,放在开源圈是断层领先,放在整个行业(含闭源)也是第一梯队。Gemini-2.5-Pro 都被它压下去,含金量不用多说。

我最欣赏的是那个”因果 ConvNet 替掉扩散”的工程直觉。业界为了音质把扩散模型堆了又堆,Qwen3-Omni 却看穿了”多码本 token 已经够好,扩散是过剩的保险”这一点,砍掉它、省下算力、换回 234 ms 的首包延迟。这种”做减法换速度”的魄力,和 DeepSeek 砍辅助损失、砍 critic 是同一类气质。

局限也摆在明面上:30B-A3B 是”总参 30B、激活 3B”,开源的是 MoE,对部署框架(vLLM 等)有要求,个人开发者跑起来仍有门槛;首包延迟 234 ms 是冷启动理论值,真实网络下要打折;语音生成 10 语种和文本 119 语种之间的落差,说明语音侧的扩展仍是瓶颈。但瑕不掩瑜——它就是 2025 年开源语音多模态的那根标杆,后续论文都要拿它当参照系。


附:核心数据速查#

基本盘

项目数值
架构Thinker-Talker MoE,30B-A3B(总参 30B / 激活 3B)
模态文本 / 图像 / 音频 / 视频
延迟冷启动端到端首包 234 ms(理论值)
语种文本 119 / 语音理解 19 / 语音生成 10
时间线模型 2025.05 开源;技术报告 2025.09.22 提交
许可Apache 2.0(基础版 / Thinking / Captioner 三个模型)

核心创新

创新要点
Thinker-TalkerTalker 直接读 Thinker 隐状态生成语音,不丢副语言信息
多码本自回归 + 因果 ConvNet砍掉 block-wise diffusion,首个 codec 帧即开始流式
四模态无退化各模态对齐 Qwen 同尺寸单模态模型,互不拖累
Captioner从 Qwen3-Omni 微调出的通用低幻觉音频描述模型

关键成绩

  • 36 个音频/音视频基准:32 项开源 SOTA、22 项总 SOTA
  • 超越 Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe 等闭源模型
  • 音频任务为相对强项,同时文本/图像/视频不退化

Qwen 音频系列背景

模型arXiv要点
Qwen-Audio2311.07919(2023.11)30+ 任务统一音频理解,层级标签抗干扰
Qwen2-Audio2407.10759(2024.07)自然语言 prompt、语音聊天/音频分析双模式、AIR-Bench 超 Gemini-1.5-pro
Qwen3-Omni2509.17765(2025.09.22)四模态 Thinker-Talker,语音多模态天花板

关键概念清单

  • Thinker-Talker = 思考者-说话者双模块架构
  • MoE = Mixture of Experts,混合专家
  • 30B-A3B = 总参数 30B、激活 3B
  • hidden states = 隐状态(Thinker 传给 Talker 的中间表示)
  • multi-codebook = 多码本(语音离散化的多层表示)
  • causal ConvNet = 因果卷积网络
  • block-wise diffusion = 逐块扩散(被替代的重型精修模块)
  • first-packet latency = 首包延迟
  • chain-of-thought = 思维链 / 多步推理
  • audio captioning = 音频描述
  • SOTA = State-Of-The-Art,最优水平
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[语音多模态] Qwen3-Omni:四模态不退化
https://mizuki-eaf.pages.dev/posts/音频生成模型/语音多模态-qwen3-omni四模态不退化/
作者
无名之子
发布于
2026-08-05
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录