Qwen2-Audio 论文解读:一个模型,把语音、音乐、环境声全听了
论文:Qwen2-Audio Technical Report(arXiv<2407>2407>.10759,2024 年 7 月) 作者:Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv, Jinzheng He, Junyang Lin, Chang Zhou, Jingren Zhou(阿里 Qwen 团队)
一句话总结:把一个 Whisper-large-v3 挂在 Qwen-7B 前面,组成 8.2B 的音频语言模型,预训练标签全部换成自然语言提示,SFT 之后再上 DPO。结果就是:一个模型同时干 ASR、翻译、情感识别、声音场景分析等一堆活,还在 AIR-Bench 上把 Gemini-1.5-pro 按在身后。方案谈不上惊艳,但工程上很扎实,属于”把一个正确思路执行到位”的那种报告。
一、先搞清楚这是个什么东西
1. 音频理解,比大多数人想的要宽
一提”音频大模型”,很多人第一反应是语音识别(ASR)。但 Qwen 系列要做的不是这个。音频信号里至少有三类东西:语音(speech)、环境声(sound)、音乐(music)。键盘敲击声是什么键盘、这段 BGM 是什么风格、说话人语气是愤怒还是平静——这些都得懂。
Qwen-Audio 系列的路线一直是”统一架构”:初代 Qwen-Audio 就是用一套模型覆盖了 30+ 个数据集、30+ 项音频任务的训练,不搞任务级分类器,全部塞进一个自回归的语言模型里做。到了 Qwen2-Audio,这条路线没变,变的是一件事:怎么让模型更听话。
顺带说一句,音频理解在圈内的热度一直比不上视觉。原因也不复杂:图像有 CLIP 这种天然的图文对齐数据,网页上到处都是;而音频的”文字描述”稀缺,标注成本高,能拿到的大规模数据基本是语音转写这种单一形态。所以音频大模型想追上视觉大模型的进度,必须在”怎么用好有限数据”上多下功夫——这正是 Qwen2-Audio 这份报告真正在做的事。
2. 这篇报告的主线:指令跟随
论文引言里说得直白:Qwen2-Audio 的研发重点是增强指令跟随能力(instruction following)。输入是音频 + 文本,输出是文本。它支持两种交互方式——音频分析(audio-analysis) 和 语音聊天(audio-chat),而且用户不需要切换任何模式、不需要写 system prompt。
这个设计取舍很关键,后面第四章细说。
二、架构:Whisper-large-v3 + Qwen-7B,一共 8.2B
1. 整体结构:两块拼起来
Qwen2-Audio 的架构非常朴素,就两个组件:
- 音频编码器(audio encoder):初始化自 Whisper-large-v3;
- 大语言模型(LLM):底座是 Qwen-7B。
训练目标是标准的下一词预测(next-token prediction):给定音频表示和已有文本,最大化下一个 token 的概率。注意一点:编码器和语言模型都是可训练的,不是把 Whisper 冻住当纯特征提取器。
总参数量 8.2B。这个体量在 2024 年的多模态模型里属于”能在单机上好好干活”的档位。
2. 音频进模型之前经历了什么
预处理流程值得记一下,都是工程细节:
- 原始波形重采样到 16kHz;
- 转成 128 通道的梅尔频谱(mel spectrogram),窗口 25ms,帧移 10ms;
- 编码器里加了一个步长为 2 的池化层(pooling),把音频表示的长度再压缩一倍。
最终效果:编码器输出的每一帧约对应原始音频的 40ms。也就是说 1 分钟的音频进去,出来大约 1500 个 token——这个压缩率对 LLM 的上下文压力是相当友好的。
3. 为什么选 Whisper 当编码器
报告里没展开论证,但理由不难猜:Whisper-large-v3 在海量弱标注语音数据上训过,本身就是个极强的通用音频表征器;而且它天生支持多语言语音。初代 Qwen-Audio 用的是自研编码器,二代直接换成 Whisper-large-v3 初始化——这说明团队实测下来,站在成熟大模型的肩膀上比从头炼编码器划算。这也是 2023-2024 年多模态领域的普遍趋势:视觉侧大家都在用 CLIP/SigLIP,音频侧大家都在往 Whisper 上靠。
三、训练:三阶段,最关键的变化是”标签变成自然语言”
1. 预训练:扔掉层级标签
初代 Qwen-Audio 预训练时用的是复杂的层级标签(complex hierarchical labels)——给每个任务设计一套任务前缀、数据集前缀之类的结构化标记,告诉模型”现在做 ASR,数据集是 XX”。
Qwen2-Audio 把这套全扔了,改用自然语言提示(natural language prompts) 来组织和描述不同的数据与任务。打个比方:以前是给模型一套内部暗号,现在直接用人话告诉它”请把这段音频转写成文字”。
这个改动看着小,意义不小:它缩小了预训练和后训练之间的分布差异。初代模型预训练时见的是暗号,微调时见的是人话,中间有一道沟;二代从头到尾都在自然语言环境里泡着,泛化和指令跟随自然更顺。同时预训练数据规模也进一步扩大了。
2. SFT:质量和复杂度是关键
第二阶段是监督微调(SFT),把预训练模型转成可交互的聊天模型。论文在这里反复强调两个词:质量(quality) 和 复杂度(complexity)。SFT 数据经过严格的质量控制——这条经验其实和纯文本 LLM 圈子的共识完全一致:SFT 阶段拼的不是数据量,是数据的含金量。
3. DPO:事实性和行为遵循
第三阶段上 DPO(Direct Preference Optimization,直接偏好优化)。训练数据是三元组:一个输入序列、一条人类标注的较好回复(chosen)、一条较差回复(rejected)。优化时拿当前模型和一个参考模型对比,参考模型由当前模型初始化而来。
论文给 DPO 的定位很明确:提升事实性(factuality)和对期望行为的遵循(adherence to desired behavior)。翻译一下:让模型少胡说八道、少答非所问。对一个要”听懂音频再描述”的模型来说,音频幻觉(没听到的声音瞎描述)正是 DPO 该管的范畴。
为什么用 DPO 而不是传统 RLHF?做过对齐的都知道:RLHF 要先训一个奖励模型,再用 PPO 做强化学习,链路长、调参难、训练还不稳定。DPO 把这条链路压缩成一个有监督的偏好分类问题,稳定性好得多。2024 年的多模态模型后训练几乎集体倒向 DPO,Qwen2-Audio 算是跟上了主流打法。
四、双模式:audio-analysis 和 audio-chat,一套权重全搞定
这是全文我最欣赏的设计点。
1. 两种模式各管什么
- 音频分析(audio-analysis):偏离线场景。分析语音、环境声、音乐或混合音频,指令既可以打在文本里,也可以直接出现在音频里。模型需要自己识别出音频中哪段是指令、哪段是待分析内容。
- 语音聊天(audio-chat):偏在线场景。用户跟模型自由语音对话,随时可以切到文本交互。
2. 亮点:不需要 system prompt 切换
传统做法(包括初代 Qwen-Audio)往往靠 system prompt 告诉模型”你现在处于分析模式”还是”聊天模式”。Qwen2-Audio 把两种模式联合训练(jointly trained),使用时完全不用切换任何提示词。
论文给的例子很传神:一段音频先是键盘敲击声,然后有人开口问”这是什么声音?“。模型得意识到——前半段是待分析的内容,后半段是对它下的指令——然后回答”这是键盘声”。这要求模型对音频里的”内容”和”指令”做隐式切分,全靠训练出来的直觉,不靠外部开关。
这种设计对工程落地很友好:调用方不用维护模式状态机,一个接口吃所有场景。
3. 论文给的案例覆盖了哪些场景
报告的 case 部分展示了六类典型能力:围绕语音的自由聊天、围绕语音加自然环境声的聊天、语音分析(比如口音、说话风格)、环境声分析、音乐分析,以及混合音频分析中的鲁棒性。最后一类最有意思——真实世界的音频从来不是纯净的,背景音乐里掺着人说话、街道噪音里夹着语音指令,模型得在混响和干扰里把该听的东西听出来。这也是 AIR-Bench 单独设一个 Mixed-Audio 维度的原因。
五、跟初代 Qwen-Audio 比,到底改了什么
把改动列出来,一目了然:
| 维度 | Qwen-Audio(初代) | Qwen2-Audio |
|---|---|---|
| 预训练标签 | 复杂层级标签 | 自然语言提示 |
| 音频编码器 | 自研编码器 | 从 Whisper-large-v3 初始化 |
| 模式切换 | 需要 system prompt | 不需要,联合训练 |
| 后训练 | SFT | SFT + DPO |
| SFT 数据 | 常规规模 | 数量、质量、复杂度全面提升 |
性能上的直观对比(二代 vs 初代):
- Librispeech test-clean WER:2.0 → 1.6,test-other:4.2 → 3.6;
- CoVoST2 翻译:en-de BLEU 25.1 → 29.9,zh-en 15.7 → 24.4(这个涨幅相当夸张);
- AIR-Bench chat:Speech 6.47 → 7.18,Music 5.52 → 6.79,Mixed-Audio 6.08 → 6.77;
- VocalSound 人声分类:0.9289 → 0.9392。
一个例外:Meld 情感识别(SER) 上,Qwen2-Audio 是 0.553,反而略低于初代的 0.557。幅度很小,大概率在噪声范围内,但报告没藏着掖着,照实写了——这点值得好评。
六、成绩单:跟 SALMONN、Gemini-1.5-pro 掰手腕
论文特意说明:所有评测数据集都排除在训练数据之外,避免数据泄漏。另外,作者认为很多老 benchmark 脱离真实场景,所以把重头戏放在 AIR-Bench 上。下面按任务过一遍。
1. ASR:语音识别全面领先
Librispeech(WER,越低越好):
| 模型 | test-clean | test-other |
|---|---|---|
| SALMONN | 2.1 | 4.9 |
| SpeechVerse | 2.1 | 4.4 |
| Qwen-Audio | 2.0 | 4.2 |
| Qwen2-Audio | 1.6 | 3.6 |
Common Voice 15 上更有意思:中文 WER 6.9、粤语 5.9,而 Whisper-large-v3 分别是 12.8 和 10.9——几乎腰斩。不过论文很诚实地标注了:Whisper 在 CV15 上是零样本,Qwen2-Audio 不是。而在 Fleurs zh 上,双方都是零样本,Qwen2-Audio 7.5 对 Whisper 7.7,小幅胜出。这种把实验条件写清楚的报告,读着放心。
2. S2TT:七个翻译方向全部刷新
CoVoST2(BLEU,越高越好),对比最有代表性的几个:
| 方向 | SALMONN | Qwen-Audio | Qwen2-Audio |
|---|---|---|---|
| en-de | 18.6 | 25.1 | 29.9 |
| en-zh | 33.1 | 41.5 | 45.2 |
| zh-en | — | 15.7 | 24.4 |
七个方向(en-de、de-en、en-zh、zh-en、es-en、fr-en、it-en)全部显著超过基线。zh-en 从 15.7 到 24.4,提升了 55%,说明底座 LLM 的语言能力和编码器的语音表征一起升级了。
3. 声音与情感任务
- VocalSound(人声分类):Qwen2-Audio 0.9392,初代 0.9289,而专用模型 Pengi 只有 0.6035、CLAP 只有 0.4945。通用大模型在这类任务上已经是碾压级优势。
- Meld(情感识别):0.553,高于 WavLM-large 的 0.542,略低于初代 0.557。情感识别依然是块硬骨头,大家都啃得一般。
4. AIR-Bench:正面硬刚 Gemini-1.5-pro
AIR-Bench chat 用 GPT-4 自动评分(0-10 分),覆盖 Speech、Sound、Music、Mixed-Audio 四个维度:
| 模型 | Speech | Sound | Music | Mixed |
|---|---|---|---|---|
| Macaw-LLM | 0.97 | 1.01 | 0.91 | 1.01 |
| SpeechGPT | 1.57 | 0.95 | 0.95 | 4.13 |
| BLSP | 6.17 | 5.55 | 5.08 | 5.33 |
| SALMONN | 6.16 | 6.28 | 5.95 | 6.08 |
| Qwen-Audio | 6.47 | 6.95 | 5.52 | 6.08 |
| Gemini-1.5-pro | 6.97 | 5.49 | 5.06 | 5.27 |
| Qwen2-Audio | 7.18 | 6.99 | 6.79 | 6.77 |
四个维度全部第一,超过此前 SOTA Gemini-1.5-pro。尤其 Music(6.79 vs 5.06)和 Mixed-Audio(6.77 vs 5.27),领先幅度超过 1.5 分,在 GPT-4 打分的尺度上这是相当大的差距。
这张表还藏着一条有意思的领域演进线:Macaw-LLM、SpeechGPT 这些早期音频 LLM 得分在 1-4 分区间——基本属于”听不太懂还硬答”的水平;BLSP、SALMONN 这批拉到 5-6 分,能听懂但回答平庸;Qwen-Audio 站上 6 分档;到 Qwen2-Audio 和 Gemini-1.5-pro 才真正进入”可以当产品用”的 7 分附近。一年时间,从玩具到可用,音频这条赛道的迭代速度其实一点不慢。
要说公道话:论文注明 Gemini-1.5-pro 有约五分之一的样本因安全机制没能正常返回结果,这会影响它的分数。但即便打个折扣,Qwen2-Audio 在 Sound/Music/Mixed 上的领先也不是这点样本损耗能解释掉的。
七、局限与没说透的地方
客观起见,列几点这篇报告里没有解决的问题:
- 只有文本输出。Qwen2-Audio 听得懂但”不会说”,没有语音生成能力。要做端到端语音对话,还得外接 TTS,或者等后续的 Qwen2.5-Omni 那类全模态方案。
- 情感识别没进步。Meld 上 0.553 vs 初代 0.557,细粒度情感理解仍是短板。
- GPT-4 评分的天花板。AIR-Bench 用 GPT-4 当裁判,分数本身带裁判的偏见;裁判和选手还有可能同源。这是整个领域的评测通病,不独 Qwen 如此。
- 论文没细讲长音频。Whisper 编码器天然对输入长度敏感,报告对超长音频的处理策略着墨不多。
收尾:我的一点看法
Qwen2-Audio 这份报告,最大的价值不在某个单项 SOTA,而在于它把一个判断验证得很干净:音频理解不该做成任务集合,而该做成一个听懂人话的模型。预训练从层级标签换成自然语言提示、双模式联合训练去掉 system prompt——这两个动作指向同一件事:把”任务”这个概念从架构里抹掉,只留下”音频 + 指令 → 回答”。这才是通用音频理解该有的形态。
从工程角度看,它也是”借力”哲学的典型样本。编码器不从头炼,直接用 Whisper-large-v3;后训练不发明新算法,老老实实 SFT + DPO;评测不挑软柿子,直接上 AIR-Bench 硬碰 Gemini-1.5-pro。全篇没有一处炫技,但每一处都踩在正确的位置上。8.2B 的体量做出 AIR-Bench 四冠,性价比相当能打。
当然也要看到短板:只进不出(无音频生成)、情感识别原地踏步、评测依赖 GPT-4 打分。这些是 2024 年年中音频大模型的共性局限,Qwen2-Audio 也不例外。
如果让我给个定位:Qwen2-Audio 不是开创路线的论文,而是把”多任务音频 LLM”这条路修到可交付标准的里程碑。它之后的故事——全模态、端到端语音对话、实时交互——基本都是站在这类工作的地基上盖的。想入坑音频理解的同学,这份报告依然是最好的起点之一:架构简单到可以复述,数据诚实到可以直接引用。
附:核心数据速查
关键结果一览
| 任务 / Benchmark | 指标 | Qwen2-Audio | 主要对比 |
|---|---|---|---|
| Librispeech test-clean | WER↓ | 1.6 | Qwen-Audio 2.0 / SALMONN 2.1 |
| Librispeech test-other | WER↓ | 3.6 | Qwen-Audio 4.2 / SALMONN 4.9 |
| Common Voice 15 (zh / yue) | WER↓ | 6.9 / 5.9 | Whisper-large-v3 12.8 / 10.9(零样本) |
| Fleurs zh(双方零样本) | WER↓ | 7.5 | Whisper-large-v3 7.7 |
| Aishell2(Mic/iOS/Android) | WER↓ | 3.0 / 3.0 / 2.9 | Qwen-Audio 3.3 / 3.1 / 3.3 |
| CoVoST2 en-de | BLEU↑ | 29.9 | SALMONN 18.6 / Qwen-Audio 25.1 |
| CoVoST2 en-zh | BLEU↑ | 45.2 | SALMONN 33.1 / Qwen-Audio 41.5 |
| CoVoST2 zh-en | BLEU↑ | 24.4 | Qwen-Audio 15.7 |
| Meld(SER) | ACC↑ | 0.553 | Qwen-Audio 0.557 / WavLM-large 0.542 |
| VocalSound(VSC) | ACC↑ | 0.9392 | Pengi 0.6035 / CLAP 0.4945 |
| AIR-Bench Speech | GPT-4 分↑ | 7.18 | Gemini-1.5-pro 6.97 |
| AIR-Bench Sound | GPT-4 分↑ | 6.99 | Gemini-1.5-pro 5.49 |
| AIR-Bench Music | GPT-4 分↑ | 6.79 | Gemini-1.5-pro 5.06 |
| AIR-Bench Mixed-Audio | GPT-4 分↑ | 6.77 | Gemini-1.5-pro 5.27 |
模型配置速查
| 项目 | 配置 |
|---|---|
| 总参数量 | 8.2B |
| 音频编码器 | Whisper-large-v3 初始化,可训练 |
| 语言模型底座 | Qwen-7B |
| 音频预处理 | 16kHz 重采样 → 128 通道梅尔频谱(25ms 窗 / 10ms 帧移) |
| 压缩 | stride-2 池化,约 40ms 音频/token 帧 |
| 训练流程 | 预训练(自然语言提示)→ SFT → DPO |
| 交互模式 | audio-analysis + audio-chat,联合训练,免 system prompt |
概念清单
- ASR(Automatic Speech Recognition):自动语音识别,语音转文字
- S2TT(Speech-to-Text Translation):语音翻译
- SER(Speech Emotion Recognition):语音情感识别
- VSC(Vocal Sound Classification):人声分类
- AIR-Bench:音频信息检索与理解基准,chat 子集用 GPT-4 打分(0-10)
- DPO(Direct Preference Optimization):直接偏好优化,用 chosen/rejected 回复对对齐模型
- 梅尔频谱(Mel Spectrogram):按人耳感知尺度划分的时频表示,音频模型的标准输入
- 层级标签 → 自然语言提示:Qwen2-Audio 预训练的核心改动,消除预训练与微调之间的分布鸿沟
- 双模式联合训练:audio-analysis 与 audio-chat 共训于一套权重,无需 system prompt 切换
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





