mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4702 字
13 分钟
Qwen2-Audio:语音音乐一把抓
2026-07-23

Qwen2-Audio 论文解读:一个模型,把语音、音乐、环境声全听了#

论文:Qwen2-Audio Technical Report(arXiv<2407>.10759,2024 年 7 月) 作者:Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv, Jinzheng He, Junyang Lin, Chang Zhou, Jingren Zhou(阿里 Qwen 团队)

一句话总结:把一个 Whisper-large-v3 挂在 Qwen-7B 前面,组成 8.2B 的音频语言模型,预训练标签全部换成自然语言提示,SFT 之后再上 DPO。结果就是:一个模型同时干 ASR、翻译、情感识别、声音场景分析等一堆活,还在 AIR-Bench 上把 Gemini-1.5-pro 按在身后。方案谈不上惊艳,但工程上很扎实,属于”把一个正确思路执行到位”的那种报告。

一、先搞清楚这是个什么东西#

1. 音频理解,比大多数人想的要宽#

一提”音频大模型”,很多人第一反应是语音识别(ASR)。但 Qwen 系列要做的不是这个。音频信号里至少有三类东西:语音(speech)环境声(sound)音乐(music)。键盘敲击声是什么键盘、这段 BGM 是什么风格、说话人语气是愤怒还是平静——这些都得懂。

Qwen-Audio 系列的路线一直是”统一架构”:初代 Qwen-Audio 就是用一套模型覆盖了 30+ 个数据集、30+ 项音频任务的训练,不搞任务级分类器,全部塞进一个自回归的语言模型里做。到了 Qwen2-Audio,这条路线没变,变的是一件事:怎么让模型更听话

顺带说一句,音频理解在圈内的热度一直比不上视觉。原因也不复杂:图像有 CLIP 这种天然的图文对齐数据,网页上到处都是;而音频的”文字描述”稀缺,标注成本高,能拿到的大规模数据基本是语音转写这种单一形态。所以音频大模型想追上视觉大模型的进度,必须在”怎么用好有限数据”上多下功夫——这正是 Qwen2-Audio 这份报告真正在做的事。

2. 这篇报告的主线:指令跟随#

论文引言里说得直白:Qwen2-Audio 的研发重点是增强指令跟随能力(instruction following)。输入是音频 + 文本,输出是文本。它支持两种交互方式——音频分析(audio-analysis)语音聊天(audio-chat),而且用户不需要切换任何模式、不需要写 system prompt。

这个设计取舍很关键,后面第四章细说。

二、架构:Whisper-large-v3 + Qwen-7B,一共 8.2B#

1. 整体结构:两块拼起来#

Qwen2-Audio 的架构非常朴素,就两个组件:

  • 音频编码器(audio encoder):初始化自 Whisper-large-v3
  • 大语言模型(LLM):底座是 Qwen-7B

训练目标是标准的下一词预测(next-token prediction):给定音频表示和已有文本,最大化下一个 token 的概率。注意一点:编码器和语言模型都是可训练的,不是把 Whisper 冻住当纯特征提取器。

总参数量 8.2B。这个体量在 2024 年的多模态模型里属于”能在单机上好好干活”的档位。

2. 音频进模型之前经历了什么#

预处理流程值得记一下,都是工程细节:

  1. 原始波形重采样到 16kHz
  2. 转成 128 通道的梅尔频谱(mel spectrogram),窗口 25ms,帧移 10ms;
  3. 编码器里加了一个步长为 2 的池化层(pooling),把音频表示的长度再压缩一倍。

最终效果:编码器输出的每一帧约对应原始音频的 40ms。也就是说 1 分钟的音频进去,出来大约 1500 个 token——这个压缩率对 LLM 的上下文压力是相当友好的。

3. 为什么选 Whisper 当编码器#

报告里没展开论证,但理由不难猜:Whisper-large-v3 在海量弱标注语音数据上训过,本身就是个极强的通用音频表征器;而且它天生支持多语言语音。初代 Qwen-Audio 用的是自研编码器,二代直接换成 Whisper-large-v3 初始化——这说明团队实测下来,站在成熟大模型的肩膀上比从头炼编码器划算。这也是 2023-2024 年多模态领域的普遍趋势:视觉侧大家都在用 CLIP/SigLIP,音频侧大家都在往 Whisper 上靠。

三、训练:三阶段,最关键的变化是”标签变成自然语言”#

1. 预训练:扔掉层级标签#

初代 Qwen-Audio 预训练时用的是复杂的层级标签(complex hierarchical labels)——给每个任务设计一套任务前缀、数据集前缀之类的结构化标记,告诉模型”现在做 ASR,数据集是 XX”。

Qwen2-Audio 把这套全扔了,改用自然语言提示(natural language prompts) 来组织和描述不同的数据与任务。打个比方:以前是给模型一套内部暗号,现在直接用人话告诉它”请把这段音频转写成文字”。

这个改动看着小,意义不小:它缩小了预训练和后训练之间的分布差异。初代模型预训练时见的是暗号,微调时见的是人话,中间有一道沟;二代从头到尾都在自然语言环境里泡着,泛化和指令跟随自然更顺。同时预训练数据规模也进一步扩大了。

2. SFT:质量和复杂度是关键#

第二阶段是监督微调(SFT),把预训练模型转成可交互的聊天模型。论文在这里反复强调两个词:质量(quality)复杂度(complexity)。SFT 数据经过严格的质量控制——这条经验其实和纯文本 LLM 圈子的共识完全一致:SFT 阶段拼的不是数据量,是数据的含金量。

3. DPO:事实性和行为遵循#

第三阶段上 DPO(Direct Preference Optimization,直接偏好优化)。训练数据是三元组:一个输入序列、一条人类标注的较好回复(chosen)、一条较差回复(rejected)。优化时拿当前模型和一个参考模型对比,参考模型由当前模型初始化而来。

论文给 DPO 的定位很明确:提升事实性(factuality)和对期望行为的遵循(adherence to desired behavior)。翻译一下:让模型少胡说八道、少答非所问。对一个要”听懂音频再描述”的模型来说,音频幻觉(没听到的声音瞎描述)正是 DPO 该管的范畴。

为什么用 DPO 而不是传统 RLHF?做过对齐的都知道:RLHF 要先训一个奖励模型,再用 PPO 做强化学习,链路长、调参难、训练还不稳定。DPO 把这条链路压缩成一个有监督的偏好分类问题,稳定性好得多。2024 年的多模态模型后训练几乎集体倒向 DPO,Qwen2-Audio 算是跟上了主流打法。

四、双模式:audio-analysis 和 audio-chat,一套权重全搞定#

这是全文我最欣赏的设计点。

1. 两种模式各管什么#

  • 音频分析(audio-analysis):偏离线场景。分析语音、环境声、音乐或混合音频,指令既可以打在文本里,也可以直接出现在音频里。模型需要自己识别出音频中哪段是指令、哪段是待分析内容。
  • 语音聊天(audio-chat):偏在线场景。用户跟模型自由语音对话,随时可以切到文本交互。

2. 亮点:不需要 system prompt 切换#

传统做法(包括初代 Qwen-Audio)往往靠 system prompt 告诉模型”你现在处于分析模式”还是”聊天模式”。Qwen2-Audio 把两种模式联合训练(jointly trained),使用时完全不用切换任何提示词。

论文给的例子很传神:一段音频先是键盘敲击声,然后有人开口问”这是什么声音?“。模型得意识到——前半段是待分析的内容,后半段是对它下的指令——然后回答”这是键盘声”。这要求模型对音频里的”内容”和”指令”做隐式切分,全靠训练出来的直觉,不靠外部开关。

这种设计对工程落地很友好:调用方不用维护模式状态机,一个接口吃所有场景。

3. 论文给的案例覆盖了哪些场景#

报告的 case 部分展示了六类典型能力:围绕语音的自由聊天、围绕语音加自然环境声的聊天、语音分析(比如口音、说话风格)、环境声分析、音乐分析,以及混合音频分析中的鲁棒性。最后一类最有意思——真实世界的音频从来不是纯净的,背景音乐里掺着人说话、街道噪音里夹着语音指令,模型得在混响和干扰里把该听的东西听出来。这也是 AIR-Bench 单独设一个 Mixed-Audio 维度的原因。

五、跟初代 Qwen-Audio 比,到底改了什么#

把改动列出来,一目了然:

维度Qwen-Audio(初代)Qwen2-Audio
预训练标签复杂层级标签自然语言提示
音频编码器自研编码器从 Whisper-large-v3 初始化
模式切换需要 system prompt不需要,联合训练
后训练SFTSFT + DPO
SFT 数据常规规模数量、质量、复杂度全面提升

性能上的直观对比(二代 vs 初代):

  • Librispeech test-clean WER:2.0 → 1.6,test-other:4.2 → 3.6
  • CoVoST2 翻译:en-de BLEU 25.1 → 29.9,zh-en 15.7 → 24.4(这个涨幅相当夸张);
  • AIR-Bench chat:Speech 6.47 → 7.18,Music 5.52 → 6.79,Mixed-Audio 6.08 → 6.77
  • VocalSound 人声分类:0.9289 → 0.9392

一个例外:Meld 情感识别(SER) 上,Qwen2-Audio 是 0.553,反而略低于初代的 0.557。幅度很小,大概率在噪声范围内,但报告没藏着掖着,照实写了——这点值得好评。

六、成绩单:跟 SALMONN、Gemini-1.5-pro 掰手腕#

论文特意说明:所有评测数据集都排除在训练数据之外,避免数据泄漏。另外,作者认为很多老 benchmark 脱离真实场景,所以把重头戏放在 AIR-Bench 上。下面按任务过一遍。

1. ASR:语音识别全面领先#

Librispeech(WER,越低越好):

模型test-cleantest-other
SALMONN2.14.9
SpeechVerse2.14.4
Qwen-Audio2.04.2
Qwen2-Audio1.63.6

Common Voice 15 上更有意思:中文 WER 6.9、粤语 5.9,而 Whisper-large-v3 分别是 12.8 和 10.9——几乎腰斩。不过论文很诚实地标注了:Whisper 在 CV15 上是零样本,Qwen2-Audio 不是。而在 Fleurs zh 上,双方都是零样本,Qwen2-Audio 7.5 对 Whisper 7.7,小幅胜出。这种把实验条件写清楚的报告,读着放心。

2. S2TT:七个翻译方向全部刷新#

CoVoST2(BLEU,越高越好),对比最有代表性的几个:

方向SALMONNQwen-AudioQwen2-Audio
en-de18.625.129.9
en-zh33.141.545.2
zh-en15.724.4

七个方向(en-de、de-en、en-zh、zh-en、es-en、fr-en、it-en)全部显著超过基线。zh-en 从 15.7 到 24.4,提升了 55%,说明底座 LLM 的语言能力和编码器的语音表征一起升级了。

3. 声音与情感任务#

  • VocalSound(人声分类):Qwen2-Audio 0.9392,初代 0.9289,而专用模型 Pengi 只有 0.6035、CLAP 只有 0.4945。通用大模型在这类任务上已经是碾压级优势。
  • Meld(情感识别):0.553,高于 WavLM-large 的 0.542,略低于初代 0.557。情感识别依然是块硬骨头,大家都啃得一般。

4. AIR-Bench:正面硬刚 Gemini-1.5-pro#

AIR-Bench chat 用 GPT-4 自动评分(0-10 分),覆盖 Speech、Sound、Music、Mixed-Audio 四个维度:

模型SpeechSoundMusicMixed
Macaw-LLM0.971.010.911.01
SpeechGPT1.570.950.954.13
BLSP6.175.555.085.33
SALMONN6.166.285.956.08
Qwen-Audio6.476.955.526.08
Gemini-1.5-pro6.975.495.065.27
Qwen2-Audio7.186.996.796.77

四个维度全部第一,超过此前 SOTA Gemini-1.5-pro。尤其 Music(6.79 vs 5.06)和 Mixed-Audio(6.77 vs 5.27),领先幅度超过 1.5 分,在 GPT-4 打分的尺度上这是相当大的差距。

这张表还藏着一条有意思的领域演进线:Macaw-LLM、SpeechGPT 这些早期音频 LLM 得分在 1-4 分区间——基本属于”听不太懂还硬答”的水平;BLSP、SALMONN 这批拉到 5-6 分,能听懂但回答平庸;Qwen-Audio 站上 6 分档;到 Qwen2-Audio 和 Gemini-1.5-pro 才真正进入”可以当产品用”的 7 分附近。一年时间,从玩具到可用,音频这条赛道的迭代速度其实一点不慢。

要说公道话:论文注明 Gemini-1.5-pro 有约五分之一的样本因安全机制没能正常返回结果,这会影响它的分数。但即便打个折扣,Qwen2-Audio 在 Sound/Music/Mixed 上的领先也不是这点样本损耗能解释掉的。

七、局限与没说透的地方#

客观起见,列几点这篇报告里没有解决的问题:

  1. 只有文本输出。Qwen2-Audio 听得懂但”不会说”,没有语音生成能力。要做端到端语音对话,还得外接 TTS,或者等后续的 Qwen2.5-Omni 那类全模态方案。
  2. 情感识别没进步。Meld 上 0.553 vs 初代 0.557,细粒度情感理解仍是短板。
  3. GPT-4 评分的天花板。AIR-Bench 用 GPT-4 当裁判,分数本身带裁判的偏见;裁判和选手还有可能同源。这是整个领域的评测通病,不独 Qwen 如此。
  4. 论文没细讲长音频。Whisper 编码器天然对输入长度敏感,报告对超长音频的处理策略着墨不多。

收尾:我的一点看法#

Qwen2-Audio 这份报告,最大的价值不在某个单项 SOTA,而在于它把一个判断验证得很干净:音频理解不该做成任务集合,而该做成一个听懂人话的模型。预训练从层级标签换成自然语言提示、双模式联合训练去掉 system prompt——这两个动作指向同一件事:把”任务”这个概念从架构里抹掉,只留下”音频 + 指令 → 回答”。这才是通用音频理解该有的形态。

从工程角度看,它也是”借力”哲学的典型样本。编码器不从头炼,直接用 Whisper-large-v3;后训练不发明新算法,老老实实 SFT + DPO;评测不挑软柿子,直接上 AIR-Bench 硬碰 Gemini-1.5-pro。全篇没有一处炫技,但每一处都踩在正确的位置上。8.2B 的体量做出 AIR-Bench 四冠,性价比相当能打。

当然也要看到短板:只进不出(无音频生成)、情感识别原地踏步、评测依赖 GPT-4 打分。这些是 2024 年年中音频大模型的共性局限,Qwen2-Audio 也不例外。

如果让我给个定位:Qwen2-Audio 不是开创路线的论文,而是把”多任务音频 LLM”这条路修到可交付标准的里程碑。它之后的故事——全模态、端到端语音对话、实时交互——基本都是站在这类工作的地基上盖的。想入坑音频理解的同学,这份报告依然是最好的起点之一:架构简单到可以复述,数据诚实到可以直接引用。

附:核心数据速查#

关键结果一览#

任务 / Benchmark指标Qwen2-Audio主要对比
Librispeech test-cleanWER↓1.6Qwen-Audio 2.0 / SALMONN 2.1
Librispeech test-otherWER↓3.6Qwen-Audio 4.2 / SALMONN 4.9
Common Voice 15 (zh / yue)WER↓6.9 / 5.9Whisper-large-v3 12.8 / 10.9(零样本)
Fleurs zh(双方零样本)WER↓7.5Whisper-large-v3 7.7
Aishell2(Mic/iOS/Android)WER↓3.0 / 3.0 / 2.9Qwen-Audio 3.3 / 3.1 / 3.3
CoVoST2 en-deBLEU↑29.9SALMONN 18.6 / Qwen-Audio 25.1
CoVoST2 en-zhBLEU↑45.2SALMONN 33.1 / Qwen-Audio 41.5
CoVoST2 zh-enBLEU↑24.4Qwen-Audio 15.7
Meld(SER)ACC↑0.553Qwen-Audio 0.557 / WavLM-large 0.542
VocalSound(VSC)ACC↑0.9392Pengi 0.6035 / CLAP 0.4945
AIR-Bench SpeechGPT-4 分↑7.18Gemini-1.5-pro 6.97
AIR-Bench SoundGPT-4 分↑6.99Gemini-1.5-pro 5.49
AIR-Bench MusicGPT-4 分↑6.79Gemini-1.5-pro 5.06
AIR-Bench Mixed-AudioGPT-4 分↑6.77Gemini-1.5-pro 5.27

模型配置速查#

项目配置
总参数量8.2B
音频编码器Whisper-large-v3 初始化,可训练
语言模型底座Qwen-7B
音频预处理16kHz 重采样 → 128 通道梅尔频谱(25ms 窗 / 10ms 帧移)
压缩stride-2 池化,约 40ms 音频/token 帧
训练流程预训练(自然语言提示)→ SFT → DPO
交互模式audio-analysis + audio-chat,联合训练,免 system prompt

概念清单#

  • ASR(Automatic Speech Recognition):自动语音识别,语音转文字
  • S2TT(Speech-to-Text Translation):语音翻译
  • SER(Speech Emotion Recognition):语音情感识别
  • VSC(Vocal Sound Classification):人声分类
  • AIR-Bench:音频信息检索与理解基准,chat 子集用 GPT-4 打分(0-10)
  • DPO(Direct Preference Optimization):直接偏好优化,用 chosen/rejected 回复对对齐模型
  • 梅尔频谱(Mel Spectrogram):按人耳感知尺度划分的时频表示,音频模型的标准输入
  • 层级标签 → 自然语言提示:Qwen2-Audio 预训练的核心改动,消除预训练与微调之间的分布鸿沟
  • 双模式联合训练:audio-analysis 与 audio-chat 共训于一套权重,无需 system prompt 切换
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Qwen2-Audio:语音音乐一把抓
https://mizuki-eaf.pages.dev/posts/qwen/qwen2-audio语音音乐一把抓/
作者
无名之子
发布于
2026-07-23
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录