AudioLDM 系列论文解读:不烧算力摸到 SOTA,一张 GPU 的”穷人之光”
论文:AudioLDM: Text-to-Audio Generation with Latent Diffusion Models(arXiv<2301>2301>.12503,2023.01.29,ICML 2023) 论文:AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining(arXiv<2308>2308>.05734,2023.08.10) 作者/机构:Haohe Liu、Yi Yuan、Xubo Liu、Xinhao Mei、Wenwu Wang、Mark D. Plumbley 等(英国萨里大学等,AudioLDM 2 合作方含腾讯云音等)
2023 年初的文生音频,画风是这样的:Meta 在训十亿级自回归语言模型,谷歌在叠分层流水线,大家默认”模型越大越好、参数量就是尊严”。而 AudioLDM 偏偏走了另一条路——用扩散模型,在潜在空间里做文章,训练只需要一张 GPU。它的关键洞察是:不必让模型自己从头学”文本和音频怎么对应”,而是直接把 CLAP 这个预训练好的”文本-音频联合嵌入”模型拿来当条件。论文摘要的原话是”在 CLAP 潜在空间上学习连续的音频表征”,就这么一手,AudioLDM 在 AudioCaps 上拿单卡训出的结果居然直接摸到了当时 SOTA,还是第一个能做零样本音频风格迁移的 TTS 之外模型。一年之后它升级成 AudioLDM 2,把”文本”彻底概念化成了一种叫”语言化音频”(LOA)的中间表示,试图用一个框架统一语音、音乐和音效。这条”重表示、轻参数量”的路线,跟 Meta/OpenAI 的”大力出奇迹”形成了 2023 年最精彩的一对对照。
一、AudioLDM:把扩散模型搬进音频潜在空间
AudioLDM 是个标准的潜在扩散模型(Latent Diffusion Model, LDM),跟图像那边 Stable Diffusion 的套路几乎一模一样,只是换成了音频。流程分两步:
先训一个音频 VAE,把波形编码进一个低维潜在空间(latent space)——这不改变序列长度,主要做维度压缩,让扩散模型在小得多、稳得多的空间里学。
再训扩散模型,在潜在空间上从纯噪声逐步”去噪”生成目标表征,条件是文本。这里就是 AudioLDM 最精妙的一笔:它不做跨模态关系建模,而是用预训练好的 CLAP(Contrastive Language-Audio Pretraining,对比式语言-音频预训练) 模型——CLAP 把文本和音频各自嵌入到同一个向量空间,对齐了”文字描述的语义”和”声音的语义”。AudioLDM 的做法是:训练时拿音频的 CLAP 嵌入当扩散模型的输入条件,推理时换成语义的 CLAP 嵌入。因为文本和音频在 CLAP 空间里本来就是对齐的,模型甚至不需要真正理解”文本长什么样”,它只要学会”在 CLAP 音频嵌入附近生成音频”就完事。这一招让模型既省钱又学得快。
效果是实打实的:在 AudioCaps(音效-文本配对数据集)上用单张 GPU 训练,客观指标(比如 FAD,弗雷歇距离)和主观评测都达到了当时 SOTA。而且因为 CLAP 嵌入自带跨模态语义,AudioLDM 天然支持零样本文本引导音频编辑——比如把一段音频的风格从”教室”迁移成”露天市场”,不需要为每个任务重新训练。这是当时其他文生音频系统做不到的。论文 2023 年 1 月投出,同年被 ICML 2023 接收。
二、为什么值得在意:它证明了”条件设计”比”规模”更值钱
读 AudioLDM 的爽点在于,它用最小成本打脸了”必须堆参数”的直觉。当时的自回归模型(AudioGen、MusicGen 的前辈们)动辄上亿参数,还要为每个码本绞尽脑汁设计交错策略;而 AudioLDM 只是把扩散模型的”外部条件”从朴素文本编码换成 CLAP 嵌入,训练成本就压到单卡级别,性能还追平甚至反超。这背后其实是一个普遍规律:生成模型最难学的是”条件和解空间的对齐”,如果你能用一个预训练模型把这个对齐提前解决掉,扩散模型只需要专注于”在潜在空间里画图”。这个思路后来被 Stable Audio、Stable Audio Open 等一堆扩散系音频模型继承,成了图像扩散进音频的”标准搬运姿势”。
三、AudioLDM 2:把音频翻译成”一种语言”
AudioLDM 2 是同一拨人(萨里 + 腾讯云音等)在 2023 年 8 月的续作,野心更大:不满足于”文生音效”,它想用一个框架统一语音、音乐、音效三种生成。它的立论是——这些音频类型不该各自训一个模型,因为底层共享很多结构,分开训是浪费。
解决方案是提出一个中间表示叫 LOA(Language of Audio,“音频的语言”)。任何音频都可以先被 AudioMAE——一个自监督预训练的音频表征模型——翻译成 LOA。然后在生成侧:任意模态(文本、音频等)的输入,先由一个 GPT-2 模型翻译成 LOA 描述,再交给一个以 LOA 为条件的潜在扩散模型(LDM) 做生成。这样一来,“生成音频”被拆成了两步走:先想办法把条件变成 LOA,再在 LOA 条件下去噪出音频。
这套设计带来两个白送的福利:一是上下文学习(in-context learning)能力——因为 GPT-2 是语言模型,它天然能理解”连续多段指令、参考示例”这类结构,音频输入也能被”说成”LOA;二是可复用性——AudioMAE 和 LDM 都是自监督预训练出来的,换个任务不用从头训。实验上,AudioLDM 2 在文生音效、文生音乐、文生语音三个主流基准上都做到了 SOTA 或接近 SOTA。模型规模约 1.1–1.5B 参数(用户侧核验口径 ⚠️,论文未给出单一明确数字),比同期的自回归大模型小,靠的还是表示设计的巧劲。
四、两代模型的关系:从”打脸规模论”到”统一表示论”
把两代连起来看,AudioLDM 系列的演进主线其实只有一条:用预训练表示把”条件理解”外包出去,让生成模型只做生成。第一代外包给 CLAP(解决文本-音频对齐),第二代外包给 AudioMAE(把任意音频变成统一语言)+ GPT-2(把任意条件翻译成这种语言)+ LDM(在这门语言条件下生成)。区别只是外包的对象和覆盖范围扩大了——从”文生音效”这一个任务,扩张到”一切音频类型、一切输入模态”。
这条路和 Meta 的”EnCodec token + 语言模型”路线殊途同归:Meta 把音频变成”离散 token 的语言”,AudioLDM 2 把音频变成”连续语义的 LOA”,两者本质上都是”先定义一种音频的内部语言,再让生成器学会说这门语言”。区别在于,Meta 的语言模型是要”从零学会说话”,AudioLDM 2 是”请 GPT-2 当翻译、扩散模型当播音员”,后者在参数量和推理成本上明显更省。
收尾:我的一点看法
AudioLDM 系列最大的贡献,是提醒整个圈子:音频生成的瓶颈往往不在”模型规模”,而在”条件与表示的耦合设计”。CLAP 这一手在当时几乎是四两拨千斤——别人在疯狂堆 GPU 训 AR 模型,它用一张卡把最难的”文本理解”外包给现成嵌入模型,性能还不落下风。这种”借力预训练”的思路,跟后来把大语言模型当条件编码器用的各种工作是一脉相承的。
当然缺点也要认:扩散模型在长序列、长时间连贯音乐上一直有短板,AudioLDM 2 虽号称统一,但音乐这块的竞争力明显弱于 MusicGen 那种为音乐特调的模型;“统一”更多是工程复用意义上的统一,不是每个子任务的单项冠军。另外 1.1–1.5B 的参数量口径在论文里并不直观,引用时得标注清楚。但作为”低成本、巧表示”路线的代表,AudioLDM 系列在 2023 年留下的方法论,到今天依然管用。
附:核心数据速查
基本盘
| 项目 | AudioLDM | AudioLDM 2 |
|---|---|---|
| 论文 | arXiv<2301>2301>.12503(2023.01.29,ICML 2023) | arXiv<2308>2308>.05734(2023.08.10) |
| 机构 | 萨里大学等 | 萨里大学、腾讯云音等 |
| 范式 | CLAP 条件潜在扩散(LDM) | LOA(AudioMAE + GPT-2)+ LDM |
| 训练成本 | 单 GPU 可训练(AudioCaps) | ⚠️ 论文未给出明确数字 |
| 参数量 | ⚠️ 未给出单一数值 | 约 1.1–1.5B(⚠️ 口径需注意) |
| 覆盖任务 | 文生音效 + 零样本音频编辑 | 语音 / 音乐 / 音效统一生成 |
核心创新
| 创新 | 要点 |
|---|---|
| CLAP 条件 | 用预训练文本-音频联合嵌入当条件,免跨模态建模 |
| 潜在空间扩散 | LDM 在压缩潜在空间生成,训练省、生成快 |
| 零样本音频编辑 | 文本引导风格迁移/音频操作,无需逐任务训练 |
| LOA(Language of Audio) | AudioMAE 把任意音频翻译成统一”音频语言” |
| GPT-2 翻译条件 | 任意模态输入先翻译成 LOA,再做扩散生成 |
| 自监督预训练复用 | AudioMAE 与 LDM 均可复用、支持上下文学习 |
关键成绩
- AudioLDM 单 GPU 训练即达当时文生音频 SOTA(AudioCaps 主客观指标)
- 首个支持零样本文本引导音频操作(如风格迁移)的文生音频系统
- AudioLDM 2 在文生音效/音乐/语音三大基准上 SOTA 或接近 SOTA
关键概念清单
- LDM = Latent Diffusion Model,潜在扩散模型
- CLAP = Contrastive Language-Audio Pretraining,对比式语言-音频预训练
- latent space = 潜在空间,压缩后的低维表示空间
- AudioCaps = 音频-文本配对数据集(音效方向)
- LOA = Language of Audio,“音频的语言”中间表示
- AudioMAE = 自监督音频表征预训练模型
- FAD = Frechet Audio Distance,弗雷歇音频距离
- zero-shot = 零样本,不针对该任务训练即可完成
- in-context learning = 上下文学习,模型从提示中的示例/指令现场学习
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





