mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2720 字
7 分钟
[音乐生成] Audiobox:通吃三种声音
2026-07-07

Audiobox 论文解读:一个模型包圆语音、音效、音乐,还顺手快了 25 倍#

论文:Audiobox: Unified Audio Generation with Natural Language Prompts 作者/机构:Apoorv Vyas 等(Meta AI / FAIR) 这是 Meta 在 2023 年 12 月底(arXiv<2312>.15821,2023.12.25 提交)放出的”全家桶”模型。Voicebox 的兄弟篇——Meta 刚在 6 月用 Voicebox 把语音合成带进流匹配(flow matching)时代,转头就用 Audiobox 告诉你:别盯着单一模态了,语音、音效、音乐,一个模型都能干,而且你想让”谁在说话""在什么场景”说了算都行。论文给的核心数字是零样本 TTS 说话人相似度 0.745、文本到音效在 AudioCaps 上 FAD 0.77,外加一个让生成提速 25 倍以上的 Bespoke Solvers。读它,等于把 2023 年音频生成最前沿的”统一化”路线图拿到手。


一、背景:2023 年底,音频生成卡在哪儿#

到 2023 年底,音频生成已经分成了泾渭分明的三条线:语音合成(TTS)有 VALL-E、Voicebox、NaturalSpeech 2,音效有 AudioGen、AudioLDM,音乐有 MusicGen、MusicLM、Stable Audio。每个模态一个模型,各有各的得意和短板。

但三条线各有各的”不痛快”:

  • 语音:模型能克隆音色,但你想让声音带上”在空旷室外""像广播腔”这种描述性风格?做不到,只能靠几秒参考音频暗示;
  • 音效:文本控制非常粗糙。你说”一个人在说话”,它真就给你生成一段含含糊糊的人声嘟囔,控制粒度约等于没有;
  • 音乐:这当时还不算 Audiobox 的主战场,但同样的”单模态各自为政”问题一样存在。

Audiobox 想干的事很朴素:一个模型,三种音频模态,用自然语言当遥控器。这在当时是相当激进的目标。

二、整体思路:流匹配统一三模态#

方法底座还是 Meta 自己趟出来的老路——流匹配(flow matching),跟 Voicebox 一脉相承。流匹配相比扩散模型的一个好处是采样步数少、生成快,而且对”补全”这类条件任务特别友好。

真正的新意在于”统一”二字:

  • 一个框架内同时做语音音效音乐三种模态的生成;
  • 把”描述提示”和”示例提示”两种输入形式统一起来,文字、音频都能当条件;
  • 语音生成时,文本内容、音色、风格三者解耦,分别可控。

三、两大控制机制:描述式提示与示例式提示#

论文提出了两种提示方式,这是 Audiobox 控制能力的关键:

  1. 描述式提示(description-based prompting):用自然语言描述要什么,比如”一位女性在嘈杂街道上以广播腔念新闻”。语音模型会把它解析成独立的**音色(vocal timbre)风格(style)**表征;
  2. 示例式提示(example-based prompting):给一段参考音频,模型提取它的声学特征作为条件——这就是传统零样本 TTS 的那套玩法,VALL-E 靠 3 秒提示就能克隆音色。

妙处在于 Audiobox 把两者对齐了:同一个模型里,文字描述和音频示例会被映射到同一个条件空间,于是你可以”用一段示例定音色,再用文字定风格”,交叉组合。语音生成时文本(transcript)、音色(vocal)、风格(style)三个因素被显式建模成互相独立的条件——说”让女声用男声的音色”这种玩法在结构上就变得可能。

四、核心训练技巧:自监督 infilling 预训练#

有限标注数据是音频生成的通病,Audiobox 的解法是自监督填充(self-supervised infilling)目标

简单说:把一段音频的中间部分挖掉,让模型自己把它”补”出来。这套训练方式继承自 Voicebox,好处是不需要标注就能在大量无标签音频上预训练,让模型在缺条件、弱对齐的情况下也能干活。它也是流匹配模型的天然任务——填充本质上是”给定上下文与提示,预测被遮住的部分”,跟”给定提示生成整段”是同一个能力的不同用法。

这套”先自监督预训练、再任务适配”的配方,保证了模型在标签稀缺时还能有不错的泛化。

五、Bespoke Solvers:提速 25 倍#

论文里最”工程向”的部分是 Bespoke Solvers(定制求解器)

流匹配生成要走 ODE 求解(数值积分,把连续变换逐步解出来),默认求解器步数多、耗时长。Audiobox 的做法是:先拿训练好的模型跑一批真实轨迹,学一个专门的、步数更少的求解器来替代默认求解器——相当于给这条模型”量身定制”了一条更短的路径。结果是生成速度比默认 ODE 求解器快 25 倍以上,而且论文称在多个任务上性能不损失。这一手在当年挺超前,后来”为特定模型蒸馏/定制采样器”成了音频生成的常规操作。

六、成绩单:三线作战,各有斩获#

论文报告的核心成绩:

  • 零样本 TTS:LibriSpeech 上说话人相似度 0.745,同时支持用文字描述来指定全新声学风格——“没见过但能造出来”;
  • 文本到音效:AudioCaps 上 FAD 0.77。FAD(Fréchet Audio Distance)是衡量生成音频与真实音频分布差距的指标,越低越好,0.77 在当时是很能打的成绩;
  • 统一生成范式:语音、音效(以及音乐)在一个流匹配框架里统一,支持描述与示例两种提示的混合控制。

Meta 还为它配了在线 Demo(audiobox.metademolab.com),把”自然语言造音频”这个卖点直接摆到用户面前。

收尾:我的一点看法#

Audiobox 在技术史上有点像”承上启下”的角色。承上:它是 Voicebox 那套流匹配 + infilling 思路的系统化放大;启下:它把”一个模型多模态""描述+示例双条件""文本/音色/风格三解耦”这些设计语言固定下来,后来的统一音频模型(比如 AudioLDM 2 的 LOA、再到各类全能音频基座)都能看到它的影子。

我最欣赏的是它对”控制粒度”的执着。2023 年的音频生成不缺”能出声”的模型,缺的是”听话”的模型。把风格和音色解耦,本质上是把”创造”的权力交还给了用户——你要的不是”像谁的声音”,而是”我想要的声音”。

局限也明显。论文里语音和音效是重点,音乐部分相对一笔带过;参数量、训练数据规模等信息论文没有给出单一明确的公开口径,这类”基础模型”到底有多大、烧了多少钱,外界只能猜⚠️。另外,0.745 和 0.77 是论文自报数字,评测集和参照系各不相同,跟后来的模型横比时要小心。再有,Audiobox 作为研究项目始终没有大规模产品化——Meta 在音频生成上”论文跑得快、产品没跟上”的老毛病,在这篇里也体现得挺清楚。但作为一份”统一音频生成”的思想纲领,它值得每个做音频 AI 的人读一遍。


附:核心数据速查#

基本盘

项目数值
论文Audiobox: Unified Audio Generation with Natural Language Prompts
机构Meta AI / FAIR
arXiv2312.15821(2023.12.25 提交)
底层方法流匹配(flow matching)
生成模态语音(TTS)/ 音效 / 音乐,统一框架
训练策略自监督 infilling 预训练 + 任务适配
参数量论文未公开单一口径 ⚠️

核心创新

创新要点
多模态统一一个流匹配模型覆盖语音/音效/音乐,而非每模态一个模型
双提示机制描述式(自然语言)与示例式(参考音频)提示,映射到同一条件空间
三因素解耦语音生成时文本内容、音色、风格独立可控,可交叉组合
自监督 infilling挖空音频让模型自补,无标注数据也能大规模预训练
Bespoke Solvers为模型定制专用 ODE 求解器,比默认求解器快 25 倍以上

关键成绩

任务指标
零样本 TTSLibriSpeech 说话人相似度 0.745
文本到音效AudioCaps FAD 0.77
生成加速Bespoke Solvers 比默认 ODE 求解器快 25×+
风格能力支持用文字描述生成全新声学风格(语音)

关键概念清单

  • flow matching = 流匹配,一种生成模型范式,相比扩散采样步数更少、速度更快
  • FAD = Fréchet Audio Distance,音频分布距离指标,越低越好
  • LibriSpeech = 常用英文语音评测集
  • AudioCaps = 音效(声音事件)文-音频对基准,评测文本到音效的标准场地
  • infilling = 填充任务,挖空音频中间部分让模型补全
  • description-based prompting = 描述式提示,用自然语言描述目标音频
  • example-based prompting = 示例式提示,用参考音频作为条件
  • ODE solver = 常微分方程求解器,流匹配/扩散采样时的数值积分工具
  • Bespoke Solvers = 定制求解器,针对特定模型训练的专用采样器
  • zero-shot TTS = 零样本语音合成,无需微调即可克隆新音色
  • similarity = 说话人相似度,衡量生成声音与目标音色接近程度
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[音乐生成] Audiobox:通吃三种声音
https://mizuki-eaf.pages.dev/posts/音频生成模型/音乐生成-audiobox通吃三种声音/
作者
无名之子
发布于
2026-07-07
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录