Voicebox 论文解读:不数 token 也能说话,Meta 用”完形填空”把 TTS 提速 20 倍
论文:Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale(arXiv<2306>2306>.15687,NeurIPS 2023) 作者/机构:Meta AI(Matthew Le、Apoorv Vyas、Wei-Ning Hsu 等)
VALL-E 证明了”音频 token + 语言模型”这条路能走通,但它是自回归的,一个 token 一个 token 地蹦,慢得让人着急。Meta 这篇 Voicebox 干的事,就是直接掀了自回归的桌子:非自回归(non-autoregressive)流匹配(flow matching),一次前向把整段语音生成出来,推理速度比 VALL-E 快 20 倍。更妙的是训练方式,它不像 VALL-E 那样学”文本后面跟着什么语音”,而是学”一段话中间被挖掉一块,怎么把洞填上”——这个文本修复(infilling)式的训练目标,让一个模型同时学会了零样本克隆、去噪、内容编辑、风格转换好几样本事。这篇论文可以说是”非自回归路线首次正面硬刚自回归路线”的里程碑。
一、思路:从”顺流而下”到”中间填空”
GPT 那套范式是”给前半句,猜后半句”,纯单向。VALL-E 用的就是这个思路:给文本和参考音频,从左往右猜音频 token。Voicebox 觉得这样太浪费了——为什么不能让模型看到未来的上下文?
于是它把训练目标改成了 infilling:给一段语音的中间挖掉一块,让模型看着”左右两边都有的上下文 + 对应的文本”,去把挖掉的语音部分生成出来。这就像做阅读理解里的”完形填空”而不是”接龙”。这个改动带来的第一个好处就是灵活性,模型既能单向生成,也能双向取上下文;第二个好处是数据利用率高,一段音频挖不同位置就能变出无数条训练样本。
训练数据也相当”野”:超过 5 万小时的语音,而且是不经过筛选、不经过增强的原始录音(unfiltered,unenhanced)。听起来像在将就,其实是有意为之——真实场景里的语音就是这么脏,模型在脏数据上练出来才扛得住”野外”环境。这里要特别说清一个口径问题:Voicebox 的总训练数据是 5 万小时多语种,“6 万小时(60k hours)“那个说法对应的是论文里英语单语实验模型的口径,别把两者混着用。
二、流匹配:非自回归的快,到底怎么来的
非自回归的意思是:不一个 token 一个 token 地顺序生成,而是并行地、一口气把整段音频的特征都生成出来。Voicebox 用来做这件事的是流匹配(flow matching)模型。
流匹配你可以理解成一个”加速版的扩散模型”:扩散模型是慢慢地往数据里加噪声、再慢慢去噪,路径弯弯绕绕,要多步迭代;流匹配则直接学一条从”噪声分布”到”目标分布”的直线轨迹(flow),从起点一步或多步滑到终点,路径短、步数少、生成快。两者都是”从噪声里造数据”,但流匹配把路修直了。
对 TTS 而言这意味着什么?VALL-E 自回归生成时,每出一个 token 都得等前一个 token;Voicebox 呢,整段音频的特征是一次性”滑”出来的,推理快了 20 倍——从”等得人心焦”变成了”基本可以当实时用”。速度之外,流匹配还带来了稳定的好处,非自回归模型不会像自回归那样陷入无限循环或重复塌陷。
三、一个模型干五份活
GPT 之所以伟大,在于一个模型能泛化到没教过的任务。Voicebox 的目标就是做”语音界的 GPT”——靠 infilling 训练学到的通用能力,一个模型顺带干五份活:
- 单语/跨语种零样本 TTS:给文本 + 一段参考语音,克隆音色合成,这是主菜;
- 去噪(denoising):把语音里塞进噪声,当成”中间被破坏的洞”,模型填洞 = 去噪;
- 内容编辑(content editing):把一句话里的某个词挖掉重填,等于录音棚里的”补一句”;
- 风格转换(style conversion):换参考语音,就换了一种说话风格;
- 多样样本生成(diverse sample generation):同一个文本能生成多条不同韵律的语音,供后期挑选。
不用重新训练,一个 checkpoint 通吃。这种”一个模型干五件事”的通用性,在当时是 TTS 领域独一份的卖点。
四、成绩:又快又准
Voicebox 的评测直接跟当时的王者 VALL-E 硬碰硬,而且全面获胜。这里要盯紧数字的方向,别被摘要里那种缩写写法绕晕:
- 可懂度(intelligibility):Voicebox 的词错误率(WER,word error rate)1.9%,VALL-E 是 5.9%——错误率直接砍掉三分之二;
- 说话人相似度(SIM):Voicebox 0.681,VALL-E 只有 0.580(分数越高越像);
- 速度:推理比 VALL-E 快 20 倍。
“又快、又准、又像”,三个维度全赢,这在当时是相当炸裂的一张成绩单。值得说明的是,这个对比里 5.9% 就是 VALL-E 在它自己评测设定下的成绩,两者对标的是同一批评测任务,可比性较强。
收尾:我的一点看法
Voicebox 在历史上的地位有点微妙:它技术含金量极高,但商业上却很”憋屈”。论文 2023 年 6 月就挂了 arXiv,Meta 至今没有把它完整开源,只给了一堆 demo——这跟同期大厂”论文发归发,模型藏着掖着”的风气一致。但从影响力看,它把两条关键路线点透了:一是流匹配可以稳稳扛住高质量 TTS,二是 infilling 训练目标比单向 AR 更划算。后来的 NaturalSpeech 2/3、Audiobox、CosyVoice、F5-TTS 多少都吃了这两条路线的红利。
我个人最欣赏的是它”脏数据+通用任务”的哲学。很多人卷数据清洗,Meta 反着来,用不筛选的数据训练,换来的是对真实世界的鲁棒性。这其实和后来大模型圈的共识一致——数据规模和大而全的任务设计,往往比精致的预处理更管用。
吐槽点也有。非自回归的快是有代价的,它在韵律的自然度、多样性和长句稳定性上,仍然不如自回归模型细腻;“通用语音模型”的画饼也没完全兑现,风格转换和去噪的实际效果离生产级还有距离。另外,“1.9% 的 WER”是在特定评测集上的数字,别当成普适的”语音识别水平”来吹。总体上,这是一篇”路线级”的论文,读它的价值不在于追那 20 倍的快,而在于理解为什么后来大家都去拥抱流匹配了。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| arXiv / 时间 | 2306.15687 / 2023.06(NeurIPS 2023) |
| 机构 | Meta AI |
| 生成范式 | 非自回归 + 流匹配(flow matching) |
| 训练任务 | infilling(文本修复式完形填空训练) |
| 训练数据 | 超过 5 万小时、不筛选不增强的原始语音 |
| 语种 | 6 语种(“60k 小时”口径对应英语单语实验模型,勿混用) |
| 推理速度 | 比 VALL-E 快 20 倍 |
核心创新
| 创新 | 要点 |
|---|---|
| infilling 训练 | 挖空语音中间让模型填补,兼容单向/双向上下文 |
| 流匹配生成 | 学”噪声→数据”直线轨迹,非自回归并行生成 |
| 多任务泛化 | 零样本 TTS / 去噪 / 内容编辑 / 风格转换 / 多样采样,一模型通吃 |
| 脏数据路线 | 5 万小时原始未筛选语音,换来野外鲁棒性 |
关键成绩(对比 VALL-E)
- WER:Voicebox 1.9% vs VALL-E 5.9%
- SIM(说话人相似度):Voicebox 0.681 vs VALL-E 0.580
- 推理速度:20× 快于 VALL-E
- 支持单语与跨语种零样本 TTS
关键概念清单
- non-autoregressive = 非自回归(并行生成,不逐 token 依赖)
- flow matching = 流匹配(学噪声到数据的直线轨迹,扩散的加速版)
- infilling = 文本修复式训练(完形填空式生成目标)
- WER = Word Error Rate,词错误率
- SIM = speaker similarity,说话人相似度
- zero-shot = 零样本(不微调直接克隆新音色)
- cross-lingual = 跨语种(参考语音与目标文本不同语言)
- denoising = 去噪
- style conversion = 风格转换
- diverse sample generation = 多样样本生成
- raw/unfiltered speech = 未筛选的原始语音数据
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





