mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2472 字
7 分钟
[声音克隆] Voicebox:完形填空 20 倍
2026-07-25

Voicebox 论文解读:不数 token 也能说话,Meta 用”完形填空”把 TTS 提速 20 倍#

论文:Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale(arXiv<2306>.15687,NeurIPS 2023) 作者/机构:Meta AI(Matthew Le、Apoorv Vyas、Wei-Ning Hsu 等)

VALL-E 证明了”音频 token + 语言模型”这条路能走通,但它是自回归的,一个 token 一个 token 地蹦,慢得让人着急。Meta 这篇 Voicebox 干的事,就是直接掀了自回归的桌子:非自回归(non-autoregressive)流匹配(flow matching),一次前向把整段语音生成出来,推理速度比 VALL-E 快 20 倍。更妙的是训练方式,它不像 VALL-E 那样学”文本后面跟着什么语音”,而是学”一段话中间被挖掉一块,怎么把洞填上”——这个文本修复(infilling)式的训练目标,让一个模型同时学会了零样本克隆、去噪、内容编辑、风格转换好几样本事。这篇论文可以说是”非自回归路线首次正面硬刚自回归路线”的里程碑。


一、思路:从”顺流而下”到”中间填空”#

GPT 那套范式是”给前半句,猜后半句”,纯单向。VALL-E 用的就是这个思路:给文本和参考音频,从左往右猜音频 token。Voicebox 觉得这样太浪费了——为什么不能让模型看到未来的上下文?

于是它把训练目标改成了 infilling:给一段语音的中间挖掉一块,让模型看着”左右两边都有的上下文 + 对应的文本”,去把挖掉的语音部分生成出来。这就像做阅读理解里的”完形填空”而不是”接龙”。这个改动带来的第一个好处就是灵活性,模型既能单向生成,也能双向取上下文;第二个好处是数据利用率高,一段音频挖不同位置就能变出无数条训练样本。

训练数据也相当”野”:超过 5 万小时的语音,而且是不经过筛选、不经过增强的原始录音(unfiltered,unenhanced)。听起来像在将就,其实是有意为之——真实场景里的语音就是这么脏,模型在脏数据上练出来才扛得住”野外”环境。这里要特别说清一个口径问题:Voicebox 的总训练数据是 5 万小时多语种,“6 万小时(60k hours)“那个说法对应的是论文里英语单语实验模型的口径,别把两者混着用。

二、流匹配:非自回归的快,到底怎么来的#

非自回归的意思是:不一个 token 一个 token 地顺序生成,而是并行地、一口气把整段音频的特征都生成出来。Voicebox 用来做这件事的是流匹配(flow matching)模型。

流匹配你可以理解成一个”加速版的扩散模型”:扩散模型是慢慢地往数据里加噪声、再慢慢去噪,路径弯弯绕绕,要多步迭代;流匹配则直接学一条从”噪声分布”到”目标分布”的直线轨迹(flow),从起点一步或多步滑到终点,路径短、步数少、生成快。两者都是”从噪声里造数据”,但流匹配把路修直了。

对 TTS 而言这意味着什么?VALL-E 自回归生成时,每出一个 token 都得等前一个 token;Voicebox 呢,整段音频的特征是一次性”滑”出来的,推理快了 20 倍——从”等得人心焦”变成了”基本可以当实时用”。速度之外,流匹配还带来了稳定的好处,非自回归模型不会像自回归那样陷入无限循环或重复塌陷。

三、一个模型干五份活#

GPT 之所以伟大,在于一个模型能泛化到没教过的任务。Voicebox 的目标就是做”语音界的 GPT”——靠 infilling 训练学到的通用能力,一个模型顺带干五份活:

  1. 单语/跨语种零样本 TTS:给文本 + 一段参考语音,克隆音色合成,这是主菜;
  2. 去噪(denoising):把语音里塞进噪声,当成”中间被破坏的洞”,模型填洞 = 去噪;
  3. 内容编辑(content editing):把一句话里的某个词挖掉重填,等于录音棚里的”补一句”;
  4. 风格转换(style conversion):换参考语音,就换了一种说话风格;
  5. 多样样本生成(diverse sample generation):同一个文本能生成多条不同韵律的语音,供后期挑选。

不用重新训练,一个 checkpoint 通吃。这种”一个模型干五件事”的通用性,在当时是 TTS 领域独一份的卖点。

四、成绩:又快又准#

Voicebox 的评测直接跟当时的王者 VALL-E 硬碰硬,而且全面获胜。这里要盯紧数字的方向,别被摘要里那种缩写写法绕晕:

  • 可懂度(intelligibility):Voicebox 的词错误率(WER,word error rate)1.9%,VALL-E 是 5.9%——错误率直接砍掉三分之二;
  • 说话人相似度(SIM):Voicebox 0.681,VALL-E 只有 0.580(分数越高越像);
  • 速度:推理比 VALL-E 快 20 倍

“又快、又准、又像”,三个维度全赢,这在当时是相当炸裂的一张成绩单。值得说明的是,这个对比里 5.9% 就是 VALL-E 在它自己评测设定下的成绩,两者对标的是同一批评测任务,可比性较强。

收尾:我的一点看法#

Voicebox 在历史上的地位有点微妙:它技术含金量极高,但商业上却很”憋屈”。论文 2023 年 6 月就挂了 arXiv,Meta 至今没有把它完整开源,只给了一堆 demo——这跟同期大厂”论文发归发,模型藏着掖着”的风气一致。但从影响力看,它把两条关键路线点透了:一是流匹配可以稳稳扛住高质量 TTS,二是 infilling 训练目标比单向 AR 更划算。后来的 NaturalSpeech 2/3、Audiobox、CosyVoice、F5-TTS 多少都吃了这两条路线的红利。

我个人最欣赏的是它”脏数据+通用任务”的哲学。很多人卷数据清洗,Meta 反着来,用不筛选的数据训练,换来的是对真实世界的鲁棒性。这其实和后来大模型圈的共识一致——数据规模和大而全的任务设计,往往比精致的预处理更管用

吐槽点也有。非自回归的快是有代价的,它在韵律的自然度、多样性和长句稳定性上,仍然不如自回归模型细腻;“通用语音模型”的画饼也没完全兑现,风格转换和去噪的实际效果离生产级还有距离。另外,“1.9% 的 WER”是在特定评测集上的数字,别当成普适的”语音识别水平”来吹。总体上,这是一篇”路线级”的论文,读它的价值不在于追那 20 倍的快,而在于理解为什么后来大家都去拥抱流匹配了。


附:核心数据速查#

基本盘

项目数值
arXiv / 时间2306.15687 / 2023.06(NeurIPS 2023)
机构Meta AI
生成范式非自回归 + 流匹配(flow matching)
训练任务infilling(文本修复式完形填空训练)
训练数据超过 5 万小时、不筛选不增强的原始语音
语种6 语种(“60k 小时”口径对应英语单语实验模型,勿混用)
推理速度比 VALL-E 快 20 倍

核心创新

创新要点
infilling 训练挖空语音中间让模型填补,兼容单向/双向上下文
流匹配生成学”噪声→数据”直线轨迹,非自回归并行生成
多任务泛化零样本 TTS / 去噪 / 内容编辑 / 风格转换 / 多样采样,一模型通吃
脏数据路线5 万小时原始未筛选语音,换来野外鲁棒性

关键成绩(对比 VALL-E)

  • WER:Voicebox 1.9% vs VALL-E 5.9%
  • SIM(说话人相似度):Voicebox 0.681 vs VALL-E 0.580
  • 推理速度:20× 快于 VALL-E
  • 支持单语与跨语种零样本 TTS

关键概念清单

  • non-autoregressive = 非自回归(并行生成,不逐 token 依赖)
  • flow matching = 流匹配(学噪声到数据的直线轨迹,扩散的加速版)
  • infilling = 文本修复式训练(完形填空式生成目标)
  • WER = Word Error Rate,词错误率
  • SIM = speaker similarity,说话人相似度
  • zero-shot = 零样本(不微调直接克隆新音色)
  • cross-lingual = 跨语种(参考语音与目标文本不同语言)
  • denoising = 去噪
  • style conversion = 风格转换
  • diverse sample generation = 多样样本生成
  • raw/unfiltered speech = 未筛选的原始语音数据
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[声音克隆] Voicebox:完形填空 20 倍
https://mizuki-eaf.pages.dev/posts/音频生成模型/声音克隆-voicebox完形填空-20-倍/
作者
无名之子
发布于
2026-07-25
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录