VALL-E 与 VALL-E 2 论文解读:3 秒克隆一个声音,两年后连 AI 自己都听不出破绽
论文:Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers(VALL-E,arXiv<2301>2301>.02111);VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers(arXiv<2406>2406>.05370) 作者/机构:微软研究院 / 微软 Azure Speech(Chengyi Wang、Sanyuan Chen、Shujie Liu、Xu Tan、Furu Wei 等)
说句实话,2023 年以前的 TTS 让人挺憋屈的。你想合成一个新声音,得先准备这个人的大量录音去微调,没有个把小时录音和半天训练基本没戏。VALL-E 干的事情就是把这事彻底掀桌子:给你 3 秒参考语音,它就能像模像样地学这个人说话,语气、音色、韵律全带走,还能带着情绪和房间回声一起带走。技术上的本质一句话能说清——把语音变成离散的”音频 token”,然后像 GPT 预测下一个单词那样预测下一个 token。这条路后来被整个行业抄了个遍,Voicebox、CosyVoice、Seed-TTS 全部溯源到这篇。一年半之后微软自己又出了一篇 VALL-E 2,把识别错误率打到跟真人录音转写一样低,首次宣称零样本 TTS 达到”人类平价”(human parity)。
一、思路:TTS 从”画波形”变成”写 token”
在 VALL-E 之前,主流 TTS 是”回归派”:模型直接预测频谱(mel 谱)或者干脆预测波形,本质是一个连续信号的回归问题。VALL-E 换了个玩法,先把语音喂给一个现成的神经音频编解码器,比如 EnCodec,把波形压成一串离散的码字(code),然后让一个 Transformer 语言模型去学”文本条件下,下一个音频 token 是什么”。
这招的妙处在于:离散 token 天生就是语言模型的菜。语言模型干了这么多年”预测下一个 token”的活,直接拿来干 TTS 完全顺手,还能白捡语言模型最值钱的技能——上下文学习(in-context learning)。训练时模型见过成千上万种音色,推理时你给一段新人的语音当”提示(prompt)“,模型靠 in-context learning 现学现卖,于是零样本克隆就成了。
为了支撑这套玩法,微软把训练数据直接拉满:6 万小时英语语音,比当时主流 TTS 系统的数据量大几百倍。这个规模是这套方法能成立的前提,也是后来所有零样本 TTS 军备竞赛的起点。
二、VALL-E 怎么工作:两级结构
VALL-E 用的是分级(hierarchical)的架构,因为 EnCodec 的残差向量量化(RVQ,residual vector quantization)会把一段语音拆成好几个码本,码本之间有从粗到细的层级。
第一级是个自回归(autoregressive,AR)模型,只预测最粗的那个码本——也就是”这句话的大致内容”。第二级是非自回归模型,以第一级的输出为条件,一次性补全剩下的细粒度码本——也就是”这句话的具体音色和细节”。第一级管内容,第二级管细节,分工明确,和后来 GPT-4o 时代的”内容/表达分层”思路一脉相承。
论文里还观察到一个挺有趣的副作用:VALL-E 不只会复刻音色,还能保留提示语音里的情绪和声学环境。比如参考音频是嘈杂环境里带笑意的说话,合成出来也是那个味。这对”克隆”来说其实是加分项,但也给后面铺天盖地的声音伪造留下了技术伏笔。
三、VALL-E 的成绩与软肋
在 LibriSpeech test-clean 上,VALL-E 的词错误率(WER,word error rate)5.9%,说话人相似度(SIM,speaker similarity)0.580(0–1 打分)。对比当时最强的零样本系统,自然度和相似度全面胜出,这也是它敢叫”开山作”的底气。
但软肋同样明显。第一,它是自回归的,一个 token 一个 token 往外蹦,推理速度慢,实打实是”慢工出细活”。第二,说话人相似度 0.58 左右仍然明显不如真人,只是”能听出像这个人”,离”以假乱真”还差一截。第三,长句子或反复出现的词容易生成崩掉,训练数据虽然大,但稳健性还是经不起折腾。这三个问题,恰好就是 VALL-E 2 要补的功课。
四、VALL-E 2:两个”补丁”封神
VALL-E 2 在 2024 年 6 月发布,架构大框架没动,真正的变化是两个名字都起得很直白的技术。
第一个:重复感知采样(Repetition Aware Sampling,RAS)。原来的核采样(nucleus sampling)在解码时会碰到一个鬼问题——某个 token 在历史里已经出现很多次了,模型还在疯狂选它,导致生成卡死在无限循环里(infinite loop),一句话反复念同一段。RAS 的思路是:采样时把”历史上已经重复出现过的 token”的概率压下去,惩罚重复,逼模型往前走。这一招同时解决了两个问题,既稳住了解码过程,又直接消灭了无限循环——顺带把生成含重复短语的句子的质量也拉上来了。
第二个:分组编码建模(Grouped Code Modeling,GCM)。前面说过 RVQ 有多个码本,序列会被拉得很长,长度一长,自回归建模又慢又容易崩。GCM 把多个码本”分组”合并,相当于把音频 token 序列变短。序列短了,推理速度上去了,长序列建模的难题也缓解了。这是一个工程味很浓的改进,但对实用性的提升立竿见影。
五、VALL-E 2 的成绩:人类平价
在 LibriSpeech 和 VCTK 上,VALL-E 2 在鲁棒性、自然度、相似度上全面超过以往所有系统,而且第一次达到了人类平价。具体数字很关键,也很容易被误传:
- 常规评测下 VALL-E 2 的 WER 是 1.6%,而真人语音(Ground Truth,真实录音)转写的 WER 也是 1.6%——两边打平;
- 只有在使用”参考语句(Ref Utterance)“评测时,VALL-E 2 的 WER 才降到 1.5%,低于真人,这才能说”比真人还准”。
网上很多文章写”VALL-E 2 的 1.9%“其实是张冠李戴,论文里根本没有 1.9% 这个数。正确口径是:1.6% 与真人持平,1.5%(Ref Utterance)才低于真人。这也提醒我们,看这类论文一定要盯住评测条件,差一个条件数字就完全不可比。
收尾:我的一点看法
VALL-E 的价值怎么强调都不过分。它做对了两件大事:一是证明了”编解码 token + 语言模型”这条范式真的能跑通零样本 TTS,把 TTS 从”连续回归”彻底拽进”离散语言建模”的轨道;二是用 6 万小时数据摊开了一个事实——这个领域拼的就是数据规模。此后所有头部玩家走的路,本质都是把这两件事做得更大、更快。
VALL-E 2 则展示了工业级团队”打补丁”的水平:RAS 和 GCM 都不是什么石破天惊的新发明,前者是解码策略,后者是编码组织方式,但两个补丁合起来就把”人类平价”这四个字从口号变成了可复现的数字。这种”在成熟框架里做精准手术”的功力,比拍脑袋换架构更难得。
当然也要泼点冷水。所谓”人类平价”,前提是评测指标本身只看 WER 和相似度这类客观分数,自然度、韵律、情感这些主观维度并没有真正打平;而且”平价”的代价是庞大的训练数据和自回归的低效率。更深层的隐忧是伦理——三秒克隆音色的能力一旦落到坏人手,就是现成的诈骗工具。技术越成熟,安全护栏越不能缺席。VALL-E 全家桶留给后人的,不只是技术遗产,还有这道绕不开的命题。
附:核心数据速查
基本盘
| 项目 | VALL-E | VALL-E 2 |
|---|---|---|
| arXiv / 时间 | 2301.02111 / 2023.01 | 2406.05370 / 2024.06 |
| 机构 | 微软研究院 / Azure Speech | 微软研究院 / Azure Speech |
| 核心范式 | 编解码 token + 条件语言建模 | 同左(继承并改进) |
| 训练数据 | 6 万小时英语语音 | 大规模语料(论文未给单一数字,以 LibriSpeech/VCTK 评测) |
| 提示需求 | 3 秒参考语音(acoustic prompt) | 同左 |
| 架构 | AR 预测粗码本 + 非 AR 补全细码本 | 两级架构 + RAS + GCM |
核心创新
| 创新 | 要点 |
|---|---|
| 编解码 token 化 TTS | 用 EnCodec 离散 token 替代连续频谱回归,TTS 变”条件语言建模” |
| in-context learning 零样本 | 3 秒提示即克隆音色,无需微调 |
| 分级两级结构 | AR 管内容、非 AR 管细节 |
| 重复感知采样(RAS) | 惩罚解码历史中的重复 token,稳定解码、消除无限循环 |
| 分组编码建模(GCM) | 码本分组缩短序列,提速并缓解长序列建模难题 |
关键成绩
- VALL-E:LibriSpeech WER 5.9%;说话人相似度 SIM 0.580
- VALL-E 2:常规评测 WER 1.6%,与真人 GroundTruth 的 1.6% 持平;Ref Utterance 下 1.5% 低于真人
- 首次宣称零样本 TTS 达到人类平价(human parity)(论文无”1.9%“数字,勿误传)
- 优势应用场景:失语症(aphasia)、肌萎缩侧索硬化(ALS)患者等特殊人群的语音生成
关键概念清单
- codec = 神经音频编解码器(把波形压成离散码字)
- token = 离散的音频码字,语言模型的”单词”
- RVQ = Residual Vector Quantization,残差向量量化(多码本分层)
- zero-shot = 零样本,不微调直接对新说话人克隆
- acoustic prompt = 声学提示(参考语音片段)
- WER = Word Error Rate,词错误率
- SIM = speaker similarity,说话人相似度
- in-context learning = 上下文学习(参考提示里现学音色)
- nucleus sampling = 核采样(按累计概率截断的随机采样)
- human parity = 人类平价(与真人录音指标持平)
- Ground Truth / Ref Utterance = 真人录音基线 / 参考语句评测条件
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





