mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2915 字
8 分钟
[声音克隆] VALL-E 与 VALL-E 2:3 秒克隆人声
2026-07-21

VALL-E 与 VALL-E 2 论文解读:3 秒克隆一个声音,两年后连 AI 自己都听不出破绽#

论文:Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers(VALL-E,arXiv<2301>.02111);VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers(arXiv<2406>.05370) 作者/机构:微软研究院 / 微软 Azure Speech(Chengyi Wang、Sanyuan Chen、Shujie Liu、Xu Tan、Furu Wei 等)

说句实话,2023 年以前的 TTS 让人挺憋屈的。你想合成一个新声音,得先准备这个人的大量录音去微调,没有个把小时录音和半天训练基本没戏。VALL-E 干的事情就是把这事彻底掀桌子:给你 3 秒参考语音,它就能像模像样地学这个人说话,语气、音色、韵律全带走,还能带着情绪和房间回声一起带走。技术上的本质一句话能说清——把语音变成离散的”音频 token”,然后像 GPT 预测下一个单词那样预测下一个 token。这条路后来被整个行业抄了个遍,Voicebox、CosyVoice、Seed-TTS 全部溯源到这篇。一年半之后微软自己又出了一篇 VALL-E 2,把识别错误率打到跟真人录音转写一样低,首次宣称零样本 TTS 达到”人类平价”(human parity)


一、思路:TTS 从”画波形”变成”写 token”#

在 VALL-E 之前,主流 TTS 是”回归派”:模型直接预测频谱(mel 谱)或者干脆预测波形,本质是一个连续信号的回归问题。VALL-E 换了个玩法,先把语音喂给一个现成的神经音频编解码器,比如 EnCodec,把波形压成一串离散的码字(code),然后让一个 Transformer 语言模型去学”文本条件下,下一个音频 token 是什么”。

这招的妙处在于:离散 token 天生就是语言模型的菜。语言模型干了这么多年”预测下一个 token”的活,直接拿来干 TTS 完全顺手,还能白捡语言模型最值钱的技能——上下文学习(in-context learning)。训练时模型见过成千上万种音色,推理时你给一段新人的语音当”提示(prompt)“,模型靠 in-context learning 现学现卖,于是零样本克隆就成了。

为了支撑这套玩法,微软把训练数据直接拉满:6 万小时英语语音,比当时主流 TTS 系统的数据量大几百倍。这个规模是这套方法能成立的前提,也是后来所有零样本 TTS 军备竞赛的起点。

二、VALL-E 怎么工作:两级结构#

VALL-E 用的是分级(hierarchical)的架构,因为 EnCodec 的残差向量量化(RVQ,residual vector quantization)会把一段语音拆成好几个码本,码本之间有从粗到细的层级。

第一级是个自回归(autoregressive,AR)模型,只预测最粗的那个码本——也就是”这句话的大致内容”。第二级是非自回归模型,以第一级的输出为条件,一次性补全剩下的细粒度码本——也就是”这句话的具体音色和细节”。第一级管内容,第二级管细节,分工明确,和后来 GPT-4o 时代的”内容/表达分层”思路一脉相承。

论文里还观察到一个挺有趣的副作用:VALL-E 不只会复刻音色,还能保留提示语音里的情绪和声学环境。比如参考音频是嘈杂环境里带笑意的说话,合成出来也是那个味。这对”克隆”来说其实是加分项,但也给后面铺天盖地的声音伪造留下了技术伏笔。

三、VALL-E 的成绩与软肋#

在 LibriSpeech test-clean 上,VALL-E 的词错误率(WER,word error rate)5.9%,说话人相似度(SIM,speaker similarity)0.580(0–1 打分)。对比当时最强的零样本系统,自然度和相似度全面胜出,这也是它敢叫”开山作”的底气。

但软肋同样明显。第一,它是自回归的,一个 token 一个 token 往外蹦,推理速度慢,实打实是”慢工出细活”。第二,说话人相似度 0.58 左右仍然明显不如真人,只是”能听出像这个人”,离”以假乱真”还差一截。第三,长句子或反复出现的词容易生成崩掉,训练数据虽然大,但稳健性还是经不起折腾。这三个问题,恰好就是 VALL-E 2 要补的功课。

四、VALL-E 2:两个”补丁”封神#

VALL-E 2 在 2024 年 6 月发布,架构大框架没动,真正的变化是两个名字都起得很直白的技术。

第一个:重复感知采样(Repetition Aware Sampling,RAS)。原来的核采样(nucleus sampling)在解码时会碰到一个鬼问题——某个 token 在历史里已经出现很多次了,模型还在疯狂选它,导致生成卡死在无限循环里(infinite loop),一句话反复念同一段。RAS 的思路是:采样时把”历史上已经重复出现过的 token”的概率压下去,惩罚重复,逼模型往前走。这一招同时解决了两个问题,既稳住了解码过程,又直接消灭了无限循环——顺带把生成含重复短语的句子的质量也拉上来了。

第二个:分组编码建模(Grouped Code Modeling,GCM)。前面说过 RVQ 有多个码本,序列会被拉得很长,长度一长,自回归建模又慢又容易崩。GCM 把多个码本”分组”合并,相当于把音频 token 序列变短。序列短了,推理速度上去了,长序列建模的难题也缓解了。这是一个工程味很浓的改进,但对实用性的提升立竿见影。

五、VALL-E 2 的成绩:人类平价#

在 LibriSpeech 和 VCTK 上,VALL-E 2 在鲁棒性、自然度、相似度上全面超过以往所有系统,而且第一次达到了人类平价。具体数字很关键,也很容易被误传:

  • 常规评测下 VALL-E 2 的 WER 是 1.6%,而真人语音(Ground Truth,真实录音)转写的 WER 也是 1.6%——两边打平;
  • 只有在使用”参考语句(Ref Utterance)“评测时,VALL-E 2 的 WER 才降到 1.5%,低于真人,这才能说”比真人还准”。

网上很多文章写”VALL-E 2 的 1.9%“其实是张冠李戴,论文里根本没有 1.9% 这个数。正确口径是:1.6% 与真人持平,1.5%(Ref Utterance)才低于真人。这也提醒我们,看这类论文一定要盯住评测条件,差一个条件数字就完全不可比。

收尾:我的一点看法#

VALL-E 的价值怎么强调都不过分。它做对了两件大事:一是证明了”编解码 token + 语言模型”这条范式真的能跑通零样本 TTS,把 TTS 从”连续回归”彻底拽进”离散语言建模”的轨道;二是用 6 万小时数据摊开了一个事实——这个领域拼的就是数据规模。此后所有头部玩家走的路,本质都是把这两件事做得更大、更快。

VALL-E 2 则展示了工业级团队”打补丁”的水平:RAS 和 GCM 都不是什么石破天惊的新发明,前者是解码策略,后者是编码组织方式,但两个补丁合起来就把”人类平价”这四个字从口号变成了可复现的数字。这种”在成熟框架里做精准手术”的功力,比拍脑袋换架构更难得。

当然也要泼点冷水。所谓”人类平价”,前提是评测指标本身只看 WER 和相似度这类客观分数,自然度、韵律、情感这些主观维度并没有真正打平;而且”平价”的代价是庞大的训练数据和自回归的低效率。更深层的隐忧是伦理——三秒克隆音色的能力一旦落到坏人手,就是现成的诈骗工具。技术越成熟,安全护栏越不能缺席。VALL-E 全家桶留给后人的,不只是技术遗产,还有这道绕不开的命题。


附:核心数据速查#

基本盘

项目VALL-EVALL-E 2
arXiv / 时间2301.02111 / 2023.012406.05370 / 2024.06
机构微软研究院 / Azure Speech微软研究院 / Azure Speech
核心范式编解码 token + 条件语言建模同左(继承并改进)
训练数据6 万小时英语语音大规模语料(论文未给单一数字,以 LibriSpeech/VCTK 评测)
提示需求3 秒参考语音(acoustic prompt)同左
架构AR 预测粗码本 + 非 AR 补全细码本两级架构 + RAS + GCM

核心创新

创新要点
编解码 token 化 TTS用 EnCodec 离散 token 替代连续频谱回归,TTS 变”条件语言建模”
in-context learning 零样本3 秒提示即克隆音色,无需微调
分级两级结构AR 管内容、非 AR 管细节
重复感知采样(RAS)惩罚解码历史中的重复 token,稳定解码、消除无限循环
分组编码建模(GCM)码本分组缩短序列,提速并缓解长序列建模难题

关键成绩

  • VALL-E:LibriSpeech WER 5.9%;说话人相似度 SIM 0.580
  • VALL-E 2:常规评测 WER 1.6%,与真人 GroundTruth 的 1.6% 持平;Ref Utterance 下 1.5% 低于真人
  • 首次宣称零样本 TTS 达到人类平价(human parity)(论文无”1.9%“数字,勿误传)
  • 优势应用场景:失语症(aphasia)、肌萎缩侧索硬化(ALS)患者等特殊人群的语音生成

关键概念清单

  • codec = 神经音频编解码器(把波形压成离散码字)
  • token = 离散的音频码字,语言模型的”单词”
  • RVQ = Residual Vector Quantization,残差向量量化(多码本分层)
  • zero-shot = 零样本,不微调直接对新说话人克隆
  • acoustic prompt = 声学提示(参考语音片段)
  • WER = Word Error Rate,词错误率
  • SIM = speaker similarity,说话人相似度
  • in-context learning = 上下文学习(参考提示里现学音色)
  • nucleus sampling = 核采样(按累计概率截断的随机采样)
  • human parity = 人类平价(与真人录音指标持平)
  • Ground Truth / Ref Utterance = 真人录音基线 / 参考语句评测条件
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[声音克隆] VALL-E 与 VALL-E 2:3 秒克隆人声
https://mizuki-eaf.pages.dev/posts/音频生成模型/声音克隆-vall-e-与-vall-e-23-秒克隆人声/
作者
无名之子
发布于
2026-07-21
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录