mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2465 字
7 分钟
[TTS] WaveNet:机器首次像人声
2026-07-09

WaveNet 论文解读:每秒 16000 个采样点逐个”挤”出来,机器第一次像人说话#

论文:WaveNet: A Generative Model for Raw Audio 作者/机构:Aaron van den Oord 等,DeepMind

在 WaveNet 之前,语音合成基本是两派天下:拼接式(concatenative)和参数式(statistical parametric)。前者从语料库里剪声音片段拼起来,后者用声学模型预测参数再交给声码器。两家都有一个共同毛病——听起来”机器味”很重。2016 年 9 月,DeepMind 把深度学习直接怼到了原始波形上:不预测频谱、不预测参数,而是逐个采样点地预测 16kHz 波形的每一个值。这就是 WaveNet,波形级自回归(autoregressive)生成的开山之作。它在英文和中文上拿到了当时最好的 MOS(平均意见分)4.21,首次让机器语音”像人到可以聊天的程度”。代价也很诚实:生成速度远慢于实时,只能当研究原型,没法上产品。


一、问题:语音合成卡在哪#

传统 TTS(text-to-speech,文本转语音)管线一般分三段:文本前端(分词、注音)、声学模型(预测频谱或参数)、声码器(vocoder,把频谱还原成波形)。三段各自为政,错误会层层放大,而且听起来总有”嗡嗡的合成味”。

WaveNet 的思路简单粗暴:放弃中间表示,直接建模原始音频波形的概率分布。给定前面所有的采样点,预测下一个采样点最可能是哪个值。这就是自回归。它把”语音像不像人”的问题变成了”下一个样本猜得准不准”的问题。

二、核心架构:因果膨胀卷积#

当时建模时序的主流是 RNN(循环神经网络),但逐个时间步展开又慢又难并行。WaveNet 用了卷积,但不是普通卷积,而是两样改造:

  • 因果卷积(causal convolution):预测第 t 个采样点时,只看 t 之前的输入,绝不让未来信息”泄密”——这是自回归建模的纪律。
  • 膨胀卷积(dilated convolution):卷积核之间隔开空洞(dilation),让感受野指数级扩大。WaveNet 用膨胀系数 1, 2, 4, 8, … 成倍递增的堆叠,几十层下来就能”看到”数千个采样点之前的信息,覆盖几百毫秒的上下文。这正好抓住语音的长程依赖——一个音节的发音受前面好几个音影响。

模型对每个采样点输出一个softmax 分布,预测它在 256 种可能取值(8-bit μ-law 量化,一种非线性压缩采样值到 256 个档位的技巧)中的哪一个。整个模型是”下一个采样点 = 前文所有采样点的函数”,训练时一次算完整段,生成时只能一个样本一个样本地滚——这就是它慢的根源。

三、关键能力:多说话人、音乐、还有”说话人身份开关”#

WaveNet 论文不只是做了 TTS,还展示了几个让它显得”早熟”的能力:

  • 多说话人(multi-speaker):同一个模型可以同时学会多个人的音色,生成时只需输入一个说话人 ID(speaker identity embedding,说话人身份嵌入)做条件,就能在几个人声之间切换,质量不塌。
  • 音乐生成:用同样的架构训练钢琴等乐器的原始音频,能生成”新颖且相当逼真”的乐段。
  • 判别任务:把 WaveNet 当特征提取器,做音素识别也有不错结果。

也就是说,它不只是个 TTS 模型,而是”原始音频自回归生成器”这个通用工具的第一版。

四、成绩:MOS 4.21,但别跟真人硬比#

WaveNet 在英文和中文(Mandarin)上都显著优于当时最好的参数式与拼接式系统。论文的盲听测试(MOS,mean opinion score,1–5 分主观自然度评分)里:

  • 模型拿到 4.21
  • 自然语音是 4.46(8-bit μ-law 编码)/ 4.55(16-bit PCM 原始录音)

注意:论文全文没有 4.44 这个数字,网上流传的”自然 4.44”是讹传。更关键的是,WaveNet 用的自然语音参考还是经过 μ-law 压缩的版本,也就是 4.46 那档。模型距离 4.46 只差 0.25——这在当时是断崖式的进步,直接把”神经合成语音”拉到了”接近真人”的区间。

五、代价:快是快不了的,这辈子都难以实时#

WaveNet 的软肋写在论文每个角落:生成是逐样本串行的,每个样本都要跑一遍完整网络。16kHz 就是每秒 16000 个采样点,而它生成 1 秒音频往往要几十秒甚至更久(论文用”far slower than real-time”这类表述,具体数值取决于硬件与实现)。研究原型可以接受,生产部署完全不行。

所以后续的整个提速史,本质上都是围绕”怎么把 WaveNet 的串行生成变成并行”。两条主线:

  1. 把它降级成”声码器”:Tacotron 2 用更轻量的 WaveNet 变体,把”文本预测频谱”和”频谱还原波形”拆开,前者由 seq2seq 负责,后者仍由 WaveNet 干活——WaveNet 从”全能选手”变成管线末端的音色渲染器。
  2. 蒸馏出并行版:Parallel WaveNet 用概率密度蒸馏(probability density distillation),让一个可并行的前馈网络模仿已训练好的 WaveNet,GPU 上做到 >20× 实时、相对原版快约千倍,2018 年上线 Google Assistant。

收尾:我的一点看法#

WaveNet 最大的贡献不是”效果好”,而是它第一次证明神经模型可以在原始波形层面直接建模语音,并且质量碾压所有手工设计的旧管线。它把语音合成的战场从”特征工程”拖进了”端到端学习”,此后十年 TTS 的每一次跃迁——频谱端到端、非自回归、GAN 声码器、token 语言模型——都能在 WaveNet 里找到影子。

但我对它的评价里也有一句保留:WaveNet 的成功有很大一部分建立在”算力换质量”上,串行生成是它自带的枷锁,它自己并不能解决。真正让它”活下来”的是后面的蒸馏和声码器化改造——换句话说,WaveNet 的伟大之处,恰恰在于它作为一座基石,被后来的模型合理地”拆掉”了。它至今不是任何主流产品的推理内核,但它定义了整个领域的问题和坐标系。

局限也别忘了:逐样本自回归天然低效,256 档 μ-law 量化对音质也有天花板(后面 HiFi-GAN 用 16-bit 波形做回归直接超了它);多说话人只是”开关切换”而非”零样本克隆”;没有任何可控韵律的手段。这些都是后来者解决的问题。


附:核心数据速查#

基本盘

项目数值
论文WaveNet: A Generative Model for Raw Audio
机构 / 发表DeepMind,2016.09(arXiv<1609>.03499)
输入/输出16 kHz 原始波形,8-bit μ-law 量化(256 档)
建模方式逐采样点自回归(autoregressive)
主干结构因果卷积 + 膨胀卷积堆叠
生成速度远慢于实时(逐样本串行)

核心创新

创新要点
波形级自回归不预测频谱/参数,直接逐样本建模原始音频分布
因果膨胀卷积因果性保证自回归纪律,膨胀让感受野指数扩大
多说话人条件单一模型 + speaker embedding 切换多个音色
通用音频生成语音之外还能做音乐生成、音素识别

关键成绩

  • 英文/中文 TTS 双双达到当时 SOTA,显著超过最好的参数式与拼接式系统
  • MOS 4.21;自然语音 4.46(8-bit μ-law)/ 4.55(16-bit PCM)——论文全文无 4.44 ⚠️ 注意网上讹传
  • 生成音乐可产出”新颖且逼真”的乐段

关键概念清单

  • autoregressive = 自回归(预测下一个值时依赖之前的所有输出)
  • causal convolution = 因果卷积(只看过去,不看未来)
  • dilated convolution = 膨胀卷积(卷积核间留空洞,扩大感受野)
  • receptive field = 感受野(一个输出能看到多长的输入上下文)
  • MOS = Mean Opinion Score,平均意见分(1–5,主观听感自然度)
  • μ-law = 一种非线性压扩编码,把采样值压缩到 256 档
  • speaker embedding = 说话人身份嵌入(音色条件向量)
  • vocoder = 声码器(把频谱/参数还原为波形)
  • concatenative / parametric TTS = 拼接式 / 参数式语音合成
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[TTS] WaveNet:机器首次像人声
https://mizuki-eaf.pages.dev/posts/音频生成模型/tts-wavenet机器首次像人声/
作者
无名之子
发布于
2026-07-09
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录