mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1856 字
5 分钟
[音频理解] AudioLM:音频当语言续写
2026-08-04

AudioLM 论文解读:把音频当”语言”续写,骗过人类耳朵的那 51.2%#

论文:AudioLM: a Language Modeling Approach to Audio Generation 作者/机构:Zalán Borsos、Raphaël Marinier、Damien Vincent、Eugene Kharitonov 等(Google) 这篇是 2022 年 9 月 Google 的”范式宣言”:音频根本不用先转成文本,它本身就是一门语言。AudioLM 把输入音频切成离散 token,然后用语言模型的方式”续写”——给几秒提示,它就能续出语法通顺、语义连贯的语音,还能保持说话人身份和韵律;不只语音,钢琴曲也能续。在人耳盲测里,人类正确识别 AI 语音的比例只有 51.2%,跟随机猜(50%)基本没差。这里要特别说清楚口径:51.2% 是人类”正确识别”AI 语音的比例(接近随机),而不是”无法区分率”——数字方向别写反了。


一、背景:音频的两种”语言”,各有各的毛病#

要让语言模型(LM)处理音频,第一步是把音频变成 token。但 token 怎么选,是个两难:

  • 声学 token(来自 SoundStream 这类神经编解码器):重建质量高,但一个 token 往往只对应很短的音频片段,长期结构——比如一段话讲没讲完、一首曲子的主题怎么走向——很容易丢;
  • 语义 token:能抓住长期结构和内容走向,但重建出的声音质量不够好。

AudioLM 的选择是不做取舍,两个都要:用一套混合 token 化方案,各取所长。

二、架构:语义 + 声学两条码流,两阶段续写#

AudioLM 的混合 token 化分两层:

  1. 语义 token(semantic tokens):来自 w2v-BERT——一个在音频上预训练过的掩码语言模型(masked LM,类似 BERT 的”填空”预训练)——把它的中间层激活离散化得到。它负责”这段声音在讲什么、结构怎么走”,是长期一致性的支柱。
  2. 声学 token(acoustic tokens):来自 SoundStream 神经编解码器的离散码。它负责”最终听到的音质”,是高质量合成的基础。

生成时走两阶段自回归(autoregressive):第一阶段只建模语义 token,把”内容大纲”续出来;第二阶段以语义 token 为条件,把声学 token 逐级补全。这有点像先写大纲、再填血肉——长程一致性保住了,音质也保住了。

三、纯无监督:没有一个字的转写,也能续出像样的话#

AudioLM 全程训练在原始波形上,没有任何转写文本、没有任何标注。效果却出人意料:

  • 给一段没见过的说话人的语音提示,它能续出句法和语义都说得通的后续内容,并且保持说话人身份和韵律
  • 它还能续出连贯的钢琴曲——即使训练时从未见过任何乐谱(符号化音乐)。

也就是说,模型在纯音频数据里自己学会了”语法”和”乐理”,这是”音频即语言”最有说服力的证据。

四、盲测:51.2%,人类的耳朵基本失灵#

论文做人耳盲测:让被试判断”这段语音是真人说的,还是 AudioLM 生成的”。结果是正确识别率只有 51.2%,而随机猜也有 50%——人类基本区分不出 AI 和真人的语音

这里再强调一次口径:51.2% 是”正确识别率”,不是”无法区分率”。它的含义是”正确识别比例接近随机水平,等于分不出来”。两种说法结论等价,但方向不同,引用时必须表述准确。

五、历史地位:“音频即语言”范式正式确立#

AudioLM 是”纯音频语言建模”的里程碑。它证明了:语音、音乐都可以只用音频数据、用语言模型的套路生成,且质量能骗过人的耳朵。之后 Google 的 AudioPaLM、MusicLM 乃至整个音频 LLM 浪潮,都能在这篇里找到源头。

收尾:我的一点看法#

AudioLM 让我最服气的不是某个分数,而是它把”范式”讲明白了:只要能把音频变成足够好的 token,生成问题就退化成语言建模问题,然后大规模算力和成熟的 Transformer 工程直接复用。两阶段”语义定结构、声学补细节”的分工,后来被无数音频大模型以不同形式继承。

局限也直说。一是它仍然依赖 SoundStream 这类编解码器的质量,tokenizer 的性能就是它的天花板;二是盲测的 51.2% 是”识别率”,只能说明”接近随机”,不能解读成”保证无法区分”——听力好的被试、更长的音频、或者专门找茬,结果都会变;三是它的能力是”续写”,离”指令式生成”(比如”给我一段周杰伦风格的歌”)还有距离,那要等后面文本条件控制的模型来补。不过作为把音频送进语言建模世界的先行者,AudioLM 值得反复读。


附:核心数据速查#

基本盘

项目数值
论文AudioLM: a Language Modeling Approach to Audio Generation
arXiv / 时间2209.03143(2022.09,Google)
任务纯音频语言建模(语音续写 / 钢琴续写)
输入输出原始波形,无需文本/标注
混合 tokenw2v-BERT 语义 token + SoundStream 声学 token
建模方式两阶段自回归

核心创新

创新要点
混合 token 化语义 token 保长期结构 + 声学 token 保重建质量
两阶段自回归先续语义大纲,再以语义为条件补全声学细节
纯无监督无转写、无标注,在原始波形上学习”续写”

关键成绩

  • 保持未见说话人的身份与韵律,生成句法/语义连贯的语音续写
  • 无乐谱训练下生成连贯钢琴续写
  • 人耳盲测:人类正确识别 AI 语音的比例仅 51.2%(接近随机 50%)

关键概念清单

  • semantic tokens = 语义 token(捕捉内容与长期结构)
  • acoustic tokens = 声学 token(保证合成音质)
  • w2v-BERT = 在音频上预训练的掩码语言模型(提供语义离散特征)
  • SoundStream = Google 的神经音频编解码器(提供声学 token)
  • masked LM = 掩码语言模型(BERT 式”填空”预训练)
  • autoregressive = 自回归(逐个 token 预测下一个)
  • blind test = 盲测(被试不知道样本来源的判断测试)
  • LM = Language Model,语言模型
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[音频理解] AudioLM:音频当语言续写
https://mizuki-eaf.pages.dev/posts/音频生成模型/音频理解-audiolm音频当语言续写/
作者
无名之子
发布于
2026-08-04
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录