AudioLM 论文解读:把音频当”语言”续写,骗过人类耳朵的那 51.2%
论文:AudioLM: a Language Modeling Approach to Audio Generation 作者/机构:Zalán Borsos、Raphaël Marinier、Damien Vincent、Eugene Kharitonov 等(Google) 这篇是 2022 年 9 月 Google 的”范式宣言”:音频根本不用先转成文本,它本身就是一门语言。AudioLM 把输入音频切成离散 token,然后用语言模型的方式”续写”——给几秒提示,它就能续出语法通顺、语义连贯的语音,还能保持说话人身份和韵律;不只语音,钢琴曲也能续。在人耳盲测里,人类正确识别 AI 语音的比例只有 51.2%,跟随机猜(50%)基本没差。这里要特别说清楚口径:51.2% 是人类”正确识别”AI 语音的比例(接近随机),而不是”无法区分率”——数字方向别写反了。
一、背景:音频的两种”语言”,各有各的毛病
要让语言模型(LM)处理音频,第一步是把音频变成 token。但 token 怎么选,是个两难:
- 声学 token(来自 SoundStream 这类神经编解码器):重建质量高,但一个 token 往往只对应很短的音频片段,长期结构——比如一段话讲没讲完、一首曲子的主题怎么走向——很容易丢;
- 语义 token:能抓住长期结构和内容走向,但重建出的声音质量不够好。
AudioLM 的选择是不做取舍,两个都要:用一套混合 token 化方案,各取所长。
二、架构:语义 + 声学两条码流,两阶段续写
AudioLM 的混合 token 化分两层:
- 语义 token(semantic tokens):来自 w2v-BERT——一个在音频上预训练过的掩码语言模型(masked LM,类似 BERT 的”填空”预训练)——把它的中间层激活离散化得到。它负责”这段声音在讲什么、结构怎么走”,是长期一致性的支柱。
- 声学 token(acoustic tokens):来自 SoundStream 神经编解码器的离散码。它负责”最终听到的音质”,是高质量合成的基础。
生成时走两阶段自回归(autoregressive):第一阶段只建模语义 token,把”内容大纲”续出来;第二阶段以语义 token 为条件,把声学 token 逐级补全。这有点像先写大纲、再填血肉——长程一致性保住了,音质也保住了。
三、纯无监督:没有一个字的转写,也能续出像样的话
AudioLM 全程训练在原始波形上,没有任何转写文本、没有任何标注。效果却出人意料:
- 给一段没见过的说话人的语音提示,它能续出句法和语义都说得通的后续内容,并且保持说话人身份和韵律;
- 它还能续出连贯的钢琴曲——即使训练时从未见过任何乐谱(符号化音乐)。
也就是说,模型在纯音频数据里自己学会了”语法”和”乐理”,这是”音频即语言”最有说服力的证据。
四、盲测:51.2%,人类的耳朵基本失灵
论文做人耳盲测:让被试判断”这段语音是真人说的,还是 AudioLM 生成的”。结果是正确识别率只有 51.2%,而随机猜也有 50%——人类基本区分不出 AI 和真人的语音。
这里再强调一次口径:51.2% 是”正确识别率”,不是”无法区分率”。它的含义是”正确识别比例接近随机水平,等于分不出来”。两种说法结论等价,但方向不同,引用时必须表述准确。
五、历史地位:“音频即语言”范式正式确立
AudioLM 是”纯音频语言建模”的里程碑。它证明了:语音、音乐都可以只用音频数据、用语言模型的套路生成,且质量能骗过人的耳朵。之后 Google 的 AudioPaLM、MusicLM 乃至整个音频 LLM 浪潮,都能在这篇里找到源头。
收尾:我的一点看法
AudioLM 让我最服气的不是某个分数,而是它把”范式”讲明白了:只要能把音频变成足够好的 token,生成问题就退化成语言建模问题,然后大规模算力和成熟的 Transformer 工程直接复用。两阶段”语义定结构、声学补细节”的分工,后来被无数音频大模型以不同形式继承。
局限也直说。一是它仍然依赖 SoundStream 这类编解码器的质量,tokenizer 的性能就是它的天花板;二是盲测的 51.2% 是”识别率”,只能说明”接近随机”,不能解读成”保证无法区分”——听力好的被试、更长的音频、或者专门找茬,结果都会变;三是它的能力是”续写”,离”指令式生成”(比如”给我一段周杰伦风格的歌”)还有距离,那要等后面文本条件控制的模型来补。不过作为把音频送进语言建模世界的先行者,AudioLM 值得反复读。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 论文 | AudioLM: a Language Modeling Approach to Audio Generation |
| arXiv / 时间 | 2209.03143(2022.09,Google) |
| 任务 | 纯音频语言建模(语音续写 / 钢琴续写) |
| 输入输出 | 原始波形,无需文本/标注 |
| 混合 token | w2v-BERT 语义 token + SoundStream 声学 token |
| 建模方式 | 两阶段自回归 |
核心创新
| 创新 | 要点 |
|---|---|
| 混合 token 化 | 语义 token 保长期结构 + 声学 token 保重建质量 |
| 两阶段自回归 | 先续语义大纲,再以语义为条件补全声学细节 |
| 纯无监督 | 无转写、无标注,在原始波形上学习”续写” |
关键成绩
- 保持未见说话人的身份与韵律,生成句法/语义连贯的语音续写
- 无乐谱训练下生成连贯钢琴续写
- 人耳盲测:人类正确识别 AI 语音的比例仅 51.2%(接近随机 50%)
关键概念清单
- semantic tokens = 语义 token(捕捉内容与长期结构)
- acoustic tokens = 声学 token(保证合成音质)
- w2v-BERT = 在音频上预训练的掩码语言模型(提供语义离散特征)
- SoundStream = Google 的神经音频编解码器(提供声学 token)
- masked LM = 掩码语言模型(BERT 式”填空”预训练)
- autoregressive = 自回归(逐个 token 预测下一个)
- blind test = 盲测(被试不知道样本来源的判断测试)
- LM = Language Model,语言模型
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





