mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1915 字
5 分钟
[音频理解] Whisper:68 万小时训练
2026-07-08

Whisper 论文解读:68 万小时”听写训练”,把语音识别卷成了零样本#

论文:Robust Speech Recognition via Large-Scale Weak Supervision 作者/机构:Alec Radford、Jong Wook Kim、Tao Xu、Greg Brockman、Christine McLeavey、Ilya Sutskever(OpenAI) 这篇是 2022 年 9 月 OpenAI 发布的”不讲武德”之作。它没搞新架构,只是把网上抓来的 68 万小时”语音 + 转写文本”喂给一个标准的 Transformer,用弱监督方式直接预测文本,结果在零样本、不微调的情况下,就在一堆标准基准上追平甚至超过了此前的全监督系统,抗噪和鲁棒性逼近人类水平。它支持 99 种语言(官方 GitHub 口径),参数规模从 39M 到 1.55B 五档任选。严格说它是”理解”模型不是”生成”模型,但它重新定义了语音数据管线的质量上限,成了后续几乎所有语音大模型的事实标准前端。


一、背景:监督学习喂不动语音识别了#

传统 ASR(Automatic Speech Recognition,自动语音识别)走的是”精选数据 + 强监督”路线:用人工标注的小而精语料训练,数据贵、语种少、换个环境就崩。问题是,语音的多样性——口音、噪声、方言、语码混合——根本不是人工标注能覆盖的。OpenAI 的赌注是:互联网上现成的大量”音频 + 文字”对,虽然标注质量参差,但数量级碾压人工数据;大到一定程度,弱监督也能练出强模型。 这套逻辑他们在 CLIP 上验证过一遍,这次轮到语音。

二、数据与方法:弱监督 + 多任务 + 标准 Transformer#

  • 68 万小时多语种、多任务数据,直接从互联网抓取语音和对应转写文本。
  • 架构很朴素:编码器—解码器结构的 Transformer(注意不是 GPT 那种 decoder-only,Whisper 保留了 encoder 来”看”整段音频),输入是 80 通道的 log-mel 频谱(对梅尔频谱取对数,语音模型的常见输入特征),输出文本序列。
  • 多任务训练目标:不仅做语音识别,还同时做翻译(其他语言 → 英语)、语言识别、时间戳预测(VAD,Voice Activity Detection,语音活动检测)。一个模型把”听懂、翻译、认出语言、定位语音段”全包了。
  • 语言覆盖:训练数据里检测到 117 种语言,其中 99 种有足够数据进入训练(官方 GitHub 口径)。
  • 五个规格:tiny 39M、base 74M、small 244M、medium 769M、large 1.55B,性能和算力按需取舍。

三、零样本泛化:不微调也敢硬刚#

Whisper 最反直觉的成绩是:在零样本迁移(zero-shot transfer)设置下,不做任何微调,就在标准基准上追平甚至超过了此前需要针对性训练的全监督系统,准确率和鲁棒性逼近人类水平。这意味着它”自学”到了声音与文字之间足够通用的映射,而不是背熟某个数据集。

它对噪声、重口音、嘈杂环境的抵抗力,是那些小而精的专用模型给不了的——这也是后来几乎所有项目都拿它当前端的原因:省事,而且抗造。

四、它是”理解”模型,凭什么进音频生成史?#

把 Whisper 写进《音频生成模型发展史》,不是因为它能生成,而是因为:

  1. 它重定义了语音数据管线:以前语音数据”能不能用”,取决于有没有高质量标注;Whisper 让”海量互联网音频 → 高质量转写”变成流水线操作,语音大模型的训练数据从此有了天花板级的质量保障。
  2. 它成了事实标准前端:从级联式语音助手到语音 Agent,几乎都走”Whisper 转写 → LLM 处理 → TTS 回话”的管线,Whisper 是这条管线最稳的第一环。
  3. 后续版本继续演进:large-v3 于 2023 年 11 月发布,进一步改善了多语种与转写质量,社区至今仍把它当主力模型用。

收尾:我的一点看法#

Whisper 的哲学是”规模能解决的事,就不要用技巧”。没有新架构、没有花哨损失,全靠 68 万小时数据把 Transformer 喂出鲁棒性。这对后来者是个重要提醒:当数据本身可以大规模获取时,弱监督是性价比极高的路线。图像有 CLIP,语音有 Whisper,同一套方法论被验证了两次,说服力很强。

但它也有边界。弱监督受制于数据分布:对互联网语料覆盖少的小语种和方言,效果明显下滑;大模型(large)推理成本高,实时场景得靠蒸馏和 tiny/base 顶着;而且它毕竟是”理解”模型,跟生成侧的 token 化逻辑(SoundStream/EnCodec)不是一回事,别指望 Whisper 自己会生成语音。最后注明一点:“99 语种”是官方 GitHub 口径,论文正文以”检测到 117 种语言”表述,各版本实际支持的语种集合建议以仓库 README 为准(⚠️)。


附:核心数据速查#

基本盘

项目数值
论文Robust Speech Recognition via Large-Scale Weak Supervision
arXiv / 时间2212.04356(2022.12 提交;模型 2022.09 发布)
机构OpenAI
训练数据680,000 小时多语种弱监督数据
语言99 种(官方 GitHub 口径;数据中检测到 117 种)
参数规模39M / 74M / 244M / 769M / 1.55B(tiny–large)
架构编码器—解码器 Transformer,80 通道 log-mel 输入

核心创新

创新要点
大规模弱监督68 万小时互联网”音频+转写”,用数量换质量
多任务训练ASR + 翻译 + 语言识别 + 时间戳,一模型多能力
零样本迁移不微调即追平/超越全监督系统,鲁棒性逼近人类

关键成绩

  • 零样本下追平甚至超越此前的全监督结果
  • 抗噪、抗口音鲁棒性逼近人类水平
  • 成为语音大模型事实标准前端;large-v3 于 2023.11 发布

关键概念清单

  • weak supervision = 弱监督(用低质但海量的标注训练)
  • zero-shot transfer = 零样本迁移(不微调直接部署到新任务)
  • multitask = 多任务(一个模型同时学多个目标)
  • log-mel spectrogram = 对数梅尔频谱(语音模型常见输入特征)
  • ASR = Automatic Speech Recognition,自动语音识别
  • VAD = Voice Activity Detection,语音活动检测(定位”哪里有人在说话”)
  • encoder-decoder = 编码器—解码器(Transformer 的一种结构,先压缩输入再展开输出)
  • decoder-only = 仅解码器结构(如 GPT 系列,只能从左到右生成)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[音频理解] Whisper:68 万小时训练
https://mizuki-eaf.pages.dev/posts/音频生成模型/音频理解-whisper68-万小时训练/
作者
无名之子
发布于
2026-07-08
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录