音频生成模型发展史:十年四线,AI 从无声到”开口就聊、张嘴就唱”(2016–2026)
〇、总览:这篇文章讲什么
文章系统梳理了**音频生成(Audio Generation)**领域从 2016 年 WaveNet 发布,到 2026 年 8 月原生多模态语音时代的十年技术进化史。全文覆盖 60 余个模型、论文与关键事件,沿四条主线展开:
- 语音合成(TTS)——从波形级自回归(WaveNet)到声码器提速,再到非自回归、端到端,直至大模型零样本与多模态语音 LLM;
- 音乐与音效生成——从符号音乐(MuseNet)到原始音频自回归(Jukebox),再到编解码 token 语言建模与扩散/流匹配,最终以 Suno、Udio 完成产品化;
- 语音多模态大模型——从 ASR 工具(Whisper)到音频理解基座,再到实时全双工对话(Moshi、GPT-4o),收敛为”单模型端到端”;
- 基础设施与生态——神经音频编解码器(SoundStream→EnCodec→DAC→Mimi)、评测基准(FAD、MusicCaps)、商业融资与版权博弈。
文章最后总结出音频生成领域的四条方法论:抽象层级跃迁优先于算力堆叠、自回归与扩散”两条腿走路”、端到端取代流水线、开源与中文社区成为第二引擎。
一、发展时间线总表
| 时间 | 模型/事件 | 机构 | 类别 | 核心贡献 |
|---|---|---|---|---|
| 2016.09 | WaveNet | DeepMind | TTS | 波形级自回归开山之作,MOS 4.21(自然 4.46/4.55) |
| 2017.02 | Deep Voice | 百度 | TTS | 首个全神经 TTS 管线 |
| 2017.04 | Tacotron | TTS | seq2seq+注意力端到端 TTS | |
| 2017.11 | Parallel WaveNet | DeepMind | TTS | 概率密度蒸馏,GPU 上 >20× 实时,上线 Google Assistant |
| 2017.12 | Tacotron 2 | TTS | MOS 4.53(自然 4.58),首次逼近真人 | |
| 2018.10 | WaveGlow / LPCNet | NVIDIA / Mozilla | TTS | 流式声码器(>500 kHz)/ CPU 单核实时声码器 |
| 2019.04 | MuseNet | OpenAI | 音乐 | 符号(MIDI)音乐预训练,72 层稀疏 Transformer |
| 2019.05 | FastSpeech | 微软 | TTS | 首个非自回归并行 TTS,~270× 加速 |
| 2019.10 | MelGAN | Lyrebird | TTS | 首个实用 GAN 声码器,1080Ti 上 >100× 实时 |
| 2020.04 | Jukebox | OpenAI | 音乐 | 原始音频+人声歌唱生成,顶层 prior 5B 参数、训练 120 万首歌 |
| 2020.06 | FastSpeech 2 | 微软 | TTS | 免 teacher 蒸馏的并行 TTS,训练快 3× |
| 2020.10 | HiFi-GAN | Kakao | TTS | 多周期判别器声码器,V100 上 167.9× 实时 |
| 2021.06 | VITS | Kakao | TTS | 首个完全端到端(文本→波形)开源 TTS,LJSpeech MOS 4.43 |
| 2021.07 | SoundStream | 编解码 | 神经音频编解码器开山之作,RVQ 3–18 kbps 可调 | |
| 2022.05 | NaturalSpeech | 微软 | TTS | 变分端到端,LJSpeech 达人类级 |
| 2022.09 | AudioGen | Meta | 音效 | 文本→音效,1B(large;另有 285M),ICLR 2023 |
| 2022.09 | Whisper | OpenAI | 多模态 | 弱监督 ASR/翻译,68 万小时、99 语种,39M–1.55B |
| 2022.09 | AudioLM | 多模态 | ”音频即语言”,人耳正确识别率仅 51.2%(≈随机,基本无法区分) | |
| 2022.10 | EnCodec | Meta | 编解码 | RVQ 编解码器,6 kbps≈MP3 64 kbps,支撑 MusicGen 等 |
| 2023.01 | VALL-E | 微软 | TTS | 编解码 token+LM 零样本 TTS 开山作,3 秒提示克隆音色 |
| 2023.01 | MusicLM | 音乐 | 分层 seq2seq 音乐生成,24 kHz;发布 MusicCaps 5.5k 基准 | |
| 2023.01 | AudioLDM | Surrey | 音效 | CLAP 条件潜在扩散,单 GPU 可训练 |
| 2023.04 | Bark / NaturalSpeech 2 | Suno / 微软 | 混合 | GPT 风格全能音频 / RVQ+潜扩散零样本 |
| 2023.05 | SpeechGPT | 复旦 | 多模态 | 语音 token 进 LLM 的早期尝试 |
| 2023.06 | MusicGen | Meta | 音乐 | 单阶段 LM+EnCodec 4 码本并行,32 kHz;3.3B 的 MusicCaps FAD=3.8 |
| 2023.06 | Voicebox | Meta | TTS | 非自回归流匹配 infilling,5 万小时/6 语种,20× 快于 VALL-E |
| 2023.06 | DAC | Descript | 编解码 | 44.1 kHz@8 kbps ≈ 90× 压缩,语音/音乐/音效通用 |
| 2023.08 | AudioLDM 2 | Surrey | 音效 | ”语言化音频”(LOA)统一语音/音乐/音效 |
| 2023.09 | Stable Audio | Stability AI | 音乐 | 时序条件潜在扩散,扩散 U-Net 约 0.9B(全模型约 1.15B)、44.1 kHz 立体声 95 秒 |
| 2023.10 | SALMONN | 清华/字节 | 多模态 | 通用听觉 LLM,13B(Vicuna 基础) |
| 2023.11 | Qwen-Audio / XTTS / Lyria | 阿里 / Coqui / Google | 混合 | 统一音频理解 / 多语零样本开源 TTS / 商业音乐 API |
| 2023.12 | Audiobox / Suno 上线 / OpenVoice | Meta / Suno / MyShell | 混合 | 流匹配统一生成 / 12.20 公开测试 / 即时克隆 |
| 2024.01 | GPT-SoVITS | 开源 | TTS | 5 秒零样本克隆、1 分钟微调,中文社区爆款 |
| 2024.03 | Suno v3 / NaturalSpeech 3 | Suno / 微软 | 混合 | AI 音乐引爆点 / FACodec 分解+扩散(1B/20 万小时) |
| 2024.04 | Udio / Stable Audio 2 / 天工 SkyMusic | Uncharted Labs / Stability / 昆仑万维 | 音乐 | AI 音乐”双子星”成型 / 3 分钟整曲 / 中国首个音乐 AIGC |
| 2024.05 | GPT-4o / Suno v3.5 / ChatTTS | OpenAI / Suno / 2noise | 混合 | 首个原生端到端音频大模型 / 4 分钟歌曲 / 对话场景中文 TTS |
| 2024.06 | VALL-E 2 / Seed-TTS / RIAA 起诉 / Stable Audio Open | 微软 / 字节 / RIAA / Stability | 混合 | WER 1.6% 与真人持平 / 版权战争开打 / 开源 1B 扩散 |
| 2024.07 | CosyVoice / Qwen2-Audio / Udio v1.5 | 阿里 / Udio | 混合 | LLM+流匹配约 300M(论文表 10 命名口径)中英零样本 / 48 kHz 分轨 |
| 2024.08 | Gemini Live / Mini-Omni | Google / 清华 | 多模态 | 实时语音助手首发 / 首个开源全模态实时对话 |
| 2024.09 | Moshi / GPT-4o 高级语音模式 | Kyutai / OpenAI | 多模态 | 首个实时全双工口语 LLM,理论 160 ms/实测约 200 ms(2024.07 演示、09 开源)/ 50+ 语种全量开放 |
| 2024.10 | GLM-4-Voice / F5-TTS / Fish Speech | 智谱 / 上交 / fishaudio | TTS | 9B 情感语音对话 / DiT 流匹配 RTF 0.15 / 开源多语 |
| 2024.11 | Suno v4 / Seed-VC | Suno / 腾讯 | 混合 | Remaster/Cover/Persona/ReMi / 扩散变声(唱歌 CER 19.7%) |
| 2024.12 | Step-Audio / CosyVoice 2 / Kokoro-82M | 阶跃 / 阿里 / 开源 | 混合 | 130B 端到端语音交互 / FSQ 流式首包约 150 ms(官方口径)/ 82M 参数登顶 TTS Arena |
| 2025.01 | YuE / ElevenLabs C 轮 | 港科大+M-A-P / ElevenLabs | 混合 | 5 分钟”歌词→歌”Apache 2.0 / 1.8 亿美元 @33 亿估值 |
| 2025.03 | Spark-TTS / Orpheus / Udio v1.5 Allegro | 讯飞 / Canopy / Udio | 混合 | BiCodec+Qwen2.5-0.5B / Llama 语音 LLM 3B / 提速 30% |
| 2025.04 | Kimi-Audio | 月之暗面 | 多模态 | 开源音频基础模型,1300 万小时预训练,12.5 Hz tokenizer |
| 2025.05 | CosyVoice 3 / ACE-Step / Suno v4.5 | 阿里 / ACE Studio+阶跃星辰 / Suno | 混合 | 1 万→100 万小时数据 / A100 上 20 秒生成 4 分钟 / 8 分钟歌曲 |
| 2025.06 | ElevenLabs v3 / Eleven Music | ElevenLabs | TTS | ”最富表现力” TTS,70+ 语种 / AI 音乐生成上线 |
| 2025.09 | Suno v5 / Qwen3-Omni 技术报告 | Suno / 阿里 | 混合 | 44.1 kHz、12 分轨、快 10 倍 / Thinker-Talker MoE 30B-A3B、首包 234 ms |
| 2025.11 | Suno C 轮 + 华纳和解 | Suno | 生态 | 2.5 亿美元 @24.5 亿估值;首个主流厂牌授权 |
| 2025.12 | Gemini 2.5 Flash Native Audio / Qwen3-TTS | Google / 阿里 | 混合 | 原生音频输入输出 / 流式 TTS 开源 |
| 2026.01 | MiniMax Speech 2.8 / ElevenLabs Scribe v2 | MiniMax / ElevenLabs | TTS | <250 ms 流式 / 90+ 语种最准转录 |
| 2026.02 | ElevenLabs D 轮 / ACE-Step 1.5 / Lyria 3 | ElevenLabs / 蚂蚁 / Google | 混合 | 5 亿美元 @110 亿估值 / <2 秒一首 / 进 Gemini 图导音乐 |
| 2026.03 | Suno v5.5 / Fish Speech S2 | Suno / fishaudio | 混合 | 声音克隆/自定义模型 / DualAR(4B+0.4B)千万小时 |
| 2026.07 | GPT-Live | OpenAI | 多模态 | 新一代实时语音 |
四个分水岭:SoundStream/EnCodec(音频 token 化,2021–2022)、VALL-E(零样本 TTS,2023.01)、GPT-4o(端到端实时语音,2024.05)、Suno v3/v5(AI 音乐产品化,2024.03/2025.09)。
二、阶段一:奠基——波形生成与神经声码器(2016–2018)
1. WaveNet:起点
2016 年 9 月(arXiv<1609>1609>.03499)。DeepMind 的波形级自回归开山之作:逐样本预测 16 kHz 波形,用因果膨胀卷积建模长程依赖。MOS 达到 4.21(自然语音 4.46/4.55),首次让机器语音”像人”到可参加图灵测试的程度。代价是生成速度远慢于实时——每个样本依赖前一个样本。核心意义:证明”神经波形合成可行”,但需要找到加速路径。
2. 全神经管线与端到端:Deep Voice、Tacotron
- Deep Voice(百度,2017.02,arXiv<1702>1702>.07825):首个把文本前端、声学模型、声码器全部网络化的 TTS 系统,后续 Deep Voice 2(1705.08947)支持多说话人、Deep Voice 3(1710.07654)改为全卷积 seq2seq;
- Tacotron(Google,2017.04,arXiv<1703>1703>.10135):seq2seq + 注意力,直接从文本生成频谱——“文本→语音”一步到位,不再需要手工特征;
- Tacotron 2(Google,2017.12,arXiv<1712>1712>.05884):seq2seq 预测 mel 谱 + WaveNet 声码器,LJSpeech 上 MOS 4.53(自然 4.58),被公认为”第一个接近人类的神经 TTS”,也是此后两年的事实标准。
3. 提速三路线:蒸馏、流、DSP 混合
- Parallel WaveNet(DeepMind,2017.11,arXiv<1711>1711>.10433):概率密度蒸馏让 WaveNet 并行化,GPU 上 >20× 实时(比原版快约千倍),2018 年上线 Google Assistant——音频生成第一次走上生产环境;
- WaveGlow(NVIDIA,2018.10,arXiv<1811>1811>.00002):基于流的单网络声码器,V100 上 >500 kHz(>25× 实时);
- LPCNet(Mozilla,2018.10,arXiv<1810>1810>.11846):线性预测编码 + 稀疏 GRU,约 3 GFLOPs,CPU 单核即可实时——低算力设备路线。
三、阶段二:提速——非自回归、GAN 声码器与端到端 TTS(2019–2021)
1. 非自回归革命:FastSpeech 系列
FastSpeech(微软,2019.05,arXiv<1905>1905>.09263):首个非自回归并行 TTS,一次前向生成整段频谱,~270× 加速(代价是先训练 teacher 模型做时长对齐)。FastSpeech 2(2020.06,arXiv<2006>2006>.04558) 免去蒸馏,显式建模 duration/energy/pitch,训练快 3 倍、质量反超。并行合成范式由此确立。
2. GAN 声码器:MelGAN 与 HiFi-GAN
- MelGAN(Lyrebird,2019.10,arXiv<1910>1910>.06711):首个实用 GAN 声码器,1080Ti 上 >100× 实时;
- HiFi-GAN(Kakao,2020.10,arXiv<2010>2010>.05646):多周期判别器(MPD),22.05 kHz,V100 上 167.9× 实时,此后两年成为开源 TTS 的”标准声码器”。
3. VITS:完全端到端
VITS(Kakao,2021.06,arXiv<2106>2106>.06103):CVAE + flow + GAN 三合一,文本直接到波形,没有中间频谱/声码器环节,LJSpeech MOS 4.43。它是”端到端”理念的完成态,也是 2021–2023 年开源 TTS 的默认基线。
4. 音乐生成的先行者(插叙)
- MuseNet(OpenAI,2019.04):符号(MIDI)音乐预训练 Transformer,72 层稀疏注意力、4096 token 上下文、10 种乐器——验证”预测下一个 token”同样适用于音乐;
- Jukebox(OpenAI,2020.04,arXiv<2005>2005>.00341):首个生成原始音频+人声歌唱的模型,多尺度 VQ-VAE(8×/32×/128×)压缩 44 kHz 波形 + 自回归 Transformer,顶层 prior 5B 参数、训练 120 万首歌。代价极端:渲染 1 分钟音频约需 9 小时。它同时预告了两个未来方向——“压缩后再建模”和”自回归原始音频”。
5. SoundStream:音频 token 化的起点(分水岭①)
SoundStream(Google,2021.07,arXiv<2107>2107>.03312):首个端到端可学习的神经音频编解码器,RVQ(残差向量量化)+ SEANet + 多尺度判别器,单模型支持 3–18 kbps 可变码率,3 kbps 的主观质量超过 Opus 12 kbps。它的意义超出压缩本身:把连续波形变成离散 token,让音频可以像文本一样交给语言模型建模——这是后续一切”音频大模型”的地基。
四、阶段三:token 化与大模型前夜(2022–2023.06)
1. 编解码器基础设施
- EnCodec(Meta,2022.10,arXiv<2210>2210>.13438):SEANet + RVQ,24 kHz 1.5–24 kbps、48 kHz 3–24 kbps,Transformer 熵编码再省 25–40% 码率,6 kbps ≈ MP3 64 kbps。它是 MusicGen、AudioGen 等 Meta 系模型的标配 tokenizer;
- DAC(Descript,2023.06,arXiv<2306>2306>.06546):通用 RVQGAN,44.1 kHz @ 8 kbps ≈ 90× 压缩,一个模型覆盖语音/音乐/环境音,NeurIPS 2023 spotlight。
2. 音频理解奠基:Whisper 与 AudioLM
- Whisper(OpenAI,2022.09,arXiv<2212>2212>.04356):弱监督 ASR/翻译/语音识别,68 万小时多语数据、99 语种、39M–1.55B 参数,零样本抗噪泛化极强(large-v3 于 2023.11 发布)。严格说它是”理解”而非”生成”模型,但它重新定义了语音数据管线的质量上限,成为后续所有语音大模型的事实标准前端;
- AudioLM(Google,2022.09,arXiv<2209>2209>.03143):纯音频语言建模(语音/钢琴续写),语义+声学混合 token,人耳盲测中正确识别 AI 语音的比例仅 51.2%(接近随机 50%),即基本无法区分——“音频即语言”范式正式确立。
3. 零样本 TTS 开山:VALL-E 与同类
- VALL-E(微软,2023.01,arXiv<2301>2301>.02111):把 TTS 变成”音频 token 的条件语言建模”——3 秒参考语音即可克隆音色与韵律,LibriSpeech WER 5.9%。它点燃了”音频 token 大模型”军备竞赛,后续一切零样本 TTS 都可溯源至此;
- Tortoise TTS(开源,2022):AR 生成 latent + 扩散声码器,社区零样本标杆;
- NaturalSpeech 2(微软,2023.04,arXiv<2304>2304>.09116):RVQ + 潜扩散,4.4 万小时数据,零样本 + 歌声合成;
- Voicebox(Meta,2023.06,arXiv<2306>2306>.15687):非自回归流匹配 + infilling 任务(文本修复式训练),5 万小时/6 语种,推理 20× 快于 VALL-E——扩散/流匹配路线首次与自回归正面交锋;
- Bark(Suno,2023.04 开源):GPT 风格文本→音频(人声+音乐+音效),Suno 公司的技术前身。
4. 音乐与音效生成大模型
- MusicLM(Google,2023.01,arXiv<2301>2301>.11325):分层 seq2seq(SoundStream + w2v-BERT 600M + MuLan 文本嵌入),24 kHz 多分钟连贯音乐;同期发布 MusicCaps 5.5k 音文对基准,成为此后音乐生成的评测标准;
- AudioGen(Meta,2022.09,arXiv<2209>2209>.15352):文本→音效,1B(large;另有 285M base),EnCodec token 自回归,ICLR 2023;
- AudioLDM(Surrey,2023.01,arXiv<2301>2301>.12503):CLAP 条件潜在扩散,单 GPU 即可训练即达当时最优(ICML 2023);
- Tango(NVIDIA,2023.04,arXiv<2304>2304>.13731):Flan-T5 指令编码 + LDM,训练数据小 63 倍仍超 AudioLDM;
- MusicGen(Meta,2023.06,arXiv<2306>2306>.05284):单阶段 LM + EnCodec 4 码本并行预测,32 kHz、训练 2 万小时许可音乐,300M/1.5B/3.3B 三档开源;3.3B 在 MusicCaps FAD=3.8,此后两年开源音乐生成的事实基线。
5. 语音进 LLM:SpeechGPT 与 AudioPaLM
- SpeechGPT(复旦,2023.05,arXiv<2305>2305>.11000):语音 token 离散化后进 LLM,跨模态对话的早期尝试;
- AudioPaLM(Google,2023.06,arXiv<2306>2306>.12925):PaLM-2 + AudioLM 统一”听说”,翻译时保留说话人身份。
五、阶段四:统一音频与 AI 音乐起步(2023.07–2024.04)
1. 统一生成模型
- AudioLDM 2(Surrey,2023.08,arXiv<2308>2308>.05734):提出”语言化音频”(LOA,AudioMAE + GPT-2 生成描述)+ LDM,一个模型统一语音/音乐/音效,1.1–1.5B;
- Stable Audio(Stability AI,2023.09,arXiv<2402>2402>.04825):时序条件潜在扩散,扩散 U-Net 约 0.9B(全模型约 1.15B)、44.1 kHz 立体声 95 秒、A100 渲染仅 8 秒;训练数据 80 万文件 ≈ 1.95 万小时(AudioSparx 授权语料)——“快”第一次成为卖点;
- Audiobox(Meta,2023.12,arXiv<2312>2312>.15821):flow-matching 统一语音/音乐/音效,AudioCaps FAD 0.77、零样本 TTS 相似度 0.745。
2. 听觉 LLM 与语音克隆
- SALMONN(清华/字节,2023.10,arXiv<2310>2310>.13289):通用听觉 LLM(语音/音效/音乐理解),13B(Vicuna 基础,开源仓库另有 7B 检查点);
- Qwen-Audio(阿里,2023.11,arXiv<2311>2311>.07919):统一多任务音频理解,用多任务共训规避一对多映射退化;
- OpenVoice(MyShell,2023.12,arXiv<2312>2312>.01479):即时克隆 + 风格/情感可控 + 零样本跨语种;
- XTTS(Coqui,2023.11):多语零样本开源 TTS,v2 MOS 4.21,2024 年成为 HuggingFace 下载量最大的开源 TTS(约 930 万次)。
3. AI 音乐产品化前夜
- Lyria(Google DeepMind,2023.11.16):承接 MusicLM 技术的音乐生成 API 首发(MusicLM 本身于 2023.05 经 AI Test Kitchen 开放,无独立 API);
- Suno 公开上线(2023.12.20):集成微软 Copilot,chirp-v1/v2 最长 80 秒——“AI 音乐平台”这一物种诞生;
- ElevenLabs v2(2023.08/12):商业 TTS 标杆,多语种、极低延迟。
4. 2024 年初的爆发前奏
- GPT-SoVITS(开源,2024.01):5 秒零样本克隆、1 分钟微调跨语种,GitHub 5.9 万 ★,中文社区现象级项目;
- Suno v3(2024.03.21):“广播级”质量、2 分钟歌曲,被 Rolling Stone/Wired 评价为”首批能在短片段中骗过普通听众的 AI 音乐”——AI 音乐的 ChatGPT 时刻;
- NaturalSpeech 3(微软,2024.03,arXiv<2403>2403>.03100):FACodec 分解语音属性 + 扩散,1B/20 万小时;
- Udio(2024.04.10 公测):前 Google DeepMind 团队(Uncharted Labs,约 1000 万美元种子,a16z)——Suno 的”双子星”对手出现;
- Stable Audio 2.0(2024.04.03):3 分钟整曲、audio-to-audio 与风格迁移;
- 天工 SkyMusic(昆仑万维,2024.04.17):中国首个端到端音乐 AIGC;网易天音(2024.05)上线免费 AI 作词/作曲/演唱一体化。
六、阶段五:分水岭——实时语音对话与 AI 音乐爆发(2024.05–2024.12)
1. 端到端实时语音:GPT-4o 与全双工时代
- GPT-4o(OpenAI,2024.05):首个原生端到端音频大模型(音频直接进出,无 ASR→LLM→TTS 级联),音频响应平均 320 ms(最低 232 ms),而旧级联管线需 2.8–5.4 秒——语音交互第一次进入”人感”延迟区间。2024.09.24 高级语音模式向 Plus 用户全量开放(50+ 语种、可打断);
- Moshi(Kyutai,2024.07 首次公开演示 / 2024.09 开源,arXiv<2410>2410>.00037):首个实时全双工口语 LLM:Inner Monologue 双流架构(同时处理”说什么”与”怎么说”),Helium 7B + Mimi 编解码器,理论延迟 160 ms/实测约 200 ms;
- Gemini Live(Google,2024.08.13 首发):语音实时助手,2025 I/O 后全平台免费、45+ 语种;
- Mini-Omni(清华,2024.08,arXiv<2408>2408>.16725):首个开源”语音进语音出”全模态实时对话模型;
- GLM-4-Voice(智谱/清华,2024.10,arXiv<2412>2412>.02612):端到端情感语音对话,9B,12.5 Hz/175 bps 超低码率 tokenizer;
- Step-Audio(阶跃星辰,2024.12,arXiv<2502>2502>.11946):130B 端到端语音交互(情感/方言/唱 RAP),2025.02 开源;GPT-4o-mini-Realtime(2024.12.17 预览)把实时语音 API 成本打下来;
- Qwen2-Audio(阿里,2024.07,arXiv<2407>2407>.10759):音频理解 + 语音对话统一。
2. 零样本 TTS 成熟年
- VALL-E 2(微软,2024.06,arXiv<2406>2406>.05370):重复感知采样 + 分组编码,LibriSpeech WER 1.6%,与真人转写(1.6%)持平,Ref Utterance 下 1.5% 低于真人,首次宣称零样本 TTS”人类平价”;
- Seed-TTS(字节,2024.06,arXiv<2406>2406>.02430):大规模 AR 家族,自然度/相似度匹配真人、情绪可控,含 DiT 变体;
- CosyVoice(阿里,2024.07,arXiv<2407>2407>.05407):LLM + 流匹配,约 300M(论文表 10 命名口径)中英零样本,FunAudioLLM 开源;
- ChatTTS(2noise,2024.05):对话场景中文 TTS,10 万+ 小时数据,气口/笑声自然,B 站爆款;
- F5-TTS(上交,2024.10,arXiv<2410>2410>.06885):DiT 流匹配、免文本-语音对齐,RTF 0.15,10 万小时数据;
- Fish Speech(fishaudio,2024.10):开源多语,V1.5 英 WER 3.5%、TTS Arena ELO 1339;
- Seed-VC(腾讯,2024.11,arXiv<2411>2411>.09943):扩散 Transformer 零样本变声,唱歌 CER 19.7% 优于 RVCv2 的 28.5%。
3. AI 音乐产品化:Suno 与 Udio 的版本战争
- Suno v3.5(2024.05.30):首个 4 分钟生成,歌曲结构(verse-chorus-bridge)显著改善;同期完成 1.25 亿美元 B 轮(估值约 5 亿);
- RIAA 起诉(2024.06.24):代表索尼/环球/华纳起诉 Suno(662 首)与 Udio(1670 首) 侵权训练,单曲最高索赔 15 万美元——AI 音乐的版权战争正式开打;
- Stable Audio Open(2024.06,arXiv<2407>2407>.14358):开源 1B 扩散模型,44.1 kHz/47 秒,仅用 48.6 万条 CC 许可数据,可本地微调;
- Udio v1.5(2024.07.23):48 kHz、分轨导出、调性控制;
- Suno v4(2024.11.19):Remaster(重制)/Cover(翻唱)/Persona(固定声线)/ReMi(歌词助手),从”生成器”走向”制作工具”。
4. 编解码器再进化
- WavTokenizer(浙大/阿里/Meta,2024.08,arXiv<2408>2408>.16532):单量化器 40/75 token/s,极致压缩 + 语义增强(ICLR 2025);
- Mimi(Kyutai,2024.09,随 Moshi):流式编解码器,24 kHz → 12.5 Hz token @1.1 kbps、帧长 80 ms(端到端延迟 160–200 ms 见 Moshi),首级蒸馏 WavLM 语义——实时对话的低延迟基石。
七、阶段六:成熟——规模扩展与原生多模态(2025–2026.08)
1. AI 音乐:从产品到产业链
- YuE(港科大 + M-A-P,2025.03,arXiv<2503>2503>.08638):LLaMA2 基础、万亿 token 训练,5 分钟”歌词→歌”,Apache 2.0——开源音乐生成第一个严肃的”Suno 对手”;
- Suno v4.5(2025.05.01):8 分钟歌曲、1200+ 流派、非破坏编辑(Replace/Extend/Remaster/Covers);v4.5+(2025.07)加入 Add Vocals/Add Instrumentals 分轨操作;
- ACE-Step / 音跃(阶跃星辰 + ACE Studio,2025.05.07 联合开源,arXiv<2506>2506>.00045):3.5B,扩散 + Sana DCAE + 线性 Transformer,A100 上 20 秒生成 4 分钟音乐(比 LLM 基线快 15×),支持 19 语种、最快 15 秒成曲;ACE-Step 1.5(2026.02,arXiv<2602>2602>.00744) 进一步做到 <2 秒/首(A100)、<10 秒(RTX 3090)、<4 GB VRAM,LM 规划器 + DiT;
- Suno v5(2025.09.23):“complete re-architecture”,44.1 kHz、12 分轨、320 kbps、快 10 倍(内部代号 chirp-crow),9.25 发布 DAW 级 Suno Studio;
- Suno C 轮(2025.11):2.5 亿美元 @24.5 亿估值(Menlo Ventures 领投),并与华纳音乐和解签授权协议——首个主流厂牌合作;
- Eleven Music(ElevenLabs,2025 夏):授权训练、商业可用,年末上线 Music Marketplace 让创作者从 AI 曲目获利;
- Suno v5.5(2026.03.26):声音克隆/自定义模型;平台约 1 亿注册用户、200 万付费、ARR 3 亿美元(2026.02 口径),“日生成约 700 万首”为 2025.11 融资材料披露(Billboard 报道)。
2. 语音大模型:从 TTS 到”音频 AGI”
- CosyVoice 2(阿里,2024.12,arXiv<2412>2412>.10117):FSQ 量化 + chunk-aware 因果流匹配,流式/非流式统一,MOS 5.53(自评)、首包约 150 ms(官方 GitHub 口径;论文未给出具体数值);
- CosyVoice 3(阿里,2025.05,arXiv<2505>2505>.17589):0.5B→1.5B、数据 1 万→100 万小时、9 语种 + 18 方言,监督多任务语音分词器 + 可微奖励模型 RL 后训练;
- Spark-TTS(科大讯飞,2025.03,arXiv<2503>2503>.01710):BiCodec 解耦 + Qwen2.5-0.5B,中文 CER 1.20,VoxBox 10 万小时;
- Orpheus(Canopy,2025.03):Llama 语音 LLM 3B、情感标签、流式约 200 ms;
- MiniMax Speech:02(2025.04)→ 2.5(2025.08,40+ 语种)→ 2.6(2025.10,<250 ms)→ 2.8(2026.01);
- Kimi-Audio(月之暗面,2025.04,arXiv<2504>2504>.18425):开源音频基础模型,1300 万小时预训练、12.5 Hz tokenizer、流匹配 chunk 式 detokenizer,ASR/理解/问答/对话多项 SOTA;
- Qwen3-Omni(阿里,模型 2025.05 开源 / 技术报告 2025.09,arXiv<2509>2509>.17765):Thinker-Talker MoE 30B-A3B,冷启动首包 234 ms,36 个音频/音视频基准中 32 项开源 SOTA、119 语种文本/19 语种语音理解/10 语种语音生成,且四模态无退化——当前开源音频多模态的天花板;
- GPT-5(OpenAI,2025.08.07):多模态旗舰(发布初期 API 不含音频,语音模式随后上线);Step-Audio 2(阶跃,2025.07,arXiv<2507>2507>.16632)支持语音对话与合成(论文未涉歌唱任务);
- Fish Speech S2(2026.03):DualAR(4B+0.4B)双自回归,千万小时/80+ 语种,Seed-Eval 中文 WER 0.54%/英文 0.99%。
3. 实时语音产品与平台
- GPT-4o Realtime API / gpt-realtime-1.5(2026.02.23):生产级语音代理;GPT-Live(2026.07) 新一代语音;
- Gemini 2.5 Flash Native Audio + Gemini TTS(2025.12):风格/情感控制;Lyria 3(2026.02.18) 进入 Gemini,支持 30 秒图/视频导音乐;
- Qwen3-TTS(阿里,API 2025.12 / HF 开源 2026.01,arXiv<2601>2601>.15621):流式 TTS 开源;gpt-4o-mini-tts / gpt-audio-mini(2025.12.22),WER 下降约 35%;
- ElevenLabs v3(2025.06 发布 / 2026.02 GA):“最富表现力” TTS,70+ 语种,Flash 延迟 75 ms(官方口径);Scribe v2(2026.01.09) 90+ 语种转录。
4. 商业与生态格局
- ElevenLabs:2022 年创立 → 2023.01 公测 → 2024.01 B 轮 8000 万 @11 亿(独角兽)→ 2025.01 C 轮 1.8 亿 @33 亿 → 2025.09 NVIDIA 战略投资 → 2026.02.04 D 轮 5 亿美元 @110 亿估值(红杉领投,累计融资 7.81 亿美元,2025 年底 ARR 3.3 亿美元)——语音 AI 商业化标杆;
- Suno:2022 年创立(Kensho 系)→ 2023.12 上线 → B 轮 1.25 亿 → C 轮 2.5 亿 @24.5 亿 → 2026 年探索 D 轮(估值超 50 亿美元 ⚠️);
- 版权博弈:RIAA 诉讼后,Suno 与华纳和解授权(2025.11),Udio 与环球/华纳和解并共建授权平台(⚠️);截至 2026 年中环球、索尼对 Suno 的诉讼仍在进行(⚠️);
- HuggingFace 开源生态:XTTS-v2(930 万下载,2024 第一)→ Kokoro-82M(2024.12.25,82M 参数、训练成本约 1000 美元、登 TTS Arena 榜首,2026.8 累计下载约 1200 万、居 HF 开源 TTS 下载第一)→ Chatterbox(2025.05,MIT)→ Qwen3-TTS——开源把 TTS 入场成本打到近乎为零。
八、四条技术主线
主线一:语音合成——从波形到”语音 AGI”
WaveNet(波形自回归)→ 声码器提速(Parallel WaveNet/WaveGlow/MelGAN/HiFi-GAN)→ 非自回归(FastSpeech/2)→ 端到端(Tacotron 2/VITS/NaturalSpeech)→ 零样本大模型(VALL-E/Voicebox/Seed-TTS/NaturalSpeech 3)→ 多模态语音 LLM(CosyVoice 3/Spark-TTS/Orpheus/Fish S2/Qwen3-Omni)
- 波形级 → token 级:SoundStream/EnCodec 让 TTS 复用 LLM 范式(VALL-E 是标志)
- 双路线并行:自回归(保韵律多样)vs 扩散/流匹配(快、稳),混合系统(LLM 粗建模 + 扩散精渲染)成为工业主流
- 中文开源生态成为全球第二引擎:GPT-SoVITS、ChatTTS、CosyVoice、F5-TTS、Spark-TTS
主线二:音乐生成——从符号到产品
MuseNet(符号 MIDI)→ Jukebox(原始音频 AR,5B)→ MusicLM/MusicGen(编解码 token LM)→ AudioLDM/Stable Audio/Audiobox(扩散/流匹配)→ Suno/Udio(产品化、版本季度级迭代)→ ACE-Step/YuE(开源基础模型)→ Lyria RealTime(实时交互)
- 速度与质量的权衡是核心矛盾:Jukebox 9 小时/分钟 → ACE-Step 20 秒/4 分钟
- 评测从无到有:MusicCaps(5.5k)成为事实标准,FAD 为量化指标
- 版权从”灰色”到”授权”:RIAA 诉讼 → 华纳/环球/UMG 和解授权
主线三:语音多模态——从 ASR 到原生实时对话
Whisper/AudioLM(理解与 token 化奠基)→ SpeechGPT/AudioPaLM/SALMONN/Qwen-Audio(语音进 LLM)→ GPT-4o/Moshi/Mini-Omni(端到端实时,级联管线死亡)→ Qwen3-Omni/Kimi-Audio/GPT-5/Gemini Live(原生多模态、全双工、情感可控)
- 延迟从秒级(2.8–5.4 s 级联)降到百毫秒级(232 ms/160 ms/150 ms)
- 架构收敛:ASR+LLM+TTS 流水线 → 单模型端到端;说话人/情感/方言成为一等公民
主线四(暗线):基础设施、评测与资本
SoundStream(2021)→ EnCodec(2022)→ DAC(2023)→ WavTokenizer/Mimi(2024)——音频的”分词器”;FAD/MusicCaps/MUSHRA/WER/UTMOS/TTS-Arena——可量化的迭代反馈;ElevenLabs $11B、Suno $2.45B、RIAA 诉讼——商业化与合规的双轮
九、方法论:音频生成领域的四条规律
- 抽象层级跃迁优先于算力堆叠——从波形级(WaveNet)到频谱(Tacotron)再到 token 级(VALL-E/MusicGen),每一次层级跃迁都同时带来质量与效率的跃升;编解码器是比模型参数更关键的杠杆;
- 自回归与扩散”两条腿走路”——自回归擅长多样性与韵律一致性(TTS/音乐),扩散/流匹配擅长速度与稳定性(Stable Audio/ACE-Step/F5-TTS),工业界普遍采用”LLM 定内容、扩散定细节”的混合架构(CosyVoice、Seed-TTS、ACE-Step 1.5);
- 端到端取代流水线——级联(ASR→LLM→TTS)的 2.8–5.4 秒延迟被 GPT-4o 的 232 ms 终结;但端到端并非万能,语音 LLM 仍依赖编解码器与后处理模块,“单模型”是系统观而非字面意义;
- 开源与中文社区成为第二引擎——GPT-SoVITS、ChatTTS、CosyVoice、F5-TTS、Kokoro-82M($1000 训练成本)把 TTS 能力民主化;音乐侧 YuE、ACE-Step 则为开源留住了”Suno 之外的另一种可能”。
附录 A:主要论文/模型清单与 arXiv 映射
| 模型/版本 | 机构 | arXiv | 备注 |
|---|---|---|---|
| WaveNet | DeepMind | 1609.03499 | 波形级自回归开山作 |
| Tacotron / Tacotron 2 | 1703.10135 / 1712.05884 | seq2seq 端到端 | |
| Parallel WaveNet | DeepMind | 1711.10433 | 蒸馏并行 |
| WaveGlow / LPCNet / MelGAN | NVIDIA / Mozilla / Lyrebird | 1811.00002 / 1810.11846 / 1910.06711 | 声码器三路线 |
| FastSpeech / FastSpeech 2 | 微软 | 1905.09263 / 2006.04558 | 非自回归 |
| HiFi-GAN | Kakao | 2010.05646 | GAN 声码器标准件 |
| Jukebox | OpenAI | 2005.00341 | 原始音频音乐生成 5B |
| VITS | Kakao | 2106.06103 | 端到端 TTS |
| SoundStream | 2107.03312 | 神经编解码器开山作 | |
| NaturalSpeech / 2 / 3 | 微软 | 2205.04421 / 2304.09116 / 2403.03100 | 端到端→零样本→分解 |
| AudioGen | Meta | 2209.15352 | 文本→音效 1B(large,另有 285M) |
| Whisper | OpenAI | 2212.04356 | 弱监督 ASR 68 万小时 |
| AudioLM | 2209.03143 | 音频语言建模 | |
| EnCodec | Meta | 2210.13438 | RVQ 编解码器 |
| VALL-E / VALL-E 2 | 微软 | 2301.02111 / 2406.05370 | 零样本 TTS 开山/人类平价 |
| MusicLM | 2301.11325 | 音乐生成 + MusicCaps | |
| AudioLDM / AudioLDM 2 | Surrey | 2301.12503 / 2308.05734 | 潜在扩散音频 |
| Tango | NVIDIA | 2304.13731 | 指令音频扩散 |
| MusicGen | Meta | 2306.05284 | EnCodec token 音乐 LM |
| Voicebox | Meta | 2306.15687 | 流匹配 infilling TTS |
| DAC | Descript | 2306.06546 | 通用编解码器 90× |
| AudioPaLM | 2306.12925 | 统一听说 | |
| Stable Audio / Open | Stability AI | 2402.04825 / 2407.14358 | 时序扩散 / 开源 1B |
| Audiobox | Meta | 2312.15821 | 流匹配统一生成 |
| SALMONN | 清华/字节 | 2310.13289 | 通用听觉 LLM |
| Qwen-Audio / Qwen2-Audio / Qwen3-Omni | 阿里 | 2311.07919 / 2407.10759 / 2509.17765 | 音频理解→全模态(Qwen3-Omni 报告 2025.09 提交,模型 2025.05 开源) |
| OpenVoice | MyShell | 2312.01479 | 即时克隆 |
| SpeechGPT | 复旦 | 2305.11000 | 语音进 LLM 早期 |
| Mini-Omni | 清华 | 2408.16725 | 开源全模态实时对话 |
| Moshi(含 Mimi) | Kyutai | 2410.00037 | 实时全双工口语 LLM |
| GLM-4-Voice | 智谱/清华 | 2412.02612 | 端到端情感语音对话 |
| Step-Audio / 2 | 阶跃星辰 | 2502.11946 / 2507.16632 | 130B 语音交互 / 对话与合成 |
| Seed-TTS / Seed-VC | 字节 / 腾讯 | 2406.02430 / 2411.09943 | 大规模零样本 / 变声 |
| CosyVoice / 2 / 3 | 阿里 | 2407.05407 / 2412.10117 / 2505.17589 | LLM+流匹配→流式→规模化 |
| F5-TTS | 上交 | 2410.06885 | DiT 流匹配 RTF 0.15 |
| Spark-TTS | 科大讯飞 | 2503.01710 | BiCodec 中文 TTS |
| Kimi-Audio | 月之暗面 | 2504.18425 | 开源音频基础模型 1300 万小时 |
| WavTokenizer | 浙大/阿里/Meta | 2408.16532 | 单量化器 40/75 token/s |
| YuE | 港科大+M-A-P | 2503.08638 | 歌词→歌开源基础模型 |
| ACE-Step / 1.5 | 阶跃星辰 + ACE Studio | 2506.00045 / 2602.00744 | 20 秒/4 分钟 → <2 秒/首 |
| Qwen3-TTS | 阿里 | 2601.15621 | 流式 TTS 开源 |
| FAD 基准 | 1812.08466 | 音乐生成标配指标 | |
| MusicCaps | (随 MusicLM)2301.11325 | 5.5k 音文对基准 |
未纳入(无独立论文/非公开):MuseNet、Bark、Tortoise、XTTS、GPT-SoVITS、ChatTTS、Fish Speech、Orpheus、MiniMax Speech、Kokoro-82M、Chatterbox、Suno v1–v5.5、Udio v1–v1.5、ElevenLabs v1–v3、Gemini Live、GPT-4o/GPT-5、Lyria 1–3、天工 SkyMusic、网易天音等——以官方发布/媒体报道为准。
附录 B:完整时间线(一句话流水)
2016.09 WaveNet → 2017.02 Deep Voice → 2017.04 Tacotron → 2017.11 Parallel WaveNet → 2017.12 Tacotron 2 → 2018.10 WaveGlow/LPCNet → 2019.04 MuseNet → 2019.05 FastSpeech → 2019.10 MelGAN → 2020.04 Jukebox → 2020.06 FastSpeech 2 → 2020.10 HiFi-GAN → 2021.06 VITS → 2021.07 SoundStream → 2022.05 NaturalSpeech → 2022.09 Whisper/AudioLM/AudioGen → 2022.10 EnCodec → 2023.01 VALL-E/MusicLM/AudioLDM → 2023.04 Tango/Bark/NaturalSpeech 2 → 2023.05 SpeechGPT → 2023.06 MusicGen/Voicebox/DAC/AudioPaLM → 2023.08 AudioLDM 2 → 2023.09 Stable Audio → 2023.10 SALMONN → 2023.11 Qwen-Audio/XTTS/Lyria → 2023.12 Audiobox/Suno 上线/OpenVoice/ElevenLabs v2 → 2024.01 GPT-SoVITS → 2024.03 Suno v3/NaturalSpeech 3 → 2024.04 Udio/Stable Audio 2/天工 SkyMusic → 2024.05 GPT-4o/Suno v3.5/ChatTTS → 2024.06 VALL-E 2/Seed-TTS/RIAA 起诉/Stable Audio Open → 2024.07 CosyVoice/Qwen2-Audio/Udio v1.5 → 2024.08 Gemini Live/Mini-Omni/WavTokenizer → 2024.09 Moshi/GPT-4o 高级语音模式/Mimi → 2024.10 GLM-4-Voice/F5-TTS/Fish Speech → 2024.11 Suno v4/Seed-VC → 2024.12 Step-Audio/CosyVoice 2/Kokoro-82M → 2025.01 YuE/ElevenLabs C 轮 → 2025.03 Spark-TTS/Orpheus/Udio v1.5 Allegro → 2025.04 Kimi-Audio → 2025.05 CosyVoice 3/ACE-Step/Suno v4.5/Qwen3-Omni 开源 → 2025.06 ElevenLabs v3/Eleven Music → 2025.09 Suno v5/Qwen3-Omni 技术报告 → 2025.11 Suno C 轮+华纳和解 → 2025.12 Gemini Native Audio/Qwen3-TTS → 2026.01 MiniMax Speech 2.8/Scribe v2 → 2026.02 ElevenLabs D 轮/ACE-Step 1.5/Lyria 3/gpt-realtime-1.5 → 2026.03 Suno v5.5/Fish Speech S2 → 2026.07 GPT-Live
附录 C:口径与勘误说明
- Suno 版本时长口径:部分媒体称 v3 支持 4 分钟,本文按多方交叉核对采用 v3=2 分钟(2024.03.21)、v3.5=4 分钟(2024.05.30) 的口径;v4.5 的 8 分钟与 v5 的 12 分轨/320 kbps 以官方与 AI Wiki 为准。
- Qwen3-Omni 时间:模型权重 2025.05 开源,技术报告 arXiv<2509>2509>.17765 于 2025.09.22 提交——两者相差四个月,本文分开标注,避免”报告日期=发布日”的误读。
- Kimi-Audio 时间:arXiv<2504>2504>.18425 于 2025.04.25 提交(开源于 2025.07),部分报道误记为 7 月首发,本文以 arXiv 提交日期为准。
- AudioGen 编号:早期资料误引 2206.04793(实为无关论文),本文采用已核实的 arXiv<2209>2209>.15352。
- CosyVoice 2 编号:部分资料误引为 2407.05407(CosyVoice 1 的编号),正确为 arXiv<2412>2412>.10117(2024.12 提交)。
- ⚠️ 未完全核实项:Suno D 轮(估值超 50 亿美元)、MiniCPM-o 2.6 的 arXiv 编号、Gemini 3.0 语音能力、ACE-Step 的 MusicCaps FAD 1.92、Qwen3-TTS 的 HuggingFace 下载量——均来自单一来源,引用前建议再核一手资料。(注:Suno v5.5 时间、MiniMax Speech 版本线、Udio 与环球/华纳和解、Suno 日生成量等此前标注项已在本轮核查中得到确认,不再列入。)
- 数字口径:MOS/WER/FAD 等评测分数均标注了具体评测集与模型版本(如 MusicGen FAD=3.8 为 MusicCaps 参考集、VALL-E 2 WER 为 LibriSpeech test-clean);不同论文的评测条件不可直接横比。
- 范围说明:本文以”生成”为主线,ASR(Whisper 等)仅作为语音多模态线的入口提及;语音增强(DNS Challenge)、音频水印(Meta Seal)等关联领域未展开。
附录 D:2026-08-05 系统性核查修正记录
本节为对全文的逐条事实核查结果(核对对象:arXiv 摘要页/论文原文、官方博客、维基、权威媒体;共核查 arXiv 编号 57 项、商业/产品声明 32 项)。全部 arXiv 编号经核验有效,无编号错误;以下为确认的修正项(✘=与一手资料矛盾,⚠️=口径需精化):
| # | 条目 | 原表述 | 核查结论(正确值) |
|---|---|---|---|
| 1 | WaveNet 自然 MOS | 自然 4.44 | 论文中自然语音为 4.46(8-bit μ-law)/4.55(16-bit PCM),全文无 4.44(MOS 4.21 正确) |
| 2 | AudioLM 盲测 | 人耳 51.2% 无法区分 | 51.2% 是人类正确识别 AI 语音的比例(接近随机 50%),结论同义但数字方向相反 |
| 3 | AudioGen 参数量 | 3.3B | 实际 1B(large)/285M(base);3.3B 是 MusicGen 的规模,属张冠李戴 |
| 4 | Stable Audio 参数量 | 907M | 907M 仅为扩散 U-Net,全模型(+VAE 133M+CLAP 110M)约 1.15B |
| 5 | SALMONN 规模 | 7B–13B | 论文正文仅 Vicuna-13B(7B 为开源仓库检查点) |
| 6 | VALL-E 2 WER | 1.6% 低于真人 1.9% | 论文 GroundTruth WER 为 1.6%(无 1.9%);Ref Utterance 下 1.5% 才低于真人 |
| 7 | CosyVoice 参数量 | 300M | 论文正文未明确参数量,300M 仅为论文表 10 的命名口径 |
| 8 | CosyVoice 2 首包延迟 | 首包 150 ms | 论文全文无此数值,150 ms 为官方 GitHub 口径(已注明) |
| 9 | Mimi 延迟 | 延迟 80 ms | 80 ms 为 Mimi 帧长/步长;端到端系统延迟为 160/200 ms(见 Moshi) |
| 10 | Step-Audio 2 能力 | 对话+歌唱 | 论文不含任何歌唱(singing)任务,仅语音理解/对话/合成 |
| 11 | ACE-Step 机构 | 蚂蚁集团 | 阶跃星辰(StepFun)+ ACE Studio 联合开源(2025.05.07),非蚂蚁集团;参数量 3.5B、19 语种、最快 15 秒成曲 |
| 12 | GPT-5 音频能力 | 原生音频输入输出旗舰 | 发布初期 API 不含音频,语音模式随后上线(2025.08.07 日期正确) |
| 13 | Lyria 与 MusicLM | MusicLM 的商业化 API 首发 | 无独立”MusicLM API”;MusicLM 为 2023.01 论文/2023.05 AI Test Kitchen 开放,Lyria 于 2023.11.16 承接该技术商业化 |
| 14 | Moshi 时间 | 2024.09 | 2024.07.03 首次公开演示,2024.09 为开源+技术报告发布 |
| 15 | Kokoro-82M 下载量 | 2026.8 超 1500 万 | 官方仓库累计约 1196 万(2026.08 快照),“居 HF 开源 TTS 第一”成立 |
| 16 | Qwen3-TTS 时间 | 2025.12 开源 | API 2025.12.10 / HuggingFace 开源 2026.01.22 |
| 17 | Suno 日生成量 | 2026.03 口径 | ”日生成约 700 万首”出自 2025.11 融资 pitch deck(Billboard),非 2026.03 数据 |
| 18 | ElevenLabs Flash 延迟 | <75 ms | 官方口径为 75 ms(非”小于 75”) |
| 19 | Chatterbox Turbo 日期 | (正文未涉) | GitHub 提交 2025.12.16、媒体 12.15,未见 12.18 出处——如引用请用 12 月中旬 |
本轮已确认无误的重点项(抽查通过):Suno 全部版本时间线(v3=2024.03.21/v3.5=05.30/v4=11.19/v4.5=2025.05.01/v5=09.23/v5.5=2026.03.26)、RIAA 起诉(2024.06.24,662/1670 首,单曲最高 15 万美元)、Suno B/C 轮(1.25 亿/2.5 亿 @24.5 亿)与华纳和解(2025.11.25)、ElevenLabs 融资史(累计 7.81 亿美元,D 轮 2026.02.04 @110 亿)、GPT-4o 延迟(均值 320 ms/最低 232 ms)、Whisper(68 万小时/99 语种官方口径)、MusicGen(32 kHz/2 万小时/FAD 3.8)、Voicebox(5 万小时/6 语种/20× 快于 VALL-E;60k 说法对应英语单语模型)、Kimi-Audio(1300 万小时)、Qwen3-Omni(30B-A3B/234 ms/36 基准 32 开源 SOTA)、MiniMax Speech 版本线(02=2025.04.02/2.5=08.06/2.6=10.29/2.8=2026.01.23)、Fish Speech S2(DualAR 4B+0.4B/WER 0.54%/0.99%)、Orpheus(3B/约 200 ms)、ACE-Step 1.5(<2 秒/首/<4 GB VRAM)、gpt-realtime-1.5(2026.02.23)、GPT-Live(2026.07.08)、Gemini 2.5 Flash Native Audio(2025.12)。
说明:另有 10 项(Tacotron 2/VITS/Whisper/EnCodec/VALL-E/Tango/MusicGen/DAC/Stable Audio/Seed-VC)为”编号正确、arXiv 正式标题与常用模型名不同”(如 Whisper 正式标题为《Robust Speech Recognition via Large-Scale Weak Supervision》),属论文命名习惯差异,非事实错误,本文沿用社区通用名。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





