mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
10307 字
33 分钟
音频生成模型发展史
2026-08-01

音频生成模型发展史:十年四线,AI 从无声到”开口就聊、张嘴就唱”(2016–2026)#


〇、总览:这篇文章讲什么#

文章系统梳理了**音频生成(Audio Generation)**领域从 2016 年 WaveNet 发布,到 2026 年 8 月原生多模态语音时代的十年技术进化史。全文覆盖 60 余个模型、论文与关键事件,沿四条主线展开:

  1. 语音合成(TTS)——从波形级自回归(WaveNet)到声码器提速,再到非自回归、端到端,直至大模型零样本与多模态语音 LLM;
  2. 音乐与音效生成——从符号音乐(MuseNet)到原始音频自回归(Jukebox),再到编解码 token 语言建模与扩散/流匹配,最终以 Suno、Udio 完成产品化;
  3. 语音多模态大模型——从 ASR 工具(Whisper)到音频理解基座,再到实时全双工对话(Moshi、GPT-4o),收敛为”单模型端到端”;
  4. 基础设施与生态——神经音频编解码器(SoundStream→EnCodec→DAC→Mimi)、评测基准(FAD、MusicCaps)、商业融资与版权博弈。

文章最后总结出音频生成领域的四条方法论:抽象层级跃迁优先于算力堆叠自回归与扩散”两条腿走路”端到端取代流水线开源与中文社区成为第二引擎


一、发展时间线总表#

时间模型/事件机构类别核心贡献
2016.09WaveNetDeepMindTTS波形级自回归开山之作,MOS 4.21(自然 4.46/4.55)
2017.02Deep Voice百度TTS首个全神经 TTS 管线
2017.04TacotronGoogleTTSseq2seq+注意力端到端 TTS
2017.11Parallel WaveNetDeepMindTTS概率密度蒸馏,GPU 上 >20× 实时,上线 Google Assistant
2017.12Tacotron 2GoogleTTSMOS 4.53(自然 4.58),首次逼近真人
2018.10WaveGlow / LPCNetNVIDIA / MozillaTTS流式声码器(>500 kHz)/ CPU 单核实时声码器
2019.04MuseNetOpenAI音乐符号(MIDI)音乐预训练,72 层稀疏 Transformer
2019.05FastSpeech微软TTS首个非自回归并行 TTS,~270× 加速
2019.10MelGANLyrebirdTTS首个实用 GAN 声码器,1080Ti 上 >100× 实时
2020.04JukeboxOpenAI音乐原始音频+人声歌唱生成,顶层 prior 5B 参数、训练 120 万首歌
2020.06FastSpeech 2微软TTS免 teacher 蒸馏的并行 TTS,训练快 3×
2020.10HiFi-GANKakaoTTS多周期判别器声码器,V100 上 167.9× 实时
2021.06VITSKakaoTTS首个完全端到端(文本→波形)开源 TTS,LJSpeech MOS 4.43
2021.07SoundStreamGoogle编解码神经音频编解码器开山之作,RVQ 3–18 kbps 可调
2022.05NaturalSpeech微软TTS变分端到端,LJSpeech 达人类级
2022.09AudioGenMeta音效文本→音效,1B(large;另有 285M),ICLR 2023
2022.09WhisperOpenAI多模态弱监督 ASR/翻译,68 万小时99 语种,39M–1.55B
2022.09AudioLMGoogle多模态”音频即语言”,人耳正确识别率仅 51.2%(≈随机,基本无法区分)
2022.10EnCodecMeta编解码RVQ 编解码器,6 kbps≈MP3 64 kbps,支撑 MusicGen 等
2023.01VALL-E微软TTS编解码 token+LM 零样本 TTS 开山作,3 秒提示克隆音色
2023.01MusicLMGoogle音乐分层 seq2seq 音乐生成,24 kHz;发布 MusicCaps 5.5k 基准
2023.01AudioLDMSurrey音效CLAP 条件潜在扩散,单 GPU 可训练
2023.04Bark / NaturalSpeech 2Suno / 微软混合GPT 风格全能音频 / RVQ+潜扩散零样本
2023.05SpeechGPT复旦多模态语音 token 进 LLM 的早期尝试
2023.06MusicGenMeta音乐单阶段 LM+EnCodec 4 码本并行,32 kHz;3.3B 的 MusicCaps FAD=3.8
2023.06VoiceboxMetaTTS非自回归流匹配 infilling,5 万小时/6 语种,20× 快于 VALL-E
2023.06DACDescript编解码44.1 kHz@8 kbps ≈ 90× 压缩,语音/音乐/音效通用
2023.08AudioLDM 2Surrey音效”语言化音频”(LOA)统一语音/音乐/音效
2023.09Stable AudioStability AI音乐时序条件潜在扩散,扩散 U-Net 约 0.9B(全模型约 1.15B)、44.1 kHz 立体声 95 秒
2023.10SALMONN清华/字节多模态通用听觉 LLM,13B(Vicuna 基础)
2023.11Qwen-Audio / XTTS / Lyria阿里 / Coqui / Google混合统一音频理解 / 多语零样本开源 TTS / 商业音乐 API
2023.12Audiobox / Suno 上线 / OpenVoiceMeta / Suno / MyShell混合流匹配统一生成 / 12.20 公开测试 / 即时克隆
2024.01GPT-SoVITS开源TTS5 秒零样本克隆、1 分钟微调,中文社区爆款
2024.03Suno v3 / NaturalSpeech 3Suno / 微软混合AI 音乐引爆点 / FACodec 分解+扩散(1B/20 万小时)
2024.04Udio / Stable Audio 2 / 天工 SkyMusicUncharted Labs / Stability / 昆仑万维音乐AI 音乐”双子星”成型 / 3 分钟整曲 / 中国首个音乐 AIGC
2024.05GPT-4o / Suno v3.5 / ChatTTSOpenAI / Suno / 2noise混合首个原生端到端音频大模型 / 4 分钟歌曲 / 对话场景中文 TTS
2024.06VALL-E 2 / Seed-TTS / RIAA 起诉 / Stable Audio Open微软 / 字节 / RIAA / Stability混合WER 1.6% 与真人持平 / 版权战争开打 / 开源 1B 扩散
2024.07CosyVoice / Qwen2-Audio / Udio v1.5阿里 / Udio混合LLM+流匹配约 300M(论文表 10 命名口径)中英零样本 / 48 kHz 分轨
2024.08Gemini Live / Mini-OmniGoogle / 清华多模态实时语音助手首发 / 首个开源全模态实时对话
2024.09Moshi / GPT-4o 高级语音模式Kyutai / OpenAI多模态首个实时全双工口语 LLM,理论 160 ms/实测约 200 ms(2024.07 演示、09 开源)/ 50+ 语种全量开放
2024.10GLM-4-Voice / F5-TTS / Fish Speech智谱 / 上交 / fishaudioTTS9B 情感语音对话 / DiT 流匹配 RTF 0.15 / 开源多语
2024.11Suno v4 / Seed-VCSuno / 腾讯混合Remaster/Cover/Persona/ReMi / 扩散变声(唱歌 CER 19.7%)
2024.12Step-Audio / CosyVoice 2 / Kokoro-82M阶跃 / 阿里 / 开源混合130B 端到端语音交互 / FSQ 流式首包约 150 ms(官方口径)/ 82M 参数登顶 TTS Arena
2025.01YuE / ElevenLabs C 轮港科大+M-A-P / ElevenLabs混合5 分钟”歌词→歌”Apache 2.0 / 1.8 亿美元 @33 亿估值
2025.03Spark-TTS / Orpheus / Udio v1.5 Allegro讯飞 / Canopy / Udio混合BiCodec+Qwen2.5-0.5B / Llama 语音 LLM 3B / 提速 30%
2025.04Kimi-Audio月之暗面多模态开源音频基础模型,1300 万小时预训练,12.5 Hz tokenizer
2025.05CosyVoice 3 / ACE-Step / Suno v4.5阿里 / ACE Studio+阶跃星辰 / Suno混合1 万→100 万小时数据 / A100 上 20 秒生成 4 分钟 / 8 分钟歌曲
2025.06ElevenLabs v3 / Eleven MusicElevenLabsTTS”最富表现力” TTS,70+ 语种 / AI 音乐生成上线
2025.09Suno v5 / Qwen3-Omni 技术报告Suno / 阿里混合44.1 kHz、12 分轨、快 10 倍 / Thinker-Talker MoE 30B-A3B、首包 234 ms
2025.11Suno C 轮 + 华纳和解Suno生态2.5 亿美元 @24.5 亿估值;首个主流厂牌授权
2025.12Gemini 2.5 Flash Native Audio / Qwen3-TTSGoogle / 阿里混合原生音频输入输出 / 流式 TTS 开源
2026.01MiniMax Speech 2.8 / ElevenLabs Scribe v2MiniMax / ElevenLabsTTS<250 ms 流式 / 90+ 语种最准转录
2026.02ElevenLabs D 轮 / ACE-Step 1.5 / Lyria 3ElevenLabs / 蚂蚁 / Google混合5 亿美元 @110 亿估值 / <2 秒一首 / 进 Gemini 图导音乐
2026.03Suno v5.5 / Fish Speech S2Suno / fishaudio混合声音克隆/自定义模型 / DualAR(4B+0.4B)千万小时
2026.07GPT-LiveOpenAI多模态新一代实时语音

四个分水岭:SoundStream/EnCodec(音频 token 化,2021–2022)、VALL-E(零样本 TTS,2023.01)、GPT-4o(端到端实时语音,2024.05)、Suno v3/v5(AI 音乐产品化,2024.03/2025.09)。


二、阶段一:奠基——波形生成与神经声码器(2016–2018)#

1. WaveNet:起点#

2016 年 9 月(arXiv<1609>.03499)。DeepMind 的波形级自回归开山之作:逐样本预测 16 kHz 波形,用因果膨胀卷积建模长程依赖。MOS 达到 4.21(自然语音 4.46/4.55),首次让机器语音”像人”到可参加图灵测试的程度。代价是生成速度远慢于实时——每个样本依赖前一个样本。核心意义:证明”神经波形合成可行”,但需要找到加速路径。

2. 全神经管线与端到端:Deep Voice、Tacotron#

  • Deep Voice(百度,2017.02,arXiv<1702>.07825):首个把文本前端、声学模型、声码器全部网络化的 TTS 系统,后续 Deep Voice 2(1705.08947)支持多说话人、Deep Voice 3(1710.07654)改为全卷积 seq2seq;
  • Tacotron(Google,2017.04,arXiv<1703>.10135):seq2seq + 注意力,直接从文本生成频谱——“文本→语音”一步到位,不再需要手工特征;
  • Tacotron 2(Google,2017.12,arXiv<1712>.05884):seq2seq 预测 mel 谱 + WaveNet 声码器,LJSpeech 上 MOS 4.53(自然 4.58),被公认为”第一个接近人类的神经 TTS”,也是此后两年的事实标准。

3. 提速三路线:蒸馏、流、DSP 混合#

  • Parallel WaveNet(DeepMind,2017.11,arXiv<1711>.10433):概率密度蒸馏让 WaveNet 并行化,GPU 上 >20× 实时(比原版快约千倍),2018 年上线 Google Assistant——音频生成第一次走上生产环境;
  • WaveGlow(NVIDIA,2018.10,arXiv<1811>.00002):基于流的单网络声码器,V100 上 >500 kHz(>25× 实时);
  • LPCNet(Mozilla,2018.10,arXiv<1810>.11846):线性预测编码 + 稀疏 GRU,约 3 GFLOPs,CPU 单核即可实时——低算力设备路线。

三、阶段二:提速——非自回归、GAN 声码器与端到端 TTS(2019–2021)#

1. 非自回归革命:FastSpeech 系列#

FastSpeech(微软,2019.05,arXiv<1905>.09263):首个非自回归并行 TTS,一次前向生成整段频谱,~270× 加速(代价是先训练 teacher 模型做时长对齐)。FastSpeech 2(2020.06,arXiv<2006>.04558) 免去蒸馏,显式建模 duration/energy/pitch,训练快 3 倍、质量反超。并行合成范式由此确立。

2. GAN 声码器:MelGAN 与 HiFi-GAN#

  • MelGAN(Lyrebird,2019.10,arXiv<1910>.06711):首个实用 GAN 声码器,1080Ti 上 >100× 实时
  • HiFi-GAN(Kakao,2020.10,arXiv<2010>.05646):多周期判别器(MPD),22.05 kHz,V100 上 167.9× 实时,此后两年成为开源 TTS 的”标准声码器”。

3. VITS:完全端到端#

VITS(Kakao,2021.06,arXiv<2106>.06103):CVAE + flow + GAN 三合一,文本直接到波形,没有中间频谱/声码器环节,LJSpeech MOS 4.43。它是”端到端”理念的完成态,也是 2021–2023 年开源 TTS 的默认基线。

4. 音乐生成的先行者(插叙)#

  • MuseNet(OpenAI,2019.04):符号(MIDI)音乐预训练 Transformer,72 层稀疏注意力、4096 token 上下文、10 种乐器——验证”预测下一个 token”同样适用于音乐;
  • Jukebox(OpenAI,2020.04,arXiv<2005>.00341):首个生成原始音频+人声歌唱的模型,多尺度 VQ-VAE(8×/32×/128×)压缩 44 kHz 波形 + 自回归 Transformer,顶层 prior 5B 参数、训练 120 万首歌。代价极端:渲染 1 分钟音频约需 9 小时。它同时预告了两个未来方向——“压缩后再建模”和”自回归原始音频”。

5. SoundStream:音频 token 化的起点(分水岭①)#

SoundStream(Google,2021.07,arXiv<2107>.03312):首个端到端可学习的神经音频编解码器,RVQ(残差向量量化)+ SEANet + 多尺度判别器,单模型支持 3–18 kbps 可变码率,3 kbps 的主观质量超过 Opus 12 kbps。它的意义超出压缩本身:把连续波形变成离散 token,让音频可以像文本一样交给语言模型建模——这是后续一切”音频大模型”的地基。


四、阶段三:token 化与大模型前夜(2022–2023.06)#

1. 编解码器基础设施#

  • EnCodec(Meta,2022.10,arXiv<2210>.13438):SEANet + RVQ,24 kHz 1.5–24 kbps、48 kHz 3–24 kbps,Transformer 熵编码再省 25–40% 码率,6 kbps ≈ MP3 64 kbps。它是 MusicGen、AudioGen 等 Meta 系模型的标配 tokenizer;
  • DAC(Descript,2023.06,arXiv<2306>.06546):通用 RVQGAN,44.1 kHz @ 8 kbps ≈ 90× 压缩,一个模型覆盖语音/音乐/环境音,NeurIPS 2023 spotlight。

2. 音频理解奠基:Whisper 与 AudioLM#

  • Whisper(OpenAI,2022.09,arXiv<2212>.04356):弱监督 ASR/翻译/语音识别,68 万小时多语数据、99 语种、39M–1.55B 参数,零样本抗噪泛化极强(large-v3 于 2023.11 发布)。严格说它是”理解”而非”生成”模型,但它重新定义了语音数据管线的质量上限,成为后续所有语音大模型的事实标准前端;
  • AudioLM(Google,2022.09,arXiv<2209>.03143):纯音频语言建模(语音/钢琴续写),语义+声学混合 token,人耳盲测中正确识别 AI 语音的比例仅 51.2%(接近随机 50%),即基本无法区分——“音频即语言”范式正式确立。

3. 零样本 TTS 开山:VALL-E 与同类#

  • VALL-E(微软,2023.01,arXiv<2301>.02111):把 TTS 变成”音频 token 的条件语言建模”——3 秒参考语音即可克隆音色与韵律,LibriSpeech WER 5.9%。它点燃了”音频 token 大模型”军备竞赛,后续一切零样本 TTS 都可溯源至此;
  • Tortoise TTS(开源,2022):AR 生成 latent + 扩散声码器,社区零样本标杆;
  • NaturalSpeech 2(微软,2023.04,arXiv<2304>.09116):RVQ + 潜扩散,4.4 万小时数据,零样本 + 歌声合成;
  • Voicebox(Meta,2023.06,arXiv<2306>.15687):非自回归流匹配 + infilling 任务(文本修复式训练),5 万小时/6 语种,推理 20× 快于 VALL-E——扩散/流匹配路线首次与自回归正面交锋;
  • Bark(Suno,2023.04 开源):GPT 风格文本→音频(人声+音乐+音效),Suno 公司的技术前身。

4. 音乐与音效生成大模型#

  • MusicLM(Google,2023.01,arXiv<2301>.11325):分层 seq2seq(SoundStream + w2v-BERT 600M + MuLan 文本嵌入),24 kHz 多分钟连贯音乐;同期发布 MusicCaps 5.5k 音文对基准,成为此后音乐生成的评测标准;
  • AudioGen(Meta,2022.09,arXiv<2209>.15352):文本→音效,1B(large;另有 285M base),EnCodec token 自回归,ICLR 2023;
  • AudioLDM(Surrey,2023.01,arXiv<2301>.12503):CLAP 条件潜在扩散,单 GPU 即可训练即达当时最优(ICML 2023);
  • Tango(NVIDIA,2023.04,arXiv<2304>.13731):Flan-T5 指令编码 + LDM,训练数据小 63 倍仍超 AudioLDM;
  • MusicGen(Meta,2023.06,arXiv<2306>.05284):单阶段 LM + EnCodec 4 码本并行预测,32 kHz、训练 2 万小时许可音乐,300M/1.5B/3.3B 三档开源;3.3B 在 MusicCaps FAD=3.8,此后两年开源音乐生成的事实基线。

5. 语音进 LLM:SpeechGPT 与 AudioPaLM#

  • SpeechGPT(复旦,2023.05,arXiv<2305>.11000):语音 token 离散化后进 LLM,跨模态对话的早期尝试;
  • AudioPaLM(Google,2023.06,arXiv<2306>.12925):PaLM-2 + AudioLM 统一”听说”,翻译时保留说话人身份。

五、阶段四:统一音频与 AI 音乐起步(2023.07–2024.04)#

1. 统一生成模型#

  • AudioLDM 2(Surrey,2023.08,arXiv<2308>.05734):提出”语言化音频”(LOA,AudioMAE + GPT-2 生成描述)+ LDM,一个模型统一语音/音乐/音效,1.1–1.5B;
  • Stable Audio(Stability AI,2023.09,arXiv<2402>.04825):时序条件潜在扩散,扩散 U-Net 约 0.9B(全模型约 1.15B)、44.1 kHz 立体声 95 秒、A100 渲染仅 8 秒;训练数据 80 万文件 ≈ 1.95 万小时(AudioSparx 授权语料)——“快”第一次成为卖点;
  • Audiobox(Meta,2023.12,arXiv<2312>.15821):flow-matching 统一语音/音乐/音效,AudioCaps FAD 0.77、零样本 TTS 相似度 0.745。

2. 听觉 LLM 与语音克隆#

  • SALMONN(清华/字节,2023.10,arXiv<2310>.13289):通用听觉 LLM(语音/音效/音乐理解),13B(Vicuna 基础,开源仓库另有 7B 检查点);
  • Qwen-Audio(阿里,2023.11,arXiv<2311>.07919):统一多任务音频理解,用多任务共训规避一对多映射退化;
  • OpenVoice(MyShell,2023.12,arXiv<2312>.01479):即时克隆 + 风格/情感可控 + 零样本跨语种;
  • XTTS(Coqui,2023.11):多语零样本开源 TTS,v2 MOS 4.21,2024 年成为 HuggingFace 下载量最大的开源 TTS(约 930 万次)。

3. AI 音乐产品化前夜#

  • Lyria(Google DeepMind,2023.11.16):承接 MusicLM 技术的音乐生成 API 首发(MusicLM 本身于 2023.05 经 AI Test Kitchen 开放,无独立 API);
  • Suno 公开上线(2023.12.20):集成微软 Copilot,chirp-v1/v2 最长 80 秒——“AI 音乐平台”这一物种诞生;
  • ElevenLabs v2(2023.08/12):商业 TTS 标杆,多语种、极低延迟。

4. 2024 年初的爆发前奏#

  • GPT-SoVITS(开源,2024.01)5 秒零样本克隆、1 分钟微调跨语种,GitHub 5.9 万 ★,中文社区现象级项目;
  • Suno v3(2024.03.21):“广播级”质量、2 分钟歌曲,被 Rolling Stone/Wired 评价为”首批能在短片段中骗过普通听众的 AI 音乐”——AI 音乐的 ChatGPT 时刻
  • NaturalSpeech 3(微软,2024.03,arXiv<2403>.03100):FACodec 分解语音属性 + 扩散,1B/20 万小时;
  • Udio(2024.04.10 公测):前 Google DeepMind 团队(Uncharted Labs,约 1000 万美元种子,a16z)——Suno 的”双子星”对手出现;
  • Stable Audio 2.0(2024.04.03):3 分钟整曲、audio-to-audio 与风格迁移;
  • 天工 SkyMusic(昆仑万维,2024.04.17):中国首个端到端音乐 AIGC;网易天音(2024.05)上线免费 AI 作词/作曲/演唱一体化。

六、阶段五:分水岭——实时语音对话与 AI 音乐爆发(2024.05–2024.12)#

1. 端到端实时语音:GPT-4o 与全双工时代#

  • GPT-4o(OpenAI,2024.05):首个原生端到端音频大模型(音频直接进出,无 ASR→LLM→TTS 级联),音频响应平均 320 ms(最低 232 ms),而旧级联管线需 2.8–5.4 秒——语音交互第一次进入”人感”延迟区间。2024.09.24 高级语音模式向 Plus 用户全量开放(50+ 语种、可打断);
  • Moshi(Kyutai,2024.07 首次公开演示 / 2024.09 开源,arXiv<2410>.00037):首个实时全双工口语 LLM:Inner Monologue 双流架构(同时处理”说什么”与”怎么说”),Helium 7B + Mimi 编解码器,理论延迟 160 ms/实测约 200 ms;
  • Gemini Live(Google,2024.08.13 首发):语音实时助手,2025 I/O 后全平台免费、45+ 语种;
  • Mini-Omni(清华,2024.08,arXiv<2408>.16725):首个开源”语音进语音出”全模态实时对话模型;
  • GLM-4-Voice(智谱/清华,2024.10,arXiv<2412>.02612):端到端情感语音对话,9B,12.5 Hz/175 bps 超低码率 tokenizer;
  • Step-Audio(阶跃星辰,2024.12,arXiv<2502>.11946)130B 端到端语音交互(情感/方言/唱 RAP),2025.02 开源;GPT-4o-mini-Realtime(2024.12.17 预览)把实时语音 API 成本打下来;
  • Qwen2-Audio(阿里,2024.07,arXiv<2407>.10759):音频理解 + 语音对话统一。

2. 零样本 TTS 成熟年#

  • VALL-E 2(微软,2024.06,arXiv<2406>.05370):重复感知采样 + 分组编码,LibriSpeech WER 1.6%,与真人转写(1.6%)持平,Ref Utterance 下 1.5% 低于真人,首次宣称零样本 TTS”人类平价”;
  • Seed-TTS(字节,2024.06,arXiv<2406>.02430):大规模 AR 家族,自然度/相似度匹配真人、情绪可控,含 DiT 变体;
  • CosyVoice(阿里,2024.07,arXiv<2407>.05407):LLM + 流匹配,约 300M(论文表 10 命名口径)中英零样本,FunAudioLLM 开源;
  • ChatTTS(2noise,2024.05):对话场景中文 TTS,10 万+ 小时数据,气口/笑声自然,B 站爆款;
  • F5-TTS(上交,2024.10,arXiv<2410>.06885):DiT 流匹配、免文本-语音对齐,RTF 0.15,10 万小时数据;
  • Fish Speech(fishaudio,2024.10):开源多语,V1.5 英 WER 3.5%、TTS Arena ELO 1339;
  • Seed-VC(腾讯,2024.11,arXiv<2411>.09943):扩散 Transformer 零样本变声,唱歌 CER 19.7% 优于 RVCv2 的 28.5%。

3. AI 音乐产品化:Suno 与 Udio 的版本战争#

  • Suno v3.5(2024.05.30):首个 4 分钟生成,歌曲结构(verse-chorus-bridge)显著改善;同期完成 1.25 亿美元 B 轮(估值约 5 亿);
  • RIAA 起诉(2024.06.24):代表索尼/环球/华纳起诉 Suno(662 首)与 Udio(1670 首) 侵权训练,单曲最高索赔 15 万美元——AI 音乐的版权战争正式开打;
  • Stable Audio Open(2024.06,arXiv<2407>.14358):开源 1B 扩散模型,44.1 kHz/47 秒,仅用 48.6 万条 CC 许可数据,可本地微调;
  • Udio v1.5(2024.07.23):48 kHz、分轨导出、调性控制;
  • Suno v4(2024.11.19):Remaster(重制)/Cover(翻唱)/Persona(固定声线)/ReMi(歌词助手),从”生成器”走向”制作工具”。

4. 编解码器再进化#

  • WavTokenizer(浙大/阿里/Meta,2024.08,arXiv<2408>.16532):单量化器 40/75 token/s,极致压缩 + 语义增强(ICLR 2025);
  • Mimi(Kyutai,2024.09,随 Moshi):流式编解码器,24 kHz → 12.5 Hz token @1.1 kbps、帧长 80 ms(端到端延迟 160–200 ms 见 Moshi),首级蒸馏 WavLM 语义——实时对话的低延迟基石。

七、阶段六:成熟——规模扩展与原生多模态(2025–2026.08)#

1. AI 音乐:从产品到产业链#

  • YuE(港科大 + M-A-P,2025.03,arXiv<2503>.08638):LLaMA2 基础、万亿 token 训练,5 分钟”歌词→歌”,Apache 2.0——开源音乐生成第一个严肃的”Suno 对手”;
  • Suno v4.5(2025.05.01):8 分钟歌曲、1200+ 流派、非破坏编辑(Replace/Extend/Remaster/Covers);v4.5+(2025.07)加入 Add Vocals/Add Instrumentals 分轨操作;
  • ACE-Step / 音跃(阶跃星辰 + ACE Studio,2025.05.07 联合开源,arXiv<2506>.00045)3.5B,扩散 + Sana DCAE + 线性 Transformer,A100 上 20 秒生成 4 分钟音乐(比 LLM 基线快 15×),支持 19 语种、最快 15 秒成曲;ACE-Step 1.5(2026.02,arXiv<2602>.00744) 进一步做到 <2 秒/首(A100)、<10 秒(RTX 3090)、<4 GB VRAM,LM 规划器 + DiT;
  • Suno v5(2025.09.23):“complete re-architecture”,44.1 kHz、12 分轨、320 kbps、快 10 倍(内部代号 chirp-crow),9.25 发布 DAW 级 Suno Studio;
  • Suno C 轮(2025.11)2.5 亿美元 @24.5 亿估值(Menlo Ventures 领投),并与华纳音乐和解签授权协议——首个主流厂牌合作;
  • Eleven Music(ElevenLabs,2025 夏):授权训练、商业可用,年末上线 Music Marketplace 让创作者从 AI 曲目获利;
  • Suno v5.5(2026.03.26):声音克隆/自定义模型;平台约 1 亿注册用户、200 万付费、ARR 3 亿美元(2026.02 口径),“日生成约 700 万首”为 2025.11 融资材料披露(Billboard 报道)。

2. 语音大模型:从 TTS 到”音频 AGI”#

  • CosyVoice 2(阿里,2024.12,arXiv<2412>.10117):FSQ 量化 + chunk-aware 因果流匹配,流式/非流式统一,MOS 5.53(自评)、首包约 150 ms(官方 GitHub 口径;论文未给出具体数值);
  • CosyVoice 3(阿里,2025.05,arXiv<2505>.17589):0.5B→1.5B、数据 1 万→100 万小时9 语种 + 18 方言,监督多任务语音分词器 + 可微奖励模型 RL 后训练;
  • Spark-TTS(科大讯飞,2025.03,arXiv<2503>.01710):BiCodec 解耦 + Qwen2.5-0.5B,中文 CER 1.20,VoxBox 10 万小时;
  • Orpheus(Canopy,2025.03):Llama 语音 LLM 3B、情感标签、流式约 200 ms;
  • MiniMax Speech:02(2025.04)→ 2.5(2025.08,40+ 语种)→ 2.6(2025.10,<250 ms)→ 2.8(2026.01);
  • Kimi-Audio(月之暗面,2025.04,arXiv<2504>.18425):开源音频基础模型,1300 万小时预训练、12.5 Hz tokenizer、流匹配 chunk 式 detokenizer,ASR/理解/问答/对话多项 SOTA;
  • Qwen3-Omni(阿里,模型 2025.05 开源 / 技术报告 2025.09,arXiv<2509>.17765):Thinker-Talker MoE 30B-A3B,冷启动首包 234 ms36 个音频/音视频基准中 32 项开源 SOTA、119 语种文本/19 语种语音理解/10 语种语音生成,且四模态无退化——当前开源音频多模态的天花板;
  • GPT-5(OpenAI,2025.08.07):多模态旗舰(发布初期 API 不含音频,语音模式随后上线);Step-Audio 2(阶跃,2025.07,arXiv<2507>.16632)支持语音对话与合成(论文未涉歌唱任务);
  • Fish Speech S2(2026.03):DualAR(4B+0.4B)双自回归,千万小时/80+ 语种,Seed-Eval 中文 WER 0.54%/英文 0.99%。

3. 实时语音产品与平台#

  • GPT-4o Realtime API / gpt-realtime-1.5(2026.02.23):生产级语音代理;GPT-Live(2026.07) 新一代语音;
  • Gemini 2.5 Flash Native Audio + Gemini TTS(2025.12):风格/情感控制;Lyria 3(2026.02.18) 进入 Gemini,支持 30 秒图/视频导音乐;
  • Qwen3-TTS(阿里,API 2025.12 / HF 开源 2026.01,arXiv<2601>.15621):流式 TTS 开源;gpt-4o-mini-tts / gpt-audio-mini(2025.12.22),WER 下降约 35%;
  • ElevenLabs v3(2025.06 发布 / 2026.02 GA):“最富表现力” TTS,70+ 语种,Flash 延迟 75 ms(官方口径);Scribe v2(2026.01.09) 90+ 语种转录。

4. 商业与生态格局#

  • ElevenLabs:2022 年创立 → 2023.01 公测 → 2024.01 B 轮 8000 万 @11 亿(独角兽)→ 2025.01 C 轮 1.8 亿 @33 亿 → 2025.09 NVIDIA 战略投资 → 2026.02.04 D 轮 5 亿美元 @110 亿估值(红杉领投,累计融资 7.81 亿美元,2025 年底 ARR 3.3 亿美元)——语音 AI 商业化标杆;
  • Suno:2022 年创立(Kensho 系)→ 2023.12 上线 → B 轮 1.25 亿 → C 轮 2.5 亿 @24.5 亿 → 2026 年探索 D 轮(估值超 50 亿美元 ⚠️);
  • 版权博弈:RIAA 诉讼后,Suno 与华纳和解授权(2025.11),Udio 与环球/华纳和解并共建授权平台(⚠️);截至 2026 年中环球、索尼对 Suno 的诉讼仍在进行(⚠️);
  • HuggingFace 开源生态:XTTS-v2(930 万下载,2024 第一)→ Kokoro-82M(2024.12.25,82M 参数、训练成本约 1000 美元、登 TTS Arena 榜首,2026.8 累计下载约 1200 万、居 HF 开源 TTS 下载第一)→ Chatterbox(2025.05,MIT)→ Qwen3-TTS——开源把 TTS 入场成本打到近乎为零。

八、四条技术主线#

主线一:语音合成——从波形到”语音 AGI”#

WaveNet(波形自回归)→ 声码器提速(Parallel WaveNet/WaveGlow/MelGAN/HiFi-GAN)→ 非自回归(FastSpeech/2)→ 端到端(Tacotron 2/VITS/NaturalSpeech)→ 零样本大模型(VALL-E/Voicebox/Seed-TTS/NaturalSpeech 3)→ 多模态语音 LLM(CosyVoice 3/Spark-TTS/Orpheus/Fish S2/Qwen3-Omni)

  • 波形级 → token 级:SoundStream/EnCodec 让 TTS 复用 LLM 范式(VALL-E 是标志)
  • 双路线并行:自回归(保韵律多样)vs 扩散/流匹配(快、稳),混合系统(LLM 粗建模 + 扩散精渲染)成为工业主流
  • 中文开源生态成为全球第二引擎:GPT-SoVITS、ChatTTS、CosyVoice、F5-TTS、Spark-TTS

主线二:音乐生成——从符号到产品#

MuseNet(符号 MIDI)→ Jukebox(原始音频 AR,5B)→ MusicLM/MusicGen(编解码 token LM)→ AudioLDM/Stable Audio/Audiobox(扩散/流匹配)→ Suno/Udio(产品化、版本季度级迭代)→ ACE-Step/YuE(开源基础模型)→ Lyria RealTime(实时交互)

  • 速度与质量的权衡是核心矛盾:Jukebox 9 小时/分钟 → ACE-Step 20 秒/4 分钟
  • 评测从无到有:MusicCaps(5.5k)成为事实标准,FAD 为量化指标
  • 版权从”灰色”到”授权”:RIAA 诉讼 → 华纳/环球/UMG 和解授权

主线三:语音多模态——从 ASR 到原生实时对话#

Whisper/AudioLM(理解与 token 化奠基)→ SpeechGPT/AudioPaLM/SALMONN/Qwen-Audio(语音进 LLM)→ GPT-4o/Moshi/Mini-Omni(端到端实时,级联管线死亡)→ Qwen3-Omni/Kimi-Audio/GPT-5/Gemini Live(原生多模态、全双工、情感可控)

  • 延迟从秒级(2.8–5.4 s 级联)降到百毫秒级(232 ms/160 ms/150 ms)
  • 架构收敛:ASR+LLM+TTS 流水线 → 单模型端到端;说话人/情感/方言成为一等公民

主线四(暗线):基础设施、评测与资本#

SoundStream(2021)→ EnCodec(2022)→ DAC(2023)→ WavTokenizer/Mimi(2024)——音频的”分词器”;FAD/MusicCaps/MUSHRA/WER/UTMOS/TTS-Arena——可量化的迭代反馈;ElevenLabs $11B、Suno $2.45B、RIAA 诉讼——商业化与合规的双轮


九、方法论:音频生成领域的四条规律#

  1. 抽象层级跃迁优先于算力堆叠——从波形级(WaveNet)到频谱(Tacotron)再到 token 级(VALL-E/MusicGen),每一次层级跃迁都同时带来质量与效率的跃升;编解码器是比模型参数更关键的杠杆;
  2. 自回归与扩散”两条腿走路”——自回归擅长多样性与韵律一致性(TTS/音乐),扩散/流匹配擅长速度与稳定性(Stable Audio/ACE-Step/F5-TTS),工业界普遍采用”LLM 定内容、扩散定细节”的混合架构(CosyVoice、Seed-TTS、ACE-Step 1.5);
  3. 端到端取代流水线——级联(ASR→LLM→TTS)的 2.8–5.4 秒延迟被 GPT-4o 的 232 ms 终结;但端到端并非万能,语音 LLM 仍依赖编解码器与后处理模块,“单模型”是系统观而非字面意义;
  4. 开源与中文社区成为第二引擎——GPT-SoVITS、ChatTTS、CosyVoice、F5-TTS、Kokoro-82M($1000 训练成本)把 TTS 能力民主化;音乐侧 YuE、ACE-Step 则为开源留住了”Suno 之外的另一种可能”。

附录 A:主要论文/模型清单与 arXiv 映射#

模型/版本机构arXiv备注
WaveNetDeepMind1609.03499波形级自回归开山作
Tacotron / Tacotron 2Google1703.10135 / 1712.05884seq2seq 端到端
Parallel WaveNetDeepMind1711.10433蒸馏并行
WaveGlow / LPCNet / MelGANNVIDIA / Mozilla / Lyrebird1811.00002 / 1810.11846 / 1910.06711声码器三路线
FastSpeech / FastSpeech 2微软1905.09263 / 2006.04558非自回归
HiFi-GANKakao2010.05646GAN 声码器标准件
JukeboxOpenAI2005.00341原始音频音乐生成 5B
VITSKakao2106.06103端到端 TTS
SoundStreamGoogle2107.03312神经编解码器开山作
NaturalSpeech / 2 / 3微软2205.04421 / 2304.09116 / 2403.03100端到端→零样本→分解
AudioGenMeta2209.15352文本→音效 1B(large,另有 285M)
WhisperOpenAI2212.04356弱监督 ASR 68 万小时
AudioLMGoogle2209.03143音频语言建模
EnCodecMeta2210.13438RVQ 编解码器
VALL-E / VALL-E 2微软2301.02111 / 2406.05370零样本 TTS 开山/人类平价
MusicLMGoogle2301.11325音乐生成 + MusicCaps
AudioLDM / AudioLDM 2Surrey2301.12503 / 2308.05734潜在扩散音频
TangoNVIDIA2304.13731指令音频扩散
MusicGenMeta2306.05284EnCodec token 音乐 LM
VoiceboxMeta2306.15687流匹配 infilling TTS
DACDescript2306.06546通用编解码器 90×
AudioPaLMGoogle2306.12925统一听说
Stable Audio / OpenStability AI2402.04825 / 2407.14358时序扩散 / 开源 1B
AudioboxMeta2312.15821流匹配统一生成
SALMONN清华/字节2310.13289通用听觉 LLM
Qwen-Audio / Qwen2-Audio / Qwen3-Omni阿里2311.07919 / 2407.10759 / 2509.17765音频理解→全模态(Qwen3-Omni 报告 2025.09 提交,模型 2025.05 开源)
OpenVoiceMyShell2312.01479即时克隆
SpeechGPT复旦2305.11000语音进 LLM 早期
Mini-Omni清华2408.16725开源全模态实时对话
Moshi(含 Mimi)Kyutai2410.00037实时全双工口语 LLM
GLM-4-Voice智谱/清华2412.02612端到端情感语音对话
Step-Audio / 2阶跃星辰2502.11946 / 2507.16632130B 语音交互 / 对话与合成
Seed-TTS / Seed-VC字节 / 腾讯2406.02430 / 2411.09943大规模零样本 / 变声
CosyVoice / 2 / 3阿里2407.05407 / 2412.10117 / 2505.17589LLM+流匹配→流式→规模化
F5-TTS上交2410.06885DiT 流匹配 RTF 0.15
Spark-TTS科大讯飞2503.01710BiCodec 中文 TTS
Kimi-Audio月之暗面2504.18425开源音频基础模型 1300 万小时
WavTokenizer浙大/阿里/Meta2408.16532单量化器 40/75 token/s
YuE港科大+M-A-P2503.08638歌词→歌开源基础模型
ACE-Step / 1.5阶跃星辰 + ACE Studio2506.00045 / 2602.0074420 秒/4 分钟 → <2 秒/首
Qwen3-TTS阿里2601.15621流式 TTS 开源
FAD 基准Google1812.08466音乐生成标配指标
MusicCapsGoogle(随 MusicLM)2301.113255.5k 音文对基准

未纳入(无独立论文/非公开):MuseNet、Bark、Tortoise、XTTS、GPT-SoVITS、ChatTTS、Fish Speech、Orpheus、MiniMax Speech、Kokoro-82M、Chatterbox、Suno v1–v5.5、Udio v1–v1.5、ElevenLabs v1–v3、Gemini Live、GPT-4o/GPT-5、Lyria 1–3、天工 SkyMusic、网易天音等——以官方发布/媒体报道为准。

附录 B:完整时间线(一句话流水)#

2016.09 WaveNet → 2017.02 Deep Voice → 2017.04 Tacotron → 2017.11 Parallel WaveNet → 2017.12 Tacotron 2 → 2018.10 WaveGlow/LPCNet → 2019.04 MuseNet → 2019.05 FastSpeech → 2019.10 MelGAN → 2020.04 Jukebox → 2020.06 FastSpeech 2 → 2020.10 HiFi-GAN → 2021.06 VITS → 2021.07 SoundStream → 2022.05 NaturalSpeech → 2022.09 Whisper/AudioLM/AudioGen → 2022.10 EnCodec → 2023.01 VALL-E/MusicLM/AudioLDM → 2023.04 Tango/Bark/NaturalSpeech 2 → 2023.05 SpeechGPT → 2023.06 MusicGen/Voicebox/DAC/AudioPaLM → 2023.08 AudioLDM 2 → 2023.09 Stable Audio → 2023.10 SALMONN → 2023.11 Qwen-Audio/XTTS/Lyria → 2023.12 Audiobox/Suno 上线/OpenVoice/ElevenLabs v2 → 2024.01 GPT-SoVITS → 2024.03 Suno v3/NaturalSpeech 3 → 2024.04 Udio/Stable Audio 2/天工 SkyMusic → 2024.05 GPT-4o/Suno v3.5/ChatTTS → 2024.06 VALL-E 2/Seed-TTS/RIAA 起诉/Stable Audio Open → 2024.07 CosyVoice/Qwen2-Audio/Udio v1.5 → 2024.08 Gemini Live/Mini-Omni/WavTokenizer → 2024.09 Moshi/GPT-4o 高级语音模式/Mimi → 2024.10 GLM-4-Voice/F5-TTS/Fish Speech → 2024.11 Suno v4/Seed-VC → 2024.12 Step-Audio/CosyVoice 2/Kokoro-82M → 2025.01 YuE/ElevenLabs C 轮 → 2025.03 Spark-TTS/Orpheus/Udio v1.5 Allegro → 2025.04 Kimi-Audio → 2025.05 CosyVoice 3/ACE-Step/Suno v4.5/Qwen3-Omni 开源 → 2025.06 ElevenLabs v3/Eleven Music → 2025.09 Suno v5/Qwen3-Omni 技术报告 → 2025.11 Suno C 轮+华纳和解 → 2025.12 Gemini Native Audio/Qwen3-TTS → 2026.01 MiniMax Speech 2.8/Scribe v2 → 2026.02 ElevenLabs D 轮/ACE-Step 1.5/Lyria 3/gpt-realtime-1.5 → 2026.03 Suno v5.5/Fish Speech S2 → 2026.07 GPT-Live

附录 C:口径与勘误说明#

  1. Suno 版本时长口径:部分媒体称 v3 支持 4 分钟,本文按多方交叉核对采用 v3=2 分钟(2024.03.21)、v3.5=4 分钟(2024.05.30) 的口径;v4.5 的 8 分钟与 v5 的 12 分轨/320 kbps 以官方与 AI Wiki 为准。
  2. Qwen3-Omni 时间:模型权重 2025.05 开源,技术报告 arXiv<2509>.17765 于 2025.09.22 提交——两者相差四个月,本文分开标注,避免”报告日期=发布日”的误读。
  3. Kimi-Audio 时间:arXiv<2504>.18425 于 2025.04.25 提交(开源于 2025.07),部分报道误记为 7 月首发,本文以 arXiv 提交日期为准。
  4. AudioGen 编号:早期资料误引 2206.04793(实为无关论文),本文采用已核实的 arXiv<2209>.15352
  5. CosyVoice 2 编号:部分资料误引为 2407.05407(CosyVoice 1 的编号),正确为 arXiv<2412>.10117(2024.12 提交)。
  6. ⚠️ 未完全核实项:Suno D 轮(估值超 50 亿美元)、MiniCPM-o 2.6 的 arXiv 编号、Gemini 3.0 语音能力、ACE-Step 的 MusicCaps FAD 1.92、Qwen3-TTS 的 HuggingFace 下载量——均来自单一来源,引用前建议再核一手资料。(注:Suno v5.5 时间、MiniMax Speech 版本线、Udio 与环球/华纳和解、Suno 日生成量等此前标注项已在本轮核查中得到确认,不再列入。)
  7. 数字口径:MOS/WER/FAD 等评测分数均标注了具体评测集与模型版本(如 MusicGen FAD=3.8 为 MusicCaps 参考集、VALL-E 2 WER 为 LibriSpeech test-clean);不同论文的评测条件不可直接横比。
  8. 范围说明:本文以”生成”为主线,ASR(Whisper 等)仅作为语音多模态线的入口提及;语音增强(DNS Challenge)、音频水印(Meta Seal)等关联领域未展开。

附录 D:2026-08-05 系统性核查修正记录#

本节为对全文的逐条事实核查结果(核对对象:arXiv 摘要页/论文原文、官方博客、维基、权威媒体;共核查 arXiv 编号 57 项、商业/产品声明 32 项)。全部 arXiv 编号经核验有效,无编号错误;以下为确认的修正项(✘=与一手资料矛盾,⚠️=口径需精化):

#条目原表述核查结论(正确值)
1WaveNet 自然 MOS自然 4.44论文中自然语音为 4.46(8-bit μ-law)/4.55(16-bit PCM),全文无 4.44(MOS 4.21 正确)
2AudioLM 盲测人耳 51.2% 无法区分51.2% 是人类正确识别 AI 语音的比例(接近随机 50%),结论同义但数字方向相反
3AudioGen 参数量3.3B实际 1B(large)/285M(base);3.3B 是 MusicGen 的规模,属张冠李戴
4Stable Audio 参数量907M907M 仅为扩散 U-Net,全模型(+VAE 133M+CLAP 110M)约 1.15B
5SALMONN 规模7B–13B论文正文仅 Vicuna-13B(7B 为开源仓库检查点)
6VALL-E 2 WER1.6% 低于真人 1.9%论文 GroundTruth WER 为 1.6%(无 1.9%);Ref Utterance 下 1.5% 才低于真人
7CosyVoice 参数量300M论文正文未明确参数量,300M 仅为论文表 10 的命名口径
8CosyVoice 2 首包延迟首包 150 ms论文全文无此数值,150 ms 为官方 GitHub 口径(已注明)
9Mimi 延迟延迟 80 ms80 ms 为 Mimi 帧长/步长;端到端系统延迟为 160/200 ms(见 Moshi)
10Step-Audio 2 能力对话+歌唱论文不含任何歌唱(singing)任务,仅语音理解/对话/合成
11ACE-Step 机构蚂蚁集团阶跃星辰(StepFun)+ ACE Studio 联合开源(2025.05.07),非蚂蚁集团;参数量 3.5B、19 语种、最快 15 秒成曲
12GPT-5 音频能力原生音频输入输出旗舰发布初期 API 不含音频,语音模式随后上线(2025.08.07 日期正确)
13Lyria 与 MusicLMMusicLM 的商业化 API 首发无独立”MusicLM API”;MusicLM 为 2023.01 论文/2023.05 AI Test Kitchen 开放,Lyria 于 2023.11.16 承接该技术商业化
14Moshi 时间2024.092024.07.03 首次公开演示,2024.09 为开源+技术报告发布
15Kokoro-82M 下载量2026.8 超 1500 万官方仓库累计约 1196 万(2026.08 快照),“居 HF 开源 TTS 第一”成立
16Qwen3-TTS 时间2025.12 开源API 2025.12.10 / HuggingFace 开源 2026.01.22
17Suno 日生成量2026.03 口径”日生成约 700 万首”出自 2025.11 融资 pitch deck(Billboard),非 2026.03 数据
18ElevenLabs Flash 延迟<75 ms官方口径为 75 ms(非”小于 75”)
19Chatterbox Turbo 日期(正文未涉)GitHub 提交 2025.12.16、媒体 12.15,未见 12.18 出处——如引用请用 12 月中旬

本轮已确认无误的重点项(抽查通过):Suno 全部版本时间线(v3=2024.03.21/v3.5=05.30/v4=11.19/v4.5=2025.05.01/v5=09.23/v5.5=2026.03.26)、RIAA 起诉(2024.06.24,662/1670 首,单曲最高 15 万美元)、Suno B/C 轮(1.25 亿/2.5 亿 @24.5 亿)与华纳和解(2025.11.25)、ElevenLabs 融资史(累计 7.81 亿美元,D 轮 2026.02.04 @110 亿)、GPT-4o 延迟(均值 320 ms/最低 232 ms)、Whisper(68 万小时/99 语种官方口径)、MusicGen(32 kHz/2 万小时/FAD 3.8)、Voicebox(5 万小时/6 语种/20× 快于 VALL-E;60k 说法对应英语单语模型)、Kimi-Audio(1300 万小时)、Qwen3-Omni(30B-A3B/234 ms/36 基准 32 开源 SOTA)、MiniMax Speech 版本线(02=2025.04.02/2.5=08.06/2.6=10.29/2.8=2026.01.23)、Fish Speech S2(DualAR 4B+0.4B/WER 0.54%/0.99%)、Orpheus(3B/约 200 ms)、ACE-Step 1.5(<2 秒/首/<4 GB VRAM)、gpt-realtime-1.5(2026.02.23)、GPT-Live(2026.07.08)、Gemini 2.5 Flash Native Audio(2025.12)。

说明:另有 10 项(Tacotron 2/VITS/Whisper/EnCodec/VALL-E/Tango/MusicGen/DAC/Stable Audio/Seed-VC)为”编号正确、arXiv 正式标题与常用模型名不同”(如 Whisper 正式标题为《Robust Speech Recognition via Large-Scale Weak Supervision》),属论文命名习惯差异,非事实错误,本文沿用社区通用名。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

音频生成模型发展史
https://mizuki-eaf.pages.dev/posts/音频生成模型/音频生成模型发展史/
作者
无名之子
发布于
2026-08-01
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录