Stable Audio 论文解读:95 秒立体声、8 秒渲染完,音乐生成第一次拼”速度”
论文:Fast Timing-Conditioned Latent Audio Diffusion(arXiv<2402>2402>.04825,2024.02.07 提交,ICML 2024) 作者/机构:Zach Evans、CJ Carr、Josiah Taylor、Scott H. Hawley、Jordi Pons 等(Stability AI) 附:Stable Audio 2.0(2024.04.03 发布,无独立论文);Stable Audio Open(arXiv<2407>2407>.14358,2024.07.19 提交)
在 Stable Audio 之前,AI 音乐的叙事基本是”质量 vs 速度二选一”:Jukebox 一小时渲一分钟,MusicGen 这类 token 语言模型质量不错但推理也快不到哪去。Stability AI 这篇直接把赛道换成了时序条件潜在扩散——跟文生图的 Stable Diffusion 同宗同源,只是把”时间”变成了第一公民。它生成的 44.1kHz 立体声音乐最长 95 秒,在 A100 上渲染只要约 8 秒,比实时快十几倍。模型本体于 2023 年 9 月发布(论文 2024 年 2 月才挂 arXiv),所以这篇严格说是”产品模型的论文化”。读懂它,就理解了后来音乐生成里”扩散派”为什么能跟”自回归派”分庭抗礼。
一、总盘子:把 Stable Diffusion 的配方端到音频
Stable Audio 的架构是文生图扩散模型的”音频移植版”,三段式:
- 全卷积 VAE(fully-convolutional variational autoencoder):把音频压进潜在空间,这是扩散模型工作的”画布”,维度低、好训练。
- 扩散 U-Net:在潜在空间里从噪声逐步去噪,一步步”画”出目标音频的潜在表征。这个 U-Net 约 907M 参数——注意,907M 只是扩散 U-Net 这一个模块,不是全模型!完整模型还要加上 VAE(约 133M)和 CLAP 文本编码器(约 110M),三者合计约 1.15B。很多资料只写 907M,那是把 U-Net 当成了全部,属于口径乌龙。
- VAE 解码器:把潜在表征还原成 44.1kHz 的立体声波形。
条件部分有两个,这也是论文标题里 “Timing-Conditioned”(时序条件)的由来:文本 prompt(经 CLAP 编码)+ 时序嵌入(timing embedding)。时序嵌入是 Stable Audio 相对同类最特别的设计——它告诉模型”这段音频总共要多长、现在是第几秒”,让模型能按你指定的**可变时长(variable length)**生成,而不是像很多模型那样固定生成长度。音乐和音效本身时长差异巨大,一首 90 秒的曲子和一个 3 秒的关门声,结构完全不同,能把时长当条件直接控制,这是扩散派相对自回归派的一个实用优势。
二、为什么”8 秒渲染 95 秒”这么重要
生成 95 秒音频,A100 上只要 8 秒——这个数字在当时是碾压级的。同期主流的音乐生成要么是自回归逐 token 吐(MusicGen 3.3B 在 A100 上生成 30 秒音频要几十秒到分钟级),要么干脆是慢到没用的研究模型。Stable Audio 把”生成一条可用的音乐片段”压到了接近实时,这直接改变了产品的想象空间:它可以进交互式 DAW(数字音频工作站)流程,可以一遍遍试 prompt,可以批量出素材。“快”第一次成为 AI 音乐的营销词,后来 ACE-Step 的”20 秒生成 4 分钟”、Suno 的”快 10 倍”都是沿着这条路的再加速。
当然快是有代价的:U-Net 扩散在长程结构上不如自回归模型有”叙事感”,95 秒的上限也摆在那。但 Stability 的算盘很清楚——让速度和可控性先打动人,质量交给后续版本迭代。它在两个公开的文生音乐/文生音频基准上都排进了前列,且能生成有结构(乐段起伏)和立体声的音频,这在当时是很多 SOTA 模型做不到的。
三、训练数据:80 万文件,约 1.95 万小时,全部授权
Stable Audio 训练用的是 AudioSparx 授权曲库:约 80 万个音频文件,合计约 1.95 万小时。这个数字比 MusicGen 的 2 万小时许可音乐略少,但关键在于它全部来自 Stability 自家的商业授权平台,训练和商用都没有版权雷。数据量本身在音乐生成里不算大,但质量密度高——都是正经编曲的成品,不是爬虫抓的杂音。这套”用授权数据换干净训练”的思路,加上后来自家 Stable Audio Open 继续走 CC 许可路线,让 Stability 在版权风暴里一直站得比较稳。
四、两个后续:2.0 和 Open
Stable Audio 的产品线一年内走了两步:
Stable Audio 2.0(2024.04.03 发布,无独立论文):生成长度从 95 秒拉长到 3 分钟整曲,新增 audio-to-audio(把一段已有音频按描述重做/续写)和风格迁移能力。它不再是”给一段 prompt 出一段素材”,而是开始往”给一首歌做制作”的方向走。
Stable Audio Open(arXiv<2407>2407>.14358,2024.06 开源):开源的 1B 参数版本,44.1kHz、最长 47 秒,只用了 48.6 万条 Creative Commons(CC)许可数据训练。它和完整版的关系有点像”开源学生版”——规模小、时长短,但权重可下载、可本地微调,成了社区里少有的”能自己动手的文本到音频扩散模型”。论文摘要里强调它靠 CC 数据就拿到了与当时 SOTA 可竞争的性能,FDopenl3(衡量生成真实感的指标)表现亮眼。
收尾:我的一点看法
Stable Audio 给我的最大启示,是**“快”本身就是一种技术路线选择**。当大家都在卷”谁生成的歌更像真人写的”时,Stability 选择了”谁最快、最可控、最没有版权顾虑”,然后靠产品化把这些优势放大。时序条件这个设计尤其聪明——它把”时长”从超参数变成了用户可调的条件,这在音乐生成里是刚需,而自回归派往往要专门设计停止 token 才能实现类似效果。
技术层面,907M vs 1.15B 这个口径问题值得每个写稿的人记住:扩散模型的”参数量”经常只算 U-Net,但完整系统还含 VAE 和文本编码器,跨模型比较时必须统一口径。缺点方面,95 秒上限、长程结构一般、旋律一致性偶尔漂移,都是扩散路线的老毛病,后来 2.0 拉长到 3 分钟,也多少是补这个短板。整体上,Stable Audio 是”扩散派”在音乐生成里站住脚的关键一仗——它证明了不靠自回归语言模型,光靠”潜在扩散 + 好条件设计”,也能造出又快又够用的音乐生成器。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 论文 | arXiv<2402>2402>.04825(2024.02.07 提交,ICML 2024) |
| 模型发布时间 | 2023.09(论文晚于模型发布) |
| 范式 | 时序条件潜在扩散(latent diffusion + timing embedding) |
| 扩散 U-Net | 约 907M |
| 全模型 | 约 1.15B(U-Net 907M + VAE 约 133M + CLAP 约 110M) |
| 采样率 / 声道 | 44.1 kHz 立体声 |
| 生成时长 | 最长 95 秒(可变量时长) |
| 渲染速度 | A100 上渲染 95 秒音频约 8 秒 |
| 训练数据 | 约 80 万文件 ≈ 1.95 万小时(AudioSparx 授权) |
Stable Audio 2.0(2024.04,无独立论文)
| 项目 | 数值 |
|---|---|
| 生成长度 | 3 分钟整曲 |
| 新能力 | audio-to-audio、风格迁移 |
Stable Audio Open(arXiv<2407>2407>.14358,2024.06 开源)
| 项目 | 数值 |
|---|---|
| 参数量 | 1B |
| 采样率 / 时长 | 44.1 kHz / 47 秒 |
| 训练数据 | 48.6 万条 Creative Commons(CC)许可数据 |
核心创新
| 创新 | 要点 |
|---|---|
| 时序条件(timing embedding) | 时长作为条件输入,支持可变长度生成 |
| 潜在空间扩散 | 全卷积 VAE + 扩散 U-Net,推理大幅提速 |
| 极速推理 | 95 秒音频 A100 约 8 秒渲染,接近实时 |
| 授权数据训练 | AudioSparx 约 1.95 万小时,规避版权雷 |
| 立体声生成 | 直接输出 44.1kHz 立体声 |
关键成绩
- 44.1kHz 立体声最长 95 秒,A100 上约 8 秒渲染完成
- 在公开文生音乐/文生音频基准上进入前列,能生成有结构、立体声的音频
- Stable Audio Open 用 CC 数据达到与 SOTA 可竞争的性能
- 2.0 版本拉长到 3 分钟整曲并支持 audio-to-audio
关键概念清单
- latent diffusion = 潜在扩散,在压缩潜在空间做去噪生成
- U-Net = 扩散模型常用的编解码网络骨架
- VAE = Variational Autoencoder,变分自编码器
- timing embedding = 时序嵌入/时序条件,指示生成时长与当前时间位置
- CLAP = Contrastive Language-Audio Pretraining,对比式语言-音频预训练
- prompt = 提示词,文本描述条件
- FDopenl3 = 用 OpenL3 特征计算的 Frechet 距离,衡量生成音频真实感
- audio-to-audio = 音频到音频,对已有音频做重做/续写
- CC = Creative Commons,知识共享许可协议
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





