mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2507 字
7 分钟
[音乐生成] Stable Audio:8 秒出成品
2026-07-21

Stable Audio 论文解读:95 秒立体声、8 秒渲染完,音乐生成第一次拼”速度”#

论文:Fast Timing-Conditioned Latent Audio Diffusion(arXiv<2402>.04825,2024.02.07 提交,ICML 2024) 作者/机构:Zach Evans、CJ Carr、Josiah Taylor、Scott H. Hawley、Jordi Pons 等(Stability AI) 附:Stable Audio 2.0(2024.04.03 发布,无独立论文);Stable Audio Open(arXiv<2407>.14358,2024.07.19 提交)

在 Stable Audio 之前,AI 音乐的叙事基本是”质量 vs 速度二选一”:Jukebox 一小时渲一分钟,MusicGen 这类 token 语言模型质量不错但推理也快不到哪去。Stability AI 这篇直接把赛道换成了时序条件潜在扩散——跟文生图的 Stable Diffusion 同宗同源,只是把”时间”变成了第一公民。它生成的 44.1kHz 立体声音乐最长 95 秒,在 A100 上渲染只要约 8 秒,比实时快十几倍。模型本体于 2023 年 9 月发布(论文 2024 年 2 月才挂 arXiv),所以这篇严格说是”产品模型的论文化”。读懂它,就理解了后来音乐生成里”扩散派”为什么能跟”自回归派”分庭抗礼。


一、总盘子:把 Stable Diffusion 的配方端到音频#

Stable Audio 的架构是文生图扩散模型的”音频移植版”,三段式:

  1. 全卷积 VAE(fully-convolutional variational autoencoder):把音频压进潜在空间,这是扩散模型工作的”画布”,维度低、好训练。
  2. 扩散 U-Net:在潜在空间里从噪声逐步去噪,一步步”画”出目标音频的潜在表征。这个 U-Net 约 907M 参数——注意,907M 只是扩散 U-Net 这一个模块,不是全模型!完整模型还要加上 VAE(约 133M)和 CLAP 文本编码器(约 110M),三者合计约 1.15B。很多资料只写 907M,那是把 U-Net 当成了全部,属于口径乌龙。
  3. VAE 解码器:把潜在表征还原成 44.1kHz 的立体声波形。

条件部分有两个,这也是论文标题里 “Timing-Conditioned”(时序条件)的由来:文本 prompt(经 CLAP 编码)+ 时序嵌入(timing embedding)。时序嵌入是 Stable Audio 相对同类最特别的设计——它告诉模型”这段音频总共要多长、现在是第几秒”,让模型能按你指定的**可变时长(variable length)**生成,而不是像很多模型那样固定生成长度。音乐和音效本身时长差异巨大,一首 90 秒的曲子和一个 3 秒的关门声,结构完全不同,能把时长当条件直接控制,这是扩散派相对自回归派的一个实用优势。

二、为什么”8 秒渲染 95 秒”这么重要#

生成 95 秒音频,A100 上只要 8 秒——这个数字在当时是碾压级的。同期主流的音乐生成要么是自回归逐 token 吐(MusicGen 3.3B 在 A100 上生成 30 秒音频要几十秒到分钟级),要么干脆是慢到没用的研究模型。Stable Audio 把”生成一条可用的音乐片段”压到了接近实时,这直接改变了产品的想象空间:它可以进交互式 DAW(数字音频工作站)流程,可以一遍遍试 prompt,可以批量出素材。“快”第一次成为 AI 音乐的营销词,后来 ACE-Step 的”20 秒生成 4 分钟”、Suno 的”快 10 倍”都是沿着这条路的再加速。

当然快是有代价的:U-Net 扩散在长程结构上不如自回归模型有”叙事感”,95 秒的上限也摆在那。但 Stability 的算盘很清楚——让速度和可控性先打动人,质量交给后续版本迭代。它在两个公开的文生音乐/文生音频基准上都排进了前列,且能生成有结构(乐段起伏)和立体声的音频,这在当时是很多 SOTA 模型做不到的。

三、训练数据:80 万文件,约 1.95 万小时,全部授权#

Stable Audio 训练用的是 AudioSparx 授权曲库:约 80 万个音频文件,合计约 1.95 万小时。这个数字比 MusicGen 的 2 万小时许可音乐略少,但关键在于它全部来自 Stability 自家的商业授权平台,训练和商用都没有版权雷。数据量本身在音乐生成里不算大,但质量密度高——都是正经编曲的成品,不是爬虫抓的杂音。这套”用授权数据换干净训练”的思路,加上后来自家 Stable Audio Open 继续走 CC 许可路线,让 Stability 在版权风暴里一直站得比较稳。

四、两个后续:2.0 和 Open#

Stable Audio 的产品线一年内走了两步:

Stable Audio 2.0(2024.04.03 发布,无独立论文):生成长度从 95 秒拉长到 3 分钟整曲,新增 audio-to-audio(把一段已有音频按描述重做/续写)和风格迁移能力。它不再是”给一段 prompt 出一段素材”,而是开始往”给一首歌做制作”的方向走。

Stable Audio Open(arXiv<2407>.14358,2024.06 开源):开源的 1B 参数版本,44.1kHz、最长 47 秒,只用了 48.6 万条 Creative Commons(CC)许可数据训练。它和完整版的关系有点像”开源学生版”——规模小、时长短,但权重可下载、可本地微调,成了社区里少有的”能自己动手的文本到音频扩散模型”。论文摘要里强调它靠 CC 数据就拿到了与当时 SOTA 可竞争的性能,FDopenl3(衡量生成真实感的指标)表现亮眼。

收尾:我的一点看法#

Stable Audio 给我的最大启示,是**“快”本身就是一种技术路线选择**。当大家都在卷”谁生成的歌更像真人写的”时,Stability 选择了”谁最快、最可控、最没有版权顾虑”,然后靠产品化把这些优势放大。时序条件这个设计尤其聪明——它把”时长”从超参数变成了用户可调的条件,这在音乐生成里是刚需,而自回归派往往要专门设计停止 token 才能实现类似效果。

技术层面,907M vs 1.15B 这个口径问题值得每个写稿的人记住:扩散模型的”参数量”经常只算 U-Net,但完整系统还含 VAE 和文本编码器,跨模型比较时必须统一口径。缺点方面,95 秒上限、长程结构一般、旋律一致性偶尔漂移,都是扩散路线的老毛病,后来 2.0 拉长到 3 分钟,也多少是补这个短板。整体上,Stable Audio 是”扩散派”在音乐生成里站住脚的关键一仗——它证明了不靠自回归语言模型,光靠”潜在扩散 + 好条件设计”,也能造出又快又够用的音乐生成器。


附:核心数据速查#

基本盘

项目数值
论文arXiv<2402>.04825(2024.02.07 提交,ICML 2024)
模型发布时间2023.09(论文晚于模型发布)
范式时序条件潜在扩散(latent diffusion + timing embedding)
扩散 U-Net约 907M
全模型约 1.15B(U-Net 907M + VAE 约 133M + CLAP 约 110M)
采样率 / 声道44.1 kHz 立体声
生成时长最长 95 秒(可变量时长)
渲染速度A100 上渲染 95 秒音频约 8 秒
训练数据80 万文件 ≈ 1.95 万小时(AudioSparx 授权)

Stable Audio 2.0(2024.04,无独立论文)

项目数值
生成长度3 分钟整曲
新能力audio-to-audio、风格迁移

Stable Audio Open(arXiv<2407>.14358,2024.06 开源)

项目数值
参数量1B
采样率 / 时长44.1 kHz / 47 秒
训练数据48.6 万条 Creative Commons(CC)许可数据

核心创新

创新要点
时序条件(timing embedding)时长作为条件输入,支持可变长度生成
潜在空间扩散全卷积 VAE + 扩散 U-Net,推理大幅提速
极速推理95 秒音频 A100 约 8 秒渲染,接近实时
授权数据训练AudioSparx 约 1.95 万小时,规避版权雷
立体声生成直接输出 44.1kHz 立体声

关键成绩

  • 44.1kHz 立体声最长 95 秒,A100 上约 8 秒渲染完成
  • 在公开文生音乐/文生音频基准上进入前列,能生成有结构、立体声的音频
  • Stable Audio Open 用 CC 数据达到与 SOTA 可竞争的性能
  • 2.0 版本拉长到 3 分钟整曲并支持 audio-to-audio

关键概念清单

  • latent diffusion = 潜在扩散,在压缩潜在空间做去噪生成
  • U-Net = 扩散模型常用的编解码网络骨架
  • VAE = Variational Autoencoder,变分自编码器
  • timing embedding = 时序嵌入/时序条件,指示生成时长与当前时间位置
  • CLAP = Contrastive Language-Audio Pretraining,对比式语言-音频预训练
  • prompt = 提示词,文本描述条件
  • FDopenl3 = 用 OpenL3 特征计算的 Frechet 距离,衡量生成音频真实感
  • audio-to-audio = 音频到音频,对已有音频做重做/续写
  • CC = Creative Commons,知识共享许可协议
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[音乐生成] Stable Audio:8 秒出成品
https://mizuki-eaf.pages.dev/posts/音频生成模型/音乐生成-stable-audio8-秒出成品/
作者
无名之子
发布于
2026-07-21
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录