ACE-Step 系列论文解读:从 20 秒到 2 秒一首,开源音乐掀起的”速度革命”
论文1:ACE-Step: A Step Towards Music Generation Foundation Model 论文2:ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation 作者/机构:Junmin Gong 等(ACE Studio 与阶跃星辰(StepFun)联合发布并开源;arXiv<2506>2506>.00045 于 2025.05.28 提交,ACE-Step 1.5 为 arXiv<2602>2602>.00744,2026.01.31 提交) 开源音乐生成在 2025 年迎来了一位”速度狂魔”。ACE-Step 用 3.5B 参数在 A100 上 20 秒生成 4 分钟音乐,比 LLM 路线快 15 倍;半年后 ACE-Step 1.5 直接把数字打到 A100 上 2 秒一首、RTX 3090 上 10 秒一首、4 GB 显存就能本地跑,还宣称质量”超过多数商业音乐模型”。它给自己定的目标是——“音乐界的 Stable Diffusion 时刻”。这套”扩散打底、压缩先行”的设计哲学,值得每一个做音频生成的人细读。
一、背景:一个两难困局
2025 年初,音乐生成路线分两派,各有各的硬伤:
- LLM 路线(如 YuE、SongGen):歌词对齐好、细节丰富,但推理慢,而且自回归生成容易在长结构上出”结构性伪影”(段落糊、重复、崩塌);
- 扩散路线(如 DiffRhythm):合成快,但长范围结构连贯性差——前面一段和后面一段常常对不上。
ACE-Step 想干的不是选边站,而是把两条路的优点焊在一起。它的回答是一套”整体架构设计”(holistic architectural design),四个件拼起来。
二、架构:扩散 + DCAE + 线性 Transformer + REPA
1. 扩散生成打底(快)
生成器走扩散模型路线,天然快,适合做长音乐。但纯扩散管不住长结构,所以它靠后面几招补短板。
2. Sana 的深度压缩自动编码器(DCAE,省算力)
DCAE(Deep Compression AutoEncoder,深度压缩自动编码器)来自微软的 Sana 系列,ACE-Step 把它从图像搬进音频。它的作用是把音频压到极短的潜在表示:token 数量大减,模型处理的是高度浓缩的”音频摘要”而不是冗长的波形/频谱流。这一手是”20 秒出 4 分钟”的成本前提——生成空间小一个量级,速度自然上去一个量级,同时还能保留细粒度的声学细节。
3. 轻量线性 Transformer(管结构)
扩散模型缺少长程结构记忆,那就配一个轻量线性 Transformer——线性注意力让序列长度扩展的代价可控,负责把音乐的旋律、和声、节奏在时间轴上串起来,补上扩散路线的”结构性连贯性”短板。
4. REPA 语义对齐(让模型学得快)
训练时用 MERT 和 m-hubert 这两个现成的音乐/多语语音编码器,通过 REPA(Representation Alignment,表征对齐)技术把扩散模型的中间表征与它们对齐。相当于给模型请了个”音乐老师”监督它的中间过程,结果是快速收敛——数据没用那么多,学得还快。
三、成绩:20 秒 4 分钟、快 15 倍、19 语种
- 速度:A100 上生成 4 分钟音乐只要 20 秒,比 LLM 基线快 15 倍;官方还提供快速模式,最快 15 秒成曲;
- 连贯性:论文称在旋律、和声、节奏等指标上达到卓越的音乐连贯性与歌词对齐——“又快又不散”;
- 语言:支持 19 种语言,其中英语、中文、俄语、西班牙语、日语、德语、法语、葡萄牙语、意大利语、韩语这 10 种表现最佳(数据不平衡导致小众语言偏弱);
- 控制能力:不是只出整首歌,还解锁了声音克隆、歌词编辑、混音重制、轨道生成等细粒度操作——比如歌词转人声(lyric2vocal)、演唱转伴奏(singing2accompaniment)。
ACE-Step 的野心比”又一个文本到音乐模型”大:它要做的是音乐 AI 的基础模型(foundation model)——一个又快又通用又高效的可扩展底座,各家公司能在这上面低成本地训练自己的子任务,直接进入音乐人的创作工作流。
四、ACE-Step 1.5:让 LM 当”总导演”
半年后的 ACE-Step 1.5 把架构升级为混合架构:语言模型(LM)规划器 + 扩散 Transformer(DiT)。
核心思想是”分工”:LM 不再是笨重的生成主力,而是当全能规划器(omni-capable planner)——把用户一句简单的需求(比如”来一首慵懒的爵士”)翻译成一份完整的歌曲蓝图:段落结构、配器、情绪走向,从短 loop 到 10 分钟长曲都能规划;同时用**思维链(Chain-of-Thought)**把元数据、歌词、描述也一并合成出来,作为”剧本”交给 DiT 去渲染。DiT 负责把蓝图变成真实的声音。
论文里有个相当特别的点:LM 与 DiT 的**对齐是靠内在强化学习(intrinsic reinforcement learning)**完成的——只用模型自身机制,不引入外部奖励模型或人类偏好,理由是外部奖励会带来偏差。这个设计在音乐生成里相当少见,也相当大胆。
五、1.5 的效率:把生成速度打穿消费级硬件
1.5 版的数字单拎出来都够惊悚:
- A100 上一首完整歌曲 <2 秒(全文生成的推理);
- RTX 3090 上 <10 秒——个人工作站的体验已经接近”即点即出”;
- 本地运行只需 <4 GB 显存,消费级显卡就能部署;
- 支持 50+ 语种,保持对提示的严格遵循(prompt adherence);
- LoRA 个性化:只用几首歌就能微调出自己的风格模型,把模型”变成你的声音”。
从 20 秒到 2 秒,不是简单的优化,是架构级换挡:压缩彻底 + 规划器替代盲目自回归 + DiT 快采样,三者缺一不可。它还把编辑能力补齐——翻唱生成(cover)、局部重绘(repainting)、人声转伴奏(vocal-to-BGM),配合 50+ 语种,基本在朝着”开源里最接近生产工具”的方向走。
六、两代对比:一条清晰的进化线
| 维度 | ACE-Step | ACE-Step 1.5 |
|---|---|---|
| 生成速度(A100) | 20 秒/4 分钟 | <2 秒/首 |
| 消费级硬件 | 需数据中心 GPU | RTX 3090 <10 秒、<4 GB VRAM |
| 架构 | 扩散 + DCAE + 线性 Transformer + REPA | LM 规划器 + DiT,内在 RL 对齐 |
| 语种 | 19 种 | 50+ 种 |
| 个性化 | 基础控制 | LoRA 数首歌微调 |
收尾:我的一点看法
ACE-Step 最值得被记住的一句话是论文原话:“我们的目标,是创造一个音乐界的 Stable Diffusion 时刻。” 这句话的分量在于:Stable Diffusion 当年做的事不是”把图画得最好”,而是把”最好的画图能力”从云端大厂手里抢过来,放到任何人的显卡上。ACE-Step 1.5 的 <4 GB VRAM、3090 上 10 秒一首,做的正是同一件事——音乐生成能力的本地化、平民化。
技术上的亮点,我投给”让规划与渲染分离”这一刀。LLM 天生会讲故事(规划),DiT 天生会画质(渲染),把两者切开各干各的,比让一个自回归模型从头到尾硬扛要优雅得多。这也是 1.5 把速度、质量和可编辑性同时拉满的根本原因。而”内在 RL、不用外部奖励”的实验精神,虽然方向激进、结果有待同行验证⚠️,但至少说明这个团队在认真思考”奖励模型本身的偏差”这个深层问题。
当然,泼冷水也要泼到位。第一,“质量超过多数商业音乐模型”是论文自报口径,主观音乐质量从来最怕王婆卖瓜,社区的盲听对比才是试金石。第二,1.5 的数字(2 秒/首)是官方技术报告口径,实际端到端体验(排队、上传、解析)远不止这个数,别被”秒出”的宣传带偏。第三,训练数据来源与授权问题,两篇论文都没有给出清晰口径⚠️——这在这个版权大战的年头是绕不开的雷。第四,语种的”50+“里有多少是真能打的、多少是凑数的,也需要实测验证。
但无论如何,ACE-Step 系列已经给开源音乐生成立起了一个新标杆:速度、质量、本地化,可以同时要。它和 YuE(重规划重质量的自回归路线)正好构成了开源音乐生成的两条互补路径,这一对组合拳,是 2025–2026 年开源侧对抗闭源产品最有力的筹码。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 论文1 | ACE-Step: A Step Towards Music Generation Foundation Model |
| 论文2 | ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation |
| 机构 | ACE Studio + 阶跃星辰(StepFun)联合开源(非蚂蚁集团) |
| arXiv | 2506.00045(2025.05.28 提交)/ 2602.00744(2026.01.31 提交) |
| 开源时间 | 2025.05.07 联合发布并开源 |
| 参数量 | 3.5B |
| 许可证 | 开源(权重+代码公开) |
核心创新
| 创新 | 要点 |
|---|---|
| 扩散 + DCAE + 线性 Transformer + REPA | 快(扩散)+ 省(深度压缩)+ 稳(线性注意力管结构)+ 快收敛(语义对齐) |
| 音轨级控制 | 声音克隆、歌词编辑、混音重制、lyric2vocal、singing2accompaniment |
| LM 规划器 + DiT(1.5) | LM 出”歌曲蓝图”,DiT 渲染,规划与渲染分离 |
| 内在强化学习(1.5) | 不依赖外部奖励模型/人类偏好,靠模型自身机制对齐 |
| LoRA 个性化(1.5) | 数首歌即可微调出自己的风格 |
关键成绩
| 指标 | ACE-Step | ACE-Step 1.5 |
|---|---|---|
| 生成速度 | A100 上 20 秒/4 分钟(快 15×),最快 15 秒成曲 | A100 <2 秒/首、RTX 3090 <10 秒/首 |
| 显存/部署 | 需数据中心级 GPU | <4 GB VRAM 本地运行 |
| 语言支持 | 19 种(10 种表现最佳) | 50+ 种 |
| 扩展能力 | 多子任务基础模型 | LoRA 个性化 + cover/repaint/vocal-to-BGM |
| 质量宣称 | 卓越连贯性与歌词对齐(论文自报) | 超过多数商业模型(论文自报 ⚠️) |
关键概念清单
- DCAE = Deep Compression AutoEncoder,深度压缩自动编码器(源自 Sana 系列),大幅压缩音频潜在表示
- linear transformer = 线性 Transformer,线性注意力降低长序列成本
- REPA = Representation Alignment,表征对齐,用 MERT/m-hubert 语义对齐加速收敛
- MERT / m-hubert = 音乐表征 / 多语语音自监督编码器
- DiffRhythm = 扩散式音乐生成模型(ACE-Step 的对比基线之一)
- Lyric2Vocal = 歌词转人声
- Singing2Accompaniment = 演唱转伴奏
- DiT = Diffusion Transformer,扩散 Transformer
- LM planner = 语言模型规划器(把需求转成歌曲蓝图)
- Chain-of-Thought = 思维链,让 LM 逐步合成元数据/歌词/描述
- intrinsic reinforcement learning = 内在强化学习(无外部奖励模型)
- LoRA = Low-Rank Adaptation,低秩适配,低成本微调技术
- prompt adherence = 对提示遵循度
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





