YuE 论文解读:5 分钟”歌词→成品歌”,开源音乐终于有了能打的
论文:YuE: Scaling Open Foundation Models for Long-Form Music Generation 作者/机构:Ruibin Yuan 等(香港科技大学 + M-A-P 多模态艺术工程团队,arXiv<2503>2503>.08638,2025.03.11 提交) 这是开源音乐生成领域第一个敢正面叫板 Suno、Udio 的严肃作品。YuE 基于 LLaMA2 架构一路扩到万亿级 token,目标只有一个:你给一首歌词,它给你一整首最长 5 分钟、人声能唱、歌词对得上、段落结构不乱的歌。最狠的是它完全开源(Apache 2.0),模型权重、代码、技术报告全给你。2025 年初的这张牌一打出,开源音乐生成就再也不是”玩具”了。
一、问题:为什么”歌词→歌”这么难
“歌词到歌曲”(lyrics-to-song)跟”文字到音乐”是两码事。后者只要”好听”,前者要求词曲严丝合缝:人声要真的把歌词唱出来、音节要落在旋律上、情绪要跟着词走、段落要按主歌副歌的规矩排。这是音频生成里最硬的任务之一,连商业产品也经常翻车——词唱串了、段落重复、人声糊成一团。
更麻烦的是训练信号的问题:一段成品歌曲里,人声和伴奏是混在一起的密集信号(dense mixture)。让模型”预测下一个音频 token”,它同时要对齐词、旋律、和声、节奏、音色,多个任务挤在同一个预测目标里,谁也学不干净。这是 YuE 要解决的头号难题。
二、架构:LLaMA2 打底,音轨解耦预测
YuE 没有另起炉灶,直接站在 LLaMA2 架构肩上,因为 LLM 那套”下一个 token 预测”已经被证明是音乐生成最稳的范式之一(MusicGen 就是这么干的)。
针对”密集混合信号”问题,YuE 的核心设计是音轨解耦的下一个 token 预测(track-decoupled next-token prediction):
- 把一首歌的音频拆成两轨——人声轨(vocal track)和伴奏轨(accompaniment track),分别建模、分别预测;
- 模型在学习时不再面对一团浆糊,而是”这一帧人声该唱什么词、伴奏该是什么和弦”各归各位;
- 推理时两条轨道预测组合回去,还原成完整歌曲。
这个思路的直观类比是:让两个乐手各看各的谱子,比让一个乐手同时看总谱要靠谱得多。它绕开了”一个预测头什么都得管”的困境。
三、训练配方:万亿 token,多任务多阶段
LLM 的成败在数据。YuE 声称训练规模扩到了万亿(trillions)级 token,这在开源音乐模型里是头一档的胃口——2023 年的 MusicGen 还只有 2 万小时,YuE 直接进入”规模即正义”的赛道。
光有量不够,配方还讲究。论文提出多任务、多阶段预训练(multitask, multiphase pre-training):
- 多任务:一个任务学”接着生成”,一个任务学”补全”,不同任务给模型不同的归纳偏置;
- 多阶段:先易后难,先在较宽松的条件上学通用规律,再逐步引入歌词、结构等强约束,保证模型能收敛还能泛化。
这套配方的意义在于:万亿 token 不是硬塞就能吃下的,得让模型在不同学习阶段”消化”不同层次的知识。
四、结构性渐进条件:长歌词对齐的钥匙
要让 5 分钟的歌歌词不乱,还得解决长上下文对齐问题——歌词在时间轴上摊开,每句词必须落在正确的位置。
YuE 用了结构性渐进条件(structural progressive conditioning):把歌词的段落结构(主歌/副歌/桥段)作为显式条件逐步注入生成过程,让模型”看着结构写歌”。歌词对齐不是靠模型碰运气,而是被结构信息锚定在正确的段落和位置上。这也是它能撑起 5 分钟长歌的关键——短歌靠直觉,长歌靠结构。
五、音乐版的 In-Context Learning:风格迁移与双向生成
YuE 还干了一件挺妙的事:把 LLM 的**上下文学习(in-context learning)**改造成音乐版本。什么意思?LLM 看几个例子就能学会新任务的套路,YuE 让它”听”一段音乐就能学会一种风格。
论文给的例子很有画面感:把日本城市流行(Japanese city pop)转换成英语说唱(English rap),而且保留原来的伴奏——人声和歌词换了,编曲还是那一套。这背后是它对”人声轨”和”伴奏轨”的精细控制:两轨可以独立地被替换和迁移。
更进一步,YuE 支持双向生成(bidirectional generation)——既能词生成歌,也能歌反推出词/结构,相当于把”写歌”这件事从单向生成变成可来回操作的能力。
六、评测成绩:音乐性打平商业系统
音乐生成没有统一的”标准答案”,YuE 的评估主要靠客观指标加主观对比:
- 音乐性与人声灵活度:论文称 YuE 匹配甚至超越部分商业系统(proprietary systems)——这在开源模型里是相当硬气的说法,因为对标的是 Suno 这类闭源产品;
- 可控性扩展:在 YuE 基础上微调,可以获得额外控制能力,并显著改善尾部语言(tail languages)——也就是训练数据少的语言的支持;
- 理解任务反向验证:YuE 学到的表征不只是能生成,在音乐理解基准 MARBLE 上表现也匹配或超过当时的 SOTA 方法——“会写歌的也懂音乐”,侧面印证了表征质量。
七、开源与生态
YuE 走的是Apache 2.0 全开源路线:代码、权重、论文全部开放,仓库挂在 M-A-P(multimodal-art-projection)名下,供任何人下载、微调、商用。在 Suno、Udio 还在跟版权方扯皮的时候,YuE 用”干净的开源”给社区提供了一条自托管路线——你甚至可以拿它做二次开发,接自己的声线、做自己的产品。
收尾:我的一点看法
YuE 最大的价值不是”又一个能唱歌的模型”,而是证明了开源也能做长歌。之前开源音乐生成普遍是”30 秒 demo 级”,YuE 把门槛抬到了”5 分钟整曲、词曲对齐、结构完整”,而且是在 Apache 2.0 下做到的。这个示范效应,跟当年 Stable Diffusion 之于图像的地位有点类似——闭源产品把市场做起来了,开源把能力民主化了。
技术层面我最服的是”音轨解耦”这个设计。它没有去发明玄乎的新架构,而是精准地识别出”预测目标太挤”这个病灶,用拆轨道的方式让每个预测头专注一件事。这种”诊断问题比堆参数重要”的思路,是好的工程直觉。
说点泼冷水的。第一,论文的评估主要靠自报,音乐性”匹配商业系统”这种结论,在主观评测上水分空间不小,真想验证得拿耳朵一轨一轨地听。第二,万亿 token 的训练成本不是一般团队能复现的,所以它的”开源”对个体开发者来说是”能跑”而非”能训”。第三,5 分钟的上限对一首完整作品够用,但真要支撑整张专辑的工作流,时长、音质、可编辑性都还有路要走。最后,版权也是个隐性问题——训练数据从哪来论文没细说⚠️,而版权恰恰是 2025 年音乐 AI 头上悬着的那把剑。
但瑕不掩瑜。YuE 是 2025 年开源音乐生成最重要的一份答卷,后来 ACE-Step 等模型的出现,多少都站在它划出的这条跑道上。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 论文 | YuE: Scaling Open Foundation Models for Long-Form Music Generation |
| 机构 | 香港科技大学 + M-A-P(multimodal-art-projection) |
| arXiv | 2503.08638(2025.03.11 提交,v2 于 2025.09.15 修订) |
| 基础架构 | LLaMA2 |
| 训练数据 | 万亿(trillions)级 token |
| 生成能力 | 歌词→歌,最长 5 分钟,含人声 |
| 许可证 | Apache 2.0(代码+权重+报告全开源) |
| 参数量 | 论文未给出单一口径 ⚠️ |
核心创新
| 创新 | 要点 |
|---|---|
| 音轨解耦预测 | 人声轨/伴奏轨分开建模预测,破解密集混合信号 |
| 结构渐进条件 | 歌词段落结构显式注入,锚定长歌的歌词对齐 |
| 多任务多阶段预训练 | 多任务+分阶段,支撑万亿 token 规模下的收敛与泛化 |
| 音乐版 in-context learning | 听例学风格,支持日本城市流行→英语说唱等风格迁移 |
| 双向生成 | 歌词→歌与歌→结构/歌词双向可操作 |
关键成绩
| 指标 | 表现 |
|---|---|
| 音乐性/人声灵活度 | 匹配甚至超越部分商业系统(论文自报) |
| 微调扩展性 | 支持额外控制能力,显著改善尾部语言支持 |
| 音乐理解 | MARBLE 基准上匹配或超过当时 SOTA 方法 |
| 开源形态 | Apache 2.0,权重/代码/报告全部开放 |
关键概念清单
- lyrics-to-song = 歌词到歌曲,从歌词文本生成含人声演唱的完整歌曲
- track-decoupled next-token prediction = 音轨解耦的下一 token 预测,人声/伴奏分开建模
- dense mixture = 密集混合信号(人声与伴奏混在同一段音频里)
- structural progressive conditioning = 结构渐进条件(按段落结构注入歌词条件)
- multitask, multiphase pre-training = 多任务、多阶段预训练配方
- in-context learning = 上下文学习,LLM 看几个示例即可套用新任务
- tail languages = 尾部语言,训练数据稀少的语言
- MARBLE = 音乐表征理解基准(音乐理解评测)
- Apache 2.0 = 宽松开源许可证,允许商用与再分发
- M-A-P = Multimodal Art Projection,多模态艺术工程团队
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





