mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2864 字
8 分钟
[音乐生成] YuE:5 分钟出成品
2026-07-22

YuE 论文解读:5 分钟”歌词→成品歌”,开源音乐终于有了能打的#

论文:YuE: Scaling Open Foundation Models for Long-Form Music Generation 作者/机构:Ruibin Yuan 等(香港科技大学 + M-A-P 多模态艺术工程团队,arXiv<2503>.08638,2025.03.11 提交) 这是开源音乐生成领域第一个敢正面叫板 Suno、Udio 的严肃作品。YuE 基于 LLaMA2 架构一路扩到万亿级 token,目标只有一个:你给一首歌词,它给你一整首最长 5 分钟、人声能唱、歌词对得上、段落结构不乱的歌。最狠的是它完全开源(Apache 2.0),模型权重、代码、技术报告全给你。2025 年初的这张牌一打出,开源音乐生成就再也不是”玩具”了。


一、问题:为什么”歌词→歌”这么难#

“歌词到歌曲”(lyrics-to-song)跟”文字到音乐”是两码事。后者只要”好听”,前者要求词曲严丝合缝:人声要真的把歌词唱出来、音节要落在旋律上、情绪要跟着词走、段落要按主歌副歌的规矩排。这是音频生成里最硬的任务之一,连商业产品也经常翻车——词唱串了、段落重复、人声糊成一团。

更麻烦的是训练信号的问题:一段成品歌曲里,人声和伴奏是混在一起的密集信号(dense mixture)。让模型”预测下一个音频 token”,它同时要对齐词、旋律、和声、节奏、音色,多个任务挤在同一个预测目标里,谁也学不干净。这是 YuE 要解决的头号难题。

二、架构:LLaMA2 打底,音轨解耦预测#

YuE 没有另起炉灶,直接站在 LLaMA2 架构肩上,因为 LLM 那套”下一个 token 预测”已经被证明是音乐生成最稳的范式之一(MusicGen 就是这么干的)。

针对”密集混合信号”问题,YuE 的核心设计是音轨解耦的下一个 token 预测(track-decoupled next-token prediction)

  • 把一首歌的音频拆成两轨——人声轨(vocal track)和伴奏轨(accompaniment track),分别建模、分别预测;
  • 模型在学习时不再面对一团浆糊,而是”这一帧人声该唱什么词、伴奏该是什么和弦”各归各位;
  • 推理时两条轨道预测组合回去,还原成完整歌曲。

这个思路的直观类比是:让两个乐手各看各的谱子,比让一个乐手同时看总谱要靠谱得多。它绕开了”一个预测头什么都得管”的困境。

三、训练配方:万亿 token,多任务多阶段#

LLM 的成败在数据。YuE 声称训练规模扩到了万亿(trillions)级 token,这在开源音乐模型里是头一档的胃口——2023 年的 MusicGen 还只有 2 万小时,YuE 直接进入”规模即正义”的赛道。

光有量不够,配方还讲究。论文提出多任务、多阶段预训练(multitask, multiphase pre-training)

  • 多任务:一个任务学”接着生成”,一个任务学”补全”,不同任务给模型不同的归纳偏置;
  • 多阶段:先易后难,先在较宽松的条件上学通用规律,再逐步引入歌词、结构等强约束,保证模型能收敛还能泛化。

这套配方的意义在于:万亿 token 不是硬塞就能吃下的,得让模型在不同学习阶段”消化”不同层次的知识。

四、结构性渐进条件:长歌词对齐的钥匙#

要让 5 分钟的歌歌词不乱,还得解决长上下文对齐问题——歌词在时间轴上摊开,每句词必须落在正确的位置。

YuE 用了结构性渐进条件(structural progressive conditioning):把歌词的段落结构(主歌/副歌/桥段)作为显式条件逐步注入生成过程,让模型”看着结构写歌”。歌词对齐不是靠模型碰运气,而是被结构信息锚定在正确的段落和位置上。这也是它能撑起 5 分钟长歌的关键——短歌靠直觉,长歌靠结构。

五、音乐版的 In-Context Learning:风格迁移与双向生成#

YuE 还干了一件挺妙的事:把 LLM 的**上下文学习(in-context learning)**改造成音乐版本。什么意思?LLM 看几个例子就能学会新任务的套路,YuE 让它”听”一段音乐就能学会一种风格。

论文给的例子很有画面感:把日本城市流行(Japanese city pop)转换成英语说唱(English rap),而且保留原来的伴奏——人声和歌词换了,编曲还是那一套。这背后是它对”人声轨”和”伴奏轨”的精细控制:两轨可以独立地被替换和迁移。

更进一步,YuE 支持双向生成(bidirectional generation)——既能词生成歌,也能歌反推出词/结构,相当于把”写歌”这件事从单向生成变成可来回操作的能力。

六、评测成绩:音乐性打平商业系统#

音乐生成没有统一的”标准答案”,YuE 的评估主要靠客观指标加主观对比:

  • 音乐性与人声灵活度:论文称 YuE 匹配甚至超越部分商业系统(proprietary systems)——这在开源模型里是相当硬气的说法,因为对标的是 Suno 这类闭源产品;
  • 可控性扩展:在 YuE 基础上微调,可以获得额外控制能力,并显著改善尾部语言(tail languages)——也就是训练数据少的语言的支持;
  • 理解任务反向验证:YuE 学到的表征不只是能生成,在音乐理解基准 MARBLE 上表现也匹配或超过当时的 SOTA 方法——“会写歌的也懂音乐”,侧面印证了表征质量。

七、开源与生态#

YuE 走的是Apache 2.0 全开源路线:代码、权重、论文全部开放,仓库挂在 M-A-P(multimodal-art-projection)名下,供任何人下载、微调、商用。在 Suno、Udio 还在跟版权方扯皮的时候,YuE 用”干净的开源”给社区提供了一条自托管路线——你甚至可以拿它做二次开发,接自己的声线、做自己的产品。

收尾:我的一点看法#

YuE 最大的价值不是”又一个能唱歌的模型”,而是证明了开源也能做长歌。之前开源音乐生成普遍是”30 秒 demo 级”,YuE 把门槛抬到了”5 分钟整曲、词曲对齐、结构完整”,而且是在 Apache 2.0 下做到的。这个示范效应,跟当年 Stable Diffusion 之于图像的地位有点类似——闭源产品把市场做起来了,开源把能力民主化了。

技术层面我最服的是”音轨解耦”这个设计。它没有去发明玄乎的新架构,而是精准地识别出”预测目标太挤”这个病灶,用拆轨道的方式让每个预测头专注一件事。这种”诊断问题比堆参数重要”的思路,是好的工程直觉。

说点泼冷水的。第一,论文的评估主要靠自报,音乐性”匹配商业系统”这种结论,在主观评测上水分空间不小,真想验证得拿耳朵一轨一轨地听。第二,万亿 token 的训练成本不是一般团队能复现的,所以它的”开源”对个体开发者来说是”能跑”而非”能训”。第三,5 分钟的上限对一首完整作品够用,但真要支撑整张专辑的工作流,时长、音质、可编辑性都还有路要走。最后,版权也是个隐性问题——训练数据从哪来论文没细说⚠️,而版权恰恰是 2025 年音乐 AI 头上悬着的那把剑。

但瑕不掩瑜。YuE 是 2025 年开源音乐生成最重要的一份答卷,后来 ACE-Step 等模型的出现,多少都站在它划出的这条跑道上。


附:核心数据速查#

基本盘

项目数值
论文YuE: Scaling Open Foundation Models for Long-Form Music Generation
机构香港科技大学 + M-A-P(multimodal-art-projection)
arXiv2503.08638(2025.03.11 提交,v2 于 2025.09.15 修订)
基础架构LLaMA2
训练数据万亿(trillions)级 token
生成能力歌词→歌,最长 5 分钟,含人声
许可证Apache 2.0(代码+权重+报告全开源)
参数量论文未给出单一口径 ⚠️

核心创新

创新要点
音轨解耦预测人声轨/伴奏轨分开建模预测,破解密集混合信号
结构渐进条件歌词段落结构显式注入,锚定长歌的歌词对齐
多任务多阶段预训练多任务+分阶段,支撑万亿 token 规模下的收敛与泛化
音乐版 in-context learning听例学风格,支持日本城市流行→英语说唱等风格迁移
双向生成歌词→歌与歌→结构/歌词双向可操作

关键成绩

指标表现
音乐性/人声灵活度匹配甚至超越部分商业系统(论文自报)
微调扩展性支持额外控制能力,显著改善尾部语言支持
音乐理解MARBLE 基准上匹配或超过当时 SOTA 方法
开源形态Apache 2.0,权重/代码/报告全部开放

关键概念清单

  • lyrics-to-song = 歌词到歌曲,从歌词文本生成含人声演唱的完整歌曲
  • track-decoupled next-token prediction = 音轨解耦的下一 token 预测,人声/伴奏分开建模
  • dense mixture = 密集混合信号(人声与伴奏混在同一段音频里)
  • structural progressive conditioning = 结构渐进条件(按段落结构注入歌词条件)
  • multitask, multiphase pre-training = 多任务、多阶段预训练配方
  • in-context learning = 上下文学习,LLM 看几个示例即可套用新任务
  • tail languages = 尾部语言,训练数据稀少的语言
  • MARBLE = 音乐表征理解基准(音乐理解评测)
  • Apache 2.0 = 宽松开源许可证,允许商用与再分发
  • M-A-P = Multimodal Art Projection,多模态艺术工程团队
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[音乐生成] YuE:5 分钟出成品
https://mizuki-eaf.pages.dev/posts/音频生成模型/音乐生成-yue5-分钟出成品/
作者
无名之子
发布于
2026-07-22
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录