mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1804 字
5 分钟
[编解码器] DAC:一码通吃三声
2026-07-20

DAC 论文解读:44.1 kHz 压成 8 kbps,一个编解码器通吃语音、音乐、环境音#

论文:High-Fidelity Audio Compression with Improved RVQGAN 作者/机构:Rithesh Kumar、Prem Seetharaman、Alejandro Luebs、Ishaan Kumar、Kundan Kumar(Descript) 这篇是 2023 年 6 月 Descript 出品的”卷王”编解码器。它把图像领域的 RVQGAN 思路搬到音频上做了一整套改进,最后交出的是44.1 kHz 音频压到 8 kbps、约 90 倍压缩的答卷,而且语音、音乐、环境音一个通用模型通吃,显著赢过同期竞品。论文拿了 NeurIPS 2023 spotlight(亮点报告),代码和权重全部开源。如果你想看”音频编解码器还能怎么卷”,这篇就是答案。


一、背景:大家都在卷码率,DAC 要卷”通用”#

SoundStream 和 EnCodec 确立了”全卷积编解码器 + RVQ + 判别器”的标准路线,但两者都有共性局限:不同音频域(语音/音乐/音效)往往要分别适配,压缩率的天花板也还有空间。DAC 的思路反着来——能不能一个模型,把该压缩的音频全压缩了,还把压缩率干到极致? 这正好呼应了语言模型那边的需求:做通用音频生成,最好一个 tokenizer 就能覆盖所有音频模态。

二、架构改进:把 RVQGAN 拧上几颗新螺丝#

DAC 全称 Descript Audio Codec,技术路线是”改进的 RVQGAN”。相比前辈,它主要在四处动刀:

  1. 因子化编码(factorized codes):把潜在表征拆成几个维度组分别量化,从而把码本(codebook)大小和潜在维度解耦。收益很直接——码本参数量大幅下降,量化器不再是模型里的”内存大户”,训练和推理都更省。
  2. 分组量化(group quantization):每个维度组独立量化,让码本利用率(codebook utilization)更高,离散 token 的信息密度更大。
  3. 周期归纳偏置(periodic inductive bias):生成器里引入周期性激活函数,让模型天然擅长建模钢琴、人声这类”有基频”的周期性声音。这是通用音频建模里最容易被忽视的坑——周期信号处理不好,乐器声和元音就会”发闷”。
  4. 更强的对抗与重建损失:结合音频生成领域最新的损失设计,把重建保真度再顶高一层。

更难得的是,论文对每个设计选择都做了彻底的消融实验(ablation study),不是”我改了所以更好”,而是”改了,并且用实验证明它确实更好”。

三、成绩:90 倍压缩 + 单模型通吃#

论文最扎眼的数字是约 90 倍的压缩率:44.1 kHz 音频压成 8 kbps 的 token 流。参照一下,CD 级 44.1 kHz / 16-bit / 立体声约是 1411 kbps,压到 8 kbps,信息量只剩零头。

评测结论:在语音、音乐、环境音等多个域上都显著优于同期竞品编解码算法。最难得的是这一切来自同一个模型——没有为某个域单独调参。这让 DAC 成为通用音频生成建模的友好底座:研究者拿到一个 DAC,就能用一套 token 覆盖语音、音乐、音效三种模态。

四、历史地位:开源、可复现、敢给全套消融#

DAC 提供了开源代码和训练好的权重,这在一众”只给效果不给工具”的编解码器里相当加分。它在 SoundStream/EnCodec 开创的”通用神经编解码器”路线上,把压缩率和通用性都推到了一个新台阶;后来的许多音频生成工作(尤其是音乐和音效侧)直接把 DAC 当默认 tokenizer 用。论文摘要里那句”希望我们的工作能为下一代高保真音频建模打地基”,基本是兑现了。

收尾:我的一点看法#

DAC 是我见过把”工程诚意”拉满的论文之一:90 倍压缩、单模型通用、全套消融、代码权重开源,每一条都在降低别人复现的门槛。它对”码本利用率”和”周期信号建模”的改进,正是前代 RVQ 路线最容易翻车的两处软肋,补得很准。

当然它也不是终点。8 kbps 对 44.1 kHz 来说已经非常激进,但实时对话、直播这类场景更看重低延迟和低码率的平衡,而更高采样率(48 kHz+)的场景 DAC 也需要适配——这些后来由 Mimi、WavTokenizer 等接棒。另外,作为 GAN 路线,它继承了”训练不稳定”的老毛病;评测以主观听感为主,客观指标仍需谨慎横比。还有一点要注明:论文的核心技术细节(如因子化编码的具体实现)在不同版本里表述有差异,引用具体机制时建议以 v2 版正文为准(⚠️)。


附:核心数据速查#

基本盘

项目数值
论文High-Fidelity Audio Compression with Improved RVQGAN
arXiv / 时间2306.06546(2023.06 提交;v2 2023.10)
荣誉NeurIPS 2023 spotlight
机构Descript
架构改进 RVQGAN(因子化编码 + 分组量化 + 周期归纳偏置)
采样率 / 码率44.1 kHz @ 8 kbps
压缩率约 90×

核心创新

创新要点
因子化编码码本大小与潜在维度解耦,大幅降低码本参数量
分组量化维度组独立量化,提高码本利用率与信息密度
周期归纳偏置周期性激活建模基频,擅长语音/乐器等周期信号
全套消融每个设计选择均有对照实验支撑

关键成绩

  • 约 90× 压缩(44.1 kHz → 8 kbps)
  • 单模型通吃语音/音乐/环境音,显著优于同期竞品
  • NeurIPS 2023 spotlight;代码与权重开源

关键概念清单

  • RVQGAN = 基于 GAN 的残差向量量化生成器(图像域 VQGAN 的音频改造)
  • factorized codes = 因子化编码(维度分组解耦,降码本参数量)
  • group quantization = 分组量化
  • periodic inductive bias = 周期归纳偏置(建模有基频的周期信号)
  • codebook = 码本(离散向量查找表)
  • codebook utilization = 码本利用率(码本被用到的比例)
  • ablation study = 消融实验(逐个去掉设计验证其必要性)
  • spotlight = 会议亮点报告(NeurIPS 中优于普通 poster 的档次)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[编解码器] DAC:一码通吃三声
https://mizuki-eaf.pages.dev/posts/音频生成模型/编解码器-dac一码通吃三声/
作者
无名之子
发布于
2026-07-20
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录