mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2419 字
7 分钟
[语音多模态] Mini-Omni:小身板大对话
2026-07-24

Mini-Omni 论文解读:0.5B 的小身板,让开源社区先用上”语音对话”#

论文:Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming(arXiv<2408>.16725) 作者/机构:Zhifei Xie、Changqiao Wu / 清华大学

2024 年 8 月,GPT-4o 展示的实时语音对话还像个”仅供参观”的传说,开源社区连个能照抄的现成方案都没有。清华的 Mini-Omni 就是这个空档的产物:一个参数只有 0.5B 的小模型,却是业界第一个完全端到端、开源、支持流式语音输入输出的实时语音交互模型。它不需要额外的 ASR 和 TTS,把”语音进、语音出”塞进了一个语言模型里,还给这套能力起了个野心勃勃的名字——“Any Model Can Talk”,任何模型都能开口说话。


一、开源模型为什么做不了实时语音#

当时给语言模型加语音能力只有两条路,各有各的死穴:

  • 级联路线(cascade):LLM 生成文字,再接一个 TTS 念出来。中间隔着整段文本生成时间,延迟无法忍受;
  • 端到端路线:像 SpeechGPT 那样模型直接吐音频 token,但它仍要求先生成完整文本、再生成音频,实时性同样没解决。

两条路的共同问题是:文字和音频的顺序是”先文本后音频”,用户必须等文本全部生成完才能听到声音。Mini-Omni 要解决的就是”不等文本生成完,声音就能开始出”。

二、架构:Qwen2-0.5B + Whisper 耳朵 + SNAC 嗓子#

Mini-Omni 的底座是 Qwen2-0.5B(24 层 Transformer,隐层 896 维),保留它原有的语言推理能力。语音进来先过一个 Whisper-small 的语音编码器(对,就是 OpenAI 的 Whisper,借来当耳朵),把波形转成连续特征,再用两层 MLP把音频特征和文本特征对齐,喂给语言模型。

输出侧采用 SNAC 编解码器做离散音频 token。为什么输出一定要离散?因为语言模型只会”预测下一个 token”,把声音也 token 化,才能复用语言模型的老本行——next token prediction(预测下一个 token)。输入连续、输出离散,整个训练就走回了语言模型熟悉的范式。

三、文本指导语音生成:让文本给语音”带路”#

这是论文的核心贡献,叫文本指导的语音生成(text-instructed speech generation),本质是”文本领先、音频跟随”的并行解码:

  • 文本流比音频流领先 N 步生成:在第 t 步,模型同时预测第 t+N 位的文本 token 和第 t 位的音频 token;
  • 音频 token 在第 t 步生成时,前方的文本已经”想”到了 t+N,等于给音频提供了未来语义上下文
  • N 是可调旋钮:N 越大,音频拿到的文本上下文越足、质量越好,代价是延迟略增。

这样一来,用户几乎立刻就能听到声音,又不会丢掉语言模型的推理质量——质量靠”提前跑的文本流”兜底,延迟靠”音频不等文本”压下来。思路和 Moshi 的 Inner Monologue 异曲同工,但 Moshi 是 Kyutai 同期独立搞出来的,两边互相不知道。

四、批量并行解码:一次前向,出 K 个 token#

光有”文本领跑”还不够——每生成一个音频 token 都要跑一次前向,太慢。Mini-Omni 用**批量并行解码(batch-parallel decoding)**提速:在一次前向里,用 K 个独立的预测头,基于同一个 LLM 隐状态,同时预测 K 个连续的音频 token。这相当于把一次前向的产出翻了 K 倍,推理速度大幅提升,和文本侧 Medusa 解码的思路很像。

质量会不会崩?不会——因为整个批次都被”领先的文本流”这个强条件约束着,语义已经定死了,并行出的几个音频 token 翻不了天。

五、Any Model Can Talk:三阶段训练法#

Mini-Omni 把训练方法抽象成了一套可迁移的三阶段流程,名字就叫 “Any Model Can Talk”,意思是任何现成语言模型(LLaMA、Vicuna、Baichuan 都行)都能用这套流程加上”听说”能力:

  1. 模态扩展(modality expansion):给语言模型接上语音编码和音频解码模块,用语音-文本配对数据打通新模态;
  2. 模态适配训练(modality adaptation):让模型习惯在语音输入下做推理;
  3. 整体微调(holistic fine-tuning):端到端联合训练文本与音频输出,强化”边说边想”的流式能力。

论文特别强调,这套流程只需要增加少量参数和分阶段训练,就能在尽量保留原模型语言能力的前提下加上语音交互。训练数据用了 8000 小时语音和 Open-Orca 的 200 万条文本样本,规模小得”抠门”,但效果验证了方法的通用性。

六、VoiceAssistant-400K 与评测#

为了把模型调成合格的”语音助手”,作者构造了 VoiceAssistant-400K 数据集:40 万条面向语音输出优化的指令数据,专门做语音助手的微调。这是该方向较早的开源中文数据资产,后续很多语音模型都参考过。

评测方面,Mini-Omni 在 LibriSpeech test-clean 上语音识别 WER 约 4.5%,紧咬 Whisper-small 的 3.4%(⚠️ 该数字出自第三方复现口径,论文正文未逐项列出);语音问答与多模态对话能力则在公开演示中展示了”同时出文本和语音”的实时效果。作为 0.5B 模型,它证明的是”路走得通”,而不是”性能碾压”。

收尾:我的一点看法#

Mini-Omni 的珍贵在于”时点”和”成本”。它出现在 GPT-4o 演示之后、各家闭源语音大模型开源之前,用 0.5B 参数和小规模开源数据,把”语音进语音出 + 流式 + 端到端”这条技术路线完整跑通并开源,等于给整个学界发了一张免费地图。后来的 Mini-Omni 2(加打断识别)、以及一批借鉴其思路的语音模型,都踩在它画出来的这条路上。

技术上我最服的是那个”文本领先 N 步”的巧劲。它说明实时语音对话未必非要硬端到端到底,让语言模型保留一条文本”前哨”反而又稳又快——这个思想后来在多个模型里以不同形态反复出现,是真正的”模式识别”级贡献。

短板也很好理解:0.5B 底座决定了它的知识量、复杂推理都有限,距离商用级对话助手还差很远;批量并行解码以损失部分语义一致性为代价换速度,长对话里偶发”前言不搭后语”也在意料之中。但作为”开源实时语音对话第一枪”,它打得很响。


附:核心数据速查#

基本盘

项目数值
模型规模Qwen2-0.5B(24 层、隐层 896)+ 语音模块
架构语音输入(Whisper-small + 2 层 MLP)→ LLM → 离散音频 token 输出(SNAC)
时间线2024.08.29 arXiv 提交(v1);2024.08 发布开源
训练数据约 8000 小时语音 + Open-Orca 约 200 万文本条
专用数据集VoiceAssistant-400K(40 万条语音助手数据)
定位首个完全端到端、开源的实时语音交互模型

核心创新

创新要点
文本指导语音生成文本流领先 N 步,音频流边听文本边生成,质量与延迟兼得
批量并行解码K 个预测头共享隐状态,一次前向生成 K 个音频 token
Any Model Can Talk三阶段(模态扩展→适配→整体微调)可迁移到任意语言模型
VoiceAssistant-400K开源语音助手微调数据集

关键成绩

  • 业界首个开源 + 完全端到端 + 实时流式语音交互模型
  • 不需要额外 ASR / TTS 系统
  • 支持同时生成文本与音频(“边想边说”)
  • LibriSpeech test-clean WER 约 4.5% ⚠️(第三方口径,紧咬 Whisper-small 3.4%)

关键概念清单

  • end-to-end = 端到端,语音直接进、语音直接出
  • streaming = 流式,边生成边输出
  • SNAC = 多层码本神经音频编解码器
  • text-instructed speech generation = 文本指导的语音生成
  • batch-parallel decoding = 批量并行解码
  • Any Model Can Talk = “任何模型都能说话”三阶段训练法
  • modality expansion / adaptation / holistic fine-tuning = 模态扩展 / 适配 / 整体微调
  • WER = Word Error Rate,词错误率
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[语音多模态] Mini-Omni:小身板大对话
https://mizuki-eaf.pages.dev/posts/音频生成模型/语音多模态-mini-omni小身板大对话/
作者
无名之子
发布于
2026-07-24
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录