mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2423 字
7 分钟
[语音多模态] GLM-4-Voice:9B 带情绪说话
2026-07-21

GLM-4-Voice 论文解读:175 bps 的”声音词表”,9B 模型带情绪开口说话#

论文:GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot(arXiv<2412>.02612) 作者/机构:Aohan Zeng、Zhengxiao Du、Mingdao Liu 等 / 智谱 AI 与清华大学(THUDM)

2024 年 10 月,智谱开源了 GLM-4-Voice:一个端到端的语音聊天机器人,能听能说、支持中英双语、实时语音对话,而且能按照你的指令变换情感、语调、语速甚至方言——用东北腔说笑话、用播音腔念新闻,都行。论文在 2024.12.03 提交。它最狠的一招藏在底层:一个比特率只有 175 bps 的超低码率语音 tokenizer,单码本、12.5 Hz 帧率,把”声音的词汇表”压到极致,再让 GLM-4-9B 在这张极简词表上学说话。


一、背景:语音聊天机器人的两条路#

当时做语音对话模型有两条主流路线。一条是 Moshi、Mini-Omni 式的多码本音频 token路线:用残差向量量化(RVQ)把声音压成好几层 token,信息量足,但模型要花力气预测多个码本,训练和推理都重。另一条是级联:ASR 转文字、文字模型答、TTS 念出来,快是快,但情绪、语气这些”怎么说”的信息在转文字时丢光了。

GLM-4-Voice 想走一条新路:把语音 token 压到极简,让”语音语言建模”本身变成主战场。它不追求把声音的所有细节都编码进 token,而是只保留”够用”的信息——反正还有声学信息从别处补。代价换来的收益是:token 率低、模型学得动、情感控制这些副语言信息反而成了显式可控的一等公民。

二、175 bps 的极致压缩:单码本 tokenizer#

GLM-4-Voice 的核心创新是一个超低码率、单码本(single-codebook)的语音 tokenizer,帧率 12.5 Hz、比特率 175 bps——比 Moshi 的 Mimi(1.1 kbps)还低一个数量级,是当时已知最低的语音 token 率之一。

怎么做到这么低?关键在来源:它不是从零训的音频编解码器,而是从 ASR 模型”切”出来的。作者在自动语音识别(ASR)模型的编码器里加了一个向量量化瓶颈(vector-quantized bottleneck),把编码器输出的连续特征强制压成一个量化 token。ASR 编码器天生就是为”听懂语义”训练的,所以它挤出来的 token 携带的是稠密的语义信息——语言模型最需要的那种。至于音色、音质等声学细节,交给生成阶段的声码器/解码器去补。

这个设计的精妙之处在于”降维”:既然语音 LM 的难点是”让模型在 token 序列上做语言建模”,那就把 token 流压到接近文字 token 的密度和语义纯度,让语音建模直接复用文本建模的成功经验。而 12.5 Hz 的帧率(每 80 毫秒一个 token,和 Mimi 一个节奏)又保证了流式生成的实时性潜力。

三、从 GLM-4-9B 继续预训练:1 万亿 token 的”语音学英语”#

拿到极简 tokenizer 之后,GLM-4-Voice 做了一件很聪明的”知识迁移”:直接拿现成的文本大模型 GLM-4-9B 当底座,继续预训练。但难点是——文本预训练语料里没有”语音”。怎么把文本知识搬进语音模态?

作者的解法是用一个文本到 token(text-to-token)模型,把已有的海量文本预训练语料合成成语音-文本交错数据:一段文字,旁边配一段它对应的语音 token。这样等于把整个文本知识库”翻译”成了带语音的训练信号,语音模态就能从文本知识里借力,而不是从零学。

整个继续预训练分三类数据混着来:无监督语音数据交错的语音-文本数据有监督的语音-文本数据,总计 1 万亿 token。这个量级意味着模型在”语音语言建模”和”口语问答”两个任务上直接刷到了 SOTA。

四、情感与韵律控制:副语言信息变成指令#

普通 TTS 的”情感”靠固定模板或额外控制网络,GLM-4-Voice 则把情感、语调、语速、方言这些**副语言信息(paralinguistic information)**直接交给指令控制:用户说”用开心的语气回答”,模型就在语音 token 生成阶段带上对应的韵律特征。

这也是 175 bps 极简 tokenizer 带来的红利——token 流足够干净,情感和韵律的变化主要落在低频的语义-韵律耦合结构上,模型更容易在端到端训练里”学会”把指令翻译成语调。论文在主观评测里验证了这一点:按指令变换情感、语速和方言的能力显著强于同期基线。

预训练之后,作者再用高质量对话语音数据做微调(SFT),把模型调成真正会”聊天”的语音助手。最终开源的 glm-4-voice-9b 在对话能力和语音质量上双双超过当时的开源基线。

五、评测:两线 SOTA#

评测分两条线。一是语音语言建模:在纯语音 token 序列的困惑度类指标上,GLM-4-Voice 的 1 万亿 token 继续预训练把它推到了开源最前面;二是口语问答(spoken question answering):只靠语音进、语音出,不做 ASR 转写,回答质量也刷到了 SOTA。这也正是它和”TTS 套壳”模型的本质区别——它真的在语音模态上做推理,而不是转成文字再答。

收尾:我的一点看法#

GLM-4-Voice 最有意思的地方,是它没有卷”多码本堆信息量”这条赛道,反而反着来:把 token 压到 175 bps 的极限,然后用语义极纯的 token 流,让 9B 的 GLM-4 能”用声音思考”。这个”减法”思路和 DeepSeek 砍 KV cache、砍 critic 的哲学异曲同工——先想清楚哪个部件其实是负担,再动手拆。

我还很喜欢”从 ASR 切 tokenizer”这个务实操作。与其花大力气训练一个完美的神经编解码器,不如从已经练好的 ASR 编码器里白嫖一个语义瓶颈。这种”复用已有资产”的思路,对资源有限的团队是教科书级的示范。

当然也要泼冷水:175 bps 的极致压缩是一把双刃剑,音色相似度、环境声细节这类声学信息注定是弱项,跟 Mimi、DAC 那种高保真编解码器比音质是吃亏的;12.5 Hz 帧率意味着流式实时能力在架构上是可行的,但论文并未给出像 Moshi 那样明确的实测延迟数据(⚠️ 未在论文中找到首包延迟数值,市面流传的延迟数字多来自第三方)。另外情感控制的客观评测(如可辨识度、自然度打分)披露有限,很多结论依赖主观试听。


附:核心数据速查#

基本盘

项目数值
模型规模GLM-4-9B 底座
语音 tokenizer超低码率单码本:12.5 Hz / 175 bps
数据无监督语音 + 交错语音-文本 + 有监督语音-文本,共 1 万亿 token
语言中文 + 英文
时间线2024.10 模型开源;2024.12.03 论文提交
能力实时语音对话、情感/语调/语速/方言指令控制

核心创新

创新要点
175 bps 单码本 tokenizer从 ASR 编码器加向量量化瓶颈派生,语义极纯
文本到 token 数据合成用 text-to-token 模型把文本语料合成语音-文本交错数据,迁移知识
文本大模型继续预训练从 GLM-4-9B 出发,1 万亿 token 语音继续预训练
副语言信息指令化情感/语速/方言作为显式指令控制

关键成绩

  • 语音语言建模与口语问答双双 SOTA(开源)
  • 支持中英双语、实时语音对话
  • 指令级情感、语速、方言控制,主观评测优于同期基线
  • 超低码率 tokenizer 使语音建模逼近文本建模效率

关键概念清单

  • bps = bits per second,每秒比特数(码率)
  • single-codebook = 单码本(对比 RVQ 多码本)
  • vector-quantized bottleneck = 向量量化瓶颈
  • text-to-token model = 文本到语音 token 的合成模型
  • paralinguistic information = 副语言信息(情感、韵律、语气等)
  • interleaved data = 交错数据(语音与文本交替)
  • SFT = Supervised Fine-Tuning,监督微调
  • spoken question answering = 口语问答
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[语音多模态] GLM-4-Voice:9B 带情绪说话
https://mizuki-eaf.pages.dev/posts/音频生成模型/语音多模态-glm-4-voice9b-带情绪说话/
作者
无名之子
发布于
2026-07-21
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录