GLM-4-Voice 论文解读:175 bps 的”声音词表”,9B 模型带情绪开口说话
论文:GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot(arXiv<2412>2412>.02612) 作者/机构:Aohan Zeng、Zhengxiao Du、Mingdao Liu 等 / 智谱 AI 与清华大学(THUDM)
2024 年 10 月,智谱开源了 GLM-4-Voice:一个端到端的语音聊天机器人,能听能说、支持中英双语、实时语音对话,而且能按照你的指令变换情感、语调、语速甚至方言——用东北腔说笑话、用播音腔念新闻,都行。论文在 2024.12.03 提交。它最狠的一招藏在底层:一个比特率只有 175 bps 的超低码率语音 tokenizer,单码本、12.5 Hz 帧率,把”声音的词汇表”压到极致,再让 GLM-4-9B 在这张极简词表上学说话。
一、背景:语音聊天机器人的两条路
当时做语音对话模型有两条主流路线。一条是 Moshi、Mini-Omni 式的多码本音频 token路线:用残差向量量化(RVQ)把声音压成好几层 token,信息量足,但模型要花力气预测多个码本,训练和推理都重。另一条是级联:ASR 转文字、文字模型答、TTS 念出来,快是快,但情绪、语气这些”怎么说”的信息在转文字时丢光了。
GLM-4-Voice 想走一条新路:把语音 token 压到极简,让”语音语言建模”本身变成主战场。它不追求把声音的所有细节都编码进 token,而是只保留”够用”的信息——反正还有声学信息从别处补。代价换来的收益是:token 率低、模型学得动、情感控制这些副语言信息反而成了显式可控的一等公民。
二、175 bps 的极致压缩:单码本 tokenizer
GLM-4-Voice 的核心创新是一个超低码率、单码本(single-codebook)的语音 tokenizer,帧率 12.5 Hz、比特率 175 bps——比 Moshi 的 Mimi(1.1 kbps)还低一个数量级,是当时已知最低的语音 token 率之一。
怎么做到这么低?关键在来源:它不是从零训的音频编解码器,而是从 ASR 模型”切”出来的。作者在自动语音识别(ASR)模型的编码器里加了一个向量量化瓶颈(vector-quantized bottleneck),把编码器输出的连续特征强制压成一个量化 token。ASR 编码器天生就是为”听懂语义”训练的,所以它挤出来的 token 携带的是稠密的语义信息——语言模型最需要的那种。至于音色、音质等声学细节,交给生成阶段的声码器/解码器去补。
这个设计的精妙之处在于”降维”:既然语音 LM 的难点是”让模型在 token 序列上做语言建模”,那就把 token 流压到接近文字 token 的密度和语义纯度,让语音建模直接复用文本建模的成功经验。而 12.5 Hz 的帧率(每 80 毫秒一个 token,和 Mimi 一个节奏)又保证了流式生成的实时性潜力。
三、从 GLM-4-9B 继续预训练:1 万亿 token 的”语音学英语”
拿到极简 tokenizer 之后,GLM-4-Voice 做了一件很聪明的”知识迁移”:直接拿现成的文本大模型 GLM-4-9B 当底座,继续预训练。但难点是——文本预训练语料里没有”语音”。怎么把文本知识搬进语音模态?
作者的解法是用一个文本到 token(text-to-token)模型,把已有的海量文本预训练语料合成成语音-文本交错数据:一段文字,旁边配一段它对应的语音 token。这样等于把整个文本知识库”翻译”成了带语音的训练信号,语音模态就能从文本知识里借力,而不是从零学。
整个继续预训练分三类数据混着来:无监督语音数据、交错的语音-文本数据、有监督的语音-文本数据,总计 1 万亿 token。这个量级意味着模型在”语音语言建模”和”口语问答”两个任务上直接刷到了 SOTA。
四、情感与韵律控制:副语言信息变成指令
普通 TTS 的”情感”靠固定模板或额外控制网络,GLM-4-Voice 则把情感、语调、语速、方言这些**副语言信息(paralinguistic information)**直接交给指令控制:用户说”用开心的语气回答”,模型就在语音 token 生成阶段带上对应的韵律特征。
这也是 175 bps 极简 tokenizer 带来的红利——token 流足够干净,情感和韵律的变化主要落在低频的语义-韵律耦合结构上,模型更容易在端到端训练里”学会”把指令翻译成语调。论文在主观评测里验证了这一点:按指令变换情感、语速和方言的能力显著强于同期基线。
预训练之后,作者再用高质量对话语音数据做微调(SFT),把模型调成真正会”聊天”的语音助手。最终开源的 glm-4-voice-9b 在对话能力和语音质量上双双超过当时的开源基线。
五、评测:两线 SOTA
评测分两条线。一是语音语言建模:在纯语音 token 序列的困惑度类指标上,GLM-4-Voice 的 1 万亿 token 继续预训练把它推到了开源最前面;二是口语问答(spoken question answering):只靠语音进、语音出,不做 ASR 转写,回答质量也刷到了 SOTA。这也正是它和”TTS 套壳”模型的本质区别——它真的在语音模态上做推理,而不是转成文字再答。
收尾:我的一点看法
GLM-4-Voice 最有意思的地方,是它没有卷”多码本堆信息量”这条赛道,反而反着来:把 token 压到 175 bps 的极限,然后用语义极纯的 token 流,让 9B 的 GLM-4 能”用声音思考”。这个”减法”思路和 DeepSeek 砍 KV cache、砍 critic 的哲学异曲同工——先想清楚哪个部件其实是负担,再动手拆。
我还很喜欢”从 ASR 切 tokenizer”这个务实操作。与其花大力气训练一个完美的神经编解码器,不如从已经练好的 ASR 编码器里白嫖一个语义瓶颈。这种”复用已有资产”的思路,对资源有限的团队是教科书级的示范。
当然也要泼冷水:175 bps 的极致压缩是一把双刃剑,音色相似度、环境声细节这类声学信息注定是弱项,跟 Mimi、DAC 那种高保真编解码器比音质是吃亏的;12.5 Hz 帧率意味着流式实时能力在架构上是可行的,但论文并未给出像 Moshi 那样明确的实测延迟数据(⚠️ 未在论文中找到首包延迟数值,市面流传的延迟数字多来自第三方)。另外情感控制的客观评测(如可辨识度、自然度打分)披露有限,很多结论依赖主观试听。
附:核心数据速查
基本盘
| 项目 | 数值 |
|---|---|
| 模型规模 | GLM-4-9B 底座 |
| 语音 tokenizer | 超低码率单码本:12.5 Hz / 175 bps |
| 数据 | 无监督语音 + 交错语音-文本 + 有监督语音-文本,共 1 万亿 token |
| 语言 | 中文 + 英文 |
| 时间线 | 2024.10 模型开源;2024.12.03 论文提交 |
| 能力 | 实时语音对话、情感/语调/语速/方言指令控制 |
核心创新
| 创新 | 要点 |
|---|---|
| 175 bps 单码本 tokenizer | 从 ASR 编码器加向量量化瓶颈派生,语义极纯 |
| 文本到 token 数据合成 | 用 text-to-token 模型把文本语料合成语音-文本交错数据,迁移知识 |
| 文本大模型继续预训练 | 从 GLM-4-9B 出发,1 万亿 token 语音继续预训练 |
| 副语言信息指令化 | 情感/语速/方言作为显式指令控制 |
关键成绩
- 语音语言建模与口语问答双双 SOTA(开源)
- 支持中英双语、实时语音对话
- 指令级情感、语速、方言控制,主观评测优于同期基线
- 超低码率 tokenizer 使语音建模逼近文本建模效率
关键概念清单
- bps = bits per second,每秒比特数(码率)
- single-codebook = 单码本(对比 RVQ 多码本)
- vector-quantized bottleneck = 向量量化瓶颈
- text-to-token model = 文本到语音 token 的合成模型
- paralinguistic information = 副语言信息(情感、韵律、语气等)
- interleaved data = 交错数据(语音与文本交替)
- SFT = Supervised Fine-Tuning,监督微调
- spoken question answering = 口语问答
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





