mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4066 字
11 分钟
GLM-4-Voice:端到端才正解
2026-07-22

GLM-4-Voice 论文解读:语音交互不该是”拼凑”出来的,端到端才是正解#

GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot 作者:智谱AI(Zhipu AI)

你有没有想过,为什么你跟Siri说话总觉得”隔了一层”?因为传统语音助手是三个系统拼起来的:先把你说的话转成文字(ASR),再让语言模型理解生成回复(LLM),最后把文字转成语音念给你听(TTS)。这就像翻译接力赛——每一棒都会丢信息,每一棒都会加延迟。GLM-4-Voice说:别拼了,一个模型全搞定。语音进,语音出,中间不经过文字这个”中间商”。

一、先搞清楚:传统语音交互到底差在哪#

在聊GLM-4-Voice之前,我们得先理解它要革谁的命。

传统的语音对话系统是一个级联架构(Cascaded Pipeline)

语音 → ASR(语音识别)→ 文本 → LLM(语言模型)→ 文本 → TTS(语音合成)→ 语音

这个架构用了十几年了,从Siri到小爱同学,底层逻辑都是这一套。它能用,但问题很多:

第一,信息损耗。 你说话时的语气、情绪、犹豫、重音——这些在ASR转文字的瞬间就丢了。ASR只关心”你说了什么字”,不关心”你怎么说的”。然后LLM基于纯文本生成回复,TTS再用一个”默认情绪”念出来。你的愤怒、你的急切、你的讽刺,全没了。

第二,延迟叠加。 三个模块串行执行,每个模块都有自己的处理时间。ASR要等一句话说完才能转写,LLM要等文本完整才能推理,TTS要等文本生成才能合成。三层延迟一叠加,你跟AI对话就像打越洋电话——你说完,等两秒,它才开始回。

第三,错误传播。 ASR识别错了,LLM就基于错误文本推理;LLM生成了奇怪的句子,TTS就忠实地把奇怪的句子念出来。一个环节出错,后面全跟着错。

GPT-4o在2024年5月展示了端到端语音交互的可能性——语音直接进,语音直接出,延迟极低,还能感知情绪。这给整个行业立了一个标杆。

GLM-4-Voice,就是智谱对这个标杆的回应。

二、端到端到底”端”在哪里#

GLM-4-Voice的核心主张是:不再把语音交互拆成三个独立任务,而是用一个统一的模型直接处理语音。

它的架构由三个组件构成,但注意——这三个组件不是三个独立系统,而是一个统一模型内部的三个功能模块

  1. 语音分词器(Speech Tokenizer):把连续的语音波形编码为离散的token序列
  2. 语音语言模型(Speech Language Model):9B参数的核心模型,理解语音token并生成回复
  3. 语音解码器(Speech Decoder):把生成的语音token还原为连续的语音波形

关键区别在哪?传统方案里,ASR、LLM、TTS是三个独立训练、独立部署的系统,中间用文本做”胶水”。而GLM-4-Voice里,这三个组件是联合设计、统一训练的,中间传递的不是文本,而是语音token——一种保留了语音特征的离散表示。

这意味着什么?意味着模型从输入到输出,始终在”语音空间”里思考。你的语气、情绪、语速,不会在中间某个环节被”翻译”掉。

三、语音分词器:把声音变成”文字”的艺术#

**语音分词器(Speech Tokenizer)**是整个系统的基石。它决定了模型能”听到”多少信息。

GLM-4-Voice的分词器基于Whisper编码器改进。Whisper是OpenAI开源的语音识别模型,它的编码器本来是用来提取语音特征的。智谱在这个基础上加了一层向量量化(Vector Quantization, VQ),把连续的特征向量映射到离散的码本(Codebook)上。

最终效果:

  • 帧率:12.5Hz——也就是每秒生成12.5个token
  • 码率:约175bps——极低的比特率,但保留了足够的语义信息
  • 单码本设计——只用一个码本,不像某些方案用多层码本叠加

12.5Hz是什么概念?正常语速下,一个人每秒大约说3-5个字。12.5个token/秒意味着每个字大约对应2-4个token,足以编码发音细节。

更聪明的是训练方式。这个分词器不是纯无监督训练的——智谱用了带文本标注的ASR数据做有监督训练。这保证了语音token里确实编码了语义信息,而不只是声学特征。

所以这个分词器编码的不只是”声音长什么样”,还有”说的是什么意思”。语义、语速、音高、情绪——全都压缩进了每秒12.5个离散token里。

四、9B语言模型:在语音token上”思考”#

核心模型是一个9B参数的语言模型,底座是GLM-4-9B

智谱在GLM-4-9B的基础上做了语音模态的继续预训练(Continual Pre-training)。简单说就是:这个模型本来已经是一个很强大的文本语言模型了,现在让它”学会听”和”学会说”。

训练数据规模约1万亿token,包括:

  • 无监督语音数据:大量纯语音,让模型学习语音的自然分布
  • 合成语音-文本交错数据:语音和文本交替出现,让模型建立两种模态的对应关系
  • 监督对齐数据:高质量的语音对话数据,让模型学会”好好说话”

这里有一个很精妙的设计:模型在生成回复时,会交替输出文本token和语音token。

为什么要这样?因为纯语音token生成容易”跑偏”——没有文本的语义约束,模型可能说着说着就不知道自己在说什么了。文本token充当了”思维锚点”,保证回复的逻辑质量和信息准确性;语音token则负责自然表达,让输出听起来像人话而不是机器朗读。

这就像一个人边想边说——脑子里组织语言(文本token),嘴巴同步表达(语音token)。

五、语音解码器:让token重新变成”人话”#

**语音解码器(Speech Decoder)**负责把模型生成的语音token还原为连续的语音波形。

这个组件基于CosyVoice的**流匹配(Flow Matching)**架构重新训练。Flow Matching是一种生成模型技术,相比传统的扩散模型(Diffusion),它在生成质量和速度之间取得了更好的平衡。

几个关键特性:

  • 流式输出(Streaming):不需要等所有token生成完才开始合成。最少只需要10个语音token就能开始输出音频。这意味着用户几乎不用等——模型还在”想”后面的内容,前面的话已经说出来了。
  • 首包延迟低至3秒:从你问完到听到第一个字,最快3秒。
  • 可控属性:情绪、音调、语速、方言风格——都可以通过指令调节。

六、细粒度控制:不只是”能说话”,还要”会说话”#

GLM-4-Voice最让我觉得有意思的特性是它的细粒度语音控制能力

传统TTS能做什么?最多让你选个”男声/女声”,调个语速快慢。完事了。

GLM-4-Voice能做到:

  • 情感控制:你可以让它”开心地说”、“严肃地说”、“温柔地说”。不是简单的音调升降,而是真正的情感表达。
  • 语速控制:不是机械的加速减速,而是像人一样有快有慢、有停顿有连贯。
  • 方言支持:支持多种方言风格的输出。
  • 实时打断:你可以在它说话的时候打断它,它能即时停下来响应你。

这些能力是怎么来的?因为端到端架构让模型在训练时就”见过”各种情感、语速、方言的语音数据。它不是靠后期规则去”调”语音,而是从骨子里就”会”这些表达方式。

七、跟GPT-4o比,到底什么水平#

说实话,GLM-4-Voice发布的时候(2024年12月),GPT-4o的语音能力已经迭代了好几轮了。正面硬刚GPT-4o,GLM-4-Voice在整体体验上肯定还有差距。

但有几个维度值得说:

第一,开源。 GLM-4-Voice是开源的。GPT-4o不是。这意味着研究者可以基于GLM-4-Voice做二次开发、做实验、做改进。对于整个语音AI社区来说,这个价值是巨大的。

第二,中文能力。 GPT-4o的语音交互在英文上很强,但中文——尤其是中文的情感表达、语气词、方言——一直是短板。GLM-4-Voice在中文语音交互上的体验,大概率是优于GPT-4o的。

第三,架构先进性。 端到端的设计思路跟GPT-4o是一致的。在技术路线上,GLM-4-Voice没有走弯路。

第四,可控性。 细粒度的情感、语速、方言控制,这在当时的开源模型里是领先的。

论文声称在**语音语言建模和语音问答任务中达到了SOTA(State-of-the-Art)**水平。虽然没给出非常详细的评测对比表,但从社区反馈来看,GLM-4-Voice在9B这个量级的模型里,确实是很能打的。

八、为什么”端到端”是语音交互的未来#

我想花点篇幅聊聊为什么我坚信端到端是正确方向。

级联架构的本质问题不是”每个模块不够好”,而是架构本身就在制造信息瓶颈

你想想,人类对话是怎么进行的?你听到对方的声音,大脑直接理解语义+情感+意图,然后直接组织语言回应。你不会先把听到的话在脑子里”转写成文字”,再”阅读理解”,再”写作文”,再”朗读”出来。

级联架构就是在强迫AI做这种低效的”转写-阅读-写作-朗读”流程。

端到端架构让AI像人一样:声音进,理解发生,声音出。 中间没有模态转换的信息损耗,没有串行等待的延迟叠加,没有错误传播的连锁反应。

GLM-4-Voice用12.5Hz的语音token做中间表示,这个设计很克制——它没有试图保留所有声学细节(那会导致token序列太长、模型处理不过来),而是找到了一个”够用”的压缩率。175bps的码率,比打电话的编码还低,但足以让模型理解语义和情感。

收尾:我的一点看法#

GLM-4-Voice这篇论文,我觉得最大的价值不在于它”超越了谁”,而在于它验证了一条技术路线的可行性

在2024年底,端到端语音交互还是一个”看起来很美但做起来很难”的方向。GPT-4o证明了上限,但它是闭源的,别人看不到里面怎么做的。GLM-4-Voice用一个开源的9B模型,把端到端语音交互的完整pipeline跑通了——从tokenizer到语言模型到decoder,全部公开。这对后续研究者来说是巨大的加速。

9B的参数量也是一个很务实的选择。它大到足以支撑复杂的语音理解和生成,又小到可以在消费级GPU上部署。你不需要一个数据中心才能跑语音交互模型,一张好点的显卡就行。这大大降低了端到端语音AI的落地门槛。

当然,GLM-4-Voice也有明显的局限。3秒的首包延迟虽然比级联方案好很多,但跟人类对话的自然节奏比还是太慢了。真正自然的对话,响应应该是亚秒级的。另外,12.5Hz的token率虽然高效,但在某些极端场景下(比如快速连读、重叠语音)可能会丢失信息。

但瑕不掩瑜。GLM-4-Voice是智谱在多模态交互领域的重要布局。它跟AutoGLM(视觉操作)、GLM系列(文本推理)一起,构成了智谱”能看、能听、能说、能做”的完整能力矩阵。

语音交互的终局,一定是端到端的。GLM-4-Voice不是终局,但它是通往终局路上一个扎实的脚印。

附:核心数据速查#

指标数值
论文发布时间2024年12月
模型参数量9B
底座模型GLM-4-9B
语音token帧率12.5 Hz
语音token码率~175 bps
码本设计单码本(Single Codebook)
训练数据规模~1万亿token
首包延迟最低约3秒
流式合成最小token数10个语音token
分词器基础Whisper编码器 + 向量量化
解码器架构基于CosyVoice的Flow Matching
支持控制维度情感、语速、音调、方言
支持语言中文、英文
是否开源

关键概念清单#

术语英文含义
端到端End-to-End一个模型直接完成从输入到输出的全部处理,不拆分为多个独立系统
级联架构Cascaded Pipeline将任务拆分为ASR→LLM→TTS等多个串行模块
语音分词器Speech Tokenizer将连续语音波形编码为离散token序列的模块
向量量化Vector Quantization (VQ)将连续向量映射到离散码本的技术
码本Codebook向量量化中用于映射的离散向量集合
流匹配Flow Matching一种生成模型技术,学习从噪声到数据的连续变换流
流式输出Streaming边生成边输出,不需要等待全部生成完毕
首包延迟Time to First Token从输入结束到第一个输出token产生的时间
继续预训练Continual Pre-training在已有模型基础上用新数据继续训练以学习新能力
语音语言建模Speech Language Modeling在语音token序列上进行语言建模
细粒度控制Fine-grained Control对输出语音的情感、语速、音调等属性进行精确调节
实时打断Real-time Interruption用户可在AI说话时打断并即时获得响应
有监督训练Supervised Training使用带标签数据(如ASR文本标注)进行训练
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

GLM-4-Voice:端到端才正解
https://mizuki-eaf.pages.dev/posts/glm/glm-4-voice端到端才正解/
作者
无名之子
发布于
2026-07-22
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录