中文开源 TTS 群像:GPT-SoVITS、ChatTTS、Fish Speech——开源”第二引擎”三巨头
说明:本篇无单一论文可引,基于 GitHub 仓库与官方资料整理(GPT-SoVITS:RVC-Boss/GPT-SoVITS;ChatTTS:2noise/ChatTTS;Fish Speech:fishaudio/fish-speech) 作者/机构:RVC-Boss(独立开发者社区)、2noise(开源组织)、fishaudio 鱼音科技
在 VALL-E、CosyVoice 这些有论文的正规军之外,中文开源 TTS 还有一条更野、更有生命力的暗线——一群不靠论文吃饭的项目,靠 GitHub 和社区口碑杀出了一条血路。GPT-SoVITS 是”中文社区现象级爆款”,5 秒零样本克隆 + 1 分钟微调,GitHub 攒下约 5.9 万颗星;ChatTTS 是”会笑会喘气的对话 TTS”,专门给聊天机器人配一张带语气的中文嘴;Fish Speech 则一路从多语开源工具做到 2026 年的千万小时级旗舰 S2,把中文 TTS 的评测纪录刷了一遍。这三个项目合起来,正好讲清楚一件事:为什么说开源与中文社区成了全球音频生成的第二引擎。
一、GPT-SoVITS:中文社区的”现象级爆款”
2024 年 1 月 14 日,RVC-Boss 在 GitHub 创建了 GPT-SoVITS 仓库,此后它就一路火成了中文 TTS 圈的图腾。名字里藏了它的架构:GPT 部分负责语音生成(自回归结构,跟 SoundStorm 的思路类似),SoVITS 部分负责音色转换(VITS 架构),再配上参考编码器提取参考音频特征、BigVGAN 声码器出波形,中文文本前端用 PaddleSpeech 和 g2pW 搞定。这套”GPT 定内容 + SoVITS 换音色”的组合,效果出奇地稳。
它的使用门槛低到离谱:5 秒参考语音就能零样本克隆,想要更还原,录 1 分钟数据微调即可,而且支持跨语种——你用中文训练,让它说日语、韩语、英语、粤语都行,推理语言可以和训练语言完全不同。预训练数据从第一版的 2000 小时扩到 V2 的 5000 小时,V4 已经原生输出 48kHz 音频。参数量方面,社区普遍的说法是整个模型约 167M(⚠️ 该数字为社区整理口径,官方未在仓库统一公示),配合 MIT 开源协议和开箱即用的 WebUI,它成了 B 站、抖音上无数”声音分身”视频的幕后功臣,GitHub 星标约 5.9 万。优点和风险一样突出——克隆太容易,也让声音伪造的门槛史无前例地低。
二、ChatTTS:会笑、会喘气、会停顿的对话 TTS
2024 年 5 月左右出圈的 ChatTTS,来自 2noise 开源组织(核心维护者包括源文雨 fumiama)。它的定位非常精准:面向日常对话(daily dialogue)的生成式语音模型——不是给有声书念稿子,而是给 LLM 助手、聊天机器人一张会说人话的嘴。
它最出名的本事是气口和笑声自然:模型支持 [laugh](笑声)、[uv_break](停顿)、[lbreak](长停顿)这类 token 级韵律控制,合成出来的语音会”嗯、啊、笑、喘气”,一听就是真人在聊天的节奏,而不是播音腔念课文。技术上它是自回归路线(和 bark、XTTSv2、VALL-E 一类),音频 tokenizer 用组向量量化(GVQ,grouped vector quantization,灵感来自 fish-speech),声码器用预训练的 Vocos。
数据上,主模型用了10 万小时以上的中英文音频训练,开源出来的版本是 4 万小时的预训练模型(未带 SFT)。支持多说话人、随机采样音色,还提供 OpenAI 兼容 API,4090 上跑 RTF 约 0.3,4GB 显存就能出声。它在 B 站上成了”AI 陪聊”的标配声线。许可证要提一句:代码 AGPLv3+,但模型权重是 CC BY-NC 4.0,仅限学术研究、禁止商用——这也是它跟”开源”二字之间最微妙的一层纱。
三、Fish Speech:从开源多语工具到千万小时旗舰
2024 年 10 月开源的 Fish Speech,是这三家里”卷得最凶”的。V1.x 时代它已经是开源多语 TTS 里的好手,V1.5 在英文评测上拿到 WER 3.5%、TTS Arena(语音竞技场)ELO 评分 1339,在当时开源圈属于第一梯队。
真正让它封神的是 2026 年 3 月的 Fish Speech S2。S2 换了全新的双自回归(DualAR)架构:一个 **Slow AR(4B 参数)**专门生成时间轴上的主码本,管整体内容节奏;一个 Fast AR(0.4B 参数)负责补全残差码本,管细节音质。主从配合,配合 RVQ 编解码器(10 个码本,约 21Hz 的 token 率),生成质量和速度两头都要。训练数据直接拉满到千万小时级别(1000 万+小时)、覆盖 80+ 语种,还用 GRPO + 强化学习做了后训练对齐。
成绩单非常硬:在 Seed-TTS Eval 评测中,中文 WER 0.54%、英文 WER 0.99%,两项都是所有对比模型(含闭源)里的最佳。它还支持 1.5 万多种自然语言标签控制(比如 [whisper] 耳语、[excited] 兴奋),10–30 秒参考音频就能快速克隆,流式推理 RTF 低至 0.195。中文 TTS 的天花板,在 Fish Speech S2 这里被顶到了一个新高度。
四、三家的共同启示
把这三个项目放在一起看,能总结出中文开源 TTS 的共性打法:
- 重产品、轻论文:没有 arXiv 编号,但 WebUI、API、一键部署、中文文档样样齐全——它们是”给用户用”的工具,不是”给审稿人看”的文章;
- 低门槛是生命线:5 秒克隆、1 分钟微调、4GB 显存可跑、半小时出活,每个门槛的降低都在指数级放大用户基数;
- 中文语境是主场:拼音、儿化音、气口、笑声、方言,这些”中文的讲究”恰恰是国外模型最容易翻车的地方,本土项目天然占优;
- 能力跃迁同样凶猛:从 GPT-SoVITS 的 167M 到 Fish Speech S2 的 4.4B,两年时间中文开源 TTS 完成了两个数量级的跨越。
收尾:我的一点看法
我私心认为,中文开源 TTS 比很多有论文的模型更值得被写进发展史,因为它们是”工程民主化”最生动的样本。论文决定技术的上限,而这些项目决定技术的下限——**当一个普通学生用一张显卡、五分钟就能让 AI 用自己喜欢的声音说话时,这个领域才算真正进入了大众时代。**GPT-SoVITS 的爆火、ChatTTS 的陪聊、Fish Speech 的评测纪录,都在反复证明这一点。
但三家的处境也暴露了开源 TTS 的三重隐忧。一是版权:训练数据(哪怕标榜”公开”)的授权问题普遍悬而未决,ChatTTS 直接选择禁商;二是安全:克隆技术越成熟,声音诈骗越猖獗,项目方普遍缺乏配套防护;三是可持续:爆款项目依赖个人热情或小团队的”用爱发电”,维护节奏往往不稳定。另外,GitHub 星标数、ELO 分这类”社区热度指标”容易随炒作波动,Fish Speech S2 的 WER 0.54%/0.99% 是 Seed-TTS Eval 单评测集口径,别跨基准瞎比。
最后想说一句公道话:**开源社区的功劳簿上,应该有这些没有论文的项目一页。**他们用最接地气的方式,让”每个人都能拥有自己想要的声音”这件事变成了现实——而这,恰恰是 VALL-E 们写在论文里、却由它们真正兑现的理想。
附:核心数据速查
项目概览(本篇无统一”基本盘”,改用逐项目表)
| 项目 | 发布时间 | 维护方 | 定位 | 参数量 |
|---|---|---|---|---|
| GPT-SoVITS | 2024.01 | RVC-Boss | 零样本/少样本中文语音克隆 | 约 167M(⚠️ 社区口径) |
| ChatTTS | 2024.05 | 2noise | 对话场景中文 TTS | 未公开(⚠️) |
| Fish Speech | 2024.10(S2:2026.03) | fishaudio 鱼音科技 | 开源多语/旗舰多语 TTS | S2:Slow AR 4B + Fast AR 0.4B |
核心创新
| 项目 | 创新 |
|---|---|
| GPT-SoVITS | GPT 自回归生成 + SoVITS 音色转换双引擎;5 秒零样本 / 1 分钟微调;跨语种 |
| ChatTTS | 对话场景设计;气口/笑声/停顿 token 控制;GVQ tokenizer + Vocos 声码器 |
| Fish Speech S2 | DualAR 双自回归(4B+0.4B);GRPO+RL 后训练;1.5 万+自然语言标签控制 |
关键成绩
- GPT-SoVITS:GitHub 约 5.9 万★;支持中英日韩粤,V4 原生 48kHz
- ChatTTS:主模型 10 万+小时数据(开源版 4 万小时);B 站现象级”AI 陪聊”声线
- Fish Speech V1.5:英文 WER 3.5%;TTS Arena ELO 1339
- Fish Speech S2:Seed-TTS Eval 中文 WER 0.54%、英文 0.99%(均为所有对比模型最佳);千万小时 / 80+ 语种;流式 RTF 0.195
- 三个项目均开源(⚠️ ChatTTS 模型权重为 CC BY-NC 4.0,禁止商用)
关键概念清单
- zero-shot / few-shot = 零样本 / 少样本(短参考音频即可克隆)
- WebUI = 图形化操作界面
- SoundStorm = 并行的语音 token 生成模型(GPT-SoVITS 的 GPT 部分类似思路)
- VITS = 变分推理 TTS 架构(SoVITS 的音色转换部分基于此)
- BigVGAN = 高质量 GAN 声码器
- GVQ = Grouped Vector Quantization,组向量量化
- Vocos = 轻量神经声码器
- WER = Word Error Rate,词错误率
- CER = Character Error Rate,字符错误率
- ELO = 竞技场排名分(TTS Arena 用)
- TTS Arena = 社区众包语音评测竞技场
- DualAR = Dual-Autoregressive,双自回归(Slow AR 管内容 + Fast AR 管细节)
- RVQ = Residual Vector Quantization,残差向量量化
- GRPO = Group Relative Policy Optimization,组相对策略优化
- Seed-TTS Eval = 语音合成评测基准
- RTF = Real-Time Factor,实时因子
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





