mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2761 字
8 分钟
[TTS·声音克隆] 中文开源 TTS 群像:开源三巨头
2026-07-15

中文开源 TTS 群像:GPT-SoVITS、ChatTTS、Fish Speech——开源”第二引擎”三巨头#

说明:本篇无单一论文可引,基于 GitHub 仓库与官方资料整理(GPT-SoVITS:RVC-Boss/GPT-SoVITS;ChatTTS:2noise/ChatTTS;Fish Speech:fishaudio/fish-speech) 作者/机构:RVC-Boss(独立开发者社区)、2noise(开源组织)、fishaudio 鱼音科技

在 VALL-E、CosyVoice 这些有论文的正规军之外,中文开源 TTS 还有一条更野、更有生命力的暗线——一群不靠论文吃饭的项目,靠 GitHub 和社区口碑杀出了一条血路。GPT-SoVITS 是”中文社区现象级爆款”,5 秒零样本克隆 + 1 分钟微调,GitHub 攒下约 5.9 万颗星;ChatTTS 是”会笑会喘气的对话 TTS”,专门给聊天机器人配一张带语气的中文嘴;Fish Speech 则一路从多语开源工具做到 2026 年的千万小时级旗舰 S2,把中文 TTS 的评测纪录刷了一遍。这三个项目合起来,正好讲清楚一件事:为什么说开源与中文社区成了全球音频生成的第二引擎。


一、GPT-SoVITS:中文社区的”现象级爆款”#

2024 年 1 月 14 日,RVC-Boss 在 GitHub 创建了 GPT-SoVITS 仓库,此后它就一路火成了中文 TTS 圈的图腾。名字里藏了它的架构:GPT 部分负责语音生成(自回归结构,跟 SoundStorm 的思路类似),SoVITS 部分负责音色转换(VITS 架构),再配上参考编码器提取参考音频特征、BigVGAN 声码器出波形,中文文本前端用 PaddleSpeech 和 g2pW 搞定。这套”GPT 定内容 + SoVITS 换音色”的组合,效果出奇地稳。

它的使用门槛低到离谱:5 秒参考语音就能零样本克隆,想要更还原,录 1 分钟数据微调即可,而且支持跨语种——你用中文训练,让它说日语、韩语、英语、粤语都行,推理语言可以和训练语言完全不同。预训练数据从第一版的 2000 小时扩到 V2 的 5000 小时,V4 已经原生输出 48kHz 音频。参数量方面,社区普遍的说法是整个模型约 167M(⚠️ 该数字为社区整理口径,官方未在仓库统一公示),配合 MIT 开源协议和开箱即用的 WebUI,它成了 B 站、抖音上无数”声音分身”视频的幕后功臣,GitHub 星标约 5.9 万。优点和风险一样突出——克隆太容易,也让声音伪造的门槛史无前例地低。

二、ChatTTS:会笑、会喘气、会停顿的对话 TTS#

2024 年 5 月左右出圈的 ChatTTS,来自 2noise 开源组织(核心维护者包括源文雨 fumiama)。它的定位非常精准:面向日常对话(daily dialogue)的生成式语音模型——不是给有声书念稿子,而是给 LLM 助手、聊天机器人一张会说人话的嘴。

它最出名的本事是气口和笑声自然:模型支持 [laugh](笑声)、[uv_break](停顿)、[lbreak](长停顿)这类 token 级韵律控制,合成出来的语音会”嗯、啊、笑、喘气”,一听就是真人在聊天的节奏,而不是播音腔念课文。技术上它是自回归路线(和 bark、XTTSv2、VALL-E 一类),音频 tokenizer 用组向量量化(GVQ,grouped vector quantization,灵感来自 fish-speech),声码器用预训练的 Vocos。

数据上,主模型用了10 万小时以上的中英文音频训练,开源出来的版本是 4 万小时的预训练模型(未带 SFT)。支持多说话人、随机采样音色,还提供 OpenAI 兼容 API,4090 上跑 RTF 约 0.3,4GB 显存就能出声。它在 B 站上成了”AI 陪聊”的标配声线。许可证要提一句:代码 AGPLv3+,但模型权重是 CC BY-NC 4.0,仅限学术研究、禁止商用——这也是它跟”开源”二字之间最微妙的一层纱。

三、Fish Speech:从开源多语工具到千万小时旗舰#

2024 年 10 月开源的 Fish Speech,是这三家里”卷得最凶”的。V1.x 时代它已经是开源多语 TTS 里的好手,V1.5 在英文评测上拿到 WER 3.5%、TTS Arena(语音竞技场)ELO 评分 1339,在当时开源圈属于第一梯队。

真正让它封神的是 2026 年 3 月的 Fish Speech S2。S2 换了全新的双自回归(DualAR)架构:一个 **Slow AR(4B 参数)**专门生成时间轴上的主码本,管整体内容节奏;一个 Fast AR(0.4B 参数)负责补全残差码本,管细节音质。主从配合,配合 RVQ 编解码器(10 个码本,约 21Hz 的 token 率),生成质量和速度两头都要。训练数据直接拉满到千万小时级别(1000 万+小时)、覆盖 80+ 语种,还用 GRPO + 强化学习做了后训练对齐。

成绩单非常硬:在 Seed-TTS Eval 评测中,中文 WER 0.54%、英文 WER 0.99%,两项都是所有对比模型(含闭源)里的最佳。它还支持 1.5 万多种自然语言标签控制(比如 [whisper] 耳语、[excited] 兴奋),10–30 秒参考音频就能快速克隆,流式推理 RTF 低至 0.195。中文 TTS 的天花板,在 Fish Speech S2 这里被顶到了一个新高度。

四、三家的共同启示#

把这三个项目放在一起看,能总结出中文开源 TTS 的共性打法:

  1. 重产品、轻论文:没有 arXiv 编号,但 WebUI、API、一键部署、中文文档样样齐全——它们是”给用户用”的工具,不是”给审稿人看”的文章;
  2. 低门槛是生命线:5 秒克隆、1 分钟微调、4GB 显存可跑、半小时出活,每个门槛的降低都在指数级放大用户基数;
  3. 中文语境是主场:拼音、儿化音、气口、笑声、方言,这些”中文的讲究”恰恰是国外模型最容易翻车的地方,本土项目天然占优;
  4. 能力跃迁同样凶猛:从 GPT-SoVITS 的 167M 到 Fish Speech S2 的 4.4B,两年时间中文开源 TTS 完成了两个数量级的跨越。

收尾:我的一点看法#

我私心认为,中文开源 TTS 比很多有论文的模型更值得被写进发展史,因为它们是”工程民主化”最生动的样本。论文决定技术的上限,而这些项目决定技术的下限——**当一个普通学生用一张显卡、五分钟就能让 AI 用自己喜欢的声音说话时,这个领域才算真正进入了大众时代。**GPT-SoVITS 的爆火、ChatTTS 的陪聊、Fish Speech 的评测纪录,都在反复证明这一点。

但三家的处境也暴露了开源 TTS 的三重隐忧。一是版权:训练数据(哪怕标榜”公开”)的授权问题普遍悬而未决,ChatTTS 直接选择禁商;二是安全:克隆技术越成熟,声音诈骗越猖獗,项目方普遍缺乏配套防护;三是可持续:爆款项目依赖个人热情或小团队的”用爱发电”,维护节奏往往不稳定。另外,GitHub 星标数、ELO 分这类”社区热度指标”容易随炒作波动,Fish Speech S2 的 WER 0.54%/0.99% 是 Seed-TTS Eval 单评测集口径,别跨基准瞎比。

最后想说一句公道话:**开源社区的功劳簿上,应该有这些没有论文的项目一页。**他们用最接地气的方式,让”每个人都能拥有自己想要的声音”这件事变成了现实——而这,恰恰是 VALL-E 们写在论文里、却由它们真正兑现的理想。


附:核心数据速查#

项目概览(本篇无统一”基本盘”,改用逐项目表)

项目发布时间维护方定位参数量
GPT-SoVITS2024.01RVC-Boss零样本/少样本中文语音克隆约 167M(⚠️ 社区口径)
ChatTTS2024.052noise对话场景中文 TTS未公开(⚠️)
Fish Speech2024.10(S2:2026.03)fishaudio 鱼音科技开源多语/旗舰多语 TTSS2:Slow AR 4B + Fast AR 0.4B

核心创新

项目创新
GPT-SoVITSGPT 自回归生成 + SoVITS 音色转换双引擎;5 秒零样本 / 1 分钟微调;跨语种
ChatTTS对话场景设计;气口/笑声/停顿 token 控制;GVQ tokenizer + Vocos 声码器
Fish Speech S2DualAR 双自回归(4B+0.4B);GRPO+RL 后训练;1.5 万+自然语言标签控制

关键成绩

  • GPT-SoVITS:GitHub 约 5.9 万★;支持中英日韩粤,V4 原生 48kHz
  • ChatTTS:主模型 10 万+小时数据(开源版 4 万小时);B 站现象级”AI 陪聊”声线
  • Fish Speech V1.5:英文 WER 3.5%;TTS Arena ELO 1339
  • Fish Speech S2:Seed-TTS Eval 中文 WER 0.54%、英文 0.99%(均为所有对比模型最佳);千万小时 / 80+ 语种;流式 RTF 0.195
  • 三个项目均开源(⚠️ ChatTTS 模型权重为 CC BY-NC 4.0,禁止商用)

关键概念清单

  • zero-shot / few-shot = 零样本 / 少样本(短参考音频即可克隆)
  • WebUI = 图形化操作界面
  • SoundStorm = 并行的语音 token 生成模型(GPT-SoVITS 的 GPT 部分类似思路)
  • VITS = 变分推理 TTS 架构(SoVITS 的音色转换部分基于此)
  • BigVGAN = 高质量 GAN 声码器
  • GVQ = Grouped Vector Quantization,组向量量化
  • Vocos = 轻量神经声码器
  • WER = Word Error Rate,词错误率
  • CER = Character Error Rate,字符错误率
  • ELO = 竞技场排名分(TTS Arena 用)
  • TTS Arena = 社区众包语音评测竞技场
  • DualAR = Dual-Autoregressive,双自回归(Slow AR 管内容 + Fast AR 管细节)
  • RVQ = Residual Vector Quantization,残差向量量化
  • GRPO = Group Relative Policy Optimization,组相对策略优化
  • Seed-TTS Eval = 语音合成评测基准
  • RTF = Real-Time Factor,实时因子
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

[TTS·声音克隆] 中文开源 TTS 群像:开源三巨头
https://mizuki-eaf.pages.dev/posts/音频生成模型/tts声音克隆-中文开源-tts-群像开源三巨头/
作者
无名之子
发布于
2026-07-15
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录