

Coqui TTS 是一个围绕 XTTS v2 构建的开源文本转语音框架。XTTS v2 是一种语音克隆模型,仅需 6 秒音频即可克隆任何声音,并支持 17 种语言。可免费在本地用于非商业项目;其背后的公司已于 2024 年 1 月关闭。
Coqui TTS 是一个用于文本转语音合成和语音克隆的深度学习工具包,由 Mozilla 的 TTS 项目团队在 2021 年分拆成立独立公司后构建。三年来,它一直是商业语音合成平台最强大的开源替代方案,并在 2023 年 11 月推出了巅峰之作 XTTS v2:该模型仅需 6 秒的参考音频片段即可克隆任何声音,并能合成 17 种语言的语音。随后,在 2024 年 1 月 3 日,创始人 Josh Meyer 宣布公司关闭。位于 github.com/coqui-ai/TTS 的原始代码库现已归档,创始团队不再进行主动维护。由 Idiap Research Institute 运营的社区分支(github.com/idiap/coqui-ai-TTS)接管了该项目并继续推进,于 2026 年 1 月发布了 v0.27.5 版本。
该库内置了十多种模型架构,包括 VITS、GlowTTS 和 FastSpeech2,以及语音转换工具。其旗舰模型是 XTTS v2,这是一个 GPT 风格的自回归模型,结合了 VQ-VAE 音频标记化和 UnivNet 声码器,可在消费级 GPU 上以低于 200ms 的流式延迟输出 24kHz 音频。它支持跨语言语音克隆:克隆一个英语声音,然后合成该声音说法语或日语。该工具包包含用于在自定义说话人数据上进行微调的训练脚本、命令行和 Python API,以及 Hugging Face 集成。截至 2026 年 4 月,XTTS v2 模型权重在 Hugging Face 上的月下载量达到 740 万次,使其成为现存最常用的自托管 TTS 模型之一。
Coqui TTS 在 2026 年 4 月的产出能力
当前的可安装包是 pip install coqui-tts,由 Idiap Research Institute 维护。它将 XTTS v2 作为默认的多语言模型引入,并通过 Fairseq 集成提供包含 1,100 多个附加模型的库。XTTS v2 在中端 NVIDIA GPU 上生成 24kHz 单声道音频,首个 token 的流式延迟低于 200ms。语音克隆的质量在很大程度上取决于参考音频:在安静房间内使用近场麦克风录制的清晰音频,其效果明显优于经过压缩的手机录音。该模型通过参考样本处理情感和风格迁移,因此激动的参考片段会产生激动的输出。
XTTS v2 支持的语言包括:英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(普通话)、日语、匈牙利语、韩语和印地语。跨语言合成在欧洲语言对之间效果良好;对于阿拉伯语到日语等差异较大的语言对,效果会有所下降。该库还捆绑了 Bark(用于富有表现力的非语音音频)、多个用于单语言任务的 VITS 模型,以及语音转换模型(FreeVC、kNN-VC、OpenVoice),用于在无需完整 TTS 合成的情况下进行音高匹配的说话人转换。
对于发音精度比表现力更重要的单语言任务,范围更窄的 VITS 模型通常优于 XTTS v2。社区讨论指出,XTTS v2 偶尔会在专有名词和技术术语上出现失误;在输入文本中预先展开缩写和数字可以大幅减少错误。
Coqui TTS 与 ElevenLabs 和 Bark 的对比定位
对于大多数选择 Coqui TTS 的用户来说,相关的比较对象是 ElevenLabs(商业质量的领导者)和 Suno 的 Bark(另一个主要的开源选项)。
ElevenLabs 作为闭源云 API 运行,没有自托管选项。其 Multilingual v2 模型支持 30 多种语言,而 XTTS v2 支持 17 种。Professional Voice Clone 层级会根据您的音频进行微调,产生的结果通常能通过人类双盲测试;Instant Voice Clone 则需要大约一分钟的音频。一个关键的机制差异是:ElevenLabs 直接从参考音频中采样语速。XTTS v2 使用一个在基础语料库(而非您的样本)上训练的独立时长预测器,这意味着克隆声音的语速节奏来自平均训练数据,而不是您的录音。在独立测试中,相同的 18 个词的脚本在 Coqui 中运行了 76 秒,而在从参考片段中采样语速的商业引擎中仅需 20-22 秒。ElevenLabs 的商业使用权起价为 $22/月(Creator 计划)。CPML 许可下的 XTTS v2 是免费的,但仅限非商业用途。
Suno 的 Bark 同样是开源的,其代码和模型权重均使用 MIT 许可证,这使其完全可用于商业用途且不受限制。它的架构使用三个 GPT 风格的 Transformer,每个约有 8000 万个参数,在 EnCodec 音频 token 上运行。Bark 的生成范围比 XTTS v2 更广:它可以通过文本提示一次性生成语音、音乐、背景噪音和非语言发声(笑声、呼吸声、叹息声)。显著的权衡在于,Bark 原生不支持对任意说话人进行零样本语音克隆;它使用预定义的说话人预设。社区分支通过外部转换工具添加了语音克隆功能,但结果并不稳定。对于需要说话人一致性和跨语言克隆的纯 TTS 任务,XTTS v2 更为可靠。而对于融入了情感和音效的创意音频生成,Bark 提供了更广阔的创作空间。
“我敢说,它目前是市面上最好的开源语音合成和克隆工具包。” - bachittle,GitHub Issues,2024 年 1 月
“它背后的技术令人难以置信,如果该模型能够开源,对 OSS 社区来说将是一件非常棒的事情。” - fakerybakery,GitHub Issues,2024 年 1 月
许可与版权现状
Coqui TTS 的许可情况是分开的,这种分离对您正在构建的项目有着至关重要的影响。
库代码在 Mozilla Public License 2.0 (MPL 2.0) 下获得许可,允许商业使用。如果您编写自己的模型,或者在框架内仅使用基于 Apache 2.0 许可的模型,那么在代码本身上您不会面临任何商业限制。
XTTS v2 模型权重在 Coqui Public Model License 1.0.0 (CPML) 下获得许可。CPML 允许非商业使用:个人研究、业余项目、学术工作和慈善用途。它将界限划在创收活动上。在 2024 年 1 月关闭之前,Coqui 为收入或资金低于 $1M 的公司提供 $365/年的商业 XTTS 许可证。由于公司已不复存在,该许可计划也随之终止。目前没有任何实体可以向其购买商业许可证。
这为构建商业产品的开发人员造成了真正的阻碍。在 Hacker News 上,一位贡献者清楚地总结了这个问题:“我很想在它上面投入更多工作,但由于许可证未来的不确定性,我担心它会有点像一条死胡同。”另一位用户指出:“XTTS 模型仍在 CPML 之下,不允许商业使用”,而第三位用户则澄清说,代码许可证 (MPL 2.0) 和预训练模型许可证是分开的,不可互换。
实际上,社区尚未解决这个问题。一些开发人员在商业上使用 XTTS v2,并认为鉴于 Coqui 已不再作为法律实体存在,执法风险很低。其他人则更愿意在同一框架内切换到 Apache 2.0 下的 VITS 模型,以较低的语音克隆质量换取干净的商业权利。如果克隆质量不是那么关键,Bark 基于 MIT 许可的权重提供了一个完全商业化的替代方案。根据美国版权法,CPML 对 AI 生成输出的法律可执行性仍然存在争议。
Coqui TTS 的明显短板
Windows GPU 安装。在原生 Windows 上,即使正确安装了 CUDA,GPU 加速也会失败。社区的解决方法是使用 WSL(Windows Subsystem for Linux)或 Ubuntu 虚拟机。期望获得标准安装程序的用户经常会感到意外。“在 Windows 11 上尝试安装的第 3 天。准备放弃并花钱买 ElevenLabs 了”这样的话语在 2024 年全年的社区频道中流传。从 0.27.4 版本开始,PyTorch 不再捆绑提供,必须使用正确的 CUDA 或 ROCm 版本单独安装,这又增加了一个步骤。
CPU 推理速度。如果没有 GPU,XTTS v2 大约每 30-60 秒生成一个句子。在 GPU(最低 4GB VRAM,推荐 8GB)上,同样的句子需要 2-5 秒。对于任何没有专用 NVIDIA 或 AMD GPU 的人来说,该工具在交互式工作流中几乎是不可用的。
语音节奏不匹配。由于 XTTS v2 的时长预测器是在基础语料库数据上训练的,而不是在您的参考片段上,因此克隆的声音以平均语速说话,而不是说话人的自然语速。在有记录的比较中,这产生的输出比从参考音频中采样语速的商业引擎生成的相同文本长 3-4 倍。
跨语言合成中的口音渗透。独立测试发现,参考语言的口音特征会渗透到目标语言中。带有德语口音的源片段会产生带有德语腔调的法语输出。
维护节奏较慢。Idiap 分支得到积极维护,并于 2026 年 1 月发布了 v0.27.5,但功能开发和问题解决的步伐比 Coqui 公司推动每周发布时要慢。在已归档的原始代码库上提交的 Issue 得不到回复。社区支持的质量参差不齐。
Coqui TTS 适合哪些人
Coqui TTS 专为需要自托管、多语言语音克隆,并具备部署所需的 GPU 基础设施和 Python 经验的开发人员和研究人员而构建。它是专门针对多语言非商业语音克隆的最强开源选项。需要可重复、本地控制的语音生成的隐私敏感型应用程序、学术研究和个人项目是它的天然契合点。
构建有声读物旁白工作流、游戏 NPC 对话管道或用于本地部署的辅助工具的团队,在完成安装步骤后即可有效使用 XTTS v2。微调支持意味着您可以在特定领域的语音(医学术语、品牌发音)上进行训练,而无需将数据发送到第三方 API。
在以下情况下请跳过 Coqui TTS:您正在构建使用 XTTS v2 的商业产品,因为 CPML 阻止了商业使用且无法获得许可。您需要 17 种以上的语言,或者想要带有滑块界面的开箱即用情感控制(ElevenLabs 是这里的答案)。您是没有 GPU 访问权限的非技术用户;它的设置曲线很陡峭,而且 CPU 推理太慢而无法发挥作用。您需要在语音之外生成 Suno 的 Bark 风格的音乐和音效。如果必须明确商业许可且需要开源,那么尽管缺乏原生语音克隆,基于 MIT 许可的 Bark 仍是更安全的替代方案。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Coqui TTS 的精选合集。
相关文章
与 Coqui TTS 相关的指南和文章。

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
