

Coqui TTS es un framework de texto a voz de código abierto basado en XTTS v2, un modelo de clonación de voz que clona cualquier voz a partir de 6 segundos de audio en 17 idiomas. De uso gratuito a nivel local para proyectos no comerciales; la empresa creadora cerró en enero de 2024.
Coqui TTS es un conjunto de herramientas de aprendizaje profundo para la síntesis de texto a voz y la clonación de voz, creado por el equipo detrás del proyecto TTS de Mozilla tras independizarse como empresa en 2021. Durante tres años, fue la alternativa de código abierto más capaz frente a las plataformas comerciales de síntesis de voz, culminando con XTTS v2 en noviembre de 2023: un modelo que clona cualquier voz a partir de un clip de audio de referencia de 6 segundos y sintetiza el habla en 17 idiomas. Luego, el 3 de enero de 2024, su fundador Josh Meyer anunció el cierre de la empresa. El repositorio original en github.com/coqui-ai/TTS está ahora archivado y no cuenta con mantenedores activos del equipo fundador. Un fork comunitario mantenido por el Idiap Research Institute (github.com/idiap/coqui-ai-TTS) lleva el proyecto adelante, lanzando la versión v0.27.5 en enero de 2026.
La biblioteca incluye más de una docena de arquitecturas de modelos, como VITS, GlowTTS y FastSpeech2, además de herramientas de conversión de voz. Su producto estrella es XTTS v2, un modelo autorregresivo estilo GPT que combina la tokenización de audio VQ-VAE con un vocoder UnivNet para ofrecer una salida de 24kHz con una latencia de streaming inferior a 200ms en una GPU de consumo. Admite la clonación de voz entre idiomas: clona una voz en inglés y luego sintetiza esa misma voz hablando en francés o japonés. El conjunto de herramientas incluye scripts de entrenamiento para el ajuste fino con datos de hablantes personalizados, interfaces de línea de comandos y API de Python, así como integraciones con Hugging Face. Hasta abril de 2026, los pesos del modelo XTTS v2 se descargan 7.4 millones de veces al mes desde Hugging Face, situándolo entre los modelos TTS autoalojados más utilizados del mundo.
Lo que ofrece Coqui TTS en abril de 2026
El paquete instalable actual es pip install coqui-tts, mantenido por el Idiap Research Institute. Incorpora XTTS v2 como modelo multilingüe predeterminado junto a una biblioteca de más de 1,100 modelos adicionales a través de integraciones con Fairseq. XTTS v2 genera audio mono a 24kHz con una latencia de streaming del primer token inferior a 200ms en una GPU NVIDIA de gama media. La calidad de la clonación de voz depende en gran medida del audio de referencia: una grabación limpia y con el micrófono cerca en una habitación silenciosa produce resultados notablemente mejores que un clip de teléfono comprimido. El modelo maneja la transferencia de emociones y estilo a través de la muestra de referencia, por lo que un clip de referencia emocionado genera un resultado emocionado.
Idiomas compatibles en XTTS v2: inglés, español, francés, alemán, italiano, portugués, polaco, turco, ruso, holandés, checo, árabe, chino (mandarín), japonés, húngaro, coreano e hindi. La síntesis entre idiomas funciona bien para pares de idiomas europeos; los resultados se degradan en pares de idiomas más distantes como del árabe al japonés. La biblioteca también incluye Bark (para audio expresivo no verbal), múltiples modelos VITS para tareas en un solo idioma y modelos de conversión de voz (FreeVC, kNN-VC, OpenVoice) para transferencias de hablantes con coincidencia de tono sin una síntesis TTS completa.
Para tareas en un solo idioma donde la precisión de la pronunciación importa más que la expresividad, los modelos VITS más específicos a menudo superan a XTTS v2. Los debates de la comunidad señalan que XTTS v2 ocasionalmente tropieza con nombres propios y terminología técnica; expandir previamente las abreviaturas y los números en el texto de entrada reduce los errores sustancialmente.
La posición de Coqui TTS frente a ElevenLabs y Bark
La comparación relevante para la mayoría de los usuarios que eligen Coqui TTS es frente a ElevenLabs (el líder en calidad comercial) y Bark de Suno (la otra gran opción de código abierto).
ElevenLabs funciona como una API en la nube de código cerrado sin opción de autoalojamiento. Su modelo Multilingual v2 admite más de 30 idiomas frente a los 17 de XTTS v2. El nivel Professional Voice Clone realiza un ajuste fino con tu audio y produce resultados que superan habitualmente pruebas humanas de doble ciego; el Instant Voice Clone requiere aproximadamente un minuto de audio. Una diferencia mecánica fundamental: ElevenLabs toma la velocidad de habla directamente del audio de referencia. XTTS v2 utiliza un predictor de duración independiente entrenado en su corpus base en lugar de en tu muestra, lo que significa que la voz clonada habla con una cadencia extraída de los datos de entrenamiento promediados en lugar de tu grabación. En pruebas independientes, el mismo guion de 18 palabras duró 76 segundos en Coqui frente a los 20-22 segundos de los motores comerciales que toman el ritmo del clip de referencia. ElevenLabs comienza en $22/mes (plan Creator) para derechos comerciales. XTTS v2 bajo CPML es gratuito pero solo para uso no comercial.
Bark de Suno también es de código abierto y utiliza una licencia MIT tanto para el código como para los pesos del modelo, lo que lo hace totalmente utilizable a nivel comercial sin restricciones. Su arquitectura utiliza tres transformadores estilo GPT con aproximadamente 80 millones de parámetros cada uno, operando sobre tokens de audio EnCodec. La superficie generativa de Bark es más amplia que la de XTTS v2: produce habla, música, ruido de fondo y vocalizaciones no verbales (risas, respiración, suspiros) todo en una sola pasada a partir de un prompt de texto. La desventaja significativa es que Bark no admite de forma nativa la clonación de voz zero-shot de hablantes arbitrarios; utiliza ajustes preestablecidos de hablantes. Los forks de la comunidad añaden capacidad de clonación de voz a través de herramientas de conversión externas, pero los resultados son inconsistentes. Para un TTS puro con consistencia de hablante y clonación entre idiomas, XTTS v2 es más confiable. Para la generación de audio creativo con emociones y efectos de sonido integrados, Bark tiene una paleta más amplia.
"Diría que actualmente es el mejor conjunto de herramientas de síntesis y clonación de voz de código abierto que existe en este momento." - bachittle, GitHub Issues, enero de 2024
"La tecnología que hay detrás es increíble y sería genial para la comunidad OSS que el modelo pasara a ser de código abierto." - fakerybakery, GitHub Issues, enero de 2024
La realidad de las licencias y los derechos de autor
La situación de las licencias de Coqui TTS está dividida, y esta división importa mucho dependiendo de lo que estés construyendo.
El código de la biblioteca está licenciado bajo la Mozilla Public License 2.0 (MPL 2.0), que permite el uso comercial. Si escribes tus propios modelos o utilizas únicamente modelos con licencia Apache 2.0 dentro del framework, no te enfrentarás a restricciones comerciales sobre el código en sí.
Los pesos del modelo XTTS v2 están licenciados bajo la Coqui Public Model License 1.0.0 (CPML). La CPML permite el uso no comercial: investigación personal, proyectos de afición, trabajo académico y uso benéfico. Traza la línea en las actividades que generan ingresos. Antes del cierre en enero de 2024, Coqui ofrecía licencias comerciales de XTTS a $365/año para empresas con menos de $1M en ingresos o financiación. Ese programa de licencias ya no existe porque la empresa ya no existe. No hay ninguna entidad a la que comprarle una licencia comercial.
Esto crea un obstáculo real para los desarrolladores que crean productos comerciales. En Hacker News, un colaborador resumió el problema claramente: "Me encantaría trabajar más en ello, pero me preocupa que sea un callejón sin salida debido a la incertidumbre sobre el futuro de la licencia". Otro usuario señaló: "El modelo XTTS sigue bajo CPML, que no permite el uso comercial", mientras que un tercero aclaró que las licencias del código (MPL 2.0) y las licencias de los modelos preentrenados son independientes, no intercambiables.
En la práctica, la comunidad no ha resuelto esto. Algunos desarrolladores utilizan XTTS v2 comercialmente y consideran que el riesgo de aplicación de la ley es bajo dado que Coqui ya no existe como entidad legal. Otros prefieren cambiar a los modelos VITS bajo Apache 2.0 dentro del mismo framework, aceptando una menor calidad de clonación de voz a cambio de derechos comerciales limpios. Los pesos con licencia MIT de Bark ofrecen una alternativa totalmente comercial si la calidad de la clonación es menos crítica. La aplicabilidad legal de la CPML bajo la ley de derechos de autor de EE. UU. para los resultados generados por IA sigue siendo objeto de debate.
Dónde Coqui TTS se queda corto de forma constante
Instalación de GPU en Windows. En Windows nativo, la aceleración por GPU falla incluso cuando CUDA está correctamente instalado. La solución de la comunidad es WSL (Windows Subsystem for Linux) o una Ubuntu VM. Los usuarios que esperan un instalador estándar se sorprenden habitualmente. "Día 3 intentando instalar en Windows 11. Listo para rendirme y pagar por ElevenLabs" circuló por los canales de la comunidad durante todo 2024. A partir de la versión 0.27.4, PyTorch ya no viene incluido y debe instalarse por separado con la versión correcta de CUDA o ROCm, lo que añade un paso más.
Velocidad de inferencia en CPU. Sin una GPU, XTTS v2 genera aproximadamente una frase cada 30-60 segundos. En una GPU (mínimo 4GB de VRAM, recomendado 8GB), la misma frase tarda de 2 a 5 segundos. Para cualquier persona sin una GPU dedicada de NVIDIA o AMD, la herramienta es prácticamente inutilizable para flujos de trabajo interactivos.
Desajuste en el ritmo de la voz. Debido a que el predictor de duración de XTTS v2 está entrenado con datos del corpus base en lugar de con tu clip de referencia, la voz clonada habla a un ritmo promedio, no al ritmo natural del hablante. En comparaciones documentadas, esto produjo resultados 3-4 veces más largos que el mismo texto de motores comerciales que toman la velocidad de habla del audio de referencia.
Filtración de acento en la síntesis entre idiomas. Pruebas independientes descubrieron que las características del acento del idioma de referencia se filtran a los idiomas de destino. Un clip de origen con acento alemán produjo un resultado en francés con inflexiones alemanas.
Cadencia de mantenimiento más lenta. El fork de Idiap se mantiene activamente y lanzó la versión v0.27.5 en enero de 2026, pero el ritmo de desarrollo de funciones y resolución de problemas es más lento que cuando la empresa Coqui publicaba actualizaciones semanales. Los problemas abiertos en el repositorio original archivado no reciben respuesta. La calidad del soporte de la comunidad varía.
Para quién es Coqui TTS
Coqui TTS está diseñado para desarrolladores e investigadores que necesitan clonación de voz multilingüe autoalojada y cuentan con la infraestructura de GPU y la experiencia en Python para implementarla. Es la opción de código abierto más sólida para la clonación de voz no comercial, específicamente en múltiples idiomas. Las aplicaciones sensibles a la privacidad, la investigación académica y los proyectos personales que necesitan una generación de voz repetible y controlada localmente son un encaje natural.
Los equipos que crean flujos de trabajo de narración de audiolibros, canales de diálogo de NPC para juegos o herramientas de accesibilidad para implementación local pueden usar XTTS v2 de manera efectiva una vez superado el paso de instalación. El soporte de ajuste fino significa que puedes entrenar con habla específica de un dominio (terminología médica, pronunciaciones de marcas) sin enviar datos a una API de terceros.
Evita Coqui TTS cuando: Estés construyendo un producto comercial que utilice XTTS v2, ya que la CPML bloquea el uso comercial y no hay licencias disponibles. Necesites más de 17 idiomas o quieras controles de emoción listos para usar con una interfaz de controles deslizantes (ElevenLabs es la respuesta en ese caso). Seas un usuario sin conocimientos técnicos y sin acceso a GPU; la curva de configuración es pronunciada y la inferencia en CPU es demasiado lenta para ser útil. Necesites la generación de música y efectos de sonido al estilo Bark de Suno junto con el habla. Si la claridad de la licencia comercial es obligatoria y se requiere código abierto, Bark bajo MIT es la alternativa más segura a pesar de su falta de clonación de voz nativa.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen Coqui TTS.
Artículos relacionados
Guías y artículos relacionados con Coqui TTS.

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
