

GPT-SoVITS es un sistema gratuito de clonación de voz y TTS con licencia MIT que clona una voz a partir de solo 1 minuto de audio. Desarrollado por RVC-Boss, destaca en la reproducción de voces en chino, japonés y personajes de anime. Es muy popular entre VTubers, actores de doblaje aficionados y creadores de audiolibros independientes de todo el mundo.
GPT-SoVITS es un sistema de clonación de voz y texto a voz (TTS) de código abierto desarrollado por RVC-Boss (lj1995) bajo la comunidad RVC-Project, un grupo de investigación de voz de código abierto sino-estadounidense. Publicado por primera vez en GitHub en enero de 2024, acumuló rápidamente más de 57,000 estrellas y 6,200 bifurcaciones (forks), convirtiéndose en uno de los repositorios de IA de audio con más estrellas en la plataforma. La herramienta resuelve un problema específico: crear TTS personalizado de alta calidad sin grandes conjuntos de datos de voz ni suscripciones a API comerciales. Su promesa principal es genuina: un modelo de voz entrenado a partir de tan solo un minuto de audio limpio, o un clon aproximado a partir de un clip de referencia de solo 5 segundos.
A nivel interno, GPT-SoVITS utiliza un flujo de trabajo de dos etapas. Un transformador basado en GPT (330M de parámetros en versiones posteriores) convierte el texto en tokens semánticos, capturando la prosodia y el ritmo. Luego, un decodificador acústico SoVITS renderiza esos tokens como formas de onda, manejando el timbre y la textura de la voz. Esta separación es lo que hace que el ajuste fino (fine-tuning) sea eficiente: solo necesitas adaptar una pequeña porción del modelo a un nuevo hablante. Las características clave incluyen síntesis zero-shot a partir de clips de 5 segundos, ajuste fino few-shot con 1 minuto de audio, conversión de voz multilingüe entre chino, japonés, inglés, coreano y cantonés, una WebUI integrada, un flujo de preparación de conjuntos de datos de audio con segmentación automática y etiquetado ASR, y entrenamiento basado en LoRA que reduce los requisitos de memoria de la GPU a 8GB para los modelos v3 y v4. Se complementa de forma natural con herramientas como Whisper para la transcripción de audio durante la preparación del conjunto de datos.
Lo que GPT-SoVITS produce en abril de 2026
El proyecto ha lanzado seis versiones principales del modelo desde su inicio. A partir de abril de 2026, las versiones estables principales son la v4 (abril de 2025, salida nativa a 48kHz mediante el vocoder HiFiGAN v4, entrenamiento LoRA en 8GB de VRAM) y la v2ProPlus (junio de 2025, añade una capa de verificación del hablante utilizando incrustaciones eres2netv2w24s4ep4, la inferencia más rápida con un factor de tiempo real de 0.014 en una RTX 4090). Los modelos v3 y v4 utilizan la arquitectura Conditional Flow Matching (CFM), un cambio significativo respecto a la decodificación autorregresiva de la v1 y v2, lo que produce una reproducción del timbre notablemente mejor a costa de una inferencia algo más lenta.
La calidad de salida depende en gran medida de la limpieza de los datos de entrenamiento. Con 5-10 minutos de grabaciones de voz con calidad de estudio, la v4 produce un habla que coincide estrechamente con el tono, el ritmo y la respiración del hablante original. Con audio de referencia más ruidoso (clips típicos de YouTube, por ejemplo), la v2ProPlus a menudo funciona mejor porque su capa de verificación del hablante compensa los artefactos de grabación. La clonación zero-shot a partir de 5 segundos produce resultados reconocibles pero imperfectos; la mayoría de los usuarios en producción realizan un ajuste fino con al menos 1 minuto de datos. La velocidad de inferencia para una oración típica es de menos de medio segundo en una GPU de juegos de gama media, lo que la hace práctica para uso interactivo.
La WebUI incluye el flujo de trabajo completo: segmentación de audio, etiquetado basado en ASR con Faster Whisper, controles de entrenamiento para los componentes del modelo GPT y SoVITS, y una interfaz de síntesis con controles de velocidad y temperatura. Se expone una API REST para uso programático. La herramienta funciona en Windows y Linux; existe soporte para macOS, pero es mantenido por la comunidad y es menos confiable.
"GPT-SoVITS ofrece una síntesis de voz en japonés de mayor calidad en comparación con VALLE-X... el tiempo de ajuste fino es más corto de lo esperado, con tiempos de inferencia breves y soporte para capacidades de CPU." - David Cochard, ailia Tech Blog, 2024
Dónde se sitúa GPT-SoVITS frente a F5-TTS y OpenVoice
El campo de la clonación de voz de código abierto avanza rápidamente en 2025-2026. GPT-SoVITS tiene dos competidores principales que vale la pena examinar mecánicamente: F5-TTS y OpenVoice. Cada uno adopta un enfoque arquitectónico significativamente diferente.
GPT-SoVITS vs. F5-TTS: F5-TTS (lanzado en octubre de 2024 por SWivid) es completamente no autorregresivo, utilizando Flow Matching con un Diffusion Transformer. Elimina por completo el codificador de texto, el modelo de duración y el sistema de alineación de fonemas, lo que resulta en un ciclo de entrenamiento más simple y una convergencia más rápida. El benchmark SpeechRole (agosto de 2025) sitúa a F5-TTS en la cima o cerca de ella en las puntuaciones MOS para inglés y lenguas europeas, así como en la estabilidad de formato largo durante más de 3 minutos. GPT-SoVITS contraataca en los idiomas CJK: su modelo semántico GPT captura la complejidad tonal del mandarín, cantonés y japonés con mayor precisión que el enfoque de flow-matching de F5-TTS, y maneja mejor el audio de referencia de baja calidad o ruidoso porque el decodificador SoVITS es más tolerante a las entradas degradadas. La elección práctica: si estás clonando una voz en inglés o español con acento occidental, F5-TTS gana actualmente en naturalidad. Si estás replicando un personaje de anime japonés o un presentador de noticias chino, GPT-SoVITS es la opción más sólida. Ambos tienen licencia MIT/Apache 2.0 sin restricciones comerciales.
GPT-SoVITS vs. OpenVoice v2: OpenVoice v2 (MyShell + MIT, abril de 2024) utiliza un mecanismo fundamentalmente diferente: congela un gran modelo TTS base entrenado con miles de hablantes y aplica un "extractor de color de tono" ligero, una pequeña red de incrustación que captura el timbre de la voz a partir de un clip de referencia, sin ningún ajuste fino. Esto significa que la clonación con OpenVoice toma segundos en lugar de minutos de tiempo de entrenamiento, y requiere mucha menos VRAM (funciona con 2-4GB). La contrapartida es la fidelidad en voces inusuales o distintivas. OpenVoice maneja bien los perfiles de voz convencionales, pero tiene dificultades con texturas de voz muy idiosincrásicas, estilos de canto o voces de personajes con patrones de entonación inusuales. El ajuste fino de GPT-SoVITS puede capturar esas características detalladas porque realmente actualiza los pesos del modelo para cada nuevo hablante. OpenVoice también es más fácil de instalar para usuarios no técnicos. Para alguien que desea un clon rápido de un presentador de podcast o narrador, OpenVoice v2 es más rápido y sencillo. Para el trabajo de voz de anime o una voz que es genuinamente distintiva, el ajuste fino de GPT-SoVITS produce resultados notablemente mejores.
Como referencia, Coqui XTTS es una tercera alternativa que vale la pena destacar: soporta más idiomas de forma nativa que cualquiera de los anteriores y tiene un ecosistema más fuerte de demostraciones alojadas, pero el proyecto Coqui fue descontinuado formalmente en enero de 2024, lo que significa que el mantenimiento continuo es impulsado únicamente por la comunidad.
La realidad de las licencias y los derechos de autor
GPT-SoVITS se publica bajo la licencia MIT, una de las licencias de código abierto más permisivas disponibles. Esto significa que puedes usarlo comercialmente, modificar el código fuente y distribuir tus propias compilaciones sin más restricciones que preservar el aviso de derechos de autor. Los pesos del modelo preentrenado (alojados en lj1995/GPT-SoVITS en Hugging Face) se distribuyen bajo la misma licencia. No hay regalías de tiempo de ejecución, tarifas de uso de API ni niveles de acceso controlados por el proveedor.
La dimensión ética y legal que más importa en la práctica es cómo obtienes tus datos de entrenamiento. Clonar la voz de una figura pública sin consentimiento, para luego usarla y generar discursos atribuidos a ellos, está cada vez más regulado en múltiples jurisdicciones a partir de 2025. La Ley de IA de la UE, varias leyes estatales de EE. UU. y las políticas de contenido de las plataformas abordan esta área. GPT-SoVITS en sí no tiene filtrado de contenido, por lo que la responsabilidad recae completamente en el usuario. La popularidad del proyecto en las comunidades de fans para la recreación de voces de personajes de anime ocupa un área gris similar al fan fiction: ampliamente practicado, formalmente prohibido por muchos titulares de propiedad intelectual y rara vez penalizado en proyectos personales no comerciales. El uso comercial de la voz de un personaje clonado para el desarrollo de juegos o un producto comercial conllevaría un riesgo legal genuino.
El contraste con servicios comerciales como ElevenLabs o PlayHT es relevante aquí. Esas plataformas incluyen flujos de trabajo de verificación de consentimiento, políticas de contenido y mecanismos de eliminación. GPT-SoVITS, como software local, no aplica nada de eso. Es más potente y más flexible precisamente porque no impone barreras de seguridad. Que eso sea una ventaja o una responsabilidad depende completamente de lo que estés construyendo.
Dónde GPT-SoVITS se queda corto de manera constante
La instalación es la primera barrera. GPT-SoVITS requiere un entorno Python o conda funcional, descargar los pesos del modelo GPT y los pesos del modelo SoVITS por separado (múltiples archivos, cada uno de varios cientos de MB), y una configuración opcional pero prácticamente necesaria para Faster Whisper ASR para el flujo de etiquetado. Los conflictos de dependencias aparecen con regularidad, particularmente en torno a la compatibilidad de la versión de ctranslate2, donde los usuarios frecuentemente necesitan degradar a una versión específica (3.24.0 documentada por un autor de HackerNoon en julio de 2025) para evitar errores de inferencia. Los usuarios no técnicos se topan con estos muros rápidamente.
La compatibilidad con la GPU es una frustración recurrente. El rastreador de problemas de GitHub (525 problemas abiertos a mediados de 2025) muestra múltiples hilos sobre las arquitecturas más nuevas de NVIDIA: las tarjetas RTX 5070, 5070 Ti y 5090 (arquitectura Blackwell, sm_120) no son compatibles de forma nativa hasta que las compilaciones nocturnas de PyTorch se pongan al día, y las GPU de la serie 16 se ven obligadas a usar precisión FP32, reduciendo aproximadamente a la mitad la velocidad de inferencia. Cada nueva generación de GPU crea una nueva ola de problemas de compatibilidad que tardan de semanas a meses en resolverse.
La omisión de palabras persiste en todas las versiones. El componente GPT ocasionalmente omite palabras o repite frases en pasajes más largos, particularmente con nombres propios inusuales, habla rápida o texto que mezcla múltiples escrituras. La solución recomendada es el ajuste sistemático de hiperparámetros: probar configuraciones de peso de GPT en oraciones problemáticas antes de comprometerse con una configuración final del hablante. Este es un comportamiento documentado del usuario, pero requiere paciencia técnica. La salida en japonés sufre específicamente de una entonación poco natural porque el módulo g2p carece de soporte para marcas de acento, una brecha arquitectónica conocida que no se ha abordado hasta la v4.
"La calidad del modelo mejoró enormemente de la v2 a la v4... los errores son inevitables [en la generación de formato largo], es lo suficientemente bueno para mi caso de uso." - Tech Shinobi, HackerNoon, julio de 2025
Los modelos v3 y v4 introdujeron una regresión de calidad en una dimensión específica: la velocidad de inferencia. La arquitectura CFM funciona a 0.028-0.040 RTF frente a la v2ProPlus a 0.014 RTF. Para aplicaciones interactivas o casos de uso de transmisión (streaming), algunos usuarios han vuelto a la v2ProPlus a pesar de su menor límite de calidad de audio sin procesar, porque la latencia importa más que la fidelidad máxima para su flujo de trabajo.
Para quién es GPT-SoVITS
La comunidad que adoptó GPT-SoVITS más rápido te dice para quién es. El video de introducción original en Bilibili recibió 2.4 millones de visitas y 203,000 guardados en su primer año, impulsado por creadores de contenido chinos, actores de doblaje aficionados y constructores de la comunidad VTuber. A las pocas semanas del lanzamiento en enero de 2024, los modelos de voz creados por fans para personajes de anime y miembros de Hololive EN aparecían en voice-models.com, cada uno entrenado con GPT-SoVITS. Esta comunidad sigue siendo el grupo de usuarios más fuerte de la herramienta: creadores que necesitan una reproducción precisa de tipos de voz japoneses o chinos distintivos, a menudo a partir de material de referencia relativamente corto.
Más allá de la comunidad de fans, GPT-SoVITS tiene un fuerte caso de uso para la producción independiente de audiolibros. Un narrador que desea generar una narración TTS consistente con su propia voz, o un pequeño editor que produce audiolibros en idiomas CJK, obtiene una herramienta genuinamente capaz a costo cero. El flujo de preparación del conjunto de datos (segmentar, etiquetar con ASR, entrenar) está lo suficientemente bien documentado como para que expertos no especializados en aprendizaje automático (ML) con inclinaciones técnicas puedan seguirlo. El artículo sobre el flujo de trabajo de audiolibros en HackerNoon de julio de 2025 es el ejemplo documentado más claro de este proceso en inglés.
Los desarrolladores que integran funciones TTS en productos se benefician de la licencia MIT, que permite incluir los pesos en software comercial sin regalías. La API REST hace que la integración sea sencilla para aquellos familiarizados con implementaciones en Python o Docker. Para los equipos que necesitan un servicio TTS gestionado y escalable con acuerdos de nivel de servicio (SLA), ElevenLabs o PlayHT siguen siendo mejores opciones: GPT-SoVITS no tiene alojamiento en la nube, ni análisis de uso, ni contrato de soporte.
Evita GPT-SoVITS si tu idioma principal es el inglés y deseas la máxima naturalidad: F5-TTS actualmente lo supera en los benchmarks de inglés con menos fricción de configuración. Evítalo si deseas una experiencia de "hacer clic y listo" sin involucrar la terminal. Evítalo si usas macOS o un sistema sin una GPU dedicada de NVIDIA o AMD y necesitas una inferencia rápida y confiable. En esos casos, un servicio alojado o una alternativa autoalojada más simple te ahorrará mucho tiempo y frustración.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen GPT-SoVITS.
Artículos relacionados
Guías y artículos relacionados con GPT-SoVITS.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives
