

F5-TTS es un modelo de texto a voz de código abierto que clona cualquier voz a partir de una muestra de audio de 10 a 15 segundos mediante coincidencia de flujo (flow matching). Desarrollado por investigadores de la Universidad Jiao Tong de Shanghái y Cambridge, se ejecuta completamente en hardware local sin costos de API.
F5-TTS es un sistema de texto a voz totalmente no autorregresivo basado en coincidencia de flujo (flow matching) con una arquitectura Diffusion Transformer, desarrollado por investigadores de la Universidad Jiao Tong de Shanghái, la Universidad de Cambridge y el Gile Auto Research Institute. Se lanzó públicamente en octubre de 2024 junto con su artículo en arXiv (arXiv:2410.06885) y fue aceptado en las actas principales de ACL 2025, uno de los eventos más importantes en el procesamiento del lenguaje natural. El proyecto ha acumulado 14.4k estrellas en GitHub, más de 600,000 descargas mensuales en Hugging Face y 89 variantes ajustadas (fine-tuned) aportadas por la comunidad, lo que lo convierte en uno de los sistemas TTS de código abierto más adoptados desde su lanzamiento. El código tiene licencia MIT; los pesos del modelo preentrenado llevan una licencia CC-BY-NC-4.0 debido al conjunto de datos de entrenamiento Emilia.
El modelo puede clonar una voz a partir de 3 a 15 segundos de audio de referencia sin necesidad de ajustes finos (fine-tuning), produciendo un habla de sonido natural con el timbre y la cadencia del hablante de referencia. Incluye dos variantes principales del modelo: F5TTS_Base (el lanzamiento original de octubre de 2024) y F5TTS_v1_Base (marzo de 2025, con calidad mejorada y una inferencia más rápida). Ambas variantes se ejecutan en hardware NVIDIA, AMD, Intel y Apple Silicon. Un port dedicado a MLX creado por Lucas Newman produce muestras en aproximadamente 4 segundos en un M3 Max. Para los desarrolladores que desean acceso programático sin una API alojada, F5-TTS se integra directamente en los flujos de trabajo de Python a través de su paquete pip, una interfaz web Gradio o CLI. Se combina de forma natural con Whisper para flujos de trabajo de transcripción a voz.
Lo que F5-TTS produce en abril de 2026
La salida del modelo es audio estéreo o mono generado a partir de un vocoder Vocos o BigVGAN, con un factor de tiempo real de 0.15, lo que significa que genera audio aproximadamente 6.7 veces más rápido que el tiempo real en hardware compatible. La inferencia en la mayoría de las entradas de la longitud de una oración se ejecuta en menos de 7 segundos. La estrategia de inferencia Sway Sampling, introducida en el artículo original, reduce significativamente los pasos de eliminación de ruido necesarios sin sacrificar la calidad, lo que le otorga una ventaja práctica sobre los sistemas TTS anteriores basados en difusión que requerían de 50 a 100 pasos DDPM.
El soporte de idiomas principal cubre inglés y chino (mandarín) con un cambio de código (code-switching) fluido entre ellos a mitad de la frase, una capacidad que el artículo evalúa específicamente. La simplicidad de la arquitectura ha atraído ajustes finos de la comunidad para polaco, árabe, turco, indonesio y otros idiomas, aunque estos requieren de 10 a 100 horas de datos de entrenamiento en el idioma para alcanzar la capacidad zero-shot. El modelo F5TTS_v1_Base, lanzado el 12 de marzo de 2025, mejoró la prosodia y la inteligibilidad del modelo base y es el punto de partida recomendado para nuevas implementaciones a partir de abril de 2026.
Los requisitos de hardware son accesibles para los estándares de código abierto. El modelo se carga limpiamente en aproximadamente 3GB de VRAM de la GPU. Los usuarios de Apple Silicon pueden ejecutar el port nativo de MLX sin la pila CUDA. La inferencia solo con CPU es posible pero lenta. El proyecto incluye imágenes Docker y una interfaz Gradio tanto para la inferencia como para el ajuste fino, lo que permite implementarlo en una estación de trabajo doméstica o en una instancia de GPU en la nube. Para los equipos que construyen flujos de trabajo de voz, la salida de F5-TTS se puede encadenar con AudioRead para el procesamiento de audio posterior.
Dónde se sitúa F5-TTS frente a OpenVoice V2 y Coqui XTTS-v2
Las diferencias significativas entre estos tres modelos son arquitectónicas, no superficiales.
OpenVoice V2 (MyShell AI, abril de 2024): OpenVoice utiliza un flujo de trabajo de dos etapas. Primero, un modelo TTS base (MeloTTS) genera un habla natural en un idioma de destino. Luego, un módulo convertidor de color de tono ligero e independiente, basado en la codificación y decodificación de hablantes al estilo VITS, clona el timbre de la voz de referencia por encima. Este desacoplamiento significa que la síntesis y la clonación son pasos independientes. El beneficio es un control explícito y granular sobre la emoción, el acento, el ritmo, las pausas y la entonación como diales separados. La limitación es que la calidad de salida está limitada por el modelo TTS base, y el enfoque de dos etapas introduce artefactos cuando la conversión de timbre se aplica de manera agresiva. OpenVoice V2 también cuenta con una licencia MIT totalmente permisiva, lo que significa que se puede utilizar en productos comerciales sin el requisito de entrenamiento desde cero que impone F5-TTS. OpenVoice V2 es compatible de forma nativa con inglés, español, francés, chino, japonés y coreano desde el primer momento.
Coqui TTS / XTTS-v2 (empresa inactiva, modelo aún activo): XTTS-v2 utiliza un modelo autorregresivo estilo GPT-2 para la predicción de tokens emparejado con un vocoder HiFi-GAN. Debido a que genera tokens de audio de forma secuencial, admite la transmisión (streaming) con aproximadamente 200 ms de tiempo hasta el primer fragmento, lo que lo hace adecuado para aplicaciones de voz en tiempo real. El enfoque de coincidencia de flujo no autorregresivo de F5-TTS genera todos los fotogramas en paralelo mediante la eliminación de ruido, lo que produce una síntesis masiva más rápida pero dificulta arquitectónicamente la transmisión nativa. La mayor ventaja de XTTS-v2 es la cobertura de idiomas: 17 idiomas, incluyendo alemán, italiano, portugués, ruso, polaco, turco, holandés, checo, árabe, japonés, húngaro, coreano e hindi, frente al inglés y chino principales de F5-TTS. Coqui AI cerró a principios de 2024; el modelo es mantenido por el fork de la comunidad "coqui-tts" en PyPI, pero se enfrenta a crecientes problemas de compatibilidad con las versiones modernas de PyTorch. Para los equipos que necesitan clonación de voz en cualquiera de esos 17 idiomas en la actualidad, XTTS-v2 sigue siendo la opción de código abierto predeterminada a pesar del riesgo de mantenimiento.
"La clonación que hizo con la referencia de 10 segundos es sorprendentemente buena. No esperaba que diera un resultado tan exitoso de una manera tan sencilla." - srkngl, HuggingFace Discussions (SWivid/F5-TTS #12), 28 de noviembre de 2024
Frente a alternativas comerciales como ElevenLabs o PlayHT, F5-TTS intercambia la conveniencia y la amplitud multilingüe por un costo continuo de API nulo y total privacidad de los datos. Cada generación permanece en su hardware. Para los desarrolladores que integran funciones de voz en aplicaciones con un alto volumen o datos de audio confidenciales, esa compensación a menudo vale la pena por el esfuerzo de configuración.
La realidad de las licencias y los derechos de autor
F5-TTS tiene una estructura de licencias dividida que toma a muchos desarrolladores por sorpresa. El repositorio de código tiene licencia MIT, que es totalmente permisiva: puede bifurcarlo (fork), modificarlo y usarlo en software comercial sin restricciones. Los pesos del modelo preentrenado, sin embargo, son CC-BY-NC-4.0 debido a su entrenamiento en el conjunto de datos Emilia, que opera bajo sus propios términos CC-BY-NC.
La implicación práctica: no puede utilizar los pesos oficiales del modelo F5TTS_Base o F5TTS_v1_Base en un producto comercial, y esta restricción sobrevive al ajuste fino. El mantenedor lo confirmó directamente en la discusión de GitHub #997: "El modelo base entrenado con Emilia bajo CC-BY-NC tampoco se puede utilizar comercialmente después del ajuste fino". Para construir un producto de voz comercial en la arquitectura F5-TTS, debe entrenar un nuevo modelo base desde cero utilizando datos comercialmente permisivos, sin cargar ningún peso derivado de Emilia como punto de partida. Esto requiere como mínimo de 10 a 100 horas de audio en el idioma y un presupuesto de GPU significativo, lo cual no es trivial para los desarrolladores independientes.
Para proyectos no comerciales (investigación, educación, herramientas personales, proyectos de aficionados), esta estructura de licencias no supone ningún obstáculo. El modelo es genuinamente gratuito para esos fines, y la licencia de código permisiva significa que puede implementarlo como desee. Pero si está creando un producto SaaS, una API de voz comercial o cualquier aplicación monetizada, revise esta restricción cuidadosamente antes de integrar los pesos de F5-TTS. Esta es la ventaja clave que tiene OpenVoice V2 con sus pesos MIT, y por qué ese modelo tiene una mayor adopción comercial a pesar de tener una calidad de salida bruta posiblemente inferior. Herramientas como ComfyUI han navegado de manera similar la presión de la comunidad en torno a los pesos restrictivos de los modelos manteniendo una clara separación entre el código del marco de trabajo con licencia MIT y los términos específicos del modelo.
Dónde F5-TTS se queda corto de manera constante
Varios problemas recurrentes aparecen en los Issues de GitHub, las discusiones de HuggingFace y los canales de la comunidad:
Aceleración de la velocidad en textos largos: El error reportado con mayor consistencia. A las 200 palabras aproximadamente, la velocidad del habla es normal. A las 300 palabras, se acelera notablemente. A más de 500 palabras, la salida es demasiado rápida para entenderse. La causa principal es una fórmula de cálculo de duración en utils_infer.py que subestima el tiempo requerido a medida que crece la longitud del texto. El usuario hotdogarea documentó la compresión progresiva en el Issue de GitHub #811 (febrero de 2025): 42 caracteres a 0.051 seg/carácter, 146 caracteres a 0.014 seg/carácter, 374 caracteres a 0.006 seg/carácter. El problema se cerró, pero el comportamiento subyacente persiste en los flujos de trabajo de documentos largos.
Desviación de dependencias que causa salidas ininteligibles: Entre enero y marzo de 2025, varios usuarios en la demostración pública de HuggingFace (mrfakename/E2-F5-TTS) experimentaron un audio que se degradaba en una salida ininteligible y distorsionada después de funcionar correctamente al principio. El usuario bigbrotherr lo describió como "galimatías y basura" después de 13 intentos. La causa principal fue la desviación de dependencias entre el Space y el repositorio principal; la solución requirió volver a clonar en un entorno virtual nuevo. Esta es una realidad esperada de los modelos autoalojados, pero vale la pena planificarla en las implementaciones de producción.
"Estoy usando el mismo audio y texto que funcionaba antes, pero después de no usarlo desde el 10/1/25, la salida ahora es solo un galimatías." - gmirsky2, HuggingFace Spaces (mrfakename/E2-F5-TTS discussion #48), 11 de marzo de 2025
Complejidad de instalación en macOS: Ejecutar F5-TTS en Apple Silicon requiere una configuración cuidadosa, específicamente evitando los paquetes CUDA administrados por conda (que no existen para M2/M3) y habilitando el respaldo de MPS a través de una variable de entorno. Los usuarios que instalan sin comprender estas restricciones comúnmente ven una mala calidad de audio o bloqueos antes de resolver la configuración.
Salida sin transmisión (non-streaming): La arquitectura de coincidencia de flujo es inherentemente no autorregresiva: genera todos los fotogramas de audio a través de un proceso de eliminación de ruido en paralelo. Esto significa que no puede transmitir audio a un altavoz a medida que llegan los tokens, de la forma en que puede hacerlo XTTS-v2. El clip completo debe generarse antes de que comience la reproducción. Para aplicaciones de voz conversacionales o uso en tiempo real de baja latencia, este es un límite arquitectónico estricto.
Cobertura de idiomas limitada de fábrica: A pesar de que el artículo se presenta como "multilingüe", en la práctica el modelo predeterminado maneja bien el inglés y el chino. Otros idiomas requieren un ajuste fino con datos sustanciales en el idioma. El foro de discusiones de GitHub muestra esfuerzos activos de la comunidad para árabe, polaco, indonesio y turco, pero estos son aportados por la comunidad, no mantenidos oficialmente.
Para quién es F5-TTS
Úselo cuando: Necesite clonación de voz de alta calidad para contenido no comercial en inglés o chino y desee cero costos continuos de API. Destaca en la narración de audiolibros (genere capítulos a partir de un clip de referencia de 15 segundos de su propia voz), diálogos de juegos independientes (genere todas las líneas de los NPC localmente sin tarifas por carácter) y producción de podcasts (mantenga una voz consistente en todo el contenido sin volver a grabar). Los investigadores que trabajan en TTS, conversión de voz o síntesis de voz encontrarán que la licencia de código MIT y la arquitectura DiT limpia son fáciles de extender. Si está desarrollando en Apple Silicon y desea un flujo de trabajo MLX nativo sin CUDA, el port de la comunidad está listo para producción. F5-TTS también se integra de forma natural con Whisper para flujos de trabajo de bucle cerrado de transcripción a voz clonada, y con los patrones de ajuste fino de Coqui TTS para equipos que ya están familiarizados con los flujos de trabajo de voz de código abierto.
Evítelo cuando: Su proyecto sea comercial y no pueda entrenar desde cero con datos compatibles con CC-BY. Evítelo si necesita una cobertura sólida de más de dos idiomas sin una inversión significativa en ajustes finos. Evítelo si su aplicación requiere transmisión de audio en tiempo real (asistentes conversacionales de baja latencia, síntesis de voz en vivo). Evítelo si su equipo carece de experiencia en la gestión de entornos de Python, ya que los problemas de dependencias son el modo de fallo más común. Para TTS multilingüe de grado comercial, ElevenLabs o PlayHT ofrecen API administradas con una cobertura de idiomas más amplia, confiabilidad alojada y términos comerciales claros, a costos por carácter que vale la pena evaluar frente a los gastos operativos del autoalojamiento.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen F5-TTS.
Artículos relacionados
Guías y artículos relacionados con F5-TTS.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

What People Are Building With Claude Fable 5 (And Which Viral Demos Are Fake)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
