

F5-TTS est un modèle de synthèse vocale open source qui clone n'importe quelle voix à partir d'un échantillon audio de 10 à 15 secondes en utilisant le flow matching. Développé par des chercheurs de la Shanghai Jiao Tong University et de Cambridge, il s'exécute entièrement sur du matériel local sans aucun coût d'API.
F5-TTS est un système de synthèse vocale (TTS) entièrement non autorégressif basé sur le flow matching avec une architecture Diffusion Transformer, développé par des chercheurs de la Shanghai Jiao Tong University, de l'University of Cambridge et du Gile Auto Research Institute. Il a été rendu public en octobre 2024 en même temps que son article arXiv (arXiv:2410.06885) et a été accepté dans les actes principaux de l'ACL 2025, l'une des conférences les plus prestigieuses en traitement du langage naturel. Le projet a accumulé 14,4k étoiles sur GitHub, plus de 600 000 téléchargements mensuels sur Hugging Face et 89 variantes affinées (fine-tuned) par la communauté, ce qui en fait l'un des systèmes TTS open source les plus adoptés depuis son lancement. Le code est sous licence MIT ; les poids du modèle pré-entraîné portent une licence CC-BY-NC-4.0 en raison du jeu de données d'entraînement Emilia.
Le modèle peut cloner une voix à partir de 3 à 15 secondes d'audio de référence sans aucun fine-tuning, produisant une parole au son naturel avec le timbre et la cadence du locuteur de référence. Il propose deux variantes principales de modèle : F5TTS_Base (la version originale d'octobre 2024) et F5TTS_v1_Base (mars 2025, avec une qualité améliorée et une inférence plus rapide). Les deux variantes fonctionnent sur du matériel NVIDIA, AMD, Intel et Apple Silicon. Un portage MLX dédié par Lucas Newman produit des échantillons en environ 4 secondes sur un M3 Max. Pour les développeurs qui souhaitent un accès programmatique sans API hébergée, F5-TTS s'intègre directement dans les pipelines Python via son package pip, une interface web Gradio ou en CLI. Il s'associe naturellement avec Whisper pour les flux de travail de transcription vers la parole.
Ce que F5-TTS produit en avril 2026
La sortie du modèle est un audio stéréo ou mono généré à partir d'un vocodeur Vocos ou BigVGAN, avec un facteur temps réel (RTF) de 0.15, ce qui signifie qu'il génère l'audio environ 6,7 fois plus vite que le temps réel sur le matériel pris en charge. L'inférence sur la plupart des entrées de la longueur d'une phrase s'exécute en moins de 7 secondes. La stratégie d'inférence Sway Sampling, introduite dans l'article original, réduit considérablement les étapes de débruitage nécessaires sans sacrifier la qualité, lui donnant un avantage pratique sur les systèmes TTS basés sur la diffusion plus anciens qui nécessitaient 50 à 100 étapes DDPM.
La prise en charge des langues principales couvre l'anglais et le chinois (mandarin) avec une alternance codique (code-switching) fluide entre les deux au milieu d'un énoncé, une capacité que l'article évalue spécifiquement. La simplicité de l'architecture a attiré des fine-tunes de la communauté pour le polonais, l'arabe, le turc, l'indonésien et d'autres langues, bien que ceux-ci nécessitent 10 à 100 heures de données d'entraînement dans la langue pour atteindre une capacité zero-shot. Le modèle F5TTS_v1_Base, sorti le 12 mars 2025, a amélioré la prosodie et l'intelligibilité du modèle de base et constitue le point de départ recommandé pour les nouveaux déploiements à partir d'avril 2026.
Les exigences matérielles sont abordables pour les standards open source. Le modèle se charge proprement dans environ 3 Go de VRAM GPU. Les utilisateurs d'Apple Silicon peuvent exécuter le portage natif MLX sans la pile CUDA. L'inférence sur CPU uniquement est possible mais lente. Le projet fournit des images Docker et une interface Gradio pour l'inférence et le fine-tuning, ce qui le rend déployable sur une station de travail personnelle ou une instance GPU cloud. Pour les équipes qui construisent des pipelines vocaux, la sortie de F5-TTS peut être chaînée avec AudioRead pour le traitement audio en aval.
Où se situe F5-TTS par rapport à OpenVoice V2 et Coqui XTTS-v2
Les différences significatives entre ces trois modèles sont architecturales, et non superficielles.
OpenVoice V2 (MyShell AI, avril 2024) : OpenVoice utilise un pipeline en deux étapes. Tout d'abord, un modèle TTS de base (MeloTTS) génère une parole naturelle dans une langue cible. Ensuite, un module convertisseur de couleur de ton léger et distinct, basé sur un encodage et décodage de locuteur de style VITS, clone le timbre de la voix de référence par-dessus. Ce découplage signifie que la synthèse et le clonage sont des étapes indépendantes. L'avantage est un contrôle explicite et granulaire sur l'émotion, l'accent, le rythme, les pauses et l'intonation comme des paramètres distincts. La limite est que la qualité de sortie est restreinte par le modèle TTS de base, et l'approche en deux étapes introduit des artefacts lorsque la conversion de timbre est appliquée de manière agressive. OpenVoice V2 bénéficie également d'une licence MIT entièrement permissive, ce qui signifie qu'il peut être utilisé dans des produits commerciaux sans l'exigence d'entraînement à partir de zéro qu'impose F5-TTS. OpenVoice V2 prend en charge nativement l'anglais, l'espagnol, le français, le chinois, le japonais et le coréen dès le départ.
Coqui TTS / XTTS-v2 (entreprise disparue, modèle toujours actif) : XTTS-v2 utilise un modèle autorégressif de style GPT-2 pour la prédiction de tokens, associé à un vocodeur HiFi-GAN. Parce qu'il génère des tokens audio de manière séquentielle, il prend en charge le streaming avec un temps d'environ 200 ms pour le premier fragment, ce qui le rend adapté aux applications vocales en temps réel. L'approche de flow matching non autorégressive de F5-TTS génère toutes les trames en parallèle via le débruitage, ce qui produit une synthèse en masse plus rapide mais rend le streaming natif architecturalement difficile. Le plus grand avantage de XTTS-v2 est sa couverture linguistique : 17 langues dont l'allemand, l'italien, le portugais, le russe, le polonais, le turc, le néerlandais, le tchèque, l'arabe, le japonais, le hongrois, le coréen et le hindi, contre principalement l'anglais et le chinois pour F5-TTS. Coqui AI a fermé ses portes début 2024 ; le modèle est maintenu par le fork communautaire "coqui-tts" sur PyPI mais fait face à des problèmes de compatibilité croissants avec les versions modernes de PyTorch. Pour les équipes ayant besoin de clonage vocal dans l'une de ces 17 langues aujourd'hui, XTTS-v2 reste l'option open source par défaut malgré le risque lié à la maintenance.
"Le clonage qu'il a réalisé avec la référence de 10 secondes est étonnamment bon. Je ne m'attendais pas à ce qu'il donne un résultat aussi réussi d'une manière aussi simple." - srkngl, HuggingFace Discussions (SWivid/F5-TTS #12), 28 novembre 2024
Face à des alternatives commerciales comme ElevenLabs ou PlayHT, F5-TTS échange la commodité et l'étendue multilingue contre l'absence de coûts d'API récurrents et une confidentialité totale des données. Chaque génération reste sur votre matériel. Pour les développeurs intégrant des fonctionnalités vocales dans des applications avec un volume élevé ou des données audio sensibles, ce compromis vaut souvent la peine d'assumer la charge de configuration.
La réalité des licences et des droits d'auteur
F5-TTS possède une structure de licence scindée qui prend de nombreux développeurs au dépourvu. Le dépôt de code est sous licence MIT, qui est entièrement permissive : vous pouvez le forker, le modifier et l'utiliser dans des logiciels commerciaux sans restriction. Les poids du modèle pré-entraîné, cependant, sont sous licence CC-BY-NC-4.0 en raison de leur entraînement sur le jeu de données Emilia, qui fonctionne sous ses propres termes CC-BY-NC.
L'implication pratique : vous ne pouvez pas utiliser les poids officiels des modèles F5TTS_Base ou F5TTS_v1_Base dans un produit commercial, et cette restriction subsiste après le fine-tuning. Le mainteneur l'a confirmé directement dans la discussion GitHub #997 : "Le modèle de base entraîné sur Emilia sous CC-BY-NC ne peut pas être utilisé commercialement, même après fine-tuning." Pour construire un produit vocal commercial sur l'architecture F5-TTS, vous devez entraîner un nouveau modèle de base à partir de zéro en utilisant des données commercialement permissives, sans charger aucun poids dérivé d'Emilia comme point de départ. Cela nécessite au minimum 10 à 100 heures d'audio dans la langue et un budget GPU significatif, ce qui n'est pas négligeable pour des développeurs indépendants.
Pour les projets non commerciaux (recherche, éducation, outils personnels, projets amateurs), cette structure de licence ne pose aucun obstacle. Le modèle est véritablement gratuit pour ces usages, et la licence de code permissive signifie que vous pouvez le déployer comme bon vous semble. Mais si vous construisez un produit SaaS, une API vocale commerciale ou toute application monétisée, examinez attentivement cette contrainte avant d'intégrer les poids de F5-TTS. C'est l'avantage clé que détient OpenVoice V2 avec ses poids sous licence MIT, et la raison pour laquelle ce modèle connaît une plus grande adoption commerciale malgré une qualité de sortie brute sans doute inférieure. Des outils comme ComfyUI ont de la même manière géré la pression de la communauté autour des poids de modèles restrictifs en maintenant une séparation nette entre le code du framework sous licence MIT et les conditions spécifiques aux modèles.
Là où F5-TTS montre systématiquement ses limites
Plusieurs problèmes récurrents apparaissent dans les Issues GitHub, les discussions HuggingFace et les canaux communautaires :
Accélération de la vitesse sur les textes longs : Le bug le plus fréquemment signalé. À environ 200 mots, la vitesse d'élocution est normale. À 300 mots, elle s'accélère sensiblement. À plus de 500 mots, la sortie est trop rapide pour être comprise. La cause principale est une formule de calcul de durée dans utils_infer.py qui sous-estime le temps requis à mesure que la longueur du texte augmente. L'utilisateur hotdogarea a documenté la compression progressive dans l'Issue GitHub #811 (février 2025) : 42 caractères à 0,051 sec/car, 146 caractères à 0,014 sec/car, 374 caractères à 0,006 sec/car. L'issue a été fermée mais le comportement sous-jacent persiste dans les flux de travail sur des documents longs.
Dérive des dépendances provoquant un charabia en sortie : Entre janvier et mars 2025, plusieurs utilisateurs de la démo publique HuggingFace (mrfakename/E2-F5-TTS) ont constaté que l'audio se dégradait en une sortie brouillée et inintelligible après avoir fonctionné correctement au départ. L'utilisateur bigbrotherr l'a décrit comme "du charabia et des déchets" après 13 tentatives. La cause principale était une dérive des dépendances entre le Space et le dépôt principal ; le correctif nécessitait de cloner à nouveau dans un environnement virtuel vierge. C'est une réalité attendue des modèles auto-hébergés, mais il convient de la prévoir pour les déploiements en production.
"J'utilise le même audio et le même texte qui fonctionnaient auparavant, mais après ne pas l'avoir utilisé depuis le 10/01/25, la sortie n'est plus que du charabia." - gmirsky2, HuggingFace Spaces (mrfakename/E2-F5-TTS discussion #48), 11 mars 2025
Complexité de l'installation sur macOS : L'exécution de F5-TTS sur Apple Silicon nécessite une configuration minutieuse, en évitant spécifiquement les packages CUDA gérés par conda (qui n'existent pas pour M2/M3) et en activant le repli MPS via une variable d'environnement. Les utilisateurs qui l'installent sans comprendre ces contraintes constatent généralement une mauvaise qualité audio ou des plantages avant de résoudre la configuration.
Sortie sans streaming : L'architecture de flow matching est intrinsèquement non autorégressive : elle génère toutes les trames audio via un processus de débruitage parallèle. Cela signifie que vous ne pouvez pas diffuser l'audio vers un haut-parleur au fur et à mesure que les tokens arrivent, comme le fait XTTS-v2. Le clip complet doit être généré avant que la lecture ne commence. Pour les applications vocales conversationnelles ou une utilisation en temps réel à faible latence, il s'agit d'une limite architecturale stricte.
Couverture linguistique limitée par défaut : Bien que l'article le présente comme "multilingue", dans la pratique, le modèle par défaut gère bien l'anglais et le chinois. Les autres langues nécessitent un fine-tuning avec des données substantielles dans la langue cible. Le forum de discussions GitHub montre des efforts actifs de la communauté pour l'arabe, le polonais, l'indonésien et le turc, mais ce sont des contributions de la communauté, non maintenues officiellement.
À qui s'adresse F5-TTS
Utilisez-le quand : Vous avez besoin d'un clonage vocal de haute qualité pour du contenu non commercial en anglais ou en chinois et que vous ne voulez aucun coût d'API récurrent. Il excelle pour la narration de livres audio (générer des chapitres à partir d'un clip de référence de 15 secondes de votre propre voix), les dialogues de jeux indépendants (générer toutes les répliques des PNJ localement sans frais par caractère) et la production de podcasts (maintenir une voix cohérente sur l'ensemble du contenu sans réenregistrer). Les chercheurs travaillant sur le TTS, la conversion vocale ou la synthèse vocale trouveront la licence de code MIT et l'architecture DiT épurée faciles à étendre. Si vous développez sur Apple Silicon et souhaitez un flux de travail MLX natif sans CUDA, le portage communautaire est prêt pour la production. F5-TTS s'intègre également naturellement avec Whisper pour des pipelines en boucle fermée de transcription vers la parole clonée, et avec les modèles de fine-tuning de Coqui TTS pour les équipes déjà familières avec les flux de travail vocaux open source.
Ignorez-le quand : Votre projet est commercial et vous ne pouvez pas l'entraîner à partir de zéro sur des données compatibles CC-BY. Ignorez-le si vous avez besoin d'une couverture robuste de plus de deux langues sans un investissement significatif en fine-tuning. Ignorez-le si votre application nécessite un streaming audio en temps réel (assistants conversationnels à faible latence, synthèse vocale en direct). Ignorez-le si votre équipe manque d'expérience en gestion d'environnement Python, car les problèmes de dépendances sont le mode de défaillance le plus courant. Pour un TTS multilingue de qualité commerciale, ElevenLabs ou PlayHT proposent des API gérées avec une couverture linguistique plus large, une fiabilité hébergée et des conditions commerciales claires, à des coûts par caractère qui valent la peine d'être évalués par rapport à la charge opérationnelle de l'auto-hébergement.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant F5-TTS.
Articles associés
Guides et articles en lien avec F5-TTS.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

What People Are Building With Claude Fable 5 (And Which Viral Demos Are Fake)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
