Aller au contenu principal
Vantaige
Coqui TTS screenshot
Coqui TTS logo

Coqui TTS

Gratuit

Coqui TTS est un framework open source de synthèse vocale (text-to-speech) articulé autour de XTTS v2, un modèle de clonage vocal capable de cloner n'importe quelle voix à partir de 6 secondes d'audio dans 17 langues. Son utilisation locale est gratuite pour les projets non commerciaux ; l'entreprise qui l'a créé a fermé ses portes en janvier 2024.

Cas d'usage :Audio & Musique
Fonctionnalités :Open Source

Coqui TTS est une boîte à outils de deep learning pour la synthèse vocale et le clonage de voix, conçue par l'équipe à l'origine du projet TTS de Mozilla après leur scission en tant qu'entreprise indépendante en 2021. Pendant trois ans, il s'est imposé comme l'alternative open source la plus performante aux plateformes commerciales de synthèse vocale, avec pour point d'orgue XTTS v2 en novembre 2023 : un modèle capable de cloner n'importe quelle voix à partir d'un extrait audio de référence de 6 secondes et de synthétiser la parole dans 17 langues. Puis, le 3 janvier 2024, le fondateur Josh Meyer a annoncé la fermeture de l'entreprise. Le dépôt d'origine sur github.com/coqui-ai/TTS est désormais archivé et ne compte plus aucun mainteneur actif de l'équipe fondatrice. Un fork communautaire maintenu et géré par l'Idiap Research Institute (github.com/idiap/coqui-ai-TTS) poursuit le projet, avec la sortie de la version v0.27.5 en janvier 2026.

La bibliothèque intègre plus d'une douzaine d'architectures de modèles, dont VITS, GlowTTS et FastSpeech2, ainsi que des outils de conversion vocale. Son fleuron est XTTS v2, un modèle autorégressif de type GPT qui combine la tokenisation audio VQ-VAE avec un vocodeur UnivNet pour une sortie à 24kHz avec une latence de streaming inférieure à 200ms sur un GPU grand public. Il prend en charge le clonage vocal multilingue : clonez une voix en anglais, puis synthétisez cette même voix parlant français ou japonais. La boîte à outils comprend des scripts d'entraînement pour le fine-tuning sur des données de locuteurs personnalisées, des API en ligne de commande et Python, ainsi que des intégrations Hugging Face. En avril 2026, les poids du modèle XTTS v2 sont téléchargés 7.4 millions de fois par mois depuis Hugging Face, ce qui le place parmi les modèles TTS auto-hébergés les plus utilisés au monde.

Ce que produit Coqui TTS en avril 2026

Le paquet installable actuel est pip install coqui-tts, maintenu par l'Idiap Research Institute. Il intègre XTTS v2 comme modèle multilingue par défaut, aux côtés d'une bibliothèque de plus de 1,100 modèles supplémentaires via les intégrations Fairseq. XTTS v2 génère un son mono à 24kHz avec une latence de streaming du premier token inférieure à 200ms sur un GPU NVIDIA de milieu de gamme. La qualité du clonage vocal dépend fortement de l'audio de référence : un enregistrement propre, avec un micro proche dans une pièce calme, produit des résultats nettement meilleurs qu'un extrait téléphonique compressé. Le modèle gère le transfert d'émotion et de style via l'échantillon de référence, de sorte qu'un extrait de référence enthousiaste donne un résultat enthousiaste.

Langues prises en charge par XTTS v2 : anglais, espagnol, français, allemand, italien, portugais, polonais, turc, russe, néerlandais, tchèque, arabe, chinois (mandarin), japonais, hongrois, coréen et hindi. La synthèse inter-langues fonctionne bien pour les paires de langues européennes ; les résultats se dégradent pour des paires de langues plus éloignées comme l'arabe vers le japonais. La bibliothèque intègre également Bark (pour l'audio expressif non vocal), plusieurs modèles VITS pour les tâches unilingues, et des modèles de conversion vocale (FreeVC, kNN-VC, OpenVoice) pour des transferts de locuteurs avec correspondance de hauteur sans synthèse TTS complète.

Pour les tâches unilingues où la précision de la prononciation prime sur l'expressivité, les modèles VITS, plus spécialisés, surpassent souvent XTTS v2. Les discussions de la communauté soulignent que XTTS v2 bute parfois sur les noms propres et la terminologie technique ; le développement préalable des abréviations et des chiffres dans le texte d'entrée réduit considérablement les erreurs.

Où se situe Coqui TTS par rapport à ElevenLabs et Bark

La comparaison la plus pertinente pour la plupart des utilisateurs choisissant Coqui TTS se fait avec ElevenLabs (le leader commercial en termes de qualité) et Bark de Suno (l'autre grande option open source).

ElevenLabs fonctionne comme une API cloud à source fermée sans option d'auto-hébergement. Son modèle Multilingual v2 prend en charge plus de 30 langues contre 17 pour XTTS v2. Le niveau Professional Voice Clone effectue un fine-tuning sur votre audio et produit des résultats qui passent régulièrement les tests humains en double aveugle ; l'Instant Voice Clone nécessite environ une minute d'audio. Une différence mécanique cruciale : ElevenLabs échantillonne le débit de parole directement à partir de l'audio de référence. XTTS v2 utilise un prédicteur de durée distinct entraîné sur son corpus de base plutôt que sur votre échantillon, ce qui signifie que la voix clonée parle à une cadence tirée des données d'entraînement moyennées plutôt que de votre enregistrement. Lors de tests indépendants, le même script de 18 mots a duré 76 secondes dans Coqui contre 20-22 secondes pour les moteurs commerciaux qui échantillonnent le rythme à partir de l'extrait de référence. ElevenLabs commence à $22/mois (forfait Creator) pour les droits commerciaux. XTTS v2 sous CPML est gratuit mais réservé à un usage non commercial.

Bark de Suno est également open source et utilise une licence MIT pour le code et les poids du modèle, ce qui le rend entièrement utilisable à des fins commerciales sans restrictions. Son architecture utilise trois transformers de type GPT avec environ 80 millions de paramètres chacun, fonctionnant sur des tokens audio EnCodec. La surface générative de Bark est plus large que celle de XTTS v2 : il produit de la parole, de la musique, des bruits de fond et des vocalisations non verbales (rires, respirations, soupirs) en un seul passage à partir d'un prompt textuel. Le compromis majeur est que Bark ne prend pas en charge nativement le clonage vocal zero-shot de locuteurs arbitraires ; il utilise des préréglages de locuteurs définis. Des forks communautaires ajoutent la capacité de clonage vocal via des outils de conversion externes, mais les résultats sont inconstants. Pour une TTS pure avec une cohérence du locuteur et un clonage inter-langues, XTTS v2 est plus fiable. Pour la génération audio créative intégrant des émotions et des effets sonores, Bark offre une palette plus large.

"Je dirais que c'est actuellement la meilleure boîte à outils open source de synthèse et de clonage vocal disponible en ce moment." - bachittle, GitHub Issues, janvier 2024
"La technologie qui la sous-tend est incroyable et ce serait formidable pour la communauté OSS si le modèle devenait open source." - fakerybakery, GitHub Issues, janvier 2024

La réalité des licences et des droits d'auteur

La situation des licences pour Coqui TTS est divisée, et cette division a une grande importance selon ce que vous construisez.

Le code de la bibliothèque est sous licence Mozilla Public License 2.0 (MPL 2.0), qui autorise une utilisation commerciale. Si vous écrivez vos propres modèles ou n'utilisez que des modèles sous licence Apache 2.0 au sein du framework, vous ne rencontrez aucune restriction commerciale sur le code lui-même.

Les poids du modèle XTTS v2 sont sous licence Coqui Public Model License 1.0.0 (CPML). La CPML autorise une utilisation non commerciale : recherche personnelle, projets amateurs, travaux académiques et utilisation caritative. Elle trace la limite aux activités génératrices de revenus. Avant la fermeture de janvier 2024, Coqui proposait des licences commerciales XTTS à $365/an pour les entreprises ayant moins de $1M de revenus ou de financement. Ce programme de licence n'existe plus car l'entreprise n'existe plus. Il n'y a aucune entité auprès de laquelle acheter une licence commerciale.

Cela crée un véritable obstacle pour les développeurs qui créent des produits commerciaux. Sur Hacker News, un contributeur a résumé le problème clairement : "J'aimerais beaucoup travailler davantage dessus, mais je crains que ce ne soit un peu une impasse en raison de l'incertitude quant à l'avenir de la licence." Un autre utilisateur a noté : "Le modèle XTTS est toujours sous CPML, ce qui n'autorise pas l'utilisation commerciale", tandis qu'un troisième a précisé que les licences du code (MPL 2.0) et les licences des modèles pré-entraînés sont distinctes et non interchangeables.

Dans la pratique, la communauté n'a pas résolu ce problème. Certains développeurs utilisent XTTS v2 commercialement et considèrent le risque d'application de la loi comme faible étant donné que Coqui n'existe plus en tant qu'entité légale. D'autres préfèrent passer aux modèles VITS sous Apache 2.0 au sein du même framework, acceptant une qualité de clonage vocal inférieure en échange de droits commerciaux clairs. Les poids sous licence MIT de Bark offrent une alternative entièrement commerciale si la qualité du clonage est moins critique. L'applicabilité légale de la CPML en vertu de la loi américaine sur le droit d'auteur pour les résultats générés par l'IA reste contestée.

Là où Coqui TTS montre ses limites

Installation GPU sous Windows. Sur Windows natif, l'accélération GPU échoue même lorsque CUDA est correctement installé. La solution de contournement de la communauté est WSL (Windows Subsystem for Linux) ou une machine virtuelle Ubuntu. Les utilisateurs qui s'attendent à un programme d'installation standard sont régulièrement surpris. "Jour 3 à essayer d'installer sur Windows 11. Prêt à abandonner et à payer pour ElevenLabs" a circulé dans les canaux de la communauté tout au long de 2024. À partir de la version 0.27.4, PyTorch n'est plus inclus et doit être installé séparément avec la bonne version de CUDA ou ROCm, ce qui ajoute une étape supplémentaire.

Vitesse d'inférence CPU. Sans GPU, XTTS v2 génère environ une phrase toutes les 30 à 60 secondes. Sur un GPU (4GB de VRAM minimum, 8GB recommandés), la même phrase prend 2 à 5 secondes. Pour quiconque ne disposant pas d'un GPU NVIDIA ou AMD dédié, l'outil est pratiquement inutilisable pour des flux de travail interactifs.

Décalage du rythme vocal. Étant donné que le prédicteur de durée de XTTS v2 est entraîné sur les données du corpus de base plutôt que sur votre extrait de référence, la voix clonée parle à un rythme moyen, et non au rythme naturel du locuteur. Dans des comparaisons documentées, cela a produit un résultat 3 à 4 fois plus long que le même texte provenant de moteurs commerciaux qui échantillonnent le débit de parole à partir de l'audio de référence.

Débordement d'accent dans la synthèse inter-langues. Des tests indépendants ont révélé que les caractéristiques d'accent de la langue de référence débordent sur les langues cibles. Un extrait source avec un accent allemand a produit un résultat en français avec une inflexion allemande.

Cadence de maintenance plus lente. Le fork de l'Idiap est activement maintenu et a publié la version v0.27.5 en janvier 2026, mais le rythme de développement des fonctionnalités et de résolution des problèmes est plus lent que lorsque l'entreprise Coqui publiait des mises à jour hebdomadaires. Les problèmes ouverts sur le dépôt d'origine archivé ne reçoivent pas de réponses. La qualité du support communautaire est variable.

À qui s'adresse Coqui TTS

Coqui TTS est conçu pour les développeurs et les chercheurs qui ont besoin d'un clonage vocal multilingue auto-hébergé et qui disposent de l'infrastructure GPU et de l'expérience Python nécessaires pour le déployer. C'est la meilleure option open source pour le clonage vocal non commercial, en particulier dans plusieurs langues. Les applications sensibles à la confidentialité, la recherche académique et les projets personnels nécessitant une génération de parole reproductible et contrôlée localement y trouvent naturellement leur compte.

Les équipes qui créent des flux de narration de livres audio, des pipelines de dialogues de PNJ pour les jeux ou des outils d'accessibilité pour un déploiement local peuvent utiliser XTTS v2 efficacement une fois l'étape d'installation passée. La prise en charge du fine-tuning signifie que vous pouvez vous entraîner sur un discours spécifique à un domaine (terminologie médicale, prononciations de marques) sans envoyer de données à une API tierce.

Évitez Coqui TTS si : Vous créez un produit commercial qui utilise XTTS v2, car la CPML bloque l'utilisation commerciale et aucune licence n'est disponible. Vous avez besoin de plus de 17 langues ou souhaitez des contrôles d'émotion prêts à l'emploi avec une interface à curseurs (ElevenLabs est la solution dans ce cas). Vous êtes un utilisateur non technique sans accès à un GPU ; la courbe d'apprentissage est abrupte et l'inférence CPU est trop lente pour être utile. Vous avez besoin de la génération de musique et d'effets sonores dans le style de Bark de Suno en plus de la parole. Si la clarté de la licence commerciale est obligatoire et que l'open source est requis, Bark sous licence MIT est l'alternative la plus sûre malgré son absence de clonage vocal natif.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant Coqui TTS.

Articles associés

Guides et articles en lien avec Coqui TTS.