

Cartesia AI développe l'API de synthèse vocale Sonic sur une architecture novatrice de modèle d'espace d'état (State Space Model), atteignant un délai de 90ms avant le premier son (TTFA) pour les agents vocaux en temps réel. Fondée par les chercheurs à l'origine de Mamba, soutenue par NVIDIA et Kleiner Perkins avec $122M levés.
Cartesia est une entreprise d'IA vocale fondée en 2023 par les chercheurs du Stanford AI Lab Albert Gu, Karan Goel, Chris Re et Arjun Desai, la même équipe qui a inventé l'architecture Mamba State Space Model (SSM) utilisée dans l'apprentissage automatique. Leur produit phare est Sonic, une API de synthèse vocale (TTS) qui ne repose pas sur des transformers, mais sur des SSM, qui traitent les séquences en mettant à jour un vecteur d'état compressé plutôt qu'en prêtant attention à chaque token précédent. Le résultat pratique est un modèle qui atteint un délai de 90ms avant le premier son (TTFA) sur la variante standard Sonic-3, et 40ms sur Sonic Turbo, ce qui en fait l'API TTS de qualité humaine la plus rapide disponible pour les applications conversationnelles en temps réel. Cartesia a levé environ $122M au total, dont un tour de table de $100M en novembre 2025 auprès de Kleiner Perkins, Index Ventures, Lightspeed et NVIDIA.
Sonic-3, le modèle de production actuel, prend en charge 42 langues, ~130 voix prédéfinies et des contrôles de prosodie précis incluant la vitesse, la hauteur et des balises d'émotion explicites. Les développeurs peuvent injecter des rires naturels en utilisant une balise [laughter] directement dans le prompt textuel. Le clonage vocal fonctionne à partir de seulement 3 secondes d'audio source, générant une voix correspondant au locuteur qui préserve l'accent, la cadence et le caractère tonal. Au-delà du TTS, la plateforme de Cartesia inclut désormais Ink-Whisper (reconnaissance vocale), un point de terminaison Voice Changer pour la transformation audio, un point de terminaison Infill pour l'édition audio, et Line, un produit d'agent vocal géré construit sur Sonic. Les déploiements d'entreprise prennent en charge l'inférence sur site (on-premise) et sur appareil (on-device), avec une conformité SOC-2 et HIPAA pour les secteurs réglementés.
Ce que Cartesia propose en avril 2026
Sonic-3 est le modèle par défaut actuel. Il génère une sortie audio en streaming commençant à 90ms de TTFA, de l'appel API au premier octet audio, mesuré dans des conditions de réseau standard. La variante Turbo descend à 40ms au prix d'une limite d'entrée de 500 caractères par requête et d'un plafond de qualité plus restreint. Les deux modèles utilisent l'inférence SSM, ce qui signifie que l'audio est diffusé token par token à la vitesse de lecture plutôt que de générer un clip complet avant de le renvoyer. Cette architecture nativement conçue pour le streaming explique pourquoi les agents vocaux construits sur Cartesia semblent si réactifs lors des conversations : l'utilisateur entend l'IA commencer à parler à peu près en même temps qu'un humain le ferait.
La prise en charge linguistique de Sonic-3 couvre 42 langues avec des voix à l'accent natif, contre 15 dans le Sonic original et 15 dans Sonic-2 à son lancement. La personnalisation de la voix offre des réglages de vitesse (taux de lecture), de décalage de hauteur, des cadrans d'émotion (calme, en colère, excité, triste, et autres), ainsi que la balise d'injection de rire. Le Pro Voice Cloning, disponible à partir du forfait Startup, entraîne un modèle de locuteur à partir d'un court échantillon audio et est facturé 1.5 crédits par caractère au lieu du tarif standard de 1 crédit par caractère. La plateforme publie des SLA de disponibilité de 99.9% et revendique les latences P90 les plus rapides au monde sur l'ensemble de son déploiement CDN.
Goodcall, une entreprise d'agents téléphoniques IA pour les professionnels, a déployé 2,217 agents vocaux uniques sur Sonic dans les trois mois suivant sa transition. Leur PDG a décrit le résultat de manière directe :
"Sonic est le seul produit existant avec une latence de modèle inférieure à 100 ms, surpassant sa meilleure alternative d'un facteur quatre." - Bob Summers, PDG de Goodcall, étude de cas client Cartesia, 2025
Où se situe Cartesia par rapport à ElevenLabs et Resemble AI
Le marché du TTS en 2026 est globalement divisé entre les outils de création de contenu à usage général et l'infrastructure d'agents en temps réel. Cartesia se positionne sur ce dernier axe. Les différences mécaniques entre les trois principaux concurrents sont importantes pour faire le bon choix.
ElevenLabs exécute un TTS basé sur des transformers. L'inférence des transformers prête attention à chaque token précédent dans la séquence, ce qui passe bien à l'échelle pour la qualité de la narration longue mais ajoute une surcharge par token. Leur modèle Flash v2.5 atteint environ 75ms de TTFA, ce qui est compétitif avec Cartesia Turbo. Cependant, les modèles de niveau qualité d'ElevenLabs fonctionnent à 300ms ou plus de TTFA, et leur bibliothèque vocale est considérablement plus vaste : plus de 4,000 voix prédéfinies dans plus de 70 langues contre environ 130 voix et 42 langues pour Cartesia. Lors d'un test de préférence à l'aveugle sur 100 voix exclues de l'entraînement, les utilisateurs ont préféré Sonic-2 à ElevenLabs Flash V2 à 61.4% contre 38.6% pour des extraits conversationnels. Le clonage vocal pour ElevenLabs nécessite un minimum de 10 secondes d'audio ; le clonage instantané de Cartesia fonctionne à partir de 3 secondes. La répartition pratique : ElevenLabs pour les bibliothèques vocales riches, le doublage, la narration longue et le contenu multilingue où l'étendue des langues est importante. Cartesia pour l'infrastructure d'agents en temps réel où chaque milliseconde de latence est une mesure de la qualité du produit.
Resemble AI emprunte une voie architecturale différente. Leur modèle Chatterbox Turbo utilise un transformer de 350M de paramètres avec un décodeur de diffusion distillé en une étape, réduisant la génération de 10 étapes de diffusion à une seule. La différenciation de Resemble réside dans la sécurité et l'authenticité : ils intègrent la détection de deepfakes, le tatouage numérique audio (watermarking) et des outils d'analyse vocale dans la plateforme, ce qui en fait le choix naturel pour les secteurs réglementés qui doivent prouver la provenance de l'audio. Chatterbox est publié en open-source, ce qui n'est pas le cas de Sonic de Cartesia. Les benchmarks de latence de Resemble n'égalent pas les chiffres TTFA publiés par Cartesia, et ils ne mettent pas en avant la vitesse comme argument de positionnement. La comparaison se résume à la posture de sécurité d'entreprise et la déployabilité open-source (Resemble) contre les performances de latence brute pour les systèmes en temps réel (Cartesia).
"En utilisant l'API vocale générative de Cartesia, Sonic, nous avons renforcé Cresta AI Agent pour aller au-delà des scripts rigides et offrir des conversations empathiques, semblables à celles des humains." - Tim Shi, cofondateur et CTO chez Cresta, étude de cas client Cartesia, 2025
La réalité des licences et des droits d'auteur
Les conditions de Cartesia accordent des droits commerciaux sur les sorties audio à partir du forfait Pro ($4/mois facturé annuellement). Le niveau Free limite les sorties à un usage personnel et non commercial. Le Pro Voice Cloning, qui entraîne un modèle de locuteur à partir de l'audio soumis, exige que les utilisateurs possèdent ou aient les droits sur l'audio qu'ils soumettent. La plateforme ne publie pas les sources de données d'entraînement pour les voix prédéfinies de Sonic, et aucun litige concernant les données d'entraînement n'a été publiquement déposé contre Cartesia en date d'avril 2026.
Les options de déploiement sur appareil et sur site signifient que les organisations peuvent exécuter l'inférence Sonic localement, ce qui contourne les problèmes de conservation des données dans les secteurs réglementés. Cartesia met en avant sa conformité HIPAA pour les déploiements d'agents vocaux dans le domaine de la santé, et le déploiement du centre de contact de Cresta chez Brinks Home confirme son utilisation en production d'entreprise. Veronica Moturi, SVP de l'expérience client chez Brinks Home, a noté que "Notre agent vocal IA guide les clients à travers des scénarios de dépannage complexes à plusieurs étapes, et les retours positifs de ces clients ont été révélateurs", décrivant les résultats du déploiement de Cresta utilisant Sonic.
La structure des droits commerciaux est simple : payez le niveau Pro ou supérieur, et l'audio généré vous appartient pour un usage commercial. Les clones vocaux entraînés à partir de vos propres enregistrements appartiennent à votre compte. Cartesia ne revendique aucune propriété ni aucun droit sur l'audio de sortie généré via son API.
Là où Cartesia montre ses limites
La limite de 500 caractères sur Sonic Turbo est la frustration la plus signalée par les développeurs. Construire une narration longue ou une conversation à plusieurs tours où la réponse d'un seul agent dépasse 500 caractères nécessite de découper le texte, de gérer les limites des morceaux pour éviter les coupures au milieu des mots, et d'assembler les segments audio. ElevenLabs Flash v2.5 accepte jusqu'à 40,000 caractères par requête. Pour la production de livres audio, la narration de podcasts ou toute application où les segments individuels sont longs, cette limite impose un travail d'ingénierie que les concurrents évitent.
La couverture linguistique de 42 langues est réelle mais reste plus restreinte que les 70+ d'ElevenLabs. Les équipes développant pour les marchés d'Asie du Sud-Est, des langues africaines moins courantes ou des dialectes régionaux avec des données d'entraînement limitées trouveront des lacunes. La bibliothèque de voix prédéfinies d'environ 130 voix est également plus mince que le catalogue de 4,000+ d'ElevenLabs. Les équipes qui souhaitent des variations d'accents régionaux, des voix d'âges divers ou une large couverture de personnages pour les jeux vidéo et la production multimédia sont confrontées à des limitations vocales qui nécessitent un investissement dans le clonage sur mesure.
Cartesia est une API pour développeurs, pas un outil métier. Il n'y a pas de connecteur Salesforce natif, pas d'intégration de flux de travail de centre d'assistance, pas de routage d'appels prêt à l'emploi. Les équipes décrivant Cartesia comme leur couche vocale notent systématiquement qu'il gère bien la voix mais ne contribue en rien à l'architecture de l'application environnante. Une formulation courante : Cartesia fournit le moteur, pas le châssis, la direction ou la navigation. Les développeurs construisant un agent vocal complet doivent assembler le reste de manière indépendante.
Le réglage manuel des émotions ajoute une surcharge dans les contextes conversationnels dynamiques. Contrairement aux plateformes dotées d'une détection automatique de la prosodie, Cartesia nécessite des balises d'émotion explicites ou des ajustements manuels des cadrans de vitesse/hauteur. Dans un système scénarisé, c'est gérable ; dans une IA conversationnelle générative répondant à des entrées utilisateur imprévisibles, maintenir la précision des contrôles d'émotion nécessite soit une ingénierie de prompt LLM affinée, soit une couche de classification qui décide quelle balise d'émotion appliquer.
À qui s'adresse Cartesia
Cartesia cible les développeurs construisant des IA conversationnelles en temps réel où la latence affecte directement la qualité du produit. Si votre application est un agent vocal, un bot téléphonique, un avatar IA dans un jeu, ou tout système interactif où l'utilisateur attend une réponse vocale, 90ms contre 300ms de TTFA fait une différence audible. Le taux d'interaction d'appel de 97% de Goodcall et ses 2,217 agents déployés représentent le type de résultat que permet un TTS à faible latence : les utilisateurs restent en ligne car l'IA donne l'impression d'être un partenaire de conversation naturel.
Les équipes des services de santé et financiers exécutant des charges de travail sensibles à la conformité bénéficient des options de déploiement sur appareil et sur site. La conformité HIPAA sans transmission de données dans le cloud est un différenciateur significatif pour ce secteur. Les entreprises à grande échelle qui ont besoin d'un support prioritaire, d'une forte simultanéité et de SLA personnalisés trouveront les niveaux Scale et Enterprise bien adaptés.
Ignorez Cartesia si vos besoins principaux sont la variété des voix et l'étendue des langues pour la création de contenu. Si vous produisez des podcasts multilingues, doublez du contenu vidéo dans plus de 50 langues, ou avez besoin d'une bibliothèque de plus de 1,000 voix pour une plateforme créative, le catalogue d'ElevenLabs vous servira mieux. Ignorez Cartesia si vous avez besoin d'une solution vocale no-code ou low-code : il n'y a pas d'interface pointer-cliquer pour les utilisateurs non techniques, pas de créateur de campagne, pas de lecteur intégré. L'API est le produit. Et ignorez spécifiquement Sonic Turbo si votre cas d'usage génère des segments de texte plus longs que quelques phrases à la fois, à moins que vous ne soyez prêt à construire et maintenir un pipeline de découpage.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Cartesia AI.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing
