

AssemblyAI est une API de reconnaissance vocale (speech-to-text) et d'intelligence audio pour les développeurs. Elle transcrit l'audio à l'aide des modèles Universal-2 et Universal-3 Pro, et intègre la diarisation des locuteurs, l'analyse des sentiments et des résumés générés par LLM via LeMUR, à partir de $0.15 par heure d'audio.
AssemblyAI est une API de reconnaissance vocale hébergée dans le cloud, créée par AssemblyAI, Inc., fondée à San Francisco en 2017. Elle s'adresse aux développeurs de logiciels qui ont besoin d'ajouter le traitement vocal à leurs applications sans avoir à gérer l'infrastructure GPU, les mises à jour de modèles ou la mise à l'échelle des pipelines. La plateforme traite plus de 40 téraoctets d'audio par jour et gère 840 millions d'appels d'API par mois, ce qui en fait l'un des services de transcription gérés les plus utilisés du marché. Contrairement aux outils de transcription grand public, AssemblyAI ne possède pas d'interface graphique prête à l'emploi : vous envoyez l'audio, l'API renvoie du texte structuré et des métadonnées.
La gamme de modèles actuelle va de Universal-2 ($0.15/hr) pour les charges de travail par lots (batch) soucieuses des coûts, jusqu'à Universal-3 Pro ($0.21/hr) pour une transcription préenregistrée de la plus haute précision, et Universal-3 Pro Streaming ($0.45/hr) pour les applications d'agents vocaux en temps réel. En plus de la transcription de base, la plateforme propose la diarisation des locuteurs, l'analyse des sentiments, la détection d'entités, la rédaction des PII (données personnelles), la modération de contenu et les Auto-Chapters. Le framework LeMUR, lancé en juillet 2023, applique Claude ou GPT-4 aux transcriptions en un seul appel d'API, traitant jusqu'à 10 heures d'audio (~150K tokens) pour la synthèse, les questions-réponses (Q&A) et le coaching par IA, sans que les développeurs n'aient à construire leurs propres pipelines LLM.
Ce que fait réellement AssemblyAI en avril 2026
La pile de modèles d'AssemblyAI comprend désormais cinq options distinctes selon que la charge de travail est préenregistrée ou en temps réel. Universal-3 Pro est le modèle batch phare, avec un taux d'erreur de mots (WER) de 5.93% et la prise en charge de 99 langues, y compris l'alternance codique (code-switching) automatique. Universal-2, la version d'octobre 2024 qui a remplacé Universal-1, offre une précision des mots de 93.32% avec des gains notables sur les noms propres (24% de mieux qu'Universal-1), les caractères alphanumériques (21% de mieux) et le formatage du texte (15% de mieux). Ce sont les chiffres qui comptent pour une utilisation réelle en production : un logiciel de centre d'appels échoue lorsque les numéros de téléphone et les codes d'assurance sont erronés, et non lorsque le WER s'écarte de 0.5% par rapport à un jeu de données de référence.
Pour les charges de travail en temps réel, Universal-Streaming et Universal-3 Pro Streaming utilisent des connexions WebSocket avec une latence de bout en bout inférieure à 200ms. Une décision d'ingénierie clé : le streaming d'AssemblyAI fournit des transcriptions immuables, ce qui signifie qu'une fois qu'un mot est renvoyé, il n'est pas révisé. Les API de streaming concurrentes envoient souvent des "partiels" qui sont corrigés au fur et à mesure que le contexte s'accumule, créant des problèmes de gestion d'état pour les applications d'agents vocaux. L'approche immuable permet aux agents de traiter et d'agir sur la parole transcrite pendant que l'utilisateur continue de parler.
La pile d'intelligence vient se superposer à la transcription. LeMUR enveloppe un pipeline combinant une segmentation intelligente, une base de données vectorielle et un prompting par chaîne de pensée (chain-of-thought), permettant à un seul appel d'API d'exécuter des Q&A ou de générer des résumés sur des heures d'audio. La diarisation des locuteurs sépare plusieurs intervenants dans un fichier. Le module complémentaire Medical Mode est conforme à la norme HIPAA et optimisé pour le vocabulaire clinique. La rédaction des PII couvre 15 types de données sensibles dans plus de 50 langues.
"LeMUR fonctionne incroyablement bien dès sa sortie de la boîte. Il nous a permis de nous concentrer sur le produit plutôt que sur l'infrastructure." -- Alexander Kvamme, Co-fondateur & PDG de Pathlight, juillet 2023
Où se situe AssemblyAI par rapport à Deepgram et Whisper
Les deux concurrents significatifs sont Deepgram (API gérée similaire) et OpenAI Whisper (open-source, auto-hébergé). Ils diffèrent sur le modèle de coût, la profondeur des fonctionnalités et la complexité opérationnelle d'une manière qui compte pour la décision d'achat.
AssemblyAI vs. Deepgram Nova-3 : Les deux sont des API gérées ciblant les développeurs. Les chiffres de précision sont proches mais contestés. Les propres benchmarks d'AssemblyAI placent Universal-3 Pro à 5.93% de WER contre 7.9% pour Deepgram Nova-3 ; les benchmarks de Deepgram affirment l'inverse. Ce qui est plus clair, c'est la latence : dans les benchmarks de lancement d'Universal-Streaming de juin 2025, AssemblyAI a rapporté une latence médiane de 307ms contre 516ms pour Deepgram Nova-3, et 73% de faux bruits en moins. Le modèle de tarification est un véritable différenciateur : Deepgram exige généralement des engagements contractuels et des minimums de dépenses pour les comptes de production, tandis qu'AssemblyAI est entièrement pay-as-you-go (paiement à l'usage) sans minimum. Pour l'intelligence audio, l'écart est plus grand : LeMUR d'AssemblyAI fournit un pipeline LLM intégré sur les transcriptions ; Deepgram oblige les développeurs à câbler le leur. La transcription orientable par prompt (instructions de contexte en langage naturel qui améliorent la précision pour l'audio spécifique à un domaine) est disponible dans AssemblyAI ; Deepgram ne propose pas cette fonctionnalité en 2026.
AssemblyAI vs. OpenAI Whisper : Whisper est un transformateur encodeur-décodeur open-source publié par OpenAI sous licence MIT. La proposition de valeur fondamentale est le coût : l'auto-hébergement de Whisper sur votre propre GPU n'a aucun coût par heure d'audio après l'infrastructure. L'API Whisper hébergée par OpenAI facture $0.36/hr. AssemblyAI facture $0.15/hr pour Universal-2 ou $0.21/hr pour Universal-3 Pro, ce qui est moins cher que Whisper hébergé mais pas moins cher que l'auto-hébergé. L'écart architectural compte pour les fonctionnalités : Whisper seul n'a pas de diarisation des locuteurs, pas de streaming, pas de rédaction des PII, pas de fonctionnalités d'intelligence audio, et des taux d'hallucination environ 30% plus élevés que les modèles Universal sur l'audio de production (selon les benchmarks d'AssemblyAI). Les cas d'utilisation en temps réel sont mal servis par Whisper, qui traite l'audio par morceaux plutôt qu'en véritable streaming. La question pratique est le coût d'ingénierie : l'auto-hébergement de Whisper nécessite la gestion des GPU, des systèmes de file d'attente et des mises à jour continues des modèles. Les équipes qui souhaitent livrer une fonctionnalité vocale en un sprint plutôt qu'en un trimestre paient généralement le tarif horaire d'AssemblyAI. Les équipes traitant des millions d'heures par mois trouvent souvent Whisper auto-hébergé moins cher une fois l'infrastructure amortie.
"Leur transcription et leur diarisation sont à un autre niveau. Je n'ai presque jamais besoin de modifier les transcriptions, ce qui est rare avec ce genre d'outils." -- Évaluateur G2, 2025
À quoi ressemble la réalité du flux de travail de l'API
Pour la transcription asynchrone (préenregistrée), le flux de travail se déroule en trois étapes : télécharger l'audio sur AssemblyAI ou transmettre une URL, interroger l'ID de transcription et récupérer la réponse JSON structurée contenant la transcription, les horodatages au niveau des mots, les étiquettes des locuteurs et toutes les sorties d'intelligence. Des SDK existent pour Python, Node.js, Go, Java et Ruby. La documentation est complète avec des environnements de test interactifs (playgrounds), ce qui explique pourquoi AssemblyAI a obtenu un badge "Leader" G2 dans le rapport Voice Recognition Grid de l'automne 2025.
Pour le streaming en temps réel, les développeurs ouvrent une connexion WebSocket et diffusent des morceaux d'audio. L'API renvoie les tokens de transcription finalisés au fur et à mesure de leur arrivée. La mise à jour du produit d'octobre 2025 a ajouté le "Intelligent Model Fallback", permettant aux développeurs de spécifier plusieurs modèles par ordre de priorité : l'API utilise le modèle le plus précis qui prend en charge la langue détectée, en se rabattant automatiquement si besoin. Cela est important pour les produits multilingues où un fichier audio peut changer de langue au milieu d'une conversation.
Un incident spécifique mérite d'être noté : lorsqu'AssemblyAI a lancé Universal-2 fin octobre 2024, l'entreprise a simultanément réduit le prix de base de la transcription de 43%, passant de $0.37/hr à $0.15/hr pour le nouveau modèle. L'article de blog du 31 octobre 2024 "Beyond Word Error Rate: Universal-2 Delivers Accuracy Where It Matters" a articulé la sortie autour de catégories de précision critiques pour la production plutôt que sur le WER global, ce qui constituait un changement de positionnement notable : le message était qu'obtenir les bons noms propres et numéros de téléphone compte plus pour un centre d'appels qu'une amélioration d'un demi-point de pourcentage du WER affiché. Ce cadrage a trouvé un écho auprès des entreprises clientes comme Calabrio et Siro, qui ont toutes deux signalé des résultats commerciaux significatifs après le déploiement d'Universal-2.
Pour qui AssemblyAI est conçu
La cible la plus évidente est constituée des équipes de développeurs intégrant des fonctionnalités vocales dans des produits SaaS : intelligence conversationnelle pour centres d'appels, plateformes de podcasts, documentation médicale, résumé de réunions, et de plus en plus d'applications d'agents vocaux utilisant des frameworks comme LiveKit et Pipecat. La couche LeMUR est particulièrement précieuse pour les équipes qui souhaitent éviter de construire leurs propres pipelines de transcription vers LLM. La conformité SOC2 Type II et HIPAA couvre les cas d'utilisation des services de santé et financiers où les exigences de traitement des données nécessiteraient autrement une infrastructure personnalisée importante.
Les startups bénéficient de $50 de crédits gratuits pour prototyper sans carte de crédit. Le modèle pay-as-you-go évolue sans engagement minimum, ce qui est significatif pour les équipes en phase de démarrage incertaines quant au volume. Les entreprises clientes bénéficient d'une tarification personnalisée, de limites de simultanéité plus élevées et de SLA dédiés une fois que l'utilisation justifie la conversation avec les ventes.
La mise à jour d'octobre 2025 a également introduit une LLM Gateway qui consolide le speech-to-text, la compréhension de la parole et l'inférence LLM en une seule plateforme avec une facturation unifiée, ciblant les équipes qui souhaitent réduire le nombre de fournisseurs d'API et simplifier les pipelines de données.
Ce que n'est pas AssemblyAI
AssemblyAI n'est pas un produit grand public. Il n'y a pas d'interface web où un utilisateur non technique peut télécharger un fichier audio et récupérer une transcription. Ce cas d'utilisation appartient à des outils comme Otter.ai, Rev ou Descript. Quiconque se décrit comme "non-développeur" devrait chercher ailleurs.
Ce n'est pas l'option la moins chère à très grande échelle. À plus de 100 000 heures d'audio par mois, l'auto-hébergement de Whisper sur du matériel GPU dédié devient généralement moins cher que le paiement à l'heure. Les équipes atteignant ce volume devraient faire leurs calculs : le coût d'ingénierie de la maintenance de l'infrastructure peut facilement dépasser les économies de coûts de l'API, mais cela peut aussi aller dans l'autre sens une fois qu'une équipe plateforme est en place.
Ce n'est pas encore une plateforme d'intelligence multilingue complète. La transcription en 99 langues est réelle, mais LeMUR, les Auto-Chapters, l'analyse des sentiments, la détection d'entités et la plupart des fonctionnalités d'intelligence sont dominantes en anglais. Construire une IA de centre d'appels en espagnol ou en portugais se heurte rapidement à ces lacunes.
Ce n'est pas une plateforme de fine-tuning. Les équipes disposant d'un vocabulaire très spécifique à un domaine (termes médicaux rares, noms de produits exclusifs, jargon de l'industrie) peuvent utiliser le Keyterms Prompting pour améliorer la reconnaissance, mais il n'y a pas d'entraînement de modèle personnalisé. Deepgram propose des moteurs adaptés à des domaines pour certains secteurs verticaux ; AssemblyAI s'appuie sur la capacité prête à l'emploi de son modèle Universal.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec AssemblyAI.
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Amazon Translate Review (2026): Pricing, Accuracy, and When to Pick an Alternative
