
Deepgram est une API pour développeurs dédiée à la reconnaissance vocale (speech-to-text), à la synthèse vocale (text-to-speech) et à l'orchestration d'agents vocaux. Nova-3 offre une transcription en streaming avec une latence inférieure à 300 ms pour $0.46 par heure d'audio, avec un déploiement sur site et une API Voice Agent qui combine STT, TTS et routage LLM dans un seul pipeline WebSocket.
Deepgram est une plateforme vocale d'IA conçue par Deepgram, Inc., une entreprise de San Francisco fondée en 2015. Elle propose trois API de production : la reconnaissance vocale (speech-to-text) utilisant le modèle Nova-3, la synthèse vocale (text-to-speech) avec Aura-2, et une API Voice Agent qui intègre le STT, le TTS et l'orchestration LLM dans un seul pipeline WebSocket géré. La plateforme ne dispose d'aucune interface grand public. Vous envoyez de l'audio ou du texte via l'API et obtenez en retour des transcriptions structurées, de la voix de synthèse ou des sessions complètes d'agents vocaux. Plus de 450 entreprises clientes utilisent Deepgram en production, dont Twilio, Aircall et Jack in the Box.
Nova-3, lancé le 12 février 2025, est l'actuel modèle STT phare. Il atteint un taux d'erreur sur les mots (WER) médian de 6.84% sur l'audio en streaming, soit une amélioration de 54.3% par rapport à son concurrent d'API gérée le plus proche. Il prend en charge l'alternance codique (code-switching) en temps réel sur 10 langues simultanément, propose l'injection de mots-clés (keyterm prompting) pour une adaptation instantanée du vocabulaire sans réentraînement du modèle, et fonctionne avec une latence inférieure à 300 ms pour les sessions en streaming. L'API Voice Agent a atteint sa disponibilité générale le 16 juin 2025, avec un score de 71.5 sur le Voice Agent Quality Index, surpassant OpenAI de 6.4% et ElevenLabs de 29.3% sur un composite de latence, de taux d'interruption et de couverture des réponses. Le TTS Aura-2 offre un délai d'attente du premier octet (time-to-first-byte) inférieur à 200 ms avec plus de 40 voix anglaises réparties sur 7 langues.
Ce que fait réellement Deepgram en avril 2026
Le produit principal de Deepgram est une infrastructure vocale gérée. Vous vous connectez à son API via WebSocket pour le streaming en temps réel ou via HTTP pour le traitement par lots (batch) de fichiers préenregistrés. Nova-3 se charge du gros du travail côté STT : il accepte les flux audio et renvoie des transcriptions au niveau du mot avec horodatage, diarisation des locuteurs en option, ponctuation et masquage en temps réel de jusqu'à 50 types d'entités (numéros de téléphone, numéros de carte de crédit, numéros de sécurité sociale).
La fonctionnalité d'injection de mots-clés (keyterm prompting) mérite une attention particulière. Plutôt que d'exiger un ajustement fin (fine-tuning) du modèle ou le téléchargement de vocabulaires personnalisés, Nova-3 accepte jusqu'à 100 termes spécifiques à un domaine par requête API et augmente leur probabilité de reconnaissance sans aucun cycle de réentraînement. Cela permet d'adapter Deepgram à l'audio médical, juridique ou technique plus rapidement que ne le permettent les pipelines de fine-tuning traditionnels. La limite de 100 termes est une véritable contrainte pour les grands vocabulaires, mais pour la plupart des cas d'usage en production, elle couvre la terminologie la plus prioritaire.
L'API Voice Agent abstrait l'ensemble du pipeline de l'agent vocal. Auparavant, les développeurs devaient assembler un service STT distinct, une couche VAD pour la détection d'interruption (barge-in), une API LLM et un point de terminaison TTS. L'API Voice Agent de Deepgram gère tout cela via une seule session WebSocket : elle gère la prise de parole, la détection des interruptions, l'état de la session et les mises à jour des prompts en temps réel. Vous pouvez apporter votre propre LLM tout en utilisant le STT et le TTS de Deepgram, ou utiliser la stack complète de Deepgram pour $4.50 par heure.
Les options de déploiement incluent le cloud public, le VPC privé au sein de comptes AWS ou Azure, et sur site (on-premises) via des conteneurs Docker ou Kubernetes. L'approche sur site est cruciale pour les équipes de santé et financières : l'architecture conteneurisée de Deepgram offre une latence et une précision identiques à celles du cloud tout en conservant les données audio derrière les pare-feu de l'entreprise. Ceci est disponible uniquement avec les contrats Enterprise.
"Le STT en temps réel le plus précis que nous ayons testé.. le premier modèle speech-to-text à combiner la transcription multilingue en temps réel, l'injection de vocabulaire en direct et une latence inférieure à 300 ms." - Stephen FIYINFOLUWA Oladele, Neurl Creators, critique sur Substack, 2025
Où se situe Deepgram par rapport à AssemblyAI et Whisper
La comparaison la plus importante pour les décisions de production oppose Deepgram Nova-3 à AssemblyAI Universal-2/Slam-1 et OpenAI Whisper. Ces trois solutions couvrent la majeure partie du marché STT pour les développeurs, mais elles font des compromis d'ingénierie fondamentalement différents.
Deepgram vs. AssemblyAI : Le modèle Slam-1 d'AssemblyAI combine un décodeur LLM avec un encodeur ASR traditionnel, ce qui lui confère une personnalisation basée sur les prompts plus flexible et gère jusqu'à 1 000 termes spécifiques à un domaine par requête, contre la limite de 100 termes de Nova-3. AssemblyAI Universal-2 prend en charge plus de 100 langues, comparé à l'ensemble multilingue plus restreint mais plus précis de Nova-3. AssemblyAI dispose également d'une intelligence audio prête à l'emploi plus approfondie : détection de sujets, détection d'entités, génération de chapitres, et son LLM audio LeMUR pour les requêtes conversationnelles sur les transcriptions. L'intelligence audio de Deepgram (résumé, sentiment) est plus simple et présente des problèmes d'hallucination connus sur les discours techniques denses. Deepgram l'emporte sur la latence brute en streaming (inférieure à 300 ms contre 300 à 600 ms pour AssemblyAI), le déploiement sur site (AssemblyAI est un SaaS uniquement cloud) et la tarification en volume. AssemblyAI Universal-2 est à $0.37/h ; Nova-3 se situe à $0.46/h en Pay-As-You-Go mais chute à $0.39/h avec le plan Growth.
Deepgram vs. Whisper : Whisper est un Transformer encodeur-décodeur open-source d'OpenAI, entraîné sur 680 000 heures d'audio multilingue, avec des poids disponibles pour l'auto-hébergement. Il couvre 57 langues et est gratuit au niveau du modèle. Mais Whisper ne prend pas en charge nativement le streaming en temps réel : le faire fonctionner pour l'audio en direct nécessite des solutions de contournement comme whisper.cpp, ajoutant une surcharge d'ingénierie significative. Whisper large-v3 prend 10 à 30 minutes pour transcrire une heure d'audio selon le matériel ; Deepgram transcrit la même heure en environ 20 secondes. L'auto-hébergement de Whisper sur une instance GPU (généralement $0.50 à $1.50/h pour un équivalent A10G) rapproche le coût de calcul des $0.46/h de Deepgram, rendant le compromis entre géré et auto-hébergé moins évident que ne le suggère l'argument "Whisper est gratuit".
"J'ai choisi Deepgram spécifiquement parce qu'il s'annonçait comme étant le plus rapide pour minimiser les délais de réponse." - Alyx1337, Hacker News, décembre 2023
À quoi ressemble la réalité du pipeline d'agent vocal
L'API Voice Agent est le produit que Deepgram positionne le plus activement comme un avantage concurrentiel différencié. Construire un agent vocal avant l'existence de cette API impliquait d'exécuter quatre services distincts : un point de terminaison STT pour la transcription, une couche VAD pour la détection d'interruption, une API LLM pour la génération de réponses, et un point de terminaison TTS pour vocaliser la réponse. Chaque étape ajoute de la latence, et l'assemblage des états d'erreur sur quatre services signifie plus de modes de défaillance à gérer en production.
L'API Voice Agent de Deepgram condense tout cela en une seule session WebSocket. Vous envoyez de l'audio ; l'API gère le VAD, le STT, le routage LLM (celui par défaut de Deepgram ou le vôtre), la synthèse TTS et le retour audio de la réponse en streaming. L'injection de prompts en temps réel vous permet de mettre à jour le prompt système en cours de session, et le remplacement à chaud (hot-swapping) du modèle permet de changer les voix TTS pendant un appel en direct. Jack in the Box utilise cette architecture pour les commandes au drive. Aircall et OpenPhone l'intègrent pour la gestion des appels.
La gestion des connexions WebSocket est cependant le point où les développeurs rencontrent constamment des frictions. Les discussions GitHub de Deepgram montrent un schéma récurrent d'erreurs CLIENT_MESSAGE_TIMEOUT lorsque le streaming audio commence avant que le serveur n'ait confirmé le message SettingsApplied. Le handshake correct nécessite d'attendre Welcome, puis Settings, puis la confirmation SettingsApplied avant d'envoyer des données audio. Une mauvaise configuration entraîne la perte de la connexion en 2 à 3 secondes. Le correctif est documenté mais n'est pas mis en évidence dans les guides de démarrage rapide.
Le quota de streaming simultané par défaut est plafonné à 1 200 requêtes. Pour aller au-delà, il faut contacter l'équipe commerciale de Deepgram, ce qui introduit des frictions pour les équipes en forte croissance qui atteignent cette limite de manière inattendue en production.
À qui s'adresse Deepgram
Le point fort de Deepgram réside dans les équipes d'ingénierie qui construisent des infrastructures vocales de production où une latence inférieure à 300 ms est une exigence, et non une préférence. Les analyses de support client en temps réel, les systèmes SVI (IVR), les fonctionnalités SaaS à commande vocale et les agents d'IA conversationnelle correspondent parfaitement à ce profil. Les plateformes de centres de contact traitant des milliers de flux audio simultanés bénéficient de l'architecture de streaming Nova-3 et de l'option de déploiement sur site pour les secteurs réglementés.
Le crédit gratuit de $200 (sans carte de crédit requise) couvre environ 433 heures de transcription Nova-3 Monolingual aux tarifs Pay-As-You-Go. Il s'agit d'un budget d'exploration substantiel pour les développeurs indépendants et les petites équipes évaluant l'API avant de s'engager dans un plan.
Ce que Deepgram n'est pas
Deepgram est une API. Il n'y a pas d'interface web pour télécharger un fichier audio et obtenir une transcription en retour. Les utilisateurs non techniques qui souhaitent transcrire des enregistrements de podcasts ou des audios de réunions sans écrire de code devraient chercher ailleurs : Otter.ai, Rev et Descript proposent tous des flux de travail de transcription basés sur une interface utilisateur. Deepgram est destiné aux développeurs intégrant la voix dans une application.
Le fine-tuning de modèles personnalisés n'est pas en libre-service. Si 100 mots-clés par requête sont insuffisants et que vous devez entraîner un modèle spécifique à un domaine sur vos propres données audio, cela nécessite un contrat Enterprise. Les équipes développant pour plus de 100 langues devraient plutôt se tourner vers Universal-2 d'AssemblyAI. Les équipes dont l'exigence principale est la profondeur de l'intelligence audio, en particulier les requêtes conversationnelles sur les transcriptions, la détection de sujets ou l'extraction d'entités, trouveront LeMUR et Slam-1 d'AssemblyAI nettement plus performants.
Ignorez Deepgram si vous avez besoin d'une solution sans coût d'infrastructure et que vous avez la capacité d'ingénierie pour l'auto-hébergement. Les poids de Whisper sont gratuits, et l'exécution de l'inférence sur votre propre matériel élimine entièrement les frais à la minute, au prix d'une surcharge DevOps et de la complexité de la création d'un support de streaming en temps réel à partir de zéro.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Deepgram.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)
