
Speechmatics est une API de reconnaissance vocale (speech-to-text) d'entreprise fondée à Cambridge, fonctionnant sur le modèle Ursa 2. Elle couvre plus de 55 langues en temps réel avec des options de déploiement sur site, une conformité totale HIPAA et SOC 2, et une précision indépendante des accents, conçue pour les diffuseurs, les centres de contact et les secteurs réglementés.
Speechmatics est une API de reconnaissance vocale (speech-to-text) d'entreprise développée par une société basée à Cambridge (Royaume-Uni), fondée en 2006 par le Dr Tony Robinson, un chercheur en reconnaissance vocale par réseaux de neurones ayant mené ses travaux fondateurs à l'Université de Cambridge. Initialement constituée sous le nom de Cantab Research Ltd., l'entreprise a passé près de deux décennies à développer une compétence clé unique : une transcription précise pour chaque accent, dialecte et langue, sans sacrifier la vitesse. L'API alimente le sous-titrage de diffusions en direct, l'analyse des centres de contact, la documentation médicale et les applications de renseignement de défense, où la précision et la souveraineté des données ne peuvent être considérées comme de simples options.
Le modèle actuel de la plateforme, Ursa 2 (disponible pour le grand public depuis octobre 2024), couvre plus de 55 langues en modes streaming en temps réel et traitement par lots (batch). Il offre une latence de streaming inférieure à 1 seconde avec la configuration adéquate, et inclut la diarisation des locuteurs comme fonctionnalité de base plutôt que comme module payant. Speechmatics propose trois modes de déploiement : API cloud, sur site via des conteneurs Docker ou des appliances virtuelles préconfigurées, et inférence en périphérie (edge) sur appareil. L'entreprise détient les certifications ISO/IEC 27001:2022, SOC 2 Type II, RGPD et HIPAA sur l'ensemble de sa pile de déploiement. Un modèle médical spécialisé (Medical Model), lancé en septembre 2025, a atteint une précision générale en conditions réelles de 93 % sur des audios cliniques et un rappel de 96 % sur les mots-clés médicaux, lors de tests comparatifs avec des systèmes concurrents. Pour les équipes qui recherchent l'expérience développeur de Deepgram ou AssemblyAI sans les exigences de conformité, ces alternatives sont à considérer ; pour les entreprises réglementées et les diffuseurs mondiaux pour qui « assez bon » ne suffit pas, Speechmatics est une option de premier choix crédible.
Ce que propose Speechmatics en avril 2026
L'API vocale de Speechmatics prend en charge les entrées audio (en streaming via WebSocket ou par téléchargement de fichiers par lots) et renvoie des transcriptions horodatées, des étiquettes de locuteurs, la ponctuation et des scores de confiance optionnels. Le modèle Ursa 2, devenu la norme pour tous les services Speechmatics en octobre 2024, couvre 55 langues en mode streaming en temps réel, avec l'ajout de l'irlandais et du maltais lors de son lancement pour compléter la couverture des 24 principales langues européennes. Lors des tests de précision sur le jeu de données FLEURS, Ursa 2 s'est classé premier dans 62 % des langues testées et dans le top trois pour 92 % d'entre elles.
Les tarifs de transcription par lots sont disponibles selon les niveaux Standard et Enhanced (le niveau Enhanced utilise une passe de modèle plus large pour une meilleure précision sur les audios complexes). Le streaming en temps réel utilise un paramètre max_delay allant de 0.7 à 4 secondes ; la valeur par défaut de 4 secondes maximise la précision, tandis que 1.5 seconde est le point de départ recommandé pour les applications d'agents vocaux. La plateforme regroupe également le STT (speech-to-text), la gestion des tours de parole par LLM et le TTS (text-to-speech) dans un produit unique appelé Flow, une API d'agent vocal conversationnel disponible en configurations cloud et sur site.
Le Medical Model de septembre 2025 mérite une mention particulière. Il a établi de nouvelles références dans l'industrie pour l'audio clinique en anglais avec une précision générale en conditions réelles de 93 % (7 % de WER), un rappel de 96 % sur les mots-clés médicaux et un taux d'erreur de 4 % sur les noms de médicaments, les diagnostics et les codes de procédure, ce qui représente 50 % d'erreurs de termes médicaux en moins que son concurrent le plus proche selon les propres tests de Speechmatics. Le modèle est déployé sur NVIDIA Triton Inference Server avec accélération CUDA et est disponible en anglais, espagnol, français, néerlandais et finnois, les autres langues étant en cours de déploiement sur l'ensemble du portefeuille de 55 langues.
En mars 2026, Speechmatics a publié ce qu'elle a décrit comme le premier modèle STT de production bilingue arabe-anglais au monde, un modèle unique capable de traiter simultanément plusieurs dialectes arabes et l'anglais. Cela a comblé une lacune de longue date signalée dans les avis des entreprises de la région du Moyen-Orient.
« Nous sommes ravis de travailler avec Speechmatics pour piloter notre sous-titrage en direct et par lots. Ils continuent d'être en tête du peloton pour toutes les mesures de qualité clés. » - Tom Wootton, Product Leader, Red Bee Media, 2024
Où se situe Speechmatics par rapport à Deepgram et AssemblyAI
Le marché des API STT en 2026 compte trois principaux concurrents au niveau entreprise : Speechmatics, Deepgram et AssemblyAI. Les différences mécaniques sont suffisamment importantes pour que le choix d'une solution inadaptée à votre cas d'usage ait de réelles conséquences.
Speechmatics vs. Deepgram Nova-3 : Deepgram est une startup américaine dotée d'une architecture axée sur la latence. Nova-3 affiche un WER de référence de 5.26 % sur 2,703 fichiers dans 9 domaines, et dans les classements combinant vitesse et précision, Deepgram l'emporte souvent. Son modèle de streaming Flux vise une latence inférieure à 100 ms pour les applications d'agents vocaux avec moins de contraintes de configuration que le réglage `max_delay` de Speechmatics. Le Keyterm Prompting de Deepgram permet d'injecter jusqu'à 100 termes de vocabulaire personnalisés au moment de l'inférence, tandis que le Custom Dictionary de Speechmatics utilise une approche basée sur JSON limitée à 6 mots par entrée avec des alternatives phonétiques « sounds_like ». La différence critique : Deepgram ne propose aucune option de déploiement sur site. Pour une startup SaaS américaine développant un agent vocal, la tarification de Deepgram (tarifs à la minute plus une API Voice Agent groupée à $4.50/h) est plus lisible pour de faibles volumes. Pour un diffuseur ou un hôpital européen qui ne peut pas faire transiter l'audio de ses patients par un fournisseur cloud américain, Speechmatics est la seule option à ce niveau.
Speechmatics vs. AssemblyAI Universal-3 Pro : AssemblyAI est orienté développeurs et riche en fonctionnalités. Son produit LeMUR superpose directement un LLM sur l'audio, permettant le résumé, l'analyse des sentiments, l'extraction de questions-réponses et la détection d'entités en un seul appel d'API, sans pipeline LLM séparé. Universal-3 Pro Streaming d'AssemblyAI revendique la première place dans les classements de précision multilingue (selon leurs propres tests) et prend en charge le prompting en langage naturel ainsi que l'injection dynamique de mots-clés en cours de flux. Le plafond mécanique : le streaming d'AssemblyAI prend en charge 6 langues (anglais, espagnol, français, allemand, italien, portugais). Speechmatics en prend en charge plus de 55 en mode streaming. Si votre application gère des appels d'utilisateurs dans 20 pays, la limite de langues en streaming d'AssemblyAI est un point de blocage. AssemblyAI ne propose pas non plus de déploiement sur site, et les modules complémentaires pour la diarisation, le mode médical et LeMUR s'ajoutent de manière significative au coût de base. Une étude académique a révélé que Deepgram était à la traîne par rapport à Speechmatics et AssemblyAI sur la précision de la parole lue avec des marges statistiquement significatives, mais le constat global demeure : testez sur votre propre audio, car les références des fournisseurs ne se reproduisent pas de manière cohérente d'un ensemble de tests à l'autre.
« Travailler avec Speechmatics nous permet de fournir de manière transparente à nos clients des analyses vocales automatisées de qualité dans le cadre de notre solution. » - Mariano Tan, President and CEO, Prosodica, 2024
En résumé : Deepgram l'emporte sur la latence des agents vocaux et l'ergonomie pour les développeurs américains. AssemblyAI l'emporte sur les fonctionnalités LLM intégrées et l'intégration des développeurs. Speechmatics l'emporte sur la couverture linguistique, le déploiement sur site et la profondeur des certifications de conformité. Il s'associe également naturellement aux références d'OpenAI Whisper comme point de comparaison : Whisper est open-source et très précis, mais n'offre aucun SLA d'entreprise, aucune diarisation et aucun streaming, ce qui fait de Speechmatics l'alternative structurée pour les équipes qui ont dépassé les limites d'un Whisper auto-hébergé.
La réalité de la conformité et du déploiement
La différenciation la plus claire de Speechmatics par rapport à Deepgram et AssemblyAI réside dans sa flexibilité de déploiement et la pile de certifications de conformité qui l'accompagne. L'option sur site n'est pas une simple case à cocher marketing. Flow On-Premise, lancé en 2024, déploie une pile complète d'IA conversationnelle (STT, gestion des tours de parole par LLM et TTS) au sein de la propre infrastructure du client via des conteneurs Docker ou des appliances virtuelles préconfigurées. Cela signifie que l'audio ne quitte jamais le pare-feu du client, ce qui est d'une importance capitale dans les secteurs de la santé (HIPAA), des gouvernements européens (RGPD avec des règles nationales plus strictes en matière de résidence des données), de la défense (audio classifié) et des services financiers (exigences d'enregistrement des appels MiFID II).
Certifications détenues en avril 2026 : ISO/IEC 27001:2022, SOC 2 Type II, conformité RGPD, conformité HIPAA. Les données sont chiffrées au repos avec AES-256 et en transit avec TLS 1.2 minimum. L'infrastructure fonctionne sur des conteneurs contrôlés par Kubernetes avec une surveillance SIEM. Les entreprises clientes peuvent également sélectionner des configurations cloud multi-régions pour satisfaire aux exigences nationales de résidence des données sans passer entièrement sur site.
Pour les équipes évaluant Speechmatics par rapport à ElevenLabs pour des flux de travail combinant STT et TTS : ElevenLabs est principalement un produit TTS avec des ajouts récents en STT, tandis que Speechmatics possède 20 ans de spécialisation en STT avec un TTS ajouté plus récemment (le niveau gratuit inclut 1M de caractères/mois de TTS en anglais). Les postures des produits sont inversées. Pour les agents vocaux qui nécessitent le meilleur STT de sa catégorie avec la possibilité d'intégrer une couche TTS spécialisée, Speechmatics s'associe parfaitement avec ElevenLabs ou Coqui TTS via l'architecture de l'API Flow plutôt que de les concurrencer directement. Les équipes construisant des pipelines vocaux entièrement hébergés sans contraintes de conformité pourraient trouver Coqui TTS ou ElevenLabs plus complets du côté de la synthèse vocale.
Là où Speechmatics montre ses limites
Les motifs de frustration récurrents sur G2, Capterra et Gartner Peer Insights se concentrent sur quatre domaines :
Opacité de la tarification à grande échelle. Le niveau Pro a des tarifs publiés et un plafond de 6,000 heures/mois, mais tout ce qui dépasse ce seuil nécessite une discussion pour un plan Enterprise sans tarification publique. Les utilisateurs dans les fils d'avis signalent spécifiquement que la structure tarifaire devient complexe lors de la mise à l'échelle. La remise sur volume (20 % au-delà de 500 h/mois, réductions supplémentaires à partir de 24,000 h/an) aide, mais il est impossible de construire un modèle de coûts fiable pour une production à grande échelle sans parler au service commercial.
Limites du Custom Dictionary. Le dictionnaire personnalisé basé sur JSON est utile pour la terminologie spécifique à un domaine, mais limite les entrées à 6 mots. Les utilisateurs des secteurs de la santé et du droit ayant besoin de spécifier de longs termes cliniques composés ou des phrases juridiques de plusieurs mots trouvent cela restrictif. AssemblyAI gère cela via un prompting en langage naturel sans limite de mots.
Complexité de configuration de la latence de streaming. Le paramètre `max_delay` est défini par défaut sur 4 secondes, ce qui convient aux cas d'usage de post-traitement mais crée des frictions pour les développeurs construisant des agents vocaux en temps réel. Le minimum de 0.7 seconde est atteignable, mais nécessite une lecture de la documentation et des tests que les produits d'agents vocaux de Deepgram évitent par conception.
Post-traitement intégré limité. Speechmatics renvoie des transcriptions précises. Il ne renvoie pas de résumés, d'étiquettes de sentiment, d'extractions d'entités ou d'analyses d'appels structurées de manière native. Chaque fonctionnalité au-delà de la transcription brute nécessite un pipeline et une intégration séparés. Les équipes s'attendant au type d'analyses clés en main que fournit LeMUR d'AssemblyAI devront construire cette couche elles-mêmes.
À qui s'adresse Speechmatics
Choisissez Speechmatics lorsque : vous avez besoin d'un déploiement sur site ou sur cloud privé et ne pouvez pas accepter que l'audio quitte votre infrastructure ; votre audio couvre plus de 6 langues en mode streaming ; vous servez un secteur réglementé (santé, finance, défense, gouvernement) où la certification HIPAA/SOC 2/ISO 27001 est une exigence d'achat ; vous avez besoin d'une diarisation robuste des locuteurs incluse sans frais supplémentaires ; votre cas d'usage de sous-titrage en direct ou de diffusion nécessite une latence inférieure à la seconde sur des dizaines de langues simultanément.
Évitez Speechmatics lorsque : vous êtes un développeur solo ou une petite startup explorant le STT pour la première fois (l'expérience développeur et la tarification de Deepgram sont plus accessibles à de faibles volumes) ; vous avez besoin d'un résumé LLM intégré, d'une analyse des sentiments ou d'une extraction d'entités en un seul appel d'API (LeMUR d'AssemblyAI gère cela sans pipeline séparé) ; vous construisez un agent vocal basé aux États-Unis où la latence est la variable principale et la conformité n'est pas un facteur bloquant (Deepgram Flux est conçu pour cela) ; ou votre budget nécessite un niveau gratuit véritablement illimité avant de vous engager dans une tarification basée sur l'utilisation (le niveau gratuit de 8 heures/mois est un point de départ, pas un environnement de production).
L'histoire du benchmark de Limecraft est illustrative. La plateforme de collaboration média a évalué plusieurs fournisseurs ASR en face-à-face avant de standardiser sur Speechmatics pour ses clients diffuseurs. Maarten Verwaest, CRO de Limecraft, a rapporté : « Ils surpassent constamment les autres fournisseurs en termes de taux d'erreur de mots et de ponctuation, jouant un rôle central dans le développement de notre espace de travail. » C'est le type d'acheteur pour lequel Speechmatics est conçu : des équipes d'entreprise qui ont exécuté les tests, comparé les documents de conformité et constaté que la précision associée à la flexibilité de déploiement l'emporte sur le coût premium.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Speechmatics.
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Amazon Translate Review (2026): Pricing, Accuracy, and When to Pick an Alternative

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

SOAP Notes to Patient Summary With ChatGPT: A HIPAA-Safe Pattern (2026)
