Aller au contenu principal
Vantaige
Whisper screenshot
Whisper logo

Whisper

Gratuit

OpenAI Whisper est un modèle de reconnaissance vocale gratuit, sous licence MIT, qui transcrit l'audio dans 99 langues. Utilisé par les développeurs pour les pipelines de podcasts, les notes de réunion et les sous-titres vidéo. Auto-hébergé sans frais ; également disponible via l'API d'OpenAI à $0.006 par minute.

Fonctionnalités :APIOpen Source

Whisper est un système de reconnaissance automatique de la parole (ASR) open source, conçu et publié par OpenAI en septembre 2022. Entraîné sur 680 000 heures d'audio multilingue extraites d'Internet, il couvre 99 langues et gère une grande variété d'accents, de conditions d'enregistrement et de vocabulaires spécifiques à des domaines. Les poids du modèle et le code d'inférence sont publiés sur GitHub sous licence MIT, ce qui signifie que n'importe qui peut télécharger, modifier et utiliser Whisper sans payer de frais de licence. OpenAI propose également Whisper via son API pour les équipes qui souhaitent une inférence hébergée sans avoir à gérer leur propre infrastructure GPU.

En avril 2026, la version recommandée pour la production est Whisper large-v3-turbo, sortie en octobre 2024, qui s'exécute environ huit fois plus vite que large-v3 avec une précision quasi identique sur les langues disposant de nombreuses ressources. Des projets communautaires ont élargi les capacités de Whisper : faster-whisper reconditionne le modèle en utilisant CTranslate2 pour des gains de vitesse supplémentaires ; WhisperX ajoute des horodatages au niveau des mots et la diarisation des locuteurs ; distil-whisper est une variante distillée entraînée sur Hugging Face qui est six fois plus rapide avec 49 % de paramètres en moins. Les développeurs utilisent Whisper pour la production de podcasts, la transcription de réunions, le sous-titrage de vidéos, la construction de pipelines de données vocales et les outils d'accessibilité.

Ce que Whisper produit en avril 2026

Whisper génère des transcriptions en texte brut avec des horodatages optionnels, disponibles aux formats texte brut, SRT, VTT, TSV ou JSON. La famille de modèles comprend cinq tailles d'origine : tiny (39M de paramètres), base, small, medium et large (1.5B de paramètres). Les poids actuellement recommandés pour la production sont ceux de large-v3-turbo, une variante distillée de large-v3 optimisée pour le débit sans nécessiter l'empreinte mémoire complète de son parent.

Le traitement s'effectue par blocs : Whisper analyse l'audio par segments de 30 secondes. Cette architecture offre une grande précision sur l'audio enregistré, mais signifie que le modèle ne peut pas diffuser de transcriptions en temps réel. Pour les flux de travail par lots tels que le post-traitement d'interviews, de conférences ou d'appels enregistrés, ce n'est pas une limitation. Pour le sous-titrage en direct ou les agents vocaux nécessitant des réponses en moins d'une seconde, c'est une contrainte stricte.

La prise en charge linguistique s'étend sur 99 langues. La qualité n'est cependant pas uniforme d'une langue à l'autre. L'anglais, l'espagnol, le français, l'allemand, le japonais et le portugais atteignent des performances proches de celles d'un humain sur un son clair. La couverture diminue considérablement pour les langues disposant de moins de ressources. Les utilisateurs transcrivant le yoruba, des dialectes régionaux du pendjabi ou le créole haïtien signalent des taux d'erreur nécessitant d'importantes corrections manuelles. La fonction de traduction convertit l'audio de n'importe quelle langue prise en charge directement en texte anglais, ce qui est utile pour l'indexation de contenus multilingues.

La sortie de large-v3-turbo en octobre 2024 a coïncidé avec une autre actualité : une enquête de l'Associated Press publiée le même mois a documenté que Whisper hallucinait systématiquement du texte dans des contextes de transcription médicale, générant des phrases d'apparence plausible pendant des segments audio silencieux ou des bruits ambiants. La propre documentation d'OpenAI incluait déjà une mise en garde indiquant que le modèle « peut générer du texte qui n'a pas été prononcé », mais le rapport de l'AP a attiré l'attention du grand public sur ce point et soulevé des questions quant aux déploiements en production dans les secteurs de la santé et du droit. Ce comportement d'hallucination est lié à l'architecture, et non à la taille du modèle, et persiste dans toutes les variantes de Whisper, y compris turbo.

« J'ai exécuté Whisper sur des segments audio silencieux pour tester et il a généré du texte de remplissage d'apparence plausible. Pas seulement du bruit, mais des phrases cohérentes qui n'ont jamais été prononcées. C'est un mode de défaillance connu et c'est alarmant pour un usage médical. » - u/quietcompute, r/MachineLearning, janvier 2025

Où se situe Whisper par rapport à AssemblyAI Universal-3 et Deepgram Nova-3

La comparaison honnête ici est celle de l'ouvert contre le fermé, et du traitement par lots contre le temps réel. Whisper est la seule option de cette comparaison que vous pouvez exécuter hors ligne, affiner et inspecter entièrement. AssemblyAI et Deepgram sont des API commerciales fermées.

AssemblyAI Universal-3 (sorti en mars 2024) est un modèle encodeur-décodeur propriétaire entraîné sur des ensembles de données audio sous licence, qui, selon AssemblyAI, sont plus propres que le corpus d'entraînement de Whisper extrait d'Internet. La différence pratique : Universal-3 prend en charge la transcription en continu en temps réel via WebSocket avec une latence de bout en bout inférieure à 300 ms, ce que l'architecture de Whisper ne peut égaler. Universal-3 inclut également une diarisation des locuteurs intégrée, éliminant ainsi le besoin d'assembler un pipeline distinct. Sur l'anglais conversationnel, des benchmarks indépendants soutiennent largement l'affirmation d'AssemblyAI selon laquelle le taux d'erreur par mot est inférieur à celui de Whisper large-v3. La tarification commence par un niveau gratuit (cinq heures par mois) puis passe à $0.37 par heure. Whisper l'emporte sur l'étendue des langues (99 contre moins), le coût nul de l'auto-hébergement, la transparence du code et l'absence de dépendance vis-à-vis d'un fournisseur.

Deepgram Nova-3 (sorti en janvier 2025) utilise une architecture de streaming non autorégressive, structurellement opposée à la conception encodeur-décodeur autorégressive de Whisper. Cela permet à Nova-3 de fournir une transcription en continu avec une latence inférieure à 200 ms et des scores de confiance au niveau des mots en temps réel, ce qui en fait le choix de référence pour les déploiements d'agents vocaux et de sous-titrage en direct. Nova-3 couvre nativement 36 langues, moins que Whisper mais avec une plus grande cohérence sur ces langues. Le prix de l'API est de $0.0043 par minute, moins cher que l'API Whisper d'OpenAI à $0.006 par minute. Whisper l'emporte à nouveau sur l'ouverture, l'auto-hébergement et la gamme complète de 99 langues.

Le choix pratique se résume généralement à une question : avez-vous besoin d'une sortie en temps réel ? Si oui, Whisper n'est pas viable sans des solutions de contournement complexes par blocs qui introduisent tout de même de la latence. Si vous traitez de l'audio enregistré par lots, Whisper (auto-hébergé) offre une précision compétitive ou supérieure à un coût par minute nul à grande échelle.

« whisper-large-v3-turbo est vraiment impressionnant. Je transcris des enregistrements d'interviews de 4 heures et le WER est comparable à ce pour quoi je payais Rev.com $0.25/min. L'amélioration de la vitesse par rapport à la v3 est énorme. » - u/mlpraktiker, r/MachineLearning, novembre 2024

La réalité des licences et des droits d'auteur

La licence MIT de Whisper est l'une des plus permissives de l'IA : vous pouvez l'utiliser commercialement, le redistribuer, le modifier et créer des produits par-dessus sans payer de redevances ni obtenir d'autorisations supplémentaires. La licence couvre les poids du modèle et le code d'inférence. Il n'y a pas de clause « l'utilisation commerciale nécessite un accord d'entreprise » que certains modèles ouverts incluent.

La voie de l'auto-hébergement est entièrement gratuite. Vous téléchargez les poids depuis le Hugging Face Hub, installez le package Python et exécutez la transcription localement. Les coûts d'infrastructure GPU sont à votre charge, pas à celle d'OpenAI. Un développeur exécutant large-v3-turbo sur un GPU A10G loué via un fournisseur de cloud paie le tarif du GPU, et non des frais par transcription. À grande échelle, l'aspect économique est convaincant : une société de production de podcasts traitant 1 000 heures par mois paierait environ $360 aux tarifs de l'API OpenAI, ou une fraction de ce montant en calcul GPU en exécutant faster-whisper localement.

La voie de l'API OpenAI facture $0.006 par minute d'audio traitée. Il s'agit d'un tarif standard de paiement à l'utilisation sans exigence d'abonnement. Les équipes qui souhaitent une infrastructure gérée sans posséder de matériel GPU utilisent cette méthode. Il n'y a pas d'abonnement mensuel ni de tarification par poste. Le point de terminaison de l'API (`api.openai.com/v1/audio/transcriptions`) accepte des fichiers audio jusqu'à 25 Mo et renvoie la transcription dans le format demandé.

Les forks communautaires comme faster-whisper et distil-whisper sont également sous licence MIT. WhisperX utilise pyannote.audio pour la diarisation, et pyannote a son propre modèle d'accès sur Hugging Face qui nécessite une restriction par compte avant de télécharger certains modèles. Cela a causé des frictions pour les équipes essayant d'automatiser la configuration de leur pipeline, car la restriction nécessite une étape manuelle de demande de jeton.

Là où Whisper montre systématiquement ses limites

Hallucinations sur le silence et l'audio à faible signal. C'est la limitation documentée la plus sérieuse. Whisper génère du texte d'apparence assurée pendant des segments qui ne contiennent aucune parole, des bruits ambiants ou un son inaudible. Les paramètres `no_speech_threshold` et `logprob_threshold` réduisent ce comportement mais ne l'éliminent pas. Pour les exigences de précision mot à mot (médical, juridique, procès-verbaux officiels), chaque segment de sortie nécessite une validation. Ce n'est pas une préoccupation théorique : l'enquête de l'AP d'octobre 2024 a documenté des incidents spécifiques où Whisper a inséré des mots jamais prononcés dans des résultats de transcription médicale.

Pas de streaming intégré. L'architecture par blocs de 30 secondes de Whisper est une propriété fixe de la façon dont le modèle a été entraîné. Il ne peut pas produire de transcriptions partielles à mesure que l'audio arrive. Les solutions de contournement de la communauté impliquent la détection d'activité vocale (VAD) pour diviser l'audio en blocs au niveau de la phrase, mais celles-ci ajoutent de la latence et de la complexité. Pour les agents vocaux, les sous-titres de réunions en direct ou tout cas d'utilisation où la sortie doit apparaître dans les 500 ms suivant la prise de parole, Whisper nécessite une ingénierie importante autour de ses limitations fondamentales.

La diarisation des locuteurs nécessite un assemblage tiers. La sortie de Whisper est une transcription plate sans étiquettes de locuteur. L'ajout de la diarisation nécessite WhisperX plus pyannote.audio, ce qui implique une installation séparée, un compte Hugging Face avec un accès restreint au modèle et de la mémoire GPU supplémentaire. Les équipes venant d'API commerciales qui incluent la diarisation comme une simple option trouvent ce travail d'intégration important.

Exigences GPU pour large-v3. L'exécution de large-v3 à une vitesse utile nécessite au minimum 10 Go de VRAM en fp16. Les GPU grand public comme la RTX 3060 (12 Go) rencontrent des erreurs de mémoire insuffisante avec les paramètres par défaut. large-v3-turbo a considérablement amélioré cela, mais les développeurs qui veulent une précision maximale sur large-v3 ont toujours besoin d'un matériel sérieux. Les modèles small et medium s'exécutent de manière acceptable sur CPU mais produisent des résultats nettement moins bons sur des audios difficiles.

Variance de la qualité linguistique. Whisper prend en charge 99 langues, mais la répartition de la qualité est inégale. Le modèle atteint des performances proches de celles d'un humain sur l'anglais et les principales langues européennes ; les performances sur les langues disposant de moins de ressources sont suffisamment irrégulières pour que les utilisateurs traitant le yoruba, des dialectes arabes régionaux ou des langues asiatiques moins courantes décrivent fréquemment la sortie comme nécessitant une révision manuelle complète.

À qui s'adresse Whisper

Whisper est spécialement conçu pour les développeurs. Il n'y a pas d'interface utilisateur web officielle, pas d'interface glisser-déposer et pas de tableau de bord géré par OpenAI. Pour démarrer, il faut Python, pip et soit un GPU compatible CUDA, soit la patience d'exécuter des modèles plus petits sur CPU. Si cela décrit votre configuration, Whisper est l'un des outils gratuits les plus performants disponibles pour la transcription à n'importe quelle échelle.

Le cas d'utilisation le plus fort est le traitement par lots sensible aux coûts : production de podcasts, génération de sous-titres vidéo, archivage de conférences enregistrées, transcription d'audios d'interviews pour la recherche, traitement d'enregistrements de centres d'appels. À 1 000 heures d'audio par mois, une configuration faster-whisper auto-hébergée ne coûte que le calcul GPU. Le même volume via une API commerciale coûte $360 ou plus. L'aspect économique est sans appel.

Whisper convient également aux déploiements hors ligne et isolés (air-gapped). Les équipes informatiques du secteur de la santé, les sous-traitants gouvernementaux et les cabinets d'avocats qui ne peuvent pas envoyer d'audio à des API externes peuvent exécuter Whisper entièrement au sein de leur propre infrastructure sans qu'aucune donnée ne quitte leur environnement. La licence MIT signifie que cette utilisation est autorisée sans restriction.

Évitez Whisper lorsque : vous avez besoin d'une transcription en direct avec une latence inférieure à 500 ms pour des agents vocaux ou des applications interactives ; lorsque vos utilisateurs ne sont pas techniques et ont besoin d'une interface web ; lorsque vous traitez des audios médicaux ou juridiques où le risque d'hallucination est inacceptable sans une couche de validation dédiée ; ou lorsque vous avez besoin d'une diarisation des locuteurs de niveau production prête à l'emploi. Dans ces cas, AssemblyAI Universal-3 ou Deepgram Nova-3 comblent les lacunes du temps réel et de la diarisation, au prix d'une dépendance vis-à-vis d'un fournisseur et d'une tarification à la minute.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant Whisper.

Articles associés

Guides et articles en lien avec Whisper.