
Hume AI a créé EVI, une interface vocale empathique qui lit les émotions dans la voix de l'appelant et y répond avec un ton et un rythme adaptés. Fondée par Alan Cowen, ancien chercheur en émotions chez Google, c'est la seule IA vocale commerciale dotée d'une intelligence émotionnelle bidirectionnelle intégrée à son architecture de base.
Hume AI est une société de recherche en IA fondée en mars 2021 par Alan Cowen, un spécialiste des sciences cognitives qui a passé des années à diriger la recherche sur l'informatique affective chez Google AI avant d'obtenir son doctorat en psychologie à UC Berkeley. L'entreprise porte le nom du philosophe David Hume, dont l'argument selon lequel les émotions guident les choix humains se retrouve dans chaque décision produit. En mars 2024, Hume a levé 50M$ en série B menée par EQT Ventures, et a simultanément lancé publiquement son produit phare, l'Empathic Voice Interface (EVI), via API. Le problème central que Hume résout est celui que toutes les autres IA vocales contournent : un appelant qui semble frustré, effrayé ou en détresse ne devrait pas recevoir le même ton qu'un appelant qui semble joyeux, et l'IA elle-même devrait s'adapter, non pas seulement générer un discours expressif, mais lire le sous-texte émotionnel dans ce qu'elle entend.
EVI est un modèle de parole à parole (speech-to-speech) qui traite la voix directement, et non un pipeline STT distinct alimentant un LLM qui alimente un moteur TTS. C'est ainsi qu'il atteint une latence de réponse inférieure à 300 ms tout en analysant simultanément les indices prosodiques dans la voix de l'appelant. La version actuelle, EVI 3 (lancée le 29 mai 2025), introduit le clonage vocal personnalisé à partir de moins de 30 secondes d'audio, la prise en charge de plus de 200 000 voix préconçues, l'intégration avec Claude 4, Gemini 2.5 et Kimi K2, ainsi qu'une sortie expressive à travers 30 styles émotionnels et vocaux distincts allant de la réassurance calme à l'enthousiasme débordant. Aux côtés d'EVI, Hume propose le moteur de synthèse vocale Octave (sorti en décembre 2024) et une Expression Measurement API pour analyser le contenu émotionnel à travers l'audio, la vidéo et les images. Les forfaits commencent à 3 $/mois pour le niveau Starter, avec un niveau gratuit disponible pour l'évaluation.
Ce que Hume EVI produit en mai 2026
EVI 3 est mieux compris comme un modèle unifié de parole et de langage plutôt que comme un pipeline assemblé de toutes pièces. Son pré-entraînement sur des milliers de milliards de tokens textuels et des millions d'heures de parole signifie qu'il comprend comment les caractéristiques vocales interagissent avec le langage, et pas seulement quels mots ont été prononcés. Lorsque la voix d'un appelant monte dans les aigus ou que ses phrases se raccourcissent et se coupent, EVI détecte ces signaux et ajuste sa propre réponse : en ralentissant, en adoucissant le ton, en ajoutant des pauses qui signalent qu'il traite véritablement ce qui a été dit avant de répondre.
En termes de capacités brutes : EVI 3 offre une latence conversationnelle d'environ 300 ms, avec un mode instantané activé par défaut qui commence à envoyer des fragments audio en environ 200 ms. Il prend en charge plus de 11 langues, bien que le produit soit clairement optimisé pour l'anglais en priorité. Le clonage vocal à partir de moins de 30 secondes d'audio capture le timbre, l'accent, le rythme, le ton et la personnalité déduite, ce qui permet de créer une voix personnalisée pour un produit d'entreprise sans des semaines d'enregistrement en studio. L'Expression Measurement API, proposée séparément avec une tarification à l'usage, peut analyser le contenu émotionnel de vidéos avec audio (0,0828 $/min), d'audio seul (0,0639 $/min) et d'images (0,00204 $/image), ce qui ouvre des cas d'usage analytiques au-delà de la simple génération vocale.
Le lancement d'EVI 3 en mai 2025 a été une étape crédible. Lors de tests à l'aveugle publiés par Hume en marge de la sortie, EVI 3 a surpassé GPT-4o, Gemini et Sesame en identifiant huit des neuf émotions testées à partir du seul ton de la voix. Alan Cowen a déclaré lors du lancement : « Chez Hume, nous nous étions promis qu'avant la fin de 2025, nous parviendrions à une expérience d'IA vocale entièrement personnalisable. » EVI 3 a tenu cette promesse spécifique, la création de voix personnalisées sans fine-tuning n'étant pas possible dans les versions antérieures d'EVI.
Les déploiements en conditions réelles corroborent les affirmations techniques. Vonova, une plateforme de support client, a utilisé des agents vocaux propulsés par EVI pour obtenir une réduction de 40 % des coûts opérationnels par rapport aux centres d'appels traditionnels, et une amélioration de 20 % du taux de résolution par l'IA sans escalade humaine. Thumos Care, une plateforme de soins de santé préventifs, a intégré EVI pour les conversations avec les patients où la sensibilité émotionnelle est cliniquement significative. Leur PDG, Shan, a déclaré : « L'EVI de Hume a été transformateur. Il a accéléré notre développement de fonctionnalités émotionnellement intelligentes et a contribué à élargir notre offre de produits. » Ream, une application de coaching en santé mentale, a signalé avoir doublé ses utilisateurs actifs quotidiens après être passée d'interactions textuelles à un coaching vocal propulsé par EVI.
Où se situe Hume EVI par rapport à ElevenLabs et Cartesia AI
ElevenLabs est la comparaison la plus directe en termes de positionnement sur le marché, mais les produits sont mécaniquement différents. La technologie de base d'ElevenLabs est un modèle de synthèse vocale (text-to-speech) qui ne lit pas nativement l'état émotionnel à partir de la voix de l'utilisateur. Sa force réside dans la qualité et l'étendue de sa production : plus de 70 langues (contre 11 pour Hume), une bibliothèque de voix de taille comparable, et des scores de naturel de la parole de 89,6 % dans des benchmarks indépendants contre 78,5 % pour Hume. Le modèle v3 d'ElevenLabs offre une narration propre et cohérente qui « peut passer pour de la parole humaine » dans la création de contenu, la production de livres audio et le déploiement multilingue. L'émotion est disponible dans ElevenLabs via des balises SSML et des prompts, mais c'est un paramètre côté sortie, le modèle n'écoute pas comment vous parlez pour s'adapter. Pour un agent de support client qui doit détecter un appelant frustré et répondre avec une véritable désescalade, ElevenLabs ne fournit aucun mécanisme natif pour le faire. Pour un podcasteur qui a besoin d'une narration multilingue dans 40 langues, ElevenLabs est le choix évident et Hume n'est pas le bon outil.
Cartesia AI opère à un niveau totalement différent. Le modèle Sonic de Cartesia est un pur moteur de streaming TTS visant un délai avant le premier son (time-to-first-audio) inférieur à 90 ms, comparé aux 200-300 ms de Hume. Cartesia est environ 33 % moins cher par caractère (0,00004 $ contre 0,00006 $) et cible les développeurs qui assemblent leurs propres pipelines vocaux : ils apportent le STT, le routent vers leur propre LLM, et utilisent Cartesia pour une synthèse rapide et propre côté sortie. Cartesia n'a aucune détection d'émotion dans un sens ou dans l'autre. Le compromis est explicite : si la latence et la rentabilité sont les contraintes et que vous êtes prêt à gérer vous-même la couche de contexte émotionnel, Cartesia l'emporte. Si la réactivité émotionnelle doit être intégrée au modèle vocal lui-même, ce qui importe le plus dans la santé mentale, les soins de santé et les interactions client à fort enjeu, Cartesia ne peut pas remplacer EVI.
Pour les développeurs qui construisent des systèmes où les appelants peuvent être en détresse, en colère ou effrayés, la bidirectionnalité est tout l'enjeu. EVI lit ce qu'il entend ; ElevenLabs et Cartesia ne le font pas. Cette distinction restreint le marché adressable de Hume mais le rend véritablement différencié au sein de cet espace plus restreint, un peu comme Whisper domine la précision de la reconnaissance vocale (speech-to-text) mais n'est pas un modèle conversationnel. L'association d'outils comme OpenVoice pour le clonage vocal personnalisé ou PlayHT pour la génération vocale montre à quel point l'espace adjacent est encombré, mais aucun de ces outils ne tente l'intelligence émotionnelle bidirectionnelle au niveau du modèle.
« La précision de la détection des émotions m'a époustouflé. Hume AI pouvait faire la différence entre des appelants agacés et en colère. », critique, fahimai.com, 2026
La réalité des licences et des droits d'auteur
La capacité de clonage vocal d'EVI 3 soulève les mêmes questions qui accompagnent toute plateforme d'IA vocale. Hume exige des utilisateurs qu'ils confirment avoir les droits sur toute voix qu'ils clonent, et les conditions d'utilisation interdisent le clonage de voix sans consentement. Dans la pratique, il s'agit d'un garde-fou auto-régulé. Hume ne dispose pas d'une couche de vérification vocale distincte, la responsabilité incombe donc au développeur ou à l'entreprise cliente. L'Expression Measurement API, qui traite l'audio et la vidéo de tiers pour en extraire le contenu émotionnel, se situe dans un paysage juridique plus complexe : son utilisation pour analyser les appels des clients sans divulgation pourrait créer une responsabilité selon la juridiction, et la documentation de Hume ne rend pas ce risque explicite dans le processus d'intégration.
Les droits commerciaux pour l'audio généré par EVI sont inclus dans tous les forfaits payants ; le forfait Creator (7 $-14 $/mois) est le point d'entrée pour une licence commerciale. Les résultats du niveau gratuit sont uniquement destinés à l'évaluation et ne peuvent pas être utilisés dans des produits en production. Pour les entreprises des secteurs réglementés, de la santé, des services financiers, Hume positionne EVI comme conforme à la loi HIPAA, ce qui constitue une différenciation significative par rapport aux outils d'IA vocale moins soucieux de la conformité, bien que les entreprises doivent vérifier les spécificités de leur accord de partenariat commercial (BAA) plutôt que de présumer d'une couverture.
Là où Hume EVI montre ses limites
L'écart de couverture linguistique est la limite stricte la plus évidente. EVI prend en charge environ 11 langues début 2026. ElevenLabs en prend en charge plus de 70. Si votre produit s'adresse à des utilisateurs non anglophones dans un volume significatif, EVI n'est pas une couche vocale principale viable aujourd'hui. Il ne s'agit pas d'une lacune mineure à contourner, c'est un obstacle au déploiement pour tout cas d'usage mondial ou multilingue de support client ou de soins de santé.
L'accès à EVI nécessite un travail d'ingénierie. Il n'y a pas d'interface graphique (GUI) où un non-développeur peut construire, tester et déployer un agent vocal. Chaque configuration significative, les prompts système, la sélection de la voix, le routage LLM, l'injection de contexte, passe par l'API ou les SDK. Les petites équipes sans ressources d'ingénierie ne peuvent pas se débrouiller seules. Les 5 minutes EVI du niveau gratuit ne donnent presque rien pour évaluer ; des tests significatifs nécessitent au minimum le niveau Starter.
La facturation peut surprendre les équipes à grande échelle. Le modèle de dépassement facture de 0,04 $ à 0,07 $ par minute EVI au-delà de l'allocation du forfait. Une équipe de support client avec un volume d'appels élevé lors d'un mois chargé peut se retrouver avec un forfait Pro à 70 $ (1 200 minutes EVI incluses) accumulant des centaines de dollars de dépassements. Contrairement à la tarification forfaitaire par caractère de Cartesia ou au modèle de crédits plus clair d'ElevenLabs, la structure de coûts de Hume nécessite une surveillance attentive pour les charges de travail en production.
Les limites de simultanéité sont restreintes par les forfaits d'une manière qui devient contraignante. La mise à l'échelle des sessions EVI simultanées nécessite de passer aux niveaux Business (500 $/mois) ou Enterprise. Les équipes qui prototypent sur Starter et se développent rapidement atteignent ces plafonds avant d'avoir les revenus pour justifier le saut de forfait.
« La première semaine a été difficile. La configuration des appels API a pris plus de temps que prévu. », utilisateur développeur, référencé dans la critique de fahimai.com en 2026
À qui s'adresse Hume EVI
EVI est le bon choix pour les équipes d'ingénierie qui créent des applications vocales conversationnelles où le registre émotionnel de l'appelant et de la réponse de l'IA sont des exigences fondamentales. Le support client pour des interactions à fort enjeu ou sensibles, le coaching en santé mentale, l'admission des patients dans les soins de santé et les applications de tutorat où un utilisateur en détresse ou confus a besoin de plus que des informations correctes : il a besoin d'une voix qui réponde à la façon dont il s'exprime réellement. Dans ces contextes, l'intelligence émotionnelle bidirectionnelle de Hume n'est pas un simple atout ; c'est la fonctionnalité principale qui la distingue de l'ajout de mots-clés de sentiment sur un prompt TTS standard.
Ignorez Hume EVI si votre exigence principale est la couverture multilingue, la narration de contenu, la production de livres audio ou l'optimisation pure de la latence pour un pipeline vocal. Ces cas d'usage sont mieux servis par ElevenLabs ou Cartesia AI respectivement, à moindre coût et avec moins de complexité d'intégration. Ignorez-le également si votre équipe ne peut pas consacrer de temps d'ingénierie à l'intégration, ce n'est pas un produit pour les utilisateurs non techniques qui souhaitent créer un agent vocal via une interface visuelle.
La série B de 50M$ menée par EQT Ventures en mars 2024, combinée à Northwell Holdings (un système de santé) et LG Technology Ventures parmi les investisseurs, signale où l'entreprise voit son avenir : les industries réglementées et les déploiements d'entreprise où la couche d'intelligence émotionnelle est une propriété intellectuelle défendable, et pas seulement une astuce de prompt engineering. Pour les développeurs qui construisent dans ces espaces, le pedigree de recherche de Hume, la méthodologie d'entraînement RLHE et les résultats mesurables des clients comme Vonova, Thumos Care et Ream en font l'IA vocale spécialisée la plus crédible actuellement disponible.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Hume AI.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

AI Receptionist for Solo Professionals: Replace the Answering Service (2026)
