
Hume AI desarrolló EVI, una interfaz de voz empática que lee las emociones en la voz del interlocutor y responde con el tono y ritmo adecuados. Fundada por Alan Cowen, exinvestigador de emociones en Google, es la única IA de voz comercial con inteligencia emocional bidireccional integrada en su arquitectura central.
Hume AI es una empresa de investigación en IA fundada en marzo de 2021 por Alan Cowen, un científico cognitivo que pasó años liderando la investigación de computación afectiva en Google AI antes de completar su doctorado en Psicología en UC Berkeley. La empresa lleva el nombre del filósofo David Hume, cuyo argumento de que las emociones impulsan las decisiones humanas está presente en cada decisión de producto. En marzo de 2024, Hume recaudó una Serie B de $50M liderada por EQT Ventures, y simultáneamente lanzó su producto estrella, la Empathic Voice Interface (EVI), de forma pública a través de API. El problema central que Hume resuelve es uno que cualquier otra IA de voz evade: un interlocutor que suena frustrado, asustado o angustiado no debería recibir el mismo tono que uno que suena alegre, y la propia IA debería ajustarse, no solo generar un habla expresiva, sino leer el subtexto emocional en lo que escucha.
EVI es un modelo de voz a voz (speech-to-speech) que procesa la voz directamente, no un flujo de trabajo STT separado que alimenta a un LLM y luego a un motor TTS, que es como logra una latencia de respuesta inferior a 300ms mientras analiza simultáneamente las señales prosódicas en la voz del interlocutor. La versión actual, EVI 3 (lanzada el 29 de mayo de 2025), introduce la clonación de voz personalizada a partir de menos de 30 segundos de audio, soporte para más de 200,000 voces prediseñadas, integración con Claude 4, Gemini 2.5 y Kimi K2, y una salida expresiva en 30 estilos emocionales y vocales distintos que van desde la tranquilidad reconfortante hasta el entusiasmo de alta energía. Junto a EVI, Hume ofrece el motor de texto a voz Octave (lanzado en diciembre de 2024) y una Expression Measurement API para analizar el contenido emocional en audio, video e imágenes. Los planes comienzan en $3/mes para el nivel Starter, con un nivel gratuito disponible para evaluación.
Lo que Hume EVI produce en mayo de 2026
EVI 3 se entiende mejor como un modelo unificado de lenguaje y voz en lugar de un flujo de trabajo ensamblado. Su preentrenamiento con billones de tokens de texto y millones de horas de voz significa que comprende cómo las características vocales interactúan con el lenguaje, no solo qué palabras se dijeron. Cuando la voz de un interlocutor sube de tono o sus oraciones se acortan y entrecortan, EVI detecta esas señales y ajusta su propia respuesta: disminuyendo la velocidad, suavizando el tono y agregando pausas que indican que realmente está procesando lo que se dijo antes de responder.
En términos de capacidades brutas: EVI 3 ofrece una latencia conversacional de alrededor de 300ms, con un modo instantáneo habilitado por defecto que comienza a enviar fragmentos de audio en aproximadamente 200ms. Soporta más de 11 idiomas, aunque el producto está claramente optimizado primero para el inglés. La clonación de voz a partir de menos de 30 segundos de audio captura el timbre, el acento, el ritmo, el tono y la personalidad inferida, lo que hace posible crear una voz personalizada para un producto empresarial sin semanas de grabación en estudio. La Expression Measurement API, que se ofrece por separado con tarifas de pago por uso, puede analizar el contenido emocional de videos con audio ($0.0828/min), solo audio ($0.0639/min) e imágenes ($0.00204/imagen), lo que abre casos de uso analíticos más allá de la pura generación de voz.
El lanzamiento de EVI 3 en mayo de 2025 fue un hito creíble. En pruebas a ciegas que Hume publicó junto con el lanzamiento, EVI 3 superó a GPT-4o, Gemini y Sesame en la identificación de ocho de nueve emociones probadas basándose únicamente en el tono de voz. Alan Cowen declaró en el lanzamiento: "En Hume, nos prometimos que antes de finales de 2025, lograríamos una experiencia de IA de voz que pudiera personalizarse por completo". EVI 3 cumplió esa promesa específica; la creación de voces personalizadas sin ajustes finos (fine-tuning) no había sido posible en versiones anteriores de EVI.
Las implementaciones en el mundo real corroboran las afirmaciones técnicas. Vonova, una plataforma de atención al cliente, utilizó agentes de voz impulsados por EVI para lograr una reducción del 40% en los costos operativos frente a los centros de llamadas tradicionales, y una mejora del 20% en la tasa de resolución de la IA sin escalamiento humano. Thumos Care, una plataforma de atención médica preventiva, integró EVI para conversaciones con pacientes donde la sensibilidad emocional es clínicamente significativa. Su CEO, Shan, dijo: "EVI de Hume fue transformador. Aceleró nuestro desarrollo de funciones emocionalmente inteligentes y ayudó a expandir nuestra oferta de productos". Ream, una aplicación de coaching de salud mental, informó haber duplicado sus usuarios activos diarios después de cambiar de interacciones basadas en texto a coaching de voz impulsado por EVI.
Dónde se sitúa Hume EVI frente a ElevenLabs y Cartesia AI
ElevenLabs es la comparación más directa en el posicionamiento del mercado, pero los productos son mecánicamente diferentes. La tecnología central de ElevenLabs es un modelo de texto a voz que no lee de forma nativa el estado emocional de la voz del usuario. Su fortaleza es la calidad y amplitud de salida: más de 70 idiomas (frente a los 11 de Hume), una biblioteca de voces de tamaño comparable y puntuaciones de naturalidad del habla del 89.6% en pruebas independientes frente al 78.5% de Hume. El modelo v3 de ElevenLabs ofrece una narración limpia y consistente que "puede pasar por habla humana" en la creación de contenido, producción de audiolibros e implementación multilingüe. La emoción está disponible en ElevenLabs a través de etiquetas SSML y prompts, pero es un parámetro del lado de la salida; el modelo no escucha cómo sonaste para adaptarse. Para un agente de atención al cliente que necesita detectar a un interlocutor frustrado y responder con una desescalada genuina, ElevenLabs no proporciona ningún mecanismo nativo para hacerlo. Para un podcaster que necesita narración multilingüe en 40 idiomas, ElevenLabs es la opción clara y Hume no es la herramienta adecuada.
Cartesia AI opera en una capa completamente diferente. El modelo Sonic de Cartesia es un motor de streaming TTS puro que apunta a un tiempo hasta el primer audio inferior a 90ms, en comparación con los 200-300ms de Hume. Cartesia es aproximadamente un 33% más barato por carácter ($0.00004 frente a $0.00006) y está dirigido a desarrolladores que ensamblan sus propios flujos de voz: aportan STT, enrutan a su propio LLM y usan Cartesia para una síntesis rápida y limpia en el lado de la salida. Cartesia no tiene detección de emociones en ninguna dirección. La compensación es explícita: si la latencia y la eficiencia de costos son las restricciones y estás dispuesto a gestionar la capa de contexto emocional por ti mismo, Cartesia gana. Si la capacidad de respuesta emocional necesita estar integrada en el propio modelo de voz, lo cual es más importante en salud mental, atención médica e interacciones de alto riesgo con clientes, Cartesia no puede sustituir a EVI.
Para los desarrolladores que construyen sistemas donde los interlocutores pueden estar angustiados, enojados o asustados, la bidireccionalidad es el punto clave. EVI lee lo que escucha; ElevenLabs y Cartesia no lo hacen. Esa distinción reduce el mercado al que se dirige Hume, pero lo hace genuinamente diferenciado dentro de ese espacio más estrecho, de manera muy similar a cómo Whisper domina la precisión de voz a texto pero no es un modelo conversacional. Combinar herramientas como OpenVoice para la clonación de voz personalizada o PlayHT para la generación de voz muestra lo concurrido que está el espacio adyacente, pero ninguna de esas herramientas intenta la inteligencia emocional bidireccional a nivel de modelo.
"La precisión de la detección de emociones me dejó impresionado. Hume AI pudo notar la diferencia entre interlocutores molestos y enojados.", reseñador, fahimai.com, 2026
La realidad de las licencias y los derechos de autor
La capacidad de clonación de voz de EVI 3 plantea las mismas preguntas que siguen a cualquier plataforma de IA de voz. Hume requiere que los usuarios confirmen que tienen los derechos de cualquier voz que clonen, y los términos de servicio prohíben clonar voces sin consentimiento. En la práctica, esta es una medida de seguridad autocontrolada. Hume no tiene una capa de verificación de voz separada, por lo que la responsabilidad recae en el desarrollador o cliente empresarial. La Expression Measurement API, que procesa audio y video de terceros en busca de contenido emocional, se encuentra en un panorama legal más complejo: usarla para analizar llamadas de clientes sin divulgación podría crear responsabilidad dependiendo de la jurisdicción, y la documentación de Hume no hace explícito ese riesgo en el flujo de incorporación.
Los derechos comerciales para el audio generado por EVI están incluidos en todos los planes de pago; el plan Creator ($7-$14/mes) es el punto de entrada para una licencia comercial. La salida del nivel gratuito es solo para evaluación y no se puede utilizar en productos de producción. Para empresas en industrias reguladas, atención médica, servicios financieros, Hume posiciona a EVI como compatible con HIPAA, lo cual es una diferenciación significativa sobre las herramientas de IA de voz menos conscientes del cumplimiento, aunque las empresas deben verificar los detalles de la configuración de su acuerdo de socio comercial en lugar de asumir la cobertura.
Dónde Hume EVI se queda corto de manera constante
La brecha en la cobertura de idiomas es el límite estricto más claro. EVI soporta aproximadamente 11 idiomas a principios de 2026. ElevenLabs soporta más de 70. Si tu producto atiende a usuarios que no hablan inglés en un volumen significativo, EVI no es una capa de voz principal viable hoy en día. Esta no es una brecha menor que se pueda sortear, es un obstáculo de implementación para cualquier caso de uso global o multilingüe de atención al cliente o atención médica.
El acceso a EVI requiere trabajo de ingeniería. No hay una interfaz gráfica de usuario (GUI) donde un no desarrollador pueda construir, probar e implementar un agente de voz. Cada configuración significativa, prompts del sistema, selección de voz, enrutamiento de LLM, inyección de contexto, ocurre a través de la API o los SDK. Los equipos más pequeños sin recursos de ingeniería no pueden autogestionarse. Los 5 minutos de EVI del nivel gratuito no dan casi nada para evaluar; las pruebas significativas requieren el nivel Starter como mínimo.
La facturación puede sorprender a los equipos a gran escala. El modelo de excedentes cobra $0.04-$0.07 por minuto de EVI más allá de la asignación del plan. Un equipo de atención al cliente con un alto volumen de llamadas en un mes ocupado puede descubrir que un plan Pro de $70 (1,200 minutos de EVI incluidos) acumula cientos de dólares en excedentes. A diferencia de los precios fijos por carácter de Cartesia o el modelo de créditos más claro de ElevenLabs, la estructura de costos de Hume requiere un monitoreo cuidadoso para las cargas de trabajo de producción.
Los límites de concurrencia están restringidos por el plan de maneras que se vuelven problemáticas. Escalar sesiones concurrentes de EVI requiere pasar a los niveles Business ($500/mes) o Enterprise. Los equipos que crean prototipos en Starter y crecen rápidamente alcanzan estos techos antes de tener los ingresos para justificar el salto de plan.
"La primera semana fue dura. Configurar las llamadas a la API tomó más tiempo del que esperaba.", usuario desarrollador, referenciado en la reseña de fahimai.com de 2026
Para quién es Hume EVI
EVI es la opción correcta para los equipos de ingeniería que construuyen aplicaciones de voz conversacionales donde el registro emocional tanto del interlocutor como de la respuesta de la IA son requisitos fundamentales. Atención al cliente para interacciones sensibles o de alto riesgo, coaching de salud mental, admisión de pacientes en atención médica y aplicaciones de tutoría donde un usuario angustiado o confundido necesita más que información correcta; necesita una voz que responda a cómo suena realmente. En esos contextos, la inteligencia emocional bidireccional de Hume no es un lujo; es la característica central que lo distingue de simplemente añadir palabras clave de sentimiento a un prompt TTS estándar.
Omite Hume EVI si tu requisito principal es la cobertura multilingüe, la narración de contenido, la producción de audiolibros o la optimización pura de la latencia para un flujo de voz. Esos casos de uso están mejor atendidos por ElevenLabs o Cartesia AI respectivamente, a un costo menor y con menos complejidad de integración. También omítelo si tu equipo no puede dedicar tiempo de ingeniería a la integración; este no es un producto para usuarios no técnicos que desean construir un agente de voz a través de una interfaz visual.
La Serie B de $50M de EQT Ventures en marzo de 2024, combinada con Northwell Holdings (un sistema de atención médica) y LG Technology Ventures entre los inversores, señala dónde ve la empresa su futuro: industrias reguladas e implementaciones empresariales donde la capa de inteligencia emocional es propiedad intelectual defendible, no solo un truco de ingeniería de prompts. Para los desarrolladores que construyen en esos espacios, el pedigrí de investigación de Hume, la metodología de entrenamiento RLHE y los resultados medibles de los clientes de Vonova, Thumos Care y Ream lo convierten en la IA de voz especializada más creíble disponible en la actualidad.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Artículos relacionados
Guías y artículos relacionados con Hume AI.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

AI Receptionist for Solo Professionals: Replace the Answering Service (2026)
