Saltar al contenido principal
Vantaige
Retell AI screenshot
Retell AI logo

Retell AI

Freemium

Retell AI es una plataforma de infraestructura de agentes de voz respaldada por Y Combinator (W24) para crear agentes telefónicos impulsados por IA. Los desarrolladores conectan su propio LLM, configuran flujos de llamadas e implementan agentes que gestionan llamadas reales con una latencia de ~600ms. Utilizada a gran escala por empresas de atención médica, logística y comercio electrónico.

Funciones:API

Retell AI es una plataforma de infraestructura de agentes de voz diseñada para desarrolladores y equipos de ingeniería que necesitan automatizar llamadas telefónicas a gran escala. Lanzada en febrero de 2024 como parte del lote W24 de Y Combinator, la empresa creció de cero a más de $40M en ARR en aproximadamente dos años, impulsando más de 40 millones de llamadas telefónicas de IA en tiempo real al mes para principios de 2026. La plataforma se centra en las operaciones de los centros de contacto: atención al cliente entrante, alcance de ventas salientes, programación de citas, cobro de deudas y calificación de clientes potenciales, conectando grandes modelos de lenguaje a la infraestructura telefónica y gestionando las partes complejas de ingeniería de la IA de voz, incluida la gestión de latencia, el manejo de interrupciones y la toma de turnos.

La plataforma funciona como middleware entre la telefonía, la conversión de voz a texto, el razonamiento del LLM y la conversión de texto a voz. Los desarrolladores aportan su propio LLM (GPT-4.1, Claude, Gemini, Llama u otros) o utilizan los predeterminados de la plataforma, configuran flujos de llamadas a través de un constructor visual de arrastrar y soltar o una API sin procesar, e implementan agentes que responden llamadas telefónicas reales. Las características clave incluyen la llamada a funciones en tiempo real para reservas o procesamiento de pagos en medio de la conversación, RAG en streaming con sincronización automática para el acceso a la base de conocimientos, llamadas salientes por lotes sin límites de concurrencia, análisis posteriores a la llamada y Retell Assure (lanzado en enero de 2026), un sistema de control de calidad automatizado que monitorea el 100% de las llamadas en lugar de la tasa estándar de la industria del 1-2% de verificaciones puntuales humanas. La cobertura de cumplimiento incluye HIPAA, SOC2 Type II y GDPR, con implementación local disponible para empresas.

Lo que realmente hace Retell AI en mayo de 2026

Retell se sitúa en la intersección de cuatro componentes: conversión de voz a texto (transcribiendo a la persona que llama en tiempo real), razonamiento del LLM (decidiendo qué decir), conversión de texto a voz (convirtiendo la respuesta en voz) y telefonía (la infraestructura telefónica). La plataforma orquesta estas capas, con una latencia de respuesta de aproximadamente 600ms de extremo a extremo, que se encuentra entre las más rápidas de esta categoría de productos. Ese número es importante porque cualquier cosa por encima de 1.5-2 segundos comienza a sentirse poco natural para una persona que llama y espera a un humano.

A principios de 2026, la plataforma admite más de 50 idiomas, operación multicanal (voz, chat, SMS a través de la misma configuración de agente) y llamadas a funciones en tiempo real. Esta última característica significa que el agente realmente puede hacer cosas durante una llamada: verificar la disponibilidad de citas, procesar un pago, actualizar un registro de CRM o transferir a un agente humano, todo sin poner a la persona que llama en espera. La plataforma se integra con HubSpot, Twilio, Vonage, Go High Level, n8n, Zapier, Salesforce y plataformas de centros de contacto empresariales como Avaya, Genesys, Five9 y Amazon Connect.

En diciembre de 2025, Retell lanzó Retell Assure, su herramienta automatizada de control de calidad. El sistema analiza cada llamada frente a criterios personalizables que incluyen latencia, interrupciones, alucinaciones y sentimiento del cliente, y luego ajusta automáticamente el comportamiento del modelo. El control de calidad tradicional de los centros de contacto implica que los humanos revisen el 1-2% de las llamadas, con ciclos de retroalimentación que tardan semanas. Retell Assure cierra ese ciclo en tiempo real en el 100% del volumen. El CEO Bing Wu lo describió como "la solicitud número 1 de nuestros clientes empresariales, nuestro segmento de clientes de más rápido crecimiento".

"Se me puso la piel de gallina al pensar en el hecho de que estoy hablando con una computadora". - _fw, Hacker News, febrero de 2024 (sobre la demostración de Launch HN)

Dónde se sitúa Retell AI frente a Vapi y Bland AI

Tres plataformas dominan esta capa de infraestructura: Retell AI, Vapi y Bland AI. Cada una hace una apuesta arquitectónica diferente.

Vapi es nativa de API hasta el punto de la granularidad. Expone cada componente del canal de voz individualmente: puede cambiar su proveedor de STT, cambiar su motor de inferencia LLM, configurar los umbrales de Detección de Actividad de Voz al milisegundo y ajustar el manejo de interrupciones por estado de conversación. Ese poder tiene un costo. Vapi requiere equipos de ingeniería que quieran mantener esa configuración, y el precio total oscila entre $0.13 y $0.31/min, más alto que las configuraciones comparables de Retell. Vapi es la plataforma que los equipos de ingeniería más exigentes se recomiendan entre sí cuando necesitan el máximo control. Retell abstrae esas capas en valores predeterminados sensatos con opciones de anulación, lo que hace que sea más rápido de implementar, pero significa que se pierde parte de ese ajuste a nivel de milisegundos.

Bland AI tomó un camino diferente: en lugar de orquestar proveedores externos de LLM y TTS como lo hacen Retell y Vapi, Bland construyó una pila de modelos internos patentados. Eso significa que Bland controla la latencia de extremo a extremo sin depender de los tiempos de respuesta de API de terceros. La compensación es una menor flexibilidad en la elección del modelo, pero la fortaleza de Bland radica en volúmenes de llamadas salientes muy altos, donde millones de minutos al mes hacen que esa previsibilidad de latencia constante sea valiosa. Bland también tiene una capa de memoria entre llamadas que permite a los agentes hacer referencia a lo que sucedió en llamadas anteriores con el mismo contacto, algo que Retell no hace de forma nativa. Retell supera a Bland en latencia promedio (~600ms frente a ~800ms) y gana en casos de uso de soporte al cliente/entrante donde la calidad de la voz y la sensación de conversación natural importan más que el rendimiento del volumen bruto.

Para los equipos que desean emparejar su canal de voz con infraestructura de código abierto y evitar por completo los costos de proveedores por minuto, vale la pena examinar Pipecat. Es un marco de Python autohospedado para agentes conversacionales multimodales sin tarifa por minuto, aunque requiere significativamente más ingeniería para operar al nivel que Retell maneja de manera predeterminada.

En cuanto a la calidad de TTS específicamente, Retell admite ElevenLabs como opción de TTS (con una prima: $0.040/min frente a $0.015/min para otros proveedores), lo que da acceso a la clonación de voz de mayor calidad en el mercado para aplicaciones donde el realismo de la voz es crítico.

"El control de calidad automatizado fue la solicitud número 1 de nuestros clientes empresariales, nuestro segmento de clientes de más rápido crecimiento". - Bing Wu, cofundador y CEO de Retell AI, diciembre de 2025

Cómo es la realidad de construcción e implementación de agentes de voz

Poner en marcha un agente básico lleva unas pocas horas para un desarrollador familiarizado con las API REST. Se crea un agente en el panel de control, se configura el prompt del sistema y los ajustes del LLM, se conecta un número de teléfono (Retell proporciona números, o puede traer el suyo propio a través de Twilio o Vonage) y se realiza una llamada de prueba. El constructor de flujo visual maneja rutas condicionales simples; la lógica de ramificación compleja pasa por la API. La llamada a funciones en tiempo real requiere escribir endpoints de webhook que el agente llama en medio de la conversación, que es donde se gasta la mayor parte del tiempo de ingeniería para las implementaciones de producción.

El modelo de precios se acumula de maneras que el titular de $0.07/min subestima. Una configuración realista utilizando GPT-4.1 como LLM y el TTS predeterminado de Retell se acerca más a $0.12-$0.15/min. Si usa ElevenLabs para la voz y Claude Sonnet para el razonamiento, estará en $0.19-$0.22/min antes de los complementos. A 10,000 minutos por mes, esa es la diferencia entre aproximadamente $700 y $2,200. Las empresas deben construir modelos de costos frente a sus elecciones reales de LLM y TTS antes de comprometerse, no la tarifa base anunciada. Un agregador de reseñas señaló que "los costos totales en el mundo real de $0.25-$0.33/min son comunes" para las implementaciones de producción.

El soporte al cliente para los clientes de pago por uso se realiza a través de Discord y correo electrónico, lo que funciona bien para los desarrolladores que solucionan problemas técnicos, pero crea fricción para los equipos comerciales que esperan SLA más rápidos. Los clientes empresariales obtienen portales de soporte dedicados y cobertura omnicanal 24/7. Múltiples reseñas de Trustpilot señalaron dificultades para cancelar cuentas después de que terminaron las pruebas y respuestas poco claras sobre el cumplimiento del GDPR, problemas que no coinciden con la calificación de G2 centrada en el desarrollador de 4.8/5.

Vale la pena señalar la conexión con LK LiveKit: la capa de transporte en tiempo real subyacente de Retell se basa en los mismos conceptos de infraestructura WebRTC que LiveKit, y algunos equipos usan LiveKit directamente cuando desean un control más granular sobre la capa de comunicación en tiempo real debajo de sus agentes de voz.

Para quién está diseñado Retell AI

El ajuste más claro para Retell: un equipo de ingeniería de software en una empresa con sede en EE. UU. en atención médica, logística, bienes raíces, cobro de deudas o comercio electrónico que necesita automatizar un volumen significativo de llamadas entrantes y tiene desarrolladores para mantener la integración. Medical Data Systems implementó Retell para manejar el 100% de las llamadas entrantes con solo una tasa de transferencia humana del 30%, recaudando aproximadamente $280,000/mes en conversaciones automatizadas de deudas. Pine Park Health mejoró el NPS de programación en un 38% y llenó la capacidad de los proveedores que anteriormente no se utilizaba. SWTCH, una empresa de carga de vehículos eléctricos, redujo los costos de soporte en más del 50%. Estos no son casos aislados; representan para lo que se optimiza la plataforma.

La historia de cumplimiento es genuinamente sólida. Las certificaciones HIPAA, SOC2 Type II y GDPR están vigentes. La redacción de información personal, el control de acceso basado en roles y el SSO están disponibles en el nivel empresarial. Para las industrias reguladas donde la falta de un BAA de un competidor los descalificaría, Retell es a menudo la opción práctica.

Lo que no es Retell AI

Retell no está diseñado para usuarios sin conocimientos técnicos. Los propietarios de empresas o los equipos de operaciones sin desarrolladores en el personal encontrarán que la plataforma es demasiado compleja para una implementación sin soporte. No hay un constructor de flujo de trabajo visual completo con mapeo de respaldo de arrastrar y soltar para cada caso extremo. No hay un entorno de prueba que refleje completamente la producción. El control de acceso basado en roles y los registros de auditoría son solo para el nivel empresarial, lo que crea fricción para las empresas del mercado medio que necesitan esos controles pero aún no tienen escala empresarial.

Tampoco es la opción correcta para ventas salientes puras a un volumen muy alto. Si el caso de uso principal es marcar millones de minutos al mes en campañas salientes secuenciales con memoria por contacto de llamadas pasadas, la arquitectura de Bland AI está diseñada específicamente para ese flujo de trabajo. La fortaleza de Retell es el servicio al cliente entrante y las operaciones mixtas entrantes/salientes donde la calidad de la voz y la confiabilidad a una concurrencia moderada importan más que el rendimiento bruto.

Las empresas europeas con estrictos requisitos de soberanía de datos, particularmente en Alemania (donde más de 37 revisores de G2 señalaron específicamente brechas de cumplimiento y calidad de voz) y el Reino Unido, deben verificar la disponibilidad regional actual y los términos de residencia de datos antes de comprometerse. Existe cobertura GDPR, pero las garantías de residencia de datos en el nivel de pago por uso son menos claras que en el nivel empresarial.

Finalmente: el titular de $0.07/min es matemática de marketing. Presupueste para sus selecciones reales de LLM y TTS. Para los equipos que evalúan el costo total de propiedad, los precios modulares son transparentes una vez que se lee la página de precios detenidamente, pero la brecha entre la tarifa promocional y la realidad de producción ha frustrado a suficientes usuarios como para justificar el establecimiento explícito de expectativas antes de registrarse.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con Retell AI.