Saltar al contenido principal
Vantaige
Deepgram screenshot
Deepgram logo

Deepgram

Freemium

Deepgram es una API para desarrolladores de conversión de voz a texto (STT), texto a voz (TTS) y orquestación de agentes de voz. Nova-3 ofrece transcripción en streaming con una latencia inferior a 300 ms por $0.46 la hora de audio, con implementación local (on-premises) y una Voice Agent API que combina STT, TTS y enrutamiento de LLM en un único flujo de WebSocket.

Funciones:API

Deepgram es una plataforma de voz con IA desarrollada por Deepgram, Inc., una empresa de San Francisco fundada en 2015. Ofrece tres API de producción: conversión de voz a texto mediante el modelo Nova-3, conversión de texto a voz con Aura-2 y una Voice Agent API que integra STT, TTS y la orquestación de LLM en un único flujo gestionado de WebSocket. La plataforma no tiene interfaz para el consumidor final. Se envía audio o texto a través de la API y se obtienen transcripciones estructuradas, voz sintetizada o sesiones completas de agentes de voz. Más de 450 clientes empresariales utilizan Deepgram en producción, incluyendo Twilio, Aircall y Jack in the Box.

Nova-3, lanzado el 12 de febrero de 2025, es el modelo STT insignia actual. Logra una tasa de error de palabras (WER) media del 6.84% en audio en streaming, una mejora del 54.3% sobre su competidor de API gestionada más cercano. Soporta el cambio de código (code-switching) en tiempo real en 10 idiomas simultáneamente, ofrece inyección de términos clave (keyterm prompting) para una adaptación instantánea del vocabulario sin reentrenar el modelo, y opera con una latencia inferior a 300 ms en sesiones de streaming. La Voice Agent API alcanzó la disponibilidad general el 16 de junio de 2025, con una puntuación de 71.5 en el Voice Agent Quality Index, superando a OpenAI en un 6.4% y a ElevenLabs en un 29.3% en un compuesto de latencia, tasa de interrupción y cobertura de respuesta. Aura-2 TTS ofrece un tiempo hasta el primer byte (time-to-first-byte) inferior a 200 ms con más de 40 voces en inglés en 7 idiomas.

Lo que Deepgram realmente hace en abril de 2026

El producto principal de Deepgram es la infraestructura de voz gestionada. Te conectas a su API a través de WebSocket para streaming en tiempo real o mediante HTTP para el procesamiento por lotes de archivos pregrabados. Nova-3 se encarga del trabajo pesado en el lado del STT: acepta flujos de audio y devuelve transcripciones a nivel de palabra con marcas de tiempo, diarización de hablantes opcional, puntuación y redacción en tiempo real de hasta 50 tipos de entidades (números de teléfono, tarjetas de crédito, números de seguro social).

La función de inyección de términos clave (keyterm prompting) merece especial atención. En lugar de requerir un ajuste fino (fine-tuning) del modelo o la carga de vocabularios personalizados, Nova-3 acepta hasta 100 términos específicos del dominio por solicitud de API y aumenta su probabilidad de reconocimiento sin ningún ciclo de reentrenamiento. Esto hace que sea más rápido adaptar Deepgram para audio médico, legal o técnico de lo que permiten los flujos de trabajo de ajuste fino tradicionales. El límite de 100 términos es una restricción real para vocabularios extensos, pero para la mayoría de los casos de uso en producción, cubre la terminología de mayor prioridad.

La Voice Agent API abstrae todo el flujo de trabajo del agente de voz. Anteriormente, los desarrolladores tenían que unir un servicio STT independiente, una capa VAD para la detección de interrupciones (barge-in), una API de LLM y un endpoint TTS. La Voice Agent API de Deepgram maneja todo esto a través de una única sesión de WebSocket: gestiona los turnos de palabra, la detección de interrupciones, el estado de la sesión y las actualizaciones de prompts en tiempo real. Puedes traer tu propio LLM mientras usas el STT y TTS de Deepgram, o usar el stack completo de Deepgram por $4.50 la hora.

Las opciones de implementación incluyen nube pública, VPC privada dentro de cuentas de AWS o Azure, y local (on-premises) mediante contenedores Docker o Kubernetes. La opción local es fundamental para los equipos de salud y finanzas: la arquitectura en contenedores de Deepgram ofrece la misma latencia y precisión que la nube, manteniendo los datos de audio detrás de los firewalls corporativos. Esto solo está disponible en contratos Enterprise.

"El STT en tiempo real más preciso que hemos probado... el primer modelo de conversión de voz a texto que combina transcripción multilingüe en tiempo real, inyección de vocabulario en vivo y una latencia inferior a 300 ms." - Stephen FIYINFOLUWA Oladele, Neurl Creators, reseña en Substack, 2025

Dónde se sitúa Deepgram frente a AssemblyAI y Whisper

La comparación que más importa para las decisiones de producción es Deepgram Nova-3 frente a AssemblyAI Universal-2/Slam-1 y OpenAI Whisper. Estos tres cubren la mayor parte del mercado STT para desarrolladores, pero hacen concesiones de ingeniería fundamentalmente diferentes.

Deepgram vs. AssemblyAI: El modelo Slam-1 de AssemblyAI combina un decodificador LLM con un codificador ASR tradicional, lo que le otorga una personalización basada en prompts más flexible y maneja hasta 1,000 términos específicos del dominio por solicitud, frente al límite de 100 términos de Nova-3. AssemblyAI Universal-2 soporta más de 100 idiomas en comparación con el conjunto multilingüe más reducido pero más preciso de Nova-3. AssemblyAI también cuenta con una inteligencia de audio lista para usar más profunda: detección de temas, detección de entidades, generación de capítulos y su LLM de audio LeMUR para consultas conversacionales sobre transcripciones. La inteligencia de audio de Deepgram (resumen, sentimiento) es más simple y tiene problemas conocidos de alucinación en discursos técnicos densos. Deepgram gana en latencia de streaming pura (menos de 300 ms frente al rango de 300-600 ms de AssemblyAI), implementación local (AssemblyAI es un SaaS exclusivo en la nube) y precios por volumen. AssemblyAI Universal-2 cuesta $0.37/hr; Nova-3 se sitúa en $0.46/hr en Pay-As-You-Go, pero baja a $0.39/hr en el plan Growth.

Deepgram vs. Whisper: Whisper es un Transformer codificador-decodificador de código abierto de OpenAI, entrenado con 680,000 horas de audio multilingüe, con pesos disponibles para autoalojamiento. Cubre 57 idiomas y es gratuito a nivel de modelo. Pero Whisper no soporta de forma nativa el streaming en tiempo real: hacer que funcione para audio en vivo requiere soluciones alternativas como whisper.cpp, lo que añade una carga de ingeniería significativa. Whisper large-v3 tarda entre 10 y 30 minutos en transcribir una hora de audio dependiendo del hardware; Deepgram transcribe la misma hora en aproximadamente 20 segundos. Autoalojar Whisper en una instancia de GPU (típicamente $0.50-$1.50/hr para un equivalente a A10G) acerca el costo de computación a los $0.46/hr de Deepgram, haciendo que la disyuntiva entre gestionado y autoalojado sea menos evidente de lo que sugiere la premisa de "Whisper es gratis".

"Elegí Deepgram específicamente porque se anunciaba como el más rápido para minimizar los retrasos en las respuestas." - Alyx1337, Hacker News, diciembre de 2023

Cómo es la realidad del flujo de trabajo de los agentes de voz

La Voice Agent API es el producto que Deepgram está posicionando más activamente como su ventaja competitiva. Construir un agente de voz antes de que existiera esta API significaba ejecutar cuatro servicios separados: un endpoint STT para la transcripción, una capa VAD para la detección de interrupciones, una API de LLM para la generación de respuestas y un endpoint TTS para verbalizar la respuesta. Cada salto añade latencia, y enlazar los estados de error a través de cuatro servicios significa más modos de fallo que manejar en producción.

La Voice Agent API de Deepgram condensa esto en una única sesión de WebSocket. Envías audio; la API maneja el VAD, STT, el enrutamiento del LLM (el predeterminado de Deepgram o el tuyo propio), la síntesis TTS y el streaming de audio de respuesta de vuelta. La inyección de prompts en tiempo real te permite actualizar el prompt del sistema a mitad de la sesión, y el intercambio en caliente de modelos permite cambiar las voces TTS durante una llamada en vivo. Jack in the Box está utilizando esta arquitectura para los pedidos en el drive-through. Aircall y OpenPhone la están integrando para la gestión de llamadas.

La gestión de conexiones WebSocket, sin embargo, es donde los desarrolladores encuentran fricción constantemente. Las discusiones en el GitHub de Deepgram muestran un patrón continuo de errores CLIENT_MESSAGE_TIMEOUT cuando el audio comienza a transmitirse antes de que el servidor haya confirmado el mensaje SettingsApplied. El handshake correcto requiere esperar a Welcome, luego Settings, y después la confirmación de SettingsApplied antes de enviar cualquier dato de audio. Configurar esto incorrectamente interrumpe la conexión en 2-3 segundos. La solución está documentada, pero no se destaca de manera prominente en las guías de inicio rápido.

La cuota predeterminada de streaming concurrente está limitada a 1,200 solicitudes. Escalar más allá de eso requiere contactar al equipo de ventas de Deepgram, lo que introduce fricción para los equipos de rápido crecimiento que alcanzan el límite inesperadamente en producción.

Para quién está diseñado Deepgram

El punto fuerte de Deepgram son los equipos de ingeniería que construyen infraestructura de voz en producción donde una latencia inferior a 300 ms es un requisito, no una preferencia. Los análisis de atención al cliente en tiempo real, los sistemas IVR, las funciones SaaS habilitadas por voz y los agentes de IA conversacional encajan perfectamente en este perfil. Las plataformas de centros de contacto que procesan miles de flujos de audio concurrentes se benefician de la arquitectura de streaming de Nova-3 y de la opción de implementación local para industrias reguladas.

El crédito gratuito de $200 (sin necesidad de tarjeta de crédito) cubre aproximadamente 433 horas de transcripción con Nova-3 Monolingual a tarifas Pay-As-You-Go. Este es un presupuesto de exploración sustancial para desarrolladores independientes y equipos pequeños que evalúan la API antes de comprometerse con cualquier plan.

Lo que Deepgram no es

Deepgram es una API. No hay una interfaz web para subir un archivo de audio y obtener una transcripción. Los usuarios no técnicos que deseen transcribir grabaciones de podcasts o audios de reuniones sin escribir código deberían buscar en otra parte: Otter.ai, Rev y Descript ofrecen flujos de trabajo de transcripción basados en interfaz de usuario (UI). Deepgram es para desarrolladores que integran voz en una aplicación.

El ajuste fino (fine-tuning) de modelos personalizados no es de autoservicio. Si 100 términos clave por solicitud son insuficientes y necesitas entrenar un modelo específico del dominio con tus propios datos de audio, eso requiere un contrato Enterprise. Los equipos que desarrollan para más de 100 idiomas deberían revisar Universal-2 de AssemblyAI en su lugar. Los equipos cuyo requisito principal es la profundidad de la inteligencia de audio, específicamente consultas conversacionales sobre transcripciones, detección de temas o extracción de entidades, encontrarán que LeMUR y Slam-1 de AssemblyAI son sustancialmente más capaces.

Evita Deepgram si necesitas una ruta con costo de infraestructura cero y tienes la capacidad de ingeniería para autoalojar. Los pesos de Whisper son gratuitos, y ejecutar la inferencia en tu propio hardware elimina por completo las tarifas por minuto, a costa de la sobrecarga de DevOps y la complejidad de construir soporte de streaming en tiempo real desde cero.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con Deepgram.