
Pipecat es un framework de Python de código abierto creado por Daily para desarrollar agentes de IA multimodales y de voz en tiempo real. Encadena servicios de STT, LLM y TTS en pipelines programables con control total para el desarrollador, admitiendo más de 100 integraciones, incluyendo Deepgram, OpenAI, ElevenLabs y LiveKit.
Pipecat es un framework de Python de código abierto para desarrollar agentes de IA conversacional multimodales y de voz en tiempo real. Fue creado por Daily, la empresa de infraestructura WebRTC fundada en 2016 y dirigida por su cofundador y CEO Kwindla Hultman Kramer, quien lanzó el proyecto como código abierto en Hacker News en mayo de 2024. El framework resuelve un problema de ingeniería concreto: orquestar los pasos de conversión de voz a texto (STT), modelo de lenguaje (LLM) y texto a voz (TTS) en el pipeline de un agente de voz con una latencia lo suficientemente baja como para que parezca una conversación natural. Cuenta con licencia BSD-2-Clause, es de uso gratuito y no requiere el pago de licencias.
En su versión v1.1.0 (lanzada en abril de 2026), Pipecat admite más de 100 integraciones que abarcan más de 19 proveedores de STT (Deepgram, AssemblyAI, Whisper, Sarvam), más de 35 opciones de TTS (ElevenLabs, Cartesia, OpenAI, Smallest TTS), más de 25 proveedores de LLM (OpenAI, Anthropic, Mistral, xAI, Inworld Realtime) y transportes que incluyen Daily WebRTC, LiveKit, WebSocket, Twilio y WhatsApp. Los SDK para clientes cubren JavaScript, React, React Native, iOS (Swift), Android (Kotlin), C++ e incluso ESP32 para dispositivos integrados. El ecosistema incluye Pipecat Flows para el estado estructurado de las conversaciones, Pipecat Subagents para transferencias entre múltiples agentes y el servicio opcional de alojamiento gestionado Pipecat Cloud de Daily para los equipos que prefieren evitar la infraestructura autogestionada.
Lo que Pipecat realmente hace en mayo de 2026
El modelo de pipeline de Pipecat es su característica definitoria. Mientras que las plataformas gestionadas como Vapi ejecutan el bucle STT/LLM/TTS detrás de una capa de abstracción, Pipecat convierte cada paso en código explícito. Un desarrollador conecta un servicio de transcripción en streaming, configura la sensibilidad de detección de fin de frase (endpointing), maneja resultados parciales, escribe lógica personalizada entre la transcripción y el paso del LLM, y controla exactamente cómo se sintetiza y reproduce la voz. Esta es la propuesta de valor central del framework y también su costo principal: control total con responsabilidad total.
El framework alcanzó su versión estable v1.0.0 en abril de 2026, introduciendo una integración de la API de respuestas de OpenAI basada en WebSocket, soporte para llamadas a funciones asíncronas y compatibilidad con el LLM Inworld Realtime. El lanzamiento incluyó una guía de migración para los equipos que actualizaban desde la serie preliminar 0.0.x. La versión v1.1.0 llegó dos semanas después, añadiendo STT/TTS de Mistral, soporte para DTMF (teclado telefónico), modos multilingües de Deepgram e integraciones con xAI. El proyecto registró 11.7k estrellas en GitHub para mayo de 2026, manteniendo un ritmo constante de lanzamientos mensuales a lo largo de 2025-2026.
Pipecat es agnóstico al transporte por diseño. El mismo código del pipeline se ejecuta sobre la infraestructura WebRTC de Daily, salas de LiveKit, un servidor WebSocket puro, Twilio Media Streams o captura de audio local. La lógica del pipeline no cambia cuando cambia el transporte. Esto hace que sea factible crear prototipos localmente, probar con WebSockets y desplegar a través de Daily WebRTC o Twilio en producción sin tener que reescribir la lógica central del agente.
"Los modelos de voz a voz son el futuro. Pero hoy en día, lo que deberías usar en producción es un modelo de transcripción, un LLM en modo texto y un modelo de generación de voz". - Kwindla Hultman Kramer, CEO de Daily y creador de Pipecat, entrevista con Freeplay AI, abril de 2026
Pipecat Flows amplía el framework principal con un modelo de máquina de estados para conversaciones estructuradas: flujos de admisión de múltiples pasos, ramificación según la intención y transiciones limpias entre nodos. Pipecat Subagents maneja arquitecturas de múltiples agentes donde un agente de enrutamiento deriva a agentes especializados (facturación, soporte técnico, incorporación) y gestiona las transferencias de estado. Estas son características que las plataformas gestionadas no ofrecen o implementan de formas que resultan opacas para el desarrollador.
Dónde se sitúa Pipecat frente a LiveKit Agents y Vapi
La categoría de frameworks de IA de voz tiene actualmente tres enfoques arquitectónicos distintos, y Pipecat se sitúa de lleno en el carril de la construcción propia de código abierto junto a LiveKit Agents, diferenciándose de ambos por su filosofía y de plataformas gestionadas como Vapi por su modelo fundamental.
Pipecat vs. LiveKit Agents: Ambos son frameworks de código abierto que requieren infraestructura por parte del desarrollador. La diferencia mecánica clave es su relación con la capa de transporte. LiveKit Agents está basado en eventos y fuertemente acoplado a la arquitectura WebRTC SFU (Unidad de Reenvío Selectivo) de LiveKit: los agentes se unen a las salas WebRTC como participantes, se suscriben a pistas de audio y reaccionan a eventos. Este acoplamiento le da a LiveKit Agents su capacidad exclusiva: soporte para video. Debido a que la SFU de LiveKit enruta flujos de video entre los participantes de la sala, los agentes de video con avatares (HeyGen, Tavus) pueden funcionar dentro del modelo nativo de salas de LiveKit. El modelo de pipeline agnóstico al transporte de Pipecat no ofrece esto de forma nativa. Sin embargo, el modelo de salas de LiveKit se convierte en una limitación para despliegues exclusivos de telefonía o WebSocket puro, donde la abstracción de la sala añade sobrecarga. Pipecat maneja estos casos con la misma lógica de pipeline. Los comentarios de los desarrolladores caracterizan en general a LiveKit como más rápido para poner algo en funcionamiento; y a Pipecat como una opción que ofrece más control en cada paso, a costa de un mayor trabajo de ajuste en los turnos de conversación y el VAD (Detección de Actividad de Voz).
Pipecat vs. Vapi: La comparación se reduce realmente a construir vs. comprar. Vapi es una plataforma gestionada de código cerrado donde los desarrolladores configuran un agente de voz mediante parámetros de API (prompt del sistema, proveedor de voz, definiciones de herramientas) y la infraestructura de Vapi se encarga del resto. El tiempo hasta la primera llamada es de aproximadamente dos horas. La contrapartida es el control: con Vapi, un desarrollador no puede interceptar ni modificar una transcripción antes de que llegue al LLM, no puede ajustar la sensibilidad de detección de fin de frase del VAD y no puede insertar lógica personalizada a mitad de la conversación sin toparse con las limitaciones del modelo gestionado. Vapi cuesta $0.05-$0.13/minuto en total. Con Pipecat autohospedado solo se pagan las API de los proveedores de IA, y por encima de aproximadamente 50,000 minutos al mes, el ahorro de costos se estima en un 80% frente a Vapi. Por debajo de los 10,000 minutos al mes, la sobrecarga de ingeniería que supone ejecutar Pipecat suele superar el ahorro por minuto.
"GPT-5, el último Claude, Gemini 3, todos saturaron lo que yo pensaba que era un benchmark realmente difícil. Pero aquí está el detalle: todos son demasiado lentos para usarlos en un agente de voz". - Kwindla Hultman Kramer, entrevista sobre el Estado de la IA de Voz, Coval.ai, 2026
Para los equipos que comparan Pipecat con Retell AI o Bland AI, se aplica el mismo cálculo de construir vs. comprar: esas plataformas gestionadas ofrecen un tiempo de comercialización más rápido para casos de uso estándar, mientras que Pipecat gana en profundidad de personalización, privacidad de datos y economía a escala.
Cómo es la realidad del pipeline
Un agente mínimo de Pipecat en producción implica varias partes móviles: un proceso de Python ejecutando el pipeline, una conexión de transporte (WebRTC o WebSocket), un proveedor de STT transmitiendo fragmentos de audio y devolviendo transcripciones parciales, una capa de VAD (Detección de Actividad de Voz) que detecta cuándo el usuario ha terminado de hablar, una llamada de inferencia al LLM, un proveedor de TTS transmitiendo el audio sintetizado de vuelta, y una lógica de reproducción que interrumpe el discurso actual del bot si el usuario empieza a hablar de nuevo (barge-in).
Hacer que cada paso funcione correctamente en producción requiere ajustes. La documentación del framework incluye una guía de ajuste de latencia de STT específicamente porque este es un obstáculo común. Los problemas reportados en GitHub documentan una brecha de 2 a 5 segundos entre el final del discurso del usuario y el inicio de la respuesta del bot (issue #1694), un error de puerta semidúplex donde la puerta de salida de audio permanece cerrada después de que el bot termina de hablar (impidiendo la siguiente reproducción de TTS hasta que un nuevo discurso del usuario restablezca el estado), y pausas de audio a mitad de frase sin un desencadenante obvio (issue #2941). Cuando un segundo participante se une a una sesión basada en LiveKit, se han reportado latencia severa y encolamiento de respuestas (issue #3218). Una guía de producción publicada por un desarrollador que desplegó Pipecat a escala documentó 26 problemas de producción distintos que abarcaban fugas de memoria, fallos del VAD y bloqueos del pipeline.
Pipecat Cloud, la capa de alojamiento gestionado opcional de Daily, descarga la parte de infraestructura: aprovisionamiento de contenedores de agentes, escalado de concurrencia y manejo de telefonía SIP/PSTN. Los precios se basan en el uso, desde $0.01/min por un contenedor de 0.5 vCPU hasta $0.03/min por un contenedor de 1.5 vCPU, sin mínimos mensuales. Se incluye transporte gratuito de Daily WebRTC para sesiones de voz 1:1. Pipecat Cloud se posiciona como el camino para los equipos que desean el control de Pipecat sobre la lógica del pipeline pero no quieren gestionar el autoescalado de Kubernetes o Docker para sesiones de voz concurrentes. Se lanzó en 2025 como lo que Daily describió como "la primera nube de IA de voz de código abierto".
En cuanto a recomendaciones de combinación, el consenso de la comunidad en 2025-2026 para un equipo técnico que construye un agente solo de voz es Pipecat o LiveKit Agents más Deepgram Nova-3 para STT y Cartesia Sonic-3 o ElevenLabs Flash v2.5 para TTS. El objetivo de latencia es una mediana inferior a 800 ms para el bucle de voz completo; el benchmark de 500 ms que Kwindla demostró en el lanzamiento de Pipecat en 2024 usando Deepgram + Groq + Deepgram Aura sigue siendo el punto de referencia de lo que se puede lograr con elecciones de proveedores bien ajustadas.
Para quién está diseñado Pipecat
Pipecat está escrito para ingenieros que necesitan lanzar agentes de voz personalizados y están dispuestos a hacerse cargo de la infraestructura y los ajustes necesarios para prepararlos para producción. El punto ideal son los equipos con al menos un ingeniero competente en Python, un caso de uso que justifique la inversión en ingeniería (lógica de conversación personalizada, requisitos de cumplimiento, economía de escala por encima de ~50K minutos/mes, o una mezcla de los tres), y una preferencia por la neutralidad de proveedores entre los servicios de IA.
La atención al cliente y la automatización de centros de llamadas son las principales categorías de producción. Un agente de Pipecat autohospedado puede integrarse en la infraestructura de telefonía existente a través de Twilio o SIP, conectarse a un CRM mediante llamadas a funciones y manejar miles de llamadas entrantes concurrentes con una estructura de costos que las plataformas gestionadas no pueden igualar a escala. Pipecat Subagents hace que sea práctico construir una lógica de enrutamiento que transfiera a los interlocutores entre agentes especializados sin perder el contexto de la conversación.
El entrenamiento de voz, el aprendizaje de idiomas y la educación son la segunda categoría principal. El sistema Flows maneja progresiones de lecciones estructuradas. Las extensiones multimodales (Moondream para visión, HeyGen/Tavus para avatares de video) están disponibles para experiencias de tutoría interactiva más ricas que van más allá de los intercambios exclusivamente de audio.
Los agentes de voz integrados y de IoT representan un caso de uso de nicho pero real. Pipecat incluye un SDK de cliente en C++ y soporte explícito para ESP32, cubriendo a los desarrolladores que construyen interfaces de voz para dispositivos de hardware. Esta es una brecha de capacidad que ni Vapi ni Retell AI cubren.
Lo que Pipecat no es
Pipecat no es una herramienta sin código (no-code). No hay un constructor visual, ni una interfaz de "prompt y despliegue", ni un panel de administración para que personas sin conocimientos de ingeniería configuren agentes. Cada agente requiere escribir código en Python para el pipeline y gestionar la infraestructura de despliegue, ya sea autohospedada o a través de Pipecat Cloud.
No es un framework centrado en JavaScript. El servidor del agente ejecuta Python 3.11+ sin un entorno de ejecución oficial de TypeScript para el lado del servidor. Los equipos con backends exclusivos de TypeScript deben ejecutar Pipecat como un servicio de Python independiente. Los SDK para clientes (JavaScript, React, iOS, Android) manejan el lado del navegador y móvil, pero el pipeline en sí vive en Python.
No es una buena opción para proyectos de bajo volumen donde la velocidad de comercialización importa más que el costo o el control. Si un equipo necesita lanzar un bot de voz básico en 48 horas o ejecuta menos de 10,000 minutos al mes, la combinación de la plataforma gestionada de Vapi y su tiempo de 2 horas hasta la primera llamada superará las semanas de configuración de infraestructura que requiere Pipecat. La fortaleza del framework se multiplica a escala y con la profundidad de la personalización; por debajo de esos umbrales, las alternativas gestionadas son la opción más práctica.
Tampoco es todavía una API estable en el sentido tradicional. La versión v1.0.0 llegó en abril de 2026 con cambios disruptivos intencionales respecto a la serie 0.0.x y una guía de migración obligatoria. Los equipos que ejecutaban Pipecat anterior a la versión 1.0 en producción tuvieron que actualizar el código de su pipeline para seguir la nueva arquitectura basada en WebSocket. El proyecto avanza rápido, lo cual es a la vez su atractivo y su costo de mantenimiento.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen Pipecat.
Artículos relacionados
Guías y artículos relacionados con Pipecat.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

Google vs OpenAI vs Anthropic Agents: The May 2026 Platform Showdown

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)
