
Pipecat est un framework Python open-source créé par Daily pour concevoir des agents IA vocaux et multimodaux en temps réel. Il enchaîne les services STT, LLM et TTS dans des pipelines programmables offrant un contrôle total aux développeurs, et prend en charge plus de 100 intégrations, dont Deepgram, OpenAI, ElevenLabs et LiveKit.
Pipecat est un framework Python open-source permettant de créer des agents d'IA conversationnelle vocaux et multimodaux en temps réel. Il a été créé par Daily, l'entreprise d'infrastructure WebRTC fondée en 2016 et dirigée par son cofondateur et PDG Kwindla Hultman Kramer, qui a rendu le projet open-source sur Hacker News en mai 2024. Le framework résout un problème d'ingénierie concret : orchestrer les étapes de reconnaissance vocale (STT), de modèle de langage (LLM) et de synthèse vocale (TTS) du pipeline d'un agent vocal avec une latence suffisamment faible pour donner l'impression d'une conversation naturelle. Il est sous licence BSD-2-Clause, gratuit et ne nécessite aucun frais de licence.
Dans sa version v1.1.0 (publiée en avril 2026), Pipecat prend en charge plus de 100 intégrations couvrant plus de 19 fournisseurs STT (Deepgram, AssemblyAI, Whisper, Sarvam), plus de 35 options TTS (ElevenLabs, Cartesia, OpenAI, Smallest TTS), plus de 25 fournisseurs LLM (OpenAI, Anthropic, Mistral, xAI, Inworld Realtime), ainsi que des protocoles de transport tels que Daily WebRTC, LiveKit, WebSocket, Twilio et WhatsApp. Les SDK clients couvrent JavaScript, React, React Native, iOS (Swift), Android (Kotlin), C++ et même ESP32 pour les appareils embarqués. L'écosystème comprend Pipecat Flows pour l'état structuré des conversations, Pipecat Subagents pour les transferts multi-agents, et le service d'hébergement géré optionnel Pipecat Cloud de Daily pour les équipes souhaitant éviter de gérer leur propre infrastructure.
Ce que fait réellement Pipecat en mai 2026
Le modèle de pipeline de Pipecat est sa caractéristique principale. Là où des plateformes gérées comme Vapi exécutent la boucle STT/LLM/TTS derrière une couche d'abstraction, Pipecat transforme chaque étape en code explicite. Un développeur connecte un service de transcription en continu, configure la sensibilité de détection de fin de parole (endpointing), gère les résultats partiels, écrit une logique personnalisée entre la transcription et l'étape LLM, et contrôle exactement la façon dont la parole est synthétisée et lue. C'est la proposition de valeur fondamentale du framework, mais aussi son coût principal : un contrôle total impliquant une responsabilité totale.
Le framework a atteint sa version stable v1.0.0 en avril 2026, introduisant une intégration de l'API OpenAI Responses basée sur WebSocket, la prise en charge des appels de fonctions asynchrones et la compatibilité avec le LLM Inworld Realtime. Un guide de migration a accompagné cette sortie pour les équipes passant de la série de pré-versions 0.0.x. La version v1.1.0 a suivi deux semaines plus tard, ajoutant le STT/TTS de Mistral, la prise en charge du DTMF (clavier téléphonique), les modes multilingues de Deepgram et les intégrations xAI. Le projet a enregistré 11,7k étoiles sur GitHub en mai 2026, avec un rythme de publication mensuel constant tout au long de 2025-2026.
Pipecat est conçu pour être indépendant du transport. Le même code de pipeline s'exécute sur l'infrastructure WebRTC de Daily, les salons LiveKit, un serveur WebSocket brut, Twilio Media Streams ou une capture audio locale. La logique du pipeline ne change pas lorsque le transport change. Cela permet de prototyper localement, de tester avec des WebSockets et de déployer via Daily WebRTC ou Twilio en production sans avoir à réécrire la logique de base de l'agent.
"Les modèles de parole à parole sont l'avenir. Mais aujourd'hui, ce que vous devriez utiliser en production, c'est un modèle de transcription, un LLM en mode texte et un modèle de génération vocale." - Kwindla Hultman Kramer, PDG de Daily et créateur de Pipecat, interview Freeplay AI, avril 2026
Pipecat Flows étend le framework de base avec un modèle de machine à états pour les conversations structurées : flux de prise en charge en plusieurs étapes, branchement selon l'intention et transitions propres entre les nœuds. Pipecat Subagents gère les architectures multi-agents où un agent de routage répartit les tâches vers des agents spécialisés (facturation, support technique, intégration) et gère les transferts d'état. Ce sont des fonctionnalités que les plateformes gérées n'offrent pas ou implémentent de manière opaque pour le développeur.
Où se situe Pipecat par rapport à LiveKit Agents et Vapi
La catégorie des frameworks d'IA vocale présente actuellement trois approches architecturales distinctes, et Pipecat se positionne clairement dans la voie de la construction autonome open-source aux côtés de LiveKit Agents, se différenciant des deux par sa philosophie et des plateformes gérées comme Vapi par son modèle fondamental.
Pipecat vs. LiveKit Agents : Les deux sont des frameworks open-source nécessitant une infrastructure gérée par le développeur. La principale différence mécanique réside dans leur relation avec la couche de transport. LiveKit Agents est piloté par les événements et étroitement couplé à l'architecture WebRTC SFU (Selective Forwarding Unit) de LiveKit : les agents rejoignent les salons WebRTC en tant que participants, s'abonnent aux pistes audio et réagissent aux événements. Ce couplage confère à LiveKit Agents sa capacité exclusive : la prise en charge de la vidéo. Étant donné que le SFU de LiveKit achemine les flux vidéo entre les participants du salon, les agents vidéo avec avatars (HeyGen, Tavus) peuvent fonctionner dans le modèle de salon natif de LiveKit. Le modèle de pipeline indépendant du transport de Pipecat n'offre pas cela nativement. Cependant, le modèle de salon de LiveKit devient une contrainte pour les déploiements uniquement téléphoniques ou WebSocket bruts, où l'abstraction du salon ajoute une surcharge. Pipecat gère ces cas avec la même logique de pipeline. Les retours des développeurs décrivent généralement LiveKit comme étant plus rapide pour obtenir un résultat fonctionnel ; Pipecat comme offrant plus de contrôle à chaque étape, au prix d'un travail de réglage plus important sur la prise de parole et le VAD.
Pipecat vs. Vapi : La comparaison se résume vraiment à construire soi-même ou acheter. Vapi est une plateforme gérée à code source fermé où les développeurs configurent un agent vocal via des paramètres d'API (prompt système, fournisseur vocal, définitions d'outils) et l'infrastructure de Vapi s'occupe du reste. Le temps nécessaire pour le premier appel est d'environ deux heures. Le compromis est le contrôle : avec Vapi, un développeur ne peut pas intercepter ou modifier une transcription avant qu'elle n'atteigne le LLM, ne peut pas ajuster la sensibilité de détection de fin de parole du VAD, et ne peut pas insérer de logique personnalisée en cours de conversation sans se heurter aux contraintes du modèle géré. Vapi coûte entre $0.05 et $0.13/minute tout compris. Avec Pipecat auto-hébergé, on ne paie que les API des fournisseurs d'IA, et au-delà d'environ 50 000 minutes par mois, les économies sont estimées à 80 % par rapport à Vapi. En dessous de 10 000 minutes par mois, la charge d'ingénierie liée à l'exécution de Pipecat l'emporte souvent sur les économies par minute.
"GPT-5, le dernier Claude, Gemini 3, ils ont tous saturé ce que je pensais être un benchmark vraiment difficile. Mais voici le problème : ils sont tous trop lents pour être utilisés pour un agent vocal." - Kwindla Hultman Kramer, interview State of Voice AI, Coval.ai, 2026
Pour les équipes comparant Pipecat à Retell AI ou Bland AI, le même calcul de construction vs achat s'applique : ces plateformes gérées offrent un délai de mise sur le marché plus rapide pour les cas d'usage standards, tandis que Pipecat l'emporte sur la profondeur de personnalisation, la confidentialité des données et la rentabilité à grande échelle.
À quoi ressemble la réalité du pipeline
Un agent Pipecat minimal en production implique plusieurs éléments mobiles : un processus Python exécutant le pipeline, une connexion de transport (WebRTC ou WebSocket), un fournisseur STT diffusant des fragments audio et renvoyant des transcriptions partielles, une couche VAD (Voice Activity Detection) détectant quand l'utilisateur a fini de parler, un appel d'inférence LLM, un fournisseur TTS renvoyant l'audio synthétisé en continu, et une logique de lecture qui interrompt la parole en cours du bot si l'utilisateur recommence à parler (barge-in).
Réussir chaque étape en production nécessite des ajustements. La documentation du framework inclut un guide de réglage de la latence STT précisément parce qu'il s'agit d'une difficulté fréquente. Les tickets GitHub documentent un décalage de 2 à 5 secondes entre la fin de la parole de l'utilisateur et le début de la réponse du bot (ticket #1694), un bug de porte semi-duplex où la porte de sortie audio reste fermée après que le bot a fini de parler (empêchant la lecture TTS suivante jusqu'à ce qu'une nouvelle parole de l'utilisateur réinitialise l'état), et des pauses audio en milieu de phrase sans déclencheur évident (ticket #2941). Lorsqu'un deuxième participant rejoint une session basée sur LiveKit, une latence sévère et une mise en file d'attente des réponses ont été signalées (ticket #3218). Un guide de production publié par un développeur ayant déployé Pipecat à grande échelle a documenté 26 problèmes de production distincts, allant des fuites de mémoire aux ratés du VAD, en passant par les blocages du pipeline.
Pipecat Cloud, la couche d'hébergement géré optionnelle de Daily, décharge la partie infrastructure : provisionnement des conteneurs d'agents, mise à l'échelle de la simultanéité et gestion de la téléphonie SIP/PSTN. La tarification est basée sur l'utilisation, allant de $0.01/min pour un conteneur de 0,5 vCPU jusqu'à $0.03/min pour un conteneur de 1,5 vCPU, sans minimum mensuel. Le transport gratuit Daily WebRTC est inclus pour les sessions vocales 1:1. Pipecat Cloud se positionne comme la solution pour les équipes qui souhaitent le contrôle de Pipecat sur la logique du pipeline, mais qui ne veulent pas gérer l'autoscaling Kubernetes ou Docker pour les sessions vocales simultanées. Il a été lancé en 2025 comme ce que Daily a décrit comme « le premier cloud d'IA vocale open source ».
Pour les recommandations d'association, le consensus de la communauté en 2025-2026 pour une équipe technique construisant un agent uniquement vocal est Pipecat ou LiveKit Agents avec Deepgram Nova-3 pour le STT et Cartesia Sonic-3 ou ElevenLabs Flash v2.5 pour le TTS. L'objectif de latence médiane est inférieur à 800 ms pour la boucle vocale complète ; le benchmark de 500 ms que Kwindla a démontré lors du lancement de Pipecat en 2024 en utilisant Deepgram + Groq + Deepgram Aura reste le point de référence de ce qui est réalisable avec des choix de fournisseurs bien ajustés.
À qui s'adresse Pipecat
Pipecat est conçu pour les ingénieurs qui ont besoin de déployer des agents vocaux personnalisés et qui sont prêts à prendre en charge l'infrastructure et les réglages nécessaires pour les rendre prêts pour la production. La cible idéale correspond aux équipes comptant au moins un ingénieur compétent en Python, ayant un cas d'usage qui justifie l'investissement en ingénierie (logique de conversation personnalisée, exigences de conformité, économies d'échelle au-delà d'environ 50 000 minutes/mois, ou un mélange des trois), et une préférence pour la neutralité vis-à-vis des fournisseurs de services d'IA.
Le support client et l'automatisation des centres d'appels sont les principales catégories de production. Un agent Pipecat auto-hébergé peut s'intégrer dans une infrastructure téléphonique existante via Twilio ou SIP, se connecter à un CRM via des appels de fonctions, et gérer des milliers d'appels entrants simultanés avec une structure de coûts que les plateformes gérées ne peuvent pas égaler à grande échelle. Pipecat Subagents permet de construire facilement une logique de routage qui transfère les appelants entre des agents spécialisés sans perdre le contexte de la conversation.
Le coaching vocal, l'apprentissage des langues et l'éducation constituent la deuxième grande catégorie. Le système Flows gère les progressions de leçons structurées. Des extensions multimodales (Moondream pour la vision, HeyGen/Tavus pour les avatars vidéo) sont disponibles pour des expériences de tutorat interactif plus riches qui vont au-delà des simples échanges audio.
Les agents vocaux embarqués et IoT représentent un cas d'usage de niche mais bien réel. Pipecat propose un SDK client C++ et une prise en charge explicite de l'ESP32, couvrant ainsi les développeurs qui créent des interfaces vocales pour des appareils matériels. Il s'agit d'une lacune fonctionnelle que ni Vapi ni Retell AI ne comblent.
Ce que Pipecat n'est pas
Pipecat n'est pas un outil no-code. Il n'y a pas de constructeur visuel, pas d'interface de type « prompt-and-deploy », et pas de tableau de bord d'administration permettant aux non-ingénieurs de configurer des agents. Chaque agent nécessite l'écriture de code Python pour le pipeline et la gestion de l'infrastructure de déploiement, que ce soit en auto-hébergement ou via Pipecat Cloud.
Ce n'est pas un framework orienté JavaScript. Le serveur de l'agent exécute Python 3.11+ sans environnement d'exécution TypeScript officiel côté serveur. Les équipes disposant de backends exclusivement en TypeScript doivent exécuter Pipecat en tant que service Python distinct. Les SDK clients (JavaScript, React, iOS, Android) gèrent la partie navigateur et mobile, mais le pipeline lui-même réside en Python.
Il n'est pas adapté aux projets à faible volume où la rapidité de mise sur le marché prime sur le coût ou le contrôle. Si une équipe doit déployer un bot vocal basique en 48 heures ou utilise moins de 10 000 minutes par mois, la combinaison de la plateforme gérée de Vapi et de son délai de 2 heures pour le premier appel surpassera les semaines de configuration d'infrastructure requises par Pipecat. La force du framework se décuple à grande échelle et avec une personnalisation poussée ; en deçà de ces seuils, les alternatives gérées constituent le choix le plus pratique.
Ce n'est pas non plus encore une API stable au sens traditionnel du terme. La version v1.0.0 est arrivée en avril 2026 avec des changements majeurs intentionnels par rapport à la série 0.0.x et un guide de migration obligatoire. Les équipes exécutant Pipecat pré-1.0 en production ont dû mettre à jour le code de leur pipeline pour suivre la nouvelle architecture basée sur WebSocket. Le projet évolue rapidement, ce qui fait à la fois son attrait et son coût de maintenance.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Pipecat.
Articles associés
Guides et articles en lien avec Pipecat.

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)

Google vs OpenAI vs Anthropic Agents: The May 2026 Platform Showdown

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)
