

Langfuse est une plateforme open source d'ingénierie et d'observabilité LLM utilisée par les équipes IA pour tracer, déboguer, évaluer et gérer les prompts en production. Sous licence MIT, auto-hébergeable et approuvée par plus de 63 entreprises du Fortune 500, dont Khan Academy.
Langfuse est une plateforme d'ingénierie LLM open source conçue pour les équipes qui déploient des applications IA en production. Fondée en 2023 par trois ingénieurs issus de la cohorte W23 de Y Combinator, elle s'attaque à un problème que tout développeur IA rencontre dans les premières semaines suivant un déploiement en production : vous n'avez aucune visibilité sur ce que fait réellement votre LLM. Langfuse offre aux équipes une observabilité structurée, la gestion des prompts, des pipelines d'évaluation et des outils de jeux de données sur une seule plateforme, avec une véritable option d'auto-hébergement sous licence MIT qui fonctionne sur Docker, Kubernetes ou une infrastructure cloud gérée. En janvier 2026, ClickHouse a fait l'acquisition de Langfuse parallèlement à une série D de $400 million, apportant des ressources d'ingénierie substantielles pour les performances et la fiabilité en entreprise, tout en maintenant l'engagement open source et la tarification inchangés.
La plateforme instrumente les applications IA via des SDK Python et TypeScript ou grâce à des intégrations d'auto-instrumentation avec LangChain, LlamaIndex, OpenAI, Haystack et plus de 20 autres frameworks. Chaque appel LLM, invocation d'outil, étape de récupération et interaction utilisateur devient une trace structurée avec le nombre de tokens, la latence, l'attribution des coûts et la capture complète des entrées/sorties. À partir de là, les équipes exécutent des évaluateurs LLM-as-judge, attachent des files d'attente d'annotation humaine, gèrent les versions de prompts avec des tests A/B et effectuent des benchmarks sur des jeux de données sélectionnés. Langfuse Cloud fonctionne sur une couche de données adossée à ClickHouse introduite dans la v3 (décembre 2024), qui gère des centaines d'événements d'ingestion par seconde sans goulots d'étranglement au niveau de la base de données. Le dépôt GitHub compte 26,300+ étoiles et déploie des mises à jour en continu, avec la v3.171.0 prévue pour fin avril 2026.
Ce que fait réellement Langfuse en avril 2026
Langfuse se place entre le code de votre application et les API LLM que vous appelez, mais pas en tant que proxy. Contrairement à l'approche par échange d'URL de Helicone, Langfuse utilise une instrumentation au niveau du SDK : votre code crée explicitement des traces et des spans, et Langfuse capture l'arborescence d'exécution complète. Cela vous donne plus de contrôle et plus de contexte, au prix d'un travail d'intégration initial plus important.
Une seule trace peut contenir des dizaines d'observations imbriquées : un span d'agent externe enveloppant un appel de récupération, une génération LLM, l'exécution d'un outil et une étape de formatage final. Chaque nœud enregistre sa propre latence, son coût en tokens et ses entrées/sorties. Quand quelque chose casse à 2h du matin, vous récupérez l'ID de la trace dans vos logs, ouvrez Langfuse, et vous avez l'arbre de décision complet sous les yeux plutôt que de deviner à partir de fragments de logs.
Au-delà du traçage, la plateforme couvre trois flux de travail adjacents que les outils d'observabilité omettent souvent :
Gestion des prompts : Stockez des modèles de prompts avec un historique des versions, promouvez des versions dans différents environnements et menez des expériences A/B. Les modifications restent en dehors du code source et peuvent être annulées sans déploiement.
Évaluation : Exécutez automatiquement des évaluateurs LLM-as-judge sur des traces échantillonnées, recueillez les retours des utilisateurs (pouces en l'air/vers le bas, notes par étoiles) et acheminez les traces vers des files d'attente d'annotation humaine pour une révision manuelle.
Jeux de données : Organisez les traces en jeux de données de test structurés et exécutez des benchmarks de régression sur les versions de prompts ou les mises à jour de modèles avant le déploiement.
La version de mars 2026 a introduit un modèle de données centré sur les observations avec une amélioration par 10x des temps de chargement du tableau de bord, répondant ainsi à une plainte récurrente concernant la réactivité de l'UI avec des volumes de traces élevés.
Où se situe Langfuse par rapport à LangSmith et Helicone
Trois outils dominent cet espace, et les différences sont architecturales, non cosmétiques.
LangSmith est le produit d'observabilité propriétaire de LangChain. Si l'ensemble de votre pile applicative est LangChain ou LangGraph, LangSmith est véritablement sans friction : définissez une variable d'environnement, et le traçage automatique couvre toutes vos chaînes sans toucher au code de l'application. Dès que vous sortez de l'écosystème LangChain, cet avantage disparaît et vous avez de toute façon besoin d'une instrumentation manuelle. LangSmith est à code source fermé sans option d'auto-hébergement, ce qui l'élimine pour les équipes ayant des exigences de résidence des données. Niveau gratuit : 5,000 traces/mois. Starter : $39/month.
Helicone adopte l'architecture opposée : un proxy qui se place entre votre code et l'API LLM. Vous redirigez votre URL de base via les serveurs de Helicone et ajoutez un en-tête de clé API. La configuration prend environ 15 minutes et ne nécessite aucune modification de la logique applicative. Le compromis est que tout le trafic passe par l'infrastructure de Helicone, ce qui crée une dépendance tierce sur le chemin critique. La fonctionnalité de mise en cache sémantique de Helicone (des prompts similaires renvoient des réponses en cache) peut générer 20-40% d'économies sur certaines charges de travail, ce que Langfuse ne propose pas. Mais Helicone est dépourvu de la gestion des versions de prompts, des tests A/B, du pipeline d'évaluation et de la gestion des jeux de données de Langfuse. Niveau gratuit : 50,000 requêtes/mois. Starter : $20/month.
Langfuse est agnostique vis-à-vis des frameworks et nécessite une instrumentation SDK explicite dans tout votre code. L'investissement de configuration est plus élevé (quelques heures contre 15 minutes pour Helicone), mais le résultat est l'image d'observabilité la plus complète : spans imbriqués, arborescences complètes d'exécution d'agents, boucles de retours humains et gestion du cycle de vie des prompts. L'option d'auto-hébergement est véritablement fonctionnelle et constitue une cible de déploiement de premier plan depuis le lancement du projet. Une mise en garde : Langfuse utilise son propre format de traçage plutôt que le format natif OpenTelemetry, ce qui a suscité des inquiétudes parmi les équipes standardisant sur OTel à travers leur pile.
"Ce que nous avons vraiment aimé chez Langfuse, c'est l'API ouverte. Alors que de nombreux outils de traçage nécessitent des SDK ou des wrappers spécifiques, l'API ouverte de Langfuse nous a permis de construire notre propre client Golang autour d'elle." - Walt Wells, Staff Software Engineer, Khan Academy, 2024
"Nous dépensons plus de 60k+ chaque mois en appels LLM, donc avoir la structure nécessaire pour déboguer quand les choses tournent mal nous a beaucoup aidés." - punkpeye, Hacker News, décembre 2024
À quoi ressemble la réalité du flux de travail d'instrumentation et d'observabilité
En pratique, l'intégration de Langfuse commence par une configuration unique du SDK et une décision sur la profondeur d'instrumentation de votre code. La voie la plus simple utilise l'auto-instrumentation avec les wrappers OpenAI ou LangChain, où quelques décorateurs au niveau de l'importation capturent chaque appel LLM sans création manuelle de span. Pour les boucles d'agents personnalisées ou les pipelines à plusieurs étapes, vous instrumentez explicitement : enveloppez chaque unité de travail significative dans une trace ou un span, attachez les entrées/sorties, et laissez le SDK gérer le traitement par lots et le téléchargement asynchrone.
Une fois que les traces affluent, le tableau de bord vous donne la répartition des coûts par modèle, la latence P50/P95/P99, les taux d'erreur et les vues de session au niveau de l'utilisateur. La recherche est suffisamment rapide pour que le débogage d'une plainte spécifique d'un utilisateur soit l'affaire d'une minute : interrogez par ID de session, ouvrez la trace et parcourez l'arborescence d'exécution.
La version Langfuse Cloud fonctionne sur la même architecture adossée à ClickHouse introduite dans la v3, gérant les pics de trafic sans que la pression d'ingestion ne remonte jusqu'à l'API. L'architecture v3 écrit les événements sur S3 dès leur réception, les mettant en file d'attente avant l'insertion dans la base de données, ce qui signifie qu'un ralentissement de la base de données n'entraîne pas la perte des traces entrantes.
L'équipe Khanmigo de Khan Academy illustre le flux de travail en production : après avoir déployé Langfuse en avril 2024 auprès de plus de 100+ utilisateurs répartis dans 7 équipes produit et 4 équipes d'infrastructure, le personnel d'assistance utilise les traces Langfuse comme premier outil de débogage lorsqu'un étudiant signale un problème. Walt Wells, Staff Software Engineer chez Khan Academy, a directement souligné le résultat : "Langfuse a permis à nos développeurs d'obtenir des retours extrêmement rapides." Khan Academy maintient la résolution moyenne des demandes d'assistance à moins de 8 minutes en extrayant la trace de session pertinente plutôt qu'en reconstruisant le contexte à partir des logs.
Pour qui Langfuse est conçu
Langfuse est le plus adapté lorsque trois conditions sont réunies : l'équipe déploie des fonctionnalités LLM pour de vrais utilisateurs (et ne se contente pas d'évaluer des modèles dans des notebooks), quelqu'un dans l'équipe est responsable de l'infrastructure LLM, et la résidence des données ou les licences open source ont une importance commerciale ou légale.
En pratique, cela désigne les ingénieurs ML et les équipes de plateformes IA dans les entreprises qui construisent par-dessus les LLM plutôt que de vendre l'accès à l'API LLM elle-même. Langfuse est le bon choix pour les équipes utilisant des frameworks mixtes (LlamaIndex pour la récupération, Python personnalisé pour les agents, OpenAI pour la génération), car le SDK agnostique couvre l'ensemble de la pile sans configuration spécifique par framework. C'est également le bon choix pour les secteurs réglementés (santé, finance, éducation) qui ne peuvent pas envoyer de données de production à un SaaS tiers sans option d'auto-hébergement.
L'acquisition par ClickHouse renforce l'argumentaire pour les entreprises : les rapports de conformité SOC2, ISO27001 et HIPAA sont disponibles sur le plan Pro, l'équipe est soutenue par une entreprise dotée d'une forte crédibilité en matière d'infrastructure, et l'engagement open source est plus durable maintenant qu'il fait partie d'une organisation bien financée plutôt que d'une startup en phase d'amorçage.
Ce que Langfuse n'est pas
Langfuse n'est pas un outil plug-and-play sans effort pour les développeurs qui veulent un tableau de bord des coûts opérationnel en 15 minutes. Si votre seul cas d'usage est "combien je dépense sur OpenAI", la configuration proxy de Helicone vous y amènera plus rapidement. Langfuse rentabilise son investissement d'intégration lorsque vous avez besoin d'une vue d'ensemble : arborescences d'exécution imbriquées, gestion des versions de prompts, évaluations et retours humains, et pas seulement le comptage des tokens.
L'auto-hébergement est gratuit mais pas simple. Langfuse v3 nécessite cinq services fonctionnant en coordination : conteneur web, conteneur worker, ClickHouse, Redis/Valkey et un stockage blob compatible S3. Les équipes sans infrastructure ClickHouse existante font face à une réelle surcharge opérationnelle. Des estimations indépendantes évaluent le coût total de possession d'un auto-hébergement à moyenne échelle à $3,000-4,000/month, temps DevOps inclus, contre $199-300/month pour une utilisation équivalente sur Langfuse Cloud Pro. Le terme "gratuit" s'applique à la licence, pas à l'infrastructure.
Langfuse ne propose pas non plus de mise en cache sémantique ni de fonctionnalités de réduction des coûts de l'API LLM. Si la réduction des dépenses API est l'objectif principal, c'est le territoire de Helicone.
Ignorez Langfuse si vous êtes : un développeur solo gérant un projet de week-end sans utilisateurs en production, une équipe déjà pleinement investie dans LangChain qui souhaite une couverture automatique sans configuration, ou une entreprise qui a besoin d'un traçage natif OpenTelemetry pour s'intégrer à une infrastructure de collecteur OTel existante.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Langfuse.
Articles associés
Guides et articles en lien avec Langfuse.

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Cursor 3.3 Context Usage Breakdown: What to Cut First
