

Braintrust est une plateforme d'observabilité axée sur l'évaluation (eval-first) pour les équipes déployant des produits LLM, intégrant le traçage, les jeux de données, les évaluateurs et les barrières de qualité CI/CD dans un seul flux de travail. Utilisée par OpenAI, Stripe et Notion, elle est premium et propriétaire, avec un saut de prix important entre la version gratuite et la version payante.
Braintrust est une plateforme d'évaluation et d'observabilité de bout en bout, à code source fermé, destinée aux équipes créant des produits basés sur les LLM. Elle s'articule autour d'un postulat clair : il est impossible de savoir si une fonctionnalité d'IA s'améliore ou se dégrade sans une mesure systématique, et les tests logiciels traditionnels ne s'appliquent pas aux résultats probabilistes. Fondée à San Francisco par Ankur Goyal, dont la précédente entreprise Impira a été rachetée par Figma, elle offre aux équipes d'ingénierie une boucle structurée pour capturer des traces, définir ce qu'est un bon résultat à l'aide d'évaluateurs, mener des expériences sur des jeux de données versionnés et conditionner les déploiements à la qualité. Son portefeuille de clients est exceptionnellement solide pour une catégorie aussi récente, incluant OpenAI, Stripe, Notion, Vercel, Airtable et Zapier, ce qui prouve clairement que l'approche axée sur l'évaluation (eval-first) trouve un écho auprès des équipes exigeantes.
La plateforme combine la journalisation et le traçage sur Brainstore, une base de données propriétaire qui, selon l'entreprise, est nettement plus rapide pour interroger les données de trace, avec un framework d'évaluations, des jeux de données versionnés, un terrain de jeu pour les prompts (prompt playground) et des évaluateurs automatisés couvrant l'approche LLM-as-judge, le code et la révision humaine. Les barrières de qualité CI/CD peuvent bloquer un déploiement en cas de baisse des scores, Topics fait automatiquement remonter les groupes d'échecs à partir du trafic de production, et Loop, un agent d'IA intégré au produit lancé en novembre 2025, analyse les traces en langage naturel et propose des jeux de données d'évaluation et des évaluateurs. Les SDK couvrent Python, TypeScript, Go, Ruby et C#, la bibliothèque open source autoevals fonctionne de manière autonome, et l'entreprise a levé 80 millions de dollars en série B pour une valorisation de 800 millions de dollars en février 2026.
Ce que Braintrust apporte aux équipes IA en juin 2026
Le centre de gravité est l'évaluation, et non la trace. Là où la plupart des outils d'observabilité partent de la journalisation en production pour y greffer l'évaluation, Braintrust se construit à partir du flux de travail d'expérimentation, ce qui explique pourquoi il convient aux équipes qui considèrent la qualité comme un élément à mesurer et à imposer plutôt qu'à simplement observer.
"Je n'ai jamais vu une transformation des flux de travail comparable à celle qui intègre les évaluations dans les processus d'ingénierie traditionnels." Malte Ubl, Ingénierie chez Vercel, octobre 2024.
En pratique, cela signifie que vous instrumentez votre application, extrayez de vraies conversations dans un jeu de données, définissez des évaluateurs et menez des expériences qui produisent des comparaisons côte à côte avec une signification statistique. Une intégration GitHub Actions exécute ces évaluations sur chaque pull request et publie les résultats sous forme de commentaire, de sorte qu'une modification de prompt n'est déployée que si elle franchit un seuil de qualité. Topics, qui a atteint la disponibilité générale en juin 2026, trouve des modèles d'échec sans étiquetage manuel, et l'agent Loop, lancé le 24 novembre 2025, transforme une question comme "les hallucinations ont-elles augmenté cette semaine" en une véritable analyse avec des propositions de correctifs. La série B de 80 millions de dollars menée par ICONIQ en février 2026, avec le retour d'Andreessen Horowitz et de Greylock, finance la feuille de route qui sous-tend tout cela.
Braintrust face à Langfuse et Arize Phoenix
Face à Langfuse, la différence réside dans la philosophie et la licence. Langfuse est axé sur le traçage (tracing-first) et entièrement open source sous licence MIT, auto-hébergeable par tous, et a été acquis par ClickHouse en janvier 2026, tandis que Braintrust est axé sur l'évaluation (eval-first), à code source fermé sur son moteur propriétaire Brainstore, sans version gratuite auto-hébergée. Les équipes qui recherchent la liberté de l'open source commencent avec Langfuse ; celles qui veulent les outils d'évaluation native et d'expérimentation les plus poussés commencent avec Braintrust. Face à Arize Phoenix, le contraste se situe entre la découverte et l'application. Phoenix est natif OpenTelemetry, gratuit à auto-héberger, et bénéficie de l'étendue de la dérive ML issue des racines de surveillance d'Arize, ce qui le rend performant pour trouver ce qui ne va pas en production. Braintrust est plus fort pour le corriger systématiquement, avec des barrières CI/CD et des flux de travail de jeux de données plus matures. Pour résumer : Phoenix fait remonter le problème, Braintrust boucle la boucle pour le résoudre.
Combien coûte le flux de travail axé sur l'évaluation
Braintrust propose un niveau Starter véritablement gratuit avec un nombre illimité d'utilisateurs, 1 Go de données traitées et 10 000 scores par mois, ainsi qu'une rétention de 14 jours. Le passage au payant est brutal : le forfait Pro est à un tarif fixe de 249 $ par mois, toujours avec un nombre illimité d'utilisateurs, augmentant les données incluses à 5 Go et les scores à 50 000 avec une rétention de 30 jours, plus le RBAC et un support prioritaire. Le forfait Enterprise ajoute une rétention personnalisée, un déploiement hybride ou sur site, et un SLA premium.
"Les évaluations sont la pièce maîtresse de l'ingénierie IA systématique." Ankur Goyal, fondateur de Braintrust, octobre 2024.
La véritable difficulté réside dans le modèle d'utilisation. En plus du forfait fixe, l'ingestion de données et les scores sont facturés à l'unité, et les charges de travail des agents qui génèrent de nombreux spans et scores par exécution peuvent rapidement accumuler des dépassements, 450 000 scores au-delà de l'allocation Pro ajoutant environ 675 $ à la facture. Il n'y a pas non plus de niveau intermédiaire entre la gratuité et 249 $, ce qui rend la transition abrupte pour les petites équipes.
Où Braintrust frustre les équipes
Les plaintes les plus fréquentes se concentrent sur le coût et le support. La tarification est difficile à modéliser avant de s'inscrire car elle mélange un forfait fixe avec des frais par gigaoctet et par score, et le saut de la gratuité à 249 $ sans intermédiaire prend les petites équipes au dépourvu. La qualité du support suscite des critiques répétées dans les avis tiers, avec des temps de réponse lents décrits comme un schéma systémique plutôt que comme des incidents isolés, typique d'une entreprise qui est passée à 165 personnes en environ un an. L'interface utilisateur des traces est optimisée pour la notation et les expériences plutôt que pour le débogage brut en production, de sorte que la localisation d'une cause première dans une exécution d'agent de 2 000 spans nécessite plus de navigation qu'un outil de traçage dédié. Il n'y a pas d'auto-hébergement en dessous du niveau Enterprise, ce qui est un obstacle majeur pour les équipes aux budgets limités ou soumises à des contraintes de résidence des données, et parce que l'évaluation se fait a posteriori, Braintrust ne fournit pas de garde-fous en temps réel qui bloquent une réponse dangereuse avant qu'elle n'atteigne un utilisateur.
Pour qui Braintrust est conçu, et qui devrait chercher ailleurs
Braintrust est un excellent choix pour les équipes d'ingénierie qui souhaitent intégrer les évaluations dans le CI/CD, pour les organisations qui construisent une culture axée sur l'évaluation (eval-first) plutôt que de faire des tests de prompts ad hoc, pour les équipes à l'aise avec le niveau à 249 $ par mois, et pour quiconque s'appuie sur n'importe quel fournisseur de LLM plutôt que d'être enfermé dans un seul framework. Les SDK agnostiques vis-à-vis des frameworks et les barrières natives de GitHub constituent son principal attrait.
Il ne convient pas aux équipes qui ont principalement besoin de garde-fous en temps réel ou de filtrage de contenu, puisque Braintrust évalue a posteriori, ni aux équipes réglementées qui exigent un auto-hébergement en dessous d'un contrat d'entreprise. Les organisations exécutant du ML traditionnel aux côtés de LLM et qui souhaitent une surveillance unifiée seront mieux servies par Arize ou Weights and Biases. Les développeurs indépendants et les petites équipes qui ne peuvent pas justifier 249 $ et qui épuiseront rapidement le niveau gratuit sur les charges de travail des agents devraient plutôt se tourner vers une option ouverte comme Opik ou Langfuse.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Braintrust.

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)
