

Arize Phoenix est une plateforme d'observabilité et d'évaluation open source, native OpenTelemetry, pour les applications LLM et les agents. Elle trace chaque appel, l'évalue avec plus de 50 évaluateurs intégrés et peut être auto-hébergée gratuitement, ce qui en fait le choix de référence pour les équipes soucieuses de rester indépendantes des fournisseurs.
Arize Phoenix est une plateforme d'observabilité et d'évaluation open source pour les applications LLM et les agents IA, développée par Arize AI, l'entreprise de San Francisco qui a débuté en 2020 comme outil de surveillance du machine learning. Elle a été conçue pour résoudre un problème d'aveuglement spécifique : les défaillances des LLM et des agents, les hallucinations, les mauvaises récupérations de données, les régressions de prompts et les boucles d'outils incontrôlables sont presque invisibles sans instrumentation. Phoenix capture chaque étape de l'appel d'un modèle sous forme de trace, l'évalue avec des évaluateurs intégrés et offre aux ingénieurs un flux de travail pour identifier et corriger les erreurs. La décision architecturale qui la définit est que Phoenix repose sur OpenTelemetry et les conventions OpenInference, ce qui lui permet de fonctionner avec n'importe quel framework ou fournisseur que vous utilisez déjà, et vous pouvez auto-héberger l'ensemble gratuitement.
Phoenix propose un traçage sous forme d'arborescences de spans (prompts, récupérations, appels d'outils, tokens et latence), plus de 50 évaluateurs « LLM-as-judge » basés sur la recherche qui fournissent des explications plutôt que de simples scores, des jeux de données et des expérimentations pour des comparaisons systématiques avant/après, la gestion des prompts, et l'analyse de la dérive des embeddings héritée des racines ML d'Arize. Un agent IA intégré appelé PXI peut déboguer les traces et itérer sur les prompts directement dans l'outil, et Phoenix intègre un serveur Model Context Protocol pour que les assistants de codage puissent interroger les traces directement. L'outil est gratuit sous la licence Elastic License avec une option hébergée Phoenix Cloud, tandis que la plateforme commerciale distincte Arize AX ajoute des fonctionnalités d'entreprise. Arize a levé une série C de $70 million en février 2025, ce projet n'est donc pas une simple expérience secondaire.
Ce qu'Arize Phoenix instrumente en juin 2026
La boucle principale consiste à instrumenter, tracer, évaluer et itérer. Vous ajoutez quelques lignes à l'aide d'une bibliothèque compatible OpenTelemetry, et Phoenix enregistre chaque span d'une chaîne d'appels LLM, puis vous permet d'exécuter des évaluateurs sur ces spans pour noter la fidélité, la pertinence, les hallucinations, la toxicité, et bien plus encore. Comme les évaluateurs fournissent des explications, vous comprenez pourquoi un span a été signalé, et pas seulement le fait qu'il l'ait été. Les traces s'exportent vers des jeux de données, les jeux de données alimentent les expérimentations, et les expérimentations vous permettent de comparer un nouveau prompt ou modèle par rapport à un benchmark fixe. La vue d'analyse des embeddings, un héritage de l'expertise en surveillance d'Arize, regroupe les valeurs aberrantes et détecte les dérives, ce qui est véritablement utile pour les systèmes RAG. Cette dynamique est soutenue par des fonds importants : la série C de $70 million d'Arize, annoncée le 20 février 2025 et menée par Adams Street Partners avec la participation de M12, Datadog et PagerDuty, a été présentée comme le plus gros investissement dans l'observabilité de l'IA à ce jour, Phoenix comptant déjà plus de deux millions de téléchargements mensuels.
Phoenix face à Langfuse et Braintrust
La façon la plus claire de situer Phoenix est de le comparer aux deux outils avec lesquels les équipes le mettent en balance.
« Si vous êtes sur LangGraph, LangSmith est le bon choix. Si vous êtes agnostique en matière de framework, Langfuse. Si la rigueur de l'évaluation est la priorité, Arize Phoenix. » Rétrospective sur l'observabilité en ingénierie, mars 2026.
Langfuse est sous licence MIT là où Phoenix utilise la licence Elastic License, ce qui a son importance si vous souhaitez revendre ou intégrer l'outil, chose que la licence de Phoenix interdit et que celle de Langfuse autorise. Langfuse est également passé à un backend ClickHouse et a été acquis par ClickHouse en janvier 2026, lui conférant une évolutivité analytique au-delà du plafond d'environ 200 millions de spans atteint par le stockage PostgreSQL de Phoenix, et il offre une parité totale des fonctionnalités entre le cloud et l'auto-hébergement. Phoenix riposte avec des primitives d'évaluation plus poussées et une détection des dérives héritée du ML. Braintrust adopte la philosophie inverse : un SaaS propriétaire axé sur l'évaluation, natif CI/CD, sans niveau d'auto-hébergement gratuit, là où Phoenix privilégie OpenTelemetry et l'auto-hébergement. Braintrust l'emporte pour les équipes qui souhaitent que les évaluations servent de barrière de qualité bloquant les fusions (merge) ; Phoenix l'emporte pour les équipes qui ont besoin d'une neutralité vis-à-vis des fournisseurs et d'un auto-hébergement gratuit.
La frontière de l'open source et là où commence Arize AX
La version open source de Phoenix est gratuite, sans limite de spans ou de rétention, auto-hébergée sur votre propre PostgreSQL via Docker ou Kubernetes. Phoenix Cloud ajoute une option hébergée gratuite pour les petites équipes. Le produit payant est différent : Arize AX, qui commence par un niveau gratuit à 25 000 spans par mois, passe à AX Pro à $50 par mois pour 50 000 spans avec un dépassement à $10 par million supplémentaire, et culmine avec AX Enterprise qui inclut SOC 2, HIPAA, l'auto-hébergement avec résidence des données, et des évaluations en ligne sur le trafic en direct. Le piège à connaître est que le passage de Phoenix à AX implique un nouveau contrat de vente, et non une simple montée en gamme transparente, et la tarification d'AX basée sur les spans grimpe rapidement sur les charges de travail des agents où une seule action utilisateur peut générer des centaines de spans. Les équipes comparant les plateformes d'évaluation devraient également considérer Weights and Biases, dont le produit Weave couvre un terrain similaire issu d'une lignée de suivi des expérimentations.
Les limites de Phoenix
La limite la plus concrète est l'évolutivité. L'interface utilisateur en arborescence de spans, qui rend les petites traces lisibles, devient difficile à manier sur les exécutions d'agents de grande envergure, et le backend PostgreSQL a un véritable plafond.
« Nous avons culminé à environ 200M de spans et un peu plus de 2TB, et notre déploiement phoenix est plus ou moins non fonctionnel. » Dillon D., forum de la communauté Arize, 2025.
Au-delà de l'échelle brute, Phoenix affiche des arborescences de spans plutôt que des transcriptions de conversation lisibles, ce qui ralentit le débogage des agents multi-tours. De plus, son modèle d'accès est réservé à l'ingénierie, de sorte que les chefs de produit ou les experts métier ne peuvent pas télécharger de jeux de données ou examiner les résultats sans l'aide de Python et d'un ingénieur. Les évaluateurs sont utiles pour la surveillance des tendances mais ne sont pas infaillibles, le juge des hallucinations étant documenté à environ 82 % de concordance avec les étiquettes humaines et un taux de faux positifs de 12 %. Ils doivent donc éclairer les décisions plutôt que de les prendre automatiquement. La prise en charge intégrée de l'évaluation des trajectoires multi-tours complètes est également en retard par rapport à l'évaluation d'un prompt unique.
À qui s'adresse Phoenix, et qui finit par le dépasser
Phoenix est un excellent choix pour les ingénieurs ML et IA qui souhaitent une observabilité auto-hébergée, neutre vis-à-vis des fournisseurs et sans coût de plateforme, pour les équipes ayant des exigences de résidence des données qui conservent les traces sur site, pour les environnements multi-frameworks qui bénéficient de l'instrumentation OpenTelemetry, et pour tous ceux qui apprécient les primitives d'évaluation approfondies avec une rigueur statistique. Les équipes utilisant déjà Arize AX se servent de Phoenix comme complément pour le développement local.
Ce n'est pas le bon outil pour les parties prenantes non techniques qui ont besoin de flux de révision no-code, pour les volumes de traces extrêmes dépassant ce que gère un PostgreSQL auto-géré (à moins de passer à AX Enterprise), ni pour les environnements axés sur LangChain qui tireront davantage parti de l'intégration approfondie par nœud de LangSmith. Les équipes qui souhaitent des barrières CI/CD automatisées bloquant les déploiements seront mieux servies par Braintrust ou Opik, et quiconque souhaite revendre ou intégrer la couche d'observabilité devrait choisir une option sous licence permissive comme Langfuse, car la licence Elastic License l'interdit.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Articles associés
Guides et articles en lien avec Arize Phoenix.

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

AI Security Tools for Small Teams (2026): The Stack That Doesn't Need a SOC

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

AI User Testing in 2026: The Tools That Test Your Product While You Sleep
