

Arize Phoenix es una plataforma de observabilidad y evaluación de código abierto, nativa de OpenTelemetry, para aplicaciones y agentes de LLM. Rastrea cada llamada, la califica con más de 50 evaluadores integrados y se puede alojar de forma gratuita, lo que la convierte en la opción estándar para equipos que buscan neutralidad de proveedores.
Arize Phoenix es una plataforma de observabilidad y evaluación de código abierto para aplicaciones de LLM y agentes de IA, desarrollada por Arize AI, la empresa de San Francisco que comenzó en 2020 como una herramienta de monitoreo de aprendizaje automático. Existe para resolver un tipo específico de ceguera: los fallos de LLM y agentes, las alucinaciones, las recuperaciones deficientes, las regresiones de prompts y los bucles de herramientas descontrolados son casi invisibles sin instrumentación. Phoenix captura cada paso de la llamada a un modelo como un rastro, lo califica con evaluadores integrados y ofrece a los ingenieros un flujo de trabajo para encontrar y solucionar los fallos. La decisión arquitectónica que la define es que Phoenix está construida sobre OpenTelemetry y las convenciones de OpenInference, por lo que funciona con cualquier marco de trabajo o proveedor que ya utilices, y puedes alojar todo el sistema por tu cuenta de forma gratuita.
Phoenix ofrece rastreo mediante árboles de tramos (span trees) de prompts, recuperaciones, llamadas a herramientas, tokens y latencia, además de más de 50 evaluadores respaldados por investigaciones (LLM como juez) que devuelven explicaciones en lugar de simples puntuaciones, conjuntos de datos y experimentos para comparaciones sistemáticas de antes y después, gestión de prompts y análisis de desviación de embeddings (embedding-drift) heredado de las raíces de ML de Arize. Un agente de IA integrado llamado PXI puede depurar rastros e iterar sobre prompts dentro de la herramienta, y Phoenix incluye un servidor Model Context Protocol para que los asistentes de programación puedan consultar los rastros directamente. Es gratuito bajo la Elastic License, con una opción alojada en Phoenix Cloud, mientras que la plataforma comercial independiente Arize AX añade funciones empresariales. Arize recaudó $70 millones en una ronda de Serie C en febrero de 2025, por lo que el proyecto no es un experimento secundario.
Qué instrumenta Arize Phoenix en junio de 2026
El ciclo principal es instrumentar, rastrear, evaluar e iterar. Añades un par de líneas usando una biblioteca compatible con OpenTelemetry, y Phoenix registra cada tramo de una cadena de llamadas de LLM, para luego permitirte ejecutar evaluadores sobre esos tramos y calificar la fidelidad, relevancia, alucinación, toxicidad y más. Como los evaluadores devuelven explicaciones, ves por qué se marcó un tramo, no solo que fue marcado. Los rastros se exportan a conjuntos de datos, los conjuntos de datos alimentan experimentos, y los experimentos te permiten comparar un nuevo prompt o modelo con un punto de referencia fijo. La vista de análisis de embeddings, un remanente de la herencia de monitoreo de Arize, agrupa valores atípicos y detecta desviaciones, lo cual es genuinamente útil para sistemas RAG. Este impulso está respaldado por dinero real: la Serie C de $70 millones de Arize, anunciada el 20 de febrero de 2025 y liderada por Adams Street Partners con la participación de M12, Datadog y PagerDuty, fue catalogada como la mayor inversión en observabilidad de IA hasta la fecha, con Phoenix superando ya los dos millones de descargas mensuales.
Phoenix frente a Langfuse y Braintrust
La forma más clara de situar a Phoenix es frente a las dos herramientas con las que los equipos suelen compararla.
"Si usas LangGraph, LangSmith es la opción correcta. Si eres agnóstico en cuanto a marcos de trabajo, Langfuse. Si el rigor de la evaluación es la prioridad, Arize Phoenix". Retrospectiva de observabilidad de ingeniería, marzo de 2026.
Langfuse tiene licencia MIT, mientras que Phoenix utiliza la Elastic License, lo cual es importante si deseas revender o integrar la herramienta, algo que la licencia de Phoenix prohíbe y la de Langfuse permite. Langfuse también se trasladó a un backend de ClickHouse y fue adquirida por ClickHouse en enero de 2026, lo que le otorga una escala analítica que supera el límite de aproximadamente 200 millones de tramos que alcanza el almacenamiento PostgreSQL de Phoenix, y ofrece paridad total de funciones entre la nube y el alojamiento propio. Phoenix contrarresta con primitivas de evaluación más profundas y detección de desviaciones heredada del ML. Braintrust adopta la filosofía opuesta: un SaaS propietario, nativo de CI/CD y centrado en la evaluación, sin un nivel gratuito de alojamiento propio, mientras que Phoenix prioriza OpenTelemetry y el alojamiento propio. Braintrust gana para los equipos que desean evaluaciones como un filtro de calidad que bloquee las fusiones (merges); Phoenix gana para los equipos que necesitan neutralidad de proveedores y alojamiento propio gratuito.
La línea del código abierto y dónde comienza Arize AX
Phoenix Open Source es gratuito, sin límites de tramos ni de retención, y se aloja en tu propio PostgreSQL a través de Docker o Kubernetes. Phoenix Cloud añade una opción alojada gratuita para equipos más pequeños. El producto de pago es algo diferente: Arize AX, que comienza con un nivel gratuito de 25,000 tramos al mes, pasa a Arize AX Pro por $50 al mes para 50,000 tramos con un excedente de $10 por cada millón adicional, y culmina en Arize AX Enterprise con SOC 2, HIPAA, alojamiento propio con residencia de datos y evaluaciones en línea sobre tráfico en vivo. El detalle que vale la pena conocer es que pasar de Phoenix a Arize AX implica un nuevo contrato de ventas, no un aumento de nivel transparente, y los precios basados en tramos de Arize AX suben rápidamente en cargas de trabajo de agentes donde una acción del usuario puede generar cientos de tramos. Los equipos que comparan plataformas de evaluación también deberían considerar Weights and Biases, cuyo producto Weave cubre un terreno similar desde un linaje de seguimiento de experimentos.
Dónde se resiente Phoenix
El límite más concreto es la escala. La interfaz de usuario de árbol de tramos que hace legibles los rastros pequeños se vuelve inmanejable en ejecuciones de agentes grandes, y el backend de PostgreSQL tiene un techo real.
"Alcanzamos un pico de unos 200 millones de tramos y un poco más de 2 TB, y nuestra implementación de Phoenix es más o menos no funcional". Dillon D., foro de la comunidad de Arize, 2025.
Más allá de la escala bruta, Phoenix muestra árboles de tramos en lugar de transcripciones de conversaciones legibles, lo que ralentiza la depuración de agentes de múltiples turnos, y su modelo de acceso es solo para ingeniería, por lo que los gerentes de producto o expertos en el dominio no pueden cargar conjuntos de datos ni revisar resultados sin Python y la ayuda de ingeniería. Los evaluadores son útiles para el monitoreo de tendencias, pero no son infalibles; el juez de alucinaciones está documentado con un acuerdo de alrededor del 82% con las etiquetas humanas y una tasa de falsos positivos del 12%, por lo que deberían informar las decisiones en lugar de tomarlas automáticamente. El soporte integrado para evaluar trayectorias completas de múltiples turnos también va a la zaga de la evaluación de un solo prompt.
Para quién es adecuado Phoenix y a quién se le queda pequeño
Phoenix es una excelente opción para ingenieros de ML e IA que desean observabilidad alojada por ellos mismos y neutral en cuanto a proveedores sin costo de plataforma, para equipos con requisitos de residencia de datos que mantienen los rastros en sus instalaciones, para entornos de múltiples marcos de trabajo que se benefician de la instrumentación de OpenTelemetry, y para cualquiera que valore primitivas de evaluación profundas con rigor estadístico. Los equipos que ya usan Arize AX utilizan Phoenix como complemento para el desarrollo local.
Es la herramienta equivocada para partes interesadas no técnicas que necesitan flujos de trabajo de revisión sin código, para volúmenes de rastreo extremos más allá de lo que maneja un PostgreSQL autogestionado a menos que te pases a Arize AX Enterprise, y para entornos centrados en LangChain que obtienen más de la profunda integración por nodo de LangSmith. Los equipos que desean filtros automatizados de CI/CD que bloqueen las implementaciones estarán mejor servidos por Braintrust u Opik, y cualquiera que desee revender o integrar la capa de observabilidad debería elegir una opción con licencia permisiva como Langfuse, ya que la Elastic License lo prohíbe.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Artículos relacionados
Guías y artículos relacionados con Arize Phoenix.

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

AI Security Tools for Small Teams (2026): The Stack That Doesn't Need a SOC

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

AI User Testing in 2026: The Tools That Test Your Product While You Sleep
