

Braintrust es una plataforma de observabilidad centrada en la evaluación para equipos que lanzan productos basados en LLM, integrando rastreo, conjuntos de datos, evaluadores y controles de calidad CI/CD en un solo flujo de trabajo. Utilizada por OpenAI, Stripe y Notion, es una herramienta premium y propietaria, con un salto pronunciado entre su versión gratuita y la de pago.
Braintrust es una plataforma integral de evaluación y observabilidad de código cerrado para equipos que desarrollan productos impulsados por LLM, organizada en torno a una premisa directa: no se puede saber si una función de IA está mejorando o empeorando sin una medición sistemática, y las pruebas de software tradicionales no se aplican a resultados probabilísticos. Fue fundada en San Francisco por Ankur Goyal, cuya empresa anterior, Impira, fue adquirida por Figma, y ofrece a los equipos de ingeniería un ciclo estructurado para capturar rastreos, definir qué se considera un buen resultado mediante evaluadores, ejecutar experimentos con conjuntos de datos versionados y condicionar los lanzamientos a la calidad. Su cartera de clientes es inusualmente sólida para una categoría joven, e incluye a OpenAI, Stripe, Notion, Vercel, Airtable y Zapier, lo cual es la señal más clara de que el enfoque centrado en la evaluación resuena en los equipos serios.
La plataforma combina el registro y el rastreo en Brainstore, una base de datos propietaria que, según la empresa, es notablemente más rápida al consultar datos de rastreo, con un marco de evaluaciones, conjuntos de datos versionados, un entorno de pruebas de prompts y evaluadores automatizados que abarcan LLM como juez, código y revisión humana. Los controles de calidad CI/CD pueden bloquear una implementación cuando las puntuaciones retroceden, Topics saca a la luz automáticamente los grupos de fallos del tráfico de producción, y Loop, un agente de IA integrado en el producto lanzado en noviembre de 2025, analiza los rastreos en lenguaje natural y propone conjuntos de datos de evaluación y evaluadores. Los SDK cubren Python, TypeScript, Go, Ruby y C#, la biblioteca de código abierto autoevals funciona de forma independiente, y la empresa recaudó $80 millones en una Serie B con una valoración de $800 millones en febrero de 2026.
Qué hace Braintrust por los equipos de IA en junio de 2026
El centro de gravedad es la evaluación, no el rastreo. Mientras que la mayoría de las herramientas de observabilidad parten del registro de producción y añaden la evaluación como un complemento, Braintrust se construye desde el flujo de trabajo del experimento hacia afuera, razón por la cual se adapta a los equipos que tratan la calidad como algo que se debe medir y hacer cumplir, en lugar de solo observar.
"Nunca antes había visto una transformación del flujo de trabajo como la que incorpora las evaluaciones en los procesos de ingeniería convencionales". Malte Ubl, Ingeniería en Vercel, octubre de 2024.
En la práctica, eso significa que instrumentas tu aplicación, extraes conversaciones reales a un conjunto de datos, defines evaluadores y ejecutas experimentos que producen diferencias lado a lado con significancia estadística. Una integración con GitHub Actions ejecuta esas evaluaciones en cada pull request y publica los resultados como un comentario, por lo que un cambio en un prompt solo se implementa si supera un estándar de calidad. Topics, que alcanzó la disponibilidad general en junio de 2026, encuentra patrones de fallo sin etiquetado manual, y el agente Loop, lanzado el 24 de noviembre de 2025, convierte "han aumentado las alucinaciones esta semana" en un análisis real con propuestas de solución. La Serie B de $80 millones liderada por ICONIQ en febrero de 2026, con el regreso de Andreessen Horowitz y Greylock, financia la hoja de ruta detrás de todo esto.
Braintrust frente a Langfuse y Arize Phoenix
Frente a Langfuse, la diferencia radica en la filosofía y las licencias. Langfuse prioriza el rastreo, es de código abierto bajo licencia MIT, puede ser autoalojado por cualquiera y fue adquirido por ClickHouse en enero de 2026, mientras que Braintrust prioriza la evaluación, es de código cerrado en su motor propietario Brainstore y no tiene un nivel gratuito de autoalojamiento. Los equipos que desean la libertad del código abierto comienzan con Langfuse; los equipos que desean las herramientas nativas de puntuación y experimentación más profundas comienzan con Braintrust. Frente a Arize Phoenix, el contraste es el descubrimiento frente a la aplicación. Phoenix es nativo de OpenTelemetry, gratuito para autoalojar y cuenta con la amplitud de la deriva de ML de las raíces de monitorización de Arize, lo que lo hace fuerte para encontrar qué está mal en producción. Braintrust es más fuerte para solucionarlo sistemáticamente, con controles CI/CD y flujos de trabajo de conjuntos de datos más maduros. Un resumen útil: Phoenix saca a la luz el problema, Braintrust cierra el ciclo sobre él.
Cuánto cuesta el flujo de trabajo centrado en la evaluación
Braintrust tiene un nivel Starter genuinamente gratuito con usuarios ilimitados, 1 GB de datos procesados y 10,000 puntuaciones al mes, y 14 días de retención. El salto a la versión de pago es pronunciado: Pro tiene una tarifa plana de $249 al mes, de nuevo con usuarios ilimitados, aumentando los datos incluidos a 5 GB y las puntuaciones a 50,000 con 30 días de retención, además de RBAC y soporte prioritario. Enterprise añade retención personalizada, implementación híbrida o local (on-premise) y un SLA premium.
"Las evaluaciones son la pieza central de la ingeniería de IA sistemática". Ankur Goyal, fundador de Braintrust, octubre de 2024.
El verdadero inconveniente es el modelo de uso. Además de la tarifa plana, la ingesta de datos y las puntuaciones se facturan por unidad, y las cargas de trabajo de los agentes que generan muchos tramos y puntuaciones por ejecución pueden acumular excedentes rápidamente; por ejemplo, 450,000 puntuaciones más allá del límite de Pro añaden aproximadamente $675 a la factura. Tampoco hay un nivel intermedio entre la versión gratuita y la de $249, lo que hace que el salto sea abrupto para los equipos pequeños.
Dónde frustra Braintrust a los equipos
Las quejas más comunes se agrupan en torno al coste y el soporte. Los precios son difíciles de modelar antes de registrarse porque mezclan una tarifa plana con cargos por gigabyte y por puntuación, y el salto de la versión gratuita a $249 sin nada intermedio pilla desprevenidos a los equipos pequeños. La calidad del soporte recibe críticas repetidas en reseñas de terceros, con tiempos de respuesta lentos descritos como un patrón sistémico en lugar de incidentes aislados, algo típico de una empresa que creció a 165 personas en aproximadamente un año. La interfaz de usuario de rastreo está optimizada para la puntuación y los experimentos en lugar de la depuración de producción en bruto, por lo que localizar la causa raíz en la ejecución de un agente de 2,000 tramos requiere más navegación que una herramienta de rastreo dedicada. No hay autoalojamiento por debajo del nivel empresarial, lo cual es un obstáculo insalvable para equipos con presupuesto limitado o sujetos a normativas de residencia de datos, y debido a que la evaluación ocurre a posteriori, Braintrust no proporciona barreras de seguridad en tiempo real que bloqueen una respuesta insegura antes de que llegue al usuario.
Para quién está diseñado Braintrust y quién debería buscar en otra parte
Braintrust es una excelente opción para los equipos de ingeniería que desean evaluaciones integradas en CI/CD, para las organizaciones que construyen una cultura centrada en la evaluación en lugar de realizar pruebas de prompts ad-hoc, para los equipos que se sienten cómodos en el nivel de $249 al mes y para cualquiera que desarrolle sobre cualquier proveedor de LLM en lugar de estar atado a un solo marco de trabajo. Los SDK independientes del marco y los controles nativos de GitHub son su principal atractivo.
Es una mala opción para los equipos que necesitan principalmente barreras de seguridad en tiempo real o filtrado de contenido, ya que Braintrust evalúa a posteriori, y para los equipos regulados que requieren autoalojamiento por debajo de un contrato empresarial. Las organizaciones que ejecutan ML tradicional junto con LLM y que desean una monitorización unificada estarán mejor servidas por Arize o Weights and Biases. Los desarrolladores independientes y los equipos pequeños que no pueden justificar los $249 y que agotarán rápidamente el nivel gratuito en cargas de trabajo de agentes deberían buscar una opción abierta como Opik o Langfuse en su lugar.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Artículos relacionados
Guías y artículos relacionados con Braintrust.

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)
