Saltar al contenido principal
Vantaige
Langfuse screenshot
Langfuse logo

Langfuse

Freemium

Langfuse es una plataforma de ingeniería y observabilidad de LLM de código abierto utilizada por equipos de IA para rastrear, depurar, evaluar y gestionar prompts en producción. Con licencia MIT, opción de autoalojamiento y la confianza de más de 63 empresas de la lista Fortune 500, incluyendo Khan Academy.

Casos de uso:Datos y Analítica
Funciones:APIOpen Source

Langfuse es una plataforma de ingeniería de LLM de código abierto diseñada para equipos que lanzan aplicaciones de IA a producción. Fundada en 2023 por tres ingenieros de la cohorte W23 de Y Combinator, aborda un problema al que todo desarrollador de IA se enfrenta en las primeras semanas de implementación en producción: no tienes visibilidad de lo que tu LLM está haciendo realmente. Langfuse ofrece a los equipos observabilidad estructurada, gestión de prompts, pipelines de evaluación y herramientas de conjuntos de datos en una sola plataforma, con una auténtica opción de autoalojamiento bajo licencia MIT que se ejecuta en Docker, Kubernetes o infraestructura gestionada en la nube. En enero de 2026, ClickHouse adquirió Langfuse junto con una Serie D de $400 millones, aportando importantes recursos de ingeniería para el rendimiento y la fiabilidad empresarial, manteniendo intactos el compromiso con el código abierto y los precios.

La plataforma instrumenta aplicaciones de IA a través de SDKs de Python y TypeScript o mediante integraciones de autoinstrumentación con LangChain, LlamaIndex, OpenAI, Haystack y más de 20 frameworks adicionales. Cada llamada al LLM, invocación de herramientas, paso de recuperación e interacción del usuario se convierte en una traza estructurada con recuento de tokens, latencia, atribución de costes y captura completa de entradas/salidas. A partir de ahí, los equipos ejecutan evaluadores de LLM como juez (LLM-as-judge), adjuntan colas de anotación humana, gestionan prompts versionados con pruebas A/B y realizan benchmarks en conjuntos de datos seleccionados. Langfuse Cloud se ejecuta sobre una capa de datos respaldada por ClickHouse introducida en la v3 (diciembre de 2024), que maneja cientos de eventos de ingesta por segundo sin cuellos de botella en la base de datos. El repositorio de GitHub cuenta con más de 26,300 estrellas y publica actualizaciones continuamente, con la llegada de la v3.171.0 a finales de abril de 2026.

Lo que Langfuse hace realmente en abril de 2026

Langfuse se sitúa entre el código de tu aplicación y las APIs de LLM a las que llamas, pero no como un proxy. A diferencia del enfoque de intercambio de URL de Helicone, Langfuse utiliza instrumentación a nivel de SDK: tu código crea explícitamente trazas y spans, y Langfuse captura el árbol de ejecución completo. Esto te da más control y más contexto, a costa de un mayor trabajo de integración inicial.

Una sola traza puede contener docenas de observaciones anidadas: un span de agente exterior que envuelve una llamada de recuperación, una generación de LLM, la ejecución de una herramienta y un paso de formato final. Cada nodo registra su propia latencia, coste de tokens y entrada/salida. Cuando algo falla a las 2am, extraes el ID de la traza de tus registros, abres Langfuse y tienes el árbol de decisiones completo frente a ti en lugar de adivinar a partir de fragmentos de logs.

Más allá del rastreo, la plataforma cubre tres flujos de trabajo adyacentes que las herramientas de observabilidad suelen omitir:

  • Gestión de prompts: Almacena plantillas de prompts con historial de versiones, promueve versiones en distintos entornos y ejecuta experimentos A/B. Los cambios se mantienen fuera del código fuente y se pueden revertir sin necesidad de un despliegue.

  • Evaluación: Ejecuta evaluadores de LLM como juez en trazas muestreadas automáticamente, recopila comentarios de los usuarios (pulgar arriba/abajo, calificaciones por estrellas) y enruta las trazas a colas de anotación humana para su revisión manual.

  • Conjuntos de datos: Organiza las trazas en conjuntos de datos de prueba estructurados y ejecuta benchmarks de regresión en versiones de prompts o actualizaciones de modelos antes de su lanzamiento.

La versión de marzo de 2026 incluyó un modelo de datos centrado en observaciones con una mejora de 10x en los tiempos de carga del panel, abordando una queja recurrente sobre la capacidad de respuesta de la interfaz de usuario con altos volúmenes de trazas.

Dónde se sitúa Langfuse frente a LangSmith y Helicone

Tres herramientas dominan este espacio, y las diferencias son arquitectónicas, no estéticas.

LangSmith es el producto de observabilidad propietario de LangChain. Si toda la pila de tu aplicación es LangChain o LangGraph, LangSmith es genuinamente sin fricciones: configuras una variable de entorno y el rastreo automático cubre todas tus cadenas sin tocar el código de la aplicación. En el momento en que sales del ecosistema de LangChain, esa ventaja desaparece y necesitas instrumentación manual de todos modos. LangSmith es de código cerrado y no tiene opción de autoalojamiento, lo que lo descarta para equipos con requisitos de residencia de datos. Nivel gratuito: 5,000 trazas/mes. Starter: $39/mes.

Helicone adopta la arquitectura opuesta: un proxy que se sitúa entre tu código y la API del LLM. Rediriges tu URL base a través de los servidores de Helicone y añades un encabezado con la clave API. La configuración lleva unos 15 minutos y no requiere ningún cambio en la lógica de la aplicación. La contrapartida es que todo el tráfico pasa por la infraestructura de Helicone, lo que crea una dependencia de terceros en la ruta crítica. La función de caché semántica de Helicone (los prompts similares devuelven respuestas en caché) puede producir un ahorro de costes del 20-40% en algunas cargas de trabajo, algo que Langfuse no ofrece. Pero Helicone carece del versionado de prompts, las pruebas A/B, el pipeline de evaluación y la gestión de conjuntos de datos de Langfuse. Nivel gratuito: 50,000 solicitudes/mes. Starter: $20/mes.

Langfuse es agnóstico al framework y requiere instrumentación explícita del SDK en todo tu código. La inversión en configuración es mayor (unas pocas horas frente a los 15 minutos de Helicone), pero el resultado es la imagen de observabilidad más completa: spans anidados, árboles completos de ejecución de agentes, bucles de retroalimentación humana y gestión del ciclo de vida de los prompts. La opción de autoalojamiento es genuinamente funcional y ha sido un objetivo de despliegue de primer nivel desde el lanzamiento del proyecto. Una advertencia: Langfuse utiliza su propio formato de rastreo en lugar de OpenTelemetry nativo, lo que ha surgido como una preocupación entre los equipos que estandarizan con OTel en toda su pila.

"Lo que realmente nos encantó de Langfuse fue la API abierta. Mientras que muchas herramientas de rastreo requieren SDKs o wrappers específicos, la API abierta de Langfuse nos permitió construir nuestro propio cliente Golang en torno a ella." - Walt Wells, Staff Software Engineer, Khan Academy, 2024
"Gastamos más de 60k cada mes en llamadas a LLM, así que tener la columna vertebral para depurar cuando las cosas se descontrolan ha ayudado mucho." - punkpeye, Hacker News, diciembre de 2024

Cómo es la realidad del flujo de trabajo de instrumentación y observabilidad

En la práctica, la integración de Langfuse comienza con una configuración única del SDK y la decisión de cuán profundamente instrumentar tu código. El camino más sencillo utiliza la autoinstrumentación con wrappers de OpenAI o LangChain, donde unos pocos decoradores a nivel de importación capturan cada llamada al LLM sin creación manual de spans. Para bucles de agentes personalizados o pipelines de múltiples pasos, instrumentas explícitamente: envuelves cada unidad de trabajo significativa en una traza o span, adjuntas entradas/salidas y dejas que el SDK maneje el procesamiento por lotes y la carga asíncrona.

Una vez que las trazas fluyen, el panel te ofrece desgloses de costes por modelo, latencia P50/P95/P99, tasas de error y vistas de sesión a nivel de usuario. La búsqueda es lo suficientemente rápida como para que depurar la queja de un usuario específico sea trabajo de un minuto: consultas por ID de sesión, abres la traza y recorres el árbol de ejecución.

La versión Langfuse Cloud se ejecuta en la misma arquitectura respaldada por ClickHouse introducida en la v3, manejando picos de tráfico sin que la presión de ingesta retroceda hacia la API. La arquitectura v3 escribe eventos en S3 inmediatamente al recibirlos, poniéndolos en cola antes de la inserción en la base de datos, lo que significa que una ralentización de la base de datos no descarta las trazas entrantes.

El equipo de Khanmigo de Khan Academy ilustra el flujo de trabajo en producción: tras desplegar Langfuse en abril de 2024 en más de 100 usuarios que abarcan 7 equipos de producto y 4 equipos de infraestructura, el personal de soporte utiliza las trazas de Langfuse como su primera herramienta de depuración cuando un estudiante informa de un problema. Walt Wells, Staff Software Engineer en Khan Academy, señaló el resultado directamente: "Langfuse ha permitido a nuestros desarrolladores obtener comentarios extremadamente rápidos". Khan Academy mantiene la resolución media de soporte por debajo de los 8 minutos extrayendo la traza de la sesión relevante en lugar de reconstruir el contexto a partir de los registros.

Para quién está diseñado Langfuse

Langfuse encaja mejor cuando se cumplen tres condiciones: el equipo está lanzando funciones de LLM a usuarios reales (no solo evaluando modelos en notebooks), alguien del equipo es responsable de la infraestructura de LLM, y la residencia de datos o las licencias de código abierto importan ya sea comercial o legalmente.

En la práctica, esto significa ingenieros de ML y equipos de plataformas de IA en empresas que construyen sobre LLMs en lugar de vender acceso a la API de LLM en sí. Langfuse es la opción correcta para equipos que utilizan frameworks mixtos (LlamaIndex para recuperación, Python personalizado para agentes, OpenAI para generación), porque el SDK agnóstico al framework cubre toda la pila sin configuración por framework. También es la opción correcta para industrias reguladas (salud, finanzas, educación) que no pueden enviar datos de producción a un SaaS de terceros sin opción de autoalojamiento.

La adquisición por parte de ClickHouse fortalece el caso empresarial: los informes de cumplimiento SOC2, ISO27001 e HIPAA están disponibles en el plan Pro, el equipo está respaldado por una empresa con profunda credibilidad en infraestructura, y el compromiso con el código abierto es más duradero ahora que forma parte de una organización bien financiada en lugar de una startup en fase semilla.

Lo que Langfuse no es

Langfuse no es una herramienta plug-and-play de cero esfuerzo para desarrolladores que quieren un panel de costes listo en 15 minutos. Si todo tu caso de uso es "cuánto estoy gastando en OpenAI", la configuración del proxy de Helicone te lleva allí más rápido. Langfuse justifica su inversión en integración cuando necesitas la imagen completa: árboles de ejecución anidados, versionado de prompts, evaluaciones y retroalimentación humana, no solo recuentos de tokens.

El autoalojamiento es gratuito pero no sencillo. Langfuse v3 requiere cinco servicios ejecutándose en coordinación: contenedor web, contenedor worker, ClickHouse, Redis/Valkey y almacenamiento de blobs compatible con S3. Los equipos sin infraestructura de ClickHouse existente se enfrentan a una carga operativa real. Estimaciones independientes sitúan el coste total de propiedad del autoalojamiento a mediana escala en $3,000-4,000/mes, incluyendo el tiempo de DevOps, en comparación con los $199-300/mes por un uso equivalente en Langfuse Cloud Pro. "Gratis" se aplica a la licencia, no a la infraestructura.

Langfuse tampoco ofrece caché semántica ni funciones de reducción de costes de la API de LLM. Si reducir el gasto en la API es el objetivo principal, ese es el territorio de Helicone.

Evita Langfuse si eres: un desarrollador en solitario que ejecuta un proyecto de fin de semana sin usuarios en producción, un equipo ya totalmente invertido en LangChain que quiere cobertura automática sin configuración, o una empresa que necesita rastreo nativo de OpenTelemetry para integrarse con una infraestructura de recolector OTel existente.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Langfuse.

Artículos relacionados

Guías y artículos relacionados con Langfuse.