Saltar al contenido principal
Vantaige
LlamaParse screenshot
LlamaParse logo

LlamaParse

Freemium

LlamaParse es la API en la nube de análisis de documentos de LlamaIndex para canalizaciones RAG. Convierte PDF, DOCX, PPTX y más de 130 formatos en markdown o JSON listos para LLM, con extracción de tablas, gráficos e imágenes. El nivel gratuito incluye 10,000 créditos al mes.

Funciones:API

LlamaParse es la API de análisis de documentos patentada de LlamaIndex, creada específicamente para convertir PDF y documentos comerciales complejos en texto limpio y estructurado que los modelos de lenguaje realmente puedan utilizar. Desarrollada por run-llama (cofundada por Jerry Liu y Simon Suo, San Francisco), se lanzó en versión preliminar pública el 20 de febrero de 2024, junto con la plataforma LlamaCloud, y alcanzó la disponibilidad general en marzo de 2025 tras recaudar una Serie A de $19M. El problema central que resuelve es la brecha entre cómo se ven los documentos y cómo los LLM necesitan los datos: los PDF sin procesar con tablas incrustadas, diseños de varias columnas, gráficos y notas al pie rompen habitualmente la extracción de texto simple, y LlamaParse aplica modelos de visión-lenguaje para preservar esa estructura en el resultado.

La API maneja más de 130 formatos de archivo, incluyendo PDF, DOCX, PPTX, XLSX, HTML e imágenes escaneadas. Ofrece resultados en markdown que respeta el diseño, texto sin formato, JSON con esquemas de extracción personalizados o texto espacial con datos de coordenadas. Cuatro niveles de análisis permiten a los equipos equilibrar el costo y la precisión: Fast (1 crédito/página para documentos de texto sin formato), Cost Effective (3 créditos/página para cargas de trabajo estándar), Agentic (10 créditos/página para diseños complejos) y Agentic Plus (45 créditos/página para máxima precisión usando GPT-4.1 o Gemini 2.5 Pro). Un nivel gratuito proporciona 10,000 créditos al mes, suficientes para analizar aproximadamente 3,300 páginas en el nivel Cost Effective o 1,000 páginas en el nivel Agentic sin gastar nada. Junto con su framework LlamaIndex, LlamaParse se conecta de forma natural a las pilas RAG creadas con herramientas como Pinecone, Weaviate y AnythingLLM.

Lo que LlamaParse realmente hace en mayo de 2026

LlamaParse V2, lanzado el 18 de diciembre de 2025, simplificó todo el sistema de configuración después de que la investigación de usuarios mostrara que la interfaz original, cargada de parámetros, suponía una carga para los equipos de ingeniería. El sistema de cuatro niveles reemplazó lo que había sido un laberinto de modos de análisis, selecciones de proveedores de LLM y docenas de opciones. Los equipos que ya han pasado a producción ahora pueden fijar su análisis al comportamiento del modelo de una fecha específica utilizando el formato YYYY-MM-DD, para que una actualización del modelo no cambie silenciosamente la estructura de salida a mitad de la canalización.

La actualización de mayo de 2025 añadió detección automática de orientación y sesgo: los documentos escaneados a 90, 180 o 270 grados se corrigen automáticamente, y también se manejan inclinaciones sutiles de página de entre 1 y 12 grados. Cada página analizada ahora incluye una puntuación de confianza de 0 a 1 que compara el recuento de caracteres y la superposición de palabras para páginas con mucho texto, o ejecuta un análisis OCR para aquellas con muchas imágenes. Los equipos pueden establecer un umbral de page_error_tolerance y definir si las páginas fallidas devuelven texto de respaldo sin procesar, un espacio en blanco o un mensaje de error.

Más allá del análisis, LlamaParse cubre una superficie de extracción cada vez más amplia. El producto Extract acepta un esquema JSON definido en lenguaje natural y lo completa automáticamente a partir del contenido del documento, reemplazando la entrada manual de datos. Classify y Split pueden enrutar documentos en categorías etiquetadas y segmentar PDF concatenados. Sheets maneja la ingesta de Excel y hojas de cálculo. Index proporciona una canalización de búsqueda vectorial alojada y gestionada a través del panel de LlamaCloud. Los seis productos comparten una única clave API y una cuenta de facturación.

El acceso se realiza a través del SDK de Python (pip install llama-cloud>=2.1), el SDK de TypeScript/Node, una API REST o directamente desde una interfaz de usuario web. La API también funciona como una habilidad de agente dentro de AnythingLLM, Claude Code y Cursor, por lo que los desarrolladores pueden activar el análisis de documentos desde dentro de sus bucles de agentes existentes sin un paso de integración separado. Para los equipos que ya usan LangChain o Firecrawl, la salida de LlamaParse se integra en las canalizaciones existentes sin necesidad de una capa de traducción de formato.

Dónde se sitúa LlamaParse frente a Reducto y Unstructured.io

Reducto y Unstructured.io son las dos alternativas más relevantes, y abordan el análisis de documentos desde ángulos completamente diferentes.

Reducto utiliza una arquitectura de corrección de múltiples pasadas: la visión por computadora segmenta el diseño, el OCR lee el texto, un modelo de visión-lenguaje añade interpretación contextual y, a continuación, un bucle patentado de Agentic OCR vuelve a examinar la salida del OCR específicamente para detectar y corregir errores. Ese paso de autocorrección es la diferencia mecánica clave. El propio RD-TableBench de Reducto afirma tener hasta un 20% más de precisión de análisis en documentos del mundo real con tablas complejas, combinadas o rotadas. Soporta más de 100 idiomas frente a la cobertura más reducida de LlamaParse, cuenta con certificación SOC 2 e HIPAA, y ofrece implementación local (on-premises) sin requerir un contrato empresarial. La contrapartida es el costo y la accesibilidad: Reducto no tiene un nivel gratuito público y está posicionado principalmente para equipos empresariales con requisitos de precisión críticos, como firmas de servicios financieros que analizan densas tablas 10-K.

Unstructured.io toma un camino arquitectónico completamente diferente. Su salida no es markdown listo para LLM por defecto; etiqueta los elementos del documento semánticamente (título, texto narrativo, tabla, imagen, etc.) para que los desarrolladores puedan escribir su propia lógica de fragmentación (chunking) basada en el tipo de elemento. La plataforma incluye más de 71 conectores preconstruidos que abarcan almacenamiento en la nube, bases de datos y almacenes vectoriales. Su implementación SaaS afirma tener un rendimiento de más de 15 millones de páginas por hora por flujo de trabajo, escalando a petabytes. Ofrece tanto un núcleo de código abierto que los equipos pueden autoalojar de forma gratuita como un SaaS empresarial con implementación en VPC. LlamaParse genera una salida que es inmediatamente consumible por un LLM con un posprocesamiento mínimo; Unstructured te da más control sobre la canalización a costa de más trabajo de ingeniería. Si tu canalización implica una lógica de preprocesamiento pesada o un enrutamiento mixto de tipos de documentos, Unstructured encaja mejor. Si deseas una salida lista para LLM con una configuración mínima, LlamaParse tiene la ventaja.

El benchmark ParseBench (publicado por run-llama en 2025) sitúa el modo Agentic de LlamaParse en un 84.9% de precisión general, lo que los autores describen como superior a todos los proveedores probados en su nivel de costo de aproximadamente 1.2 centavos por página. El benchmark evaluó cinco dimensiones de calidad de análisis, y Agentic fue el único modo que tuvo un rendimiento competitivo en las cinco. El modo Cost Effective se mantuvo a la par con Google Gemini a menos de 0.4 centavos por página. Estas son las propias cifras de LlamaIndex, por lo que deben considerarse como direccionalmente útiles en lugar de neutrales.

"El modo Agentic de LlamaParse supera a todos los demás proveedores en cualquier nivel de costo" - Análisis del benchmark ParseBench, GitHub de run-llama/ParseBench, 2025

Cómo es la realidad diaria de la API

Para la mayoría de los ingenieros de IA, el flujo de trabajo es sencillo: configurar una clave API, elegir un nivel, llamar al SDK. En el nivel Cost Effective, un PDF de 50 páginas se devuelve en aproximadamente 6 segundos. La salida es markdown con celdas de tabla preservadas, encabezados etiquetados e imágenes marcadas. Para los equipos que construyen RAG sobre documentos comerciales estándar (informes anuales, contratos, manuales de productos), esto cubre la mayoría de los casos de uso.

Donde el flujo de trabajo se vuelve más complicado es en los diseños complejos. Los documentos de varias columnas, típicos en artículos académicos e informes escaneados antiguos, siguen siendo un punto débil documentado. El texto de columnas adyacentes puede intercalarse en la salida, lo que rompe la recuperación posterior porque los fragmentos contienen partes de secciones no relacionadas de la página. El Issue #512 de GitHub (presentado en noviembre de 2024, cerrado sin una solución confirmada) documentó esto específicamente para encabezados de tabla de varios niveles: diferentes niveles de análisis produjeron diferentes soluciones parciales, pero ninguno capturó la estructura completa. Los usuarios informaron haber probado el modo Accurate, el modo Premium y el modo Continuous en el mismo documento y haber obtenido resultados incompletos diferentes de cada uno.

Las tablas que abarcan varias páginas aparecían históricamente como dos tablas separadas en la salida de LlamaParse, y los encabezados no se trasladaban de manera confiable a través del salto de página. La función Continuous Mode abordó esto, pero requiere un indicador de configuración explícito que muchos desarrolladores solo descubren después de encontrarse con el problema en producción.

También hay un problema de precisión numérica señalado por varios ingenieros: en ciertos documentos, LlamaParse parece calcular valores en lugar de aplicarles OCR literalmente, produciendo números incorrectos en tablas financieras. Los símbolos de moneda causan errores en algunos modos de análisis. Estos son casos extremos, pero importan significativamente para los equipos que construyen aplicaciones financieras o legales donde una cifra en dólares mal leída o un decimal mal colocado causa problemas posteriores.

"LlamaParse es excelente para hacer que las cosas parezcan tablas. ¿Pero los datos en su interior? Necesitan más limpieza." - BoringBot Substack, PDF Table Extraction Showdown, 2024

Para quién está creado LlamaParse

LlamaParse es la opción más práctica para los ingenieros de IA que ya están construyendo en el ecosistema de LlamaIndex. La integración nativa del SDK significa que no hay capa de adaptador, y los 10,000 créditos gratuitos al mes son genuinamente generosos para el desarrollo y las pruebas, cubriendo una carga de trabajo real antes de que el dinero cambie de manos.

Los equipos que analizan documentos comerciales estándar a escala moderada, donde es aceptable cierto posprocesamiento, encontrarán que el nivel Cost Effective es suficiente y el precio razonable a menos de medio centavo por página. Los equipos financieros en empresas como Carlyle o fondos de capital privado que analizan informes de ganancias y presentaciones para inversores con tablas complejas pero no patológicamente desordenadas reportan buenos resultados con el modo Agentic. La definición de esquema en lenguaje natural del producto Extract es genuinamente útil para reemplazar los flujos de trabajo de entrada manual de datos, particularmente para el procesamiento de facturas y la extracción de campos de contratos.

Las startups que evalúan la infraestructura de análisis de documentos se benefician del punto de entrada sin compromiso: el nivel gratuito no requiere tarjeta de crédito, y el plan Starter a $50/mes cubre 40,000 créditos, lo que equivale aproximadamente a 13,000 páginas Cost Effective o 4,000 páginas Agentic al mes. Para un equipo que lanza un primer producto, ese es un presupuesto real.

Los equipos empresariales con datos regulados deben preguntar específicamente sobre la opción de implementación en VPC antes de comprometerse. La opción local (on-premises) está disponible pero requiere un contrato empresarial. Los usuarios en el espacio de seguridad de datos de LLM que no pueden enrutar documentos a través de una API en la nube gestionada están estancados a menos que puedan negociar ese acuerdo.

Lo que LlamaParse no es

LlamaParse no es una buena opción para los equipos que necesitan la máxima precisión en tablas financieras o legales complejas con celdas combinadas, encabezados de varios niveles o diseños rotados. La canalización de OCR con autocorrección de Reducto obtiene resultados considerablemente mejores en esos casos, y la diferencia de precisión importa cuando la salida alimenta decisiones comerciales o presentaciones legales.

No es una herramienta de código abierto que se pueda autoalojar. Los equipos con políticas estrictas de residencia de datos, organizaciones gubernamentales o de atención médica, o cualquier equipo cuya revisión de seguridad bloquee la transmisión de documentos a través de una API en la nube necesitan el núcleo de código abierto de Unstructured o Docling, que se ejecuta localmente. La opción empresarial local de LlamaParse existe, pero a un precio que la descarta para equipos pequeños.

No está diseñado para canalizaciones de documentos a escala de petabytes donde la arquitectura de rendimiento importa más que la precisión por documento. El motor de orquestación de Unstructured, con procesamiento paralelo, reintentos automáticos y más de 15 millones de páginas por hora por flujo de trabajo, está construido para esa escala. La API en la nube de LlamaParse está optimizada para la calidad por documento, no para el rendimiento horizontal.

Para artículos académicos de varias columnas, documentos históricos escaneados con gran variación de diseño o conjuntos de documentos en varios idiomas (particularmente escrituras no latinas), las brechas de precisión documentadas hacen de LlamaParse una primera opción arriesgada. Ejecuta un conjunto de muestra a través del nivel gratuito antes de comprometer una canalización con él.

Los equipos que buscan complementar LlamaParse con una capa de rastreo de contenido web a menudo lo combinan con Firecrawl para la ingesta basada en URL y utilizan el framework LlamaIndex para unir toda la canalización.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con LlamaParse.