

LlamaParse 是 LlamaIndex 专为 RAG 流水线打造的云端文档解析 API。它能将 PDF、DOCX、PPTX 等 130 多种格式转换为 LLM 可直接使用的 Markdown 或 JSON 格式,并支持提取表格、图表和图像。免费版每月包含 10,000 个积分。
LlamaParse 是 LlamaIndex 专有的文档解析 API,专为将 PDF 和复杂的商业文档转换为语言模型能够实际使用的干净、结构化文本而构建。它由 run-llama(由 Jerry Liu 和 Simon Suo 在旧金山联合创立)开发,于 2024 年 2 月 20 日与 LlamaCloud 平台一同推出公开预览版,并在完成 1900 万美元 A 轮融资后,于 2025 年 3 月全面上市。它解决的核心问题是文档视觉呈现与 LLM 数据需求之间的鸿沟:带有内嵌表格、多栏排版、图表和脚注的原始 PDF 通常会让简单的文本提取工具失效,而 LlamaParse 则应用视觉语言模型在输出中完美保留了这些结构。
该 API 支持 130 多种文件格式,包括 PDF、DOCX、PPTX、XLSX、HTML 和扫描图像。它能输出感知排版的 Markdown、纯文本、带有自定义提取 Schema 的 JSON,或带有坐标数据的空间文本。四种解析层级让团队可以在成本与准确率之间进行权衡:Fast(纯文本文档 1 积分/页)、Cost Effective(标准工作负载 3 积分/页)、Agentic(复杂排版 10 积分/页)以及 Agentic Plus(使用 GPT-4.1 或 Gemini 2.5 Pro 实现最高准确率,45 积分/页)。免费版每月提供 10,000 个积分,足以在零花费的情况下,使用 Cost Effective 层级解析约 3,300 页,或使用 Agentic 层级解析 1,000 页。除了其 LlamaIndex 框架,LlamaParse 还能自然地接入基于 Pinecone、Weaviate 和 AnythingLLM 等工具构建的 RAG 技术栈。
LlamaParse 在 2026 年 5 月的实际表现
2025 年 12 月 18 日发布的 LlamaParse V2 简化了整个配置系统,因为用户研究表明,最初参数繁多的界面给工程团队带来了负担。四层级系统取代了过去由解析模式、LLM 提供商选择和数十个可选开关组成的迷宫。已经发布到生产环境的团队现在可以使用 YYYY-MM-DD 格式将其解析行为固定在特定日期的模型状态,从而避免模型更新在流水线中途悄无声息地改变输出结构。
2025 年 5 月的更新增加了自动方向和倾斜检测功能:以 90、180 或 270 度扫描的文档会被自动纠正,1 到 12 度之间的轻微页面倾斜也能得到处理。现在,每个解析后的页面都带有一个 0 到 1 的置信度分数,该分数通过比较文本密集型页面的字符数和单词重叠度,或对图像密集型页面运行 OCR 分析得出。团队可以设置 page_error_tolerance 阈值,并定义失败的页面是返回原始的后备文本、空白页还是错误消息。
除了解析之外,LlamaParse 还涵盖了越来越广泛的提取面。Extract 产品接受以自然语言定义的 JSON Schema,并自动从文档内容中填充数据,从而取代手动数据录入。Classify 和 Split 可以将文档路由到标记的类别中,并对拼接的 PDF 进行分割。Sheets 负责处理 Excel 和电子表格的摄取。Index 提供了一个通过 LlamaCloud 仪表板管理的托管向量搜索流水线。所有六款产品共享一个 API 密钥和一个计费账户。
可以通过 Python SDK(pip install llama-cloud>=2.1)、TypeScript/Node SDK、REST API 或直接从 Web UI 进行访问。该 API 还可以作为 AnythingLLM、Claude Code 和 Cursor 中的 Agent 技能运行,因此开发人员可以从其现有的 Agent 循环内部触发文档解析,而无需单独的集成步骤。对于已经在使用 LangChain 或 Firecrawl 的团队,LlamaParse 的输出可以直接放入现有的流水线中,无需格式转换层。
LlamaParse 与 Reducto 和 Unstructured.io 的定位对比
Reducto 和 Unstructured.io 是两个最相关的替代方案,它们从完全不同的角度处理文档解析。
Reducto 使用多遍校正架构:计算机视觉分割排版,OCR 读取文本,视觉语言模型添加上下文解释,然后专有的 Agentic OCR 循环专门重新检查 OCR 输出以捕获并修复错误。这种自我校正步骤是关键的机制差异。Reducto 自己的 RD-TableBench 声称,在处理具有复杂、合并或旋转表格的真实文档时,解析准确率最高可提升 20%。与 LlamaParse 较窄的覆盖范围相比,它支持 100 多种语言,拥有 SOC 2 和 HIPAA 认证,并提供无需企业合同的本地部署。代价是成本和可访问性:Reducto 没有公开的免费版,主要定位于对准确率有极高要求的企业团队,例如解析密集 10-K 表格的金融服务公司。
Unstructured.io 走的是完全不同的架构路线。它的默认输出不是 LLM 可直接使用的 Markdown;它对文档元素进行语义标记(title、narrative_text、table、image 等),以便开发人员可以根据元素类型编写自己的分块逻辑。该平台附带 71 个以上的预构建连接器,涵盖云存储、数据库和向量存储。其 SaaS 部署声称每个工作流的吞吐量超过每小时 1500 万页,可扩展至 PB 级。它既提供团队可以免费自托管的开源核心,也提供支持 VPC 内部署的企业级 SaaS。LlamaParse 生成的输出只需极少的后处理即可立即被 LLM 消费;Unstructured 则让你对流水线有更多的控制权,代价是需要更多的工程工作。如果你的流水线涉及繁重的预处理逻辑或混合文档类型路由,Unstructured 更合适。如果你想要配置极简且 LLM 可直接使用的输出,LlamaParse 则占据优势。
ParseBench 基准测试(由 run-llama 于 2025 年发布)显示 LlamaParse Agentic 模式的整体准确率为 84.9%,作者称其在每页约 1.2 美分的成本水平上优于所有测试的提供商。该基准测试评估了解析质量的五个维度,而 Agentic 是唯一在所有五个维度上都表现出竞争力的模式。Cost Effective 模式以每页不到 0.4 美分的成本与 Google Gemini 保持同步。这些是 LlamaIndex 自己的数据,因此请将其视为具有方向性参考价值,而非绝对中立。
“LlamaParse Agentic 模式在任何成本水平上都优于所有其他提供商” - ParseBench 基准测试分析,run-llama/ParseBench GitHub,2025 年
日常 API 使用的真实体验
对于大多数 AI 工程师来说,工作流非常简单:设置 API 密钥,选择层级,调用 SDK。在 Cost Effective 层级下,一份 50 页的 PDF 大约在 6 秒内就能返回结果。输出为 Markdown 格式,保留了表格单元格,标记了标题,并标注了图像。对于基于标准商业文档(年度报告、合同、产品手册)构建 RAG 的团队来说,这涵盖了绝大多数用例。
工作流在处理复杂排版时会变得棘手。多栏文档(常见于学术论文和较旧的扫描报告)仍然是一个已被记录的痛点。相邻栏的文本可能会在输出中交错,这会破坏下游检索,因为分块中包含了来自页面不相关部分的片段。GitHub Issue #512(2024 年 11 月提交,在未确认修复的情况下关闭)专门记录了多级表头的问题:不同的解析层级产生了不同的部分解决方案,但没有一个能捕获完整的结构。用户报告称,在同一文档上尝试了 Accurate 模式、Premium 模式和 Continuous 模式,每次都得到了不同的不完整结果。
跨越多页的表格过去在 LlamaParse 输出中会显示为两个独立的表格,且表头无法可靠地跨页保留。Continuous Mode 功能解决了这个问题,但它需要一个显式的配置标志,许多开发人员只有在生产环境中遇到问题后才发现这一点。
多位工程师还指出了一个数字准确性问题:在某些文档上,LlamaParse 似乎在计算数值,而不是按字面进行 OCR,从而在财务表格中生成了错误的数字。货币符号在某些解析模式下会导致错误。这些虽然是边缘情况,但对于构建财务或法律应用程序的团队来说却至关重要,因为误读的美元数字或放错位置的小数点会导致下游出现严重问题。
“LlamaParse 在让内容看起来像表格方面非常出色。但里面的数据呢?需要更多的清理。” - BoringBot Substack,PDF 表格提取对决,2024 年
LlamaParse 适合哪些用户
对于已经在 LlamaIndex 生态系统上进行构建的 AI 工程师来说,LlamaParse 是最实用的选择。原生 SDK 集成意味着无需适配层,而且每月免费的 10,000 个积分对于开发和测试来说确实非常慷慨,在产生任何费用之前就能覆盖实际的工作负载。
对于以中等规模解析标准商业文档且可以接受一定后处理的团队来说,Cost Effective 层级已经足够,而且每页不到半美分的定价也很合理。像 Carlyle 这样的公司或私募股权基金的财务团队,在解析包含复杂但并非杂乱无章的表格的财报和投资者演示文稿时,报告称使用 Agentic 模式取得了良好的效果。Extract 产品的自然语言 Schema 定义对于取代手动数据录入工作流非常有用,特别是在发票处理和合同字段提取方面。
评估文档解析基础设施的初创公司可以从无承诺的入门门槛中受益:免费版不需要信用卡,而每月 50 美元的 Starter 计划包含 40,000 个积分,大约相当于每月 13,000 页 Cost Effective 或 4,000 页 Agentic 解析量。对于发布首款产品的团队来说,这是一笔实实在在的预算。
拥有受监管数据的企业团队在做出承诺之前,应专门询问 VPC 部署选项。本地部署是可行的,但需要企业合同。LLM 数据安全领域的用户如果无法通过托管云 API 路由文档,除非能够协商达成该安排,否则将陷入困境。
LlamaParse 不适合哪些场景
对于需要在具有合并单元格、多级表头或旋转排版的复杂财务或法律表格上获得最高准确率的团队来说,LlamaParse 并不是一个好选择。Reducto 的自校正 OCR 流水线在这些情况下的基准测试表现明显更好,当输出用于支持交易决策或法律文件时,这种准确率差异至关重要。
它不是一个可自托管的开源工具。具有严格数据驻留政策的团队、政府或医疗保健组织,或任何安全审查阻止云 API 文档传输的团队,需要 Unstructured 的开源核心或在本地运行的 Docling。LlamaParse 的企业本地部署选项确实存在,但其价格点将小型团队排除在外。
它不是为 PB 级文档流水线设计的,在这些流水线中,吞吐量架构比单文档准确率更重要。Unstructured 的编排引擎具有并行处理、自动重试和每个工作流每小时 1500 万页以上的处理能力,专为这种规模而构建。LlamaParse 的云 API 针对单文档质量进行了优化,而不是横向吞吐量。
对于多栏学术论文、排版变化极大的扫描历史文档或混合语言文档集(特别是基于非拉丁字母的文字),已记录的准确率差距使得 LlamaParse 成为一个有风险的首选。在将流水线托付给它之前,请先通过免费版运行一个样本集进行测试。
希望用 Web 内容抓取层来补充 LlamaParse 的团队,通常会将其与 Firecrawl 搭配使用以进行基于 URL 的摄取,并使用 LlamaIndex 框架将整个流水线拼接在一起。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 LlamaParse 相关的指南和文章。

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

How to Automate Invoice and Document Processing With AI (End-to-End Build)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

RFP and Proposal Auto-Fill: The Agent That Handles 80% of the Repeating Questions (2026)
