跳到主要内容
Vantaige
Reducto screenshot
Reducto logo

Reducto

付费

Reducto 是一款企业级文档解析 API,利用多通道视觉语言模型和 Agentic OCR 技术,将复杂的 PDF、财务表格和扫描文档转换为结构化的、可供 LLM 直接使用的数据。深受 Harvey、Scale AI 及财富 10 强企业的信赖。

使用场景:文档与知识管理
功能:API

Reducto 是一款专为 AI 工程团队打造的文档解析与提取 API,旨在从复杂的现实文档中获取结构化的、可供 LLM 直接使用的输出。该公司由麻省理工学院(MIT)培养的机器学习工程师 Adit Abraham 和 Raunak Chowdhuri 于 2023 年创立,从 Y Combinator 2024 年冬季班毕业后,已累计获得来自 Andreessen Horowitz、Benchmark 和 First Round Capital 的 $108M 融资。它解决的核心问题是 AI 管道中长期存在的瓶颈:金融、法律、医疗和保险领域的大多数文档都是 PDF 和电子表格,包含复杂的表格布局、多列文本、嵌入式图表和手写批注,标准的文本提取工具往往会将其破坏,从而导致下游模型出错。

Reducto 的 API 提供了四个主要端点。Parse 端点将文档转换为感知布局的结构化 JSON 块,并为每个元素提供边界框。Extract 端点执行基于模式的结构化数据提取,提供字段级置信度分数和来源引用。Split 端点处理多文档检测和表单分割。2025 年推出的 Edit 端点是业界首个无需预定义模板即可动态编辑 PDF 和 DOCX 文件的 API。支持所有这些功能的是 Reducto Studio,这是一个无代码管道构建器,无需直接集成 API 即可添加置信度评分、评估数据生成和管道性能可视化功能。该平台支持 100+ 种语言,能够处理合并单元格表格、图表、手写内容和复选框,并为受监管行业提供 SOC 2 Type II 认证、符合 HIPAA 标准的处理以及零保留配置。

Reducto 在 2026 年 4 月的实际表现

从本质上讲,Reducto 将每个文档页面视为图像而不是文本文件。大多数 PDF 解析库从 PDF 元数据中提取文本,这对于干净的、数字创建的 PDF 来说效果尚可,但在扫描文档、旋转页面、带水印的文件或任何具有复杂视觉结构的文档上就会失效。Reducto 的方法运行一个三阶段管道:首先,传统的计算机视觉分析文档的布局和空间结构;然后,视觉语言模型(VLM)实时审查并纠正初始的 OCR 输出,该公司将这一过程称为 Agentic OCR;最后,VLM 通道根据上下文解释内容区域,将列标题链接到数据单元格,将行标签链接到数值。

这种多通道架构专为单通道提取会悄无声息地丢失数据的情况而设计。正如 Reducto 首席执行官 Adit Abraham 在 2025 年 9 月接受 AI 工程师 Jason Liu 采访时所解释的那样:“使用最好的可用工具……结合传统 CV(用于处理 CV 擅长的任务)以及 VLM 和文档元数据。”其实际结果是,在那些会让其他解析器崩溃的表格上实现了可衡量的准确性:跨越多行多列的合并单元格复杂表格、单元格含义依赖于父标题层级的嵌套标题,以及跨页分割的表格。

2024 年 11 月,Reducto 开源了 RD-TableBench,这是一个包含 1,000 张复杂表格图像的基准测试,由博士级人类审查员进行标注,涵盖扫描表格、多语言内容、手写内容和多级标题结构。这一基准测试是一项深思熟虑的举措,旨在为供应商经常引用无法比较的内部指标的市场提供一个客观的准确性标准。在 RD-TableBench 上,Reducto 报告的平均表格相似度得分约为 0.90,而 AWS Textract 为 0.72,Google Cloud Document AI 为 0.81。

“尽管过去几年我们在 AI 领域看到了显著的进步,但文档处理仍然是一个关键瓶颈。Reducto 的存在就是为了解决这个问题。与传统的光学字符识别方法不同,后者……”——@a16z,X,2025 年 10 月 14 日

到 2025 年 10 月,Reducto 已处理了超过 10 亿页文档,在 4 月的 A 轮融资和 10 月的 B 轮融资公告期间,月处理量增长了 6 倍。知名客户包括 Harvey、Scale AI、Mercor、Rogo、一家财富 10 强企业以及一家全球排名前 5 的对冲基金。

Reducto 与 LlamaParse 及 Unstructured.io 的定位对比

这三个竞争对手在准确性与灵活性的权衡中占据了不同的位置。Reducto 是高准确性、具有主见(opinionated)的 API 选项。LlamaParse 面向已经在使用 LlamaIndex 生态系统的团队。而 Unstructured.io 则立足于开源、ETL 管道的一端。

Reducto vs. LlamaParse:LlamaParse 是 LlamaCloud 内部的解析服务,主要为已经使用 LlamaIndex 进行 RAG 管道编排的团队设计。它支持 90+ 种文件格式,返回多种输出格式(文本、Markdown、JSON、XLSX),并已处理了 500M+ 份文档。LlamaParse 在机制上的不同之处在于它处理复杂表格的方式:它提供可选模式(标准、LLM、agentic、agentic plus),每种模式每页的积分成本不同。开发人员根据预期的文档复杂性手动选择模式。Reducto 的 Agentic OCR 自动运行并根据区域进行自适应,这消除了配置负担,但在处理复杂文档时会产生更高的单页成本。LlamaParse 的模式提取已被弃用并移至单独的 LlamaExtract 服务,而 Reducto 的 Extract 端点是集成的,并为每个提取的字段生成带有边界框的字段级置信度分数。对于简单的研究级文档或原型设计,LlamaParse 更便宜且足够用。但对于财务文件和法律合同,如果误读一个单元格就会破坏下游计算,那么 Reducto 的多通道准确性绝对物超所值。

Reducto vs. Unstructured.io:Unstructured 本质上是一个开源 ETL 库,并在其之上构建了企业级 SaaS 层。其开源 Python 包采用 MIT 许可证,支持自托管,利用特定格式的知识在分块之前将文档划分为语义单元。Unstructured 的分块策略(按页、按相似度、语义)比 Reducto 的默认设置更具可配置性,其连接器生态系统(Databricks、Elasticsearch、S3、Google Drive、Snowflake)也更广泛,适合跨多个存储系统构建数据管道的团队。架构上的权衡在于,Unstructured 在复杂表格(尤其是财务文档中带有合并单元格和嵌套标题的表格)上的准确性不及 Reducto 的多通道 VLM 纠正。Unstructured 报告的调整后 CCT(连贯内容传输)得分为 0.917,且幻觉标记率较低,这与 RD-TableBench 的表格相似度得分衡量的是不同的指标。优先考虑零供应商依赖、开源可审计性或现有 ETL 基础设施集成的团队应评估 Unstructured。而优先考虑杂乱现实文档中表格提取准确性的团队则应基准测试 Reducto。

“我们已经花了足够多的时间去探索那些没有引起共鸣的事情。相比之下,这个新想法就像是迎面给了我们一拳,让我们瞬间清醒。”——Adit Abraham,Reducto 首席执行官,First Round Capital 采访,2025 年

AWS Textract 和 Google Cloud Document AI 也在这一领域展开竞争,特别是针对现有 AWS 或 GCP 基础设施中的团队。Reducto 的对比页面显示,在复杂表格基准测试中,其准确率比两者高出 20%+,尽管这两家云提供商为已经处于其生态系统中的团队提供了更紧密的基础设施集成和更简单的合规路径。对于在超大规模云服务商生态系统之外构建专用管道的 AI 原生团队来说,Reducto 和 Firecrawl(用于网络来源文档)往往是首选的摄取组合。

API 工作流的实际情况

Reducto 的 API 基于积分计费,在 Standard 即用即付层级中,每积分收费 $0.015。标准页面解析每页消耗 1 个积分,即 $0.015/页。启用 Agentic OCR 的复杂页面消耗 2 个积分,实际费率为 $0.03/页。其他操作会叠加计费:Agentic Extraction 根据页面复杂程度每页消耗 2-4 个积分,Split 每页消耗 2 个积分,Edit(测试版)每页消耗 4 个积分。一个每月处理 100,000 页且适度使用 VLM 的团队,在享受 Growth 层级批量折扣之前,每月的预算应在 $2,000-$4,000 左右。

Standard 层级包含 15,000 个免费积分,根据复杂程度,大约相当于 7,500-15,000 页。这足以覆盖开发、测试和早期生产阶段,且无需绑定信用卡。异步端点(/parse_async、/extract_async)会立即返回一个 job_id 并使用 webhook 回调,从而绕过同步端点 200 个并发请求的限制。对于大批量处理,这是推荐的模式。

Reducto Studio 是一个无代码管道构建器,为希望在不编写代码的情况下配置和测试管道的团队增加了一个可视化层。它包括提取字段的置信度评分、从真实文档自动生成的评估数据以及管道性能可视化。Standard 层级最多包含 5 个 Studio 席位。在 Studio 发布之初,用户曾反馈由于 WebGPU 兼容性问题导致在 iPhone Safari 和 Chrome 上崩溃;CTO 迅速确认了这些问题,产品现已成熟,但它仍然比核心 API 要新。

Enterprise 和 Growth 层级增加了 VPC 部署、本地部署选项、物理隔离配置、SSO/SAML、数据驻留控制和专属 SLA。Enterprise 层级提供 SOC 2 Type II 和 HIPAA BAA 覆盖。值得注意的欧盟相关信息:所有层级均提供标准数据处理协议(DPA);自定义修订的 DPA 需要 Enterprise 层级。这在 Studio 发布时曾引起混淆(欧盟开发人员以为 DPA 仅限 Enterprise 层级),但默认的 DPA 在 Standard 层级就涵盖了标准的 GDPR 要求。对于在 Pinecone 或其他向量数据库上进行构建的团队,Reducto 带有边界框的结构化 JSON 输出可以清晰地映射到混合搜索所需的元数据模式。

Reducto 为谁而建

Reducto 的客户群集中在四个垂直领域,在这些领域,文档质量直接影响收入或合规性。金融服务团队(对冲基金、银行、投资平台)将其用于收益报告、10-K 文件和财务报表,在这些文件中,表格单元格错位可能会破坏量化模型。像 Harvey 这样的法律 AI 平台将其用于合同、案件卷宗和监管提交文件,在这些场景中,字段级引用来源是一项硬性要求。处理事先授权表单和临床文档的医疗保健团队需要复选框检测的可靠性和符合 HIPAA 标准的处理,而通用 VLM 无法始终如一地提供这些。处理异构文档批次(表单、传真、手写提交)的保险和合规团队则受益于其多语言支持以及 Agentic OCR 对旋转或带水印页面的容错能力。

对于 RAG 管道,Reducto 与 AnythingLLM 或 LlamaIndex 配合得很好:每个输出块上的边界框来源可实现准确的文档引用,而 Extract 端点的置信度分数让团队能够在低置信度提取结果到达向量索引之前将其过滤掉,从而降低下游的幻觉率。

当初始的 PDF 解析(PyMuPDF、pdfplumber 或简单的文本提取)在包含复杂表格或扫描页面的 20% 文档语料库上崩溃时,从原型扩展到生产环境的 AI 工程团队通常会采用 Reducto。公开的 RD-TableBench 基准测试让团队在向供应商做出承诺之前,能够在具有代表性的样本上验证准确性。

Reducto 不是什么

Reducto 是一个摄取 API,而不是端到端的文档工作流平台。它不包括文档分类(将发票、合同、表单路由到不同的管道)、人在回路(human-in-the-loop)审查界面、针对特定文档模式的模型微调,或与 Salesforce 或 SAP 等下游系统的原生集成。团队需要单独构建或购买这些层。像 Extend 或 Nanonets 这样的竞争对手将自己定位为更完整的工作流解决方案;Reducto 的反驳是,一个能与任何下游系统集成的同类最佳摄取层,要优于在准确性上做出妥协的垂直集成平台。

在以下情况下请跳过 Reducto:文档是简单的纯文本 PDF,没有表格或复杂布局(LlamaParse 的高性价比模式便宜 5 倍且足够用);团队已经深入 LlamaIndex/LlamaCloud 生态系统并希望使用单一供应商;零供应商依赖的开源自托管是硬性要求(Unstructured.io);或者用例是网页抓取而不是文档解析(Firecrawl 是适合该任务的工具)。尝试文档 AI 的极早期团队应在建立计费关系之前,先从 Reducto 的 15K 免费积分开始,因为如果前期没有充分了解页面复杂性或操作选择,积分模型可能会产生意想不到的成本。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Reducto 相关的指南和文章。