تخطَّ إلى المحتوى الرئيسي
Vantaige
Reducto screenshot
Reducto logo

Reducto

مدفوع

Reducto هي واجهة برمجة تطبيقات (API) لتحليل مستندات المؤسسات، تستخدم نماذج الرؤية واللغة متعددة المراحل وتقنية Agentic OCR لتحويل ملفات PDF المعقدة والجداول المالية والمستندات الممسوحة ضوئياً إلى بيانات منظمة وجاهزة لنماذج اللغات الكبيرة (LLM). تحظى بثقة Harvey و Scale AI وشركات Fortune 10.

الميزات:API

Reducto هي واجهة برمجة تطبيقات (API) لتحليل واستخراج المستندات، صُممت خصيصاً لفرق هندسة الذكاء الاصطناعي التي تحتاج إلى مخرجات منظمة وجاهزة لنماذج اللغات الكبيرة (LLM) من مستندات واقعية معقدة. تأسست الشركة في عام 2023 على يد Adit Abraham و Raunak Chowdhuri، وكلاهما مهندسا تعلم آلي تدربا في معهد ماساتشوستس للتكنولوجيا (MIT)، وتخرجت الشركة من دفعة شتاء 2024 التابعة لـ Y Combinator، وجمعت منذ ذلك الحين تمويلاً إجمالياً قدره $108M من Andreessen Horowitz و Benchmark و First Round Capital. المشكلة الأساسية التي تحلها هي عنق الزجاجة المستمر في مسارات عمل الذكاء الاصطناعي: فمعظم المستندات في قطاعات التمويل والقانون والرعاية الصحية والتأمين عبارة عن ملفات PDF وجداول بيانات ذات تخطيطات جداول معقدة، ونصوص متعددة الأعمدة، ومخططات مضمنة، وشروح مكتوبة بخط اليد، والتي غالباً ما تتشوه عند استخدام أدوات استخراج النصوص القياسية، مما يتسبب في أخطاء في النماذج اللاحقة.

توفر واجهة برمجة تطبيقات Reducto أربع نقاط نهاية (endpoints) رئيسية. تقوم نقطة النهاية Parse بتحويل المستندات إلى كتل JSON منظمة ومدركة للتخطيط مع مربعات إحاطة (bounding boxes) على كل عنصر. وتنفذ نقطة النهاية Extract استخراجاً للبيانات المنظمة استناداً إلى المخطط (schema) مع درجات ثقة على مستوى الحقل واقتباسات المصدر. وتتولى نقطة النهاية Split اكتشاف المستندات المتعددة وتقسيم النماذج. أما نقطة النهاية Edit، التي أُطلقت في عام 2025، فهي أول واجهة برمجة تطبيقات في الصناعة لتحرير ملفات PDF و DOCX ديناميكياً دون قوالب محددة مسبقاً. ويدعم كل ذلك Reducto Studio، وهو منشئ مسارات عمل بدون تعليمات برمجية يضيف تسجيل درجات الثقة، وإنشاء بيانات التقييم، ورؤية واضحة لأداء مسار العمل دون الحاجة إلى تكامل مباشر مع واجهة برمجة التطبيقات. تدعم المنصة أكثر من 100 لغة، وتتعامل مع الجداول ذات الخلايا المدمجة، والمخططات، والكتابة اليدوية، ومربعات الاختيار، وتقدم معالجة متوافقة مع SOC 2 Type II ومؤهلة لـ HIPAA مع تكوينات عدم الاحتفاظ بالبيانات (zero-retention) للصناعات الخاضعة للتنظيم.

ما الذي تفعله Reducto فعلياً في أبريل 2026

في جوهرها، تتعامل Reducto مع كل صفحة مستند كصورة بدلاً من ملف نصي. تستخرج معظم مكتبات تحليل PDF النص من البيانات الوصفية لملف PDF، وهو ما يعمل بشكل مناسب مع ملفات PDF النظيفة والمنشأة رقمياً ولكنه يفشل مع المستندات الممسوحة ضوئياً، أو الصفحات المستديرة، أو الملفات ذات العلامات المائية، أو أي مستند ذي بنية بصرية معقدة. يُشغل نهج Reducto مسار عمل من ثلاث مراحل: أولاً، تحلل الرؤية الحاسوبية التقليدية تخطيط المستند وبنيته المكانية؛ ثم تقوم نماذج الرؤية واللغة (VLMs) بمراجعة وتصحيح مخرجات التعرف الضوئي على الحروف (OCR) الأولية في الوقت الفعلي، وهي عملية تطلق عليها الشركة اسم Agentic OCR؛ وأخيراً، تقوم تمريرة VLM النهائية بتفسير مناطق المحتوى سياقياً، وربط رؤوس الأعمدة بخلايا البيانات وتسميات الصفوف بالقيم.

صُممت هذه البنية متعددة المراحل خصيصاً للحالات التي يؤدي فيها الاستخراج أحادي المرحلة إلى إسقاط البيانات بصمت. وكما أوضح Adit Abraham، الرئيس التنفيذي لشركة Reducto، في مقابلة أجريت في سبتمبر 2025 مع مهندس الذكاء الاصطناعي Jason Liu: "استخدم أفضل الأدوات المتاحة.. مزيج من الرؤية الحاسوبية (CV) التقليدية للأشياء التي تتعامل معها بشكل جيد، وأيضاً نماذج الرؤية واللغة (VLMs) والبيانات الوصفية للمستندات." النتيجة العملية هي دقة قابلة للقياس على الجداول التي تُعطل أدوات التحليل الأخرى: الجداول المعقدة ذات الخلايا المدمجة التي تمتد عبر صفوف وأعمدة متعددة، والرؤوس المتداخلة حيث يعتمد معنى الخلية على تسلسل هرمي للرؤوس الأصلية، والجداول المقسمة عبر حدود الصفحات.

في نوفمبر 2024، جعلت Reducto معيار RD-TableBench مفتوح المصدر، وهو معيار قياسي يضم 1,000 صورة لجداول معقدة تم التعليق عليها من قبل مراجعين بشريين بمستوى دكتوراه، ويغطي الجداول الممسوحة ضوئياً، والمحتوى متعدد اللغات، والكتابة اليدوية، وهياكل الرؤوس متعددة المستويات. كان هذا المعيار خطوة مدروسة لتوفير معيار دقة موضوعي في سوق يعتاد فيه الموردون على الاستشهاد بمقاييس داخلية غير قابلة للمقارنة. على RD-TableBench، تُبلغ Reducto عن متوسط درجة تشابه جداول يبلغ حوالي 0.90، مقارنة بـ AWS Textract عند 0.72 و Google Cloud Document AI عند 0.81.

"على الرغم من التقدم الملحوظ الذي شهدناه في الذكاء الاصطناعي على مدى السنوات القليلة الماضية، تظل معالجة المستندات عنق زجاجة حرجاً. وُجدت Reducto لإصلاح ذلك. على عكس طرق التعرف الضوئي على الحروف التقليدية، والتي.." -- @a16z، X، 14 أكتوبر 2025

بحلول أكتوبر 2025، كانت Reducto قد عالجت أكثر من مليار صفحة، مع نمو الحجم الشهري بمقدار 6 أضعاف بين إعلانات جولة التمويل Series A في أبريل و Series B في أكتوبر. يشمل العملاء البارزون Harvey و Scale AI و Mercor و Rogo وشركة من قائمة Fortune 10، وواحد من أفضل 5 صناديق تحوط عالمية.

موقع Reducto مقارنة بـ LlamaParse و Unstructured.io

يحتل ثلاثة منافسين مواقع مختلفة على طيف الدقة مقابل المرونة. تُعد Reducto الخيار عالي الدقة لواجهة برمجة التطبيقات (API) الموجهة. تستهدف LlamaParse الفرق التي تستخدم بالفعل نظام LlamaIndex البيئي. بينما ترتكز Unstructured.io على الجانب مفتوح المصدر ومسارات عمل ETL.

Reducto مقابل LlamaParse: LlamaParse هي خدمة التحليل داخل LlamaCloud، وهي مصممة بشكل أساسي للفرق التي تستخدم بالفعل LlamaIndex لتنسيق مسارات عمل RAG. تدعم أكثر من 90 تنسيقاً للملفات، وتُرجع تنسيقات مخرجات متعددة (نص، Markdown، JSON، XLSX)، وقد عالجت أكثر من 500 مليون مستند. يكمن الاختلاف الميكانيكي لـ LlamaParse في كيفية تعاملها مع الجداول المعقدة: فهي توفر أوضاعاً قابلة للتحديد (قياسي، LLM، agentic، agentic plus)، ولكل منها تكاليف أرصدة مختلفة لكل صفحة. يختار المطورون الوضع يدوياً بناءً على تعقيد المستند المتوقع. تعمل تقنية Agentic OCR من Reducto تلقائياً وتتكيف مع كل منطقة، مما يزيل عبء التكوين هذا ولكنه ينتج تكاليف أعلى لكل صفحة في النهاية المعقدة. تم إيقاف استخراج المخطط (schema) في LlamaParse ونقله إلى خدمة LlamaExtract منفصلة، بينما تم دمج نقطة النهاية Extract في Reducto وتنتج درجات ثقة على مستوى الحقل مع مربعات إحاطة لكل حقل مستخرج. بالنسبة للمستندات البسيطة على مستوى البحث أو النماذج الأولية، تُعد LlamaParse أرخص وكافية. أما بالنسبة للإيداعات المالية والعقود القانونية حيث تؤدي الخلية المقروءة بشكل خاطئ إلى إفساد عملية حسابية لاحقة، فإن دقة Reducto متعددة المراحل تستحق فرق التكلفة.

Reducto مقابل Unstructured.io: Unstructured هي في الأساس مكتبة ETL مفتوحة المصدر مع طبقة SaaS للمؤسسات فوقها. حزمة Python مفتوحة المصدر مرخصة بموجب MIT وقابلة للاستضافة الذاتية، وتستخدم المعرفة الخاصة بالتنسيق لتقسيم المستندات إلى وحدات دلالية قبل التقطيع (chunking). استراتيجيات التقطيع في Unstructured (حسب الصفحة، حسب التشابه، دلالية) قابلة للتكوين بشكل أكبر من الإعدادات الافتراضية لـ Reducto، ونظام الموصلات البيئي الخاص بها (Databricks، Elasticsearch، S3، Google Drive، Snowflake) أوسع للفرق التي تبني مسارات بيانات عبر أنظمة تخزين متعددة. المقايضة المعمارية هي أن دقة Unstructured على الجداول المعقدة، وخاصة تلك ذات الخلايا المدمجة والرؤوس المتداخلة في المستندات المالية، لا تضاهي تصحيح VLM متعدد المراحل من Reducto. تُبلغ Unstructured عن درجة CCT (نقل المحتوى المتماسك) معدلة تبلغ 0.917 مع معدل منخفض لرموز الهلوسة، والذي يقيس أشياء مختلفة عن درجة تشابه الجداول في RD-TableBench. يجب على الفرق التي تعطي الأولوية لعدم الاعتماد على الموردين، أو قابلية التدقيق مفتوحة المصدر، أو تكامل البنية التحتية الحالية لـ ETL تقييم Unstructured. بينما يجب على الفرق التي تعطي الأولوية لدقة استخراج الجداول من المستندات الواقعية الفوضوية أن تختبر Reducto.

"لقد أمضينا وقتاً كافياً في استكشاف أشياء لم تكن تلقى صدى. بالمقارنة، شعرنا وكأننا تلقينا لكمة في الوجه بهذه الفكرة الجديدة." -- Adit Abraham، الرئيس التنفيذي لشركة Reducto، مقابلة First Round Capital، 2025

تتنافس AWS Textract و Google Cloud Document AI أيضاً في هذا المجال، خاصة للفرق التي تعمل ضمن البنية التحتية الحالية لـ AWS أو GCP. تُظهر صفحات المقارنة الخاصة بـ Reducto مزايا دقة تزيد عن 20%+ على كليهما في معايير الجداول المعقدة، على الرغم من أن كلا مزودي الخدمات السحابية يقدمان تكاملاً أوثق مع البنية التحتية ومسارات امتثال أبسط للفرق الموجودة بالفعل داخل تلك الأنظمة البيئية. بالنسبة لفرق الذكاء الاصطناعي الأصلية التي تبني مسارات عمل مخصصة خارج الأنظمة البيئية لمزودي الخدمات السحابية الكبرى (hyperscalers)، تميل Reducto و Firecrawl (للمستندات المستمدة من الويب) إلى أن تكونا زوج الاستيعاب المفضل.

كيف يبدو واقع سير عمل واجهة برمجة التطبيقات (API)

تعتمد واجهة برمجة تطبيقات Reducto على نظام الأرصدة، وتُفوتر بسعر $0.015 لكل رصيد في فئة Standard للدفع حسب الاستخدام. يكلف تحليل الصفحة القياسية رصيداً واحداً لكل صفحة، أي $0.015/صفحة. وتكلف الصفحات المعقدة مع تمكين Agentic OCR رصيدين، مما يجعل المعدل الفعلي $0.03/صفحة. تتراكم العمليات الإضافية: يستهلك Agentic Extraction من 2 إلى 4 أرصدة لكل صفحة اعتماداً على تعقيد الصفحة، ويكلف Split رصيدين لكل صفحة، ويكلف Edit (تجريبي) 4 أرصدة لكل صفحة. يجب على الفريق الذي يعالج 100,000 صفحة شهرياً مع استخدام معتدل لـ VLM أن يخصص ميزانية تتراوح تقريباً بين $2,000 و $4,000 شهرياً قبل تطبيق خصومات الحجم لفئة Growth.

تتضمن فئة Standard 15,000 رصيد مجاني، وهو ما يعادل تقريباً 7,500 إلى 15,000 صفحة اعتماداً على التعقيد. يغطي هذا التطوير والاختبار والإنتاج المبكر بدون بطاقة ائتمان. تُرجع نقاط النهاية غير المتزامنة (/parse_async، /extract_async) استجابة فورية مع job_id وتستخدم عمليات الاستدعاء (webhook callbacks)، متجاوزة حد 200 طلب متزامن على نقاط النهاية المتزامنة. بالنسبة لمعالجة الدفعات ذات الحجم الكبير، يُعد هذا هو النمط الموصى به.

يضيف Reducto Studio، وهو منشئ مسارات العمل بدون تعليمات برمجية، طبقة مرئية للفرق التي ترغب في تكوين واختبار مسارات العمل دون كتابة تعليمات برمجية. ويتضمن تسجيل درجات الثقة على الحقول المستخرجة، وبيانات التقييم التي يتم إنشاؤها تلقائياً من مستندات حقيقية، ورؤية واضحة لأداء مسار العمل. يتم تضمين ما يصل إلى 5 مقاعد Studio في فئة Standard. عند إطلاق Studio، أبلغ المستخدمون عن أعطال على متصفحي Safari و Chrome على أجهزة iPhone بسبب توافق WebGPU؛ أقر الرئيس التنفيذي للتكنولوجيا (CTO) بذلك بسرعة ونضج المنتج منذ ذلك الحين، ولكنه لا يزال أحدث من واجهة برمجة التطبيقات الأساسية.

تضيف فئتا Enterprise و Growth نشر VPC، وخيارات النشر المحلي (on-premises)، والتكوينات المعزولة عن الشبكة (air-gapped)، و SSO/SAML، وضوابط إقامة البيانات، واتفاقيات مستوى الخدمة (SLAs) المخصصة. تتوفر تغطية SOC 2 Type II و HIPAA BAA في فئة Enterprise. ملاحظة هامة للاتحاد الأوروبي: تتوفر اتفاقيات معالجة البيانات (DPAs) القياسية في جميع الفئات؛ بينما تتطلب اتفاقيات DPA المخصصة والمعدلة فئة Enterprise. كان هذا مصدراً للارتباك عند إطلاق Studio (افترض المطورون في الاتحاد الأوروبي أن اتفاقيات DPA تقتصر على Enterprise فقط)، ولكن اتفاقية DPA الافتراضية تغطي متطلبات اللائحة العامة لحماية البيانات (GDPR) القياسية في فئة Standard. بالنسبة للفرق التي تبني على Pinecone أو قواعد البيانات المتجهة الأخرى، فإن مخرجات JSON المنظمة من Reducto مع مربعات الإحاطة تتوافق بسلاسة مع مخططات البيانات الوصفية اللازمة للبحث الهجين.

لمن صُممت Reducto

تتركز قاعدة عملاء Reducto حول أربعة قطاعات رأسية حيث يكون لجودة المستندات عواقب مباشرة على الإيرادات أو الامتثال. تستخدمها فرق الخدمات المالية (صناديق التحوط، البنوك، منصات الاستثمار) لتقارير الأرباح، وإيداعات 10-K، والبيانات المالية حيث يمكن أن يؤدي عدم محاذاة خلايا الجدول إلى إفساد النماذج الكمية. تستخدمها منصات الذكاء الاصطناعي القانونية مثل Harvey للعقود، وملفات القضايا، والتقديمات التنظيمية حيث يُعد إثبات مصدر الاقتباس على مستوى الحقل مطلباً صارماً. تحتاج فرق الرعاية الصحية التي تعالج نماذج التفويض المسبق والمستندات السريرية إلى موثوقية اكتشاف مربعات الاختيار والمعالجة المؤهلة لـ HIPAA التي لا يمكن لنماذج VLM العامة توفيرها باستمرار. وتستفيد فرق التأمين والامتثال التي تعالج دفعات مستندات غير متجانسة (نماذج، فاكسات، تقديمات مكتوبة بخط اليد) من الدعم متعدد اللغات وتسامح Agentic OCR مع الصفحات المستديرة أو ذات العلامات المائية.

بالنسبة لمسارات عمل RAG، تقترن Reducto بشكل جيد مع AnythingLLM أو LlamaIndex: يتيح إثبات مصدر مربع الإحاطة على كل كتلة مخرجات اقتباسات دقيقة للمستندات، وتسمح درجات الثقة لنقطة النهاية Extract للفرق بتصفية الاستخراجات منخفضة الثقة قبل وصولها إلى الفهرس المتجه، مما يقلل من معدلات الهلوسة اللاحقة.

تعتمد فرق هندسة الذكاء الاصطناعي التي تتوسع من النموذج الأولي إلى الإنتاج عادةً على Reducto عندما يتعطل تحليل PDF الأولي (PyMuPDF، pdfplumber، أو استخراج النص البسيط) في 20% من مجموعة مستنداتهم التي تحتوي على جداول معقدة أو صفحات ممسوحة ضوئياً. يتيح معيار RD-TableBench العام للفرق التحقق من الدقة على عينات تمثيلية قبل الالتزام مع مورد.

ما لا تقدمه Reducto

Reducto هي واجهة برمجة تطبيقات (API) للاستيعاب، وليست منصة سير عمل مستندات شاملة (end-to-end). فهي لا تتضمن تصنيف المستندات (توجيه الفواتير مقابل العقود مقابل النماذج إلى مسارات عمل مختلفة)، أو واجهات مراجعة بشرية (human-in-the-loop)، أو الضبط الدقيق للنماذج لمخططات مستندات محددة، أو تكاملات أصلية مع الأنظمة اللاحقة مثل Salesforce أو SAP. تحتاج الفرق إلى بناء أو شراء تلك الطبقات بشكل منفصل. يضع المنافسون مثل Extend أو Nanonets أنفسهم كحلول سير عمل أكثر اكتمالاً؛ وحجة Reducto المضادة هي أن طبقة استيعاب هي الأفضل في فئتها وتتكامل مع أي نظام لاحق تُفضل على منصة متكاملة رأسياً مع مقايضات في الدقة.

تجاوز Reducto عندما: تكون المستندات عبارة عن ملفات PDF نصية بسيطة بدون جداول أو تخطيطات معقدة (الوضع الفعال من حيث التكلفة في LlamaParse أرخص بـ 5 مرات وكافٍ)؛ أو يكون الفريق متعمقاً بالفعل في نظام LlamaIndex/LlamaCloud البيئي ويريد مورداً واحداً؛ أو تكون الاستضافة الذاتية مفتوحة المصدر مع عدم الاعتماد على الموردين مطلباً صارماً (Unstructured.io)؛ أو تكون حالة الاستخدام هي استخراج بيانات صفحات الويب بدلاً من تحليل المستندات (Firecrawl هي الأداة المناسبة لهذه المهمة). يجب على الفرق في المراحل المبكرة جداً التي تجرب الذكاء الاصطناعي للمستندات أن تبدأ بـ 15 ألف رصيد مجاني من Reducto قبل الالتزام بعلاقة فوترة، حيث يمكن أن ينتج عن نموذج الأرصدة تكاليف غير متوقعة إذا لم يتم فهم تعقيد الصفحة أو اختيار العملية جيداً مقدماً.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Reducto.