تخطَّ إلى المحتوى الرئيسي
Vantaige
RAGFlow screenshot
RAGFlow logo

RAGFlow

مجاني

RAGFlow هو محرك RAG مفتوح المصدر للمؤسسات من InfiniFlow، مبني حول محلل مستندات عصبي (DeepDoc) يتعامل مع ملفات PDF المعقدة والجداول والمستندات ذات التخطيطات المختلطة. قابل للاستضافة الذاتية، بترخيص Apache 2.0، وحاصل على أكثر من 79 ألف نجمة على GitHub.

الميزات:APIOpen Source

RAGFlow هو محرك توليد معزز بالاسترجاع (RAG) شامل ومفتوح المصدر، تم تطويره بواسطة InfiniFlow، وهي شركة صينية متخصصة في البنية التحتية للذكاء الاصطناعي. تم إطلاقه كمشروع مفتوح المصدر في 1 أبريل 2024 بموجب ترخيص Apache 2.0، ونما ليصبح أحد أكثر مشاريع البنية التحتية للذكاء الاصطناعي حصولاً على النجوم على GitHub، حيث وصل إلى 79.6 ألف نجمة بحلول أبريل 2026. على عكس مكتبات أطر العمل مثل Haystack أو LlamaIndex، يُقدم RAGFlow كنظام كامل قابل للنشر: مسار استيعاب المستندات، ومحرك تقسيم (Chunking)، وبحث كامل النص ومتجهي، وتكامل مع النماذج اللغوية الكبيرة (LLM)، وواجهة مستخدم ويب، وطبقة تنسيق للوكلاء، كل ذلك في عملية نشر واحدة عبر Docker. الميزة التقنية الفارقة له هي DeepDoc، وهو نظام فرعي داخلي لتحليل المستندات يستخدم نموذج التعرف على التخطيط YOLOv8 المُحسّن، والتعرف الضوئي على الحروف (OCR)، والتعرف على بنية الجداول لاستخراج بيانات منظمة ودقيقة من ملفات PDF المؤسسية المعقدة قبل أن تبدأ عملية RAG على الإطلاق.

تدعم المنصة البحث الهجين الذي يجمع بين الاسترجاع المتجهي الكثيف، والبحث كامل النص BM25، وإعادة الترتيب القائمة على الموترات (Tensor-based reranking)، ويتم تقديم ذلك عبر قاعدة بيانات Infinity الخاصة بشركة InfiniFlow أو Elasticsearch 9.x الاختيارية. اعتباراً من الإصدار v0.25.1 (30 أبريل 2026)، توسع RAGFlow إلى ما هو أبعد من أصوله في RAG للمستندات: فهو يتضمن منشئ سير عمل للوكلاء مع تكامل MCP، ومسارات عمل متعددة الوكلاء، وتخزين ذاكرة على مستوى المستخدم، وإدخال/إخراج صوتي، وموصلات مصادر بيانات إلى Confluence و Google Drive و Notion و S3 و GitHub و Slack و DingTalk وخلاصات RSS، وتنفيذ التعليمات البرمجية في بيئة معزولة (Sandboxed) داخل تدفقات الوكلاء. يدعم النظام النماذج اللغوية الكبيرة (LLMs) الرئيسية بما في ذلك GPT-5 و DeepSeek v4 و Gemini 3 Pro و Claude، والنماذج المحلية عبر Ollama و Xinference. تعالج ميزات مثل الإجابات الموثقة والقابلة للتتبع مع إبراز المصدر وواجهة مستخدم مرئية لفحص الأجزاء (Chunks) مشكلة "البيانات الخاطئة تؤدي إلى نتائج خاطئة" التي تقوض معظم تطبيقات RAG البسيطة.

ما الذي يفعله RAGFlow فعلياً في مايو 2026

تتمحور بنية RAGFlow حول مسار عمل من ثلاث طبقات: الاستخراج والتحويل والتحميل (ETL)، والاسترجاع، والتوليد. طبقة ETL هي المكان الذي يتميز فيه RAGFlow بوضوح عن الحزم الأبسط. تدخل المستندات إلى النظام وتمر عبر DeepDoc: يحدد تحليل التخطيط ما إذا كانت منطقة معينة عبارة عن عنوان أو فقرة أو جدول أو صورة أو حاشية سفلية؛ ويتعامل OCR مع المستندات الممسوحة ضوئياً؛ ويحافظ التعرف على بنية الجدول على علاقات الصفوف/الأعمدة/الرؤوس التي تدمجها محللات PDF القياسية في نص مسطح. النتيجة هي مجموعة أجزاء غنية دلالياً تحافظ على بنية المستند، وليس مجرد نصوص خام.

قوالب التقسيم (Chunking) قابلة للتكوين حسب نوع المستند. يأتي RAGFlow مزوداً بقوالب جاهزة للنصوص العامة، والأسئلة والأجوبة، والأوراق الأكاديمية، والملفات القانونية، والمستندات المحاسبية، وأدلة الموارد البشرية، والتعليمات البرمجية، حيث يطبق كل منها استدلالات مناسبة لذلك التنسيق. يمكن للمستخدمين فحص الأجزاء بصرياً في واجهة المستخدم قبل الفهرسة، مما يجعل من الممكن اكتشاف أخطاء التحليل قبل أن تنتشر وتؤثر على جودة الاسترجاع. يتيح التقسيم بين الأصل والفرع (الذي تمت إضافته في الإصدار v0.23.0) استرجاعاً واسع النطاق مع توليد إجابات دقيقة، مما يقلل من ضغط نافذة السياق الذي يعيب أساليب التقسيم والاسترجاع البسيطة.

على جانب الاسترجاع، يقوم البحث الهجين بتشغيل التشابه المتجهي، ومطابقة الكلمات الرئيسية BM25، وإعادة الترتيب القائمة على الموترات في وقت واحد، مع أوزان درجات قابلة للتكوين. يتوفر الاسترجاع القائم على الرسم البياني (تكاملات GraphRAG و RAPTOR) للاستعلامات بأسلوب الرسم البياني المعرفي. تتضمن الإجابات استشهادات مضمنة مثبتة بالمستند المصدر والصفحة والجزء، مما يقلل من خطر الهلوسة ويجعل النتائج قابلة للتدقيق.

تدعم طبقة الوكيل، التي أعيد بناؤها بشكل كبير في الإصدار v0.20.0 (أغسطس 2025)، بناء سير العمل بالسحب والإفلات، ومشغلات Webhook، والتنسيق بين الوكلاء المتعددين، والذاكرة عبر الجلسات (تمت إضافة تخزين الذاكرة على مستوى المستخدم في الإصدار v0.25.0)، وتكامل أدوات MCP الذي تم تقديمه في عام 2026. يعني RAG القائم على الوكلاء أن الوكلاء يمكنهم تحديد قواعد المعرفة التي يجب الاستعلام عنها، ومتى يتم استدعاء واجهات برمجة التطبيقات (APIs) الخارجية، وكيفية تجميع النتائج متعددة المصادر في استجابة متماسكة.

"نموذج التعرف على التخطيط مثير للإعجاب. لقد اختبرته على بعض الجداول الصعبة وتفوق على AWS Textract في هذا السيناريو. يبدو وكأنه نسخة محسنة من YOLOv8." - mpeg، Hacker News، أبريل 2024

موقع RAGFlow مقارنة بـ Haystack و Dify

Haystack من deepset هو إطار عمل Python لبناء مسارات RAG برمجياً. يوفر مكونات: المسترجعات (Retrievers)، والمولدات (Generators)، والقراء (Readers). يقوم المطورون بتجميع هذه المكونات في مسارات عمل باستخدام Python، مما يمنحهم تحكماً معمارياً لا يضاهيه نهج RAGFlow الذي يركز على واجهة المستخدم أولاً. لا يأتي Haystack مزوداً بنموذج عصبي لتحليل المستندات؛ بل تجلب الفرق محللاتها الخاصة (PyMuPDF، unstructured، إلخ). يتفوق Haystack في الصناعات الخاضعة للرقابة (تستخدمه The Economist و Oxford University Press والعديد من الوكالات الحكومية في الإنتاج) حيث تكون قابلية التدقيق على مستوى الكود ومنطق مسار العمل المخصص أمراً لا غنى عنه. ميزة RAGFlow على Haystack هي اكتماله الجاهز للاستخدام: لا يتطلب تجميع مسار العمل، ويتعامل DeepDoc مع التخطيطات المعقدة تلقائياً، وتأتي واجهة مستخدم كاملة مع المنتج. ميزة Haystack هي قابلية التركيب والقدرة على التكامل بعمق مع حزم البرامج الحالية.

Dify هي منصة تطبيقات ذكاء اصطناعي أوسع نطاقاً. RAG هو وحدة واحدة داخل Dify، وليس هويتها الأساسية. تستخدم معالجة المستندات في Dify استراتيجيات تقسيم قياسية دون نموذج عصبي مخصص للتعرف على التخطيط، وهو ما يعمل بشكل جيد مع المستندات النصية النظيفة ولكنه يتراجع مع ملفات PDF ذات هياكل الجداول المعقدة أو الأعمدة المختلطة أو الصور المضمنة. قاعدة مستخدمي Dify هم فرق المنتجات الذين يرغبون في بناء تطبيقات مدعومة بـ LLM بسرعة: روبوتات الدردشة، وأتمتة سير العمل، وتطبيقات الذكاء الاصطناعي. قاعدة مستخدمي RAGFlow هم الفرق التي تتمثل مشكلتها الأساسية في استخراج المعلومات بشكل موثوق من مستندات المؤسسة الفوضوية. يمكن أن تكون الأداتان متكاملتين: RAGFlow كطبقة معرفة للمستندات، و Dify كطبقة تطبيق في الأعلى. تحتل Quivr مكانة أبسط للاستضافة الذاتية تقايض دقة مستندات المؤسسة ببساطة النشر.

مقارنة بـ AnythingLLM، الذي يستهدف المستخدمين الأفراد والفرق الصغيرة بغلاف بسيط فوق التقسيم القياسي، فإن RAGFlow هو مستوى مختلف من المنتجات. AnythingLLM هي أداة إنتاجية شخصية. RAGFlow هي بنية تحتية للمؤسسات التي تمتلك آلاف المستندات ومتطلبات حول الاستشهاد بالمصادر، والتحكم في الوصول، ودقة الاسترجاع على نطاق واسع.

كيف يبدو واقع الاستضافة الذاتية

يعمل RAGFlow عبر Docker Compose. الحد الأدنى للمتطلبات هو وحدة معالجة مركزية (CPU) بـ 4 نوى أو أكثر وذاكرة وصول عشوائي (RAM) بسعة 16 جيجابايت، على الرغم من أن الأسئلة الشائعة نفسها تشير إلى أن 16 جيجابايت "قد تكون ضيقة إذا تمت مشاركة الأجهزة مع خدمات أخرى". تتطلب عمليات النشر في العالم الحقيقي بانتظام 32 جيجابايت. يتم فك ضغط صورة Docker من حجم التنزيل الخاص بها إلى حوالي 7 جيجابايت على القرص. تقوم الحزمة بتشغيل قاعدتي بيانات على الأقل (Elasticsearch أو Infinity، بالإضافة إلى Redis و MinIO)، وعامل تحليل مستندات، والتطبيق الرئيسي، مما يجعلها واحدة من أثقل عمليات نشر الذكاء الاصطناعي ذاتية الاستضافة في فئة RAG مفتوحة المصدر.

الأداء أثناء استيعاب المستندات أبطأ عمداً من أدوات التقسيم الأبسط. تقر الأسئلة الشائعة بذلك مباشرة: "يستغرق تحليل المستندات وقتاً أطول من بعض المنافسين مثل LangChain لأن RAGFlow يبذل جهداً مضنياً في مهام المعالجة المسبقة للمستندات مثل تحليل التخطيط، والتعرف على بنية الجدول، و OCR باستخدام نماذج الرؤية". بالنسبة لحالات الاستخدام حيث تكون جودة المستند أكثر أهمية من سرعة الاستيعاب، فإن هذه المقايضة تستحق العناء. أما بالنسبة للتحميل المجمع للمستندات النصية النظيفة بسرعة، فمن الصعب تبرير هذا العبء الإضافي.

"خلط عدة محللات PDF بدون إعداد افتراضي واضح هو علامة حمراء. pypdf2 ليس مناسباً تماماً للتخطيطات المعقدة." - mpeg، Hacker News، أبريل 2024

أحدثت طبقة الوكيل تغييراً جذرياً كبيراً في الإصدار v0.20.0 في أغسطس 2025: تطلب جميع الوكلاء من الإصدارات السابقة إعادة بناء كاملة بعد الترقية. اضطرت الفرق التي قامت بتكوين وكلاء الإنتاج إلى إعادة هذا العمل. وثقت InfiniFlow التغيير بوضوح، لكنه يعكس توتراً مستمراً بين وتيرة التطوير النشطة وتوقعات استقرار الإنتاج.

الإحباطات التي يواجهها مستخدمو RAGFlow باستمرار

يعد استخدام الذاكرة أثناء تحليل المستندات مشكلة البنية التحتية الأكثر إبلاغاً عنها. تصف مشكلة GitHub رقم 11822 (المقدمة في 2025) استنفاد الذاكرة حتى مع 62 جيجابايت من ذاكرة الوصول العشوائي عند تحليل ملف PDF بحجم 5 ميجابايت. تُظهر مشكلة ذات صلة (رقم 8490) تجمداً لخادم بـ 16 نواة و 128 جيجابايت من ذاكرة الوصول العشوائي عند تحليل أربعة ملفات في وقت واحد. السبب الجذري هو تسرب للذاكرة في PyPDF أثناء معالجة DeepDoc، والذي أقرت به InfiniFlow وتتبعته ولكنها لم تحله بالكامل اعتباراً من الإصدار v0.25.1. بالنسبة للفرق ذات البنية التحتية المحدودة، يعد هذا عائقاً حقيقياً.

تحتوي معالجة المستندات متعددة اللغات على حالات استثنائية، خاصة بالنسبة للغات ذات الأحرف الخاصة. لاحظ المستخدمون الذين يعملون مع مستندات باللغة الألمانية أن علامات الإمالة (Umlauts) يمكن أن تسقط أثناء التحليل، وأن الأسئلة التي يتم إنشاؤها تلقائياً تكون باللغة الإنجليزية افتراضياً حتى عندما تكون المستندات المصدر بلغة أخرى. هذه حلول بديلة قابلة للحل، ولكنها تتطلب جهداً هندسياً لا يوفره الدعم متعدد اللغات المعلن للمنتج بالكامل بشكل جاهز.

تسببت فجوة توثيق Docker بين تكوينات صور التطوير والإنتاج في ارتباك مستمر بين المستخدمين الجدد حتى أواخر عام 2024. قامت إحدى مشكلات GitHub بفهرسة هذا جنباً إلى جنب مع عدم عمل الوضع الداكن، وصعوبات تكامل Infinity على Linux x64، وخطأ في استرجاع نافذة تحرير الأجزاء. تعني وتيرة الإصدار السريعة للمشروع (إصدارات نصف شهرية تقريباً) أن الأخطاء تظهر ويتم إصلاحها بسرعة، ولكن أيضاً أن أي إصدار معين يمكن أن يقدم حالات استثنائية جديدة.

لمن تم بناء RAGFlow

يعد RAGFlow الخيار الصحيح لفرق المؤسسات التي تتعامل مع مجموعات مستندات فوضوية ومعقدة. الشركات القانونية التي تستوعب ملفات PDF للعقود مع جداول البنود، والمحللون الماليون الذين يستعلمون عن تقارير الأرباح، وشركات التصنيع التي تبني أدلة الصيانة في قاعدة معرفية، وفرق تكنولوجيا المعلومات التي تبني مكاتب مساعدة داخلية عبر Confluence و S3 هي الملاءمة الطبيعية. إذا كانت مستنداتك عبارة عن ملفات Markdown نظيفة أو ملفات PDF بسيطة بدون جداول، فإن مسار DeepDoc الخاص بـ RAGFlow يعد مبالغاً فيه. استخدم حزمة أخف.

تم بناؤه للمؤسسات ذات متطلبات السحابة الخاصة أو المحلية (On-premises). يسمح ترخيص Apache 2.0 بالاستخدام التجاري والتعديل دون قيود، ويعني النشر الكامل المستضاف ذاتياً عدم خروج أي بيانات من بنيتك التحتية. بالنسبة للصناعات الخاضعة للرقابة حيث تكون إقامة البيانات متطلباً للامتثال، فإن هذا يهم أكثر من سهولة الإعداد.

تجاوز RAGFlow عندما تكون ميزانية البنية التحتية الخاصة بك لأداة واحدة أقل من 32 جيجابايت من ذاكرة الوصول العشوائي، أو عندما يحتاج فريقك إلى مكتبة Python يمكنهم دمجها في قاعدة تعليمات برمجية حالية (اتجه إلى Haystack أو LlamaIndex)، أو عندما تقوم ببناء روبوت دردشة بسيط على مجموعة مستندات صغيرة ولا تحتاج إلى تحليل على مستوى المؤسسة. تجاوزه أيضاً إذا كان فريقك لا يستطيع تحمل التغييرات الجذرية العرضية بين الإصدارات، أو إذا كنت بحاجة إلى برنامج كخدمة (SaaS) مدعوم من البائع بأسعار محددة واتفاقيات مستوى الخدمة (SLAs).

يعد RAGFlow مناسباً تماماً للمشكلة التي صُمم من أجلها: جعل RAG موثوقاً عندما تكون جودة المستند هي الجزء الصعب. تعكس 79.6 ألف نجمة على GitHub واعتراف GitHub's 2025 Octoverse كأسرع مشروع بنية تحتية للذكاء الاصطناعي نمواً من حيث تفاعل المساهمين، جاذبية حقيقية لدى مجتمعات المطورين والمؤسسات التي وصلت إلى حدود حزم RAG الأبسط. يتطلب تشغيله والحفاظ على استقراره استثماراً هندسياً، ولكن بالنسبة للفرق حيث تكون دقة المستند هي الفارق بين منتج ذكاء اصطناعي مفيد ومنتج غير موثوق، فإن هذا الاستثمار يؤتي ثماره.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن RAGFlow.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ RAGFlow.