

CogVideoX هي سلسلة نماذج مفتوحة المصدر لتوليد الفيديو من Zhipu AI، تتيح إنتاج مقاطع فيديو من النصوص والصور محلياً أو عبر واجهة برمجة التطبيقات (API). تعمل على وحدات معالجة الرسومات (GPUs) الاستهلاكية بدءاً من 5 جيجابايت من ذاكرة VRAM مع دعم كامل لمكتبة diffusers، والضبط الدقيق عبر LoRA، والتكامل مع ComfyUI. مجانية تماماً للتنزيل والاستضافة الذاتية.
CogVideoX هي سلسلة نماذج مفتوحة المصدر لتوليد الفيديو تم تطويرها بواسطة Zhipu AI وباحثين في مختبر THUDM بجامعة تسينغهوا. أُطلقت لأول مرة في أغسطس 2024 وتم قبولها كورقة بحثية في مؤتمر ICLR 2025، وهي تقوم بتوليد مقاطع الفيديو من المطالبات النصية أو الصور المصدرية دون أي اشتراكات أو رسوم لكل مقطع. يمكن تنزيل أوزان النموذج مجاناً من HuggingFace، وقاعدة التعليمات البرمجية مرخصة بموجب MIT/Apache 2.0 على GitHub، حيث حصد المشروع أكثر من 12,700 نجمة. اعتباراً من أبريل 2026، لا يزال المستودع يخضع لصيانة نشطة، مع إضافة إطار عمل الضبط الدقيق CogKit في مارس 2025 وتوفير واجهات مجتمعية تخدم مئات مسارات عمل ComfyUI.
تضم عائلة النماذج خمسة متغيرات تغطي مستويات مختلفة من الأجهزة وحالات الاستخدام: الإصدار الخفيف بـ 2 مليار معلمة (2B) يعمل على وحدات معالجة رسومات قديمة مثل GTX 1080 Ti؛ والإصدار الرائد بـ 5 مليارات معلمة (5B) يتعامل مع توليد الفيديو من النص بتفاصيل دقيقة مع التزام قوي بالمطالبات؛ ويُصنف المتغير 5B-I2V باستمرار كأفضل نموذج لتوليد الفيديو من الصور متاح لمالكي وحدات معالجة الرسومات الاستهلاكية. دفع إصدار CogVideoX1.5 (نوفمبر 2024) الدقة إلى 1360x768 بمعدل 16 إطاراً في الثانية وزاد طول المقطع إلى 10 ثوانٍ. تستخدم البنية المعمارية مشفر تلقائي متغير ثلاثي الأبعاد (3D Variational Autoencoder) للضغط المكاني والزماني مقترناً بمحول خبير (Expert Transformer)، دون وحدة الانتباه المتبادل التقليدية. التكامل الكامل مع diffusers يعني استدعاءات مسار عمل بسطر واحد، والضبط الدقيق عبر LoRA مدعوم جاهزاً للاستخدام عبر CogKit.
ما يقدمه CogVideoX في أبريل 2026
تغطي تشكيلة النماذج الحالية اعتباراً من أبريل 2026 جيلين. يُنتج الإصدار الأصلي CogVideoX-5B فيديو بدقة 720x480 بمعدل 8 إطارات في الثانية لمقاطع مدتها 6 ثوانٍ. يعمل بدقة BF16 مع وقت استدلال يبلغ حوالي 180 ثانية على A100 أو 90 ثانية على H100. مع تفريغ وحدة المعالجة المركزية (CPU offloading) وتكميم INT8، ينخفض الحد الأدنى لذاكرة VRAM إلى حوالي 4.4 جيجابايت، مما يجعله أحد أكثر نماذج الفيديو المحلية سهولة في الوصول.
يُعد إصدار CogVideoX1.5-5B، الذي أُطلق في 8 نوفمبر 2024، خطوة مهمة للأمام: دقة 1360x768، و16 إطاراً في الثانية، ومدد تتراوح بين 5 إلى 10 ثوانٍ. يقبل النموذج المرافق لتحويل الصور إلى فيديو (CogVideoX1.5-5B-I2V) أي نسبة عرض إلى ارتفاع ويُخرج ما يصل إلى 81 إطاراً. كلاهما متاح من خلال مكتبة diffusers على Hugging Face بنفس واجهة مسار العمل للنماذج الأساسية. على منصة Qingying، عرضت Zhipu AI أيضاً النماذج مقترنة بنموذج الصوت CogSound الخاص بها لإنتاج صوت متزامن ومخرجات فائقة الدقة 4K على دفعات، على الرغم من أن الإصدارات مفتوحة الأوزان تظل بالمواصفات المذكورة أعلاه.
دعم ComfyUI من الدرجة الأولى. يمتلك kijai/ComfyUI-CogVideoXWrapper أكثر من 1,500 نجمة و341 التزاماً (commit)، ويدعم تحويل النص إلى فيديو، والصورة إلى فيديو، وLoRA، وتكميم GGUF، والتحكم في الوضعيات عبر ControlNet، والتجانب الزمني (temporal tiling) للمقاطع الممتدة، والتوجيه التجريبي للحركة عبر Go-with-the-Flow. كما يوجد تكامل مع Stable Diffusion WebUI Forge.
"نموذج 5B يتفوق بشكل مذهل. ليس فقط لأنه أكثر تفصيلاً من حيث المشاهد، بل إنه قدم أداءً أفضل بكثير من حيث الالتزام بالمطالبات.". Bijan Bowen، Ominous Industries، أغسطس 2024
موقع CogVideoX مقارنة بـ HunyuanVideo و Mochi 1
تهيمن ثلاثة نماذج على النقاش عندما يقارن مستضيفو النماذج الذاتية بين خيارات توليد الفيديو مفتوحة المصدر: HunyuanVideo من Tencent، و Mochi 1 من Genmo، و CogVideoX. تم بناء هذه النماذج على رهانات معمارية مختلفة وتخدم ملفات تعريف أجهزة مختلفة بشكل كبير.
يستخدم HunyuanVideo (Tencent) بنية MoE (مزيج الخبراء) بـ 13 مليار معلمة مع وحدات توجيه نصية عبر الإطارات وتدريب مختلط الدقة، حيث يتم تعلم الديناميكيات الزمنية بدقة أقل بينما يتم تدريب التفاصيل المكانية بدقة أعلى. قلص HunyuanVideo 1.5 (نوفمبر 2025) هذا إلى 8.3 مليار معلمة وخفض الحد الأدنى لذاكرة VRAM إلى 14 جيجابايت. في معايير الأداء، سجل 9.1/10 للاتساق الزمني مقابل 7.9/10 لـ CogVideoX، وهو بوضوح الخيار الأفضل لأي شيء يتضمن وجوهاً بشرية واقعية أو مشاهد متعددة الشخصيات. المقايضة هنا هي الأجهزة: للحصول على الجودة الكاملة في النموذج الأصلي، ستحتاج إلى 60-80 جيجابايت من ذاكرة VRAM بدقة 720p، مما يتطلب الوصول إلى وحدات معالجة رسومات خاصة بمراكز البيانات. تبلغ تكلفة واجهة برمجة التطبيقات (API) عند الطلب حوالي 11 دولاراً لكل دقيقة من المخرجات. بالنسبة لمعظم المستضيفين الذاتيين، يُعد CogVideoX البديل المتاح عندما تكون جودة HunyuanVideo مطلوبة ولكن الأجهزة غير متوفرة.
يستخدم Mochi 1 (Genmo) بنية AsymmDiT (محول الانتشار غير المتماثل) بـ 10 مليارات معلمة، تم ضبطه خصيصاً للحركة السلسة بمعدل 30 إطاراً في الثانية. ميزة معدل الإطارات هذه حقيقية: تبدو مخرجات Mochi 1 أكثر سلاسة بشكل ملحوظ من CogVideoX الأساسي بمعدل 8 إطارات في الثانية. ومع ذلك، يقتصر Mochi 1 على دقة 480p دون إصدار ترقية عالية الدقة (HD)، ويتطلب 16 جيجابايت كحد أدنى من ذاكرة VRAM، ولم تصدر Genmo خليفة حقيقياً يمكنه مواكبة HunyuanVideo 1.5 أو CogVideoX1.5. ينظر المجتمع إلى حد كبير إلى Mochi 1 على أنه مهم تاريخياً لإثبات أن الحركة السلسة كانت قابلة للتحقيق في النماذج مفتوحة المصدر، ولكنه تم تجاوزه عملياً في معظم مسارات العمل. يُنتج CogVideoX1.5 بمعدل 16 إطاراً في الثانية ودقة 1360x768 مخرجات بدقة أعلى من Mochi 1، على الرغم من أن سلاسة الحركة لا تزال تميل لصالح Mochi في الحركات السريعة.
يتمتع CogVideoX بـ 5 مليارات معلمة بأقل متطلبات للأجهزة من بين النماذج الثلاثة. فهو يعمل بذاكرة VRAM تبلغ حوالي 5 جيجابايت مع التكميم، ويولد فيديو مقبولاً على بطاقات من فئة RTX 3060، ويوفر المسار الأكثر سهولة للرسوم المتحركة المحلية من صورة إلى فيديو. المقايضة هنا هي الواقعية: يُنتج CogVideoX مخرجات أكثر أسلوبية وتوضيحية من HunyuanVideo، حيث سجل 7.4/10 مقابل 8.7/10 لـ HunyuanVideo في الموضوعات البشرية الواقعية في معايير الأداء التابعة لجهات خارجية.
"يتمتع CogVideoX بأفضل وضع لتحويل الصورة إلى فيديو بين النماذج المفتوحة، مما يتيح لك إنشاء صورة رئيسية باستخدام Flux أو SDXL، ثم تحريكها باستخدام CogVideoX، مع تقنية 3D Causal VAE التي توفر حفاظاً قوياً على التفاصيل.". InsiderLLM، دليل توليد الفيديو بالذكاء الاصطناعي المحلي، 2025
التكلفة الحقيقية لتوليد الفيديو باستخدام CogVideoX
أوزان النموذج لا تكلف شيئاً. استضافة Hugging Face مجانية. التكلفة الفعلية تكمن في الكهرباء، واستهلاك الأجهزة، والوقت.
على بطاقة RTX 4090، توقع إنتاج 5-7 مقاطع في الساعة لنموذج 5B بالإعدادات القياسية. وعلى بطاقة RTX 3060 (12 جيجابايت)، يمتد وقت التوليد إلى 9-15 دقيقة لكل مقطع. بينما تقلص بطاقة H100 وقت الاستدلال لنموذج 5B إلى حوالي 90 ثانية. إذا كنت لا تمتلك أجهزة مناسبة، فإن مزودي وحدات معالجة الرسومات السحابية (Vast.ai، RunPod، Modal) يتقاضون ما يقرب من 0.50 دولار إلى 3.00 دولارات لكل ساعة من وقت H100/A100، مما يجعل تكلفة المقطع الواحد تتراوح بين سنتات إلى بضعة دولارات اعتماداً على الإعدادات والمزود.
تستضيف واجهات برمجة التطبيقات (API) التابعة لجهات خارجية مثل Replicate و SiliconFlow نقاط نهاية CogVideoX مكممة بأسعار لكل تشغيل تختلف حسب المزود، وعادة ما تكون في نطاق 0.02 دولار إلى 0.10 دولار لكل مقطع. هذه شركات مستقلة وليست منتجات تابعة لـ Zhipu AI. تقدم منصة Qingying الرسمية من Zhipu AI وصولاً سحابياً بأسعارها الخاصة، لكن النماذج مفتوحة الأوزان نفسها تظل مجانية.
بالنسبة للضبط الدقيق باستخدام CogKit، تتناسب ميزانية الحوسبة مع حجم مجموعة البيانات والدقة المستهدفة. يكتمل الضبط الدقيق لـ LoRA على CogVideoX-5B عادةً في غضون ساعات على بطاقة A100 بسعة 80 جيجابايت لمجموعات البيانات الصغيرة. أدى تحديث يناير 2025 إلى تقليل متطلبات الذاكرة لتدريب LoRA، مما جعل الضبط الدقيق أكثر قابلية للتطبيق على البطاقات الاستهلاكية بسعة 24 جيجابايت.
أين يتعثر CogVideoX باستمرار
التوليد البطيء هو الشكوى الأكثر شيوعاً. وثقت المشكلة رقم #545 على GitHub تشغيل CogVideoX1.5-5B عند 0/50 خطوة استدلال لأكثر من ساعة على بعض التكوينات. وبشكل أكثر شيوعاً، يُبلغ المستخدمون على وحدات معالجة الرسومات الاستهلاكية عن استخدام وحدة معالجة الرسومات بحوالي 60% أثناء الاستدلال، مما يشير إلى اختناقات في مسار العمل في نقل البيانات من وحدة المعالجة المركزية إلى وحدة معالجة الرسومات. تشمل الحلول المجتمعية SageAttention (يقلل من VRAM ويسرع الحوسبة)، و torch.compile، وإطار العمل الموازي xDiT (الذي يُزعم أنه يسرع الأداء بمقدار 7.75 ضعفاً عبر وحدات معالجة رسومات متعددة). لا يوجد أي من هذه الحلول جاهزاً للتشغيل الفوري (plug-and-play).
عدم استقرار الحركة في المشاهد المعقدة هو قيد موثق. تشير الأوراق البحثية المنشورة في عام 2025 تحديداً إلى أن CogVideoX يُظهر "انحرافاً في الهوية وديناميكيات غير معقولة فيزيائياً" أثناء الحركة عالية الديناميكية مثل الرقص السريع أو الرياضات التنافسية. المشكلة أكثر وضوحاً في النموذج الأساسي 5B مقارنة بـ 1.5، وتتفاقم مع زيادة طول المقطع عن 6 ثوانٍ.
تبدو المخرجات بمعدل 8 إطارات في الثانية على نماذج CogVideoX-2B و 5B الأساسية متقطعة بشكل ملحوظ عند تشغيلها. قام CogVideoX1.5 بتحسين ذلك إلى 16 إطاراً في الثانية، وهو أفضل ولكنه لا يزال أقل من 30 إطاراً في الثانية لـ Mochi 1 أو الأدوات التجارية التي تستهدف 24 إطاراً في الثانية.
المطالبات باللغة الإنجليزية فقط مع حد أقصى صارم يبلغ 226 رمزاً (token) تعني أنه يجب على المستخدمين غير الناطقين بالإنجليزية الترجمة أولاً، ويتم اقتطاع أوصاف المطالبات الطويلة والمعقدة. لا توجد قدرة متعددة اللغات أصلية في الأوزان الحالية.
التغييرات الجذرية (Breaking changes) في الأدوات هي نقطة احتكاك مستمرة. أدت إعادة هيكلة التحديث رقم 8 لغلاف kijai ComfyUI إلى كسر مسارات العمل الحالية، مما تطلب من المستخدمين إعادة بناء الرسوم البيانية للعقد الخاصة بهم. هذا أمر متوقع لمشروع مفتوح المصدر سريع التطور ولكنه غير مريح لأي شخص قام ببناء مسارات عمل إنتاجية على تكوينات قديمة.
أفضل حالات الاستخدام مقابل سيناريوهات التخطي
يعمل CogVideoX بشكل أفضل عندما:
ترغب في تحريك صورة ثابتة. يُعد مسار عمل I2V، خاصة مع FLUX أو SDXL كمولد للصورة المصدرية، هو مسار العمل الواقعي الأكثر إشادة لـ CogVideoX. الحفاظ على التفاصيل قوي، ويتفوق نموذج 5B-I2V باستمرار على البدائل في فئة VRAM الخاصة به لهذه المهمة المحددة.
تحتاج إلى توليد فيديو محلي التشغيل وبدون اشتراك على الأجهزة الاستهلاكية. من GTX 1080 Ti (2B) إلى RTX 3060 (5B)، يتمتع CogVideoX بأقل متطلبات للأجهزة مقارنة بأي نموذج من فئة الجودة المماثلة.
يكون الالتزام بالمطالبات مهماً للمشاهد المنظمة. تستفيد التصورات الفنية، والجولات المعمارية، والعروض التوضيحية للمنتجات، والمحتوى العلمي من دقة CogVideoX في اتباع النصوص، والتي صنفها مختبرون مستقلون أعلى من النماذج المفتوحة الأخرى في اتباع التعليمات للأوصاف التفصيلية.
ترغب في إجراء ضبط دقيق على بيانات نمط مخصصة. يجعل دعم CogKit و diffusers LoRA من النموذج قاعدة عملية للضبط الدقيق للحصول على مظاهر خاصة بالاستوديوهات.
تخطَّ CogVideoX عندما:
يتركز محتواك على الوجوه أو الأجسام البشرية الواقعية أو المشاهد متعددة الشخصيات. يسجل HunyuanVideo نقطتين كاملتين أعلى في الموضوعات البشرية الواقعية في معايير الأداء التابعة لجهات خارجية، وفرق الجودة واضح للمراجعين غير التقنيين.
تكون السرعة مهمة. إذا كنت بحاجة إلى مقطع في أقل من 3 دقائق على الأجهزة الاستهلاكية، فإن LTX-Video هو توصية المجتمع. سيؤدي استخدام CogVideoX الذي يستغرق 9-15 دقيقة لكل مقطع على RTX 3060 إلى إحباط أي مسار عمل يتطلب التكرار.
تعمل بلغات غير الإنجليزية. قيد الـ 226 رمزاً باللغة الإنجليزية فقط ليس إعداداً يمكن تعديله؛ بل هو مدمج في تدريب النموذج.
لا يمكنك الوصول إلى وحدة معالجة رسومات Nvidia حديثة. الاستدلال باستخدام وحدة المعالجة المركزية (CPU) فقط ممكن تقنياً ولكنه بطيء بشكل غير عملي لأي استخدام إنتاجي.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن CogVideoX.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ CogVideoX.

AI Video Generator Prompting: The Filmmaker's Real Workflow

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
