تخطَّ إلى المحتوى الرئيسي
Vantaige
WAN (Wan-Video / Wan2GP) screenshot
WAN (Wan-Video / Wan2GP) logo

WAN (Wan-Video / Wan2GP)

مجاني

تُعد WAN سلسلة نماذج توليد الفيديو مفتوحة الأوزان من Alibaba (الإصدارات 2.1 إلى 2.7)، حيث تقدم إمكانات تحويل النص إلى فيديو، والصورة إلى فيديو، وتحرير الفيديو بموجب ترخيص Apache 2.0. تصدرت السلسلة قائمة VBench عند إطلاقها في فبراير 2025 وأصبحت الخيار الافتراضي لأعمال فيديو الذكاء الاصطناعي ذاتية الاستضافة.

حالات الاستخدام:الفيديو وصناعة الأفلام
الميزات:APIOpen Source

تُعد WAN عائلة من نماذج توليد الفيديو مفتوحة الأوزان التي طورها Tongyi Lab التابع لشركة Alibaba، وهو جزء من DAMO Academy. أُصدرت السلسلة للجمهور في 25 فبراير 2025 باسم Wan 2.1، وتصدرت فوراً قائمة VBench لتوليد الفيديو مفتوح المصدر، متفوقة على جميع النماذج المفتوحة السابقة ومضاهية للعديد من واجهات برمجة التطبيقات (APIs) التجارية بتكلفة ترخيص صفرية. تُصدر الأوزان بموجب ترخيص Apache 2.0، مما يعني أنه يمكن لأي شخص تنزيلها وتشغيلها وضبطها بدقة وإعادة توزيعها للاستخدام الشخصي أو التجاري دون دفع أي رسوم لشركة Alibaba. بحلول أبريل 2026، تطورت السلسلة عبر الإصدارات 2.2 و 2.5 و 2.6 و 2.7، حيث أضاف كل إصدار رئيسي إمكانات جديدة: التحكم السينمائي في الكاميرا، والصوت الأصلي، و"وضع التفكير" (Thinking Mode) الذي يركز على الاستنتاج أولاً في أحدث واجهة برمجة تطبيقات للإصدار 2.7.

تشمل الإمكانات الأساسية تحويل النص إلى فيديو (T2V)، والصورة إلى فيديو (I2V)، والإطار الأول والأخير إلى فيديو (FLF2V)، وإنشاء وتحرير الفيديو (VACE)، وتحويل الكلام إلى فيديو (S2V)، وتحريك الشخصيات. تُولد النماذج الرائدة ذات الـ 14 مليار معلمة (14B) مقاطع بدقة 480p و 720p على وحدات معالجة الرسومات (GPUs) الاستهلاكية مثل RTX 4090، بينما يعمل النموذج المدمج ذو الـ 1.3 مليار معلمة (1.3B) على 8.19 جيجابايت فقط من ذاكرة VRAM، مما يجعله أحد نماذج الفيديو الاحترافية القليلة التي تعمل على بطاقات الألعاب من الفئة المتوسطة. وقد نما حول السلسلة منذ إطلاقها نظام بيئي مزدهر من نماذج LoRA، ومسارات عمل ComfyUI، والأدوات المساعدة التابعة لجهات خارجية (أبرزها تكامل ComfyUI وأداة Wan2GP المساعدة لإعدادات VRAM المنخفضة).

ما تقدمه WAN في أبريل 2026

يُولد Wan 2.1، وهو الإصدار الذي لا يزال معظم المبدعين يشغلونه محلياً، مقاطع تصل مدتها إلى 5 ثوانٍ بدقة 480p أو 720p، بمعدل 16 إطاراً في الثانية. يتعامل نموذج T2V ذو الـ 14B معلمة مع الحركة السينمائية والبيئات التفصيلية والفيزياء الدقيقة. بينما يقايض نموذج T2V ذو الـ 1.3B التفاصيل المرئية مقابل سهولة الوصول. يقوم متغير I2V-14B بتحريك صورة ثابتة إلى فيديو، ويقوم نموذج FLF2V-14B بالاستيفاء بين إطار البداية والنهاية. أضاف VACE (الإنشاء والتحرير الشامل للفيديو)، الذي صدر في مايو 2025، إمكانات الرسم الداخلي (inpainting)، والرسم الخارجي (outpainting)، والتحرير الموجه بالتعليمات إلى نفس الأوزان.

قدم Wan 2.2 (يوليو 2025) أول بنية مزيج الخبراء (Mixture-of-Experts) مفتوحة المصدر لنشر الفيديو: 27 مليار معلمة إجمالية مقسمة عبر شبكتي خبراء (خبير إزالة الضوضاء العالية وخبير تحسين الضوضاء المنخفضة)، مع تنشيط 14 مليار معلمة فقط لكل خطوة استنتاج. زادت بيانات التدريب بنسبة 65.6% في الصور و 83.2% في مقاطع الفيديو مقارنة بالإصدار 2.1. أضافت متغيرات النموذج الجديدة تحويل الكلام إلى فيديو (S2V-14B) وتحريك الشخصيات بالكامل (Animate-14B)، والذي يمكنه تحريك صورة فوتوغرافية واحدة إلى تسلسل فيديو متسق.

أضاف Wan 2.5 (سبتمبر 2025) الصوت الأصلي: حوار متزامن، ومؤثرات صوتية، وضوضاء خلفية محيطة يتم إنشاؤها جنباً إلى جنب مع إطارات الفيديو في تمريرة واحدة. يتعامل النموذج مع مخرجات بدقة 1080p ومقاطع مدتها 10 ثوانٍ. جلب Wan 2.7 (6 أبريل 2026) "وضع التفكير" (Thinking Mode)، حيث يخطط النموذج صراحةً لتكوين المشهد قبل التوليد، مما يؤدي إلى تماسك سردي أفضل وهوية شخصية أكثر وضوحاً. ومع ذلك، يُطرح Wan 2.7 بأوزان مغلقة متاحة فقط من خلال واجهة برمجة تطبيقات (API) مدفوعة بسعر $0.10 لكل ثانية من فيديو 720p. ويُعد هذا خروجاً ملحوظاً عن روح الأوزان المفتوحة لكل إصدار سابق.

بالنسبة للمستخدمين الذين يرغبون في تشغيل WAN على أجهزة محدودة، فإن أداة Wan2GP المساعدة التي صممها المجتمع بواسطة deepbeepmeep تخفض متطلبات VRAM إلى ما يصل إلى 6 جيجابايت في بعض التكوينات، وتضيف واجهة مستخدم ويب، وتدعم نماذج متعددة (WAN 2.1/2.2، و HunyuanVideo، و LTX Video، و FLUX)، وتتضمن معالجة الدفعات القائمة على قائمة الانتظار. إنها نقطة الدخول العملية لأي شخص لا يمتلك بطاقة RTX 4090.

موقع WAN مقارنة بـ HunyuanVideo و Mochi 1

يُبنى HunyuanVideo (من Tencent، إصدار مفتوح في ديسمبر 2024) على Causal 3D VAE مع محول ثنائي الدفق و 13 مليار معلمة. تكمن قوة بنيته في تماسك المشهد متعدد الشخصيات: تحافظ المشاهد التي تحتوي على 3-5 شخصيات مميزة على هوياتها الفردية، وتحديد المواقع المكانية الصحيحة، والحركة المنسقة بشكل أفضل من WAN في الاختبارات المباشرة. لكن المقايضة قاسية: يتطلب HunyuanVideo ما لا يقل عن 45-60 جيجابايت من ذاكرة GPU لتوليد دقة 720p، مما يضعه بقوة في فئة مراكز البيانات أو محطات العمل متعددة وحدات معالجة الرسومات. على النقيض من ذلك، يعمل نموذج 1.3B من WAN على بطاقة RTX 3060 واحدة بذاكرة VRAM سعة 8 جيجابايت. بالنسبة للمبدعين الذين يستخدمون أجهزة استهلاكية، لا يُعد HunyuanVideo بديلاً واقعياً؛ أما بالنسبة للاستوديوهات التي تشغل مجموعات A100، فإن دقة شخصياته يمكن أن تبرر تكلفة الحوسبة. يمكنك مقارنة كلا الخيارين في صفحة HunyuanVideo.

يُعد Mochi 1 (من Genmo، أكتوبر 2024) نموذجاً بـ 10 مليارات معلمة مبنياً على محول انتشار غير متماثل (AsymmDiT)، مع دفق مرئي يحتوي على ما يقرب من أربعة أضعاف عدد معلمات الدفق النصي. يُخرج بدقة 480p بمعدل 30 إطاراً في الثانية، مما يعطي حركة أكثر سلاسة بشكل ملحوظ من معدل 16 إطاراً في الثانية في WAN 2.1. تكمن العقبة في متطلبات الأجهزة: يتطلب النشر على وحدة معالجة رسومات واحدة حوالي 60 جيجابايت من ذاكرة VRAM. كان Mochi 1 هو المعيار مفتوح المصدر قبل شحن WAN 2.1 بعد أربعة أشهر واستيلائه على المركز الأول في VBench. ومنذ ذلك الحين، وسعت بنية MoE في WAN 2.2 الفجوة في الجودة الإجمالية، وتمنحه مسارات I2V و VACE والتحرير في WAN مساحة ميزات أوسع بكثير. يظل Mochi 1 إدخالاً سابقاً قوياً يستحق التحقق منه في صفحة Mochi 1، خاصةً لسلاسة الحركة إذا كانت لديك الأجهزة المناسبة.

في مواجهة الخدمات التجارية: تقدم Runway Gen-3 و Pika واجهات ويب مصقولة وأوقات إنجاز أسرع دون الحاجة إلى إعداد محلي، لكنها تفرض رسوماً لكل مقطع. تُنتج Sora و Luma AI مخرجات عالية الجودة ولكنها تقبع خلف جدران الدفع للاشتراكات أو الأرصدة. يتمثل عرض القيمة الأساسي لـ WAN تحديداً في أنه مجاني، ويعمل دون اتصال بالإنترنت، ويدعم الضبط الدقيق، ولا يحتوي على حدود استخدام تتجاوز ما يمكن لوحدة معالجة الرسومات الخاصة بك التعامل معه.

"مقاطع الفيديو التي أنشأها Wan 2.1 جيدة جداً، لدرجة أنه من الصعب تصديق أنها صُنعت بواسطة تطبيق ذكاء اصطناعي مجاني." - مراجعة تحريرية من BGR، 26 فبراير 2025
"هذا يغير الحسابات لأي شخص بنى على سلسلة Wan أو قيّمها بناءً على إمكانية وصولها مفتوحة المصدر." - Tellers.ai، حول إعلان الأوزان المغلقة لـ Wan 2.7، 15 أبريل 2026

التكلفة الحقيقية لتوليد الفيديو باستخدام WAN

بالنسبة للإصدارات مفتوحة الأوزان (2.1 إلى 2.6)، فإن التكلفة التي تتحملها Alibaba هي صفر. أنت تدفع مقابل الكهرباء والأجهزة الخاصة بك. تستغرق بطاقة RTX 4090 التي تولد مقاطع مدتها 5 ثوانٍ بدقة 480p بدقة FP16 حوالي 4 دقائق لكل مقطع غير محسن. مع تكميم FP8 أو LoRA للسرعة التي تعمل بـ 8-10 خطوات استنتاج، تصل معايير المجتمع بهذا إلى حوالي 90 ثانية لكل مقطع على نفس وحدة معالجة الرسومات. على بطاقة RTX 4070 Ti (12 جيجابايت)، يُولد نموذج 1.3B بسرعة مماثلة؛ بينما يتطلب نموذج 14B تكميماً يدوياً أو تنسيق GGUF.

توجد مسارات استئجار سحابية للمستخدمين الذين ليس لديهم وحدات معالجة رسومات محلية. تقدم كل من RunPod و ThinkDiffusion و Spheron مثيلات GPU مهيأة لـ WAN. تبلغ تكلفة مثيل 4090 على RunPod حوالي $0.74/ساعة؛ وتوليد 10 مقاطع في الساعة يعني حوالي $0.07 لكل مقطع. لا يزال هذا أرخص من معظم واجهات برمجة التطبيقات التجارية للعمل بكميات كبيرة، على الرغم من أن معدل واجهة برمجة تطبيقات Wan 2.7 ($0.10/ثانية من 720p) تنافسي للمستخدمين الذين يحتاجون إلى ميزات "وضع التفكير" (Thinking Mode) في هذا الإصدار دون إدارة البنية التحتية.

حاجز التكلفة الفعلي هو الوقت: تتراوح ملفات النموذج من 5 جيجابايت (1.3B، مكمم بـ GGUF) إلى 28 جيجابايت (14B، FP16 كامل). يتطلب الإعداد لأول مرة في ComfyUI أو Wan2GP تنزيل النماذج إلى مسارات أدلة محددة، وتكوين برامج تشفير النص و VAE بشكل منفصل، واستكشاف أخطاء تبعيات البيئة وإصلاحها. يُبلغ المستخدمون الذين ليس لديهم خبرة في Python عن قضاء 2-4 ساعات في الإعداد الأولي. بعد ذلك، يصبح التوليد مباشراً.

أين يتعثر WAN باستمرار

اتساق الشخصية عبر المقاطع الأطول: منحت الاختبارات المستقلة WAN 2.5 درجة 3.0/5 في اتساق الشخصية، مع "تغير ملامح الوجه والأنماط بشكل ملحوظ بين الإطارات". يؤثر هذا على أي مطالبة تتضمن شخصية معينة تظهر طوال المقطع: تنحرف الوجوه، وتتغير الملابس قليلاً، وتتغير نسب الجسم. يعالج متغير Animate-14B في WAN 2.2 الرسوم المتحركة للصور الشخصية على وجه التحديد، لكن المشاهد السردية متعددة الشخصيات تظل غير موثوقة.

التفاصيل البيئية المعقدة: تفقد مطالبات المناظر الطبيعية التفصيلية عناصر محددة في منتصف المقطع. قد تبدأ مطالبة "ضباب متسق فوق بحيرة عاكسة مع إضاءة خلفية صباحية ناعمة" بشكل صحيح ولكن الضباب يخف، أو يتغير الانعكاس، أو تتغير الإضاءة بحلول النصف الثاني. الاتساق الزمني في المطالبات البيئية الكثيفة أضعف من مطالبات الموضوع الواحد أو الخلفية البسيطة.

أداء وحدات معالجة الرسومات AMD: تُظهر متتبعات مشكلات GitHub لـ ComfyUI أن WAN 2.2 على بطاقات AMD/ROCm يعمل أحياناً أبطأ بـ 4-5 مرات في المقطع الثاني مقارنة بالأول، بسبب سلوك تفريغ VRAM. تؤدي إعادة التشغيل الكاملة إلى استعادة السرعة. هذه مشكلة معروفة تعالجها تصحيحات الجهات الخارجية بشكل غير متسق.

تشوهات الحركة البطيئة في WAN 2.2: يُبلغ بعض المستخدمين أن WAN 2.2 يميل افتراضياً إلى توليد لقطات تبدو وكأنها بالحركة البطيئة ما لم يتم تكوين إعدادات معدل الإطارات بشكل صريح. يتمثل الحل البديل للمجتمع في فرض عدد الخطوات وإعدادات fps في ComfyUI بدلاً من الاعتماد على الإعدادات الافتراضية.

صعوبة الإعداد للمستخدمين غير التقنيين: لا يُعد WAN منتجاً تفتحه وتنقر عليه. فهو يتطلب بيئة Python، ووضع النموذج في أدلة فرعية محددة، ومعرفة بمعلمات الاستنتاج. تحل Wan2GP والأدوات المساعدة السحابية التابعة لجهات خارجية هذه المشكلة، لكنها تضيف زمن انتقال وتحد أحياناً من متغيرات النموذج المتاحة.

أفضل حالات الاستخدام مقابل سيناريوهات التخطي

استخدم WAN عندما: تريد أفضل توليد فيديو مفتوح المصدر دون تكلفة لكل مقطع. لديك بطاقة RTX 3060 أو أفضل (أو ترغب في استئجار وقت GPU). تريد الضبط الدقيق على لقطاتك أو أسلوبك الخاص. تحتاج إلى توليد دون اتصال بالإنترنت بدون استدعاءات API أو حدود معدل أو سياسات محتوى. أنت بالفعل في النظام البيئي لـ ComfyUI وتريد إضافة الفيديو إلى مسارات عمل الصور الحالية. تريد حقوقاً تجارية دون رسوم استخدام. أنت تبني مسار عمل يحتاج إلى تحرير الفيديو، أو الرسم الداخلي، أو التعديل الموجه بالتعليمات بالإضافة إلى التوليد الأولي.

تخطَّ WAN عندما: تحتاج إلى أداة ويب بدون إعداد ولست مرتاحاً لبيئات سطر الأوامر. أنت تعمل على محتوى سردي متعدد الشخصيات حيث يكون اتساق الوجه أمراً بالغ الأهمية. ستتفوق الأدوات التجارية ذات أنظمة ذاكرة الشخصيات على WAN 2.1-2.5 في هذا الصدد. أنت تعمل على جهاز بذاكرة VRAM أقل من 6 جيجابايت (حتى Wan2GP يصل إلى حد أدنى). تريد جودة استنتاج "وضع التفكير" (Thinking Mode) في Wan 2.7 دون دفع أسعار واجهة برمجة التطبيقات. إذا كانت أولويتك هي أسرع سرعة تكرار ممكنة، فإن Pika أو Runway ستولد مقاطع في ثوانٍ مقابل دقائق، وهو أمر مهم للمسودات الإبداعية السريعة.

كان إصدار Wan 2.1 في 25 فبراير 2025 نقطة تحول حقيقية لمساحة توليد الفيديو مفتوح المصدر. لم يقتصر الأمر على سد الفجوة مع النماذج التجارية؛ فوفقاً لدرجات VBench، فقد تصدر القائمة عند الإطلاق. أصبح نموذج Squish Effect LoRA (مارس 2025)، وهو نموذج دربه المجتمع يجعل أي كائن يتشوه بفيزياء واقعية، أحد أكثر العروض التوضيحية لفيديو الذكاء الاصطناعي مشاركة في أوائل عام 2025 وأوضح ما يمكن أن ينتجه النظام البيئي للضبط الدقيق فوق الأوزان المفتوحة. تلك الطاقة الإبداعية المجتمعية، من حزم LoRA إلى قوالب مسارات عمل ComfyUI إلى مُحسِّن VRAM في Wan2GP، هي العلامة الأكثر موثوقية على أن النموذج يتمتع بقوة البقاء في المساحة مفتوحة المصدر.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن WAN (Wan-Video / Wan2GP).

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ WAN (Wan-Video / Wan2GP).