

HunyuanVideo هو نموذج توليد الفيديو مفتوح المصدر من Tencent، تم إطلاقه في ديسمبر 2024 بـ 13 مليار معلمة. ينافس النماذج مغلقة المصدر مثل Runway Gen-3 في الجودة البصرية، ويعمل محلياً عبر ComfyUI، وقد أنتج أكثر من 500 نموذج LoRA مجتمعي على CivitAI. ---
قمنا بتوليد مقطع مدته 10 ثوانٍ لمدينة ساحلية ليلاً، مع تساقط المطر على شوارع مضاءة بالنيون، ولقطة تأسيسية واسعة تتراجع من سطح مبنى. قدم HunyuanVideo لقطات بدقة 720p مع حركة كاميرا متناسقة، وسلوك واقعي لقطرات المطر، وبدون وميض واضح بين الإطارات عند علامة الـ 5 ثوانٍ. عند 8 ثوانٍ، بدأ الاتساق الزمني يضعف عند حواف الكائنات المتحركة. وبحلول 10 ثوانٍ، انحرف تأثير البوكيه في الخلفية. يخبرك هذا تقريباً بكل ما تحتاج لمعرفته حول مكانة HunyuanVideo في أبريل 2026: الحد الأقصى للإمكانيات مثير للإعجاب حقاً، والحد الأدنى مقيد بالأجهزة، وقيود المدة الزمنية حقيقية.
HunyuanVideo هي عائلة نماذج توليد الفيديو مفتوحة المصدر من Tencent، تم إصدارها لأول مرة في 3 ديسمبر 2024 كأكبر نموذج فيديو مفتوح الأوزان في ذلك الوقت بـ 13 مليار معلمة. نما النظام البيئي منذ ذلك الحين ليشمل HunyuanVideo-1.5 (8.3 مليار معلمة، تم إصداره في نوفمبر 2025، ويستهدف وحدات معالجة الرسومات الاستهلاكية)، و HunyuanVideo-I2V (من صورة إلى فيديو، مارس 2026)، و HunyuanVideo-Avatar (تحريك الصور الشخصية بالصوت، مايو 2025). أوزان النموذج مجانية على Hugging Face بموجب ترخيص مجتمعي مخصص من Tencent. يعمل محلياً عبر ComfyUI، ويدعم الضبط الدقيق لـ LoRA، ولا يفرض أي رسوم لكل مقطع من Tencent. اعتباراً من أبريل 2026، يمتلك مستودع GitHub أكثر من 12,000 نجمة، وأنتج مجتمع CivitAI LoRA أكثر من 500 تعديل مدرب.
كيف تبدو مخرجات HunyuanVideo فعلياً في أبريل 2026
يولد النموذج الأصلي بـ 13 مليار معلمة مقاطع فيديو بدقة تتراوح بين 540p و 720p مع ما يصل إلى 129 إطاراً لكل مقطع. تماسك الحركة هو نقطة قوته الأبرز: تحافظ المشاهد التي تضم عدة أشخاص على اتساق الشخصيات عبر اللقطات حيث تفقد النماذج المنافسة هويتها، وتحافظ حركات الكاميرا مثل التحريك الأفقي والسحب على المنطق المكاني عبر طول المقطع بالكامل. يستخدم النموذج 3D VAE مع ضغط CausalConv3D وبنية Diffusion Transformer من تيار مزدوج إلى تيار أحادي، مما يدعم اتساقه الزمني في الفترات القصيرة.
يحقق HunyuanVideo-1.5 (8.3 مليار معلمة، بنية SSTA) نفس جودة المخرجات تقريباً مثل النموذج الأصلي بضعف سرعة الاستدلال تقريباً، مع خفض الحد الأدنى لمتطلبات VRAM إلى 14GB مع تفعيل التفريغ (offloading). الفارق في الجودة بين 1.5 والنموذج الأصلي أصغر من الفارق في متطلبات الأجهزة، ولهذا السبب يبدأ معظم الممارسين في أبريل 2026 باستخدام 1.5.
القيود المعروفة للمخرجات: تنتج التراكبات النصية خربشات غير مقروءة، وهو أمر متسق مع جميع نماذج انتشار الفيديو الحالية. تصبح تفاصيل الوجه الدقيقة "صعبة" في اللقطات المقربة. يتدهور الاتساق الزمني بعد 8-10 ثوانٍ من طول المقطع. مضاعفة دقة المخرجات تضاعف متطلبات الذاكرة أربع مرات تقريباً، مما يخلق سقفاً عملياً على البطاقات الاستهلاكية بسعة 24GB.
"لقد قمت بتشغيل hunyuanvideoai من GitHub الخاص بهم ويبدو أنه يولد مقاطع فيديو واقعية" - natvert، Hacker News، ديسمبر 2024 (مشيراً إلى أوقات توليد تتراوح بين 30-60 دقيقة على A6000 عند الإصدار الأصلي)
"بجدية، اذهبوا لتجربته لأنه يتفوق بسهولة على توليد الفيديو في cog و ltx في رأيي" - sdimg، r/StableDiffusion، ديسمبر 2024
أفضل حالات الاستخدام، والكوارث التي يجب تجنبها
ينتج HunyuanVideo أفضل نتائجه في:
اللقطات التأسيسية السينمائية واللقطات الداعمة (B-roll): اللقطات الواسعة مع الحركة البيئية (الطقس، الحشود، المشاهد الحضرية) حيث يكون الاتساق الزمني عبر الإطار الكامل أكثر أهمية من دقة ملامح الوجه.
المقاطع الترويجية القصيرة أقل من 8 ثوانٍ: عروض المنتجات، والمرئيات المجردة للعلامات التجارية، ولقطات الطبيعة حيث تظل المدة ضمن نافذة الاتساق الزمني للنموذج.
أعمال الشخصيات المضبوطة بدقة عبر LoRA: أنتج مجتمع CivitAI نماذج LoRA للأنماط والشخصيات تعمل على توسيع النموذج الأساسي لجماليات محددة. تعد نماذج LoRA لـ "استنساخ الفيديو" المدربة على 16-22 صورة مرجعية لكل موضوع نمط استخدام نشط.
HunyuanVideo-Avatar لمقدمي البرامج الرقميين: قم بتحميل صورة شخصية واحدة ومقطع صوتي. يتعامل النموذج مع مزامنة الشفاه، وتعبيرات الوجه، وحركة الجسم لمقدمي التجارة الإلكترونية، ومقدمي البث الافتراضي، والمحتوى الثقافي/التعليمي.
تجنب استخدام HunyuanVideo لأي شيء يتطلب نصاً مقروءاً على الشاشة، أو مقاطع أطول من 10 ثوانٍ بدون قطعات، أو لقطات مقربة عالية الدقة للرؤوس المتحدثة، أو دورات التكرار السريعة. مع استغراق 5-12 دقيقة لكل مقطع على RTX 4090، لا يمكنك تحمل تكلفة اختبار العديد من الاختلافات في جلسة واحدة.
التحكم في الحركة والكاميرا: مدى صموده
يتعامل HunyuanVideo مع حركة الكاميرا الضمنية بشكل جيد معقول من خلال هندسة الأوامر (وصف "التراجع"، "التحريك لليسار"، "محمول باليد") ولكنه لا يقدم تحكماً صريحاً في مسار الكاميرا بأسلوب ControlNet في سير العمل الأساسي. يفسر النموذج حركة الكاميرا دلالياً من النص بدلاً من قبول مسارات الكاميرا على مستوى الإطارات الرئيسية. بالنسبة لإعدادات الكاميرا الثابتة أو البطيئة، تكون النتائج موثوقة. أما بالنسبة لأعمال الكاميرا المعقدة متعددة المحاور، فإن النتائج غير متسقة.
يعد التعامل مع المشاهد متعددة الأشخاص نقطة قوة محددة. تحافظ البنية على هوية الشخصيات عبر 3-5 مواضيع مميزة حيث تفقد النماذج المماثلة ذات عدد المعلمات الأقل اتساقها. هذا مهم لمشاهد الحوار، ولقطات الحشود، وأي مقطع يظهر فيه نفس الشخص عبر إطارات متعددة.
تساهم وحدات التوجيه النصي عبر الإطارات في بنية Diffusion Transformer في تماسك الحركة، وتحديداً تقليل عيوب الوميض التي تعاني منها النماذج ذات المعلمات الأقل في عناصر الخلفية. يضغط 3D VAE المعلومات الزمنية بكفاءة، ولهذا السبب تصمد المقاطع التي تقل عن 8 ثوانٍ بشكل جيد حتى في إعدادات التوليد المضغوطة.
حدود التصدير: الدقة، الطول، العلامات المائية
لا يطبق HunyuanVideo أي علامات مائية. النموذج مستضاف ذاتياً؛ والمخرجات تنتمي بالكامل للمشغل. تتراوح خيارات الدقة عبر ComfyUI من 544p إلى 720p اعتماداً على مساحة VRAM المتاحة. تنسيق المخرجات القياسي هو MP4.
الحدود العملية في أبريل 2026:
129 إطاراً هو إعداد طول المقطع القياسي (~5 ثوانٍ بمعدل 24 إطاراً في الثانية، ~4.3 ثانية بمعدل 30 إطاراً في الثانية)
تتطلب المقاطع الأطول مساحة VRAM أكبر بكثير وتولد تدهوراً أسرع بشكل ملحوظ في جودة الاتساق الزمني
يتطلب التوليد بدقة 720p على النموذج الأصلي بـ 13 مليار معلمة 60GB من VRAM؛ وعلى HunyuanVideo-1.5 مع SSTA والتفريغ، تكون مساحة 14-16GB فعالة ولكنها بطيئة
يوفر تكميم FP8 حوالي 10GB من الذاكرة مقارنة بإعداد الدقة الافتراضي
يستثني الترخيص الاستخدام في الاتحاد الأوروبي، والمملكة المتحدة، وكوريا الجنوبية. هذا قيد إقليمي صارم في ترخيص مجتمع Tencent Hunyuan، وليس قيداً تقنياً، ولكنه يؤثر على ما إذا كان بإمكان المشاريع التجارية في تلك المناطق نشر المخرجات بشكل قانوني.
سير عمل حقيقي: صناعة الأفلام من النص إلى الفيديو باستخدام HunyuanVideo
يسير سير العمل النموذجي في ComfyUI لـ HunyuanVideo-1.5 في أبريل 2026 على النحو التالي. قم بتثبيت العقدة المخصصة kijai/ComfyUI-HunyuanVideoWrapper. قم بتحميل أوزان نموذج 1.5 من Hugging Face (tencent/HunyuanVideo-1.5). قم بتمكين تجزئة VAE (VAE tiling) لتوفير 4-6GB من VRAM على حساب زيادة وقت فك التشفير بنسبة 10-15%. اضبط خطوات أخذ العينات على 20-30 للتكرارات الأولية (يقلل من استخدام الذاكرة بنسبة 40% تقريباً مقارنة بـ 50 خطوة افتراضية مع فقدان ضئيل في الجودة المرئية). قم بتأكيد الإعدادات قبل إطلاق فك التشفير الكامل، نظراً لأن أخطاء نفاد ذاكرة VRAM لا تظهر إلا في مرحلة فك تشفير VAE بعد تشغيل التوليد الكامل بالفعل.
بالنسبة لـ HunyuanVideo-Avatar، سير العمل أبسط: قم بتحميل صورة شخصية واحدة ومقطع صوتي واحد، وحدد نمط التوليد (واقعي، متحرك، إلخ)، وقم بالتشغيل. يتعامل النموذج مع مزامنة الشفاه ونقل التعبيرات تلقائياً. وضع الشخصية الواحدة مفتوح المصدر بالكامل؛ وتم الإعلان عن إصدار وضع الشخصيات المتعددة كمفتوح المصدر في أواخر عام 2025.
يبلغ الممارسون الذين يديرون أعمال الإنتاج على أجهزة RTX 3090 عن 5-6 دقائق لكل مقطع مدته 5 ثوانٍ. يرى مستخدمو RTX 4090 من 8 إلى 12 دقيقة. ينخفض الوقت على A6000 (48-80GB VRAM) إلى 4-8 دقائق مع تمكين دقة 720p الكاملة دون تنازلات التكميم.
التكلفة الحقيقية لكل فيديو نهائي
أوزان النموذج مجانية. تأتي تكاليف الاستدلال من الكهرباء واستهلاك الأجهزة. بتكلفة حوسبة نموذجية لوحدة معالجة الرسومات تتراوح بين $0.50-$1.50/ساعة على مزودي الخدمات السحابية (RunPod، Replicate)، يكلف مقطع مدته 5 ثوانٍ بدقة 720p يستغرق 8-12 دقيقة حوالي $0.07-$0.30 لكل مقطع اعتماداً على فئة وحدة معالجة الرسومات والمزود. هذا أرخص بكثير من Runway Gen-3 ($0.05/ثانية عبر الاشتراك، ولكن مع بوابة اشتراك شهري) أو تسعير Luma القائم على الأرصدة.
تعتمد تكاليف الاستضافة الذاتية بالكامل على الأجهزة. إن شراء RTX 4090 المطفأ على مدى 3 سنوات وتشغيله لمدة 4 ساعات/يوم ينتج مقاطع بتكلفة فعلية أقل من $0.01 لكل منها عند الحجم الكبير. التكلفة الحقيقية هي وقت الإعداد ومنحنى التعلم لتكوين سير عمل ComfyUI.
بالنسبة للفرق في الاتحاد الأوروبي، والمملكة المتحدة، وكوريا الجنوبية، فإن قيد الترخيص يعني أن تصنيف HunyuanVideo كـ "مجاني" يأتي مع مخاطر قانونية للاستخدام التجاري، وقد تكون البدائل السحابية بدون استثناءات إقليمية مفضلة بغض النظر عن التكلفة لكل مقطع.
HunyuanVideo مقابل Mochi 1 مقابل LTX-Video
يتصدر HunyuanVideo في جودة المخرجات، وحجم المعلمات (13 مليار للأصلي، 8.3 مليار في 1.5)، واتساق المشاهد متعددة الأشخاص، والنظام البيئي المجتمعي (أكثر من 500 LoRA، و HunyuanVideo-Avatar، و HunyuanVideo-I2V). ضعيف في السرعة، وإمكانية الوصول إلى VRAM للنموذج الأصلي، ولديه ترخيص مخصص أكثر تقييداً مع استثناءات جغرافية.
يعد Mochi 1 (من Genmo، بـ 10 مليارات معلمة، وترخيص Apache 2.0) أقرب منافس في الجودة والخيار الأكثر تساهلاً من حيث الترخيص. تنتج بنيته Asymmetric Diffusion Transformer مع Asymmetric VAE (ضغط مكاني 8x8، وضغط زمني 6x) مخرجات أصلية بمعدل 30 إطاراً في الثانية، مما يمنحه ميزة حقيقية في معدل الإطارات مقارنة بمعدل الإطارات القابل للتكوين ولكن الافتراضي الأقل في HunyuanVideo. يتفوق Mochi 1 في الحركة الدقيقة فيزيائياً وتحريك الشخصيات. يتطلب VRAM أقل من نموذج HunyuanVideo الأصلي، ويسمح ترخيص Apache 2.0 الخاص به بالاستخدام التجاري عالمياً دون استثناءات إقليمية. المقايضة هي نظام بيئي مجتمعي أصغر وسقف أقل للتفاصيل الواقعية في الإعدادات المكافئة مقارنة بنموذج HunyuanVideo بـ 13 مليار معلمة.
تم بناء LTX-Video (من Lightricks، بنية DiT) لمقايضة مختلفة تماماً: السرعة على حساب الجودة القصوى. يولد LTX-Video لقطات مدتها 5 ثوانٍ بمعدل 24 إطاراً في الثانية بدقة 768x512 في حوالي 4 ثوانٍ على RTX 4090، مقارنة بـ 8-12 دقيقة في HunyuanVideo لمقاطع ذات طول مماثل. بالنسبة للعروض التوضيحية الحية، أو النماذج الأولية السريعة، أو التكرار من خلال العديد من اختلافات الأوامر، يعد LTX-Video الخيار المنطقي. سقف جودته أقل بشكل ملحوظ من HunyuanVideo، خاصة بالنسبة للاحتفاظ بالتفاصيل والمشاهد متعددة الأشخاص. يبلغ الحد الأقصى لدقة LTX-Video 1216x704.
شجرة القرار العملية: اختر HunyuanVideo عندما تكون جودة المخرجات هي الأولوية ولديك الأجهزة والصبر. اختر Mochi 1 عندما تحتاج إلى 30 إطاراً في الثانية أصلياً، وحركة دقيقة فيزيائياً، وترخيصاً أكثر وضوحاً. اختر LTX-Video عندما تكون سرعة التكرار أكثر أهمية من الجودة القصوى.
``` ---تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن HunyuanVideo.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ HunyuanVideo.

AI Video Generator Prompting: The Filmmaker's Real Workflow

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Sell AI-Generated Short Films on TikTok Shop, Instagram & YouTube (2026)

One Product Photo, Full Fashion Campaign: AI Images and Video That Sell (2026)
