
Mochi 1 هو نموذج مفتوح المصدر لتوليد الفيديو من Genmo بـ 10 مليارات معلمة، تم إصداره بموجب ترخيص Apache 2.0 في أكتوبر 2024. يقوم بتوليد مقاطع بدقة 480p بمعدل 30fps مع التزام قوي بالمطالبات. الأوزان متاحة للتنزيل مجانًا والتشغيل التجاري بدون حقوق ملكية.
Mochi 1 هو نموذج مفتوح المصدر لتحويل النص إلى فيديو من تطوير Genmo، وهي شركة ذكاء اصطناعي ناشئة في سان فرانسيسكو مدعومة بتمويل قدره $28.4 مليون في السلسلة أ. تم إصداره في 22 أكتوبر 2024 بموجب ترخيص Apache 2.0، ويوفر قدرة توليد فيديو بـ 10 مليارات معلمة متاحة مجانًا للاستخدام الشخصي والتجاري، مع استضافة الأوزان على Hugging Face وقاعدة التعليمات البرمجية الكاملة على GitHub. عند الإطلاق، وصفته Genmo بأنه "أكبر نموذج توليدي للفيديو تم إصداره كمصدر مفتوح على الإطلاق"، وظل هذا الادعاء قائمًا لمدة شهرين تقريبًا: لم يضاهِ أي نموذج مفتوح آخر مزيجه من الحجم وجودة الحركة والترخيص المرن.
يستخدم النموذج بنية Asymmetric Diffusion Transformer (AsymmDiT) بـ 48 طبقة، ونافذة سياق بصري بـ 44,520 رمزًا، وVAE بـ 362 مليون معلمة يضغط الفيديو إلى مساحة كامنة أصغر بـ 128 مرة. المخرجات بدقة 480p بمعدل 30 إطارًا في الثانية لمدة تصل إلى 5.4 ثانية، مدفوعة بمشفر نصوص T5-XXL ينتج التزامًا قويًا بالمطالبات عبر الحركة المادية وسلوك الكاميرا والمشاهد متعددة العناصر. يسمح إصدار Apache 2.0 بالضبط الدقيق، وتكييف LoRA (تمت إضافته في نوفمبر 2024)، والنشر التجاري دون التقيد بمورد معين. تدير Genmo أيضًا بيئة عمل مستضافة على الويب على genmo.ai باشتراك قائم على الأرصدة يبدأ من $10 شهريًا للفرق التي لا ترغب في إدارة البنية التحتية لوحدات معالجة الرسومات (GPU) الخاصة بها.
كيف تبدو مخرجات Mochi 1 فعليًا في أبريل 2026
قمنا بتوليد مقطع مدته 5 ثوانٍ لقطرة ماء بالحركة البطيئة تضرب سطح بركة ساكنة باستخدام بيئة العمل المستضافة genmo.ai في أبريل 2026. كان انتشار التموجات معقولًا فيزيائيًا عبر مدة المقطع بالكامل، مع عدم وجود تشوهات تحولية عند حافة الماء. احتفظت مخرجات 480p بتفاصيل كافية لجدول زمني بدقة 1080p مع تطبيق الترقية في مرحلة ما بعد الإنتاج، على الرغم من أن الضغط المرئي أصبح واضحًا في النسخة المرقاة عند الفحص الدقيق. بدا معدل الإطارات عند 30fps سلسًا للمواد المصدرية ذات الحركة البطيئة، على الرغم من أن الحد الأقصى البالغ 5.4 ثانية قطع مرحلة الاستقرار الطبيعي لتسلسل التموجات.
اعتبارًا من أبريل 2026، لا يزال النموذج المُصدر للجمهور ينتج فيديو بدقة 480p بمعدل 30fps لمقاطع تصل مدتها إلى 5.4 ثانية. وعدت Genmo بمتغير Mochi 1 HD يستهدف دقة 720p قبل نهاية عام 2024؛ لكن هذا الجدول الزمني تأخر، وظلت مشكلة على GitHub في فبراير 2025 تطلب توضيحًا بشأن إصدار HD دون إجابة من الفريق. تنص بطاقة النموذج الرسمية على أن النموذج "يُحسّن للأنماط الواقعية" وأنه "يمكن أن تحدث أيضًا تشوهات وانحرافات طفيفة" في حالات الحركة الشديدة. جمع النموذج أكثر من 100 مساحة (Spaces) على Hugging Face، و5 محولات، و6 عمليات ضبط دقيق، و4 عمليات تكميم (quantizations) من المجتمع، مما يعكس الاستخدام النشط المستدام على الرغم من قيوده الفنية.
"هناك منحنى تعليمي، ولكن بمجرد صياغة مطالبات جيدة، يبدو الأمر وكأنك تخرج فيلمًا قصيرًا من Pixar." - مراجع على G2، عبر Geniusfirms.com، 2025
أفضل حالات الاستخدام، والكوارث التي يجب تجنبها
يكتسب Mochi 1 مكانته في مسارات العمل حيث يكون ترخيص Apache 2.0 مهمًا، وتكون الجودة الواقعية هي الأولوية، وتمتلك الفرق إما البنية التحتية الخاصة بها لوحدات معالجة الرسومات (GPU) أو ميزانية استضافة متواضعة. صانعو الأفلام المستقلون الذين يستكشفون تصور المشاهد بمساعدة الذكاء الاصطناعي، وفرق التسويق التي تبني عروضًا توضيحية قصيرة للمنتجات، وباحثو تعلم الآلة (ML) الذين يحتاجون إلى الضبط الدقيق على مجموعات بيانات مرئية خاصة، لديهم جميعًا أسباب وجيهة لاختيار Mochi 1 على البدائل.
تعد إمكانية الضبط الدقيق عبر LoRA المضافة في نوفمبر 2024 ذات قيمة خاصة لحالات استخدام اتساق العلامة التجارية. يمكن لفريق تدريب Mochi على مجموعة من المراجع المرئية المعتمدة، ثم إنشاء مقاطع فيديو متوافقة مع العلامة التجارية عبر الحملات دون إعادة كتابة المطالبات من الصفر. الأدوات مغلقة المصدر من Runway أو Pika أو Kling لا تسمح بمسار العمل هذا. على المنصة المستضافة، تناسب فئة Lite البالغة $10/شهريًا والتي تغطي حوالي 12 عملية توليد فيديو شهريًا المبدعين المستقلين الذين يبنون محتوى اجتماعيًا واقعيًا دون إعداد بنية تحتية محلية لوحدات معالجة الرسومات.
الكوارث: توجيه Mochi نحو الأنمي، أو الرسوم المتحركة، أو التظليل الخلوي (cel-shaded)، أو الأنماط الفنية المرسومة سيؤدي إلى نتائج سيئة. تم تدريب النموذج على لقطات واقعية وليس لديه آلية موثوقة لنقل النمط الجمالي. حاول إنشاء تسلسل حركة سريع وستظهر تشوهات تحولية عند الحواف. حاول تشغيله على وحدة معالجة رسومات بسعة 12GB وستنتج الإصدارات المكممة تدهورًا ملحوظًا في الجودة. استخدمه للتكرار السريع للمفاهيم عبر العديد من اختلافات المطالبات وسيصبح وقت التوليد البالغ 8-20 دقيقة لكل مقطع عنق زجاجة إبداعيًا بسرعة.
التحكم في الحركة والكاميرا، ومدى صموده
يعد التحكم في الحركة أحد أقوى القدرات المثبتة لـ Mochi 1. تطبق نافذة السياق البصري لـ AsymmDiT البالغة 44,520 رمزًا انتباهًا ثلاثي الأبعاد كاملًا عبر تسلسل الفيديو، وهو ما تعزوه Genmo إلى تماسك النموذج من إطار إلى إطار. من الناحية العملية، يظهر هذا بوضوح في الحركة المدفوعة بالفيزياء: ديناميكيات السوائل، وحركة الشعر، ومحاكاة القماش، والإيماءات البشرية البطيئة، جميعها تحافظ على الاتساق المكاني بشكل أفضل من النماذج المفتوحة السابقة.
يتم التعبير عن التحكم في الكاميرا بشكل أساسي من خلال لغة المطالبة. إن وصف اتجاهات التحريك (pan)، ومعدلات التكبير/التصغير، وزوايا الإمالة، وحركات التتبع في المطالبة النصية ينتج نتائج تتوافق مع تلك التعليمات بشكل أكثر موثوقية من العديد من النماذج المماثلة. تعرض الواجهة المستضافة genmo.ai أيضًا عناصر تحكم في شدة الحركة تتراوح من المستقرة (حوالي 50%) إلى الديناميكية للغاية (حتى 99%)، مما يمنح المستخدمين غير التقنيين نهجًا قائمًا على شريط التمرير لسلوك الحركة دون الحاجة إلى هندسة المطالبات. ما لا يدعمه النموذج بشكل أصلي هو تحويل الصورة إلى فيديو بمسار كاميرا منظم، مما يحد من استخدامه في مسارات عمل التكوين السينمائي الخاضع للرقابة.
الحركة الشديدة هي حيث يتدهور التحكم. تدفع حركات الكاميرا السريعة، وحركة الكائنات السريعة، وتسلسلات الحركة عالية التردد النموذج نحو تشوهات الالتواء عند حدود الكائنات. تعترف بطاقة النموذج الرسمية بذلك صراحةً. الإجماع بين مستخدمي مسار عمل ComfyUI هو أن الحفاظ على شدة الحركة أقل من 80% ينتج مخرجات أنظف لمعظم أنواع الكائنات.
"يتطلب النموذج طول تسلسل يبلغ 44,520 رمزًا لتوليد الفيديو مما يستهلك الذاكرة، ويعد VAE مستهلكًا ضخمًا للذاكرة. أخبار سارة: تم تقليل المتطلبات بحيث أصبح من الممكن الآن تشغيله على وحدة RTX 4090 واحدة." - ved-genmo (عضو فريق Genmo)، سلسلة نقاش Hugging Face، 1 نوفمبر 2024
حدود التصدير: الدقة، الطول، العلامات المائية
تنتج الأوزان مفتوحة المصدر فيديو بدقة 480p (848x480) بمعدل 30fps، بحد أقصى 5.4 ثانية (162 إطارًا). لا توجد علامة مائية أصلية على المخرجات المولدة محليًا؛ يسمح ترخيص Apache 2.0 بالتصدير غير المقيد. يمكن لمسارات عمل الترقية المجتمعية باستخدام Real-ESRGAN أو أدوات مماثلة رفع الدقة الفعالة إلى 1080p، على الرغم من أن دقة 480p المرقاة لا تعادل دقة 720p الأصلية، خاصة في تفاصيل الوجه والملمس الدقيق عند مسافات المشاهدة القريبة.
على المنصة المستضافة genmo.ai، تطبق الفئة المجانية علامة Genmo المائية على جميع المخرجات. تزيل الفئات المدفوعة (Lite بسعر $10/شهريًا و Standard بسعر $30/شهريًا) العلامة المائية وتمنح حقوق الاستخدام التجاري على المقاطع المولدة عبر الاستضافة. لا يوجد خيار لتصدير مقاطع أطول من 5.4 ثانية من عملية توليد واحدة؛ تتطلب التسلسلات الأطول دمج مقاطع متعددة في مرحلة ما بعد الإنتاج. تصدر المنصة المستضافة ملفات MP4؛ يتم تعيين نسبة العرض إلى الارتفاع قبل بدء التوليد مع توفر خيارات 16:9 و 9:16 و 1:1 لتنسيقات وسائل التواصل الاجتماعي.
مسار عمل حقيقي: تحريك منتج علامة تجارية باستخدام Mochi 1
يسير مسار عمل تحريك منتج تجارة إلكترونية نموذجي باستخدام Mochi 1 على المنصة المستضافة على النحو التالي. يقوم المبدع بتحميل صورة ثابتة للمنتج (زجاجة عطر، على سبيل المثال)، ويستخدم أداة الفرشاة الانتقائية على genmo.ai لتحديد منطقة السائل الداخلية كمنطقة للتحريك، ثم يضيف مطالبة نصية تصف حركة دوامية لطيفة مع إضاءة محيطية ناعمة. يستغرق التوليد من 2 إلى 5 دقائق في قائمة انتظار الاستضافة. المخرج عبارة عن ملف MP4 مدته 5 ثوانٍ بدقة 480p يُظهر السائل يتحرك داخل الزجاجة بينما يظل الزجاج والملصق ثابتين. يقوم المبدع بالتنزيل، ويطبق ترقية Real-ESRGAN للوصول إلى دقة 1080p، ويضيف خلفية موسيقية في محرر منفصل، وينشر على Instagram Reels. إجمالي الوقت من التحميل إلى المقطع المنشور: حوالي 15-20 دقيقة. التكلفة في فئة Lite: حوالي 83 سنتًا لكل عملية توليد فيديو (100 رصيد بسعر $10/1,200 رصيد).
بالنسبة لمتغير بحثي مستضاف ذاتيًا، قد يقوم فريق تعلم الآلة (ML) بضبط Mochi دقيقًا عبر LoRA على 500 مقطع فيديو معتمد للعلامة التجارية، مما ينتج نموذجًا مكيفًا مع المجال يولد باستمرار صورًا متوافقة مع العلامة التجارية دون إعادة كتابة أوصاف النمط. يتطلب مسار العمل هذا بنية تحتية لوحدات معالجة الرسومات (RTX 3090 أو أفضل للاستدلال، ومجموعة وحدات معالجة رسومات متطورة لتدريب LoRA) ولكنه لا يكلف شيئًا في رسوم الترخيص وينتج مخرجات لا تملك Genmo أي رؤية لها.
التكلفة الحقيقية لكل فيديو نهائي
الاستضافة الذاتية: الحوسبة فقط. تشغيل RTX 4090 لمدة 8-20 دقيقة لكل عملية توليد على منصة تأجير سحابية بحوالي 80 سنتًا في الساعة يضع التكلفة عند 10-30 سنتًا لكل مقطع. الفريق الذي يمتلك بنية تحتية خاصة لوحدات معالجة الرسومات يدفع فقط تكلفة الكهرباء، مما يقترب من تكلفة هامشية صفرية لكل فيديو. تقدم خدمات وحدات معالجة الرسومات السحابية مثل RunPod و Lambda Labs وصولاً إلى A100 بحوالي $1.50-$2.50 في الساعة، مما يضع عملية توليد Mochi النموذجية عند 20-80 سنتًا اعتمادًا على تعقيد المقطع.
الاستضافة عبر genmo.ai: تكلف كل عملية توليد فيديو لـ Mochi 100 رصيد. تنقسم الفئات على النحو التالي:
مجاني (مستضاف): $0/شهريًا، 50 رصيدًا/شهريًا، علامة Genmo المائية، للاستخدام الشخصي فقط. يغطي حوالي 0-1 عملية توليد فيديو لـ Mochi شهريًا بعد نفاد مكافأة التسجيل الأولية.
Lite (مستضاف): $10/شهريًا، 1,200 رصيد/شهريًا (حوالي 12 عملية توليد لـ Mochi)، بدون علامة مائية، استخدام تجاري، أولوية عالية في قائمة الانتظار. الفوترة السنوية تقلل السعر بنسبة 20%.
Standard (مستضاف): $30/شهريًا، 5,000 رصيد/شهريًا (حوالي 50 عملية توليد لـ Mochi)، بدون علامة مائية، أسرع قائمة انتظار، وصول مبكر للنماذج. الفوترة السنوية تقلل السعر بنسبة 20%.
تبلغ أسعار واجهة برمجة تطبيقات Replicate لـ Mochi 1 حوالي $0.42 لكل عملية توليد (حوالي عمليتين لكل $1)، مما يجعله خيارًا قابلاً للتطبيق للمطورين الذين يحتاجون إلى استدلال مستضاف دون التزام باشتراك.
Mochi 1 مقابل HunyuanVideo مقابل LTX-Video
يستخدم HunyuanVideo (Tencent، ديسمبر 2024) 13 مليار معلمة مقابل 10 مليارات لـ Mochi، وهو مبني على بنية Mixture-of-Experts مع وحدات توجيه نصي عبر الإطارات بدلاً من AsymmDiT الخاص بـ Mochi. يعد اختلاف دقة المخرجات هو التغيير الأكثر وضوحًا: يولد HunyuanVideo دقة 1280x720 بشكل أصلي مقابل 848x480 لـ Mochi. في معيار VBench، يسجل HunyuanVideo 83.2 مقابل 77.4 لـ Mochi، مع مزايا في الجودة السينمائية، ودقة الوجوه عبر شخصيات متعددة، وتماسك الحركة في الفترات الأطول. المقايضة هي السرعة: يستغرق HunyuanVideo حوالي 45 دقيقة لتوليد مقطع مدته 5 ثوانٍ على A100، مقابل 8 دقائق لـ Mochi. يستخدم HunyuanVideo ترخيصًا مخصصًا بشروط تجارية؛ بينما Mochi 1 بترخيص Apache 2.0 بدون قيود. بالنسبة للمشاريع التي تضع الجودة أولاً حيث يكون وقت التوليد ثانويًا، فإن HunyuanVideo هو الرائد الحالي مفتوح المصدر. للحصول على وضوح الترخيص أو التكرار الأسرع، يعد Mochi 1 أكثر عملية.
يتخذ LTX-Video (Lightricks) المقايضة المعاكسة. يستخدم نموذجه الأساسي ملياري معلمة (مع توفر متغير تطوير بـ 13 مليارًا أيضًا) ويستخدم الانتباه المجزأ (factorized attention)، حيث يعالج الأبعاد المكانية والزمانية بشكل مستقل بدلاً من الانتباه ثلاثي الأبعاد الكامل لـ Mochi عبر 44,520 رمزًا. النتيجة: يولد LTX-Video مقطعًا مدته 5 ثوانٍ في حوالي 45 ثانية على A100 مقابل 8 دقائق لـ Mochi، ويعمل على 8GB من VRAM مقابل الحد الأدنى البالغ 17-18GB لـ Mochi. تصل دقة المخرجات إلى 1216x704. درجة VBench الخاصة به هي 71.2، أقل من 77.4 لـ Mochi، مما يعكس مقايضة الجودة التي تم إجراؤها لتحقيق السرعة. يستخدم LTX-Video ترخيصًا مخصصًا، وليس Apache 2.0. للتكرار السريع للمفاهيم عبر العديد من اختلافات المطالبات، يعد LTX-Video هو الخيار الافتراضي العملي. للحصول على جودة واقعية مستدامة بموجب ترخيص تجاري نظيف، يثبت Mochi 1 جدارته.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن Mochi 1.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Mochi 1.

AI Video Generator Prompting: The Filmmaker's Real Workflow

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)
