تخطَّ إلى المحتوى الرئيسي
Vantaige
Gemini Omni screenshot
Gemini Omni logo

Gemini Omni

مجاني جزئيًا

يُعد Google Gemini Omni نموذجاً متعدد الوسائط لإنشاء وتحرير مقاطع الفيديو، تم إطلاقه في مؤتمر Google I/O 2026. يقبل النموذج أي مجموعة من النصوص والصور ومقاطع الفيديو والصوت كمدخلات، ثم يقوم بإنشاء أو تحرير الفيديو بأسلوب حواري. ولا يوجد حالياً أي نموذج آخر من الفئة الأولى يضاهي سير العمل هذا.

الميزات:API

يُعد Google Gemini Omni نموذجاً لإنشاء وتحرير مقاطع الفيديو من تطوير Google DeepMind، تم إطلاقه في 19 مايو 2026 في مؤتمر Google I/O. تم إصدار النموذج الأول، Gemini Omni Flash، في نفس اليوم عبر تطبيق Gemini و Google Flow. وتتمثل السمة المميزة له في الإدخال متعدد الوسائط الحقيقي: زوّده بموجه نصي، أو صورة، أو مقطع موجود، أو مسار صوتي، أو أي مجموعة منها، واحصل في المقابل على فيديو مُنشأ أو مُعدل. وقد وضعته Google DeepMind في مكانة "أكبر من مجرد تحديث لـ Veo"، مما يشير إلى أن Gemini Omni يمثل محاولة لدمج صناعة الأفلام التكرارية والحوارية مباشرة في خط منتجات Gemini.

تشمل القدرات الأساسية نقل النمط (تحويل اللقطات الواقعية إلى رسوم متحركة صلصالية، أو أنمي، أو فن خطي)، واستبدال الخلفية، وإزالة الكائنات، والتحرير متعدد الجولات مع الحفاظ على اتساق الشخصيات والإضاءة، والتأثيرات المدركة للفيزياء، وإنشاء مقاطع فيديو تعليمية توضيحية. ويُعد عرض النصوص نقطة قوة مؤكدة: فقد نجح Gemini Omni في عرض sin(x) + cos(x) = 1 بدقة على سبورة متحركة في اختبارات مستقلة، في حين فشل Seedance 2.0 في نفس الموجه. يقتصر طول المقاطع على 10 ثوانٍ عند الإطلاق، وهو ما تم تأكيده كقرار نشر وليس قيداً في النموذج. كما تم حجب ميزة تحرير الصوت والكلام (تغيير الحوار في اللقطات الحالية) عمداً في انتظار اختبارات السلامة.

ما يقدمه Gemini Omni في مايو 2026

يُنشئ Gemini Omni Flash مقاطع فيديو تصل مدتها إلى 10 ثوانٍ. ولم يتم الكشف علناً عن الدقة ومعدل الإطارات الدقيق. يتم دعم إنشاء الصوت والمزامنة بشكل أصلي: يمكنك إدخال مسار صوتي مرجعي وتوجيه Omni لمزامنة الأحداث المرئية معه (إضاءة الأنوار عند انخفاض الإيقاع، أو حفيف ورقة شجر عند عزف نغمة قيثارة). يدعم النموذج التحرير متعدد الجولات، مما يعني أن كل موجه لاحق يقوم بتحسين المخرجات السابقة بدلاً من إعادة الإنشاء من الصفر. وهذه هي الميزة الغائبة بوضوح عن كل النماذج المنافسة عند الإطلاق.

تشمل مجموعات الإدخال المدعومة النص وحده، والصورة وحدها، والفيديو وحده، والصورة مع النص، والفيديو مع النص، والفيديو مع صورة مرجعية، والفيديو مع الصوت والنص معاً. ويلخص الشعار في صفحة المنتج ذلك بشكل مباشر: "أنشئ أي شيء من أي مدخل". تشمل فئات الإنشاء تحويل النص إلى فيديو بالكامل، ونقل النمط من صورة إلى فيديو، والتحويل من فيديو إلى فيديو (تغيير الجماليات مع الحفاظ على الحركة)، وتبديل الكائنات والشخصيات في اللقطات الحالية، وتحرير الخلفية، وتعديل زاوية الكاميرا. الإعدادات المسبقة للأنماط التي تم عرضها عند الإطلاق: الرسوم المتحركة الصلصالية، والفن الخطي أحادي اللون، والأنمي، والألوان المائية، والتعديلات الفيزيائية الواقعية. يطبق النموذج الاستدلال الفيزيائي للعالم الحقيقي بدلاً من المزج على مستوى البكسل، ولهذا السبب ينجح التغيير في البنية مع تأثيرات مثل تموج المرآة السائل أو التشغيل المتزامن للصوت والفيديو.

موقع Gemini Omni مقارنة بـ Veo 3 و Seedance 2.0

المنافس الأوضح داخل كتالوج Google نفسه هو Veo 3. يُعد Veo 3 نموذج فيديو متخصصاً يركز على الإنشاء، وينتج مقاطع تصل مدتها إلى 8 ثوانٍ مع تركيب صوتي أصلي (مؤثرات صوتية، وأجواء، وموسيقى يتم إنشاؤها جنباً إلى جنب مع الفيديو في تمريرة واحدة). تندرج مخرجاته باستمرار ضمن الفئة "السينمائية": لقطات حادة وذات مصداقية عاطفية تناسب الأفلام القصيرة والمحتوى الاجتماعي الراقي. ما لا يستطيع Veo 3 فعله هو قبول مدخلات متعددة الأنواع في وقت واحد أو إجراء تحرير متعدد الجولات داخل الدردشة. أنت تعطيه موجهاً، فيعيد لك مقطعاً، وهذا هو التفاعل. أما Gemini Omni فهو على النقيض من ذلك: مسار التحرير الحواري والإدخال متعدد الوسائط هما السببان الأساسيان لوجوده، وهو يضحي ببعض اللمسات السينمائية الخام الموجودة في Veo 3 للوصول إلى ذلك. بالنسبة لصناع الأفلام الذين يريدون أفضل مقطع مدته ثماني ثوانٍ، يظل Veo 3 الخيار الأفضل. أما بالنسبة للمبدعين الذين يحتاجون إلى تكرار مشهد عبر عشرة تعديلات دون إعادة توجيه السياق بأكمله، فإن Omni أكثر قدرة من الناحية الهيكلية.

الرائد الخارجي في المعايير هو Seedance 2.0 من ByteDance. يعرض Seedance القماش والشعر والماء وحركة الإنسان بما يسميه المراجعون باستمرار "الوزن السينمائي"، وهي مصداقية في فيزياء الحركة تلاحظها العيون المدربة على الفور. في اختبار مقارنة مباشر أجرته ReviewsTown (مايو 2026)، تفوق Seedance 2.0 على Omni في فيزياء الطعام واستمرارية حركة الإنسان. وقد عبّر منشئ المحتوى على YouTube الذي غطى إطلاق I/O 2026 عن ذلك بوضوح في تغطيته الأولية:

"هذا ليس مثيراً للإعجاب بالنسبة لي. لدينا بالفعل نماذج فيديو أخرى متعددة الوسائط قادرة على القيام بأشياء مماثلة مثل Kling Free وكذلك Seedance 2.0. وعلى الأقل من خلال اختباراتي الأولية، لا يبدو أن Gemini Omni بجودة Seedance 2.0 من حيث التشريح ومشاهد الحركة العالية. على الأقل هذا هو انطباعي الأولي." - منشئ محتوى على YouTube (تغطية إطلاق I/O 2026)، YouTube، مايو 2026

كما أن تكلفة Seedance 2.0 أقل لكل مقطع: يتراوح الوصول إلى واجهة برمجة التطبيقات (API) التابعة لجهات خارجية بين $0.06 و $0.15 تقريباً لكل ثانية من الفيديو المُنشأ مقابل نموذج الاشتراك المقيد بحصة في Omni. يتفوق Omni بوضوح على Seedance في التحرير داخل الدردشة (لا يمتلك Seedance 2.0 أي قدرة على التحرير التكراري على الإطلاق) وعرض النصوص/المعادلات داخل الفيديو. هذه مزايا موثقة لا تسد فجوة الجودة السينمائية، لكنها تخلق حالات استخدام حقيقية. يجد المبدعون الذين يجمعون بين Omni و Runway أو Kling AI للقطات الحركة الأثقل تقسيماً عملياً للمهام.

التكلفة الحقيقية للإنشاء باستخدام Gemini Omni

يُعد Gemini Omni منتجاً مجانياً جزئياً (FREEMIUM). يتوفر الوصول المجاني فقط على YouTube Shorts وتطبيق YouTube Create، ويقتصر على تلك المنصات. للوصول عبر تطبيق Gemini أو Google Flow، يلزم الحصول على اشتراك مدفوع في Google AI. الفئات الثلاث التي تتضمن Gemini Omni هي AI Plus بسعر $7.99/شهرياً، و AI Pro بسعر $19.99/شهرياً، و AI Ultra بدءاً من $99.99/شهرياً (تم تخفيضه من نقطة الدخول السابقة البالغة $249.99 في I/O 2026).

واقع الاستخدام مقيد. وثقت اختبارات مستقلة أن عمليتي إنشاء فيديو تستهلكان حوالي 86 بالمائة من مخصصات AI Pro ليوم واحد. وهذا يعني أقل من ثلاثة مقاطع فيديو يومياً على خطة $19.99/شهرياً قبل نفاد الحصة، وهذه الحصة مشتركة مع مهام النصوص والتعليمات البرمجية والصور. يتم تصنيف أرصدة Flow Omni حسب الخطة: 200 رصيد في AI Plus، و 1,000 في AI Pro، وما بين 10,000 و 25,000 في AI Ultra. ابتعدت Google عن الحدود الشهرية الثابتة للموجهات إلى نموذج استخدام قائم على الحوسبة في I/O 2026، مما تسبب في إحباط بين مشتركي AI Pro الحاليين الذين اعتمدوا على حزمة 1,000 رصيد شهري يمكن التنبؤ بها والتي تمت إزالتها كجزء من إعادة ترتيب الخطط. شهدت Reddit ووسائل التواصل الاجتماعي انتقادات بأن النظام الجديد يجعل الحدود "أقل قابلية للتنبؤ" لأغراض الميزانية.

بالنسبة للمبدعين الذين ينتجون أكثر من بضعة مقاطع أسبوعياً، تُعد خطة AI Ultra بسعر $99.99/شهرياً هي فئة الإنتاج الواقعية. لم يتم تسعير واجهة برمجة تطبيقات المطورين (API) عند الإطلاق ("قادمة في غضون أسابيع" وفقاً لإعلان Google). بالمقارنة مع Pika أو WAN حيث يمكن التنبؤ بالأرصدة لكل عملية إنشاء، فإن حصة Gemini Omni القائمة على الحوسبة تُدخل حالة من عدم اليقين في التخطيط في كل فئة أقل من Ultra.

أين يفشل Gemini Omni باستمرار

تُعد فجوة التشريح والحركة العالية هي القيد الأكثر توثيقاً. يؤكد العديد من المراجعين المستقلين، بدءاً من منشئ المحتوى على YouTube الذي غطى حدث الإطلاق إلى مقال المقارنة الخاص بـ iGeekPhone، أن حركة الإنسان المعقدة (الرقص، والرياضة، وتسلسلات الحركة العالية)، والتشريح المتطلب بدنياً (الأيدي، والأفواه، وفيزياء تناول الطعام)، والمشاهد التي تتطلب وزناً وزخماً، تتخلف جميعها عن Seedance 2.0 و Kling V3.0 عند الإطلاق. في اختبار تناول المعكرونة الخاص بـ ReviewsTown، ظهرت المعكرونة واختفت بشكل غير متسق عبر الإطارات حيث حافظ Seedance على الاستمرارية المادية. يظل Kling V3.0 رائداً في هذه الفئة لحركة الإنسان بما في ذلك إيماءات اليد والرقص والرياضة.

النمط المرئي هو شكوى متكررة منفصلة. يصف العديد من المراجعين مخرجات Omni بأنها "مثل منتج Google: نظيفة وقوية وذات طابع مؤسسي قليلاً". وصف الناقد على X/Twitter @shlomifruchter المخرجات بأنها "مصقولة للغاية/تشبه القوالب"، ووصف @teortaxesTex (TextOrtaxes) الأسلوب المرئي بأنه يشبه "واجهة لعبة فيديو من الفئة ب". يمثل هذا قيداً إبداعياً حقيقياً: ينتج النموذج لقطات صحيحة تقنياً تفتقر إلى المصداقية العاطفية و"الإحساس" السينمائي الذي تقدمه مخرجات Seedance 2.0 في أفضل حالاتها.

"مصقولة للغاية/تشبه القوالب" - @shlomifruchter، X/Twitter، مايو 2026

ثلاثة أنماط فشل متسقة أخرى: (1) تحظر فلاتر أمان المحتوى الخاصة بـ Google الموجهات التي تشير إلى شخصيات عامة حقيقية بالاسم، مما يتطلب حلولاً بديلة تضيف احتكاكاً إلى سير العمل الإبداعي. (2) ميزة تحرير الصوت والكلام غائبة عن إصدار الإطلاق، مما يحد من فائدة Omni في الدبلجة أو مزامنة الشفاه أو استبدال الحوار. (3) الحد الأقصى للمقطع البالغ 10 ثوانٍ هو سقف صارم. عند الإطلاق، يصطدم المبدعون الذين يعملون على أي شيء أطول من مقطع اجتماعي قصير أو عرض توضيحي لمنتج بهذا الجدار على الفور. كما أن اتساق الشخصية عبر لقطات متعددة، والذي وصفه أحد التحليلات بأنه "الجرح المفتوح لفيديو الذكاء الاصطناعي"، يؤثر أيضاً على Omni إلى جانب كل النماذج الأخرى في هذه الفئة.

كيفية توجيه Gemini Omni للحصول على أفضل النتائج

يحدد دليل الموجهات الرسمي من Google خمسة أبعاد للحصول على مخرجات موثوقة: تأطير اللقطة وحركتها، والأسلوب المرئي، والإضاءة، والموقع، والحركة. المبدأ الأساسي: "كلما أضفت المزيد من التفاصيل، زاد تحكمك في المخرجات النهائية". يستخدم النموذج استدلال Gemini لملء السياق الواقعي، لذا تجنب الإفراط في تحديد العناصر الثانوية مع توخي الدقة في تلك الأبعاد الخمسة.

بالنسبة لتأطير اللقطة، استخدم مصطلحات التصوير السينمائي: أنواع اللقطات ("ثابتة"، "مقفلة"، "لقطة واحدة متصلة")، والحركات ("الاندفاع للداخل"، "تكبير/تصغير الكاميرا المتحركة")، وأنماط الكاميرا ("كاميرا سينمائية"، "نمط كاميرا الويب"، "تكبير/تصغير طبيعي للهاتف الذكي"). بالنسبة للأسلوب، قم بتسمية الجمالية مباشرة: "سينمائي"، "رسوم متحركة صلصالية"، "أنمي"، "ألوان مائية". بالنسبة للإضاءة، حدد المصدر والجودة: "شمس دافئة في أواخر فترة ما بعد الظهر"، "مصابيح فلورسنت علوية واضحة". بالنسبة للحركة، صِف ما يحدث إطاراً بإطار بدلاً من التلميح إليه. بالنسبة لسير العمل متعدد المدخلات، قم بتضمين مراجع مرئية مثل القصص المصورة أو صور الشخصيات للحفاظ على الاتساق عبر التعديلات. بالنسبة لمزامنة الصوت، كن صريحاً بشأن المحفز: "تُضاء الأنوار عند انخفاض نغمة الجهير" يتفوق على "تستجيب الأنوار للموسيقى". بالنسبة للتحرير متعدد الجولات، يقوم كل موجه لاحق بتحسين المخرجات الحالية دون الحاجة إلى إعادة توجيه المشهد بأكمله بالكامل.

أفضل حالات الاستخدام مقابل السيناريوهات التي يجب تجنبها

يُعد Gemini Omni الأداة المناسبة عندما يكون التحرير التكراري هو الهدف. لا يوجد نموذج آخر من الفئة الأولى يتيح لك تغيير خلفية، وإزالة كائن، وتبديل شخصية عبر جولات متعددة مع الحفاظ على الاتساق المرئي. المحتوى التعليمي مناسب جداً: الرسوم المتحركة الصلصالية لطي البروتين، ومعادلات السبورة، ومقاطع الفيديو التوضيحية من الأبجدية إلى الكائنات، جميعها أدت أداءً جيداً في الاختبارات المبكرة. يُعد نقل النمط لصناع المحتوى الاجتماعي (تحويل اللقطات الواقعية إلى جمالية مصورة أو متحركة) حالة استخدام حقيقية أخرى. يكتسب المستخدمون في نظام Google البيئي تكاملاً مع Flow و YouTube و Workspace لا يمكن لأدوات مثل Luma AI أو Hailuo أو Pixverse تكراره.

تجنب استخدام Gemini Omni للقطات الحركة العالية، أو حركة الإنسان المعقدة، أو المشاهد التي تتطلب دقة تشريحية. يُعد Sora و Seedance 2.0 أقوى للأعمال الإعلانية أو الأفلام القصيرة. تجنبه في مسارات العمل ذات الحجم الكبير حيث تهم التكاليف المتوقعة لكل مقطع؛ يُعد Kling أو Seedance عبر واجهة برمجة التطبيقات (API) أكثر كفاءة من حيث التكلفة دون فئة Ultra. تجنبه إذا كانت هناك حاجة إلى تحرير الصوت/الكلام في الإنتاج (هذه الميزة ليست متاحة بعد) ولأي مقطع يزيد عن 10 ثوانٍ. تستحق فئة AI Plus بسعر $7.99/شهرياً الاختبار للاستكشاف، لكن حجم الإنتاج على Pro يتطلب قبول أن إنشاء الفيديو يستهلك معظم حصتك اليومية. يحصل Gemini Omni على تقييم 4.5: مسار العمل جديد وفريد حقاً، لكن قيود الحصة، والفجوة السينمائية مقارنة بـ Seedance 2.0، وغياب ميزة تحرير الكلام تمنعه من الوصول إلى الفئة الأولى.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن Gemini Omni.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Gemini Omni.