تخطَّ إلى المحتوى الرئيسي
Vantaige
Veo 3 screenshot
Veo 3 logo

Veo 3

مجاني جزئيًا

يُعد Veo 3 نموذج توليد الفيديو من Google DeepMind، وهو أول ذكاء اصطناعي تجاري رئيسي ينتج صوتاً متزامناً مع الفيديو في عملية توليد واحدة. يتوفر عبر تطبيق Gemini على نظامي iOS و Android، و Google Flow، و Vertex AI للوصول إلى واجهة برمجة التطبيقات (API) للمؤسسات.

الميزات:APIMobile App

يُعد Veo 3 نموذج توليد الفيديو من Google DeepMind، والذي تم إطلاقه في مؤتمر Google I/O في 20 مايو 2025. وهو أول مولد فيديو تجاري رئيسي يعمل بالذكاء الاصطناعي ينتج صوتاً متزامناً، بما في ذلك الحوار والمؤثرات الصوتية المحيطية والموسيقى، بشكل مدمج مع الفيديو في عملية توليد واحدة. قبل Veo 3، كانت كل أدوات الذكاء الاصطناعي الرئيسية للفيديو، بما في ذلك Sora و Runway و Pika و Kling، تنتج مقاطع صامتة افتراضياً، مما يتطلب البحث عن الصوت وإضافته بشكل منفصل في مرحلة ما بعد الإنتاج. لقد أنهى Veo 3 سير العمل هذا. وهو يعمل عبر تطبيق Gemini على نظامي iOS و Android، و Google Flow (أداة صناعة الأفلام المخصصة)، و Google AI Studio، و Vertex AI للوصول إلى واجهة برمجة التطبيقات (API) للمؤسسات.

يولد النموذج مقاطع فيديو بدقة 1080p تصل مدتها إلى 8 ثوانٍ لكل مقطع، مع حركة تراعي قوانين الفيزياء وعناصر تحكم في الكاميرا تشمل التكبير والتصغير (zoom)، والتحريك الأفقي (pan)، ولقطات التتبع (tracking shots). ينشئ نظامه الصوتي مخرجات متطابقة مع السياق: أمواج المحيط، وضوضاء الشارع المحيطية، وحوار الشخصيات مع حركة فم متزامنة مع الشفاه، وموسيقى خلفية يختارها النموذج بناءً على سياق المشهد. قام Veo 3.1 (أكتوبر 2025) بتوسيع البنية من خلال الترقية إلى دقة 4K، والفيديو العمودي بنسبة 9:16 المخصص لـ Shorts و TikTok، وتقنية Scene Extension التي تربط المقاطع في سرديات مستمرة تتجاوز 60 ثانية. يوفر الوصول عبر Vertex AI فوترة بالثانية لتكاملات المطورين، مع تطبيق علامة SynthID المائية غير المرئية على جميع المخرجات لتتبع مصدر المحتوى.

ما يقدمه Veo 3 في أبريل 2026

اعتباراً من أبريل 2026، هناك ثلاثة نماذج من جيل Veo 3 قيد الاستخدام النشط. يولد Veo 3 الأصلي (مايو 2025) مقاطع مدتها 8 ثوانٍ بدقة 1080p مع صوت مدمج. يضيف Veo 3.1 (أكتوبر 2025) الترقية إلى دقة 4K، والتكوين العمودي، وتقنية Scene Extension للسرديات الأطول. تم إطلاق Veo 4 في أبريل 2026 مع إمكانية توليد مقطع واحد مدته 30 ثانية، وإنشاء لوحات القصة (storyboarding)، وتحسين اتساق الشخصيات، وإنشاء صور رمزية (avatars) بتقنية zero-shot، وهو متاح على Gemini Ultra و Google Flow.

يُعد النظام الصوتي الميزة التقنية الأبرز. يستخدم Veo 3 بنية انتشار (diffusion) مشتركة للفيديو والصوت بدلاً من نموذج صوتي منفصل يُضاف كطبقة علوية. عندما تطلب مشهداً لشاطئ، يولد النموذج أصوات أمواج متطابقة. وعندما تطلب شخصية تتحدث بحوار، فإنه يولد الصوت بنبرة طبيعية ويحاول مزامنة حركة الشفاه. يتخذ النموذج قرارات صوتية سياقية: في الاختبارات، عندما كان المشهد يحتمل وجود ضوضاء محيطية أو موسيقى خلفية، اختار ما يتناسب بشكل أفضل مع المحتوى. يستغرق وقت التوليد من 2 إلى 10 دقائق اعتماداً على التعقيد وحمل الخادم، مع توفر متغير أسرع ("Fast") للنماذج الأولية بدقة وجودة صوت منخفضتين.

يتطلب الوصول اشتراكاً مدفوعاً. يتم وصول المستهلكين من خلال Google AI Pro (بمبلغ $19.99/شهرياً) و Google AI Ultra (بمبلغ $249.99/شهرياً) في تطبيق Gemini. يتم وصول المطورين من خلال Gemini API أو Vertex AI بتكلفة تتراوح تقريباً بين $0.40 و $0.75 لكل ثانية من الفيديو المولد، اعتماداً على مستوى الجودة وما إذا كان الصوت متضمناً. تبدأ حسابات Google Cloud بأرصدة بقيمة $300 قابلة للتطبيق على استدعاءات Veo API.

موقع Veo 3 مقارنة بـ Sora 2 و Runway Gen-4

تختلف منصات توليد الفيديو التجارية الثلاث المهيمنة في بنيتها بطرق تؤثر بشكل مباشر على سير العمل الإبداعي.

Veo 3 مقابل Sora 2 (من OpenAI): يستخدم Sora مشفراً تلقائياً مكانياً وزمانياً (spatiotemporal autoencoder) مدمجاً مع محول انتشار (DiT) يمثل الفيديو كبقع زمكانية مع تشفير موضعي ثلاثي الأبعاد. يعالج محول الانتشار متعدد الوسائط (MM-DiT) الخاص به مدخلات النص والصورة والصوت من خلال مسارات منفصلة. الاختلاف الميكانيكي الحاسم: تفصل بنية Sora الصوت تماماً عن توليد الفيديو. لا ينتج Sora صوتاً مدمجاً. تخرج المقاطع صامتة؛ ويجب إضافة الصوت عبر أدوات ما بعد الإنتاج. يُعترف على نطاق واسع بأن التماسك الزمني لـ Sora ودلالات الأوامر لحركة الكاميرا السينمائية أقوى، مما يجعله مفضلاً للتسلسلات السردية الأطول. ولكن بالنسبة لصناع المحتوى الذين يحتاجون إلى مخرجات سمعية وبصرية كاملة دون خطوة ما بعد الإنتاج، فإن صمت Sora يمثل عائقاً في سير العمل.

"صوت Veo 3.1 وحده يستحق العناء. مقاطع فيديو Sora جميلة ولكنها صامتة - عديمة الفائدة لمعظم المحتوى." - معلق على Reddit، في r/AIVideoGeneration، أواخر عام 2025

Veo 3 مقابل Runway Gen-4 / Gen-4.5: تم إطلاق Runway Gen-4 (مارس 2025) بدون صوت مدمج، بما يتوافق مع كل نماذج Runway السابقة. البنية عبارة عن محول انتشار مع انتباه زمني عبر الإطارات، مصمم خصيصاً للمخرجات السينمائية الاحترافية: اتساق قوي للشخصيات، وعناصر تحكم متطورة في الكاميرا، وتكامل عميق في سير عمل ما بعد الإنتاج. أضاف Runway Gen-4.5 (ديسمبر 2025) توليد الصوت المدمج، بعد 7 أشهر من Veo 3. يمزج الهجين الانحداري التلقائي إلى الانتشار (A2D) في Gen-4.5 بين الجودة البصرية للانتشار والفهم الانحداري التلقائي للمشهد. يناسب نموذج تسعير Runway (مستويات اشتراك من $12 إلى $144/شهرياً حسب حجم الرصيد) المحترفين المبدعين الذين يحتاجون إلى تكرار عالٍ. تظل جودة مخرجاته السينمائية واتساق شخصياته المعيار الصناعي للاستخدام الإنتاجي. تكمن ميزة Veo 3 في تقديم الصوت أولاً وإمكانية وصول أوسع للمستهلكين من خلال حزمة اشتراكات Google الحالية.

التكلفة الحقيقية لتوليد الفيديو باستخدام Veo 3

تعتمد التكلفة كلياً على مسار الوصول. مسار المستهلك: يتضمن Google AI Pro بسعر $19.99/شهرياً الوصول إلى Veo 3/3.1 ضمن حصص التوليد. أبلغ المستخدمون في مستوى Pro عن بلوغ الحدود اليومية بعد عدد قليل من مقاطع الفيديو، مع قفل بعض الحسابات لمدة 24 ساعة بعد 5-10 عمليات توليد اعتماداً على التكوين. يوفر Google AI Ultra بسعر $249.99/شهرياً أعلى حصة مخصصة.

مسار واجهة برمجة التطبيقات (API) على Vertex AI: حوالي $0.75 لكل ثانية من الفيديو مع الصوت في مستوى Veo 3 القياسي. يكلف المقطع الواحد مدته 8 ثوانٍ حوالي $6. تكلف دقيقة واحدة من اللقطات حوالي $360 بالسعر القياسي. يقلل Veo 3.1 Fast هذا إلى حوالي $0.15/ثانية، مما يجعله المستوى العملي لسير العمل الذي يتطلب تكراراً مكثفاً. المشكلة الاقتصادية الرئيسية: يتم استهلاك الأرصدة في وقت التوليد بغض النظر عن جودة المخرجات. فالفيديو الصامت، أو النتيجة ذات الكلام المشوه، أو المقطع الذي يحتوي على تراكبات تسميات توضيحية غير مرغوب فيها، يكلف نفس تكلفة اللقطة المثالية.

"اعتقدت في الواقع أن إعلاناً عشوائياً قد ظهر على شاشتي. بدا الأمر واقعياً إلى هذا الحد." - مراجع من Manus.im، يختبر Veo 3، عام 2025

يمكن لمستخدمي المؤسسات ذوي الحجم الكبير على Vertex AI التفاوض على أسعار مخصصة، مع الإبلاغ عن تخفيضات بنسبة 20-40% على النطاق الواسع. تم ذكر Klarna و Kraft Heinz و Japan Airlines (عبر الشريك الوكيل Jellyfish/Pencil) في إعلان إطلاق Vertex AI من Google كمستخدمين أوائل من المؤسسات. أبلغت Kraft Heinz عن تقليل الجداول الزمنية الإبداعية من 8 أسابيع إلى 8 ساعات باستخدام Veo عبر Vertex AI.

أين يفشل Veo 3 باستمرار

تظهر ستة أنماط فشل متكررة في المراجعات ومناقشات المنتديات بشكل مستمر بما يكفي لتوقعها بدلاً من التفاجؤ بها:

  • هلوسة الترجمة المشوهة: منذ الإطلاق وحتى يوليو 2025 على الأقل، أضاف Veo 3 تراكبات تسميات توضيحية غير منطقية لمشاهد الحوار حتى عند توجيهه صراحةً بعدم القيام بذلك. أعلنت Google عن إصلاح في 9 يونيو 2025. وأفادت MIT Technology Review أن المشكلة استمرت في 15 يوليو 2025. صرحت المديرة الإبداعية منى وايس: "إذا كنت تنشئ مشهداً بحوار، فإن ما يصل إلى 40% من مخرجاته تحتوي على ترجمات غير مفهومة تجعله غير قابل للاستخدام." السبب الجذري هو التدريب على محتوى YouTube و TikTok الذي يحتوي على تسميات توضيحية مدمجة؛ الأوامر السلبية أقل فعالية من التعليمات الإيجابية في قمع الأنماط المكتسبة.

  • حد أقصى صارم يبلغ 8 ثوانٍ لكل مقطع: الإحباط الأكثر شيوعاً. يتطلب المحتوى الاجتماعي والإعلانات غالباً مقاطع مدتها 15-20 ثانية. تساعد تقنية Scene Extension في Veo 3.1 ولكنها تتطلب ربط المقاطع الفردية، مع إدارة الفواصل والاتساق.

  • عدم توافق الصوت مع الأوامر: يولد النموذج أحياناً عناصر صوتية غير مطلوبة، أو يضيف حواراً لم يُطلب، أو ينتج كلاماً غير مفهوم. يمكن للذكاء الصوتي أن يتجاوز الحدود.

  • انحراف الأوامر في المشاهد المعقدة: المشاهد متعددة العناصر التي تحتوي على 3 كائنات أو سلوكيات مميزة أو أكثر غالباً ما تسيء تمثيل أجزاء من الأمر. تنتج تسلسلات الحركة حشوداً ثابتة وسلوكيات عامة بدلاً من السلوكيات المحددة.

  • إيجابيات كاذبة في سياسة المحتوى: يبلغ المستخدمون عن وضع علامات على أوامر إبداعية مشروعة لانتهاكها السياسة، مما يتطلب إعادة الإرسال وفقدان الأرصدة.

  • بطء العرض وحدود التوليد: يمكن أن يستغرق التوليد أكثر من 10 دقائق تحت الضغط. تختلف حدود التوليد اليومية حسب مستوى الاشتراك ولا يتم نشرها دائماً بوضوح، مما يؤدي إلى عمليات قفل غير متوقعة في منتصف المشروع.

تجدر الإشارة إلى حادثة الإشراف على المحتوى في يوليو 2025 بشكل منفصل لمستخدمي المؤسسات. أفادت Media Matters for America في 1 يوليو 2025 أن مقاطع فيديو عنصرية ومعادية للسامية تم إنشاؤها باستخدام Veo 3 كانت تُرفع وتنتشر بشكل واسع على TikTok، حيث وصلت بعض المقاطع إلى أكثر من مليون مشاهدة. أدى فشل النموذج في فهم الاستعارات العنصرية إلى صعوبة الإشراف على المحتوى. حظرت TikTok الحسابات التي تم الإبلاغ عنها. سلطت الضوء على الفجوة بين فلاتر الأمان لكل فيديو وسوء الاستخدام المنهجي على نطاق واسع، ودفعت Google إلى تشديد قيود التوليد.

أفضل حالات الاستخدام مقابل سيناريوهات التخطي

الأنسب لـ:

  • المحتوى الاجتماعي القصير حيث يهم تقديم محتوى صوتي كامل. يحصل صناع محتوى YouTube Shorts و TikTok و Instagram Reels على أصل كامل من الفيديو والصوت في عملية توليد واحدة، مما يلغي خطوة البحث عن الصوت والمزامنة تماماً.

  • اللقطات التسويقية الداعمة (B-roll) والرسوم المتحركة الاجتماعية. حالة المؤسسات موثقة جيداً: تكرار سريع من الموجز إلى التسليم لمحتوى العلامة التجارية، والرسوم المتحركة الاجتماعية، وفواصل المنتجات.

  • المحتوى الوثائقي والمحتوى بأسلوب المقابلات. يُعد توليد حوارات المتحدثين (Talking-head) نقطة قوة محددة، حيث يؤدي التقاط نبرة الصوت الطبيعية وتعبيرات الوجه أداءً جيداً في اختبارات الموضوعات الخاضعة للرقابة.

  • المطورون الذين يدمجون توليد الفيديو عبر واجهة برمجة التطبيقات (API). فوترة Vertex AI بالثانية يمكن التنبؤ بها؛ تكامل Gemini API مباشر للفرق الموجودة بالفعل في نظام Google Cloud البيئي.

تخطَّ Veo 3 عندما:

  • تحتاج إلى تماسك سردي طويل الأمد عبر أكثر من 30 ثانية لمشهد واحد مستمر. يتعامل Sora 2 مع هذا بشكل أفضل عند الإطلاق؛ يعالج Veo 4 ذلك جزئياً ولكن Veo 3 ليس الأداة المناسبة للسرد القصصي المرئي الطويل.

  • تحتاج إلى اتساق حتمي للشخصيات عبر لقطات متعددة أو عبر المشاهد. تم تصميم Runway Gen-4 خصيصاً لحالة الاستخدام الإنتاجي هذه.

  • يتطلب سير عملك حجماً كبيراً من التكرار بتكلفة منخفضة. بتكلفة $6 لكل مقطع مدته 8 ثوانٍ مع الصوت، يصبح التكرار المكثف باهظ الثمن بسرعة. تزيد حدود التوليد في مستوى المستهلك من تعقيد هذا الأمر.

  • أنت خارج نظام Google البيئي وتحتاج إلى مرونة في سير العمل متعدد المزودين. يتمتع Runway و Sora بتكاملات أوسع مع جهات خارجية.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

ظهرت في مجموعات

قوائم منتقاة تتضمّن Veo 3.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Veo 3.