تخطَّ إلى المحتوى الرئيسي
Vantaige
Google Imagen screenshot
Google Imagen logo

Google Imagen

مجاني جزئيًا

يُعد Google Imagen 4 نموذج تحويل النص إلى صورة من Google DeepMind، ويقدم أقوى قدرة على عرض النصوص داخل الصور مقارنة بأي مولد صور رئيسي يعمل بالذكاء الاصطناعي. يمكن الوصول إليه مجانًا عبر Google AI Studio أو كفئة مدفوعة من خلال Gemini Advanced و Vertex AI.

حالات الاستخدام:الصور والفنون
الميزات:APIMobile App

Google Imagen هي عائلة نماذج توليد الصور التي طورتها Google DeepMind. تم إطلاق إصدار الإنتاج الحالي، Imagen 4، في مؤتمر Google I/O في 20 مايو 2025، ليحل محل Imagen 3 عبر منتجات Google الاستهلاكية والمؤسسية. وهو يشغل ميزة توليد الصور في تطبيق Gemini، وتكاملات Google Workspace في Docs و Slides، وأداة ImageFX Labs (التي يتم إغلاقها حاليًا)، وهو متاح للمطورين من خلال واجهة برمجة تطبيقات Vertex AI. تم بناء النموذج كـ Latent Diffusion Transformer، باستخدام T5 كمشفر نصي أساسي، ويتم وضع علامة مائية على كل مخرجات باستخدام SynthID، وهي العلامة المائية غير المرئية من Google على مستوى البكسل لإثبات مصدر محتوى الذكاء الاصطناعي.

يتوفر Imagen 4 في ثلاث فئات: Imagen 4 Fast (يولد الصورة في حوالي 2.7 ثانية بتكلفة $0.02 لكل صورة عبر واجهة برمجة التطبيقات)، و Imagen 4 القياسي ($0.04/صورة)، و Imagen 4 Ultra ($0.06/صورة) للحصول على أقصى قدر من التفاصيل والالتزام الدقيق بالمطالبات. يدعم النموذج دقة تصل إلى 2K، ويولد أربعة متغيرات للصور لكل مطالبة افتراضيًا، ويتعامل مع مجموعة واسعة من الأساليب بدءًا من الواقعية التصويرية إلى الرسم الزيتي، والرسوم المتحركة بالصلصال، والرسم التخطيطي. وتتمثل قدرته التقنية الأبرز في الطباعة داخل الصورة: عرض نص مقروء داخل تركيبات معقدة بمستوى يتجاوز DALL-E 3 ويطابق أو يتفوق على FLUX في حالات الاستخدام التجاري العملي مثل لافتات وسائل التواصل الاجتماعي واللوحات الإعلانية.

ما الذي يولده Google Imagen في أبريل 2026

اعتبارًا من أبريل 2026، تُعد عائلة Imagen 4 العمود الفقري لإنتاج توليد الصور عبر مجموعة منتجات Google. تم تصميم Imagen 4 Fast لسير العمل عالي الحجم والحساس للسرعة؛ ويتعامل Imagen 4 القياسي مع الجزء الأكبر من التوليد الاستهلاكي والمهني؛ بينما يُخصص Imagen 4 Ultra للحالات التي يبرر فيها الالتزام بالمطالبات وأقصى قدر من التفاصيل المرئية التكلفة الأعلى لكل صورة.

تصل الدقة إلى 2048x2048 (2K)، ويتعامل النموذج مع نسب العرض إلى الارتفاع 1:1 و 4:3 و 3:4 و 16:9 بشكل أصلي. تغطية الأساليب واسعة: الواقعية التصويرية مع عرض دقيق للمواد (الزجاج، القماش، الماء، درجات لون البشرة)، والأساليب الفوتوغرافية (35 مم، الماكرو، إشارات عمق المجال)، والرسوم التوضيحية، ومجموعة من الأساليب الفنية المحددة من خلال اللغة الطبيعية. تظل القدرة التقنية الأكثر تميزًا للنموذج هي عرض النص: توليد نص مقروء ومكتوب بشكل صحيح داخل الصور، سواء كانت ملصقات قصيرة على عبوات المنتجات، أو جمل كاملة على الملصقات، أو طباعة بأسلوب القوائم بأحجام خطوط صغيرة. هذا يجعل Imagen 4 الخيار العملي لحالات الاستخدام المتعلقة بالتسويق حيث عانت كل النماذج المنافسة تاريخيًا.

يتم وصول المستهلكين من خلال واجهات متعددة. يتوفر توليد الصور المجاني في واجهة متصفح Google AI Studio، مع حصص تتراوح بين 500 و 1,000 صورة يوميًا اعتمادًا على طلب الخادم (على الرغم من أنه من الناحية العملية، أبلغ المستخدمون المجانيون عن تقييدهم بما يصل إلى 10-20 صورة فقط خلال فترات الذروة بعد تخفيضات حصص Google في ديسمبر 2025). يوفر تطبيق Gemini وصولاً مجانيًا مع قيود على توليد صور الأشخاص في بعض المناطق. تفتح الفئات المدفوعة أولوية أعلى وتوليدًا كاملاً لصور الأشخاص. ملاحظة: أعلنت Google في أوائل عام 2026 أن ImageFX، أداة الصور المستقلة من Google Labs، سيتم إغلاقها في 30 أبريل 2026، مع انتقال توليد الصور إلى منصة جديدة تسمى Flow.

على جانب المطورين، تدعم واجهة برمجة تطبيقات Vertex AI وواجهة برمجة تطبيقات Gemini نموذج Imagen 4 بتسعير مباشر للدفع حسب الاستخدام لكل صورة. تتضمن جميع المخرجات العلامة المائية SynthID، والتي يتم تضمينها في بيانات البكسل بدلاً من أن تكون تراكبًا مرئيًا.

موقع Google Imagen مقارنة بـ DALL-E 3 و FLUX

أهم مقارنتين آليتين لـ Imagen 4 هما DALL-E 3 (نموذج الصور من OpenAI، المدمج الآن في GPT-4o الخاص بـ ChatGPT) و FLUX (عائلة النماذج مفتوحة الأوزان من Black Forest Labs).

مقارنة بـ DALL-E 3: يستخدم DALL-E 3 نموذج GPT-4 كمعالج نصي مسبق يعيد كتابة مطالبات المستخدم قبل توليد الصورة، بهدف تحسين دقة التكوين. تحدث إعادة الكتابة هذه بشكل غير مرئي ولا يمكن تعطيلها، مما يعني أن الصورة النهائية تختلف أحيانًا عن الصياغة الدقيقة لمطالبة المستخدم. لا يقوم Imagen 4 بإعادة كتابة المطالبات. بالنسبة لعرض النص على وجه التحديد، الفجوة كبيرة: يحقق DALL-E 3 دقة نصية تبلغ حوالي 60-70% (تهجئة صحيحة، موضع مقروء) في معايير المجتمع، بينما يصل Imagen 4 إلى أكثر من 90% ويتعامل مع جمل كاملة بدلاً من مجرد كلمات مفردة. بالنسبة للتركيبات السردية الإبداعية ذات الإضاءة الناعمة والمنمقة، يُعد DALL-E 3 نظيرًا أو أفضل؛ أما بالنسبة لأي مخرجات حيث تهم مقروئية النص داخل الصورة، فإن Imagen 4 هو الخيار العملي.

مقارنة بـ FLUX: يستخدم FLUX (حاليًا FLUX.2، وهو محول تدفق مصحح بـ 32 مليار معلمة من Black Forest Labs) مطابقة التدفق بدلاً من الانتشار المتسلسل، مع آلية انتباه مزدوجة المسار تعالج رموز الصور والنصوص في مسارات منفصلة قبل دمجها. تحقق هذه البنية عرضًا نصيًا شبه نظير مقارنة بـ Imagen 4 وتقدم التزامًا قويًا بالمطالبات. الاختلاف الآلي الرئيسي هو الوصول: FLUX.1 Schnell مفتوح المصدر بموجب ترخيص Apache 2.0 وقابل للاستضافة الذاتية بدون قيود على المحتوى. يتوفر FLUX.1 Dev للبحث غير التجاري. يتضمن نظام FLUX البيئي على Hugging Face الآلاف من محولات LoRA المدربة من قبل المجتمع لأساليب ومواضيع ومجالات محددة. لا يمتلك Imagen 4 نظامًا بيئيًا مكافئًا للضبط الدقيق، ولا أوزانًا مفتوحة، ويعمل فقط من خلال البنية التحتية لـ Google. يُعد FLUX الخيار الصحيح لأي شخص يحتاج إلى تخصيص الأسلوب، أو الاستخدام دون اتصال بالإنترنت، أو المطالبات التي قد تحظرها فلاتر الأمان الخاصة بـ Google.

"مثير للإعجاب حقًا. كانت الخطوط مقروءة ومحاذاة بشكل جيد." - عائشة امتياز، محررة AllAboutAI، مراجعة عرض النصوص، نوفمبر 2025
"تميل الرقابة إلى أن تكون مجنونة بعض الشيء في بعض الأحيان" - المستخدمة Katje، منتدى مطوري Google AI، 18 سبتمبر 2025

التكلفة الحقيقية لتشغيل Google Imagen

يحتوي هيكل التسعير على وضعين متميزين اعتمادًا على ما إذا كنت مستهلكًا أو مطورًا.

يتم دمج وصول المستهلكين في اشتراكات Google One. تتيح الفئة المجانية الوصول إلى توليد Imagen 4 مع وجود قيود (توليد صور الأشخاص محدود أو محظور حسب المنطقة؛ الحصص غير متوقعة). أدنى فئة مدفوعة مع قدرة كاملة على توليد الصور هي Gemini Advanced بسعر $19.99/شهر، والتي تتضمن أيضًا مساحة تخزين 2TB على Google One وتكامل Workspace. توفر فئة Google AI Plus بسعر $7.99/شهر 200 رصيد ذكاء اصطناعي شهريًا يمكن استخدامها لتوليد الصور، ولكن مستوى الوصول أكثر تقييدًا من Gemini Advanced.

وصول المطورين من خلال Vertex AI يكون حصريًا بنظام الدفع لكل صورة دون الحاجة إلى اشتراك. السعر هو $0.02 لكل صورة لـ Imagen 4 Fast، و $0.04 لـ Imagen 4 القياسي، و $0.06 لـ Imagen 4 Ultra. تبلغ تكلفة ترقية دقة الصورة $0.06 لكل صورة. تسمح الفئة المجانية لواجهة برمجة التطبيقات بصورتين في الدقيقة، وهو أمر غير عملي لأي سير عمل إنتاجي؛ الترقية إلى الفئة 1 (ربط حساب فوترة، بدون حد أدنى للإنفاق) يرفع ذلك إلى 10 صور في الدقيقة.

للتوضيح، تبلغ تكلفة توليد 1,000 صورة في فئة واجهة برمجة التطبيقات القياسية $40. وفي فئة Fast تنخفض إلى $20. هذه الأسعار تنافسية مع تسعير واجهة برمجة تطبيقات DALL-E 3 وأقل من المعادل لكل صورة في خطط اشتراك Midjourney.

  • مجاني (Gemini / Google AI Studio): $0/شهر، وصول محدود إلى Imagen 4، توليد مقيد لصور الأشخاص في بعض المناطق، حصة غير متوقعة (يُعلن عن 500-1,000 صورة/يوم، وعادة ما تكون أقل خلال أوقات الذروة)

  • Google AI Plus: $7.99/شهر، 200 رصيد ذكاء اصطناعي شهريًا لتوليد الوسائط، مساحة تخزين 200GB، وصول محسن لنموذج Gemini

  • Gemini Advanced (Google One AI Premium): $19.99/شهر، وصول كامل إلى Imagen 4 بما في ذلك توليد صور الأشخاص، توليد ذو أولوية عالية، مساحة تخزين 2TB على Google One، تكامل Workspace (Docs و Slides و Vids)

  • Google AI Ultra: $41.66/شهر (تُفوتر $124.99/3 أشهر)، 25,000 رصيد ذكاء اصطناعي شهريًا، وصول لأعلى فئة من نموذج Gemini، مساحة تخزين 30TB

  • واجهة برمجة تطبيقات Vertex AI (الدفع لكل صورة): $0.02/صورة (Imagen 4 Fast)، $0.04/صورة (Imagen 4 القياسي)، $0.06/صورة (Imagen 4 Ultra)، لا يتطلب اشتراكًا شهريًا

أين يفشل Google Imagen بشكل متكرر

يُعد فلتر الأمان نقطة الاحتكاك الأكثر شيوعًا. تطبق Google الإشراف على المحتوى في مرحلتين: إدخال المطالبة ومراجعة الصورة بعد التوليد. يُبلغ المستخدمون أن المطالبات المتطابقة تنجح في واجهة واحدة (تطبيق الويب Gemini) بينما يتم حظرها بصمت عبر واجهة برمجة التطبيقات. تصل حالات الرفض دون تفسير محدد، مجرد رسالة حظر عامة. هذا التناقض والغموض يحبط المطورين الذين يبنون مسارات الإنتاج والمبدعين الذين يعملون في حالات حافة يجب أن تكون حميدة بوضوح. يعود هذا النمط مباشرة إلى الجدل الذي حدث في فبراير 2024 والذي أجبر Google على إيقاف توليد صور الأشخاص بالكامل وإعادة تصميم طبقة الإشراف الخاصة بها بموقف أكثر تحفظًا.

فيما يتعلق بالجودة، تحسن Imagen 4 بشكل ملحوظ مقارنة بـ Imagen 3 في معظم المجالات، لكن الإطلاق في منتصف عام 2025 أحدث موجة من شكاوى المستخدمين، خاصة على r/Bard. وصفت العديد من المواضيع النموذج بأنه "أسوأ من Imagen 3" بالنسبة للصور الشخصية، مشيرة إلى "نتائج ضبابية أو محببة أو مشوهة خاصة في الوجوه البشرية". كانت هذه الشكاوى بارزة بما يكفي ليتم تجميعها في منشورات المراجعة بحلول نوفمبر 2025. يمكن أن تميل قوام البشرة في المخرجات الواقعية نحو المظهر البلاستيكي الناعم الذي كان يمثل انتقادًا لعائلة Imagen منذ Imagen 3.

لا يزال الاتساق التشريحي في المشاهد المعقدة يمثل مشكلة. إن وجود عدة أشخاص في إطار واحد، والوجوه الصغيرة في الخلفية، والتفاصيل الدقيقة على الأيدي، والهندسة المعقدة (النصوص الدقيقة للوحات الدوائر، والزخارف الدقيقة للمجوهرات، والتصميمات الداخلية المزدحمة) كلها تنتج تشوهات بشكل متكرر أكثر مما يحدث في التركيبات الأبسط.

لا يحتوي النموذج على إمكانية الرسم الداخلي (in-painting) أو الرسم الخارجي (out-painting) أو إخفاء المناطق (regional masking) في أي واجهة استهلاكية. تمثل هذه فجوة كبيرة مقارنة بالمنافسين: يدعم FLUX.1 Kontext تحرير الصور داخل السياق؛ ويقدم Midjourney إخفاء المناطق المتغيرة؛ وحتى DALL-E 3 يدعم الرسم الداخلي عبر واجهة برمجة التطبيقات. إذا كنت بحاجة إلى إصلاح عنصر معين في صورة دون إعادة توليد كل شيء، فلا يمكن لـ Imagen 4 القيام بذلك بشكل أصلي.

أخيرًا، موثوقية الحصة في الفئات المجانية والمدفوعة الأقل ضعيفة. خفضت Google حصص الصور للفئة المجانية بنسبة 50-80% في ديسمبر 2025 دون إعلان بارز. خلال ساعات الذروة، يجد المستخدمون في الفئات المجانية أحيانًا أن سعتهم تصل فعليًا إلى الصفر.

لمن يُعد Google Imagen مناسبًا، ومن يجب عليه اختيار شيء آخر

يتمتع Imagen 4 بعرض قيمة أوضح من أي نموذج صور آخر تقريبًا: فهو الخيار الأفضل لأي شخص يولد صورًا بنصوص مضمنة. مديرو وسائل التواصل الاجتماعي الذين ينتجون اللافتات، والمسوقون الذين يبنون رسومات ترويجية، ومنشئو المحتوى الذين يصممون صورًا مصغرة مع الطباعة، وعمال المستندات الذين يريدون توليد الصور دون مغادرة Google Workspace، جميعهم يستفيدون بشكل مباشر من نقطة القوة الأساسية لـ Imagen 4. وهو أيضًا الخيار الواضح للفرق التي تدفع بالفعل مقابل Google One أو Gemini Advanced وترغب في تجنب اشتراك إضافي في Midjourney أو أداة أخرى.

بالنسبة لفرق المطورين الذين يبنون مسارات توليد الصور على أساس التكلفة، فإن تسعير واجهة برمجة تطبيقات Vertex AI تنافسي وتعد العلامة المائية SynthID مفيدة لمتطلبات الامتثال وتصنيف محتوى الذكاء الاصطناعي.

تجاوز Imagen 4 إذا كان عملك يتطلب تحريرًا دقيقًا للصور. إن غياب الرسم الداخلي أو الإخفاء أو التحكم الإقليمي يجعله غير مناسب لسير عمل تنقيح الصور. تجاوزه إذا كان محتواك يثير فلاتر الأمان الخاصة بـ Google بشكل متكرر دون سبب وجيه. تجاوزه إذا كان تطوير الأسلوب المدفوع بالمجتمع مهمًا: لا توجد تعديلات دقيقة عامة لـ LoRA، ولا يوجد مركز نماذج مجتمعي، ولا إعدادات مسبقة مشتركة. يُعد FLUX مع نظامه البيئي Hugging Face أكثر ثراءً بالمجتمع بشكل كبير. تجاوزه إذا كنت بحاجة إلى تشغيل توليد الصور محليًا أو دون اتصال بالإنترنت. وإذا كنت تولد بشكل أساسي أسلوب الأنمي، أو الرسوم التوضيحية المنمقة، أو الأنواع الفنية المحددة للغاية، فإن مجتمعات Stable Diffusion و FLUX المضبوطة بدقة ستنتج نتائج أفضل وأكثر دقة من أي نموذج من Google.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Google Imagen.