
GPT Image 2 هو نموذج توليد الصور من OpenAI الصادر في أبريل 2026، ويقدم تصييرًا شبه مثالي للنصوص بأكثر من 100 لغة، وتحريرًا حواريًا متعدد الأدوار، وقدرات الاستنتاج عبر وضع التفكير (Thinking Mode). متوفر داخل ChatGPT وكواجهة برمجة تطبيقات (API) مباشرة.
يُعد GPT Image 2، الذي أُطلق في 21 أبريل 2026 باسم ChatGPT Images 2.0، نموذج توليد الصور الأكثر كفاءة من OpenAI وخليفة gpt-image-1. يحل هذا النموذج محل DALL-E 3، الذي أوقفته OpenAI في 12 مايو 2026، ويمثل أول نموذج للصور مزود بطبقة استنتاج أصلية: "Thinking Mode" (وضع التفكير) الذي يبحث في السياق، ويخطط للتكوين، ويصحح نفسه قبل التصيير. يتوفر النموذج داخل ChatGPT على الويب وiOS وAndroid، وعبر واجهة برمجة التطبيقات (API) باستخدام معرف النموذج gpt-image-2.
تتمثل الميزة الأبرز في دقة تصيير النصوص التي تتجاوز 99% عبر الحروف اللاتينية والصينية واليابانية والكورية والهندية والبنغالية، وهي قفزة هائلة مقارنة بمعدل نجاح DALL-E 3 البالغ حوالي 60%. وبعيدًا عن النصوص، يدعم النموذج التحرير الجراحي متعدد الأدوار (تغييرات مستهدفة دون انحراف المشهد)، وما يصل إلى 8 صور متسقة لكل مطالبة في وضع التفكير، ومخرجات أصلية بدقة 2048px مع توفر دقة 4K في المرحلة التجريبية، ونسب أبعاد مرنة تتراوح من 3:1 فائقة العرض إلى 1:3 الطولية. يغطي الوصول عبر واجهة برمجة التطبيقات (API) نقاط نهاية توليد الصور وتحريرها، بما في ذلك التكامل مع Chat Completions وResponses وBatch وAssistants. روابط داخلية للسياق: راجع DALL-E 3 لمعرفة ما حل محله، وMidjourney للبدائل التي تركز على الجماليات أولاً، وFLUX للواقعية التصويرية مفتوحة الأوزان، وAdobe Firefly للتكامل مع سير عمل التصميم.
ما يولده GPT Image 2 في أبريل 2026
يتعامل النموذج مع تحويل النص إلى صورة، وتحرير الصورة بالصورة، والتحرير الحواري متعدد الأدوار ضمن جلسة واحدة. في وضع التفكير (Thinking Mode)، يولد ما يصل إلى 8 صور لكل مطالبة تحافظ على اتساق الشخصيات والأسلوب والتخطيط عبر المجموعة، مما يجعله مفيدًا للقصص المصورة أو المحتوى الاجتماعي المتسلسل أو الرسوم البيانية متعددة اللوحات. يتخطى الوضع الفوري (Instant Mode) (المتاح لمستخدمي الباقة المجانية) خطوة الاستنتاج لتوليد أسرع ولكنه يقدم نتائج أقل دقة من حيث التكوين.
تصل دقة المخرجات إلى 2048px بشكل أصلي، مع توفر دقة 4K في المرحلة التجريبية. نسب الأبعاد مرنة: يمكنك طلب لافتات فائقة العرض بنسبة 3:1، أو مربعة بنسبة 1:1، أو طولية عمودية بنسبة 1:3 دون أن يفرض النموذج أي اقتصاص. يدمج النموذج أيضًا البحث عبر الويب لجلب السياق في الوقت الفعلي، وهو مفيد عند توليد صور تشير إلى أحداث جارية أو منتجات حديثة أو مواقع في العالم الحقيقي قد لا تغطيها بيانات التدريب بالكامل (تاريخ توقف المعرفة: ديسمبر 2025).
أنواع المخرجات المحددة التي تعمل بشكل جيد للغاية: قوائم المطاعم متعددة اللغات مع أسعار وتسميات دقيقة، ونماذج واجهة المستخدم (UI) والإطارات الشبكية مع نصوص مقروءة، والرسوم البيانية وتصورات البيانات مع وسائل شرح صحيحة، ومخططات خرائط مترو الأنفاق مع أسماء محطات دقيقة، وفقاعات كلام المانغا اليابانية، واللافتات التسويقية مع نصوص عناوين دقيقة. يمكن للنموذج التعامل مع مشاهد تحتوي على أكثر من 100 عنصر مميز دون إسقاط أو هلوسة الكائنات، وهو تحسن كبير مقارنة بنماذج الانتشار السابقة.
يتم تطبيق علامة مائية لمصدر المحتوى C2PA تلقائيًا على جميع المخرجات، مما يسمح بالتحقق من أن الصورة تم توليدها بواسطة الذكاء الاصطناعي. هذا أمر مهم للسياقات التحريرية والتجارية حيث تنطبق متطلبات الإفصاح.
"ما يقرب من 19 من أصل 20 عملية توليد أعادت نصًا مقروءًا بالكامل في المحاولة الأولى، عبر الحروف اللاتينية والصينية واليابانية والكورية والعربية." - فريق مراجعة PixVerse، مدونة PixVerse.ai، أبريل 2026
موقع GPT Image 2 مقارنة بـ Midjourney v8 و FLUX 2 Pro
يستخدم Midjourney v8 بنية تدريب جمالية متخصصة تعطي الأولوية للعمق الفني والتكوين السينمائي والنطاق الأسلوبي على حساب اتباع التعليمات الحرفية. يولد الصور بدقة 2K بشكل أصلي، بسرعات تفوق إصداره السابق بـ 5 أضعاف. تبلغ دقة النصوص حوالي 70%، وهي أقل بكثير من دقة gpt-image-2 البالغة 99%. والأهم من ذلك، لا يمتلك Midjourney واجهة برمجة تطبيقات (API) عامة رسمية: تصل الفرق إليه من خلال واجهة الويب أو روبوت Discord، مما يجعل التكامل في بيئة الإنتاج أمرًا صعبًا. يعتمد التسعير على الاشتراك ($10-$30 شهريًا حسب فئة الحوسبة)، مما يفيد المبدعين ذوي الحجم الكبير الذين يولدون مئات الصور شهريًا. أين يتفوق Midjourney: الواقعية التصويرية الفنية، والعمق السينمائي، والتحكم الجمالي. أين يتراجع: اتباع التعليمات، ودقة النصوص داخل الصور، والوصول البرمجي عبر API.
يتخذ FLUX 2 Pro من Black Forest Labs نهجًا مختلفًا: بنية مفتوحة الأوزان (Apache 2.0 على متغيرات محددة) مع التركيز على الواقعية التصويرية. يولد متغير FLUX Schnell الصور في أقل من ثانيتين؛ بينما يستغرق FLUX Pro من 4 إلى 8 ثوانٍ، وكلاهما أسرع بكثير من نطاق 10-18 ثانية في gpt-image-2 لعمليات التوليد القياسية، وأسرع بكثير من 30-60 ثانية في وضع التفكير (Thinking Mode) للطلبات المعقدة. تبلغ التكلفة لكل صورة $0.055 مقابل النطاق التقديري لـ gpt-image-2 البالغ $0.04-$0.35، لكن أوزان FLUX المفتوحة تسمح بالاستضافة الذاتية التي تقضي تمامًا على تكاليف الاستدلال للفرق التي تمتلك بنية تحتية لوحدات معالجة الرسومات (GPU). تُقدر دقة تصيير النصوص بـ 70-80%، وهي أقل من gpt-image-2. يتفوق FLUX في: تصوير منتجات التجارة الإلكترونية، والنماذج الواقعية، ومسارات العمل ذات الحجم الكبير، وأي سيناريو تهم فيه اقتصاديات الاستضافة الذاتية. يتفوق gpt-image-2 في: دقة النصوص، واتباع التعليمات المعقدة، والتحرير متعدد الأدوار دون انحراف.
جدول مرجعي مفيد حسب حالة الاستخدام: بالنسبة لنماذج واجهة المستخدم (UI) ومخططات المطورين، يُعد gpt-image-2 الخيار الأوضح. بالنسبة للفن المفاهيمي السينمائي، لا يزال Midjourney v8 في الصدارة. بالنسبة لتصوير المنتجات بكميات كبيرة، فإن سرعة وتكلفة FLUX 2 Pro تجعله الخيار الأكثر منطقية. بالنسبة للأصول التسويقية متعددة اللغات ذات النصوص الدقيقة، لا يوجد منافسون قريبون لـ gpt-image-2. راجع أيضًا Google Imagen 3 وخليفته Imagen 4 للواقعية التصويرية في الفئة الفائقة، وWhisk للتوليد الذي يركز على نقل الأسلوب أولاً.
التكلفة الحقيقية لتشغيل GPT Image 2
تعتمد فوترة واجهة برمجة التطبيقات (API) على الرموز (tokens)، وليس لكل صورة. تبلغ تكلفة رموز إدخال الصور $8.00 لكل مليون؛ وتنخفض تكلفة إدخال الصور المخزنة مؤقتًا (للصور المرجعية المتكررة) إلى $2.00 لكل مليون؛ وتبلغ تكلفة رموز إدخال النصوص $5.00 لكل مليون؛ بينما تبلغ تكلفة رموز الإخراج $30.00 لكل مليون. توفر OpenAI حاسبة تكلفة في دليل توليد الصور للحصول على تقديرات دقيقة، لكن التكاليف الفعلية لكل صورة تتراوح تقريبًا بين $0.04-$0.08 للمطالبات البسيطة، و$0.10-$0.15 للتخطيطات متوسطة التعقيد، و$0.20-$0.35 للرسوم البيانية الكثيفة أو المشاهد متعددة العناصر.
تخفض واجهة برمجة تطبيقات الدفعات (Batch API) تكاليف الإدخال والإخراج بنسبة 50% (تتم معالجتها بشكل غير متزامن على مدار 24 ساعة): $4.00/$15.00 لكل مليون رمز على التوالي. بالنسبة لمسارات التوليد غير الحساسة للوقت، يعمل وضع الدفعات على تحسين الاقتصاديات بشكل كبير. عند توليد 10,000 صورة شهريًا، تتراوح تكاليف API لـ gpt-image-2 بين $400-$800 اعتمادًا على التعقيد، مقارنة بـ Midjourney Pro بسعر $30 شهريًا لفئة المشتركين الخاصة به.
يتضمن ChatGPT Plus ($20 شهريًا) توليد الصور مع وضع التفكير (Thinking Mode) وحدود يومية أعلى. يضيف ChatGPT Pro ($200 شهريًا) أولوية الوصول وأعلى حدود للتوليد. يحصل مستخدمو الباقة المجانية على عمليات توليد يومية محدودة في الوضع الفوري (Instant Mode) فقط، دون الوصول إلى وضع التفكير. بالنسبة للمستخدمين العاديين أو الفرق الصغيرة التي تختبر النموذج، يُعد ChatGPT Plus نقطة الدخول الأكثر اقتصادية. بالنسبة للمطورين الذين يبنون المنتجات، يصبح نموذج API القائم على الرموز فعالاً من حيث التكلفة فقط عند الأحجام المتوسطة إلى العالية حيث يكون تعقيد المطالبة مفهومًا جيدًا.
"بعد 3-5 صور في نفس الجلسة، يتم تدمير الصور. يتضخم نمط الضوضاء بسرعة كبيرة. يجب عليك إعادة تحميل صفحة الويب بين كل عملية توليد كحل بديل." - Daller، منتديات مجتمع مطوري OpenAI، أبريل 2026
أين يفشل GPT Image 2 بشكل متكرر
الخطأ الأكثر توثيقًا عند الإطلاق هو تراكم ضوضاء الجلسة: يحتفظ النموذج ببيانات من الصور السابقة ضمن جلسة نشطة. بعد 3-5 عمليات توليد، تتضخم أنماط الضوضاء وتتدهور جودة الصورة بشكل واضح، مع تشوهات توصف بأنها "إجهاد عصبي يشبه تشوهات mp3 في الصوت". الحل البديل هو إعادة تحميل الصفحة بالكامل بين دفعات التوليد. يمثل هذا قيدًا كبيرًا لأي شخص يستخدم واجهة ChatGPT للعمل الإبداعي التكراري.
تتبع تشوهات الصور المرجعية نمطًا مشابهًا. عند توفير صور إدخال للتحرير أو نقل الأسلوب، تظهر التشوهات حتى في محاولة التوليد الأولى، وليس بعد تمريرات متعددة. أكد المستخدمون على r/ChatGPT المشكلة بشكل مستقل، واقترح أحدهم: "مطالبة ثانية بـ 'إزالة الضوضاء من الصورة' يمكن أن تصلح معظم هذا غالبًا" كحل جزئي.
دقة التصميم الجرافيكي هي حد حقيقي. التخطيطات التي تتطلب تباعدًا دقيقًا، أو تسلسلًا هرميًا دقيقًا للطباعة، أو أنظمة شبكية دقيقة بالبكسل تنتج نتائج غير متسقة. وكما عبر مستخدم r/graphic_design المسمى baldierot: "اللغة وسيلة غير دقيقة لتحقيق نتائج دقيقة". كما أن إعادة إنتاج شعارات العلامات التجارية غير موثوقة. يميل GPT Image 2 إلى تقديم نسخ معقولة ولكنها خاطئة تتطلب تصحيحًا يدويًا في برامج التصميم الفعلية.
تجانس الأسلوب هو انتقاد حقيقي حتى في مستوى الجودة هذا. على الرغم من تحسن التحكم، تشترك المخرجات في بصمة جمالية يمكن التعرف عليها بغض النظر عن تعليمات الأسلوب. يفيد المحترفون المبدعون الذين يحتاجون إلى تنوع أسلوبي حقيقي باللجوء إلى Midjourney للنطاق الفني، أو Krea لمزج الأساليب في الوقت الفعلي، حتى أثناء استخدام gpt-image-2 للأصول التجارية المليئة بالنصوص. بالنسبة لمسارات العمل ذات الحجم الكبير جدًا حيث يهم وقت الاستجابة، فإن وقت التوليد الذي يتراوح بين 30-60 ثانية في وضع التفكير (Thinking Mode) للمطالبات المعقدة يخلق احتكاكًا حقيقيًا مقارنة بعوائد FLUX Schnell التي تقل عن ثانيتين.
لمن يُعد GPT Image 2، ومن يجب عليه اختيار شيء آخر
يُعد GPT Image 2 الخيار الواضح للفرق التي تحتاج إلى صور دقيقة النصوص على نطاق واسع، بغض النظر عن اللغة أو الحروف. تتناسب فرق التسويق متعددة اللغات، ومشغلو التجارة الإلكترونية الذين يولدون متغيرات المنتجات عبر الأسواق، والمطورون الذين يدمجون توليد المستندات أو الرسوم البيانية في منتجاتهم مع هذا الملف الشخصي تمامًا. كما أنه الخليفة الافتراضي لأي شخص كان يستخدم DALL-E 3 عبر واجهة برمجة التطبيقات (API). الإيقاف الإجباري في 12 مايو يزيل الخيار تمامًا لهذه الشريحة.
سيجد المطورون الذين يبنون واجهات برمجة تطبيقات للصور ويريدون نموذجًا مألوفًا لـ ChatGPT دون علاقة مع مورد جديد أن واجهة برمجة تطبيقات gpt-image-2 مناسبة تمامًا. التكامل مع واجهات برمجة تطبيقات Chat Completions وAssistants يجعل من السهل نسبيًا إضافة توليد الصور إلى المنتجات الحالية القائمة على OpenAI. بالنسبة لتوليد نماذج واجهة المستخدم (UI) المستخدمة كمواصفات لوكلاء التعليمات البرمجية اللاحقين، فإن تكامل Codex مفيد بشكل خاص. راجع Leonardo AI للحصول على بديل يركز أكثر على مسارات العمل ويستهدف بناة المنتجات.
تخطَّ gpt-image-2 عندما: يكون مخرجك الأساسي سينمائيًا أو فنًا تشكيليًا ويكون اتساق الأسلوب أكثر أهمية من دقة النصوص (Midjourney v8 أفضل)؛ أو تحتاج إلى وقت استجابة للتوليد يقل عن 5 ثوانٍ في الإنتاج (يعمل FLUX Schnell في أقل من ثانيتين)؛ أو تريد الاستضافة الذاتية والقضاء على تكاليف API لكل رمز (يتيح لك متغير Apache 2.0 من FLUX 2 Pro القيام بذلك)؛ أو يتطلب عملك تحكمًا دقيقًا بالبكسل في التصميم الجرافيكي حيث تكون واجهة اللغة هي الأداة الخاطئة بشكل أساسي. بالنسبة لتوليد صور وسائل التواصل الاجتماعي العرضية دون متطلبات API، تغطي باقة ChatGPT المجانية معظم حالات الاستخدام العادية دون أي اشتراك.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ GPT Image 2.

Freepik AI Is Now Magnific: What Changed, What It Costs, and Whether to Stay (2026)

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Wix Logo Maker Review (2026): Real Costs, the Edit Catch, and AI Alternatives
