تخطَّ إلى المحتوى الرئيسي
Vantaige
DALL-E 3 screenshot
DALL-E 3 logo

DALL-E 3

مجاني جزئيًا

تطور توليد الصور في OpenAI من DALL-E 3 مروراً بـ GPT-4o وصولاً إلى GPT Image 2، والذي يُعد الآن أدق نموذج لتصيير النصوص داخل الصور، مع ميزة التحرير الحواري المدمجة في ChatGPT. متاح مجاناً عبر Bing Image Creator؛ وباشتراك $20/mo في ChatGPT Plus للاستخدام المكثف. أقل تميزاً من الناحية البصرية مقارنة بـ Midjourney؛ ولكنه أكثر عملية للمهام التي تتطلب نصوصاً مقروءة أو حلقات تقييم متكررة مع العملاء.

الميزات:GPT-4o native image genGPT Image 2Conversational EditingText RenderingInpaintingC2PA CredentialsAPI AccessBing Image Creator integrationMicrosoft Designer

الموجه: "لقطة منتج واقعية لكوب قهوة من السيراميك الأسود غير اللامع على سطح من الرخام الأبيض، إضاءة استوديو ناعمة من اليسار، بخار يتصاعد، الكوب مطبوع عليه كلمة 'Monday' بخط أبيض نقي بدون حواف (sans-serif)". ظهرت كلمة "Monday" على الكوب، مكتوبة بشكل صحيح، بخط مقروء، وبالمقياس والانحناء الصحيحين لسطح الكوب. كان للبخار تفاصيل دقيقة ومقنعة. وملمس الرخام كان واقعياً. وسقط الظل بالزاوية الصحيحة. هذه النتيجة الفردية تخبرك عن قدرات توليد الصور الحالية في OpenAI أكثر من أي مخطط قياسي: لأول مرة، أصبح تضمين نص دقيق في صورة مُولدة مسار عمل يمكنك الاعتماد عليه، وليس مقامرة تحاول التكيف معها.

تم إدراج هذا التقييم تحت DALL-E 3، وهو الاسم القديم، لكن مستخدمي ChatGPT اليوم يعتمدون على GPT Image 2، الذي تم إطلاقه في 21 أبريل 2026. فهم هذا التطور أمر مهم: فالادعاءات حول القدرات التي كانت صحيحة بالنسبة لـ DALL-E 3 (نصوص أضعف، أبطأ، يعتمد على الانتشار) لم تعد تنطبق على النموذج الحالي.

البصمة البصرية لـ DALL-E في أبريل 2026

تاريخ النموذج هو قصة إعادة ابتكار هيكلية. كان DALL-E 3 (أكتوبر 2023) نموذج انتشار، وهو مسار منفصل لتوليد الصور يتلقى موجهاً نصياً وينتج صورة. كان تصيير النصوص غير موثوق لأن النموذج الذي يفهم اللغة لم يكن هو النموذج الذي يرسم الحروف. أدى التوليد الأصلي للصور في GPT-4o (25 مارس 2025) إلى توحيد هذين النظامين: نفس النموذج الانحداري التلقائي الذي يتعامل مع المحادثة أصبح الآن يولد الصور، ولهذا السبب تحسن تصيير النصوص بشكل كبير. يُعد GPT Image 2 (21 أبريل 2026) هو الإصدار الرائد الحالي، بدقة تصيير نصوص تصل إلى 99% تقريباً عبر النصوص اللاتينية والصينية واليابانية والكورية والهندية والبنغالية، وتوليد دفعات تصل إلى 8 صور متسقة، ودقة 2K، و"وضع التفكير" (Thinking Mode) الذي يطبق التفكير المنطقي الأصلي قبل إرجاع المخرجات. في غضون 12 ساعة من إطلاقه، احتل GPT Image 2 المركز الأول في قائمة صدارة Image Arena.

أفضل طريقة لفهم البصمة البصرية هي من خلال مقارنتها مع Midjourney. يفسر Midjourney الموجهات بشكل تعبيري، مضيفاً عمقاً سينمائياً وملمساً جوياً لم يطلبه الموجه صراحةً. بينما ينفذ GPT Image 2 الموجهات بدقة: المخرجات تشبه ما تم وصفه، وليس تفسيراً مبالغاً فيه. يبدو كوب "Monday" كصورة منتج حقيقية. وتبدو صالة ألعاب طوكيو المهجورة كصورة ملتقطة، وليست كذكرى. عملي وقابل للاستخدام؛ ولكنه أقل أيقونية. هذا التمييز هو المحرك الأساسي لكل نقاش حول "DALL-E مقابل Midjourney" في المجتمع، وهو ليس عيباً، بل خيار تصميم مقصود.

الموجهات التي تعمل بالفعل (مع بعض الملاحظات)

الموجه 1: لقطة المنتج مع نص مدمج. "لقطة منتج واقعية لكوب قهوة من السيراميك الأسود غير اللامع على سطح من الرخام الأبيض، إضاءة استوديو ناعمة من اليسار، بخار يتصاعد، الكوب مطبوع عليه كلمة 'Monday' بخط أبيض نقي بدون حواف." يقوم GPT Image 2 بتصيير كلمة "Monday" بشكل مقروء، بالانحناء الصحيح لسطح الكوب، مع هندسة ظل دقيقة وبخار مقنع. هذه الفئة من الموجهات، مثل التجارة الإلكترونية، وتغليف المنتجات، والنماذج الأولية للعلامات التجارية، هي حيث تتجلى الميزة الهيكلية المطلقة لـ GPT Image 2. ينتج مكافئ Midjourney جمالية رائعة للقطة المنتج ولكن كلمة "Monday" ستكون تقريباً زخرفياً للحروف بدلاً من أن تكون مقروءة بشكل موثوق.

الموجه 2: البيئة الجوية (وحيث تظهر الفجوة). "صورة سينمائية لصالة ألعاب مهجورة في طوكيو في الساعة 3 صباحاً، انعكاسات النيون على الرصيف المبلل، حبيبات فيلم 35mm." يقوم GPT Image 2 بتصيير هذا بشكل أقرب إلى ما يصفه الموجه حرفياً، انعكاسات دقيقة هندسياً، تفاصيل معقولة لكبائن الألعاب، ولوحة ألوان تظل ضمن ما يمكن أن ينتجه فيلم 35mm بالفعل. تبدو وكأنها صورة فوتوغرافية ملتقطة. بينما تنتج نسخة Midjourney نيوناً بألوان السماوي والأرجواني والكهرماني بعمق لوني يتجاوز أي صورة حقيقية. بالنسبة لعرض تقديمي للعميل، فإن نسخة GPT Image 2 أكثر قابلية للاستخدام. أما إذا كنت بحاجة إلى أن تبدو كذكرى، فإن Midjourney هو الفائز.

التحسين الحواري هو ميزة سير العمل التي لا تضاهيها أي منصة أخرى على هذا النطاق. بعد توليد أي من الصورتين، يمكنك مواصلة المحادثة: "اجعل الإضاءة أكثر دفئاً"، "أضف كوباً ثانياً يحمل نص 'Tuesday'". تدعم فرشاة الرسم الداخلي (inpainting) التعديلات المقنعة، لكن الآلية تعيد توليد الصورة بالكامل، وتعد التغييرات غير المتوقعة في المناطق التي لم يتم المساس بها (انحراف الملمس، تغير اللون) أثراً جانبياً معروفاً.

أين يواجه DALL-E صعوبات: الأيدي، النصوص، والاتساق

تعد إدارة المحتوى نقطة الاحتكاك الأكثر توثيقاً، وهي تعمل بشكل أكثر صرامة من أي نموذج منافس على مستوى المستهلك. تشمل الموجهات المحظورة الموثقة من منتدى مطوري OpenAI (2025): "اجعل بشرتها أفتح قليلاً" لشخصية شيطانة خيالية؛ مخطط طابق يحمل أسماء الغرف؛ كارتون بطل خارق يحمل الأحرف الأولى من اسم الشخصية؛ ومشاهد حكايات خرافية من الملكية العامة. ينجح نفس الموجه أحياناً في جلسة جديدة ويفشل في جلسة أخرى. وثق أحد المستخدمين فترة تبريد (cooldown) مدتها 29 دقيقة بعد تشغيل الفلتر.

"يوم الأربعاء قام بتوليد كل صورة أردتها. ثم يوم الخميس تغير كل شيء وأصبح غير قابل للعمل.". مستخدم في منتدى مجتمع OpenAI، في موضوع "ملاحظات حول نظام توليد الصور الجديد – مقيد للغاية ومزعج لسير العمل الإبداعي"، community.openai.com، 2025

يعد رفض أسلوب الفنانين الأحياء طبقة احتكاك منفصلة. تحظر OpenAI "بأسلوب فنان على قيد الحياة" بينما تسمح بأساليب الاستوديوهات أو الحركات الفنية الأوسع، وهو تمييز يُطبق بشكل غير متسق. يمكن أن ينجح نفس الطلب في جلسة جديدة ويفشل في أخرى. بالنسبة للمديرين الفنيين الذين يستخدمون أسماء الفنانين كمرجع سريع للأسلوب المهني، فإن هذا يمثل احتكاكاً غير متوقع.

تتراوح سرعة التوليد بين 60–180 ثانية لكل صورة، وهي أبطأ من DALL-E 3 (20–45 ثانية عبر API) لأن التوليد الانحداري التلقائي يتطلب كثافة حسابية أكبر من الانتشار. خلال ساعات الذروة في الولايات المتحدة، أبلغ مستخدمو Plus عن عمليات توليد فردية تتجاوز دقيقتين. ترفض عمليات فحص الإشراف بعد التوليد أحياناً الصور بعد معالجتها، مما يستهلك حصة من الحد المسموح به دون إظهار أي نتيجة. الحد الأقصى المؤكد من المجتمع لمستخدمي Plus هو حوالي 50 صورة لكل نافذة متجددة مدتها 3 ساعات، وهو غير معلن رسمياً، وتم اكتشافه عند الوصول إليه، مع عدم وجود وضع استرخاء (Relax Mode) كبديل عند الوصول إلى الحد الأقصى.

الاستخدام التجاري: الترخيص، حقوق النشر، وفلاتر الأمان

تتنازل OpenAI عن أي حقوق تمتلكها في المخرجات لصالح العميل. سواء لمشتركي API أو ChatGPT على حد سواء. أوضح تقرير صادر عن مكتب حقوق الطبع والنشر الأمريكي في يناير 2025 أن التوجيه النصي البسيط لا يمنح المستخدمين حقوق الطبع والنشر على المخرجات بموجب القانون الحالي. تخلي OpenAI مسؤوليتها عن أي ضمان لعدم الانتهاك؛ ولا تزال الأسئلة المتعلقة بأعباء بيانات التدريب دون حل. وصلت قضية The New York Times v. OpenAI، وهي دعوى حقوق الطبع والنشر التي تحدد معالم الصناعة، إلى مرحلة الحكم المستعجل في 2 أبريل 2026، مع أمر OpenAI بتسليم 20 مليون سجل مجهول الهوية من ChatGPT. ولم يتم تحديد موعد للمحاكمة بعد.

تتضمن جميع الصور المُولدة عبر موقع ChatGPT وAPI بيانات وصفية غير مرئية من نوع C2PA تميزها على أنها مُولدة بواسطة OpenAI. يمكن التحقق منها على contentcredentials.org؛ ويمكن إزالتها عن طريق التقاط شاشة أو تحويل التنسيق. تمت إزالة العلامات المائية المرئية في عام 2024.

رسخت لحظة Studio Ghibli في 25 مارس 2025 النقاش الثقافي. عندما تم إطلاق GPT-4o، غمرت المنصات الاجتماعية صور شخصية بأسلوب Ghibli في غضون ساعات. أبلغ Sam Altman عن إضافة مليون مستخدم في ساعة واحدة ووصف البنية التحتية لوحدات معالجة الرسومات (GPU) في OpenAI بأنها "تذوب". وعاد اقتباس Miyazaki الوثائقي لعام 2016 حول كون الرسوم المتحركة بالذكاء الاصطناعي "إهانة للحياة نفسها" إلى الظهور كقصة مضادة. لم يتم رفع أي دعوى قضائية من Studio Ghibli حتى أبريل 2026، لكن هذه الحادثة أصبحت اللحظة الحاسمة لكل جدل تلاها حول حقوق الطبع والنشر لتقليد الأساليب الفنية بالذكاء الاصطناعي.

مسارات عمل المجتمع من Reddit و Discord

مسار العمل المهني المتكرر عبر مجتمعات تصميم المنتجات في 2025–2026: توليد نماذج أولية لواجهة المستخدم والتسويق مع نص مقروء مدمج. تستخدم فرق المنتجات والوكالات الصغيرة توليد الصور في ChatGPT لإنتاج لقطات شاشة لنماذج واجهة المستخدم، ومرئيات الإطارات السلكية للصفحات المقصودة، وتغليف المنتجات، باستخدام ChatGPT في مرحلة التفكير قبل فتح أي أداة تصميم. موجه مثل "أنشئ نموذجاً أولياً لشاشة إعداد تطبيق جوال مع العنوان 'Start your journey'، خلفية بيضاء نقية، طباعة San Francisco، أسلوب iOS" ينتج عملاً قابلاً للاستخدام في العروض التقديمية للعملاء. بدون Figma، وبدون استهلاك وقت المصمم في المسودة الأولى.

"لقد كنت أستخدم ChatGPT لتكرار وتحسين المرئيات الخاصة بالعلامات التجارية للعملاء. حقيقة أنه يمكنني فقط قول 'اجعلها تبدو أكثر فخامة' ويفهم ذلك من السياق، لا توجد أداة أخرى تفعل ذلك.". مستخدم Reddit في r/ChatGPT، مُقتبس في مقارنة digidop.com، 2025

تلت ذلك موجة انتشار ثانية في أبريل 2025: حيث قام المستخدمون بتوجيه ChatGPT لتصيير صورهم كشخصيات حركة بلاستيكية (action figures) داخل عبوات شفافة. انتشر هذا الاتجاه من وسائل التواصل الاجتماعي إلى LinkedIn كتمرين على بناء العلامة التجارية الشخصية، بمشاركة سياسيين ومشاهير. وبعيداً عن كونها مجرد صرعة جديدة، فقد أثبتت قدرة النموذج على التعامل مع تحويل الصور المتسق مع الموضوع من صورة مرجعية، وهي قدرة أصبحت مسار عمل موثق لتوليد الصور الرمزية (avatars) والشخصيات عبر مجتمعات المنتجات.

"توليد الصور في GPT-4o مفيد حقاً للعمل بطريقة لم يكن Midjourney كذلك بالنسبة لي أبداً. يمكنني إنشاء نموذج أولي لمنتج بنص مقروء فعلياً. هذا هو جوهر الأمر.". مستخدم في منتدى مجتمع OpenAI، community.openai.com، 2025

DALL-E مقابل Midjourney مقابل Adobe Firefly

يُعد Midjourney (V7 / V8.1 Alpha) هو المنافس الإبداعي المباشر. في مقارنة شملت سبعة موجهات أجراها Tom's Guide (2025)، فاز Midjourney في الثراء البصري عبر الموجهات السينمائية والتحريرية. الاستنتاج الثابت: بالنسبة للمخرجات الجوية والموجهة فنياً، لا يزال Midjourney مهيمناً. أما بالنسبة للصور الدقيقة التي تتضمن نصوصاً والقابلة للتحرير حوارياً في سير عمل ChatGPT، فإن GPT Image 2 هو الفائز. يبدأ اشتراك Midjourney من $10/month بدون باقة مجانية؛ أما بالنسبة للفرق التي تستخدم بالفعل ChatGPT Plus، فإن توليد الصور لا يكلف أي رسوم إضافية، وهذا التفاوت في التسعير وحده يدفع العديد من المستخدمين نحو OpenAI.

يحل Adobe Firefly مشكلة مختلفة: اليقين بشأن مصدر الملكية الفكرية (IP). تم تدريب Firefly 3 حصرياً على محتوى Adobe Stock المرخص ومحتوى الملكية العامة، ولا يحمل أي مخاطر تتعلق بحقوق الطبع والنشر من أسئلة بيانات التدريب، وهو مدمج أصلياً في Photoshop و Lightroom و Premiere. جودة الصورة جيدة ولكنها تفتقر إلى التميز الجمالي الموجود في OpenAI أو Midjourney. بالنسبة للبث أو الإعلانات أو أعمال العملاء ذات المسؤولية العالية حيث يكون المصدر أكثر أهمية من الجماليات، فإن Firefly هو الخيار المنطقي. أما بالنسبة للعمل الذي يتطلب نصاً دقيقاً في الصورة أو حلقة تحرير حوارية، فإن GPT Image 2 هو الخيار الأقوى.

اقتصاديات الأرصدة، ما تكلفة المشروع الحقيقي

الباقة المجانية مفيدة حقاً للتقييم: حوالي 3 صور لكل نافذة مدتها 24 ساعة في ChatGPT Free. يوفر Bing Image Creator نقطة دخول مجانية أكثر سخاءً، 15 عملية توليد سريعة (boost) يومياً مع توليد أبطأ غير محدود بعد ذلك، مجاناً مع أي حساب Microsoft. لا يتطلب بطاقة ائتمان.

يُعد اشتراك ChatGPT Plus بسعر $20/month هو النقطة المحورية. يضع إجماع المجتمع الحد الفعلي عند حوالي 50 صورة لكل نافذة متجددة مدتها 3 ساعات، أي حوالي 200 صورة يومياً من الناحية العملية. يتم تضمين "وضع التفكير" (Thinking Mode) الخاص بـ GPT Image 2 (توليد دفعة من 8 صور متسقة، والتحقق الذاتي) في باقة Plus. لا يوجد نظام منفصل لأرصدة الصور.

تسعير API لـ GPT Image 2 (أبريل 2026): منخفض / فوري (Low / Instant) بحوالي $0.006 لكل صورة؛ متوسط (Medium) بسعر $0.053؛ عالي / تفكير (High / Thinking) بسعر $0.211. توفر Batch API تخفيضاً في التكلفة بنسبة 50% لأعباء العمل غير الفورية. لا يزال DALL-E 3 متاحاً عبر API بسعر $0.04–$0.12، وهو أسرع ولكنه بجودة أقل بكثير.

بالنسبة لمشروع حقيقي، 200 صورة منتج مع تسميات نصية دقيقة بجودة API Medium، تبلغ التكلفة حوالي $10.60. نفس الـ 200 صورة على ChatGPT Plus مشمولة فعلياً في اشتراك $20/month. في باقة Pro ($200/month)، يكون التوليد غير محدود فعلياً. تتفوق API مع خصومات Batch على الاشتراكات للفرق التي تدير مسارات عمل ذات حجم كبير.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

كيف تقارن DALL-E 3

مقارنات جنبًا إلى جنب مع أدوات أخرى.

ظهرت في مجموعات

قوائم منتقاة تتضمّن DALL-E 3.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ DALL-E 3.