Aller au contenu principal
Vantaige
DALL-E 3 screenshot
DALL-E 3 logo

DALL-E 3

Freemium

La génération d'images d'OpenAI a évolué de DALL-E 3 à GPT Image 2 en passant par GPT-4o. C'est aujourd'hui le modèle le plus précis pour le rendu de texte, avec une édition conversationnelle intégrée à ChatGPT. Gratuit via Bing Image Creator ; 20 $/mois avec ChatGPT Plus pour des volumes plus importants. Moins iconique visuellement que Midjourney, mais plus facile à déployer pour les travaux nécessitant du texte lisible ou des boucles de retours itératives avec les clients.

Fonctionnalités :GPT-4o native image genGPT Image 2Conversational EditingText RenderingInpaintingC2PA CredentialsAPI AccessBing Image Creator integrationMicrosoft Designer

Prompt : "photographie de produit photoréaliste d'un mug en céramique noir mat sur une surface en marbre blanc, éclairage de studio doux venant de la gauche, vapeur qui s'élève, le mug porte le texte 'Monday' imprimé en caractères sans empattement blancs et nets". Le mot "Monday" est apparu sur le mug, correctement orthographié, dans une police sans empattement lisible, à la bonne échelle et avec la courbure adaptée à la surface du mug. La vapeur présentait des volutes convaincantes. La texture du marbre était photoréaliste. L'ombre tombait selon le bon angle. Ce seul résultat en dit plus sur la génération d'images actuelle d'OpenAI que n'importe quel graphique de référence : pour la première fois, inclure du texte précis dans une image générée est un flux de travail sur lequel vous pouvez compter, et non un pari que vous essayez de gérer.

Cette entrée est classée sous DALL-E 3, l'identifiant historique, mais les utilisateurs de ChatGPT utilisent aujourd'hui GPT Image 2, lancé le 21 avril 2026. Comprendre cette évolution est important : les affirmations sur les capacités qui étaient vraies pour DALL-E 3 (texte plus faible, plus lent, basé sur la diffusion) ne s'appliquent plus au modèle actuel.

La signature visuelle de DALL-E en avril 2026

L'histoire du modèle est celle d'une réinvention architecturale. DALL-E 3 (octobre 2023) était un modèle de diffusion, un pipeline de génération d'images distinct qui recevait un prompt textuel et produisait une image. Le rendu du texte n'était pas fiable car le modèle qui comprenait le langage n'était pas celui qui dessinait les lettres. La génération d'images native de GPT-4o (25 mars 2025) a unifié ces deux systèmes : le même modèle autorégressif qui gère la conversation génère désormais les images, ce qui explique l'amélioration spectaculaire du rendu du texte. GPT Image 2 (21 avril 2026) est le fleuron actuel, avec une précision de rendu de texte d'environ 99 % pour les écritures latines, CJK, hindi et bengali, la génération par lots allant jusqu'à 8 images cohérentes, une résolution 2K et un "Thinking Mode" (Mode Réflexion) qui applique un raisonnement natif avant de renvoyer un résultat. Dans les 12 heures suivant son lancement, GPT Image 2 a pris la première place du classement Image Arena.

La signature visuelle se comprend mieux en la comparant à celle de Midjourney. Midjourney interprète les prompts de manière expressive, en ajoutant une profondeur cinématographique et une texture atmosphérique que le prompt n'a pas explicitement demandées. GPT Image 2 exécute les prompts avec précision : le résultat ressemble à ce qui a été décrit, et non à une interprétation sublimée de celui-ci. Le mug "Monday" ressemble à une photographie de produit. La salle d'arcade abandonnée de Tokyo ressemble à une image trouvée, pas à un souvenir. Déployable ; moins iconique. Cette distinction est au cœur de presque toutes les discussions "DALL-E vs. Midjourney" au sein de la communauté, et ce n'est pas un bug, c'est un choix de conception.

Les prompts qui fonctionnent vraiment (et leurs particularités)

Prompt 1 : La photographie de produit avec texte intégré. "Photographie de produit photoréaliste d'un mug en céramique noir mat sur une surface en marbre blanc, éclairage de studio doux venant de la gauche, vapeur qui s'élève, le mug porte le texte 'Monday' imprimé en caractères sans empattement blancs et nets." GPT Image 2 rend "Monday" de manière lisible, avec la bonne courbure pour la surface du mug, une géométrie des ombres précise et une vapeur convaincante. C'est dans cette catégorie de prompts (e-commerce, emballages de produits, maquettes de marque) que l'avantage architectural de GPT Image 2 est absolu. Un équivalent sur Midjourney produit une esthétique de photographie de produit magnifique, mais "Monday" sera une approximation décorative des lettres plutôt qu'un texte véritablement lisible.

Prompt 2 : L'environnement atmosphérique (et là où l'écart se creuse). "Photo cinématographique d'une salle d'arcade abandonnée à Tokyo à 3h du matin, reflets de néons sur le trottoir mouillé, grain de film 35mm." GPT Image 2 rend cela de manière plus proche de ce que le prompt décrit littéralement : des reflets géométriquement précis, des détails de bornes d'arcade plausibles, une palette de couleurs qui reste dans les limites de ce qu'un film 35mm produirait réellement. On dirait une photographie trouvée. La version de Midjourney produit des néons cyan-magenta-ambre avec une profondeur tonale qui dépasse n'importe quelle vraie photographie. Pour une présentation client, la version de GPT Image 2 est plus facile à déployer. Si vous avez besoin que cela ressemble à un souvenir, Midjourney l'emporte.

L'affinage conversationnel est l'avantage de flux de travail qu'aucune autre plateforme n'égale à grande échelle. Après avoir généré l'une ou l'autre image, vous poursuivez la conversation : "rends l'éclairage plus chaud", "ajoute un deuxième mug avec le texte 'Tuesday'". Le pinceau d'inpainting prend en charge les modifications masquées, mais le mécanisme régénère l'image complète ; des changements inattendus dans les zones non touchées (dérive de texture, changement de couleur) sont un effet secondaire connu.

Là où DALL-E a des difficultés : mains, texte, cohérence

La modération du contenu est le point de friction le plus documenté, et elle est plus agressive que n'importe quel modèle concurrent au niveau grand public. Les prompts bloqués documentés sur le forum des développeurs d'OpenAI (2025) incluent : "Rends sa peau un peu plus pâle" pour une démone de fantasy ; un plan d'étage étiqueté avec des noms de pièces ; un dessin animé de super-héros avec les initiales du personnage ; des scènes de contes de fées du domaine public. Le même prompt réussit parfois dans une nouvelle session et échoue dans une autre. Un utilisateur a documenté un temps de recharge de 29 minutes après avoir déclenché le filtre.

"Mercredi, il a généré toutes les images que je voulais. Puis jeudi, tout a changé et c'était inutilisable.". Utilisateur du forum communautaire d'OpenAI, dans le fil "Feedback on the New Image Generation System – Too Restrictive and Disruptive to Creative Workflows", community.openai.com, 2025

Le refus de générer dans le style d'un artiste vivant est une autre source de friction. OpenAI bloque "dans le style d'un artiste vivant" tout en autorisant des styles de studios ou de mouvements plus larges, une distinction appliquée de manière incohérente. La même demande peut réussir dans une nouvelle session et échouer dans une autre. Pour les directeurs artistiques qui utilisent des références de style au nom d'artistes comme raccourci professionnel, c'est une friction imprévisible.

La vitesse de génération est de 60 à 180 secondes par image, plus lente que DALL-E 3 (20 à 45 secondes via l'API) car la génération autorégressive est plus gourmande en calculs que la diffusion. Pendant les heures de pointe aux États-Unis, les utilisateurs Plus signalent des générations individuelles dépassant les 2 minutes. Les analyses de modération post-génération rejettent parfois les images après leur traitement, consommant un emplacement de limite de taux sans rien afficher. La limite Plus vérifiée par la communauté est d'environ 50 images par fenêtre glissante de 3 heures, non publiée, découverte en l'atteignant, sans solution de repli en mode Relax (Relax Mode) lorsque le plafond est atteint.

Utilisation commerciale : licences, droits d'auteur et filtres de sécurité

OpenAI cède au client tous les droits qu'elle détient sur les résultats. Qu'il s'agisse des abonnés à l'API ou à ChatGPT. Un rapport du U.S. Copyright Office de janvier 2025 a précisé que le simple fait de rédiger des prompts textuels n'accorde pas aux utilisateurs de droits d'auteur sur les résultats en vertu de la loi actuelle. OpenAI décline toute garantie de non-contrefaçon ; les questions d'encombrement des données d'entraînement ne sont pas résolues. L'affaire New York Times v. OpenAI, le procès sur les droits d'auteur qui définit l'industrie, a atteint la phase de jugement sommaire le 2 avril 2026, OpenAI ayant reçu l'ordre de remettre 20 millions de journaux ChatGPT anonymisés. Aucune date de procès n'a été fixée.

Toutes les images générées via le web ChatGPT et l'API incluent des métadonnées C2PA invisibles les marquant comme générées par OpenAI. Vérifiable sur contentcredentials.org ; supprimable par capture d'écran ou conversion de format. Les filigranes visibles ont été supprimés en 2024.

Le moment Studio Ghibli du 25 mars 2025 a ancré le débat culturel. Lors du lancement de GPT-4o, les plateformes sociales ont été inondées de portraits de style Ghibli en quelques heures. Sam Altman a signalé l'ajout d'un million d'utilisateurs en une seule heure et a décrit l'infrastructure GPU d'OpenAI comme "en train de fondre". La citation du documentaire de Miyazaki de 2016 sur l'animation par l'IA étant "une insulte à la vie elle-même" a refait surface comme contre-récit. Aucun litige de la part du Studio Ghibli n'avait été déposé en avril 2026, mais l'épisode est devenu le moment déterminant pour tous les arguments sur les droits d'auteur liés à l'imitation de style par l'IA qui ont suivi.

Flux de travail de la communauté sur Reddit et Discord

Le flux de travail professionnel récurrent dans les communautés de conception de produits en 2025-2026 : la génération de maquettes d'interface utilisateur et de marketing avec du texte lisible intégré. Les équipes produit et les petites agences utilisent la génération d'images de ChatGPT pour produire des captures d'écran de maquettes d'interface utilisateur, des visuels de wireframes de pages de destination et des emballages de produits, en utilisant ChatGPT dans la phase d'idéation avant même d'ouvrir un outil de conception. Un prompt tel que "Crée une maquette d'un écran d'intégration d'application mobile avec le titre 'Start your journey', un fond blanc épuré, une typographie San Francisco, un style iOS" produit un artefact de présentation client utilisable. Pas de Figma, pas de temps de designer pour la première ébauche.

"J'utilise ChatGPT pour itérer sur les visuels de marque pour les clients. Le fait que je puisse simplement dire 'rends-le plus premium' et qu'il comprenne d'après le contexte, aucun autre outil ne fait ça.". Utilisateur Reddit dans r/ChatGPT, cité dans la comparaison digidop.com, 2025

Une deuxième vague virale a suivi en avril 2025 : les utilisateurs demandant à ChatGPT de rendre leurs photos sous forme de figurine en plastique dans un emballage blister. La tendance s'est propagée des réseaux sociaux à LinkedIn en tant qu'exercice de personal branding, avec la participation de politiciens et de célébrités. Au-delà de la nouveauté, cela a démontré la capacité du modèle à gérer la transformation d'image cohérente avec le sujet à partir d'une photographie de référence, une capacité qui est devenue un flux de travail documenté pour la génération d'avatars et de personas dans les communautés de produits.

"La génération d'images de GPT-4o est véritablement utile pour le travail d'une manière que Midjourney n'a jamais été pour moi. Je peux générer une maquette de produit avec du vrai texte lisible. C'est ça qui change tout.". Utilisateur du forum communautaire d'OpenAI, community.openai.com, 2025

DALL-E vs. Midjourney vs. Adobe Firefly

Midjourney (V7 / V8.1 Alpha) est le concurrent créatif direct. Dans une comparaison de sept prompts par Tom's Guide (2025), Midjourney a gagné sur la richesse visuelle pour les prompts cinématographiques et éditoriaux. La conclusion constante : pour des résultats atmosphériques et avec une direction artistique, Midjourney domine toujours. Pour des images précises, incluant du texte et modifiables de manière conversationnelle dans un flux de travail ChatGPT, GPT Image 2 l'emporte. Midjourney commence à 10 $/mois sans version gratuite ; pour les équipes déjà sur ChatGPT Plus, la génération d'images ne coûte rien de plus, cette asymétrie de prix à elle seule pousse de nombreux utilisateurs vers OpenAI.

Adobe Firefly résout un problème différent : la certitude de la provenance de la propriété intellectuelle. Firefly 3 est entraîné exclusivement sur du contenu sous licence Adobe Stock et du domaine public, ne comporte aucun risque de droits d'auteur lié aux données d'entraînement, et s'intègre nativement dans Photoshop, Lightroom et Premiere. La qualité de l'image est compétente mais manque de la distinction esthétique d'OpenAI ou de Midjourney. Pour la diffusion, la publicité ou le travail client à haute responsabilité où la provenance compte plus que l'esthétique, Firefly est le choix rationnel. Pour les travaux nécessitant un texte précis dans l'image ou une boucle d'édition conversationnelle, GPT Image 2 est le meilleur choix.

Économie des crédits, ce que coûte un vrai projet

La version gratuite est véritablement utile pour l'évaluation : environ 3 images par fenêtre de 24 heures dans ChatGPT Free. Bing Image Creator offre un point d'entrée gratuit plus généreux, 15 générations rapides (boosts) par jour avec une génération plus lente illimitée ensuite, gratuit avec n'importe quel compte Microsoft. Aucune carte de crédit requise.

ChatGPT Plus à 20 $/mois est le point de bascule. Le consensus de la communauté situe la limite effective à environ 50 images par fenêtre glissante de 3 heures, soit environ 200 par jour en pratique. Le Thinking Mode de GPT Image 2 (génération par lots de 8 images cohérentes, auto-vérification) est inclus dans Plus. Pas de système de crédits d'image séparé.

Tarification de l'API pour GPT Image 2 (avril 2026) : Low / Instant à environ 0,006 $ par image ; Medium à 0,053 $ ; High / Thinking à 0,211 $. API Batch avec une réduction de coût de 50 % pour les charges de travail non temps réel. DALL-E 3 via l'API reste disponible à 0,04 $–0,12 $, plus rapide mais de qualité nettement inférieure.

Pour un vrai projet, 200 images de produits avec des étiquettes de texte précises en qualité API Medium, le coût s'élève à environ 10,60 $. Les mêmes 200 images sur ChatGPT Plus sont effectivement incluses dans l'abonnement à 20 $/mois. Avec Pro (200 $/mois), la génération est pratiquement illimitée. L'API avec les remises Batch bat les abonnements pour les équipes gérant des flux de travail en volume.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Comment DALL-E 3 se compare

Comparatifs détaillés face à d'autres outils.

Présent dans les collections

Listes sélectionnées incluant DALL-E 3.

Articles associés

Guides et articles en lien avec DALL-E 3.