

La generación de imágenes de OpenAI ha evolucionado desde DALL-E 3, pasando por GPT-4o, hasta llegar a GPT Image 2, que ahora es el renderizador de texto más preciso en cualquier modelo de imagen, con edición conversacional integrada en ChatGPT. Gratis a través de Bing Image Creator; $20/mo con ChatGPT Plus para mayor volumen. Menos icónico visualmente que Midjourney; más práctico para trabajos que requieren texto legible o ciclos de retroalimentación iterativos con clientes.
Prompt: "photorealistic product shot of a matte black ceramic coffee mug on a white marble surface, soft studio lighting from the left, steam rising, the mug has the text 'Monday' printed on it in clean white sans-serif". La palabra "Monday" apareció en la taza, escrita correctamente, en una fuente sans-serif legible, con la escala y curvatura correctas para la superficie de la taza. El vapor tenía detalles de volutas convincentes. La textura del mármol era fotorrealista. La sombra caía en el ángulo correcto. Ese único resultado te dice más sobre la generación de imágenes actual de OpenAI que cualquier gráfico de rendimiento: por primera vez, incluir texto preciso en una imagen generada es un flujo de trabajo en el que puedes confiar, no una apuesta con la que tienes que lidiar.
Esta entrada está archivada bajo DALL-E 3, el identificador heredado, pero los usuarios de ChatGPT hoy en día están ejecutando GPT Image 2, que se lanzó el 21 de abril de 2026. Entender este linaje es importante: las afirmaciones sobre las capacidades que eran ciertas para DALL-E 3 (texto más deficiente, más lento, basado en difusión) ya no se aplican al modelo actual.
La firma visual de DALL-E en abril de 2026
La historia del modelo es un relato de reinvención arquitectónica. DALL-E 3 (octubre de 2023) era un modelo de difusión, un canal de generación de imágenes independiente que recibía un prompt de texto y producía una imagen. La renderización de texto no era confiable porque el modelo que entendía el lenguaje no era el mismo que dibujaba las letras. La generación nativa de imágenes de GPT-4o (25 de marzo de 2025) unificó esos dos sistemas: el mismo modelo autorregresivo que maneja la conversación ahora genera imágenes, razón por la cual la renderización de texto mejoró drásticamente. GPT Image 2 (21 de abril de 2026) es el modelo insignia actual, con aproximadamente un 99% de precisión en la renderización de texto en escrituras latinas, CJK, hindi y bengalí, generación por lotes de hasta 8 imágenes consistentes, resolución 2K y un "Thinking Mode" que aplica razonamiento nativo antes de devolver un resultado. A las 12 horas de su lanzamiento, GPT Image 2 ocupó la primera posición en la clasificación de Image Arena.
La firma visual se entiende mejor al contrastarla con Midjourney. Midjourney interpreta los prompts de manera expresiva, añadiendo profundidad cinematográfica y textura atmosférica que el prompt no solicitó explícitamente. GPT Image 2 ejecuta los prompts con precisión: el resultado se asemeja a lo descrito, no a una interpretación exagerada de ello. La taza "Monday" parece una fotografía de producto. El salón recreativo abandonado de Tokio parece una imagen encontrada, no un recuerdo. Más práctico; menos icónico. Esa distinción impulsa casi todas las discusiones de "DALL-E vs. Midjourney" en la comunidad, y no es un error, es una elección de diseño.
Prompts que realmente funcionan (con sus peculiaridades)
Prompt 1: La fotografía de producto con texto integrado. "Photorealistic product shot of a matte black ceramic coffee mug on a white marble surface, soft studio lighting from the left, steam rising, the mug has the text 'Monday' printed on it in clean white sans-serif." GPT Image 2 renderiza "Monday" de forma legible, con la curvatura correcta para la superficie de la taza, con una geometría de sombras precisa y un vapor convincente. Esta clase de prompts (comercio electrónico, empaques de productos, mockups de marca) es donde la ventaja arquitectónica de GPT Image 2 es absoluta. Un equivalente en Midjourney produce una hermosa estética de fotografía de producto, pero "Monday" será una aproximación decorativa de las letras en lugar de ser confiablemente legible.
Prompt 2: El entorno atmosférico (y donde aparece la brecha). "Cinematic photo of an abandoned Tokyo arcade at 3am, neon reflections on wet pavement, 35mm film grain." GPT Image 2 renderiza esto más cerca de lo que el prompt describe literalmente: reflejos geométricamente precisos, detalles plausibles en las máquinas, una paleta de colores que se mantiene dentro de lo que realmente produciría una película de 35mm. Se percibe como una fotografía encontrada. La versión de Midjourney produce luces de neón cian-magenta-ámbar con una profundidad tonal que supera a cualquier fotografía real. Para una presentación a un cliente, la versión de GPT Image 2 es más práctica. Si necesitas que se sienta como un recuerdo, Midjourney gana.
El refinamiento conversacional es la ventaja de flujo de trabajo que ninguna otra plataforma iguala a esta escala. Después de generar cualquier imagen, continúas la conversación: "haz que la iluminación sea más cálida", "añade una segunda taza con el texto 'Tuesday'". El pincel de inpainting admite ediciones con máscaras, pero el mecanismo regenera la imagen completa; los cambios inesperados en áreas no tocadas (desviación de textura, cambio de color) son un efecto secundario conocido.
Donde DALL-E tiene dificultades: manos, texto, consistencia
La moderación de contenido es el punto de fricción más documentado, y es más agresiva que en cualquier modelo de la competencia a nivel de consumidor. Los prompts bloqueados documentados en el foro de desarrolladores de OpenAI (2025) incluyen: "Haz que su piel sea un poco más pálida" para una diablesa de fantasía; un plano de planta etiquetado con los nombres de las habitaciones; una caricatura de superhéroe con las iniciales del personaje; escenas de cuentos de hadas de dominio público. El mismo prompt a veces tiene éxito en una nueva sesión y falla en otra. Un usuario documentó un tiempo de espera de 29 minutos después de activar el filtro.
"El miércoles generó todas las imágenes que quería. Luego, el jueves, todo cambió y fue imposible trabajar". Usuario del foro de la comunidad de OpenAI, en el hilo "Feedback on the New Image Generation System – Too Restrictive and Disruptive to Creative Workflows", community.openai.com, 2025
El rechazo al estilo de artistas vivos es una capa de fricción adicional. OpenAI bloquea "al estilo de un artista vivo" mientras permite estilos de estudios o movimientos más amplios, una distinción que se aplica de manera inconsistente. La misma solicitud puede tener éxito en una nueva sesión y fallar en otra. Para los directores de arte que utilizan referencias de estilo con nombres de artistas como atajo profesional, esto representa una fricción impredecible.
La velocidad de generación oscila entre 60 y 180 segundos por imagen, más lenta que DALL-E 3 (20–45 segundos a través de la API) porque la generación autorregresiva requiere más recursos computacionales que la difusión. Durante las horas pico en EE. UU., los usuarios de Plus reportan generaciones individuales que superan los 2 minutos. Los escaneos de moderación posteriores a la generación ocasionalmente rechazan imágenes después de haber sido procesadas, consumiendo un espacio del límite de uso sin mostrar ningún resultado. El límite de Plus verificado por la comunidad es de aproximadamente 50 imágenes por ventana móvil de 3 horas, no publicado, descubierto al alcanzarlo, sin una alternativa de Relax Mode cuando se llega al tope.
Uso comercial: licencias, derechos de autor y filtros de seguridad
OpenAI cede al cliente cualquier derecho que posea sobre los resultados. Tanto a los suscriptores de la API como a los de ChatGPT. Un informe de la Oficina de Derechos de Autor de EE. UU. de enero de 2025 aclaró que el simple uso de prompts de texto no otorga a los usuarios derechos de autor sobre los resultados según la ley actual. OpenAI renuncia a cualquier garantía de no infracción; las cuestiones sobre las cargas de los datos de entrenamiento siguen sin resolverse. El caso The New York Times v. OpenAI, la demanda por derechos de autor que define a la industria, alcanzó la fase de juicio sumario el 2 de abril de 2026, y se ordenó a OpenAI entregar 20 millones de registros anonimizados de ChatGPT. No se ha fijado fecha para el juicio.
Todas las imágenes generadas a través de la web de ChatGPT y la API incluyen metadatos C2PA invisibles que las marcan como generadas por OpenAI. Verificable en contentcredentials.org; se pueden eliminar mediante capturas de pantalla o conversión de formato. Las marcas de agua visibles se eliminaron en 2024.
El momento Studio Ghibli del 25 de marzo de 2025 ancló el debate cultural. Cuando se lanzó GPT-4o, las plataformas sociales se inundaron de retratos al estilo Ghibli en cuestión de horas. Sam Altman informó haber sumado un millón de usuarios en una sola hora y describió la infraestructura de GPU de OpenAI como si se estuviera "derritiendo". La cita del documental de Miyazaki de 2016 sobre que la animación con IA es "un insulto a la vida misma" resurgió como la contranarrativa. Hasta abril de 2026 no se había presentado ningún litigio por parte de Studio Ghibli, pero el episodio se convirtió en el momento definitorio para todos los argumentos de derechos de autor sobre la imitación de estilos por IA que siguieron.
Flujos de trabajo de la comunidad en Reddit y Discord
El flujo de trabajo profesional recurrente en las comunidades de diseño de productos en 2025–2026: generación de mockups de marketing y UI con texto legible integrado. Los equipos de producto y las pequeñas agencias utilizan la generación de imágenes de ChatGPT para producir capturas de pantalla de mockups de UI, elementos visuales de wireframes para páginas de aterrizaje y empaques de productos, utilizando ChatGPT en la fase de ideación antes de abrir cualquier herramienta de diseño. Un prompt como "Create a mockup of a mobile app onboarding screen with the headline 'Start your journey', clean white background, San Francisco typography, iOS style" produce un artefacto utilizable para presentaciones a clientes. Sin Figma, sin tiempo de diseñador para la primera pasada.
"He estado usando ChatGPT para iterar sobre los elementos visuales de marca para mis clientes. El hecho de que pueda simplemente decir 'haz que se sienta más premium' y lo entienda por el contexto, ninguna otra herramienta lo hace". Usuario de Reddit en r/ChatGPT, citado en la comparación de digidop.com, 2025
Una segunda ola viral siguió en abril de 2025: los usuarios pedían a ChatGPT que renderizara sus fotos como una figura de acción de plástico en un empaque tipo blíster. La tendencia se extendió desde las redes sociales hasta LinkedIn como un ejercicio de marca personal, con la participación de políticos y celebridades. Más allá de la novedad, demostró la capacidad del modelo para manejar la transformación de imágenes manteniendo la consistencia del sujeto a partir de una fotografía de referencia, una capacidad que se convirtió en un flujo de trabajo documentado para la generación de avatares y personas en las comunidades de productos.
"La generación de imágenes de GPT-4o es genuinamente útil para el trabajo de una manera que Midjourney nunca lo fue para mí. Puedo generar un mockup de producto con texto real y legible. Eso lo cambia todo". Usuario del foro de la comunidad de OpenAI, community.openai.com, 2025
DALL-E vs. Midjourney vs. Adobe Firefly
Midjourney (V7 / V8.1 Alpha) es el competidor creativo directo. En una comparación de siete prompts realizada por Tom's Guide (2025), Midjourney ganó en riqueza visual en prompts cinematográficos y editoriales. La conclusión constante: para resultados atmosféricos y con dirección de arte, Midjourney sigue dominando. Para imágenes precisas, que incluyan texto y sean editables conversacionalmente en un flujo de trabajo de ChatGPT, GPT Image 2 es el ganador. Midjourney comienza en $10/mo sin nivel gratuito; para los equipos que ya tienen ChatGPT Plus, la generación de imágenes no tiene un costo adicional, y esa asimetría de precios por sí sola mueve a muchos usuarios hacia OpenAI.
Adobe Firefly resuelve un problema diferente: la certeza de la procedencia de la propiedad intelectual (IP). Firefly 3 está entrenado exclusivamente con contenido licenciado de Adobe Stock y de dominio público, no conlleva exposición a derechos de autor por cuestiones de datos de entrenamiento, y se integra de forma nativa en Photoshop, Lightroom y Premiere. La calidad de la imagen es competente, pero carece de la distinción estética de OpenAI o Midjourney. Para transmisiones, publicidad o trabajos para clientes de alta responsabilidad donde la procedencia importa más que la estética, Firefly es la opción racional. Para trabajos que requieren texto preciso en la imagen o un ciclo de edición conversacional, GPT Image 2 es la mejor elección.
Economía de créditos: lo que cuesta un proyecto real
El nivel gratuito es genuinamente útil para evaluación: aproximadamente 3 imágenes por ventana de 24 horas en ChatGPT Free. Bing Image Creator ofrece un punto de entrada gratuito más generoso: 15 generaciones rápidas ("boosts") por día con generación más lenta ilimitada después, gratis con cualquier cuenta de Microsoft. No se requiere tarjeta de crédito.
ChatGPT Plus a $20/mo es el punto de inflexión. El consenso de la comunidad sitúa el límite efectivo en aproximadamente 50 imágenes por ventana móvil de 3 horas, alrededor de 200 por día en la práctica. El Thinking Mode de GPT Image 2 (generación por lotes de 8 imágenes consistentes, autoverificación) está incluido en Plus. No hay un sistema de créditos de imágenes por separado.
Precios de la API para GPT Image 2 (abril de 2026): Low / Instant a aproximadamente $0.006 por imagen; Medium a $0.053; High / Thinking a $0.211. La Batch API ofrece una reducción de costos del 50% para cargas de trabajo que no son en tiempo real. DALL-E 3 a través de la API sigue disponible a $0.04–$0.12, más rápido pero con una calidad sustancialmente menor.
Para un proyecto real, 200 imágenes de productos con etiquetas de texto precisas en calidad Medium de la API, el costo es de aproximadamente $10.60. Las mismas 200 imágenes en ChatGPT Plus están efectivamente incluidas en la suscripción de $20/mo. En Pro ($200/mo), la generación es prácticamente ilimitada. La API con descuentos por lotes (Batch) supera a las suscripciones para los equipos que ejecutan flujos de trabajo por volumen.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Cómo se compara DALL-E 3
Comparativas directas con otras herramientas.
Destacado en colecciones
Listas seleccionadas que incluyen DALL-E 3.
Artículos relacionados
Guías y artículos relacionados con DALL-E 3.

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Wix Logo Maker Review (2026): Real Costs, the Edit Catch, and AI Alternatives

AI Video Generator Prompting: The Filmmaker's Real Workflow

Freepik AI Is Now Magnific: What Changed, What It Costs, and Whether to Stay (2026)

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

