

FLUX es un modelo de texto a imagen de pesos abiertos de Black Forest Labs, el equipo detrás de Stable Diffusion. Se lanzó en agosto de 2024 con tres niveles, superó a Stable Diffusion 3 y Midjourney v6 en las tablas de clasificación de referencia, y es el pilar de uno de los ecosistemas de LoRA más grandes en la generación de imágenes con IA.
FLUX es una familia de modelos de texto a imagen y edición de imágenes desarrollada por Black Forest Labs (BFL), una empresa fundada en 2024 con sede en Friburgo de Brisgovia, Alemania. BFL fue creada por Robin Rombach, Andreas Blattmann y Patrick Esser, los investigadores que desarrollaron Stable Diffusion en LMU Munich bajo la dirección de Bjorn Ommer y que posteriormente lideraron la investigación de generación de imágenes en Stability AI. La empresa recaudó $31 millones de Andreessen Horowitz y otros inversores específicamente para construir una nueva generación de modelos de imágenes de pesos abiertos. FLUX se lanzó el 1 de agosto de 2024 como una suite de tres niveles: schnell (Apache 2.0, totalmente abierto), dev (pesos abiertos no comerciales) y pro (cerrado, solo API). Al final de su primer día, FLUX.1 [dev] y [pro] ocupaban los dos primeros puestos en la tabla de clasificación de Artificial Analysis Text to Image Arena, superando a Stable Diffusion 3 Ultra y Midjourney v6.0.
La arquitectura central de FLUX.1 es un transformador de flujo rectificado (rectified flow transformer) escalado a 12 mil millones de parámetros, que combina bloques de transformadores de difusión paralelos y multimodales. Esta arquitectura ofrece una adherencia a las indicaciones (prompts) notablemente superior a la de los modelos de difusión latente anteriores y maneja la renderización de texto en imágenes generadas, la anatomía de las manos y las escenas complejas con múltiples elementos de manera mucho más confiable que Stable Diffusion XL. A partir de abril de 2026, la familia de modelos se ha expandido para incluir FLUX.1.1 [pro] (octubre de 2024), FLUX.1 Tools para la edición controlada (noviembre de 2024), FLUX.1 Kontext para la edición de imágenes sensible al contexto (mayo de 2025) y FLUX.2, que presenta un modelo dev de pesos abiertos de 32 mil millones de parámetros (noviembre de 2025). FLUX está disponible para el autoalojamiento local a través de Hugging Face, o mediante inferencia alojada en Fal.ai, Replicate, Together.ai y la propia API de BFL. Miles de LoRA de la comunidad están disponibles en Civitai para el ajuste fino de estilos personalizados.
Lo que genera FLUX en abril de 2026
FLUX abarca dos generaciones de modelos con capacidades distintas. La familia FLUX.1 se centra en el transformador de flujo rectificado de 12B. FLUX.1 [schnell] (Apache 2.0) se ejecuta en 3-6 pasos de inferencia y genera imágenes en menos de dos segundos en hardware moderno, lo suficientemente rápido para la creación de prototipos en tiempo real en una GPU de juegos capaz. FLUX.1 [dev] utiliza la misma base de 12B con destilación de guía (guidance distillation), produciendo resultados de mayor calidad a costa de más pasos; requiere aproximadamente 16GB de VRAM a máxima precisión, con versiones cuantizadas que se ajustan a tarjetas de 8GB. FLUX.1 [pro] es el nivel cerrado, solo API, que ofrece la mejor calidad de imagen individual de la familia.
La suite FLUX.1 Tools añade cuatro modos de generación controlada: fill (inpainting), canny (generación guiada por bordes), depth (generación condicionada por mapas de profundidad) y redux (transferencia de estilo desde imágenes de referencia). FLUX.1 Kontext, lanzado en mayo de 2025, introdujo la edición sensible al contexto: sube una foto, escribe "change the jacket to red" (cambia la chaqueta a rojo), y el modelo realiza una edición local específica sin tocar nada más en el encuadre. Kontext también admite la consistencia de personajes, lo que permite que la misma persona u objeto persista de manera coherente en diferentes escenas, algo útil para construir narrativas visuales consistentes o campañas de productos. BFL afirma que Kontext se ejecuta 8 veces más rápido que GPT-Image para tareas de edición.
FLUX.2 [dev], lanzado el 25 de noviembre de 2025, escala la arquitectura a 32 mil millones de parámetros y está disponible como pesos abiertos en Hugging Face. BFL lo describe como "el modelo de generación y edición de imágenes de pesos abiertos más potente disponible". FLUX.2 [klein], lanzado el 15 de enero de 2026 bajo Apache 2.0, es una versión destilada en tamaño que genera imágenes en menos de un segundo en GPU de consumo, disponible en variantes de 4B y 9B. Todas las generaciones de FLUX admiten salidas en resoluciones estándar de hasta 1MP para la mayoría de los niveles, con FLUX.2 [pro] Ultra a 4 megapíxeles a través de Fal.ai.
Dónde se sitúa FLUX frente a Stable Diffusion 3.5 y Midjourney
Las dos comparaciones naturales para FLUX son Stable Diffusion 3.5 (la otra gran opción de pesos abiertos) y Midjourney (el modelo comercial cerrado dominante). Las diferencias mecánicas son significativas.
FLUX vs. Stable Diffusion 3.5 Large: SD3.5 Large utiliza la arquitectura MMDiT (Multimodal Diffusion Transformer) con una pila de triple codificador de texto: CLIP-L, CLIP-G y T5 XXL. Con 8.1 mil millones de parámetros en su variante large-turbo, se ejecuta con un programa de inferencia fijo de 20 pasos, en comparación con los 3-6 pasos de FLUX schnell. FLUX gana fácilmente en la adherencia a las indicaciones, la renderización de texto dentro de las imágenes generadas y las manos anatómicamente correctas, con las que SD3 todavía tiene dificultades. Un hilo de febrero de 2025 en r/StableDiffusion planteó preocupaciones adicionales de que las variantes medium y large de SD3.5 eran "inentrenables" para el ajuste fino de LoRA, frustrando a los creadores y empujando gran parte de la energía creativa de la comunidad hacia FLUX. El catálogo de LoRA de FLUX en Civitai ahora cuenta con miles. SD3.5 conserva una ventaja en cierta compatibilidad de canalizaciones (nodos más antiguos de ComfyUI y flujos de trabajo de AUTOMATIC1111) y puede ejecutarse en hardware de menor VRAM en tamaños más pequeños.
FLUX vs. Midjourney: Midjourney sigue siendo un líder en calidad estilística para estéticas pictóricas y altamente estilizadas, pero sus limitaciones estructurales son opuestas a las de FLUX. Midjourney es de código cerrado, sin API pública para la mayoría de los usuarios, sin implementación local, sin ajuste fino de LoRA y con acceso limitado a Discord o a su interfaz web. No puedes integrar Midjourney en la canalización de tu propia aplicación. Los pesos abiertos de FLUX y la API de BFL permiten un acceso programático completo, ajuste fino personalizado e implementación autoalojada, nada de lo cual es compatible con Midjourney. En las tablas de clasificación de referencia (Artificial Analysis Arena), FLUX [pro] y Midjourney intercambian posiciones dependiendo de la categoría de evaluación; FLUX gana en fidelidad de indicaciones y renderización de texto, mientras que Midjourney conserva una ventaja en algunos estilos artísticos seleccionados.
"Muy buena adherencia a las indicaciones, gran capacidad para realizar un seguimiento de múltiples partes de una escena, es técnicamente muy impresionante. Sin embargo, parece no haber tenido entrenamiento en arte puro.", vessenes, Hacker News, octubre de 2024
"FLUX.1 tiene una adherencia a las indicaciones de vanguardia, puede generar texto y es de código abierto. La estética general del modelo es muy apreciada. Puede crear imágenes realistas o artísticas y tiene una buena comprensión del color y la luz.". Reseña del blog de Stablecog, 2024
Costo real de ejecutar FLUX
Para quienes lo autoalojan, FLUX.1 [schnell] es Apache 2.0 y genuinamente gratuito. No hay costo de licencia; solo pagas la electricidad y la depreciación del hardware. FLUX.1 [dev] también es gratuito para uso personal no comercial a través del lanzamiento de pesos abiertos en Hugging Face. Estos dos niveles hacen que FLUX sea accesible para cualquier persona con una GPU capaz: una ventaja significativa sobre los modelos exclusivamente comerciales.
Al utilizar la API alojada de BFL, los precios se basan en créditos: 1 crédito = $0.01 USD. Tarifas clave a principios de 2026:
FLUX.2 [pro]: aproximadamente $0.03/imagen
FLUX.1 [pro] / FLUX.1.1 [pro]: $0.04/imagen (4 créditos)
FLUX.1 Kontext [pro]: $0.08/imagen (mayor debido a la complejidad de la edición)
Fal.ai FLUX1.1 [pro] Ultra (4MP): $0.06/imagen
No hay una suscripción mensual fija de BFL; es puramente un sistema de créditos de pago por imagen. Los hosts de terceros (Replicate, Fal.ai, Together.ai) tienen sus propias estructuras de precios y pueden diferir en unos pocos centavos. Para cargas de trabajo de producción que generan miles de imágenes al mes, los costos por imagen se acumulan rápidamente; los equipos que manejan grandes volúmenes deberían comparar los recuentos reales de generación con alternativas como Stable Diffusion autoalojado en instancias de nube spot. El costo mínimo de entrada para el uso de la API comienza alrededor de $0.014/imagen en los niveles más ligeros, lo que hace que FLUX sea accesible para pruebas a pequeña escala sin grandes compromisos iniciales.
Dónde falla FLUX de manera constante
FLUX tiene limitaciones reales que aparecen constantemente en las discusiones de la comunidad. La más notable es el arte clásico y los estilos pictóricos. Cuando se le pide "oil painting, thick brushstrokes, Impressionist light" (pintura al óleo, pinceladas gruesas, luz impresionista), o se le pide que produzca algo al estilo de Degas o Monet, FLUX tiende a devolver resultados con influencia de anime o hiperdigitales en lugar de pictóricos. La especulación de la comunidad en HN atribuye esto a una curación deliberada de los datos de entrenamiento: BFL evitó extraer masivamente obras de artistas vivos después de la reacción negativa que enfrentó Stable Diffusion. El resultado es un modelo con un fotorrealismo excepcional pero un rango artístico más estrecho que el ecosistema más antiguo de Stable Diffusion SDXL.
La textura de la piel en los retratos ha atraído críticas constantes en los hilos de r/StableDiffusion: una calidad "plástica" o excesivamente suave en los rostros en primer plano que se percibe como sintética. El ajuste fino con LoRA específicos para retratos mitiga esto, pero el modelo base lo muestra en la generación no guiada.
La composición espacial compleja y la negación siguen sin resolverse. Las indicaciones que requieren múltiples sujetos en relaciones espaciales específicas ("tres figuras, una sentada detrás de las otras dos"), o la negación ("una habitación sin ventanas"), todavía producen errores. Esto no es exclusivo de FLUX; es una limitación a nivel de arquitectura de los modelos actuales de coincidencia de flujo (flow-matching), pero vale la pena señalarlo para flujos de trabajo que requieren un control compositivo preciso.
La limitación de VRAM es un punto de fricción práctico. FLUX.1 [dev] a máxima precisión necesita 16GB de VRAM; las versiones cuantizadas que se ajustan a tarjetas de 8GB sacrifican calidad en escenas complejas. FLUX.2 [dev] a 32B es aún más exigente. Los usuarios locales ocasionales con hardware de juegos de gama media (RTX 3060, 12GB) alcanzarán los límites y pueden obtener mejores resultados prácticos de schnell a máxima precisión que de dev en configuraciones fuertemente cuantizadas.
La licencia no comercial de FLUX.1 [dev] crea una trampa sutil: el modelo de pesos abiertos de mayor calidad no se puede utilizar legalmente en productos comerciales sin cambiar a la API de pago. Los usuarios que comienzan con dev para la creación de prototipos y desean lanzar un producto deben migrar a schnell (menor calidad) o pagar por la API.
Para quién es FLUX y quién debería elegir otra opción
FLUX es la opción correcta para los desarrolladores que integran la generación de imágenes en aplicaciones, los investigadores que necesitan pesos abiertos autoalojables, los artistas de IA que ejecutan canalizaciones locales de ComfyUI y cualquiera que desee la libertad de realizar ajustes finos con LoRA en un modelo base de vanguardia (SOTA) actual. El ecosistema de Civitai para los LoRA de FLUX ya está maduro: existen miles de adaptadores entrenados por la comunidad para estilos de retrato, estéticas específicas, fotografía de productos y más. Si deseas construir algo personalizado sobre la generación de imágenes, FLUX es la base de pesos abiertos más capaz disponible a partir de abril de 2026.
FLUX también es la decisión correcta para las empresas que necesitan acceso a la API para la generación de imágenes de nivel de producción con precios por imagen, sin quedar atrapadas en el ecosistema cerrado y propietario de Midjourney.
Evita FLUX si eres un usuario ocasional que desea una aplicación web de consumo sencilla para la generación esporádica de imágenes: FLUX no tiene su propio producto de consumo pulido. Necesitarás usar una interfaz de usuario de terceros (Fal.ai, la interfaz web de Replicate o una configuración local de ComfyUI). Evítalo también si tu caso de uso principal es replicar la estética de la pintura clásica; el modelo tiene deficiencias documentadas en ese aspecto, y un punto de control (checkpoint) de SDXL fuertemente ajustado podría ser más útil. Si la VRAM es una limitación a 8GB, prueba schnell cuidadosamente antes de comprometerte: es rápido y gratuito, pero produce resultados menos detallados que [dev] en escenas complejas.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen FLUX.
Artículos relacionados
Guías y artículos relacionados con FLUX.

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Freepik AI Is Now Magnific: What Changed, What It Costs, and Whether to Stay (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

AI Video Generator Prompting: The Filmmaker's Real Workflow

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing
