

Stable Diffusion est le standard de génération d'images à poids ouverts de Stability AI. Hébergez-le vous-même gratuitement, affinez-le sur des jeux de données personnalisés et utilisez ControlNet pour un contrôle précis de la composition. Le plus grand écosystème de modèles d'images open source disponible.
Stable Diffusion est un modèle de diffusion latente à poids ouverts pour la génération de texte vers image, créé par Stability AI Ltd. et lancé pour la première fois en août 2022. Contrairement aux plateformes fermées telles que Midjourney ou DALL-E, Stable Diffusion publie les poids de son modèle sous une licence communautaire, ce qui signifie que n'importe qui peut télécharger, exécuter et affiner le modèle sur son propre matériel sans payer par image. Le fleuron actuel, Stable Diffusion 3.5 (sorti en octobre 2024), se décline en trois variantes : SD3.5 Large avec 8,1 milliards de paramètres, la version distillée SD3.5 Large Turbo qui génère en quatre étapes, et SD3.5 Medium, plus accessible au grand public, avec 2,5 milliards de paramètres. Il ne s'agit pas d'un outil unique, mais d'une famille de modèles qui alimente un écosystème d'interfaces tierces, de checkpoints entraînés par la communauté et d'applications commerciales.
Stable Diffusion prend en charge la génération de texte vers image, d'image vers image, l'inpainting et l'outpainting. Ses capacités les plus poussées proviennent de deux couches d'intégration : ControlNet, qui permet aux utilisateurs de guider la composition et la pose à l'aide d'une image de référence plutôt que de se fier uniquement aux prompts, et les fichiers LoRA (Low-Rank Adaptation), de petits adaptateurs d'affinage qui appliquent un style, un personnage ou un sujet spécifique à n'importe quel modèle de base sans nécessiter un entraînement complet. La communauté a produit des centaines de milliers de LoRA et de checkpoints personnalisés sur des plateformes comme Civitai et Hugging Face. Le modèle est accessible localement via ComfyUI ou AUTOMATIC1111, ou via l'API de Stability AI pour un coût de $0.035 à $0.065 par image selon la variante du modèle.
Ce que Stable Diffusion génère en avril 2026
Le modèle SD3.5 Large produit des images avec une résolution allant jusqu'à 1 mégapixel en utilisant une architecture Multimodal Diffusion Transformer (MMDiT) avec normalisation QK, un changement architectural majeur par rapport à la conception U-Net utilisée de SD 1.5 à SDXL. La variante Large Turbo échange une légère marge de qualité contre une génération en quatre étapes, très utile pour itérer rapidement sur des compositions. SD3.5 Medium prend en charge une résolution de 0,25 à 2 mégapixels et fonctionne sur du matériel grand public avec 9.9GB de VRAM, ce qui en fait le choix pratique pour les utilisateurs ne disposant pas de GPU professionnels.
SDXL reste largement utilisé au sein de la communauté car sa bibliothèque de LoRA et de checkpoints est plus riche que celle de SD3.5, qui est encore en phase de maturation. SD3.5 a amélioré la faible adhérence aux prompts de SD3 Medium et les problèmes d'anatomie qui affectaient cette version précédente, Stability AI soulignant un meilleur rendu du texte, des scènes multi-objets plus précises et une gamme stylistique plus large. Le modèle prend en charge le photoréalisme, l'illustration, le concept art, le rendu 3D et l'esthétique picturale sans nécessiter de changement de mode. Trois encodeurs de texte (OpenCLIP-ViT/G, CLIP-ViT/L et T5-xxl) gèrent l'analyse des prompts, ce qui donne à SD3.5 une meilleure compréhension des prompts complexes et structurés par rapport aux versions antérieures de SD.
Où se situe Stable Diffusion par rapport à FLUX et Midjourney
FLUX (Black Forest Labs) est le concurrent le plus direct dans l'espace des poids ouverts. FLUX a été créé par Robin Rombach et ses collègues qui ont initialement développé Stable Diffusion chez Stability AI avant de partir pour fonder Black Forest Labs début 2024. Les modèles FLUX.1 exécutent une architecture hybride multimodale et de diffusion parallèle par transformateur à 12 milliards de paramètres, utilisant le rectified flow matching plutôt que l'approche de débruitage probabiliste des modèles SD précédents. Concrètement, FLUX nécessite moins d'étapes d'inférence pour atteindre une qualité équivalente et gère de manière plus fiable les prompts longs et multi-éléments. Les benchmarks de la communauté sur r/StableDiffusion fin 2025 ont systématiquement placé FLUX en tête pour le photoréalisme, le rendu de texte dans les images et la composition de scènes complexes. Un modérateur du subreddit l'a résumé simplement : "Flux a gagné la bataille de la qualité. SD gagne toujours sur l'écosystème, les bibliothèques LoRA et les ressources communautaires." Cet écart d'écosystème est réel. SD3.5 et SDXL cumulent des années d'avance en matière d'affinages communautaires, de modèles ControlNet et de workflows. La bibliothèque LoRA de FLUX se développe mais n'a pas encore rattrapé son retard.
Midjourney est un service cloud entièrement propriétaire et à source fermée. Les poids de son modèle ne sont pas publics, il n'y a pas d'équivalent à ControlNet, pas de système LoRA, et aucun moyen de l'héberger soi-même ou de l'affiner. Midjourney V6 et ses versions ultérieures se positionnent comme le leader actuel en matière de qualité pour la cohérence esthétique et artistique à partir de prompts simples, avec des résultats soignés en quelques secondes via Discord ou son application web. Le compromis est une perte totale de configurabilité : vous ne pouvez pas entraîner Midjourney sur votre propre jeu de données, vous ne pouvez pas contrôler la pose ou la composition de manière programmatique, et vous ne pouvez pas l'intégrer dans votre propre application. Un abonnement Midjourney coûte de $10 à $120 par mois, sans version gratuite en 2026. Stable Diffusion l'emporte de manière décisive sur la personnalisation, l'économie de l'auto-hébergement pour les utilisateurs à fort volume et l'intégration d'API. Midjourney l'emporte sur la qualité d'image prête à l'emploi et la facilité d'utilisation pour les créatifs non techniques.
"Le plus grand avantage de stable diffusion par rapport à des outils comme midjourney est le niveau de contrôle que vous pouvez exercer sur vos images avec controlnet et les loras." - Utilisateur de r/StableDiffusion, 2025
Le coût réel de l'utilisation de Stable Diffusion
L'auto-hébergement via ComfyUI ou AUTOMATIC1111 est gratuit une fois l'investissement matériel réalisé. SDXL fonctionne confortablement sur un GPU avec 12GB de VRAM ; SD3.5 Medium nécessite 9.9GB ; SD3.5 Large nécessite 18GB (réductible à environ 11GB avec la quantification FP8 via NVIDIA TensorRT). Une carte grand public RTX 4070 Ti couvre SDXL et SD3.5 Medium. SD3.5 Large nécessite une carte haut de gamme telle qu'une RTX 3090, 4090 ou 4080 Super. Une fois le matériel en place, la génération locale n'a aucun coût par image, quel que soit le volume.
La licence communautaire de Stability AI est gratuite pour les particuliers et les organisations dont le chiffre d'affaires annuel est inférieur à 1 million de dollars, couvrant à la fois l'utilisation commerciale et non commerciale. Les utilisateurs sont entièrement propriétaires de toutes les images générées. Les organisations générant plus d'un million de dollars par an ont besoin d'une licence Entreprise à tarification personnalisée. Pour les développeurs qui souhaitent un accès à l'API sans gérer de matériel, la plateforme de Stability AI facture de 3,5 à 8 crédits par image selon le niveau du modèle ($0.035 à $0.08 par image). Un abonnement commercial à $20/mo offre une relation par abonnement avec l'API plutôt que des crédits payables à l'usage. La tarification de l'API a été mise à jour en août 2025, avec une augmentation de certains tarifs. Les 25 crédits gratuits à l'inscription suffisent pour six à sept images d'essai au niveau de qualité le plus élevé.
"Commencez avec A1111 si vous êtes débutant, passez à ComfyUI quand vous voulez plus de performances ou commencez à travailler avec Flux." - Consensus de la communauté r/StableDiffusion, 2026
Là où Stable Diffusion échoue systématiquement
Le lancement le plus tristement célèbre de l'histoire de SD a eu lieu en juin 2024, lorsque Stability AI a publié Stable Diffusion 3 Medium. La communauté a attendu pendant des mois de battage médiatique, puis a vu le subreddit se remplir d'exemples d'anatomie humaine mutilée : membres fusionnés, doigts supplémentaires, torses qui s'effondraient les uns sur les autres, mains ressemblant à de la cire fondue. Slashdot et Futurism ont publié des gros titres qualifiant cela de pas en arrière. La cause profonde était le filtrage NSFW agressif de Stability AI pendant l'entraînement, qui a par inadvertance supprimé les données d'anatomie de l'ensemble d'entraînement. CivitAI, le plus grand référentiel mondial de modèles SD communautaires, a réagi en annonçant une interdiction temporaire de tout contenu lié à SD3 pour protéger les utilisateurs de la responsabilité liée aux licences, créée par la controverse simultanée sur les conditions de licence restrictives d'origine de SD3. Stability AI a révisé la licence et a ensuite publié SD3.5 avec une gestion corrigée de l'anatomie, mais le lancement de SD3 a empoisonné la confiance de la communauté d'une manière qui a profité à l'arrivée de FLUX deux mois plus tard.
Au-delà de cet incident spécifique, les modes d'échec persistants à travers les versions de SD incluent : des mains et des doigts déformés même dans SD3.5 (mieux que SD3 Medium mais non résolu), la difficulté à rendre du texte lisible à l'intérieur des images sans LoRA spécifiques axés sur le texte, et la dérive des prompts sur des scènes complexes multi-objets où certains éléments décrits sont abandonnés ou fusionnés. Le fardeau de la configuration est une autre plainte récurrente. L'installation et la maintenance d'un environnement ComfyUI ou A1111 fonctionnel sur Windows ou Linux nécessitent la gestion des environnements Python, des versions CUDA, des chemins de modèles et des dépendances d'extensions. La première configuration prend régulièrement un après-midi, et les mises à jour peuvent casser des configurations fonctionnelles. Les utilisateurs qui veulent des résultats en 30 secondes à partir d'une zone de texte trouveront cette friction importante.
À qui s'adresse Stable Diffusion, et qui devrait choisir autre chose
Stable Diffusion est le bon choix pour les artistes numériques qui ont besoin d'un contrôle de composition allant au-delà de l'ingénierie de prompts, de workflows ControlNet pour les références de pose et de profondeur, et d'une bibliothèque de milliers de LoRA de style ou de personnage. C'est le bon choix pour les développeurs intégrant la génération d'images dans leurs propres produits, que ce soit via l'API ou en intégrant directement le modèle. Les générateurs à fort volume, en particulier ceux qui créent des centaines ou des milliers d'images par mois, bénéficient considérablement de l'auto-hébergement local une fois le coût du matériel amorti. Les chercheurs et les praticiens du ML travaillant sur l'affinage, la distillation de modèles ou les pipelines d'entraînement personnalisés ont besoin d'accéder à des poids ouverts, et SD reste l'une des familles de modèles les plus étudiées et documentées disponibles.
Ignorez Stable Diffusion si vous êtes un spécialiste du marketing, un gestionnaire de réseaux sociaux ou un professionnel de la création qui a besoin de résultats de haute qualité à partir de prompts courts, sans configuration ni maintenance. La charge de configuration est un coût réel qui ne disparaît pas avec l'expérience, et Midjourney produit systématiquement des résultats plus immédiatement soignés pour des cas d'utilisation occasionnels. Si le photoréalisme et l'adhérence aux prompts complexes sont les priorités absolues et que vous êtes à l'aise avec un autre modèle à poids ouverts, FLUX.1 Dev bat actuellement SD3.5 Large dans les tests comparatifs de la communauté. Et si vous avez un GPU économique avec 8GB ou moins de VRAM, vous serez limité à SDXL avec des optimisations ou à SD 1.5, qui sont tous deux à la traîne par rapport aux benchmarks de qualité de la génération actuelle.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Stable Diffusion.
Articles associés
Guides et articles en lien avec Stable Diffusion.

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Freepik AI Is Now Magnific: What Changed, What It Costs, and Whether to Stay (2026)

AI Video Generator Prompting: The Filmmaker's Real Workflow

Run Open Source AI Models Locally: Battle-Tested Guide

Best AI Fashion Model Generators for Clothing Brands (2026)
