Aller au contenu principal
Vantaige
WAN (Wan-Video / Wan2GP) screenshot
WAN (Wan-Video / Wan2GP) logo

WAN (Wan-Video / Wan2GP)

Gratuit

WAN est la série de modèles de génération vidéo à poids ouverts d'Alibaba (versions 2.1 à 2.7), offrant des capacités de texte-vers-vidéo, d'image-vers-vidéo et d'édition sous licence Apache 2.0. Elle a dominé le classement VBench dès son lancement en février 2025 et est devenue le choix par défaut pour la création vidéo par IA auto-hébergée.

Fonctionnalités :APIOpen Source

WAN est une famille de modèles de génération vidéo à poids ouverts développée par le Tongyi Lab d'Alibaba, qui fait partie de la DAMO Academy. Publiée le 25 février 2025 sous le nom de Wan 2.1, la série a immédiatement pris la tête du classement VBench pour la génération vidéo open source, surpassant tous les modèles ouverts précédents et égalant plusieurs API commerciales pour un coût de licence nul. Les poids sont publiés sous licence Apache 2.0, ce qui signifie que n'importe qui peut les télécharger, les exécuter, les affiner et les redistribuer pour un usage personnel ou commercial sans rien payer à Alibaba. En avril 2026, la série avait évolué à travers les versions 2.2, 2.5, 2.6 et 2.7, chaque version majeure ajoutant de nouvelles capacités : contrôle de caméra cinématographique, audio natif et un « Thinking Mode » (mode de réflexion) axé sur le raisonnement dans la dernière API 2.7.

Les capacités de base couvrent le texte-vers-vidéo (T2V), l'image-vers-vidéo (I2V), la première-et-dernière-image-vers-vidéo (FLF2V), la création et l'édition vidéo (VACE), la parole-vers-vidéo (S2V) et l'animation de personnages. Les modèles phares à 14B de paramètres génèrent des clips en 480p et 720p sur des GPU grand public comme une RTX 4090, tandis que le modèle compact de 1.3B fonctionne avec seulement 8.19 GB de VRAM, ce qui en fait l'un des seuls modèles vidéo sérieux capables de tourner sur une carte graphique de milieu de gamme. Un écosystème florissant de LoRAs, de workflows ComfyUI et de wrappers tiers (notamment l'intégration ComfyUI et le wrapper Wan2GP pour les configurations à faible VRAM) s'est développé autour de la série depuis son lancement.

Ce que WAN produit en avril 2026

Wan 2.1, la version que la plupart des créateurs exécutent encore localement, génère des clips allant jusqu'à 5 secondes en 480p ou 720p, à 16 fps. Le modèle T2V 14B gère les mouvements cinématographiques, les environnements détaillés et une physique précise. Le T2V 1.3B sacrifie un peu de détails visuels au profit de l'accessibilité. La variante I2V-14B anime une image fixe en vidéo, et le modèle FLF2V-14B interpole entre une image de début et de fin. VACE (Video All-in-one Creation and Editing), sorti en mai 2025, a ajouté l'inpainting, l'outpainting et l'édition guidée par instructions aux mêmes poids.

Wan 2.2 (juillet 2025) a introduit la première architecture Mixture-of-Experts open source pour la diffusion vidéo : 27 milliards de paramètres au total répartis sur deux réseaux d'experts (un expert en débruitage à fort bruit et un expert en raffinement à faible bruit), avec seulement 14 milliards actifs par étape d'inférence. Les données d'entraînement ont augmenté de 65.6% pour les images et de 83.2% pour les vidéos par rapport à la version 2.1. De nouvelles variantes de modèles ont ajouté la parole-vers-vidéo (S2V-14B) et l'animation complète de personnages (Animate-14B), capable d'animer une simple photographie en une séquence vidéo cohérente.

Wan 2.5 (septembre 2025) a ajouté l'audio natif : dialogues synchronisés, effets sonores et bruits de fond ambiants générés en même temps que les images vidéo en une seule passe. Le modèle gère une sortie en 1080p et des clips de 10 secondes. Wan 2.7 (6 avril 2026) a apporté le « Thinking Mode », où le modèle planifie explicitement la composition de la scène avant la génération, offrant une meilleure cohérence narrative et une identité de personnage plus nette. Wan 2.7, cependant, est distribué sous forme de poids fermés disponibles uniquement via une API payante à $0.10 par seconde de vidéo 720p. Il s'agit d'un écart notable par rapport à la philosophie des poids ouverts de toutes les versions précédentes.

Pour les utilisateurs qui souhaitent exécuter WAN sur du matériel limité, le wrapper Wan2GP créé par la communauté (par deepbeepmeep) réduit les besoins en VRAM jusqu'à 6 GB sur certaines configurations, ajoute une interface web, prend en charge plusieurs modèles (WAN 2.1/2.2, HunyuanVideo, LTX Video, FLUX) et inclut un traitement par lots basé sur une file d'attente. C'est le point d'entrée pratique pour quiconque ne possède pas de RTX 4090.

Où se situe WAN par rapport à HunyuanVideo et Mochi 1

HunyuanVideo (Tencent, version ouverte en décembre 2024) est basé sur un Causal 3D VAE avec un transformateur à double flux et 13 milliards de paramètres. Sa force architecturale réside dans la cohérence des scènes à plusieurs personnages : les scènes avec 3 à 5 personnages distincts conservent des identités individuelles, un positionnement spatial correct et des mouvements coordonnés mieux que WAN lors de tests comparatifs. Le compromis est sévère : HunyuanVideo nécessite un minimum de 45-60 GB de mémoire GPU pour une génération en 720p, le plaçant fermement dans la catégorie des centres de données ou des stations de travail multi-GPU. Le modèle 1.3B de WAN, en revanche, fonctionne sur une seule RTX 3060 avec 8 GB de VRAM. Pour les créateurs sur du matériel grand public, HunyuanVideo n'est pas une alternative réaliste ; pour les studios exploitant des clusters A100, sa fidélité des personnages peut justifier le coût de calcul. Vous pouvez comparer les deux options sur la fiche de HunyuanVideo.

Mochi 1 (Genmo, octobre 2024) est un modèle de 10 milliards de paramètres basé sur un Asymmetric Diffusion Transformer (AsymmDiT), avec un flux visuel qui possède près de quatre fois plus de paramètres que le flux textuel. Il produit des vidéos en 480p à 30 fps, offrant des mouvements nettement plus fluides que les 16 fps de WAN 2.1. Le hic est la barrière matérielle : un déploiement sur un seul GPU nécessite environ 60 GB de VRAM. Mochi 1 était la référence open source avant que WAN 2.1 ne sorte quatre mois plus tard et ne prenne la première place sur VBench. L'architecture MoE de WAN 2.2 a depuis creusé l'écart en matière de qualité globale, et les pipelines I2V, VACE et d'édition de WAN lui confèrent une surface de fonctionnalités beaucoup plus large. Mochi 1 reste une option antérieure solide qui vaut le détour sur la fiche de Mochi 1, en particulier pour la fluidité des mouvements si vous disposez du matériel adéquat.

Face aux services commerciaux : Runway Gen-3 et Pika offrent des interfaces web soignées et des délais d'exécution plus rapides sans configuration locale, mais facturent au clip. Sora et Luma AI produisent des résultats de haute qualité mais se cachent derrière des abonnements ou des systèmes de crédits. La proposition de valeur fondamentale de WAN est précisément qu'il est gratuit, fonctionne hors ligne, prend en charge le fine-tuning et n'a aucune limite d'utilisation au-delà de ce que votre GPU peut supporter.

« Les vidéos générées par Wan 2.1 sont si bonnes qu'il est difficile de croire qu'elles ont été créées par une application d'IA gratuite. » - Critique éditoriale de BGR, 26 février 2025
« Cela change la donne pour quiconque a construit ou évalué la série Wan en se basant sur son accessibilité open source. » - Tellers.ai, à propos de l'annonce des poids fermés de Wan 2.7, 15 avril 2026

Le coût réel de la génération de vidéos avec WAN

Pour les versions à poids ouverts (2.1 à 2.6), le coût pour Alibaba est nul. Vous payez votre propre électricité et votre matériel. Une RTX 4090 générant des clips de 5 secondes en 480p avec une précision FP16 prend environ 4 minutes par clip sans optimisation. Avec la quantification FP8 ou un LoRA de vitesse exécutant 8 à 10 étapes d'inférence, les benchmarks de la communauté ramènent ce temps à environ 90 secondes par clip sur le même GPU. Sur une RTX 4070 Ti (12 GB), le modèle 1.3B génère à une vitesse comparable ; le modèle 14B nécessite une quantification manuelle ou le format GGUF.

Des solutions de location cloud existent pour les utilisateurs sans GPU local. RunPod, ThinkDiffusion et Spheron proposent tous des instances GPU configurées pour WAN. Une instance 4090 sur RunPod coûte environ $0.74/heure ; générer 10 clips par heure revient à environ $0.07 par clip. Cela reste moins cher que la plupart des API commerciales pour le travail en volume, bien que le tarif de l'API de Wan 2.7 ($0.10/seconde en 720p) soit compétitif pour les utilisateurs qui ont besoin des fonctionnalités du Thinking Mode de cette version sans avoir à gérer l'infrastructure.

La véritable barrière de coût est le temps : les fichiers de modèles vont de 5 GB (1.3B, quantifié en GGUF) à 28 GB (14B, FP16 complet). La configuration initiale dans ComfyUI ou Wan2GP nécessite le téléchargement des modèles dans des chemins de répertoires spécifiques, la configuration séparée des encodeurs de texte et du VAE, et la résolution des dépendances d'environnement. Les utilisateurs sans expérience en Python signalent passer 2 à 4 heures sur la configuration initiale. Après cela, la génération est simple.

Là où WAN montre ses limites

Cohérence des personnages sur des clips plus longs : Des tests indépendants ont attribué à WAN 2.5 une note de 3.0/5 pour la cohérence des personnages, avec « des traits du visage et des styles qui changent sensiblement d'une image à l'autre ». Cela affecte tout prompt impliquant un personnage spécifique apparaissant tout au long d'un clip : les visages dérivent, les vêtements changent légèrement, les proportions du corps se modifient. La variante Animate-14B de WAN 2.2 traite spécifiquement l'animation de portraits, mais les scènes narratives à plusieurs personnages restent peu fiables.

Détails environnementaux complexes : Les prompts de paysages détaillés perdent des éléments spécifiques au milieu du clip. « Une brume constante sur un lac réfléchissant avec un doux contre-jour matinal » peut commencer correctement, mais la brume s'amincit, le reflet change ou l'éclairage se modifie dans la seconde moitié. La cohérence temporelle dans les prompts environnementaux denses est plus faible que pour les prompts à sujet unique ou à arrière-plan simple.

Performances des GPU AMD : Les suivis de problèmes GitHub pour ComfyUI montrent que WAN 2.2 sur les cartes AMD/ROCm s'exécute parfois 4 à 5 fois plus lentement sur le deuxième clip par rapport au premier, en raison du comportement de déchargement de la VRAM. Un redémarrage complet restaure la vitesse. C'est un problème connu que les correctifs tiers traitent de manière inconstante.

Artefacts de ralenti dans WAN 2.2 : Certains utilisateurs signalent que WAN 2.2 génère par défaut des séquences qui semblent être au ralenti, à moins que les paramètres de fréquence d'images ne soient configurés explicitement. La solution de contournement de la communauté consiste à forcer le nombre d'étapes et les paramètres de fps dans ComfyUI plutôt que de s'appuyer sur les valeurs par défaut.

Friction d'installation pour les utilisateurs non techniques : WAN n'est pas un produit que l'on ouvre et sur lequel on clique. Il nécessite un environnement Python, le placement des modèles dans des sous-répertoires spécifiques et la connaissance des paramètres d'inférence. Wan2GP et les wrappers cloud tiers résolvent ce problème, mais ils ajoutent de la latence et limitent parfois les variantes de modèles disponibles.

Meilleurs cas d'usage et scénarios à éviter

Utilisez WAN quand : Vous voulez la meilleure génération vidéo open source sans coût par clip. Vous possédez une RTX 3060 ou supérieure (ou êtes prêt à louer du temps GPU). Vous souhaitez effectuer un fine-tuning sur vos propres séquences ou votre propre style. Vous avez besoin d'une génération hors ligne sans appels d'API, limites de débit ou politiques de contenu. Vous êtes déjà dans l'écosystème ComfyUI et souhaitez ajouter la vidéo aux workflows d'images existants. Vous voulez des droits commerciaux sans frais d'utilisation. Vous construisez un pipeline qui nécessite de l'édition vidéo, de l'inpainting ou des modifications guidées par instructions en plus de la génération initiale.

Évitez WAN quand : Vous avez besoin d'un outil web sans configuration et n'êtes pas à l'aise avec les environnements en ligne de commande. Vous travaillez sur du contenu narratif à plusieurs personnages où la cohérence des visages est critique. Les outils commerciaux dotés de systèmes de mémoire des personnages surpasseront WAN 2.1-2.5 sur ce point. Vous êtes sur une machine avec moins de 6 GB de VRAM (même Wan2GP a une limite basse). Vous voulez la qualité de raisonnement du Thinking Mode de Wan 2.7 sans payer les tarifs de l'API. Si votre priorité est la vitesse d'itération la plus rapide possible, Pika ou Runway généreront des clips en quelques secondes contre plusieurs minutes, ce qui compte pour des ébauches créatives rapides.

La sortie de Wan 2.1 le 25 février 2025 a été un véritable tournant pour l'espace de la génération vidéo open source. Il n'a pas seulement comblé l'écart avec les modèles commerciaux ; selon les scores VBench, il a pris la tête du classement dès son lancement. Le LoRA Squish Effect (mars 2025), un modèle entraîné par la communauté qui fait se déformer n'importe quel objet avec une physique réaliste, est devenu l'une des démos vidéo d'IA les plus partagées du début de l'année 2025 et a illustré ce que l'écosystème de fine-tuning pouvait produire à partir de poids ouverts. Cette énergie créative de la communauté, des packs LoRA aux modèles de workflows ComfyUI en passant par l'optimiseur de VRAM Wan2GP, est le signe le plus fiable qu'un modèle est fait pour durer dans l'espace open source.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant WAN (Wan-Video / Wan2GP).

Articles associés

Guides et articles en lien avec WAN (Wan-Video / Wan2GP).