Saltar al contenido principal
Vantaige
WAN (Wan-Video / Wan2GP) screenshot
WAN (Wan-Video / Wan2GP) logo

WAN (Wan-Video / Wan2GP)

Gratis

WAN es la serie de generación de video de pesos abiertos de Alibaba (versiones 2.1 a 2.7), que ofrece capacidades de texto a video, imagen a video y edición bajo la licencia Apache 2.0. Lideró la clasificación de VBench en su lanzamiento en febrero de 2025 y se convirtió en la opción predeterminada para el trabajo de video con IA alojado localmente.

Funciones:APIOpen Source

WAN es una familia de modelos de generación de video de pesos abiertos desarrollada por Tongyi Lab de Alibaba, parte de DAMO Academy. Lanzada públicamente el 25 de febrero de 2025 como Wan 2.1, la serie lideró de inmediato la clasificación de VBench para la generación de video de código abierto, superando a todos los modelos abiertos anteriores e igualando a varias API comerciales con un costo de licencia cero. Los pesos se publican bajo la licencia Apache 2.0, lo que significa que cualquier persona puede descargarlos, ejecutarlos, ajustarlos y redistribuirlos para uso personal o comercial sin pagarle nada a Alibaba. Para abril de 2026, la serie había avanzado a través de las versiones 2.2, 2.5, 2.6 y 2.7, y cada lanzamiento importante agregó nuevas capacidades: control de cámara cinematográfica, audio nativo y un "Thinking Mode" (modo de pensamiento) centrado en el razonamiento en la última API 2.7.

Las capacidades principales abarcan texto a video (T2V), imagen a video (I2V), primer y último fotograma a video (FLF2V), creación y edición de video (VACE), voz a video (S2V) y animación de personajes. Los modelos insignia de 14B parámetros generan clips de 480p y 720p en GPU de consumo como una RTX 4090, mientras que el modelo compacto de 1.3B se ejecuta con solo 8.19 GB de VRAM, lo que lo convierte en uno de los únicos modelos de video serios que funciona en una tarjeta gráfica de gama media. Desde su lanzamiento, ha crecido un próspero ecosistema de LoRA, flujos de trabajo de ComfyUI y wrappers de terceros (destacando la integración con ComfyUI y el wrapper Wan2GP para configuraciones con poca VRAM) en torno a la serie.

Lo que WAN produce en abril de 2026

Wan 2.1, la versión que la mayoría de los creadores todavía ejecuta localmente, genera clips de hasta 5 segundos a 480p o 720p, a 16 fps. El modelo T2V de 14B maneja movimientos cinematográficos, entornos detallados y físicas precisas. El T2V de 1.3B intercambia detalles visuales por accesibilidad. La variante I2V-14B anima una imagen estática para convertirla en video, y el modelo FLF2V-14B interpola entre un fotograma inicial y uno final. VACE (Video All-in-one Creation and Editing), lanzado en mayo de 2025, agregó inpainting, outpainting y edición guiada por instrucciones a los mismos pesos.

Wan 2.2 (julio de 2025) introdujo la primera arquitectura Mixture-of-Experts de código abierto para la difusión de video: 27 mil millones de parámetros en total divididos en dos redes expertas (un experto en eliminación de ruido alto y un experto en refinamiento de ruido bajo), con solo 14 mil millones activos por paso de inferencia. Los datos de entrenamiento aumentaron un 65.6% en imágenes y un 83.2% en videos en comparación con la versión 2.1. Las nuevas variantes del modelo agregaron voz a video (S2V-14B) y animación completa de personajes (Animate-14B), que puede animar una sola fotografía en una secuencia de video coherente.

Wan 2.5 (septiembre de 2025) agregó audio nativo: diálogos sincronizados, efectos de sonido y ruido de fondo ambiental generados junto con los fotogramas de video en una sola pasada. El modelo maneja salidas de 1080p y clips de 10 segundos. Wan 2.7 (6 de abril de 2026) trajo el "Thinking Mode", donde el modelo planifica explícitamente la composición de la escena antes de la generación, lo que produce una mejor coherencia narrativa y una identidad de personaje más nítida. Sin embargo, Wan 2.7 se distribuye con pesos cerrados disponibles solo a través de una API de pago a $0.10 por segundo de video a 720p. Esta es una desviación notable de la filosofía de pesos abiertos de todas las versiones anteriores.

Para los usuarios que desean ejecutar WAN en hardware limitado, el wrapper Wan2GP creado por la comunidad por deepbeepmeep reduce los requisitos de VRAM a tan solo 6 GB en algunas configuraciones, agrega una interfaz de usuario web, admite múltiples modelos (WAN 2.1/2.2, HunyuanVideo, LTX Video, FLUX) e incluye procesamiento por lotes basado en colas. Es el punto de entrada práctico para cualquier persona que no tenga una RTX 4090.

La posición de WAN frente a HunyuanVideo y Mochi 1

HunyuanVideo (Tencent, lanzado en código abierto en diciembre de 2024) está construido sobre un Causal 3D VAE con un transformador de doble flujo y 13 mil millones de parámetros. Su fortaleza arquitectónica es la coherencia de escenas con múltiples personajes: las escenas con 3 a 5 personajes distintos mantienen identidades individuales, posicionamiento espacial correcto y movimiento coordinado mejor que WAN en pruebas comparativas directas. La contrapartida es severa: HunyuanVideo requiere un mínimo de 45-60 GB de memoria de GPU para la generación a 720p, lo que lo sitúa firmemente en el nivel de centros de datos o estaciones de trabajo con múltiples GPU. El modelo de 1.3B de WAN, por el contrario, se ejecuta en una sola RTX 3060 con 8 GB de VRAM. Para los creadores con hardware de consumo, HunyuanVideo no es una alternativa realista; para los estudios que ejecutan clústeres A100, la fidelidad de sus personajes puede justificar el costo computacional. Puedes comparar ambas opciones en el perfil de HunyuanVideo.

Mochi 1 (Genmo, octubre de 2024) es un modelo de 10 mil millones de parámetros construido sobre un Asymmetric Diffusion Transformer (AsymmDiT), con un flujo visual que tiene casi cuatro veces más parámetros que el flujo de texto. Produce salidas a 480p a 30 fps, lo que proporciona un movimiento notablemente más fluido que los 16 fps de WAN 2.1. El inconveniente es la barrera del hardware: la implementación en una sola GPU requiere aproximadamente 60 GB de VRAM. Mochi 1 era el punto de referencia de código abierto antes de que WAN 2.1 se lanzara cuatro meses después y ocupara el primer lugar en VBench. Desde entonces, la arquitectura MoE de WAN 2.2 ha ampliado la brecha en la calidad general, y los flujos de trabajo I2V, VACE y de edición de WAN le otorgan una superficie de funciones mucho más amplia. Mochi 1 sigue siendo una opción anterior sólida que vale la pena revisar en el perfil de Mochi 1, particularmente por la fluidez del movimiento si cuentas con el hardware adecuado.

Frente a los servicios comerciales: Runway Gen-3 y Pika ofrecen interfaces web pulidas y tiempos de respuesta más rápidos sin configuración local, pero cobran por clip. Sora y Luma AI producen resultados de alta calidad, pero se encuentran detrás de muros de pago por suscripción o créditos. La propuesta de valor central de WAN es específicamente que es gratuito, funciona sin conexión, admite ajustes finos (fine-tuning) y no tiene límites de uso más allá de lo que tu GPU pueda manejar.

"Los videos generados por Wan 2.1 son tan buenos que es difícil creer que fueron creados por una aplicación de IA gratuita". - Reseña editorial de BGR, 26 de febrero de 2025
"Eso cambia los cálculos para cualquiera que haya desarrollado o evaluado la serie Wan basándose en su accesibilidad de código abierto". - Tellers.ai, sobre el anuncio de pesos cerrados de Wan 2.7, 15 de abril de 2026

El costo real de generar video con WAN

Para las versiones de pesos abiertos (2.1 a 2.6), el costo para Alibaba es cero. Tú pagas por tu propia electricidad y hardware. Una RTX 4090 que genera clips de 5 segundos a 480p con precisión FP16 utiliza aproximadamente 4 minutos por clip sin optimizar. Con la cuantización FP8 o un LoRA de velocidad que ejecuta de 8 a 10 pasos de inferencia, las pruebas de la comunidad reducen esto a unos 90 segundos por clip en la misma GPU. En una RTX 4070 Ti (12 GB), el modelo de 1.3B genera a una velocidad comparable; el modelo de 14B requiere cuantización manual o formato GGUF.

Existen opciones de alquiler en la nube para usuarios sin GPU locales. RunPod, ThinkDiffusion y Spheron ofrecen instancias de GPU configuradas con WAN. Una instancia 4090 en RunPod cuesta aproximadamente $0.74/hora; generar 10 clips por hora significa alrededor de $0.07 por clip. Sigue siendo más barato que la mayoría de las API comerciales para trabajos por volumen, aunque la tarifa de la API de Wan 2.7 ($0.10/segundo a 720p) es competitiva para los usuarios que necesitan las funciones del Thinking Mode de esa versión sin tener que administrar la infraestructura.

La verdadera barrera de costo es el tiempo: los archivos del modelo varían desde 5 GB (1.3B, cuantizado en GGUF) hasta 28 GB (14B, FP16 completo). La configuración inicial en ComfyUI o Wan2GP requiere descargar modelos a rutas de directorio específicas, configurar codificadores de texto y VAE por separado, y solucionar problemas de dependencias del entorno. Los usuarios sin experiencia en Python informan que dedican de 2 a 4 horas a la configuración inicial. Después de eso, la generación es sencilla.

Dónde falla WAN de manera constante

Coherencia de los personajes en clips más largos: Pruebas independientes le dieron a WAN 2.5 un 3.0/5 en coherencia de personajes, con "rasgos faciales y estilos que cambian notablemente entre fotogramas". Esto afecta a cualquier prompt que involucre a un personaje específico que aparece a lo largo de un clip: los rostros se desvían, la ropa cambia ligeramente, las proporciones del cuerpo se alteran. La variante Animate-14B en WAN 2.2 aborda la animación de retratos específicamente, pero las escenas narrativas con múltiples personajes siguen siendo poco confiables.

Detalles ambientales complejos: Los prompts de paisajes detallados pierden elementos específicos a mitad del clip. "Niebla constante sobre un lago reflectante con suave luz de fondo matutina" puede comenzar correctamente, pero la niebla se disipa, el reflejo cambia o la iluminación se altera en la segunda mitad. La coherencia temporal en prompts ambientales densos es más débil que en prompts de un solo sujeto o fondos simples.

Rendimiento en GPU AMD: Los rastreadores de problemas de GitHub para ComfyUI muestran que WAN 2.2 en tarjetas AMD/ROCm a veces se ejecuta de 4 a 5 veces más lento en el segundo clip en comparación con el primero, debido al comportamiento de descarga de VRAM. Un reinicio completo restaura la velocidad. Este es un problema conocido que los parches de terceros abordan de manera inconsistente.

Artefactos de cámara lenta en WAN 2.2: Algunos usuarios informan que WAN 2.2 genera de forma predeterminada imágenes que parecen en cámara lenta a menos que la configuración de la velocidad de fotogramas se ajuste explícitamente. La solución de la comunidad es forzar el recuento de pasos y la configuración de fps en ComfyUI en lugar de depender de los valores predeterminados.

Fricción de configuración para usuarios no técnicos: WAN no es un producto que abres y haces clic. Requiere un entorno de Python, la ubicación del modelo en subdirectorios específicos y conocimiento de los parámetros de inferencia. Wan2GP y los wrappers en la nube de terceros resuelven esto, pero agregan latencia y, a veces, limitan las variantes de modelos disponibles.

Mejores casos de uso frente a escenarios a evitar

Usa WAN cuando: Desees la mejor generación de video de código abierto sin un costo por clip. Tengas una RTX 3060 o superior (o estés dispuesto a alquilar tiempo de GPU). Quieras realizar ajustes finos (fine-tuning) en tu propio metraje o estilo. Necesites generación sin conexión sin llamadas a la API, límites de velocidad o políticas de contenido. Ya estés en el ecosistema de ComfyUI y quieras agregar video a los flujos de trabajo de imágenes existentes. Desees derechos comerciales sin tarifas de uso. Estés construyendo un flujo de trabajo que necesite edición de video, inpainting o modificación guiada por instrucciones además de la generación inicial.

Evita WAN cuando: Necesites una herramienta web sin configuración y no te sientas cómodo con entornos de línea de comandos. Estés trabajando en contenido narrativo con múltiples personajes donde la coherencia facial es fundamental. Las herramientas comerciales con sistemas de memoria de personajes superarán a WAN 2.1-2.5 en esto. Estés en una máquina con menos de 6 GB de VRAM (incluso Wan2GP tiene un límite inferior). Quieras la calidad de razonamiento del Thinking Mode de Wan 2.7 sin pagar tarifas de API. Si tu prioridad es la velocidad de iteración más rápida posible, Pika o Runway generarán clips en segundos en lugar de minutos, lo cual es importante para borradores creativos rápidos.

El lanzamiento de Wan 2.1 el 25 de febrero de 2025 fue un verdadero punto de inflexión para el espacio de generación de video de código abierto. No solo cerró la brecha con los modelos comerciales; según las puntuaciones de VBench, lideró la clasificación en su lanzamiento. El LoRA Squish Effect (marzo de 2025), un modelo entrenado por la comunidad que hace que cualquier objeto se deforme con físicas realistas, se convirtió en una de las demostraciones de video con IA más compartidas de principios de 2025 e ilustró lo que el ecosistema de ajustes finos podía producir sobre pesos abiertos. Esa energía creativa de la comunidad, desde paquetes de LoRA hasta plantillas de flujo de trabajo de ComfyUI y el optimizador de VRAM Wan2GP, es la señal más confiable de que un modelo tiene capacidad de permanencia en el espacio de código abierto.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen WAN (Wan-Video / Wan2GP).

Artículos relacionados

Guías y artículos relacionados con WAN (Wan-Video / Wan2GP).