Saltar al contenido principal
Vantaige
CogVideoX screenshot
CogVideoX logo

CogVideoX

Gratis

CogVideoX es la serie de modelos de generación de video de código abierto de Zhipu AI, que produce clips de texto a video y de imagen a video de forma local o mediante API. Funciona en GPU de consumo a partir de 5GB de VRAM con soporte completo para diffusers, ajuste fino con LoRA e integración con ComfyUI. Su descarga y alojamiento propio son completamente gratuitos.

Funciones:APIOpen Source

CogVideoX es una serie de modelos de generación de video de código abierto desarrollada por Zhipu AI y los investigadores del laboratorio THUDM de la Universidad de Tsinghua. Lanzada por primera vez en agosto de 2024 y aceptada como artículo de conferencia en ICLR 2025, genera videos a partir de indicaciones de texto o imágenes de origen sin suscripciones ni tarifas por clip. Los pesos del modelo se pueden descargar gratuitamente desde HuggingFace y el código base tiene licencia MIT/Apache 2.0 en GitHub, donde el proyecto ha acumulado más de 12,700 estrellas. Hasta abril de 2026, el repositorio se mantiene activamente, con la incorporación del marco de ajuste fino CogKit en marzo de 2025 y adaptadores de la comunidad que dan soporte a cientos de flujos de trabajo de ComfyUI.

La familia de modelos abarca cinco variantes que cubren diferentes niveles de hardware y casos de uso: la versión ligera de 2B parámetros funciona en GPU tan antiguas como una GTX 1080 Ti; el modelo insignia de 5B maneja la generación detallada de texto a video con una fuerte adherencia a las indicaciones; y la variante 5B-I2V se clasifica constantemente como el mejor modelo de imagen a video accesible para propietarios de GPU de consumo. CogVideoX1.5 (noviembre de 2024) elevó la resolución a 1360x768 a 16fps y amplió la duración del clip a 10 segundos. La arquitectura utiliza un Autoencoder Variacional 3D para la compresión espacio-temporal combinado con un Expert Transformer, sin el módulo tradicional de atención cruzada. La integración completa con diffusers permite llamadas de canalización en una sola línea, y el ajuste fino con LoRA es compatible de forma nativa a través de CogKit.

Lo que produce CogVideoX en abril de 2026

La línea actual de modelos hasta abril de 2026 cubre dos generaciones. El CogVideoX-5B original produce videos de 720x480 a 8 fps para clips de 6 segundos. Funciona en precisión BF16 con una inferencia de alrededor de 180 segundos en una A100 o 90 segundos en una H100. Con la descarga a la CPU y la cuantización INT8, el límite inferior de VRAM se reduce a aproximadamente 4.4GB, lo que lo convierte en uno de los modelos de video locales más accesibles disponibles.

CogVideoX1.5-5B, lanzado el 8 de noviembre de 2024, representa un avance significativo: resolución de 1360x768, 16 fps y duraciones de 5-10 segundos. El complemento de imagen a video (CogVideoX1.5-5B-I2V) acepta cualquier relación de aspecto y produce hasta 81 fotogramas. Ambos son accesibles a través de la biblioteca diffusers de Hugging Face con la misma interfaz de canalización que los modelos base. En la plataforma Qingying, Zhipu AI también demostró los modelos combinados con su modelo de audio CogSound para producir audio sincronizado y salida de ultra alta definición 4K en lote, aunque las versiones de pesos abiertos mantienen las especificaciones mencionadas anteriormente.

El soporte para ComfyUI es de primer nivel. El kijai/ComfyUI-CogVideoXWrapper tiene más de 1,500 estrellas y 341 confirmaciones (commits), admitiendo texto a video, imagen a video, LoRA, cuantización GGUF, control de pose con ControlNet, mosaico temporal para clips extendidos y guía de movimiento experimental a través de Go-with-the-Flow. También existe integración con Stable Diffusion WebUI Forge.

"El modelo 5B supera absolutamente todas las expectativas. No solo es más detallado en términos de escenario, sino que también hizo un trabajo mucho mejor en cuanto a la adherencia a las indicaciones.". Bijan Bowen, Ominous Industries, agosto de 2024

Dónde se sitúa CogVideoX frente a HunyuanVideo y Mochi 1

Tres modelos dominan la conversación cuando los usuarios de alojamiento propio comparan la generación de video de código abierto: HunyuanVideo de Tencent, Mochi 1 de Genmo y CogVideoX. Están construidos sobre diferentes apuestas arquitectónicas y atienden a perfiles de hardware significativamente distintos.

HunyuanVideo (Tencent) utiliza una arquitectura MoE (Mixture-of-Experts) de 13 mil millones de parámetros con módulos de guía de texto entre fotogramas y entrenamiento de resolución mixta, donde la dinámica temporal se aprende a menor resolución mientras que los detalles espaciales se entrenan a mayor resolución. HunyuanVideo 1.5 (noviembre de 2025) redujo esto a 8.3B parámetros y bajó el límite de VRAM a un mínimo de 14GB. En las pruebas de rendimiento, obtiene una puntuación de 9.1/10 en consistencia temporal frente al 7.9/10 de CogVideoX, y es claramente la opción superior para cualquier cosa que involucre rostros humanos fotorrealistas o escenas con múltiples personajes. La contrapartida es el hardware: a máxima calidad en el modelo original, se requieren de 60-80GB de VRAM a 720p, lo que exige acceso a GPU de centro de datos. El precio de la API bajo demanda ronda los $11/minuto de salida. Para la mayoría de los usuarios de alojamiento propio, CogVideoX es la alternativa accesible cuando se desea la calidad de HunyuanVideo pero no se dispone del hardware.

Mochi 1 (Genmo) utiliza una arquitectura AsymmDiT (Asymmetric Diffusion Transformer) con 10 mil millones de parámetros, ajustada específicamente para un movimiento fluido a 30 fps. Esa ventaja en la velocidad de fotogramas es real: la salida de Mochi 1 se ve notablemente más suave que la de CogVideoX base a 8 fps. Sin embargo, Mochi 1 está limitado a una resolución de 480p sin ninguna actualización HD lanzada, requiere un mínimo de 16GB de VRAM, y Genmo no lanzó un sucesor significativo que pudiera seguir el ritmo de HunyuanVideo 1.5 o CogVideoX1.5. La comunidad considera en gran medida que Mochi 1 es históricamente importante por demostrar que el movimiento fluido era alcanzable en código abierto, pero en la práctica ha sido superado para la mayoría de los flujos de trabajo. CogVideoX1.5 a 16fps y 1360x768 produce una salida de mayor resolución que Mochi 1, aunque la suavidad del movimiento sigue favoreciendo a Mochi en movimientos rápidos.

CogVideoX con 5 mil millones de parámetros tiene el requisito de hardware más bajo de los tres. Funciona desde aproximadamente 5GB de VRAM con cuantización, genera videos aceptables en tarjetas de la clase RTX 3060 y ofrece la ruta más accesible para la animación local de imagen a video. La contrapartida es el fotorrealismo: CogVideoX produce resultados más estilizados e ilustrativos que HunyuanVideo, con una puntuación de 7.4/10 frente al 8.7/10 de HunyuanVideo en sujetos humanos fotorrealistas en pruebas de rendimiento de terceros.

"CogVideoX tiene el mejor modo de imagen a video entre los modelos abiertos, lo que permite generar una imagen principal con FLUX o SDXL y luego animarla con CogVideoX, con la tecnología 3D Causal VAE que ofrece una fuerte preservación de los detalles.". InsiderLLM, Local AI Video Generation Guide, 2025

El costo real de generar video con CogVideoX

Los pesos del modelo no cuestan nada. El alojamiento en Hugging Face es gratuito. El costo real es la electricidad, la depreciación del hardware y el tiempo.

En una RTX 4090, espere de 5 a 7 clips por hora para el modelo 5B con la configuración estándar. En una RTX 3060 (12GB), el tiempo de generación se extiende a 9-15 minutos por clip. Una H100 reduce la inferencia del 5B a aproximadamente 90 segundos. Si no posee el hardware adecuado, los proveedores de GPU en la nube (Vast.ai, RunPod, Modal) cobran aproximadamente $0.50-$3.00 por hora de tiempo de H100/A100, lo que sitúa un solo clip entre unos centavos y unos pocos dólares, dependiendo de la configuración y el proveedor.

Los adaptadores de API de terceros como Replicate y SiliconFlow alojan puntos finales de CogVideoX cuantizados con precios por ejecución que varían según el proveedor, típicamente en el rango de $0.02-$0.10 por clip. Estas son empresas independientes, no productos de Zhipu AI. La plataforma oficial Qingying de Zhipu AI ofrece acceso en la nube con sus propios precios, pero los modelos de pesos abiertos en sí siguen siendo gratuitos.

Para el ajuste fino con CogKit, el presupuesto de cómputo se escala con el tamaño del conjunto de datos y la resolución objetivo. El ajuste fino de LoRA en CogVideoX-5B generalmente se completa en horas en una A100 de 80GB para conjuntos de datos pequeños. La actualización de enero de 2025 redujo los requisitos de memoria para el entrenamiento de LoRA, haciendo que el ajuste fino sea más manejable en tarjetas de consumo de 24GB.

Dónde falla constantemente CogVideoX

La generación lenta es la queja más común. El problema #545 de GitHub documentó que CogVideoX1.5-5B se ejecutaba a 0/50 pasos de inferencia durante más de una hora en algunas configuraciones. De manera más típica, los usuarios de GPU de consumo reportan una utilización de la GPU de alrededor del 60% durante la inferencia, lo que indica cuellos de botella en la canalización en el movimiento de datos de la CPU a la GPU. Las soluciones de la comunidad incluyen SageAttention (reduce la VRAM y acelera el cómputo), torch.compile y el marco paralelo xDiT (que afirma una aceleración de 7.75x en múltiples GPU). Ninguna de estas opciones es de conectar y usar (plug-and-play).

La inestabilidad del movimiento en escenas complejas es una limitación documentada. Los artículos de investigación publicados en 2025 citan específicamente a CogVideoX por mostrar "deriva de identidad y dinámicas físicamente inverosímiles" durante movimientos de alta dinámica, como bailes rápidos o deportes competitivos. El problema es más pronunciado en el modelo base 5B que en el 1.5, y empeora a medida que la longitud del clip supera los 6 segundos.

La salida a 8fps en los modelos base CogVideoX-2B y 5B se ve notablemente entrecortada al reproducirse. CogVideoX1.5 mejoró esto a 16fps, lo cual es mejor pero aún está por debajo de los 30fps de Mochi 1 o de las herramientas comerciales que apuntan a 24fps.

Las indicaciones solo en inglés con un límite estricto de 226 tokens significan que los usuarios que no hablan inglés deben traducir primero, y las descripciones largas y complejas se truncan. No hay capacidad multilingüe nativa en los pesos actuales.

Los cambios drásticos en las herramientas son un punto de fricción constante. La refactorización de la Actualización 8 del adaptador de ComfyUI de kijai rompió los flujos de trabajo existentes, requiriendo que los usuarios reconstruyeran sus gráficos de nodos. Esto es de esperar en un proyecto de código abierto de rápido movimiento, pero resulta inconveniente para cualquiera que haya construido canalizaciones de producción en configuraciones más antiguas.

Mejores casos de uso frente a escenarios a evitar

CogVideoX funciona mejor cuando:

  • Desea animar una imagen estática. La canalización I2V, particularmente con FLUX o SDXL como generador de imágenes de origen, es el flujo de trabajo del mundo real más elogiado para CogVideoX. La preservación de los detalles es fuerte, y el modelo 5B-I2V supera constantemente a las alternativas en su nivel de VRAM para esta tarea específica.

  • Necesita generación de video de ejecución local y sin suscripciones en hardware de consumo. Desde la GTX 1080 Ti (2B) hasta la RTX 3060 (5B), CogVideoX tiene el requisito de hardware más bajo de cualquier modelo de nivel de calidad comparable.

  • La adherencia a las indicaciones es importante para escenas estructuradas. Las visualizaciones técnicas, los recorridos arquitectónicos, las demostraciones de productos y el contenido científico se benefician de la precisión de seguimiento de texto de CogVideoX, que los evaluadores independientes han calificado por encima de otros modelos abiertos en el seguimiento de instrucciones para descripciones detalladas.

  • Desea realizar un ajuste fino en datos de estilo personalizados. El soporte de CogKit y diffusers LoRA hace que el modelo sea una base de ajuste fino práctica para estilos específicos de estudio.

Evite CogVideoX cuando:

  • Su contenido se centra en rostros humanos fotorrealistas, cuerpos o escenas con múltiples personajes. HunyuanVideo obtiene dos puntos completos más en sujetos humanos fotorrealistas en pruebas de rendimiento de terceros, y la diferencia de calidad es visible para revisores no técnicos.

  • La velocidad es importante. Si necesita un clip en menos de 3 minutos en hardware de consumo, LTX-Video es la recomendación de la comunidad. CogVideoX, con 9-15 minutos por clip en una RTX 3060, frustrará cualquier flujo de trabajo que requiera iteración.

  • Trabaja en idiomas distintos al inglés. La restricción de solo inglés de 226 tokens no es una configuración que se pueda ajustar; está integrada en el entrenamiento del modelo.

  • No tiene acceso a una GPU Nvidia moderna. La inferencia solo con CPU es técnicamente posible, pero resulta poco práctica por su lentitud para cualquier uso de producción.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen CogVideoX.

Artículos relacionados

Guías y artículos relacionados con CogVideoX.