

CogVideoX est la série de modèles de génération vidéo open source de Zhipu AI, produisant des clips texte-vers-vidéo et image-vers-vidéo localement ou via API. Elle fonctionne sur des GPU grand public à partir de 5 Go de VRAM avec une prise en charge complète de diffusers, le fine-tuning LoRA et l'intégration ComfyUI. Entièrement gratuit à télécharger et à auto-héberger.
CogVideoX est une série de modèles de génération vidéo open source développée par Zhipu AI et les chercheurs du laboratoire THUDM de l'Université Tsinghua. Lancée pour la première fois en août 2024 et acceptée comme article de conférence à l'ICLR 2025, elle génère des vidéos à partir de prompts textuels ou d'images sources sans aucun abonnement ni frais par clip. Les poids du modèle sont téléchargeables gratuitement sur HuggingFace et le code source est sous licence MIT/Apache 2.0 sur GitHub, où le projet a accumulé plus de 12 700 étoiles. En avril 2026, le dépôt reste activement maintenu, avec l'ajout du framework de fine-tuning CogKit en mars 2025 et des wrappers communautaires alimentant des centaines de workflows ComfyUI.
La famille de modèles comprend cinq variantes couvrant différents niveaux de matériel et cas d'usage : la version légère à 2B de paramètres fonctionne sur des GPU aussi anciens qu'une GTX 1080 Ti ; le modèle phare 5B gère la génération texte-vers-vidéo détaillée avec un fort respect des prompts ; et la variante 5B-I2V est régulièrement classée comme le meilleur modèle image-vers-vidéo accessible aux propriétaires de GPU grand public. CogVideoX1.5 (novembre 2024) a poussé la résolution à 1360x768 à 16 fps et étendu la durée des clips à 10 secondes. L'architecture utilise un auto-encodeur variationnel 3D pour la compression spatio-temporelle associé à un Expert Transformer, sans module d'attention croisée traditionnel. L'intégration complète de diffusers permet des appels de pipeline en une seule ligne, et le fine-tuning LoRA est pris en charge nativement via CogKit.
Ce que CogVideoX produit en avril 2026
La gamme actuelle de modèles en avril 2026 couvre deux générations. Le CogVideoX-5B original produit des vidéos en 720x480 à 8 fps pour des clips de 6 secondes. Il fonctionne en précision BF16 avec une inférence d'environ 180 secondes sur un A100 ou 90 secondes sur un H100. Avec le déchargement CPU et la quantification INT8, le seuil de VRAM chute à environ 4,4 Go, ce qui en fait l'un des modèles vidéo locaux les plus accessibles du marché.
CogVideoX1.5-5B, sorti le 8 novembre 2024, représente une avancée significative : résolution de 1360x768, 16 fps et durées de 5 à 10 secondes. Son pendant image-vers-vidéo (CogVideoX1.5-5B-I2V) accepte n'importe quel ratio d'aspect et produit jusqu'à 81 images. Les deux sont accessibles via la bibliothèque diffusers de Hugging Face avec la même interface de pipeline que les modèles de base. Sur la plateforme Qingying, Zhipu AI a également fait la démonstration des modèles associés à son modèle audio CogSound pour produire un son synchronisé et une sortie ultra-haute définition 4K en lot, bien que les versions open-weight conservent les spécifications ci-dessus.
La prise en charge de ComfyUI est de premier ordre. Le kijai/ComfyUI-CogVideoXWrapper compte plus de 1 500 étoiles et 341 commits, prenant en charge le texte-vers-vidéo, l'image-vers-vidéo, LoRA, la quantification GGUF, le contrôle de pose ControlNet, le tuilage temporel pour les clips étendus, et le guidage de mouvement expérimental via Go-with-the-Flow. L'intégration à Stable Diffusion WebUI Forge existe également.
"Le modèle 5B surpasse absolument tout. Non seulement il est plus détaillé au niveau des décors, mais il fait aussi un bien meilleur travail en termes de respect des prompts.". Bijan Bowen, Ominous Industries, août 2024
Où se situe CogVideoX par rapport à HunyuanVideo et Mochi 1
Trois modèles dominent la conversation lorsque les adeptes de l'auto-hébergement comparent la génération vidéo open source : HunyuanVideo de Tencent, Mochi 1 de Genmo et CogVideoX. Ils reposent sur des paris architecturaux différents et répondent à des profils matériels très distincts.
HunyuanVideo (Tencent) utilise une architecture MoE (Mixture-of-Experts) de 13 milliards de paramètres avec des modules de guidage textuel inter-trames et un entraînement en résolution mixte, où la dynamique temporelle est apprise à basse résolution tandis que les détails spatiaux sont entraînés à plus haute résolution. HunyuanVideo 1.5 (novembre 2025) a réduit cela à 8,3B de paramètres et abaissé le seuil de VRAM à 14 Go minimum. Dans les benchmarks, il obtient 9,1/10 pour la cohérence temporelle contre 7,9/10 pour CogVideoX, et c'est clairement le choix supérieur pour tout ce qui implique des visages humains photoréalistes ou des scènes à plusieurs personnages. Le compromis est matériel : en qualité maximale sur le modèle original, il faut compter 60 à 80 Go de VRAM en 720p, ce qui nécessite un accès à des GPU de centre de données. La tarification de l'API à la demande s'élève à environ $11/minute de vidéo produite. Pour la plupart des utilisateurs en auto-hébergement, CogVideoX est l'alternative accessible lorsque la qualité de HunyuanVideo est souhaitée mais que le matériel n'est pas disponible.
Mochi 1 (Genmo) utilise une architecture AsymmDiT (Asymmetric Diffusion Transformer) avec 10 milliards de paramètres, spécifiquement optimisée pour des mouvements fluides à 30 fps. Cet avantage de fréquence d'images est réel : le rendu de Mochi 1 semble nettement plus fluide que le CogVideoX de base à 8 fps. Cependant, Mochi 1 est limité à une résolution de 480p sans mise à niveau HD disponible, nécessite 16 Go de VRAM minimum, et Genmo n'a pas sorti de successeur significatif capable de rivaliser avec HunyuanVideo 1.5 ou CogVideoX1.5. La communauté considère largement Mochi 1 comme historiquement important pour avoir démontré que des mouvements fluides étaient réalisables en open source, mais pratiquement dépassé pour la plupart des workflows. CogVideoX1.5 à 16 fps et 1360x768 produit une sortie de plus haute résolution que Mochi 1, bien que la fluidité des mouvements reste à l'avantage de Mochi sur les déplacements rapides.
CogVideoX, avec ses 5 milliards de paramètres, possède le prérequis matériel le plus bas des trois. Il fonctionne à partir d'environ 5 Go de VRAM avec quantification, génère des vidéos acceptables sur des cartes de la gamme RTX 3060, et offre la voie la plus accessible vers l'animation image-vers-vidéo locale. Le compromis est le photoréalisme : CogVideoX produit un rendu plus stylisé et illustratif que HunyuanVideo, obtenant 7,4/10 contre 8,7/10 pour HunyuanVideo sur les sujets humains photoréalistes dans les benchmarks tiers.
"CogVideoX possède le meilleur mode image-vers-vidéo parmi les modèles ouverts, vous permettant de générer une image principale avec FLUX ou SDXL, puis de l'animer avec CogVideoX, la technologie 3D Causal VAE offrant une forte préservation des détails.". InsiderLLM, Local AI Video Generation Guide, 2025
Le coût réel de la génération de vidéos avec CogVideoX
Les poids du modèle ne coûtent rien. L'hébergement sur Hugging Face est gratuit. Le coût réel réside dans l'électricité, l'amortissement du matériel et le temps.
Sur une RTX 4090, comptez 5 à 7 clips par heure pour le modèle 5B avec les paramètres standards. Sur une RTX 3060 (12 Go), le temps de génération s'allonge à 9-15 minutes par clip. Un H100 réduit l'inférence du 5B à environ 90 secondes. Si vous ne possédez pas le matériel adéquat, les fournisseurs de GPU cloud (Vast.ai, RunPod, Modal) facturent environ $0.50-$3.00 par heure d'utilisation d'un H100/A100, ce qui ramène le coût d'un seul clip à quelques centimes ou quelques dollars selon les paramètres et le fournisseur.
Des wrappers d'API tiers tels que Replicate et SiliconFlow hébergent des points de terminaison CogVideoX quantifiés avec une tarification par exécution qui varie selon le fournisseur, généralement de l'ordre de $0.02-$0.10 par clip. Ce sont des entreprises indépendantes, et non des produits de Zhipu AI. La plateforme officielle Qingying de Zhipu AI offre un accès cloud avec sa propre tarification, mais les modèles open-weight eux-mêmes restent gratuits.
Pour le fine-tuning avec CogKit, le budget de calcul évolue en fonction de la taille du jeu de données et de la résolution cible. Le fine-tuning LoRA sur CogVideoX-5B s'achève généralement en quelques heures sur un A100 de 80 Go pour de petits jeux de données. La mise à jour de janvier 2025 a réduit les besoins en mémoire pour l'entraînement LoRA, rendant le fine-tuning plus abordable sur des cartes grand public de 24 Go.
Les limites récurrentes de CogVideoX
La lenteur de la génération est la plainte la plus fréquente. Le ticket GitHub #545 a documenté un CogVideoX1.5-5B bloqué à 0/50 étapes d'inférence pendant plus d'une heure sur certaines configurations. Plus généralement, les utilisateurs de GPU grand public signalent une utilisation du GPU d'environ 60 % pendant l'inférence, ce qui indique des goulots d'étranglement dans le pipeline lors du transfert de données du CPU vers le GPU. Les solutions de la communauté incluent SageAttention (réduit la VRAM et accélère le calcul), torch.compile, et le framework parallèle xDiT (qui revendique une accélération de 7,75x sur plusieurs GPU). Aucune de ces solutions n'est prête à l'emploi (plug-and-play).
L'instabilité des mouvements sur des scènes complexes est une limite documentée. Des articles de recherche publiés en 2025 citent spécifiquement CogVideoX comme présentant une "dérive d'identité et des dynamiques physiquement invraisemblables" lors de mouvements à forte dynamique tels que la danse rapide ou les sports de compétition. Le problème est plus prononcé sur le modèle 5B de base que sur le 1.5, et il s'aggrave lorsque la durée du clip dépasse 6 secondes.
Le rendu à 8 fps sur les modèles de base CogVideoX-2B et 5B semble nettement saccadé lors de la lecture. CogVideoX1.5 a amélioré cela en passant à 16 fps, ce qui est mieux mais reste inférieur aux 30 fps de Mochi 1 ou aux outils commerciaux qui visent 24 fps.
Les prompts uniquement en anglais avec une limite stricte de 226 tokens signifient que les utilisateurs non anglophones doivent d'abord traduire, et que les descriptions longues et complexes sont tronquées. Il n'y a aucune capacité multilingue native dans les poids actuels.
Les changements majeurs (breaking changes) dans les outils constituent un point de friction constant. La refonte de la mise à jour 8 du wrapper ComfyUI de kijai a cassé les workflows existants, obligeant les utilisateurs à reconstruire leurs graphes de nœuds. C'est prévisible pour un projet open source en évolution rapide, mais peu pratique pour quiconque a construit des pipelines de production sur des configurations plus anciennes.
Meilleurs cas d'usage vs scénarios à éviter
CogVideoX est idéal lorsque :
Vous souhaitez animer une image statique. Le pipeline I2V, en particulier avec FLUX ou SDXL comme générateur d'image source, est le workflow concret le plus plébiscité pour CogVideoX. La préservation des détails est forte, et le modèle 5B-I2V surpasse systématiquement les alternatives de sa catégorie de VRAM pour cette tâche spécifique.
Vous avez besoin d'une génération vidéo exécutée localement, sans abonnement, sur du matériel grand public. De la GTX 1080 Ti (2B) à la RTX 3060 (5B), CogVideoX possède le prérequis matériel le plus bas de tous les modèles de qualité comparable.
Le respect du prompt est crucial pour des scènes structurées. Les visualisations techniques, les visites architecturales, les démonstrations de produits et le contenu scientifique bénéficient tous de la précision de CogVideoX à suivre le texte, que des testeurs indépendants ont mieux notée que d'autres modèles ouverts pour le respect des instructions sur des descriptions détaillées.
Vous souhaitez effectuer un fine-tuning sur des données de style personnalisées. La prise en charge de CogKit et des LoRA de diffusers fait du modèle une base de fine-tuning pratique pour des rendus spécifiques à un studio.
Évitez CogVideoX lorsque :
Votre contenu se concentre sur des visages humains, des corps ou des scènes à plusieurs personnages photoréalistes. HunyuanVideo obtient deux points de plus sur les sujets humains photoréalistes dans les benchmarks tiers, et la différence de qualité est visible même pour des évaluateurs non techniques.
La vitesse est importante. Si vous avez besoin d'un clip en moins de 3 minutes sur du matériel grand public, LTX-Video est la recommandation de la communauté. CogVideoX, avec ses 9 à 15 minutes par clip sur une RTX 3060, frustrera tout workflow nécessitant des itérations.
Vous travaillez dans des langues autres que l'anglais. La contrainte de 226 tokens uniquement en anglais n'est pas un paramètre ajustable ; elle est intégrée à l'entraînement du modèle.
Vous n'avez pas accès à un GPU Nvidia moderne. L'inférence sur CPU seul est techniquement possible mais beaucoup trop lente pour un usage en production.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant CogVideoX.
Articles associés
Guides et articles en lien avec CogVideoX.

AI Video Generator Prompting: The Filmmaker's Real Workflow

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
