

CogVideoX 是 Zhipu AI 的开源视频生成模型系列,支持在本地或通过 API 生成文生视频和图生视频片段。可在显存低至 5GB 的消费级 GPU 上运行,全面支持 diffusers、LoRA 微调以及 ComfyUI 集成。完全免费下载并支持自托管。
CogVideoX 是由 Zhipu AI 和清华大学 THUDM 实验室研究人员共同开发的开源视频生成模型系列。该模型于 2024 年 8 月首次发布,并被 ICLR 2025 接收为会议论文。它能够根据文本提示或源图像生成视频,无需任何订阅或按次计费。模型权重可从 HuggingFace 免费下载,代码库在 GitHub 上采用 MIT/Apache 2.0 许可证,目前该项目已累计获得超过 12,700 颗星。截至 2026 年 4 月,该代码库仍在积极维护中,2025 年 3 月新增了 CogKit 微调框架,社区封装工具也已支持数百个 ComfyUI 工作流。
该模型系列包含五个变体,涵盖不同的硬件层级和用例:轻量级的 2B 参数版本可在 GTX 1080 Ti 等老款 GPU 上运行;5B 旗舰版能够处理细节丰富的文生视频任务,并具有极强的提示词遵循能力;而 5B-I2V 变体则一直被评为消费级 GPU 用户可用的最佳图生视频模型。CogVideoX1.5(2024 年 11 月)将分辨率提升至 1360x768(16fps),并将视频片段长度延长至 10 秒。其架构采用 3D 变分自编码器(3D Variational Autoencoder)进行时空压缩,并搭配专家 Transformer(Expert Transformer),没有传统的交叉注意力(cross-attention)模块。全面集成 diffusers 意味着只需一行代码即可调用管道,同时通过 CogKit 开箱即用地支持 LoRA 微调。
CogVideoX 在 2026 年 4 月的输出表现
截至 2026 年 4 月,当前的模型阵容涵盖了两代产品。初代 CogVideoX-5B 可生成 720x480 分辨率、8 fps 的 6 秒视频片段。它在 BF16 精度下运行,在 A100 上的推理时间约为 180 秒,在 H100 上约为 90 秒。通过 CPU 卸载和 INT8 量化,显存下限可降至约 4.4GB,使其成为目前最易于部署的本地视频模型之一。
2024 年 11 月 8 日发布的 CogVideoX1.5-5B 实现了显著的提升:1360x768 分辨率、16 fps 以及 5-10 秒的持续时间。其配套的图生视频模型(CogVideoX1.5-5B-I2V)支持任意宽高比,最多可输出 81 帧。两者均可通过 Hugging Face 的 diffusers 库访问,并使用与基础模型相同的管道接口。在 Qingying 平台上,Zhipu AI 还展示了这些模型与其 CogSound 音频模型结合使用,批量生成同步音频和 4K 超高清输出的效果,不过开源权重版本仍保持上述规格。
对 ComfyUI 的支持是一流的。kijai/ComfyUI-CogVideoXWrapper 拥有超过 1,500 颗星和 341 次提交,支持文生视频、图生视频、LoRA、GGUF 量化、ControlNet 姿态控制、用于延长视频片段的时间平铺(temporal tiling),以及通过 Go-with-the-Flow 实现的实验性运动引导。此外,还存在 Stable Diffusion WebUI Forge 的集成。
“5B 模型的表现绝对是碾压级的。它不仅在场景细节上更加丰富,在提示词遵循方面也做得好得多。”—— Bijan Bowen,Ominous Industries,2024 年 8 月
CogVideoX 与 HunyuanVideo 和 Mochi 1 的对比定位
当自托管用户比较开源视频生成模型时,有三个模型占据了主导地位:Tencent 的 HunyuanVideo、Genmo 的 Mochi 1 以及 CogVideoX。它们基于不同的架构理念构建,并服务于截然不同的硬件配置需求。
HunyuanVideo (Tencent) 采用 130 亿参数的 MoE(混合专家)架构,结合跨帧文本引导模块和混合分辨率训练,在较低分辨率下学习时间动态,在较高分辨率下训练空间细节。HunyuanVideo 1.5(2025 年 11 月)将其缩减至 8.3B 参数,并将显存下限降至 14GB。在基准测试中,它的时间一致性得分为 9.1/10,而 CogVideoX 为 7.9/10,对于任何涉及逼真的人脸或多角色场景的任务,它显然是更优的选择。代价在于硬件要求:在初代模型上以全画质运行 720p 视频,你需要 60-80GB 的显存,这需要数据中心级别的 GPU。按需 API 定价约为每分钟输出 $11。对于大多数自托管用户来说,当渴望 HunyuanVideo 的质量但硬件条件不允许时,CogVideoX 是一个易于获取的替代方案。
Mochi 1 (Genmo) 采用 100 亿参数的 AsymmDiT(非对称扩散 Transformer)架构,专门针对 30 fps 的流畅运动进行了优化。这种帧率优势是实打实的:Mochi 1 的输出看起来明显比 8 fps 的基础版 CogVideoX 更流畅。然而,Mochi 1 的分辨率上限为 480p,且未发布高清升级版,最低需要 16GB 显存,并且 Genmo 没有推出能够跟上 HunyuanVideo 1.5 或 CogVideoX1.5 步伐的实质性继任者。社区普遍认为 Mochi 1 具有历史意义,因为它证明了开源模型也能实现流畅的运动,但在实际应用中,它已被大多数工作流所淘汰。CogVideoX1.5 在 16fps 和 1360x768 分辨率下产生的输出分辨率高于 Mochi 1,尽管在快速移动的场景中,Mochi 的运动平滑度仍然占优。
拥有 50 亿参数的 CogVideoX 是三者中硬件门槛最低的。通过量化,它可以在约 5GB 显存下运行,在 RTX 3060 级别的显卡上生成可接受的视频,并提供了最易于实现的本地图生视频动画路径。代价是照片级真实感:CogVideoX 生成的输出比 HunyuanVideo 更具风格化和插画感,在第三方基准测试中,其在逼真人物主体方面的得分为 7.4/10,而 HunyuanVideo 为 8.7/10。
“CogVideoX 在开源模型中拥有最佳的图生视频模式,允许你使用 FLUX 或 SDXL 生成主图,然后使用 CogVideoX 对其进行动画处理,其 3D Causal VAE 技术能够提供强大的细节保留能力。”—— InsiderLLM,《本地 AI 视频生成指南》,2025 年
使用 CogVideoX 生成视频的真实成本
模型权重是免费的。Hugging Face 托管也是免费的。实际成本在于电费、硬件折旧和时间。
在 RTX 4090 上,标准设置下 5B 模型每小时预计可生成 5-7 个片段。在 RTX 3060 (12GB) 上,每个片段的生成时间会延长至 9-15 分钟。H100 可将 5B 的推理时间缩短至约 90 秒。如果你没有合适的硬件,云 GPU 提供商(如 Vast.ai、RunPod、Modal)对 H100/A100 的收费约为每小时 $0.50-$3.00,这意味着根据设置和提供商的不同,单个片段的成本在几美分到几美元之间。
诸如 Replicate 和 SiliconFlow 等第三方 API 封装服务托管了量化版的 CogVideoX 端点,按次计费的价格因提供商而异,通常在每个片段 $0.02-$0.10 之间。这些是独立的企业,而非 Zhipu AI 的产品。Zhipu AI 官方的 Qingying 平台提供云端访问并有其独立的定价,但开源权重模型本身始终是免费的。
对于使用 CogKit 进行微调,计算预算会随着数据集大小和目标分辨率的增加而增加。在 80GB A100 上针对小数据集对 CogVideoX-5B 进行 LoRA 微调通常能在数小时内完成。2025 年 1 月的更新降低了 LoRA 训练的显存要求,使得在消费级 24GB 显卡上进行微调变得更加容易。
CogVideoX 常见的局限与问题
生成速度慢是最常见的抱怨。GitHub issue #545 记录了在某些配置下,CogVideoX1.5-5B 在 0/50 推理步数卡住超过一个小时的情况。更典型的是,消费级 GPU 用户报告在推理期间 GPU 利用率仅在 60% 左右,这表明在 CPU 到 GPU 的数据传输中存在管道瓶颈。社区的解决方案包括 SageAttention(减少显存并加速计算)、torch.compile 以及 xDiT 并行框架(声称在多 GPU 上可实现 7.75 倍的加速)。但这些方案都不是即插即用的。
复杂场景下的运动不稳定性是一个已被记录的局限。2025 年发表的研究论文特别指出,CogVideoX 在快速舞蹈或竞技体育等高动态运动中表现出“身份漂移和物理上不合理的动态”。这个问题在基础 5B 模型上比在 1.5 版本上更为明显,并且随着片段长度超过 6 秒而恶化。
基础版 CogVideoX-2B 和 5B 的 8fps 输出在播放时看起来明显卡顿。CogVideoX1.5 将其提高到了 16fps,情况有所改善,但仍低于 Mochi 1 的 30fps 或目标为 24fps 的商业工具。
仅支持英文提示词且有严格的 226 个 token 限制,这意味着非英语用户必须先进行翻译,而且冗长、复杂的提示词描述会被截断。当前的权重版本中没有原生的多语言能力。
工具链的破坏性更新是一个持续存在的摩擦点。kijai ComfyUI 封装工具的 Update 8 重构破坏了现有的工作流,要求用户重建他们的节点图。对于一个快速发展的开源项目来说,这是意料之中的,但对于任何在旧配置上构建生产管道的人来说,这很不方便。
最佳用例与避坑场景
CogVideoX 最适合以下情况:
你想要让静态图像动起来。I2V 管道,特别是使用 FLUX 或 SDXL 作为源图像生成器,是 CogVideoX 最受好评的实际工作流。细节保留能力强,且 5B-I2V 模型在这一特定任务上始终优于同等显存级别的其他替代方案。
你需要在消费级硬件上本地运行、零订阅的视频生成。从 GTX 1080 Ti (2B) 到 RTX 3060 (5B),CogVideoX 在同等质量级别的模型中拥有最低的硬件门槛。
结构化场景需要严格遵循提示词。技术可视化、建筑漫游、产品演示和科学内容都能从 CogVideoX 精准的文本遵循能力中受益,独立测试人员对其在详细描述的指令遵循方面的评价高于其他开源模型。
你想要针对自定义风格数据进行微调。CogKit 和 diffusers 的 LoRA 支持使该模型成为打造工作室专属视觉风格的实用微调基础。
在以下情况下请避开 CogVideoX:
你的内容以逼真的人脸、身体或多角色场景为中心。HunyuanVideo 在第三方基准测试中的逼真人物主体得分高出整整两分,而且这种质量差异连非技术人员也能肉眼可见。
速度至关重要。如果你需要在消费级硬件上在 3 分钟内生成一个片段,社区推荐使用 LTX-Video。CogVideoX 在 RTX 3060 上每个片段需要 9-15 分钟,这会让任何需要迭代的工作流感到沮丧。
你使用非英语语言工作。仅支持英文且限制 226 个 token 的约束不是一个可以调整的设置;它是固化在模型训练中的。
你没有现代 Nvidia GPU。仅使用 CPU 进行推理在技术上是可行的,但对于任何生产用途来说都慢得不切实际。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 CogVideoX 的精选合集。
相关文章
与 CogVideoX 相关的指南和文章。

AI Video Generator Prompting: The Filmmaker's Real Workflow

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
