跳到主要内容
Vantaige
HunyuanVideo screenshot
HunyuanVideo logo

HunyuanVideo

免费

HunyuanVideo 是 Tencent 开源的视频生成模型,于 2024 年 12 月发布,拥有 130 亿参数。它在视觉质量上足以媲美 Runway Gen-3 等闭源竞品,可通过 ComfyUI 在本地运行,并在 CivitAI 上催生了 500 多个社区 LoRA 模型。 ---

使用场景:视频与电影制作
功能:APIOpen Source

我们生成了一段 10 秒的夜间沿海城市片段,雨水落在霓虹闪烁的街道上,镜头从屋顶向后拉出宽广的远景。HunyuanVideo 返回了 720p 的画面,具有连贯的摄像机运动、逼真的雨滴粒子动态,并且在第 5 秒时帧与帧之间没有明显的闪烁。到了第 8 秒,运动物体边缘的时间一致性开始减弱。到第 10 秒时,背景的散景已经发生偏移。这几乎告诉了你关于 HunyuanVideo 在 2026 年 4 月所处位置的所有信息:它的上限确实令人惊叹,下限则受制于硬件门槛,而时长限制也是真实存在的。

HunyuanVideo 是 Tencent 的开源视频生成模型系列,于 2024 年 12 月 3 日首次发布,是当时最大的开源权重视频模型,拥有 130 亿参数。此后,该生态系统不断壮大,加入了 HunyuanVideo-1.5(83 亿参数,2025 年 11 月发布,面向消费级 GPU)、HunyuanVideo-I2V(图生视频,2026 年 3 月)以及 HunyuanVideo-Avatar(音频驱动的肖像动画,2025 年 5 月)。模型权重在 Hugging Face 上根据自定义的 Tencent 社区许可证免费提供。它通过 ComfyUI 在本地运行,支持 LoRA 微调,且 Tencent 不收取任何单次生成费用。截至 2026 年 4 月,其 GitHub 仓库已获得超过 12,000 颗星,CivitAI LoRA 社区已制作了 500 多种训练适配模型。

2026 年 4 月 HunyuanVideo 的实际输出效果

原始的 13B 模型可生成 540p 至 720p 分辨率的视频,每个片段最多 129 帧。运动连贯性是其核心优势:在竞品模型容易丢失身份特征的剪辑中,多人场景能够保持角色的一致性;而平移和拉伸等摄像机运动在整个片段长度内都能维持空间逻辑。该模型采用了带有 CausalConv3D 压缩的 3D VAE 以及双流到单流的 Diffusion Transformer 架构,这为其在较短时长内的时间一致性奠定了基础。

HunyuanVideo-1.5(83 亿参数,SSTA 架构)在推理速度几乎翻倍的情况下,实现了与原版大致相同的输出质量,同时在启用卸载(offloading)的情况下,将最低显存(VRAM)要求降至 14GB。1.5 版本与原版之间的质量差异小于硬件要求的差异,这就是为什么在 2026 年 4 月,大多数从业者都从 1.5 版本开始上手的原因。

已知的输出限制:文本叠加会产生难以辨认的涂鸦,这与目前所有的视频扩散模型一致。在特写镜头中,精细的面部细节变得具有“挑战性”。当片段长度超过 8-10 秒时,时间一致性会下降。将输出分辨率翻倍会使内存需求增加约四倍,这在 24GB 的消费级显卡上形成了一个实际的上限。

“我从他们的 GitHub 上运行了 hunyuanvideoai,它似乎能生成逼真的视频”—— natvert,Hacker News,2024 年 12 月(指出在最初发布时,使用 A6000 生成大约需要 30-60 分钟)
“强烈建议去看看,在我看来它轻松击败了 cog 和 ltx 的视频生成”—— sdimg,r/StableDiffusion,2024 年 12 月

最佳用例与应避免的灾难性场景

HunyuanVideo 在以下方面表现最佳:

  • 电影级远景镜头和 B-roll(空镜头): 带有环境运动(天气、人群、城市场景)的广角镜头,在这些场景中,全画幅的时间一致性比面部保真度更重要。

  • 8 秒以内的简短宣传片: 产品展示、抽象的品牌视觉效果、自然风光镜头,这些场景的时长保持在模型的时间一致性窗口内。

  • 经过 LoRA 微调的角色创作: CivitAI 社区制作了风格和角色 LoRA,为特定的美学扩展了基础模型。每个主体仅需 16-22 张参考图像训练的“视频克隆” LoRA 是一种活跃的使用模式。

  • 用于数字主持人的 HunyuanVideo-Avatar: 上传一张肖像和一段音频。该模型可为电商主播、虚拟主播以及文化/教育内容处理唇形同步、面部表情和身体动作。

避免将 HunyuanVideo 用于任何需要屏幕上可读文本、超过 10 秒无剪辑的片段、高分辨率特写口播镜头或需要快速迭代周期的场景。在 RTX 4090 上每个片段需要 5-12 分钟,你无法在一次会话中承担测试大量变体的成本。

运动与摄像机控制:它的表现如何

HunyuanVideo 通过提示词工程(描述“向后拉”、“向左平移”、“手持”)能较好地处理隐含的摄像机运动,但在基础工作流中不提供类似 ControlNet 的显式摄像机轨迹控制。该模型从文本中语义化地理解摄像机运动,而不是接受关键帧级别的摄像机路径。对于固定或缓慢的摄像机设置,结果是可靠的。对于复杂的多轴摄像机运动,结果则不太稳定。

多人场景处理是其一大特长。该架构能够在 3-5 个不同主体之间保持角色身份,而参数量较小的同类模型往往会失去一致性。这对于对话场景、人群镜头以及同一个人在多个帧中出现的任何片段都至关重要。

Diffusion Transformer 架构中的跨帧文本引导模块有助于运动连贯性,特别是减少了困扰小参数模型背景元素的闪烁伪影。3D VAE 高效地压缩了时间信息,这就是为什么即使在压缩生成设置下,8 秒以内的片段也能保持良好效果的原因。

导出限制:分辨率、长度、水印

HunyuanVideo 不添加任何水印。该模型是自托管的;输出内容完全属于操作者。通过 ComfyUI 的分辨率选项从 544p 到 720p 不等,具体取决于显存余量。标准输出格式为 MP4。

2026 年 4 月的实际限制:

  • 129 帧是标准的片段长度设置(在 24fps 下约 5 秒,在 30fps 下约 4.3 秒)

  • 更长的片段需要显著更多的显存,并且在时间一致性上会产生明显更快的质量下降

  • 在原始 13B 模型上生成 720p 需要 60GB 显存;在带有 SSTA 和卸载功能的 HunyuanVideo-1.5 上,14-16GB 可以运行但速度较慢

  • 与默认精度设置相比,FP8 量化可节省约 10GB 内存

许可证排除了在欧盟、英国和韩国的使用。这是 Tencent 混元社区许可证中的硬性地域限制,而非技术限制,但这会影响这些地区的商业项目能否合法部署输出内容。

真实工作流:使用 HunyuanVideo 进行文生视频创作

2026 年 4 月,HunyuanVideo-1.5 的典型 ComfyUI 工作流如下。安装 kijai/ComfyUI-HunyuanVideoWrapper 自定义节点。从 Hugging Face 加载 1.5 模型权重(tencent/HunyuanVideo-1.5)。启用 VAE 平铺(tiling)以节省 4-6GB 显存,代价是增加 10-15% 的解码时间。将草图迭代的采样步数设置为 20-30(与默认的 50 步相比,内存使用量减少约 40%,且视觉质量损失极小)。在启动完整解码之前确认设置,因为显存不足(OOM)错误仅在完整生成运行完毕后的 VAE 解码阶段才会显现。

对于 HunyuanVideo-Avatar,工作流更简单:上传一张肖像图像和一段音频片段,选择生成风格(逼真、动画等),然后运行。模型会自动处理唇形同步和表情迁移。单角色模式已完全开源;多角色模式已宣布于 2025 年底开源发布。

在 RTX 3090 硬件上运行生产工作的从业者报告称,生成 5 秒的片段需要 5-6 分钟。RTX 4090 用户则需要 8-12 分钟。A6000(48-80GB 显存)可降至 4-8 分钟,同时能够启用完整的 720p 而无需在量化上妥协。

每个成片视频的真实成本

模型权重是免费的。推理成本来自电力和硬件折旧。在云服务提供商(RunPod、Replicate)上,典型的 GPU 计算成本为每小时 $0.50-$1.50,生成一个耗时 8-12 分钟的 5 秒 720p 片段,成本约为每个片段 $0.07-$0.30,具体取决于 GPU 等级和提供商。这比 Runway Gen-3(通过订阅为 $0.05/秒,但有月度订阅门槛)或 Luma 基于积分的定价要便宜得多。

自托管成本完全取决于硬件。购买一块 RTX 4090 分摊到 3 年,每天运行 4 小时,在大批量生产时,每个片段的实际成本不到 $0.01。真正的成本在于设置时间以及 ComfyUI 工作流配置的学习曲线。

对于欧盟、英国和韩国的团队来说,许可证限制意味着 HunyuanVideo 的“免费”标签在商业使用中伴随着法律风险,无论单次生成成本如何,没有地域限制的基于云的替代方案可能是更好的选择。

HunyuanVideo vs. Mochi 1 vs. LTX-Video

HunyuanVideo 在输出质量、参数规模(原版 130 亿,1.5 版 83 亿)、多人场景一致性以及社区生态系统(500 多个 LoRA、HunyuanVideo-Avatar、HunyuanVideo-I2V)方面处于领先地位。弱点在于速度、原版模型的显存门槛,并且拥有带有地域排除条款的更严格的自定义许可证。

Mochi 1(Genmo,100 亿参数,Apache 2.0 许可证)是质量上最接近的竞争对手,也是许可证更宽松的选择。其带有非对称 VAE(8x8 空间,6x 时间压缩)的非对称 Diffusion Transformer 可生成原生的 30fps 输出,这使其在帧率上比 HunyuanVideo 可配置但默认较低的 fps 具有真正的优势。Mochi 1 在物理精确的运动和角色动画方面表现出色。它需要的显存比 HunyuanVideo 的原版模型少,且其 Apache 2.0 许可证允许在全球范围内进行商业使用,没有地域限制。代价是社区生态系统较小,并且在同等设置下,与 HunyuanVideo 的 13B 模型相比,逼真细节的上限较低。

LTX-Video(Lightricks,DiT 架构)则是为了完全不同的权衡而构建的:速度优先于最高质量。在 RTX 4090 上,LTX-Video 大约只需 4 秒即可生成 5 秒的 768x512 24fps 画面,而 HunyuanVideo 生成类似长度的片段需要 8-12 分钟。对于现场演示、快速原型制作或迭代大量提示词变体,LTX-Video 是理性的选择。它的质量上限明显低于 HunyuanVideo,特别是在细节保留和多人场景方面。LTX-Video 的最高分辨率限制在 1216x704。

实用的决策树:当输出质量是首要任务,且你拥有硬件和耐心时,选择 HunyuanVideo。当你需要原生 30fps、物理精确的运动以及更干净的许可证时,选择 Mochi 1。当迭代速度比最高质量更重要时,选择 LTX-Video。

``` ---

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 HunyuanVideo 的精选合集。

相关文章

与 HunyuanVideo 相关的指南和文章。