跳到主要内容
Vantaige
Mochi 1 screenshot
Mochi 1 logo

Mochi 1

免费

Mochi 1 是 Genmo 于 2024 年 10 月在 Apache 2.0 许可下发布的百亿参数开源视频生成模型。它能生成 30fps 的 480p 视频片段,并具有极强的提示词遵循能力。模型权重可免费下载,并支持免版税的商业应用。

功能:APIOpen Source

Mochi 1 是一款开源的文本生成视频模型,由获得 2840 万美元 A 轮融资的旧金山 AI 初创公司 Genmo 开发。该模型于 2024 年 10 月 22 日在 Apache 2.0 许可下发布,提供高达百亿参数的视频生成能力,免费开放给个人和商业使用,其权重托管在 Hugging Face 上,完整代码库则开源于 GitHub。在发布之初,Genmo 称其为“有史以来开源的最大视频生成模型”,这一称号保持了大约两个月:当时没有任何其他开源模型能在规模、运动质量和宽松许可的结合上与之匹敌。

该模型采用 48 层的非对称扩散 Transformer (AsymmDiT) 架构,具备 44,520 个 Token 的视觉上下文窗口,以及一个 3.62 亿参数的 VAE,可将视频压缩至 128 倍小的潜在空间。在 T5-XXL 文本编码器的驱动下,它能生成长达 5.4 秒、30fps 的 480p 视频,并在物理运动、镜头行为和多元素场景中展现出极强的提示词遵循能力。Apache 2.0 许可允许微调、LoRA 适配(于 2024 年 11 月添加)以及无供应商锁定的商业部署。Genmo 还在 genmo.ai 上运营着一个托管的 Web 游乐场,采用基于积分的订阅模式,起价为每月 $10,非常适合不想自己管理 GPU 基础设施的团队。

2026 年 4 月 Mochi 1 的实际输出效果

2026 年 4 月,我们在 genmo.ai 托管游乐场中生成了一段 5 秒的慢动作视频,内容是水滴击中平静的池塘水面。在整个视频片段中,涟漪的传播在物理上非常合理,水体边缘没有任何变形伪影。480p 的输出保留了足够的细节,经过后期放大处理后可用于 1080p 的时间线,尽管在仔细观察放大版本时会出现明显的压缩痕迹。对于慢动作素材而言,30fps 的帧率感觉很流畅,不过 5.4 秒的硬性时长限制切断了涟漪序列自然平息的阶段。

截至 2026 年 4 月,公开发布的模型仍然只能生成最长 5.4 秒、30fps 的 480p 视频。Genmo 曾承诺在 2024 年底前推出目标为 720p 的 Mochi 1 HD 变体;但该计划被推迟了,2025 年 2 月 GitHub 上一个要求明确 HD 发布时间的 Issue 也未得到团队的回复。官方模型卡片指出,该模型“针对照片级真实风格进行了优化”,并且在极端运动情况下“也可能出现轻微的扭曲和变形”。尽管存在技术限制,该模型在 Hugging Face 上已积累了 100 多个 Spaces、5 个适配器、6 个微调版本和 4 个社区量化版本,反映出其持续活跃的使用状态。

“虽然有一定的学习曲线,但一旦你写出了好的提示词,感觉就像在导演一部皮克斯动画短片。” - G2 评论者,来自 Geniusfirms.com,2025

最佳用例与需要避免的灾难性场景

在看重 Apache 2.0 许可、优先考虑照片级真实质量,且团队拥有自己的 GPU 基础设施或适度托管预算的工作流中,Mochi 1 占据了一席之地。探索 AI 辅助场景可视化的独立电影制作人、制作简短产品演示的营销团队,以及需要在专有视觉数据集上进行微调的 ML 研究人员,都有充分的理由选择 Mochi 1 而非其他替代方案。

2024 年 11 月添加的 LoRA 微调功能对于品牌一致性用例尤为宝贵。团队可以在一组经过批准的视觉参考资料上训练 Mochi,然后在各个营销活动中生成符合品牌调性的视频片段,而无需从头开始重新编写提示词。来自 Runway、Pika 或 Kling 的闭源工具不允许这种工作流。在托管平台上,每月 $10 的 Lite 计划(每月大约可生成 12 个视频)非常适合那些无需设置本地 GPU 基础设施即可制作照片级真实社交内容的独立创作者。

灾难性场景:如果用提示词引导 Mochi 生成动漫、卡通、赛璐璐或绘画风格,结果会非常糟糕。该模型是在照片级真实素材上训练的,没有可靠的美学风格迁移机制。尝试生成快速移动的动作序列,会出现边缘变形伪影。尝试在 12GB GPU 上运行它,量化版本会产生明显的质量下降。如果将其用于跨多种提示词变体的快速概念迭代,每个片段 8-20 分钟的生成时间将迅速成为创作瓶颈。

运动与镜头控制:它的表现如何

运动控制是 Mochi 1 展现出的最强能力之一。AsymmDiT 的 44,520 Token 视觉上下文窗口在整个视频序列中应用了完整的 3D 注意力机制,Genmo 将模型出色的帧间连贯性归功于此。在实践中,这在物理驱动的运动中表现得最为明显:流体动力学、头发运动、布料模拟和缓慢的人类手势,在空间一致性上都比早期的开源模型保持得更好。

镜头控制主要通过提示词语言来表达。在文本提示中描述平移方向、缩放速度、倾斜角度和跟踪运动,所产生的结果比许多同类模型更可靠地符合这些指令。genmo.ai 托管界面还提供了从稳定(约 50%)到高度动态(高达 99%)的运动强度控制,为非技术用户提供了一种基于滑块的运动行为调整方法,而无需进行提示词工程。该模型原生不支持带有结构化镜头路径的图生视频,这限制了它在受控电影构图工作流中的应用。

极端运动是控制力下降的地方。快速的镜头平移、物体的快速移动和高频运动序列会使模型在物体边界处产生扭曲伪影。官方模型卡片明确承认了这一点。ComfyUI 工作流用户的共识是,将运动强度保持在 80% 以下,可以为大多数主体类型生成更干净的输出。

“该模型生成视频需要 44,520 个 Token 的序列长度,这非常消耗内存,而且 VAE 也是一个巨大的内存消耗大户。好消息是:硬件要求已经降低,现在可以在单张 RTX 4090 上运行了。” - ved-genmo(Genmo 团队成员),Hugging Face 讨论帖,2024 年 11 月 1 日

导出限制:分辨率、时长与水印

开源权重可生成 30fps 的 480p (848x480) 视频,上限为 5.4 秒(162 帧)。本地生成的输出没有原生水印;Apache 2.0 允许无限制导出。使用 Real-ESRGAN 或类似工具的社区放大工作流可以将有效分辨率提升至 1080p,尽管放大的 480p 并不等同于原生的 720p,特别是在近距离观看时的面部细节和精细纹理上。

在 genmo.ai 托管平台上,免费套餐会对所有输出添加 Genmo 水印。付费套餐(每月 $10 的 Lite 和每月 $30 的 Standard)会移除水印,并授予托管生成片段的商业使用权。单次生成没有超过 5.4 秒的导出选项;更长的序列需要在后期制作中拼接多个片段。托管平台导出 MP4 文件;在开始生成之前设置宽高比,提供 16:9、9:16 和 1:1 选项以适应社交媒体格式。

真实工作流:使用 Mochi 1 制作品牌产品动画

在托管平台上使用 Mochi 1 进行典型的电子商务产品动画工作流如下。创作者上传一张静态产品照片(例如香水瓶),使用 genmo.ai 上的选择性画笔工具将内部液体区域标记为要动画化的区域,然后添加描述柔和环境光下轻柔旋转运动的文本提示词。在托管队列中生成需要 2-5 分钟。输出的是一个 5 秒的 480p MP4 视频,显示瓶内液体在移动,而玻璃和标签保持静止。创作者下载视频,应用 Real-ESRGAN 放大至 1080p,在独立的编辑器中添加背景音乐,然后发布到 Instagram Reels。从上传到发布片段的总时间:大约 15-20 分钟。Lite 套餐的成本:每次视频生成约 83 美分(100 积分,按 $10/1,200 积分计算)。

对于自托管的研究变体,ML 团队可能会通过 LoRA 在 500 个经过批准的品牌素材片段上微调 Mochi,从而生成一个领域自适应模型,该模型能够持续生成符合品牌调性的视觉效果,而无需重新提示风格描述。此工作流需要 GPU 基础设施(用于推理的 RTX 3090 或更高版本,用于 LoRA 训练的更高端 GPU 集群),但无需支付任何许可费用,并且生成的输出对 Genmo 是完全不可见的。

每个成品视频的真实成本

自托管:仅计算成本。在云租赁平台上运行 RTX 4090,每次生成 8-20 分钟,每小时约 80 美分,每个片段的成本在 10-30 美分之间。拥有自有 GPU 基础设施的团队只需支付电费,每个视频的边际成本接近于零。像 RunPod 和 Lambda Labs 这样的云 GPU 服务提供大约每小时 $1.50-2.50 的 A100 访问权限,根据片段的复杂程度,典型的 Mochi 生成成本在 20-80 美分之间。

通过 genmo.ai 托管:每次 Mochi 视频生成消耗 100 积分。各套餐明细如下:

  • Free(托管):每月 $0,每月 50 积分,带有 Genmo 水印,仅限个人使用。在初始注册奖励耗尽后,每月大约可生成 0-1 个 Mochi 视频。

  • Lite(托管):每月 $10,每月 1,200 积分(约 12 次 Mochi 生成),无水印,支持商业使用,高队列优先级。按年计费可享受 20% 的折扣。

  • Standard(托管):每月 $30,每月 5,000 积分(约 50 次 Mochi 生成),无水印,最快队列,抢先体验新模型。按年计费可享受 20% 的折扣。

Mochi 1 的 Replicate API 定价约为每次生成 $0.42(大约 $1 可运行 2 次),对于需要托管推理但不想承诺订阅的开发者来说,这是一个可行的选择。

Mochi 1 vs. HunyuanVideo vs. LTX-Video

HunyuanVideo(Tencent,2024 年 12 月)使用 130 亿参数,而 Mochi 为 100 亿,它基于混合专家 (Mixture-of-Experts) 架构和跨帧文本引导模块,而不是 Mochi 的 AsymmDiT。输出分辨率的差异是最明显的变化:HunyuanVideo 原生生成 1280x720,而 Mochi 为 848x480。在 VBench 基准测试中,HunyuanVideo 得分为 83.2,而 Mochi 为 77.4,在电影级画质、多角色面部保真度以及较长持续时间内的运动连贯性方面具有优势。代价是速度:在 A100 上,HunyuanVideo 生成一个 5 秒的片段大约需要 45 分钟,而 Mochi 只需要 8 分钟。HunyuanVideo 使用带有商业条件的自定义许可;Mochi 1 则是无限制的 Apache 2.0。对于生成时间次要、质量优先的项目,HunyuanVideo 是目前的开源领导者。如果为了许可清晰或更快的迭代速度,Mochi 1 则更为实用。

LTX-Video (Lightricks) 则做出了相反的权衡。其基础模型使用 20 亿参数(也提供 13B 的开发变体),并采用分解注意力机制,独立处理空间和时间维度,而不是像 Mochi 那样在 44,520 个 Token 上进行完整的 3D 注意力计算。结果是:在 A100 上,LTX-Video 大约只需 45 秒即可生成一个 5 秒的片段,而 Mochi 需要 8 分钟,并且它可以在 8GB 的显存上运行,而 Mochi 至少需要 17-18GB。输出分辨率达到 1216x704。其 VBench 得分为 71.2,低于 Mochi 的 77.4,反映了为实现速度而做出的质量妥协。LTX-Video 使用自定义许可,而非 Apache 2.0。对于跨多种提示词变体的快速概念迭代,LTX-Video 是实用的首选。而要在干净的商业许可下保持持续的照片级真实质量,Mochi 1 则独树一帜。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 Mochi 1 的精选合集。

相关文章

与 Mochi 1 相关的指南和文章。