

Google Gemini Omni 是在 Google I/O 2026 上发布的一款全模态视频生成与编辑模型。它接受文本、图像、视频和音频的任意组合作为输入,然后以对话方式生成或编辑视频。目前没有任何其他顶级模型能实现这样的工作流。
Google Gemini Omni 是由 Google DeepMind 开发的视频生成与编辑模型,于 2026 年 5 月 19 日在 Google I/O 大会上发布。首个模型 Gemini Omni Flash 于同日通过 Gemini 应用和 Google Flow 上线。其标志性特征是真正的全模态输入:输入文本提示词、图像、现有视频片段、音频轨道或它们的任意组合,即可获得生成或编辑后的视频。Google DeepMind 将其定位为“不仅仅是 Veo 的更新”,这表明 Gemini Omni 试图将迭代式、对话式的电影制作流程直接构建到 Gemini 产品线中。
其核心功能包括风格迁移(将真实画面转换为黏土动画、动漫或线稿)、背景替换、对象移除、保持角色和光影一致的多轮编辑、物理感知特效以及教育类解说视频生成。文本渲染是其公认的强项:在独立测试中,Gemini Omni 准确地在移动的黑板上渲染出了 sin(x) + cos(x) = 1,而 Seedance 2.0 在相同的提示词下则未能成功。发布初期,视频长度被限制在 10 秒以内,官方证实这是出于部署策略的考量,而非模型本身的限制。语音和对话编辑(修改现有素材中的对话)功能因有待安全测试而被刻意暂缓发布。
Gemini Omni 在 2026 年 5 月的输出表现
Gemini Omni Flash 可生成长达 10 秒的视频片段。分辨率和确切的帧率尚未公开。原生支持音频生成与同步:您可以输入参考音轨,并提示 Omni 将视觉事件与之同步(例如在重拍时亮起灯光,或在竖琴响起时树叶沙沙作响)。该模型支持多轮编辑,这意味着每一个后续提示词都会对上一次的输出进行微调,而不是从头开始重新生成。这是发布时所有竞品模型中最明显缺失的功能。
支持的输入组合包括纯文本、纯图像、纯视频、图文结合、视频加文本、视频加参考图像,以及视频、音频和文本的综合输入。产品页面的标语直接概括了这一点:“从任何输入创造任何内容(Create anything from any input)”。生成类别包括完整的文生视频、图生视频风格迁移、视频到视频的转换(在保留运动轨迹的同时改变美学风格)、现有素材中的对象和角色替换、背景编辑以及摄像机角度调整。发布会上展示的风格预设包括:黏土动画、单色线稿、动漫、水彩以及逼真的物理编辑。该模型应用了真实世界的物理推理,而非像素级的混合,这就是为什么这种架构上的改变能够实现流体镜面涟漪或音画同步触发等特效的原因。
Gemini Omni 与 Veo 3 和 Seedance 2.0 的定位对比
在 Google 自家产品线中,最明显的竞争对手是 Veo 3。Veo 3 是一个专注于生成的专用视频模型,可制作长达 8 秒的片段,并带有原生音频合成(音效、环境音和音乐与视频一次性同步生成)。它的输出始终处于“电影级”类别:清晰、具有情感说服力的画面,非常适合短片和高端社交媒体内容。Veo 3 无法做到的是同时接受多种类型的输入,或执行多轮对话式编辑。你给它一个提示词,它返回一个片段,这就是全部的交互过程。Gemini Omni 则做出了相反的取舍:对话式编辑流程和全模态输入是其存在的核心理由,为了实现这一点,它牺牲了 Veo 3 的部分原始电影级质感。对于想要获得单次生成效果最佳的 8 秒片段的电影制作人来说,Veo 3 仍然是更好的选择。而对于需要在不重新输入整个上下文的情况下对一个场景进行十次迭代编辑的创作者来说,Omni 在结构上更具优势。
外部基准测试的领导者是 ByteDance 的 Seedance 2.0。Seedance 在渲染织物、头发、水和人类运动时,展现出了评论家们一致称赞的“电影级重量感”,这种运动物理的真实感能立刻被训练有素的眼睛捕捉到。在 ReviewsTown(2026 年 5 月)的一项直接对比测试中,Seedance 2.0 在食物物理特性和人类运动连贯性方面击败了 Omni。报道 I/O 2026 发布会的 YouTube 创作者在他们的初体验报道中直言不讳地指出:
“这对我来说并没有太大的震撼。我们已经有了其他能够做类似事情的全模态视频模型,比如 Kling Free 以及 Seedance 2.0。至少从我的初步测试来看,Gemini Omni 在解剖学和高强度动作场景方面似乎不如 Seedance 2.0。至少这是我的初步印象。” - YouTube 创作者(I/O 2026 发布会报道),YouTube,2026 年 5 月
Seedance 2.0 的单次生成成本也更低:第三方 API 访问的费用约为每秒生成视频 0.06 到 0.15 美元,而 Omni 则采用受配额限制的订阅模式。Omni 相比 Seedance 的明显优势在于对话内编辑(Seedance 2.0 完全没有迭代编辑功能)以及视频内的文本/公式渲染。这些都是有据可查的优势,虽然无法弥补电影级画质上的差距,但它们开辟了真实的用例。将 Omni 与 Runway 或 Kling AI 结合使用以处理更复杂的运动镜头的创作者们,正在找到一种切实可行的分工方式。
使用 Gemini Omni 生成视频的真实成本
Gemini Omni 是一款免费增值(FREEMIUM)产品。免费访问权限仅存在于 YouTube Shorts 和 YouTube Create 应用中,且仅限于这些平台。要通过 Gemini 应用或 Google Flow 访问,则需要付费订阅 Google AI。包含 Gemini Omni 的三个层级分别是:每月 7.99 美元的 AI Plus,每月 19.99 美元的 AI Pro,以及起价 99.99 美元/月的 AI Ultra(在 I/O 2026 上从之前的 249.99 美元门槛下调)。
实际使用情况受到了严格限制。独立测试记录显示,两次视频生成大约消耗了 AI Pro 单日配额的 86%。这意味着在 19.99 美元/月的计划下,每天在配额耗尽前只能生成不到三个视频片段,而且该配额还要与文本、代码和图像任务共享。Flow Omni 积分按计划分级:AI Plus 为 200 积分,AI Pro 为 1,000 积分,AI Ultra 则在 10,000 到 25,000 积分之间。Google 在 I/O 2026 上从固定的每月提示词上限转向了基于计算量的使用模式,这引起了现有 AI Pro 订阅者的不满,他们原本依赖于可预测的每月 1,000 积分包,而该积分包在计划重组中被取消了。Reddit 和社交媒体上出现了批评声音,认为新系统使得预算限制变得“难以预测”。
对于每周需要生成多个片段的创作者来说,每月 99.99 美元的 AI Ultra 才是现实的生产力层级。开发者 API 在发布时并未公布定价(根据 Google 的公告,“将在几周内推出”)。与单次生成积分消耗可预测的 Pika 或 WAN 相比,Gemini Omni 基于计算量的配额机制为 Ultra 以下的所有层级带来了规划上的不确定性。
Gemini Omni 经常翻车的场景
解剖学和高强度动作方面的差距是记录最多的局限性。从报道发布会的 YouTube 创作者到 iGeekPhone 的对比文章,多位独立评测者证实,复杂的人类运动(舞蹈、体育、高强度动作序列)、对物理要求极高的解剖学(手部、嘴部、进食物理)以及需要重量感和动量的场景,在发布时均落后于 Seedance 2.0 和 Kling V3.0。在 ReviewsTown 的吃意大利面测试中,意大利面在不同帧之间出现了不一致的闪烁和消失,而 Seedance 则保持了物理连贯性。Kling V3.0 在包括手势、舞蹈和运动在内的人类动作领域仍然是该类别的领导者。
视觉基调是另一个反复被提及的槽点。多位评测者将 Omni 的输出描述为“就像一个 Google 产品:干净、强大,且带有一点企业风”。X/Twitter 评论家 @shlomifruchter 称其输出“过于精致/像模板一样”,而 @teortaxesTex (TextOrtaxes) 则形容其视觉风格类似于“B 级电子游戏界面”。这是一个真实的创作局限:该模型生成的画面在技术上是正确的,但缺乏 Seedance 2.0 在最佳状态下输出的那种情感说服力和电影“质感”。
“过于精致/像模板一样” - @shlomifruchter,X/Twitter,2026 年 5 月
另外三种常见的失败模式包括:(1) Google 的内容安全过滤器会拦截直接提及真实公众人物姓名的提示词,这需要寻找变通方法,从而增加了创作工作流的阻力。(2) 发布版本中缺少语音和对话编辑功能,这限制了 Omni 在配音、唇形同步或对话替换方面的实用性。(3) 10 秒的片段上限是一个硬性天花板。在发布初期,创作者如果想制作比简短社交媒体片段或产品演示更长的内容,会立刻碰壁。跨多个镜头的角色一致性被一项分析称为“AI 视频的开放性创伤”,这一问题同样影响着 Omni 以及该类别中的所有其他模型。
如何向 Gemini Omni 编写提示词以获得最佳效果
Google 的官方提示词指南指出了实现可靠输出的五个维度:镜头构图与运动、视觉风格、光照、地点和动作。核心原则是:“添加的细节越多,对最终输出的控制力就越强。”该模型利用 Gemini 的推理能力来填补逼真的上下文,因此在对这五个维度保持精确的同时,应避免对次要元素进行过度说明。
对于镜头构图,请使用电影摄影术语:镜头类型(“静态 static”、“固定镜头 locked off”、“长镜头 oner”)、运动(“推镜头 push in”、“滑动变焦 dolly zoom”)以及摄像机风格(“电影摄影机 film camera”、“网络摄像头风格 webcam style”、“自然智能手机变焦 natural smartphone zoom”)。对于风格,请直接说出美学名称:“电影级 cinematic”、“黏土动画 claymation”、“动漫 anime”、“水彩 watercolor”。对于光照,请指定光源和质量:“温暖的午后阳光 warm late-afternoon sun”、“清脆的头顶荧光灯 crisp overhead fluorescents”。对于动作,请逐帧描述正在发生的事情,而不是暗示它。对于多输入工作流,请包含故事板或角色图像等视觉参考,以保持编辑过程中的一致性。对于音频同步,请明确触发条件:“低音响起时灯光亮起”的效果要好于“灯光响应音乐”。对于多轮编辑,每一个后续提示词都会对现有输出进行微调,而无需重新输入整个场景的完整提示词。
最佳用例与避坑场景
当迭代编辑是核心需求时,Gemini Omni 就是合适的工具。没有其他顶级模型能让您在保持视觉一致性的同时,跨越多个轮次更改背景、移除对象并替换角色。教育内容非常契合:蛋白质折叠的黏土动画、黑板公式以及字母到对象的解说视频在早期测试中都表现良好。面向社交媒体创作者的风格迁移(将真实画面转换为插画或动画美学)是另一个真正的用例。Google 生态系统中的用户可以获得 Flow、YouTube 和 Workspace 的集成,这是 Luma AI、Hailuo 或 Pixverse 等工具无法复制的优势。
对于高强度动作画面、复杂的人类运动或对解剖学要求极高的场景,请避开 Gemini Omni。Sora 和 Seedance 2.0 在广告级或短片制作方面更为强大。对于需要可预测的单片成本的高产量工作流,请避开它;在 Ultra 层级以下,通过 API 使用 Kling 或 Seedance 更具成本效益。如果在制作中需要语音/对话编辑(该功能尚未上线),以及对于任何超过 10 秒的片段,也请避开它。每月 7.99 美元的 AI Plus 层级值得用于探索测试,但在 Pro 层级上进行量产需要接受视频生成会消耗您大部分每日配额的事实。Gemini Omni 获得了 4.5 分:其工作流确实新颖独特,但配额限制、与 Seedance 2.0 之间的电影级画质差距,以及缺失的语音编辑功能,使其未能跻身最顶级的行列。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Gemini Omni 的精选合集。
相关文章
与 Gemini Omni 相关的指南和文章。

AI Video Generator Prompting: The Filmmaker's Real Workflow

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Sell AI-Generated Short Films on TikTok Shop, Instagram & YouTube (2026)

Freepik AI Is Now Magnific: What Changed, What It Costs, and Whether to Stay (2026)

Best AI Fashion Model Generators for Clothing Brands (2026)
