Gemini Omni 1.1 Flash 是谷歌最新的多模态 AI 视频模型,旨在通过文本、图像和视频输入来创建和编辑视频。与以前的 AI 视频工具相比,它专注于更好的场景一致性、对话式编辑和电影级控制。在本指南中,我们将探讨其功能、实际使用案例、提示词、局限性,以及您如何通过 ChatGoat AI 试用 Gemini Omni 1.1。

从 Omni 1.0 到 Omni 1.1 发生了什么变化
最初的 Gemini Omni Flash 于 2026 年 5 月的 Google I/O 大会上宣布,它引入了核心理念:一个模型以文本、图像、音频或视频作为输入,并在单次运行中生成同步的视频输出。1.1 版本并没有取代这一基础——它添加了自发布以来开发者一直要求的控制层。
| 功能 | Gemini Omni 1.0 | Gemini Omni 1.1 |
|---|---|---|
| 场景延伸 | 仅分析了片段的最后一秒 | 分析长达 10 秒的先前片段,以获得更一致的接续效果 |
| 最大连续时长 | 每次生成约 10 秒 | 累计长达 40 秒,以 10 秒为增量添加 |
| 帧控制 | 不支持 | 设置首帧和尾帧以生成它们之间的动作 |
| 参考输入 | 文本/图像/音频 | 添加长达 3 秒的外部视频作为风格/动作参考 |
| 草稿模式 | 仅限标准生成 | 360p 草稿模式,比 720p 快约 60%,成本仅为其三分之一左右 |
| 最大分辨率 | 1080P | 高达 4K(通过超分辨率放大,而非原生生成) |
大家都搞错的几个数字
在最初 24 小时内发布的许多报道都暗示 Gemini Omni 1.1 可以生成单个连续的 40 秒 4K 剪辑。它做不到,这里有必要保持精确,因为这直接影响您如何规划制作工作流程:
- 单次生成
- 在 24FPS 下时长为 3-10 秒,而不是 40 秒。40 秒的数字是一个累计总量,是通过以 10 秒为步骤重复延长剪辑而达到的,每次模型都会重新分析前一个片段的尾部。
- 4K 是超分放大的,而不是原生生成的。 该模型在较低分辨率下生成,并应用谷歌的超分放大技术达到 1080p 或 4K。API 文档明确说明了这一点。如果您需要原生的超高分辨率细节(精细文本、复杂的纹理),请做好应对任何放大管线都具有的相同局限性的准备。
- 首/尾帧插值确实是一项新颖且实用的功能,适用于镜头横扫、缩放过渡和循环剪辑——但它仅适用于单段 3-10 秒的视频,而不是整个延长的序列。
这些并不会降低 Omni 1.1 的实用性——它在控制力上仍然是一个有意义的飞跃,而这正是制作团队此前真正的瓶颈。这只意味着“40 秒的 4K 视频”是一个工作流的产物,而不是单次生成的直接结果。
价格
Gemini Omni 1.1 Flash 按输出秒数计费,价格随分辨率而变化:
| 分辨率 | 每秒价格 |
|---|---|
| 360P (草稿) | $0.03 |
| 720P | $0.10 |
| 1080P | $0.15 |
| 4K (超分放大) | $0.30 |
360p 草稿模式的存在,专门为了让团队能够在提交全分辨率渲染之前,以低廉的价格对提示词和取景进行迭代——10 秒的 4K 剪辑成本为 3.00 美元,而相同剪辑在 360p 下仅需 0.30 美元。
Gemini Omni 1.1 对比 Seedance 2.5 和 MiniMax H3
目前最直接与 Omni 1.1 进行对比的两款模型并不是谷歌通常的竞争对手——它们是 字节跳动的 Seedance 2.5 和 MiniMax 的开源权重模型 H3,两者都在相同的几周内发布,且定价都极具竞争力。
| 模型 | 特点 | 最大输出 | 编辑控制 | 获取方式 |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | 对话式、基于会话的编辑;单次运行中统一输入文本/图像/音频/视频 | 每次生成 3-10 秒,可通过 10 秒增量累计延长至 40 秒 | 首/尾帧、场景延伸、风格参考视频 | 闭源,仅限 API/AI Studio |
| Seedance 2.5 | 长篇叙事和强参考驱动生成——单次请求最多支持 50 个图像、视频和音频参考资产 | 单次运行长达 30 秒(根据字节跳动规范) | 首帧及首尾帧控制、时间戳级多轮编辑 | 闭源,通过 BytePlus/即梦/豆包逐步推出 |
| MiniMax H3 | 极具竞争力的性价比,单次运行中生成带有同步立体声音频的原生 2K 分辨率视频 | 原生高达 15 秒 | 首/尾帧控制、视频到视频动作传递 | 开源权重(社区许可证)+ 托管 API |
在选择之前,有几点值得注意:
- 在纸面参数上,Seedance 2.5 在原生时长上处于领先地位。 字节跳动自己的规范声称单次生成可长达 30 秒,而 Omni 1.1 则是将 10 秒的片段拼接成累计 40 秒的总长。在不同服务商中,这一原生 30 秒的声称是否能保持一致,早期采用者仍在测试中——在您自己运行之前,先将其视为规格表数据。
- MiniMax H3 是这三者中唯一开源权重的模型,它是在 MiniMax 自己的社区许可证下发布的(不是像 MIT 或 Apache 2.0 这样的标准宽松许可证)。如果本地部署或微调是您路线图的一部分,这一点很重要——Omni 1.1 和 Seedance 2.5 都不提供这条路径。
- 这三款模型在不同服务商处的定价存在显著差异。 官方直连接口(API)费率和第三方网关(fal、Replicate、BytePlus、Atlas Cloud 等)对同一模型给出的每秒报价大相径庭,有时相差 2-3 倍。在没有核实您实际结算的具体服务商之前,不要轻信 Seedance 2.5 或 H3 的任何引用价格——Omni 1.1 的价格更为稳定,因为谷歌是唯一的提供商。
- Omni 1.1 的真正差异化优势仍然在于对话式、会话内的编辑循环——无需重置生成状态即可更换主体、改变照明、修复手部。Seedance 2.5 提供了类似时间戳级的编辑功能;H3 则更依赖于视频到视频的动作传递,而不是迭代式提示词细化。
如果您已经在为制作管线比较 Seedance 2.5 和 MiniMax H3,那么对于特别需要精准首/尾帧镜头控制,而不是最大原生剪辑长度或最低每秒成本的项目,Omni 1.1 值得加入到候选名单中。
如何获取 Gemini Omni 1.1
Gemini Omni 1.1 Flash 是一款面向开发者的模型。目前还没有专门针对消费者的应用——目前的获取渠道包括:
- Google AI Studio - 无需编写代码即可进行测试的最快方法。您将获得一个提示词输入框、帧控制以及草稿/放大选项。
- Gemini API (
gemini-omni-1.1-flash) - 用于将其构建到您自己的产品或管线中。gemini-omni-flash-preview是较早的预览版本;1.1 是稳定发布版本。 - Gemini Enterprise Agent Platform - 适用于已在使用 Google Cloud 并希望将其接入现有智能体工作流的团队。
所有这些都需要 Google Cloud 项目、启用计费,并且至少基本熟悉 API 密钥或 Agent Studio。如果您只是想在开通开发者帐户之前探索 Gemini 底层模型的能力——推理、图像理解、多模态对话——那么在决定使用视频 API 之前,这是一个门槛更低的起点。
这就是像 ChatGOAT AI 这样的工具融入工作流程的地方。ChatGOAT 为您提供基于浏览器的免费渠道来访问 Gemini 模型(包括 Gemini 3.7 Flash),以及 GPT 5.6 Sol、Grok 4.6 和 DeepSeek,外加内置的 AI 图像生成器——无需设置帐户、无需配置账单、无需 API 密钥。如果您正在规划一个 Gemini Omni 1.1 视频项目,您可以在接触 API 之前,使用 ChatGOAT 的图像生成器来草绘您的首尾帧参考——因为 Omni 1.1 的帧插值功能正好需要这种输入。它不会自己生成视频,但它消除了准备参考材料的繁琐过程。
Gemini Omni 1.1 AI 视频生成器:如何使用提示词创建电影级视频
从 Omni 1.1 中获取一段技术上合格的视频非常容易。但要获得一段真正具有电影感的视频——具有刻意设计的镜头运动、一致的照明以及感觉像是经过导演指引而非随机生成的镜头——这几乎完全取决于您如何构建提示词。
行之有效的提示词结构
把每个提示词都当成镜头描述,而不是概括性的要求。一个适用于 Omni 1.1 的电影级提示词应当按顺序堆叠以下元素:
- 主体与动作——画面中是谁或什么,以及它们在做什么
- 镜头运动——相机的运作方式(静止、推镜头、摇镜头、升降镜头、手持)
- 镜头类型与构图——全景、中景、特写、过肩镜头
- 光线与氛围——黄金时刻、强烈的演播室灯光、阴天、霓虹灯
- 风格参考——胶片、导演的视觉语言或类型(“35mm 拍摄”、“暗淡色调”、“浅景深”)
仅描述主体的提示词(如“一个女人在夜间的城市中漫步”)会给模型太多的自由度,通常会产生平庸的动作。加入镜头和光线引导才能使输出效果更具实用性。
示例——弱提示词:
“一辆车在山路上行驶。”
示例——电影级提示词:
“在黄金时刻,一辆复古敞篷车沿着蜿蜒的海岸山路行驶。相机低角度安装在无人机上,在车旁高速追踪拍摄,车轮有轻微的运动模糊。温暖的低角度阳光、拉长的阴影、浅景深,前景中的道路柔和地模糊。”
第二个版本赋予了 Omni 1.1 具体的相机行为和光线逻辑来遵循,这正是该模型在物理和运动一致性方面的改进得以展现之处。
利用首尾帧控制实现电影级运动
这是 Omni 1.1 专门用于指导镜头运动最实用的工具。除了单用文字描述镜头运动外,您还可以:
- 生成或上传首帧——镜头的起始画面构图
- 生成或上传尾帧——相机和主体最终应当到达的位置
- 提示它们之间的动作——“缓慢推镜头并伴随焦点变换,焦点从背景转移到主体”
这转将模糊的指令(如“戏剧性地放大”)转变为模型在其间进行插值的明确起始和结束状态,从而产生比从头开始提示动作更加一致、更具专业感的相机运动。这对于揭示镜头、产品特写镜头以及两个场景之间的过渡尤其有效。
电影级提示词的草稿先行工作流
既然提示词的措辞对输出有如此大的影响,就不要在第一次尝试时直接生成全分辨率:
- 编写 2-3 个提示词变体,每次只更改镜头运动或光线描述
- 以 360p 草稿模式(0.03 美元/秒)生成这三个变体,低成本地对比构图和运动质量
- 选择构图最强的一个版本,并根据实际渲染出来的效果优化提示词措辞
- 仅将最终选定的版本放大到 1080p 或 4K
这与专业提示词工程师在各种视频模型中通用的迭代循环相同,但在本模型中尤为重要,因为 4K 生成的成本是 360p 草稿的 10 倍。
值得使用的常用电影级提示词术语
- 镜头运动:推/拉镜头、左/右摇镜头、上/下仰俯、升降镜头、手持、静止锁定、追踪拍摄
- 镜头构图:全景交代镜头、中景镜头、特写、大特写、过肩镜头
- 光线:黄金时刻、蓝色时刻、高对比度/强光、柔和散射光、实用照明、逆光剪影
- 镜头/风格线索:浅景深、变形宽银幕光斑、电影胶片颗粒、去饱和度调色、35mm 观感
如果您想在决定接受 Omni 1.1 的按秒计费前先测试电影级提示词的措辞,您可以先使用 ChatGOAT AI 的图像生成器将视觉语言(光线、构图、色调)草拟为静态图像,然后将相同的描述性词汇带入您的 Omni 1.1 提示词中。在静态图像中敲定外观比在付费视频生成中反复迭代要便宜得多。
实际使用场景
- 产品演示视频:使用产品展示的首帧和“使用中”的尾帧,让 Omni 1.1 生成它们之间的动作。
- 社交内容草稿:在 360p 下低成本迭代,每次改变一个提示词元素,然后仅对您保留的版本进行超分放大。
- 故事板绘制:先将关键帧绘制为静态图像(这里使用 AI 图像生成器效果很好),然后将其作为首/尾参考输入到 Omni 1.1 中。
- 场景接续:在不重新生成的情况下延伸现有视频剪辑的叙事——适用于剧集式或序列化的内容。
开发前需要了解的局限性
- 并非单次长篇视频生成器——如果需要 10 秒以上,请规划分段延伸。
- 4K 输出为放大/超分效果;对于需要原生超高分辨率保真度的内容,请勿依赖此功能。
- 需要 Google Cloud/开发者配置——目前该特定模型还没有免代码的消费者视频应用。
- 对于较长的累计片段,高分辨率的计费增长迅速,因此从一开始就将草稿模式迭代纳入您的流程是非常值得的。
FAQ
Gemini Omni 1.1 是免费使用的吗?
不是。它是按照生成的视频秒数计费的,从 360p 下的 0.03 美元/秒到 4K 下的 0.30 美元/秒不等。根据您的账户情况,Google AI Studio 可能会提供有限的免费额度。
Gemini Omni 1.1 可以在单次请求中生成完整的 40 秒视频吗?
不能。每次生成产生 3 至 10 秒的视频。40 秒的数字是指通过以 10 秒为增量延长视频剪辑所能达到的累计长度。
4K 输出是原生的还是放大的?
放大的。谷歌官方文档将 1080p 和 4K 输出标注为从较低分辨率生成的画面放大而来。
Gemini Omni 1.1 和 Gemini Omni Flash Preview 有什么区别?
gemini-omni-1.1-flash 是稳定的、可投入生产的版本。gemini-omni-flash-preview 是较早的预览版本,正被逐步淘汰以被 1.1 取代。
我需要编写代码来使用它吗?
不一定——Google AI Studio 提供了可视化界面。但要完全集成到产品中,则需要使用 Gemini API。
它与仅使用 Gemini 的对话模型有什么不同?
Gemini 的标准对话模型处理文本、图像和推理任务。而 Omni 1.1 是 Gemini 系列中专门的视频生成和编辑模型——对于通用的多模态对话、图像生成和日常 AI 协助,像 ChatGOAT AI(基于 Gemini 及其他领先模型构建)这样的工具是更简单的入门选择。

