MiniMax H3 Developer 现已上线 — 官方定价 4 折,低至 $0.02/秒

Gemini Omni Flash:让每个视频续接都像一镜到底

本文介绍了如何让 Gemini Omni Flash 的每个视频续接都像一次连续拍摄。杯子是对的,演员是对的,雨水也在做它该做的事。更长的提示词并不能保护那个镜头。

你终于拍到了一个满意的10秒产品镜头。杯子对了,演员对了,雨也恰到好处。然后,就到了风险时刻。更长的提示词并不能保护这个镜头。一个受控的下一拍才能做到。

Gemini Omni Flash 1.1 视频扩展 可以在受支持的 Gemini API 工作流中,每次追加 3 到 10 秒,累计结果最长可达 40 秒。把它视为一条链:先批准一个 10 秒的锚点镜头,然后在每次续接时只指导一个可观察的事件。

这样,剪辑师、社交媒体团队和开发人员就可以在每个片段之后、在手部漂移、道具移位、面部变化、光线方向或声音基底变成昂贵的意外之前,获得一个审查点。

Gemini Omni Flash 1.1 视频扩展:核心要点

  • 单次输出为 3 到 10 秒。
  • 扩展在片尾追加,总时长可达 40 秒。
  • 保留已获批准的锚点,然后添加一个拍节。
  • 在再次扩展前,检查连接点。
  • 界面访问可能滞后于 API 能力。

Gemini Omni Flash 1.1 视频扩展:一个值得测试的连续性案例

期望的结果是一个连贯的序列,而不是一个更长的孤立片段。对于一个雨日咖啡广告,需要在每个连接点检查杯子、木炭色围裙、门口位置、阴天光线和摄像机高度。

01-gemini-omni-coffee-continuity.gif

Gemini Omni 1.1 Flash 连续性案例:一位咖啡师和同一个哑光黑色咖啡杯,从雨窗 establishing shot,经过室内跟踪镜头,再到一个低角度门口视角

真实的 10 秒测试环境输出,使用 Google Gemini Omni 1.1 Flash 文生视频功能以 720p 生成。该序列保持了咖啡师、木炭色围裙、咖啡杯、雨水和咖啡馆场景,同时从雨窗 establishing view 过渡到室内横向跟拍,再到低角度门口/室外视角。此 GIF 无声音,因为本案例的重点是视觉连续性和镜头变化,而非音频。

为什么 Gemini Omni Flash 1.1 视频扩展备受瞩目,以及尝试为何会失败

稳定的 gemini-omni-1.1-flash 发布版本支持文本、图像和短视频输入,并可输出 3 到 10 秒的视频,支持 360p、720p、1080p 和 4K 分辨率。Google 将此次发布中的 1080p 和 4K 描述为升级输出。(Gemini Omni Flash 模型页面,2026 年 8 月)

最吸引人的地方在于:一个 10 秒的片段可以变成一个 40 秒的序列。但制作中的问题在于连接点。

以下三个选择会导致大多数续接失败:

  • 封闭式锚点。 如果第一个片段以一个完成的姿势结束,下一个动作就没有可信的出路。要在动作仍有延续性时结束:比如手伸向门、跑步者系紧鞋带,或者一只狗刚好在画框外。
  • 重写式提示词。 重复人物、场景、镜头和天气的每一个细节会诱发重绘。保留少数关键的身份锚点,然后描述新的动作。
  • 界面不匹配。 模型能力、API 可用性、Gemini 应用和 Flow 控件是各自独立的界面。在向客户承诺“扩展”按钮之前,请核实具体的界面。

Gemini Omni Flash 1.1 工作流、模型与成本(在生成之前需了解)

Google 将扩展功能记录为一种片尾操作。它可以利用先前交互中模型生成的视频,或一个不超过 10 秒的上传剪辑。上传的含说话人画面不能用新对话进行扩展,且上传视频的扩展功能在欧洲经济区、瑞士和英国有地区限制。(Gemini Omni Flash 指南,2026 年 8 月)

将模型选择器、提示词、上传和结果审查都放在一个浏览器标签页中。Atlas Cloud 可以作为一个安静的操作层,因为它的模型目录允许团队在开始生成前检查实时的视频处理界面。

Atlas 测试环境现在提供了一个可运行的 Gemini Omni Flash 工作流。本文中的咖啡、跑步者和野餐案例均使用真实的测试环境输出来展示提示词、连续性锚点和可见的下一拍。文中不声明任何生产价格。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

    
阶段目标锁定或添加如果失败
草稿找到一个可用的动作出口保持种子开放重写故事拍节
批准选择一个锚点记录种子和最后帧保留已批准的片段
扩展添加一个可见事件保留锚点,添加一个变量仅重试此连接
质检检查连接点前后各 1 秒检查身份、道具、空间、手部、动作减少新变量
升级批准后交付保留已批准的链条不要用升级来掩盖糟糕的连接

如何逐步使用 Gemini Omni Flash 1.1 视频扩展

第 1 步:生成一个 10 秒的锚点镜头

在支持 Gemini API 的界面中,选择 10 秒、16:9 和 720p(如果这些控件可用)。在获得可用镜头前,将种子设置为 -1,然后记录种子并保留已批准的结果。

plaintext
1一个写实的电影级商业广告,采用连续手持 35mm 镜头拍摄。在一个雨晨的独立小咖啡馆内,一位穿着木炭色围裙的年轻女咖啡师将一个哑光黑色外带咖啡杯放在温暖的胡桃木柜台上,转身走向玻璃门,并走到门边。雨水在窗户上自然地流淌,柔和的阴天日光,浅景深,地板上微妙的倒影。全程保持同一个女人、围裙、杯子、店铺布局、灯光和摄像机高度。自然音频:安静的浓缩咖啡机声、雨打玻璃声、轻柔的脚步声。无文本,无标志,无跳切。

01-coffee-anchor-case.png

咖啡店锚点案例:咖啡师、哑光黑色杯子、门口、雨水和灯光是需要保留的元素

使用 GPT Image 生成的连续性规划案例视觉。它展示了第 1 步简报中的具体锚点,并非 Gemini Omni Flash 的结果。

第 2 步:用一个新拍节扩展同一镜头

仅在选择界面暴露了真正的扩展或续接路径时使用此方法。上传已批准的第 1 步片段。完成的输出应保留源视频并追加一个新的片尾。

plaintext
1从最终时刻继续这个精确的场景。同一位咖啡师打开玻璃门,走到雨湿的人行道上,手里仍然拿着同一个哑光黑色咖啡杯。摄像机以相同高度在她身后平滑跟拍。保留她的面部、木炭色围裙、杯子形状、咖啡馆内部、雨天阴沉的灯光、逼真的动作和环境雨声。不添加新人、无文本、无标志、无剪辑。

检查连接点前后各 1 秒:杯子、手、门的位置、围裙、光线方向和环境声。如果这里有漂移,则修改第 2 步,而不是第 1 步。

02-step2-doorway-continuation.jpg

第 2 步续接案例:咖啡师拿着同一个哑光黑色杯子,穿过打开的咖啡馆门,走到雨湿的人行道上

第 2 步续接提示词的高分辨率案例视觉。它使尾部事件可审查:当她跨过门槛时,咖啡师、哑光黑色杯子、咖啡馆门口、雨水和外部光线都保持清晰。

第 3 步:用一个受控的故事事件再次扩展

这一步在画面边缘添加一个人。不要在一次请求中同时加入新人、新地点、新时间、新角度和新对话。

plaintext
1从最终时刻继续这个精确的场景。同一位咖啡师在咖啡馆雨棚下走了两步,将同一个哑光黑色咖啡杯递给一位穿着海军蓝雨衣的等候顾客。保持咖啡师、杯子、雨水、灯光、摄像机高度和自然环境声一致。顾客仅从画面右边缘进入。无对话,无文本,无标志,无突然的镜头切换。

03-step3-awning-handoff.jpg

第 3 步受控变量案例:咖啡师在咖啡馆雨棚下,将同一个咖啡杯递给一位穿着海军蓝雨衣的顾客

第 3 步续接提示词的高分辨率案例视觉。它展示了唯一允许的新变量:一位顾客在雨棚下接过杯子,而咖啡师、雨水、咖啡馆门口和交接动作都保持清晰。

第 4 步:运行一个产品一致性变体

测试一个跑步者从公寓门口移动到河边小径的场景。锚点是面部、深绿色夹克、白色鞋子、湿路面、凉爽的黎明光线和摄像机方向。

plaintext
1在一个写实的 35mm 商业广告镜头中,继续同一个跑步者和产品故事。跑步者在公寓门口系好同一双白色跑鞋,打开门,开始在蓝色时分的安静河边小径上慢跑。保留跑步者的面部、深绿色夹克、白色鞋子、湿路面、凉爽的黎明光线和摄像机方向。自然音频:鞋带拉动声、门闩声、远处的鸟鸣、轻柔的脚步声。无文本,无标志,无剪辑。

只有在鞋的轮廓、鞋带颜色、夹克和运动方向在连接点保持稳定时,才予以批准。

02-runner-product-consistency.gif

跑步者产品一致性 GIF:同一件深绿色夹克和白色鞋子,从公寓门口系鞋带,到河边跑步

真实的 10 秒 Google Gemini Omni 1.1 Flash 文生视频测试环境输出。它测试了第 4 步的锚点,跨越低角度鞋部特写、公寓门口的横向跟拍,以及低角度河边经过,而非依赖单一的推镜头。

第 5 步:运行一个参考角色变体

使用一个非人类的参考。保持人物和野餐场景稳定;狗是唯一的新变量。

plaintext
1在同一个写实的公园野餐场景中,从最终时刻继续。两个朋友在绿叶成荫的树下,于柔和的傍晚光线下继续整理一张奶油色野餐毯。IMAGE_REF_0 中显示的小金毛狗从左侧轻轻跑入画面,绕毯子一圈,然后坐在他们旁边。保留人物、野餐物品、阳光方向、摄像机距离和自然的公园氛围。无文本,无标志,无突兀的剪辑。

03-picnic-dog-reference.gif

参考角色 GIF:一只小金毛狗从左侧进入,绕奶油色野餐毯一圈,然后坐在两个朋友旁边

真实的 10 秒 Google Gemini Omni 1.1 Flash 文生视频测试环境输出。狗是唯一的新角色:它从左侧进入,绕毯子一圈,然后坐下,而两个朋友、奶油色野餐布置和傍晚的公园在宽景、狗视角和高角度三分之四视图中保持稳定。

第 6 步:批准、升级和导出,不破坏连接

检查身份、主打产品、空间连续性、手部、动作、音频,然后检查剪辑点。在 2 次连续性失败后,更改前一个故事的出口或移除一个新变量。不要因为后续片段失误而覆盖一个好的锚点。

在选定界面支持的情况下,在链条批准后请求 1080p 或 4K。Google 将这些描述为升级输出,而非原生 4K。(Gemini API 发布说明,2026 年 8 月)

Gemini Omni Flash 1.1 视频扩展:需要不同提示词的变体

镜头延续。 仅描述下一个镜头动作,例如“镜头全景扫过群山”。

参考引导的扩展。 引入一个角色、产品或动作参考。第 5 步中的狗只有一个任务:进入,绕一圈,坐下。

首尾帧插值。 当你知道两个边界图像并希望生成它们之间的过渡时使用。它不能替代延续现有片段的最后时刻。

上传的素材。 保持源视频不超过 10 秒。如果源视频中已有人在说话,请不要请求新的对话。

Gemini Omni Flash 1.1 视频扩展成本与生产现实

使用实际运行界面上的报价。本文的测试无法验证 Atlas 的 Gemini Omni Flash 路线或价格,因此固定的 Atlas 40 秒估算是虚构的。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

   
项目可靠的预算规则可能改变它的因素
10 秒锚点保存已完成运行的报价选定的模型和选项
视频剪辑过程保存已完成运行的报价源时长和处理界面
40 秒链条为每个已批准的轮次做预算输入长度和重试
升级交付检查选定的运行分辨率支持和报价

Gemini 中提供 360p 草稿选项并不意味着每个其他界面都提供 360p。请核实你执行的表单。对于 Gemini Omni Flash 1.1 视频扩展 的生产运行,连续 2 次连接失败后应停止,并更改故事节点,而不是在同一个提示词上堆砌形容词。

常见问题解答

Gemini Omni Flash 1.1 真的能把视频扩展到 40 秒吗?

可以。文档记录的 Gemini API 工作流每次续接最多增加 10 秒,累计视频最长可达 40 秒。单次输出仍为 3 到 10 秒。

Gemini Omni Flash 1.1 视频扩展在 Flow 中可用吗?

API、应用和 UI 界面间的可用性可能不同。在安排扩展工作流之前,请确认具体的账户和界面。

在扩展 AI 视频时,如何保持同一个角色?

批准一个强有力的锚点,保留一小组身份锚点,并且只指导下一个可见的动作。仅为定义明确的主体或产品添加参考。

我可以用对话扩展上传的视频吗?

不要为正在说话的上传片段添加对话。保持续接无声,或者对于支持语音的模型生成视频,使用文档记录的多轮路径。

Gemini Omni Flash 1.1 会生成本地 4K 视频吗?

Google 将本次发布中的 1080p 和 4K 描述为升级输出。

视频扩展、视频编辑和首尾帧插值有什么区别?

扩展是在片尾追加新内容。视频编辑是使用提示词转换一个短视频源。首尾帧插值是在两个提供的图像之间创建过渡。

最新模型

一个 API,畅享全模态 AI。

探索全部模型