MiniMax H3 Developer 现已上线 — 官方定价 4 折,低至 $0.02/秒

Gemini Omni 1.1 Flash 视频编辑:保持镜头,只改一处

本文讲解了 Gemini Omni 1.1 Flash 视频编辑中「保持镜头、只改变一处」的方法。本指南使用三组对照案例:每次拍手时变化的帽子、一群人变成火烈鸟而走位依然清晰可辨、以及一个追踪既有手部动作的玻璃球。

你的短视频素材基本没问题。时机、机位和表情都到位。但一个帽子颜色、背景道具或特效却破坏了整个营销活动。重拍耗费时间;生成一个新片段则要求模型重新猜测整个表演过程。

Gemini Omni 1.1 Flash 视频编辑在将原始片段视为约束、然后只更改一个商业变量时非常有用。上传一段不超过 10 秒、已获授权的片段,说明要做的更改,说明保留契约,并在输出进入任何营销活动之前检查结果。

本指南使用三组评审对比:每次拍手时更换帽子的案例、一群人变成火烈鸟但走位仍清晰可读的案例,以及玻璃球跟随既有手部动作的案例。它们让验收标准变得具体。目标不是神奇的编辑按钮,而是一种可重复的方法,用于决定保留什么、更改什么以及何时拒绝结果。

核心要点

  • 从 5 秒的单镜头片段开始,只更改一个变量。
  • 在保留指令之前加上 Change only
  • 逐帧检查拍手、行走或手部事件。
  • 将对话、口型同步、品牌文字和原始声音作为独立的检查项。
  • 只使用自己拥有或明确获准编辑的片段。

开场动作参考:用于引入案例 1 中时机与保留评审的完整换帽片段。

为什么 Gemini Omni 1.1 Flash 视频编辑在没有约束时会失败

文生视频从空白时间线开始,模型必须推断表演者、镜头、运镜路径、灯光、空间和动作。而视频编辑启动时,这些决策已经呈现在画面中。这就是为什么现有片段能成为比一段文字描述更强大的创意简报。

Gemini Omni 1.1 Flash 使用 GA 模型 ID gemini-omni-1.1-flash。Google 通过其 Interactions API 记录了上传视频编辑、短视频延长和有状态的后续编辑功能。上传视频编辑并非在所有地区都可用,且上传的编辑或延长功能仅限于 10 秒或更短的源视频(Google Gemini API 文档)。

实际的区别在于克制。像"让它变得更好"这样的提示词等于允许系统重新诠释一切。而保留契约则给它一项狭窄的任务:

plaintext
1Change only: [one element].
2Keep everything else the same.
3Preserve: subject identity, action timing, camera framing, lighting, background, and original audio where possible.
4No new dialogue, no new text, no extra sound effects.

这样的措辞仍然无法保证完美结果,但它能在运行之前让验收标准变得可见。如果你把自行车改成直升机,主体的运动机制和镜头隐含的物理规律可能都需要重建。如果你更换帽子、产品颜色或一个 VFX 物体,原始动作会给模型一条更清晰的路径。

声音和嘴部动作需要单独谨慎对待。Gemini Omni 1.1 Flash 可以生成带音频的视频,但不要假设上传的说话片段会保留其精确的对话、口型同步或可用的背景声。先运行一个无声或非说话的测试。在关键情况下单独保留原始音频,然后在后期制作中决定编辑后的画面和源音轨是否仍然匹配。

长片段、硬切、密集字幕,以及同时改变人物、动作、服装、场景和机位的提示词,都会扩大失败的可能性。更安全的生产规则很简单:先制作一个低于 10 秒上传限制的单镜头测试,确认保留效果后,再进行下一个单一改动。

工作流程、模型与可用性

下面的三组评审使用 Atlas Cloud 作为基于浏览器的视频编辑工作流入口。将源片段、提示词、输出和评审放在同一个浏览器标签页中,这样操作者无需在独立的编辑链路中移动文件,即可比较原始片段和完成后的片段。

    
模型与任务在本指南中的用途可用性检查何时选择
Gemini Omni 1.1 Flash 视频编辑上传短视频片段并更改一个元素在运行前验证实时页面、账户和地区你已经拥有所需的动作和构图

在付费生产运行之前,立即查看 Atlas Cloud 模型列表,因为价格、分辨率选项和可用性可能会变化。

    
阶段输入唯一允许的变量审批点
1. 片段审计5 秒已授权源片段人物、动作、画面和音频是否值得保留?
2. 编辑运行源片段加一条编辑提示词一个物体、外观或效果请求的改动是否在正确的时刻出现?
3. 保留检查原始片段和输出面部、手部、背景、时机、文字或声音是否出现漂移?
4. 发布决策已批准的输出只重试一个变量,或移交给常规后期制作

实时页面是费率、输出控制和可用性的权威来源。将首次运行视为测试预算而非成片广告预算,并单独规划人工评审、素材筛选、源片段授权和常规编辑。

对于已获批准的首个结果,Gemini 的有状态工作流可以将视频上下文带入后续指令中。这使第二次的窄范围编辑比重新从空白提示词开始更容易评估。但这并不能免除将新输出作为独立资产进行评审的需要:每次编辑仍可能在面部、手部、反射、声音或背景细节中引入漂移。

如何使用 Gemini Omni 1.1 Flash 编辑视频:3 次可复现的运行

第 1 步:准备一段能经得起编辑的片段

选择一段自己拥有或已获授权的 5 秒竖屏片段,且为单一连续镜头。表演者不应在说重要的对话。保持动作简单清晰:一次拍手、一小群人行走,或张开的手在纹理表面上移动。避免剪辑点、密集字幕、大 logo 的服装以及快速的手部遮挡。

这个准备步骤不会运行模型,因此没有可展示的"已完成"面板。对于快速案例测试,使用 9:16 比例、720p 分辨率。在为最终交付物使用 1080p 或 4K 之前,请先查看当前模型页面,并在任何编辑运行之前保留一份干净的源副本。

第 2 步:案例 1,每次拍手时更换帽子

在 Gemini Omni 1.1 Flash 视频编辑页面上传准备好的片段。这个测试改动一个小的服装细节,而表演、构图、日光和背景则作为保留契约。把编辑请求放在前面,然后逐一列出必须保留的每个部分。

plaintext
1Use the uploaded video as the motion, timing, camera, and performance reference.
2
3Change only the cap worn by the person. At each hand clap, replace it with a different fashionable cap: first cobalt blue, then warm orange, then forest green. The change must happen exactly on the clap.
4
5Keep everything else the same: the same person, face, hairstyle, body movement, clothing, hands, background, framing, daylight, camera motion, and clip duration. Preserve the original audio if possible. No dialogue, no subtitles, no logos, no extra sound effects, and no other wardrobe changes.

选择实时页面可用的时长、宽高比和分辨率。在修改提示词之前先运行一次。下面的评审对比用于让身份、时机和保留检查具体化;不要将其视为对特定账户或地区的可用性保证。

01-case-one-before-after.gif

并排对比的视频编辑换帽评审

左:源片段。右:第一次编辑捕捉到了拍手,但改变了人物,因此应因身份漂移而拒绝。

仔细检查拍手的关键帧。帽子应该在节拍上变化,同时面部、手部、衬衫、街道和镜头重心保持连贯。拒绝那种通过悄悄改写人物或场景来"升级"帽子的输出。

第 3 步:案例 2,把一群人变成火烈鸟

使用一段已获授权的 5 秒片段,内容为 2 或 3 人站立或行走。这是一个替换测试,不是身份保留声明。有用的问题是:在每个人都变成火烈鸟之后,群体的位置、步速、影子和镜头运动是否仍然传达出原始的走位。

plaintext
1Transform every person in the uploaded shot into a pink flamingo wearing the same outfit silhouette and colors as the original person.
2
3Keep the original positions, walking pace, body direction, camera movement, composition, pavement, shadows, daylight, and clip duration the same. Preserve the timing of each movement. Do not add people, text, logos, dialogue, or new background objects.

选择实时页面可用的时长、宽高比和分辨率。不要添加"让它更有电影感"或新的场景设定。这些是独立的变量,会让这次评估更难判断。

02-case-two-before-after.gif

并排对比的视频编辑人物变火烈鸟评审

左:原始群体。右:火烈鸟编辑保留了三个位置、步速、影子和镜头运动。

第 4 步:案例 3,添加一个会反应的玻璃球

使用一段 5 秒片段:张开的手掌在日光下横向移动。避免手指快速交叉的特写。特效应该响应已经存在的动作,这样评审可以专注于接触时机、反射方向以及人物是否被未经许可地改变。

plaintext
1Add one small clear glass orb hovering 10 centimeters above the open palm. The orb should gently follow the hand, reflect the checkerboard pavement and daylight, and make a subtle ripple of light when the hand closes.
2
3Keep everything else the same: the same hand, skin tone, clothing, arm motion, background, camera framing, camera movement, daylight direction, and clip duration. Do not alter the person. No text, no dialogue, no extra objects, and no extra sound effects.

选择实时页面可用的时长、宽高比和分辨率。保持提示词聚焦。Google 文档将上传视频编辑描述为一种在源视频上下文中应用自然语言修改的方式,因此这个案例是对时机和场景感知反射的有用测试,而非背景替换练习(Google Gemini API 文档)。

03-case-three-before-after.gif

并排对比的视频编辑玻璃球反应评审

左:原始手部动作。右:玻璃球跟随手部运动,而人物、温室和镜头保持稳定。

第 5 步:接受、拒绝或重试

不要仅凭一帧好看的画面就批准片段。从原始片段和输出制作一个联系表,然后与负责创意决策的同一人逐项检查。看似成功的特效往往正是在这里无法满足实际营销简报的要求。

   
检查项接受条件重试条件
编辑时机请求的物体或特效在指定的事件时刻出现出现得太早、太晚或保持静止
保留效果面部、手部、服装、光线和画面保持可信无关的元素发生了变化
场景完整性没有出现未被要求的文字、标志、对话或物体出现了任何新的品牌风险元素
音频源音轨在评审后仍然可用语音、同步或声音变化会产生影响
安全与适配结果获准用于目标渠道策略阻止或可见伪影需要更窄范围的重试

如果一次运行失败,就缩小下一次尝试的范围。不要在较弱的第一版结果上叠加新背景、新服装和新动作。保留已获批准的源片段,只提出一项修正后的更改请求。对于声音至关重要的营销活动,考虑保留未经编辑的源音轨,并在编辑者确认同步后再使用视觉编辑。

真实营销片段的变体应用

同样的一次只改一个变量的原则也适用于短视频营销素材。当原始动作本身已经承载了故事,且改动容易被观众识别时,效果最佳。重点在于创建可用的变体,而不是让每个版本都更复杂。

产品变体测试。 保持开箱动作和机位不变,只更改产品颜色或包装处理方式。这让营销团队无需重拍手部动作即可比较不同创意方向。将印刷标签文字视为常规后期制作任务,而不是生成视频的承诺。

场景清理。 在保留人物和灯光的同时,移除一个分散注意力的背景物体。杂乱的桌面、散落的包或单个标志是比完全更换场景更好的首次尝试。Google Workspace 描述了相关的商业用途,包括背景清理和更改视频中产品的外观(Google Workspace 博客,2026 年 5 月)。

活动本地化。 使用经过验证的视觉替代物(例如一个获准的道具颜色),同时保持活动素材和节奏不变。之后使用常规编辑工具添加屏幕文字、法律声明和旁白。生成式视频可能对视觉变体很有价值,但不应成为必需文字或合规信息的唯一来源。

如果你没有视频素材,但有已获批准的产品主图,可以从一个独立的图生视频工作流开始。它不属于上述上传视频编辑工作流。将其首次输出视为新的源片段,然后在请求修改之前应用相同的审计和保留规则。

输出限制与制作规划

编辑成本不是完成一条营销活动片段的成本。实时模型页面提供当前运行价格,但重试、评审时间、源片段授权和最终精修仍然属于制作计划的一部分。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

  
规划问题决策规则
源片段是否可编辑?确认它是已获授权的、10 秒或更短的单镜头片段。
什么可以更改?指定一个物体、属性或效果。
什么必须保持不变?明确身份、动作时机、镜头、灯光、背景、文字和音频预期。
该途径是否可用?在运行前立即检查实时视频编辑页面、账户和地区可用性。

Google 当前文档描述了原生多模态视频生成和编辑,包括有状态编辑和受地区限制的上传视频编辑。其实现指南将用于编辑或延长的上传视频限制为 10 秒或更短;生产前请查看实时模型页面,确认当前的输入、输出、分辨率和地区限制。

对于实际工作的团队来说,短视频源片段是一个优势。它让单个动作清晰可读,使逐帧检查切实可行,并限制了模型必须保留的素材量。从实时页面上可接受的最低配置开始验证创意方向。只有在时机和保留检查通过后,才以可用的最终分辨率重新运行。这样的流程让 Gemini Omni 1.1 Flash 视频编辑更容易预算,也更容易向审批人解释。

法律与安全注意事项

使用你自己拍摄的素材、团队拥有的素材,或明确书面授权的素材。一段短视频仍然涉及个人肖像、地点、产品展示,有时还涉及雇佣或广告声明。在上传之前确认权利,而不是在看到效果不错的编辑之后。

避免模拟真实人物、出现名人或政治人物、使用未成年人,或将敏感的职业身份变成视觉玩笑。不要制作具有误导性的类似新闻的素材。如果输出将用于广告或公开社交媒体帖子,请遵守相关的当地法律、平台规则和品牌的披露要求。

Google 表示 Omni 输出带有 SynthID。这个溯源信号不能替代版权许可、同意、商标审查或广告合规。将其视为负责任使用的一部分,与源日志和编辑者批准记录一起使用。

常见问题

它可以编辑现有视频吗?

可以。你可以提供一段短视频作为参考输入,并描述要替换或添加的元素。从 5 秒的单镜头源片段和一个更改请求开始,这样你就能判断原始动作和画面是否得到保留。

如何防止它改变一切?

先写 Change only,然后列出必须保持不变的内容。明确人物、动作时机、镜头画面、灯光、背景、时长、文字和音频预期。每次尝试只更改一个物体、外观或效果。

它能保留原始声音和对话吗?

不要将声音或口型同步的保留视为理所当然。先测试一小段样本。如果原始声音很重要,请单独保留源音轨,并在发布前在常规时间线中确认合并编辑的效果。

我应该使用多长的视频?

首次 Gemini Omni 1.1 Flash 视频编辑测试使用 10 秒或更短的单一镜头源片段。在最终运行前确认当前官方的输入、输出和地区限制,因为这些参数可能会变化。

Gemini Omni 1.1 Flash 视频编辑在 Atlas Cloud 上的费用是多少?

查看实时模型页面获取当前费率,因为账户条款和可用性可能会变化。为单独的重试和人工评审预留预算。

最新模型

一个 API,畅享全模态 AI。

探索全部模型