MiniMax H3 Developer 现已上线 — 官方定价 4 折,低至 $0.02/秒

Gemini Omni Flash 1.1 API:首次生产运行前需测试的3个视频构建

本文介绍在首次生产运行 Gemini Omni Flash 1.1 API 之前,需要测试的 3 种视频构建方案。 元标题:Gemini Omni Flash 1.1 API:首次生产运行前需测试的 3 种视频构建方案 元描述:使用 Gemini Omni Flash 1.1 API 构建、编辑和扩展视频。

在一个无声、固定机位的片段中,一名成人拍了三下手。每次拍手后,只有帽子发生变化。表演者、夹克、房间、光线和节奏都保持不变。这就是开发者正在用 gemini omni flash 1.1 api 测试的实际能力。

难点不在于发送一次视频请求,而在于把“只改这一处”落实到正确的输入模式、一条约束足够的提示词,以及一个留有迭代空间的预算。下面的三个构建重点都在这个交接过程上:一个按事件定时的帽子编辑、一个单物体材质编辑,以及一个纯文本物理序列。

Gemini Omni 1.1 Flash 是 Google 面向生产环境的视频生成更新。它支持文本、图像和上传视频输入,同时 Interactions API 通过先前的交互 ID 支持迭代状态。其文档化的输出控制包括 360p、720p、1080p 和 4K,以及 16:9 或 9:16 画幅(Google Gemini Omni 文档,2026 年 9 月)。

关键要点

  • 稳定的 Google 模型 ID:gemini-omni-1.1-flash
  • 写提示词之前先选择输入路径。
  • 参考编辑的源片段保持在 10 秒以内。
  • 将重要对话视为独立的音频审批任务。

为什么 Gemini Omni Flash 1.1 API 很热门,以及为什么首次运行会失败

Omni 1.1 之所以备受关注,是因为它将生成、编辑和续写控制结合在一起。Google 表示,该更新可以以 10 秒为增量将场景扩展到 40 秒,在首帧和尾帧之间插值,生成 360p 预览,并升级到 4K(Google Omni 1.1 公告,2026 年 8 月)。这些控制对构建编辑器、创意 SaaS 或短视频营销工具的产品团队来说很重要。

首次运行往往因更简单的原因而失败:

  • 使用文生视频路径,却要求保留现有表演。
  • 编辑要求添加新物体,但没有清晰的参考或具体的视觉描述。
  • 一个提示词同时更改了演员、摄像机、服装、场景和物体。
  • 长源片段掩盖了应触发编辑的确切节拍。

首先决定哪些必须保持不变。在帽子案例中,表演者、摄像机、房间、夹克、阴影和拍手时机是不变量。帽子是唯一改变的变量。气泡雕塑案例使用同样的思路,但在改变一个物体的材质时锁定创作者和窗光。

视觉连续性和音频连续性需要不同的验收检查。一位 Reddit 用户描述了编辑后输出重写了人物对镜讲述片段的对白和上下文(社区报告,2026 年 7 月)。该报告属于个例,但它是实用的生产规则:如果对话、音乐或法律审批依赖于原始音轨,请单独保留并处理原始音频。不要只因为画面看起来正确就批准生成式视觉编辑。

Gemini Omni Flash 1.1 API 工作流:选择正确的输入、模型和成本

选择已经包含所需信息的输入。文生视频用于新场景。图生视频用于经过艺术指导的起始外观。参考视频用于需要严格受限变更的源表演。在 Atlas Cloud 上,团队可以在一个浏览器标签页中打开相关的 Developer 模型路径,比较输入模式,并通过 Atlas Cloud 保留通用的原型工作流。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

      
路径首次运行需要准备最佳适用场景常见首次运行错误文章案例公开起始费率*
Text-to-Video Developer文本提示词新的连续场景试图复现特定的源表演Rube Goldberg$0.112/秒
Image-to-Video Developer1-7 张参考图像为已定义的外观或主体制作动画提供不一致的参考图像可选变体$0.112/秒
Reference-to-Video Developer1 个源视频外加最多 5 张图像在编辑有界限的细节时保留动作传递超过 10 秒的裁剪片段帽子和气泡$0.120/秒

公开起始费率基于 2026 年 9 月 1 日的 Models All 列表检查。分辨率、时长和结算细节可能会变化,因此请在制定发布预算前确认相关模型页面。8 秒估算是费率 × 8,不是普遍的价格承诺。

对于以图像为主导的变体,Image-to-Video Developer 路径接受 1-7 张参考图像。Reference-to-Video 的 schema 接受一个源片段外加最多五张图像;其裁剪后的源片段不得超过 10 秒。只有在找到值得迭代的分支之后,才使用固定随机种子。

Google SDK 的便捷输出是 output_video。而原始 REST 响应则将视频内容放在 steps 数组中。这个区别可以避免一个常见的集成错误。

plaintext
1import { GoogleGenAI } from '@google/genai';
2import fs from 'node:fs';
3
4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
5const interaction = await ai.interactions.create({
6  model: 'gemini-omni-1.1-flash',
7  input: 'A polished steel marble triggers a tabletop chain reaction.',
8  response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' }
9});
10
11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext
1{
2  "model": "gemini-omni-1.1-flash",
3  "input": "A polished steel marble triggers a tabletop chain reaction.",
4  "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" }
5}

步骤 1:Gemini Omni Flash 1.1 API 视频编辑——按节拍换帽子

使用一段无声、版权已授权的 10 秒源片段,其中包含一名成人表演者、一个固定的 16:9 摄像机以及三下清晰的拍手。上传源片段、它的首帧以及三张清晰的帽子参考图。对于此路径,请使用 Reference-to-Video Developer playground

plaintext
1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.

选择源裁剪 0-10s、16:9、4K,并且仅在之后需要受控重试时才使用固定随机种子。一次只运行一个变量。如果帽子发生偏移,先简化更改,再添加更强的参考。

Gemini Omni Flash 换帽案例关键帧

案例 1 静帧。所选清晰帧显示了第三次拍手后的最终红色棒球帽,而表演者、房间和摄像机保持稳定。

Gemini Omni Flash 换帽案例动态测试

案例 1 动态测试。在 10 秒片段中,分离的三次拍手在同一个连续的演播室镜头中依次触发毛线帽、宽檐帽和红色棒球帽状态。

步骤 2:Gemini Omni Flash 1.1 API 视频编辑——变换一个物体

使用一段不同的无声 10 秒源:一名成人在窗边转动一个小型几何陶瓷雕塑。上传源视频及其首帧。输入保持简单,以便材质变换只需专注于一件事。

plaintext
1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.

选择源裁剪 0-10s、16:9、4K,并使用与步骤 1 相同的固定随机种子工作流。检查两秒过渡处和最后一秒的物体边缘。这些时刻会暴露模型是否更改了超出请求物体的内容。

Gemini Omni Flash 气泡雕塑案例关键帧

案例 2 静帧。气泡簇完全成形,同时艺术家的旋转双手、工作台和窗光依然清晰可辨。

Gemini Omni Flash 气泡雕塑案例动态测试

案例 2 动态测试。几何雕塑在指定节拍处变为半透明气泡簇,同时摄像机在阳光照射的演播室中横向移动。

步骤 3:Gemini Omni Flash 1.1 API 文生视频——测试连续物理序列

对于新场景,从纯文本开始。这样可以单独测试模型的时序、物体关系和摄像机指令。使用 Text-to-Video Developer 模型进行 8 秒、16:9、4K 的运行。只有在得到值得回看的输出后,才固定随机种子。

plaintext
1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.

检查实际的链条,而不是单个好看的画面。如果大理石错过了某个接触点,就缩短序列或移除一个依赖。一个可靠的 5 事件链条,其机制一目了然,比一个拥挤但无法看清机制的序列更有产品演示力。

Gemini Omni Flash Rube Goldberg 案例关键帧

案例 3 静帧。所选结束帧展示了打开的纸花和完成的桌面链条。

Gemini Omni Flash 文生视频 Rube Goldberg 连锁反应 GIF

案例 3 动态测试。大理石启动多米诺骨牌,然后是杠杆和铃铛,最后几秒纸花打开。摄像机横向移动以展示每个阶段,而不是简单地推进。

Gemini Omni Flash 1.1 API 变体:安全地扩展、插值和迭代

使用扩展和插值来解决特定的连续性问题,而不是为了避免清晰的首次生成。Google 描述了 Omni 1.1 中 10 秒扩展至累计 40 秒以及起止帧控制。它还报告称,在其自身的吞吐量对比中,360p 草稿的速度最高可提升 60%,成本仅为标准 720p 层级的三分之一。这些是 Google 的测试条件,不是平台范围内的速度保证。

采用两遍式流程:

  1. 在确实可用的低草稿分辨率下验证运动逻辑。
  2. 每次重试只改变一个变量:帽子、气泡材质或一句摄像机描述。
  3. 只有在动作表现正确之后,才以目标分辨率生成发布资产。

先写保留约束:preserve the same performer, camera, room, and timing。然后指定唯一的变换。对于连续镜头,明确写出 one continuous shot, no cuts。对于端到端过渡,提供有明确意图的首帧和尾帧,而不是让模型从笼统的句子中推断两个端点。

Gemini Omni Flash 1.1 API 成本、版权和生产护栏

将工作预算是为一系列决策,而不是无限制的“重新生成”按钮。按照上面显示的公开起始费率,一次 8 秒文本运行约为 $0.896,一次 8 秒参考编辑约为 $0.960。因此,在更高分辨率费率或不同产品 SKU 适用之前,Rube Goldberg 案例的三次尝试预算约为 $2.688,任一参考编辑案例约为 $2.880。

在内部规划中,将 API 计费、产品页结算价格以及社区或账户配额分开。在购买或发布之前,检查所选路径当前的分辨率和时长价格。本文刻意不将起始费率列表变成永久的 4K 报价。

只使用你有权上传的视频和参考图像。获得可识别人物的许可,保留提示词和源记录,并在观众可能将其误认为纪实影像的地方标注生成材料。在独立的审批流程中审查对话、音乐、商标和肖像。这些护栏与 Gemini Omni Flash 1.1 API 提示词中的 preserve 子句同样重要。

Gemini Omni Flash 1.1 API 常见问题

Gemini Omni Flash 1.1 API 的稳定模型 ID 是什么?

Google 当前的稳定模型 ID 是 gemini-omni-1.1-flash。在实施时使用当前模型文档,因为模型别名和预览可用性可能会变化。

gemini-omni-flash-preview 是否已被弃用?

将预览名称视为单独的发布轨道。在生产环境中固定使用之前,先确认 Google 模型文档中的当前弃用通知;当稳定 ID 符合你所需能力时,再使用稳定 ID。

Gemini Omni Flash 1.1 可以编辑现有视频吗?

可以。文档化的工作流通过 Files API 上传视频,并提供编辑指令。保持源片段简短,并说明所有必须保持不变的元素。

Gemini Omni Flash 1.1 API 视频最长可以多长?

标准生成示例覆盖短视频,而 Omni 1.1 可以以 10 秒为增量扩展到累计 40 秒。在当前文档化的 Developer 路径上,Atlas 的 reference-to-video 源裁剪必须为 10 秒或更短。

它能保留对话和原始音轨吗?

使用视觉保留指令,然后独立验证音频。对于对白或音乐需要精确的片段,请在后期制作中保留已批准的原始音轨,而不是将生成输出视为自动音频母带。

Gemini Omni Flash 1.1 API 的费用是多少?

费用取决于路径、时长、分辨率和计费渠道。对于 Gemini Omni Flash 1.1 API 工作流,按秒数 × 当前显示的路径费率计算,然后为任何运动关键镜头预留至少 3 次尝试。

最新模型

一个 API,畅享全模态 AI。

探索全部模型