一個成人在無聲、固定攝影機的片段中拍了三下掌。每次拍掌後,只有帽子改變。表演者、夾克、房間、光線和節奏都保持不變。這就是開發者正在用 gemini omni flash 1.1 api 測試的實際承諾。
困難之處不在於送出單一影片請求,而在於把「只改變這一個項目」轉換成正確的輸入模式、一份有足夠約束的提示詞,以及一個允許迭代的預算。以下三個建置著重於這個交接:事件時間點帽子剪輯、單一物體材質剪輯,以及純文字物理序列。
Gemini Omni 1.1 Flash 是 Google 目前已可投入生產的影片生成更新。它支援文字、影像和上傳影片輸入,而 Interactions API 可透過先前的 interaction ID 支援迭代狀態。其文件所列的輸出控制包括 360p、720p、1080p 和 4K,具 16:9 或 9:16 取景(Google Gemini Omni 文件,2026 年 9 月)。
重點摘要
- 穩定的 Google 模型 ID:
gemini-omni-1.1-flash。- 在撰寫提示詞之前先選擇輸入路徑。
- 保留參考編輯用的來源片段在 10 秒或以內。
- 把重要對話視為獨立的音訊核准任務。
為什麼 Gemini Omni Flash 1.1 API 備受關注,以及為什麼首次執行會失敗
Omni 1.1 之所以受到關注,是因為它同時具備生成、編輯和延續控制。Google 表示這項更新可以 10 秒為增量將場景延長至 40 秒、在第一幀和最後一幀之間插值、製作 360p 預覽,並升頻至 4K(Google Omni 1.1 公告,2026 年 8 月)。這些控制對正在建立編輯器、創意 SaaS 或短影音行銷工具的產品團隊來說很重要。
首次執行常因更簡單的原因失敗:
- 文字轉影片路徑被要求保留現有的表演。
- 編輯要求加入新物件,卻沒有清楚的參考或具體的視覺描述。
- 一個提示詞同時改變了演員、攝影機、服裝、場景和物件。
- 過長的來源片段掩蓋了觸發編輯的準確節拍。
先決定哪些項目必須保持不變。以帽子案例來說,表演者、攝影機、房間、夾克、陰影和拍掌節奏都是不變項;帽子是唯一改變的變數。泡泡雕塑案例使用相同概念,但鎖定創作者和窗光,只改變一個物件的材質。
視覺連續性和音訊連續性需要不同的驗收檢查。一位 Reddit 使用者描述,輸出在剪輯後改寫了談話片段的語音和內容(社群回報,2026 年 7 月)。該回報是軼事,但仍是有用的製作原則:如果對話、音樂或法律核准取決於原始音軌,請另外保留並處理原始音訊。不要只因畫面看起來正確,就核准生成式視覺剪輯。
Gemini Omni Flash 1.1 API 工作流程:選擇正確的輸入、模型和成本
選擇已包含所需資訊的輸入。文字轉影片適合新場景;影像轉影片適合經過美術指導的起始外觀;參考影片轉影片適合需要在嚴格範圍內變更的來源表演。在 Atlas Cloud 上,團隊可以在一個瀏覽器分頁中開啟相關的 Developer 模型路徑、比較輸入模式,並透過 Atlas Cloud 保留共同的原型工作流程。
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| 路徑 | 首次執行時帶入 | 最適合 | 常見的首次執行錯誤 | 本文案例 | 公開起始費率* |
| Text-to-Video Developer | 文字提示詞 | 新的連續場景 | 試圖重現特定來源表演 | 魯布·戈德堡 | $0.112/秒 |
| Image-to-Video Developer | 1-7 張參考影像 | 將明確的外觀或主體動畫化 | 提供不一致的參考影像 | 選用變化 | $0.112/秒 |
| Reference-to-Video Developer | 1 段來源影片加上最多 5 張影像 | 在編輯受限細節時保留動作 | 傳入超過 10 秒的修剪片段 | 帽子和泡泡 | $0.120/秒 |
公開起始費率是於 2026 年 9 月 1 日針對 Models All 列表核對。解析度、時長和結帳細節可能變動,因此請在發佈預算前確認相關模型頁面。8 秒估算值為費率 × 8,並非通用的價格承諾。
對於以影像為主導的變化,Image-to-Video Developer 路徑接受 1-7 張影像參考。reference-to-video 架構接受一段來源片段加上最多五張影像;其修剪後的來源片段不得超過 10 秒。只有在找到值得迭代的分支後,才使用固定種子。
Google SDK 的便捷輸出是 output_video。原始 REST 回應則將影片內容放在 steps 陣列中。這個差異可避免常見的整合錯誤。
plaintext1import { GoogleGenAI } from '@google/genai'; 2import fs from 'node:fs'; 3 4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY }); 5const interaction = await ai.interactions.create({ 6 model: 'gemini-omni-1.1-flash', 7 input: 'A polished steel marble triggers a tabletop chain reaction.', 8 response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' } 9}); 10 11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext1{ 2 "model": "gemini-omni-1.1-flash", 3 "input": "A polished steel marble triggers a tabletop chain reaction.", 4 "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" } 5}
步驟 1:Gemini Omni Flash 1.1 API 影片剪輯,在節拍上更換帽子
使用一段無聲、已取得權限的 10 秒來源片段,內含一位成人表演者、固定的 16:9 攝影機,以及三次清楚的拍掌。上傳來源片段、其第一幀,以及三張清楚的帽子參考。此路徑請使用 Reference-to-Video Developer 遊樂場。
plaintext1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.
選擇來源修剪 0-10s、16:9、4K,且僅在之後需要受控重試時才使用固定種子。一次只變更一個變數。如果帽子偏移,請先簡化變更,再加上更強的參考。
Gemini Omni Flash 帽子變更案例關鍵幀
案例 1 靜止畫面。所選的清晰幀顯示第三次拍掌後的紅色棒球帽,而表演者、房間和攝影機保持穩定。
Gemini Omni Flash 帽子變更動作案例
案例 1 動作測試。在 10 秒片段中,三次分開的拍掌觸發毛帽、寬邊帽和紅帽狀態,且全程為單一連續棚內鏡頭。
步驟 2:Gemini Omni Flash 1.1 API 影片剪輯,轉換單一物件
使用另一段無聲的 10 秒來源片段:一名成人在窗邊慢慢轉動一個小型幾何陶瓷雕塑。上傳來源影片及其第一幀。輸入保持簡單,讓材質轉換只負責一項工作。
plaintext1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.
選擇來源修剪 0-10s、16:9、4K,並採用與步驟 1 相同的固定種子工作流程。檢查兩秒轉換點和最後一秒的物件邊緣。這些時刻會揭露模型是否改變了超出指定物件的內容。
Gemini Omni Flash 泡泡雕塑案例關鍵幀
案例 2 靜止畫面。泡泡叢集完全成形,同時藝術家轉動的雙手、工作桌和窗光仍然清晰可辨。
Gemini Omni Flash 泡泡雕塑動作案例
案例 2 動作測試。幾何雕塑在要求的節拍變成半透明泡泡叢集,同時攝影機在陽光灑落的棚內向側邊漂移。
步驟 3:Gemini Omni Flash 1.1 API 文字轉影片,測試連續物理序列
對於新場景,請先只使用文字。這樣可以隔離模型的時間點、物件關係和攝影機指令。使用 Text-to-Video Developer 模型執行 8 秒、16:9、4K 的運作。只有在輸出值得重新檢視之後,才固定種子。
plaintext1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.
檢查實際的連鎖反應,而不是只看一個吸引人的幀。如果彈珠漏掉一個接觸點,請縮短序列或移除一個依賴關係。可靠的 5 個事件連鎖比一個塞滿、無法判讀機械動作的序列更適合做產品示範。
Gemini Omni Flash 魯布·戈德堡案例關鍵幀
案例 3 靜止畫面。所選的結束幀顯示打開的紙花和完成的桌上連鎖反應。
Gemini Omni Flash 文字轉影片魯布·戈德堡連鎖反應 GIF
案例 3 動作測試。彈珠啟動骨牌,接著是槓桿和鈴鐺,最後幾秒花朵打開。攝影機向側邊移動以揭示每個階段,而不是單純推進。
Gemini Omni Flash 1.1 API 變化:安全地延伸、插值和迭代
使用延伸和插值來解決特定的連續性問題,而不是用來逃避清楚的第一遍。Google 描述 Omni 1.1 可以 10 秒為增量延伸至累計 40 秒,並提供起始/結束幀控制。Google 也回報,在其自身的吞吐量比較中,360p 草稿最多可快 60%,且成本約為標準 720p 層級的三分之一。這些是 Google 的測試條件,不是平台範圍的速度保證。
採用兩遍流程:
- 在實際可用的低草稿解析度下驗證動作邏輯。
- 每次重試只變更一個變數:帽子、泡泡材質或一句攝影機描述。
- 只有當動作看起來正確之後,才以目標解析度生成發佈素材。
先寫保留約束:preserve the same performer, camera, room, and timing。然後指定唯一的轉換。若是連續鏡頭,請註明 one continuous shot, no cuts。若是完整的轉場,請提供刻意的第一幀和最後一幀,而不是要求模型從一句鬆散描述推斷兩個端點。
Gemini Omni Flash 1.1 API 成本、權利與製作護欄
把工作視為一連串決策來編列預算,而不是無上限的「再產生一次」按鈕。在以上公開起始費率下,一次 8 秒文字執行約為 $0.896,一次 8 秒參考編輯約為 $0.960。因此,三次嘗試的預算在魯布·戈德堡案例約為 $2.688,任一參考編輯案例約為 $2.880,前提是套用較高解析度費率或不同產品 SKU 之前。
在內部規劃中,將 API 帳單、產品頁面結帳定價和社群或帳戶配額分開。在購買或發佈前,請確認所選路徑目前的分辨率和時長價格。本文刻意不把起始費率列表變成永久的 4K 報價。
只使用你有權上傳的影片和參考影像。取得可辨識人物的許可、保留提示詞和來源記錄,並在觀眾可能誤認為紀實畫面的地方標示生成內容。在獨立的核准流程中審查對話、音樂、商標和肖像。這些護欄與 Gemini Omni Flash 1.1 API 提示詞中的 preserve 子句同樣重要。
Gemini Omni Flash 1.1 API 常見問題
穩定的 Gemini Omni Flash 1.1 API 模型 ID 是什麼?
Google 目前的穩定模型 ID 是 gemini-omni-1.1-flash。實作時請使用當前的模型文件,因為模型別名和預覽可用性可能變動。
gemini-omni-flash-preview 是否正在淘汰?
請將預覽名稱視為獨立的發行軌道。在固定用於生產環境前,請確認 Google 模型文件中的目前淘汰通知;當穩定 ID 符合所需能力時,請使用穩定 ID。
Gemini Omni Flash 1.1 可以編輯現有影片嗎?
可以。文件中的工作流程會透過 Files API 上傳影片,並提供編輯指令。請保持來源片段簡短,並明確指出所有必須保持不變的元素。
Gemini Omni Flash 1.1 API 影片可以多長?
標準生成範例涵蓋短片,而 Omni 1.1 可以 10 秒為增量延伸至累計 40 秒。在目前文件記載的 Developer 路徑上,Atlas reference-to-video 來源修剪必須為 10 秒或更短。
它能保留對話和原始音軌嗎?
請使用視覺保留指令,然後獨立驗證音訊。對於確切對話或音樂很重要的片段,請在後期製作中使用已核准的原始音軌,而不是把生成輸出視為自動音訊母帶。
Gemini Omni Flash 1.1 API 費用是多少?
費用取決於路徑、時長、解析度和帳單介面。對於 Gemini Omni Flash 1.1 API 工作流程,請以秒數 × 目前顯示的路徑費率計算,然後為任何動作關鍵鏡頭保留至少 3 次嘗試。






