MiniMax H3 Developer 現已上線 — 官方定價 4 折,低至 $0.02/秒

Gemini Omni Flash:讓每段影片接續都像一鏡到底

這篇文章說明如何讓 Gemini Omni Flash 的每個影片續接都像一鏡到底。杯子擺對了,演員演對了,雨也下得恰到好處。更長的提示詞並不能保證那個鏡頭。

您終於拍了一支滿意的10秒產品鏡頭。杯子對了、演員對了、雨也恰到好處。接著就是冒險的一按。更長的提示詞並不能保護這個鏡頭,受控的下一拍才能。

Gemini Omni Flash 1.1 影片延伸 在支援的 Gemini API 工作流程中,每次可追加 3 到 10 秒,累計最長可達 40 秒。把它當作一條鏈:先確認一個 10 秒的錨定鏡頭,然後每次延伸只指定一個可觀察的事件。

這樣一來,剪輯師、社群團隊和開發人員可以在每個片段之後檢查接點,避免手部漂移、道具移位、臉部變形、光線方向改變或聲音底層跑掉,最後變成昂貴的意外。

Gemini Omni Flash 1.1 影片延伸:重點摘要

  • 單次輸出為 3 到 10 秒。
  • 延伸會在尾端追加,總長度最多 40 秒。
  • 保留已確認的錨定鏡頭,然後加入一個新拍。
  • 在再次延伸前,先檢查接合處。
  • UI 存取可能落後於 API 功能。

Gemini Omni Flash 1.1 影片延伸:值得測試的連貫性案例

理想的成果是一段連貫的序列,而不是一段更長的孤立片段。以雨中的咖啡廣告為例,請在每個接點檢查杯子、炭灰色圍裙、門口位置、陰天光線和攝影機高度。

01-gemini-omni-coffee-continuity.gif

Gemini Omni 1.1 Flash 連貫性案例:一位咖啡師和同一個霧面黑色咖啡杯,從雨窗建立鏡頭,經過室內跟拍鏡頭,最後到低角度門口視角

以 Google Gemini Omni 1.1 Flash 文字轉影片於 720p 解析度產生的真實 10 秒測試環境輸出。此序列保留了咖啡師、炭灰色圍裙、咖啡杯、雨水和咖啡廳場景,同時從雨窗建立視角轉為室內橫向跟拍,再到低角度門口/戶外視角。此 GIF 為靜音版本,因為本案例的重點在於視覺連貫性和攝影機變化,而非音訊。

為什麼 Gemini Omni Flash 1.1 影片延伸備受矚目,以及為什麼嘗試會失敗

穩定的 gemini-omni-1.1-flash 版本支援文字、圖像和短片輸入,並可輸出 3 至 10 秒的 360p、720p、1080p 和 4K 影片。Google 將此版本中的 1080p 和 4K 描述為升級輸出。(Gemini Omni Flash 模型頁面,2026 年 8 月)

標題很吸引人:一段 10 秒的片段可以變成 40 秒的序列。但製作上的問題在於接合處。

三種選擇會導致大多數的延伸失敗:

  • 封閉的錨定鏡頭。 如果第一個片段以完成的姿勢結束,下一個動作就沒有可信的出口。請在動作仍有餘裕時結束:手伸向門、跑者綁緊鞋帶,或狗剛好在畫面邊緣。
  • 重寫式提示詞。 重複人物、場景、鏡頭和天氣的所有細節,容易引發重繪。保留少數重要的身分錨點,然後描述新的動作。
  • 介面落差。 模型能力、API 可用性、Gemini 應用程式和控制流程是各自獨立的使用介面。在向客戶承諾「延伸」按鈕之前,請先確認實際使用的介面。

生成前的 Gemini Omni Flash 1.1 工作流程、模型與成本

Google 將延伸記錄為片段結尾的操作。它可以利用先前互動中模型生成的影片,或上傳不超過 10 秒的片段。上傳的談話片段無法以新對話內容延伸,且上傳影片的延伸功能在歐洲經濟區、瑞士和英國有地區限制。(Gemini Omni Flash 指南,2026 年 8 月)

請在一個瀏覽器分頁中完成模型選擇、提示詞、上傳和結果審查。Atlas Cloud 可以作為一個安靜的操作層,因為其模型目錄讓團隊在投入執行前可以先檢查實際的影片生成介面。

Atlas 測試環境現在已開放可執行的 Gemini Omni Flash 工作流程。本文中的咖啡、跑者和野餐案例均使用真實的測試環境輸出,以展示提示詞、連貫性錨點和可見的下一拍。文中未聲稱任何實際生產價格。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

    
階段目標鎖定或新增若失敗
草稿找到可用的動作出口保留初始種子改寫故事拍
確認選擇一個錨點記錄種子和最終影格保留已確認的片段
延伸加入一個可見事件保留錨點,加入一個變數只重試此接點
品質檢查檢查接點前後 1 秒確認身分、道具、空間、手部、動作減少新變數
升級確認後交付保留已確認的鏈結不要用升級來掩蓋不良接點

如何逐步使用 Gemini Omni Flash 1.1 影片延伸

步驟 1:生成一個 10 秒的錨定鏡頭

在支援 Gemini API 的介面中,選擇 10 秒、16:9 和 720p(若這些控制項可用)。將種子值保留為 -1,直到獲得可用的鏡次,然後記錄種子值並保留已確認的結果。

plaintext
1一支寫實電影風格的商業廣告,以連續手持35毫米鏡頭一鏡到底。在一家小雨清晨的獨立小咖啡廳內,一位穿著炭灰色圍裙的年輕女咖啡師將一個霧面黑色外帶咖啡杯放在溫暖的胡桃木櫃檯上,轉身走向玻璃門並走到門邊。雨水在窗上自然流下,柔和的陰天漫射光,淺景深,地板上有細微反射。全程保持同一位女性、圍裙、杯子、店內佈局、光線和攝影機高度。自然音效:安靜的義式咖啡機聲、雨打玻璃聲、輕柔腳步聲。無文字、無標誌、無跳接剪輯。

01-coffee-anchor-case.png

咖啡廳錨定鏡頭案例:咖啡師、霧面黑色杯子、門口、雨水和光線是待保留的元素

以 GPT Image 生成的連貫性規劃案例視覺圖。此圖展示步驟 1 簡報中的具體錨點,非 Gemini Omni Flash 的生成結果。

步驟 2:以一個新拍延伸同一鏡頭

僅在所選介面具備真正的延伸或續接路徑時使用此功能。上傳已確認的步驟 1 片段。完成的輸出應保留來源內容並在尾端追加新片段。

plaintext
1從最後一刻繼續這個完全相同的場景。同一位咖啡師打開玻璃門,走到雨濕的人行道上,手中仍拿著同一個霧面黑色咖啡杯。攝影機以相同高度在她身後平滑跟拍。保留她的臉、炭灰色圍裙、杯子形狀、咖啡廳內部、雨天陰暗光線、寫實動作和環境雨聲。不加入新人物、無文字、無標誌、無剪接。

檢查接點兩側:杯子、手部、門的位置、圍裙、光線方向和環境聲音。若此處有偏差,表示需要修改步驟 2,而不是步驟 1。

02-step2-doorway-continuation.jpg

步驟 2 延伸案例:咖啡師拿著同一個霧面黑色杯子,穿過打開的咖啡廳大門,走到雨濕的人行道上。

步驟 2 延伸提示詞的高解析度案例視覺圖。此圖讓尾端事件可被檢視:咖啡師、霧面黑色杯子、咖啡廳門口、雨水和外部光線在她跨過門檻時依然清晰可見。

步驟 3:以一個受控的故事事件再次延伸

這個步驟在畫面邊緣加入一個人。請勿在一次請求中同時加入新人、地點、時段、攝影機角度和對話。

plaintext
1從最後一刻繼續這個完全相同的場景。同一位咖啡師在咖啡廳雨棚下走了兩步,將同一個霧面黑色咖啡杯遞給一位穿著海軍藍雨衣的等候顧客。保持咖啡師、杯子、雨水、光線、攝影機高度和自然環境聲音一致。顧客僅在畫面右側邊緣出現。無對話、無文字、無標誌、無突然的攝影機剪接。

03-step3-awning-handoff.jpg

步驟 3 受控變數案例:咖啡師在咖啡廳雨棚下,將同一個咖啡杯遞給一位穿海軍藍雨衣的顧客。

步驟 3 延伸提示詞的高解析度案例視覺圖。此圖展示唯一允許的新變數:一位顧客在雨棚下接過杯子,而咖啡師、雨水、咖啡廳門口和遞交動作保持清晰。

步驟 4:執行產品一致性變體測試

測試一位跑者從公寓門口移動到河畔小徑。錨點為臉部、深綠色夾克、白色鞋子、濕路面、冷色黎明光線和攝影機方向。

plaintext
1在同一支寫實35毫米商業廣告鏡頭中,繼續同一位跑者和產品故事。跑者在公寓門口綁好同一雙白色跑步鞋,打開門,開始慢跑到藍色時段的寧靜河畔小徑上。保留跑者的臉、深綠色夾克、白色鞋子、濕路面、冷色黎明光線和攝影機方向。自然音效:鞋帶拉緊聲、門鎖聲、遠處鳥鳴、輕柔腳步聲。無文字、無標誌、無剪接。

僅在鞋子輪廓、鞋帶顏色、夾克和行進方向在接點處保持穩定時,才確認此段。

02-runner-product-consistency.gif

跑者產品一致性 GIF:同一件深綠色夾克和白色鞋子,從公寓門口綁鞋帶的動作,移動到河畔慢跑。

以 Google Gemini Omni 1.1 Flash 文字轉影片產生的真實 10 秒測試環境輸出。此測試步驟 4 的錨點涵蓋低角度鞋部特寫、從公寓門口的橫向跟拍,以及低角度河畔經過,而非依賴單一推近鏡頭。

步驟 5:執行參考角色變體測試

使用一個非人類參考。保持人物和野餐場景穩定;狗是唯一的新變數。

plaintext
1在同一個寫實公園野餐場景中,從最後一刻繼續。兩位朋友在午後柔和的樹蔭下繼續整理米色野餐墊。IMAGE_REF_0 中出現的小型金色狗從畫面左側輕快跑入,繞著野餐墊一圈,然後坐在他們身邊。保留人物、野餐物品、陽光方向、攝影機距離和自然公園氛圍。無文字、無標誌、無突兀剪接。

03-picnic-dog-reference.gif

參考角色 GIF:一隻小型金色狗從左側進入,繞著米色野餐墊一圈,然後坐在兩位朋友身邊。

以 Google Gemini Omni 1.1 Flash 文字轉影片產生的真實 10 秒測試環境輸出。狗是唯一的新角色:它從左側進入、繞著野餐墊一圈,然後坐下,而兩位朋友、米色野餐佈置和午後公園在寬景、狗的高度視角和高角度三分之四視角中保持穩定。

步驟 6:確認、升級並匯出,不破壞接點

檢查臉部、主角產品、空間連貫性、手部、動作、音訊,然後是剪接點。連續 2 次連貫性失敗後,請更改前一個故事出口或移除一個新變數。不要因為後續片段出錯而覆寫一個好的錨定鏡頭。

在鏈結確認後,若所選介面支援,可要求 1080p 或 4K。Google 將這些描述為升級輸出,而非原生 4K。(Gemini API 版本說明,2026 年 8 月)

需要不同提示詞的 Gemini Omni Flash 1.1 影片延伸變體

攝影機延伸。 只描述下一個攝影機動作,例如「攝影機橫搖過群山」。

參考引導延伸。 引入一個角色、產品或動作參考。步驟 5 中的狗只有一個任務:進入、繞一圈、坐下。

首尾影格插補。 當您已知兩個邊界圖像並想要中間的橋接時使用。它不能替代繼續現有片段的最後一刻。

上傳片段。 保持來源在 10 秒或更短。如果片段中已有人在說話,請不要要求新的對話。

Gemini Omni Flash 1.1 影片延伸成本與製作現實

請使用實際執行介面上的報價。本文的測試無法驗證 Atlas 的 Gemini Omni Flash 路徑或價格,因此固定的 Atlas 40 秒估價將是憑空捏造。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

   
項目可靠的預算規則可能改變的因素
10 秒錨定鏡頭儲存實際執行的報價所選模型和選項
影片剪輯處理儲存實際執行的報價來源時長和介面
40 秒鏈結為每個已確認的回合編列預算輸入長度和重跑
升級交付檢查所選執行方案解析度支援和報價

Gemini 中的 360p 草稿選項並不表示所有其他介面都提供 360p。請確認您實際執行的形式。在 Gemini Omni Flash 1.1 影片延伸 的製作執行中,連續 2 次接點失敗後請停止,並更改故事節點,而不是在相同提示詞上堆疊更多形容詞。

常見問題

Gemini Omni Flash 1.1 真的可以將影片延伸到 40 秒嗎?

可以。文件記載的 Gemini API 工作流程每次延伸最多可增加 10 秒,累計最長可達 40 秒。單次輸出仍為 3 至 10 秒。

Gemini Omni Flash 1.1 影片延伸在 Flow 中可用嗎?

可用性可能因 API、應用程式和 UI 介面而異。在安排延伸工作流程之前,請先確認確切的帳號和介面。

延伸 AI 影片時,如何保持同一個角色?

確認一個強而有力的錨定鏡頭,保留少量身分錨點,並只指定下一個可見動作。僅為明確的主題或產品加入參考。

可以為上傳的影片加入對話嗎?

如果上傳的片段中有人在說話,請勿加入對話。保持延伸部分靜音,或使用文件記載的多輪路徑來處理支援語音的模型生成影片。

Gemini Omni Flash 1.1 會生成原生 4K 影片嗎?

Google 將此版本中的 1080p 和 4K 描述為升級輸出。

影片延伸、影片編輯和首尾影格插補之間有什麼區別?

延伸是在尾端追加新片段。影片編輯是使用提示詞轉換短來源影片。首尾影格插補則是建立兩張提供的圖像之間的橋接。

最新模型

一個 API,暢享全模態 AI。

探索全部模型