Seedance 2.5 現已上線 — 首發於 Atlas Cloud

如何使用 Veo 3.1?完整逐步 AI 影片指南

學習如何使用 Google Veo 3.1 製作逼真 AI 影片。掌握角色一致性、原生 48kHz 音訊同步、7 層提示公式以及 4K 輸出工作流程。

如何使用 Veo 3.1?完整逐步 AI 影片指南

關鍵要點

  • 存取層級:使用 Google Flow 取得視覺化 UI 控制;或使用 Vertex AI (veo-3.1-generate-preview) 進行 API 工作流程。
  • 一致性:避免純文字角色提示詞——使用素材模式插槽消除面部漂移。
  • 提示詞公式:部署 7 層結構,結合鏡頭、力向量與音訊標籤。
  • 音訊控制:使用括號語法 [SFX: ...][Ambient: ...] 實現原生 48kHz 音訊同步。

未錨定的文字轉影片提示詞常會產生變形臉孔、不穩定的鏡頭移動以及無聲、無法使用的片段。要掌握如何使用 Veo 3.1,必須放棄對話式的描述,改採端到端的 AI 影片製作流程。

快速啟動執行管線

使用以下序列將原始概念轉換為音訊同步的多鏡頭 4K 影片:

  1. 選擇存取層級: 透過 Google Flow UI 或 Vertex AI API (veo-3.1-generate-preview) 啟動。
  2. 錨定視覺素材: 在_素材模式_中上傳參考圖像,或提供關鍵幀邊界。
  3. 執行提示詞工程: 應用結構化語法,結合鏡頭指令、主體動作與原生音訊提示。
  4. 延長持續時間: 使用尾幀擴展,建構超過初始 8 秒窗口的剪輯。

標準文字轉影片 vs. Veo 3.1 多模態條件控制

   
生成功能傳統文字轉影片Veo 3.1 進階條件控制
角色一致性跨渲染呈現高度時間性漂移參考圖像插槽鎖定角色身份
場景轉換隨機插值移動首幀與末幀控制決定攝影機軌跡
音訊整合無聲輸出,需後期外部處理原生 48kHz 音效、環境音與唇形同步對白
輸出畫面比例固定 16:9 寬螢幕渲染原生 16:9 寬螢幕與 9:16 直式格式

官方操作規格與語法指南可參閱 Google AI Veo 文件Google DeepMind Veo 入口網站

準備工作區:Google Flow vs. Vertex AI 與引擎選擇

將專案預算浪費在完整解析度的試渲染上,是最快耗盡生成額度的方式。創作者常在高成本模型層級上測試基礎提示詞邏輯,結果因鏡頭移動偏移而必須重來。在觸發生成前選對工作區與引擎變體,可避免這種不必要的消耗。

在哪裡可以存取 Veo 3.1?

Google Flow UI 橫幅與 Vertex AI Agent Platform 驗證儀表板,用於存取 Veo 3.1

存取方式取決於你的專案需要互動式視覺控制,還是自動化批次管線:

  • Google Flow 工作區:互動式網路畫布。適合手動編輯、參考圖像錨定與即時影音預覽。
  • Vertex AI API 存取:程式化閘道。適合開發者將 veo-3.1-generate-preview 整合到自訂應用程式,或透過 Python、Node.js 與 REST 執行批次生成。

注意: Vertex AI 現已更名為 Agent Platform。

引擎選擇:Veo 3.1 Lite vs. Fast vs. Quality

在速度與畫質之間做出選擇,決定了成本效率與輸出品質。初期構圖測試在 Fast 模式下執行,最終交付時再切換至 Quality。

    
功能 / 指標Veo 3.1 LiteVeo 3.1 FastVeo 3.1 Quality / Standard
主要用途超低成本發想、大量批次草稿、快速故事板預視平衡的生產渲染、快速迭代、社群內容自動化主等級最終渲染、商業/廣播交付、複雜主打鏡頭
生成速度最快(約 5–10 秒/片段)快速(約 15–30 秒/片段)標準(約 60–120 秒/片段)
相對成本/額度極低(約 $0.05,比 Quality 低 87%)最佳化(約 $0.15,比 Quality 低 62%)全費率(約 $0.40/次)
原生解析度720p / 草稿 1080p原生 1080p原生 1080p,附專用 4K 升頻通道
光影、物理與音訊功能型物理、基礎背景音效流暢的動作一致性、平衡的體積光與音訊同步完整空間物理、複雜流體動力學、精準 48kHz 音場

生產建議

為最佳化大型專案中的生成預算,請採用三階段層級升級工作流程:

  1. 發想與提示詞測試(Lite):在 Veo 3.1 Lite 上執行初始構圖、取景與鏡頭方向測試,以最低成本鎖定提示詞語法。
  2. 動作與音訊微調(Fast):切換至 Veo 3.1 Fast 評估唇形同步對白、複雜物體運動與角色連續性。
  3. 最終製作(Quality):種子值與運動向量鎖定後,在 Veo 3.1 Quality 下執行最終渲染,並使用專用 4K 升頻管線。

掌握視覺錨點:如何維持角色與風格一致性

當你終於生成一個完美的廣角鏡頭,但攝影機推近時,主角的臉部特徵扭曲,衣服從棉質變成皮革。這種現象稱為時間性漂移,困擾著大多數文字轉影片模型。要達到專業的角色一致性,你必須停止依賴純文字提示詞,並利用 Veo 3.1 的素材模式(素材轉影片)。

利用素材模式進行結構控制

Google Veo 3.1 素材模式工作流程圖,顯示三個參考圖像插槽對應於提示詞標籤

Veo 3.1 允許你同時上傳最多三個視覺素材。與其強迫潛在引擎「猜測」細節,素材模式透過直接視覺參考鎖定身份、環境與美學紋理。應用此建議的三素材分配策略:

   
素材插槽策略主要功能官方提示詞最佳實踐
主體素材 (@character)鎖定臉部幾何、身體比例與服裝在提示詞中標記該素材(例如 "@ingredient1 walking through..."),並使用中性正面照。
環境素材 (@background)設定空間邊界與地板到天花板視角提供廣角鏡頭,建立環境光影與深度。
風格素材 (@style)控制底片顆粒、色彩分級與表面紋理上傳高對比度靜態圖,顯示特定材質編織、皮膚毛孔或燈光佈置。

逐步鎖定風格

使用此結構化流程,嚴格遵循上傳的素材,以建立圖像到影片的視覺錨點:

  1. 匹配素材畫面比例: 將所有參考素材裁切至目標畫面比例 16:9 或 9:16,並在上傳前維持尺寸高於 1024px。預先裁切可防止潛在引擎在早期擴散階段拉伸或扭曲你的靜態輸入。
  2. 賦予材質提示: 在文字提示詞中,明確描述參考圖像中存在的表面屬性,並同時使用素材標籤。如果你的風格錨點顯示拉絲鋁,請寫上 "brushed aluminum reflections on @ingredient1",以橋接靜態素材特徵與運動渲染之間的差距。
  3. 解決標記衝突: 若發生角色漂移,請從文字提示詞中清除冗餘的視覺外觀形容詞,主要依賴 @ingredient1 參考標籤來強制身份。

透過將視覺複雜性卸載到指定的參考插槽,你保留了文字生成標記,用於攝影機移動與基於動作的物理。這種分工仍然是維持多鏡頭序列中身份穩定性的最可靠方法。

用於真實感生成的 7 層提示詞公式

輸入模糊的描述詞,例如 "a high quality, hyperrealistic cinematic scene",經常會產生漂浮的動作、平淡的光影與橡膠般的物理。生成式影片擴散模型需要明確的物理與光學參數,使用結構化的 Veo 3.1 提示詞指南 框架,而非泛泛的讚美。

創作者經常問:如何為 Veo 3.1 格式化提示詞?

答案在於放棄對話式散文,改採結構化的提示詞架構,該架構可直接轉譯為渲染指令。

7 層提示詞結構

7 層 AI 影片提示詞公式圖,顯示攝影機、主體、物理、環境、光影、紋理與音訊 UI 標籤,對應到一個鐵匠場景

為達到物理保真度與精確的攝影機執行,將文字輸入組織為此可重複的序列:

   
層級目標範例語法
1. 攝影機與鏡頭選擇決定視野與跟蹤運動35mm 鏡頭,緩慢推軌,淺景深
2. 主體定義前置視覺角色錨點一名 40 歲的木匠,雙手粗糙
3. 動作與物理使用基於力的動作動詞來紮根運動敲擊鐵鑿,木屑飛散
4. 環境與氛圍建立空間深度與空氣品質木工坊,體積狀鋸屑霧
5. 光影引擎定位明確光源以產生動態陰影來自上方工業燈泡的單一主光
6. 風格與紋理定義表面處理與光學瑕疵Kodak 35mm 底片質感,微刮痕,可見顆粒
7. 原生音訊提示指導整合的對白與音效[SFX: 尖銳金屬鑿擊聲] "快好了。"

比較有缺陷的提示詞與導演式提示詞

注意用電影力向量取代描述性廢話如何大幅改變輸出品質:

  • 有缺陷的提示詞: "An amazing cinematic video of a man working hard in his shop, hyperrealistic."
  • 導演式提示詞: "Low-angle tracking shot, 24mm lens. A blacksmith hammers glowing yellow steel on a steel anvil. Sparks scatter across the dark concrete floor. Key light from the forge illuminates his face. [SFX: heavy hammer clang] [Ambient: roaring furnace fire]."

電影攝影機移動前置,並指定真實感光影提示,迫使潛在引擎計算真實的陰影路徑與焦點深度,消除非結構化提示詞常見的非自然運動。

案例研究:壓力測試物理運動極限

在我們對 Veo 3.1 的實證測試中,出現了一個關鍵區別,即潛在引擎如何處理不同提示詞風格下的物理運動:

高衝擊壓力運動(打鐵)

  • 提示詞策略:導演式(7 層公式)
  • 潛在行為:成功觸發精確的音訊同步、體積狀鍛造火光與粒子向量。然而,高衝擊碰撞力將潛在模型的物理引擎推向極限,有時會引入輕微的運動柔軟度。

線性微運動(木工)

  • 提示詞策略:有缺陷 / 模糊文字
  • 潛在行為:產生異常清晰的空間光影與無縫的音訊對齊。由於運動是線性且重複的,基礎擴散模型可以輕鬆插值流暢的運動,而不會出現嚴重的物理計算偽影。

關鍵要點:雖然 7 層提示詞公式可以讓你嚴格控制攝影機座標、光線方向與原生音訊標籤,但高壓力的物理碰撞仍然考驗著生成式影片引擎的當前邊界。對於極端運動,請將你的導演式提示詞與素材模式參考結合,以強制空間幾何。

原生音場導向:同步對白、音效與環境音

生成一個視覺驚豔的片段,卻花費數小時在手動對齊腳步聲、房間音效與唇部動作,這會中斷創作動能。傳統擴散模型將影片視為無聲運動,迫使後期製作拼接音訊。Veo 3.1 透過在視覺渲染的同時直接合成一個同步的 48kHz 立體聲軌道,並在統一的幀時間下運作,解決了這個瓶頸。

掌握括號音訊語法

要使用 Veo 3.1 音訊生成,你必須使用明確的標籤定界符來結構化文字輸入。這種括號音訊語法將視覺指令與聲學方向分開,實現精準的 48kHz 音場控制:

[視覺提示] + "口語對白" [語音修飾詞] + [SFX: 特定動作] + [Ambient: 環境噪音]

Veo 3.1 括號音訊提示語法圖,顯示對白、音效與環境噪音標籤對應到太空船駕駛艙場景

結構化多層音訊提示

在指導原生音效生成與口語台詞時,要平衡聲學層次,使對白在房間環境音中仍清晰可辨:

   
音訊層提示詞格式化範例技術執行規則
口語對白一名女子抬頭說:「我們現在必須離開」,語氣急促。每個 8 秒片段保持台詞少於 12 個字,以防止截斷。
離散音效[SFX: 靴子踩在碎石上的沉重嘎吱聲]將聲音標記緊接在視覺觸發描述之後。
環境背景音[Ambient: 低風聲穿過混凝土廢墟,遠處雨聲]在提示詞末尾建立背景音,以避免遮蔽主要音效。

防止語音截斷與不同步

要實現緊密的唇形同步 AI 影片,需要嚴格管理節奏:

  • 字數限制: 8 秒生成窗口在正常說話節奏下約可容納 15 到 18 個口語單詞。超出此限制會迫使引擎截斷句子結尾,或以不自然的方式加速唇部運動。
  • 聲學定位: 將角色可見度提示(例如 close-up profilefront-facing medium shot)直接放在對白標籤旁。清晰的面部可見度可讓模型將音標形狀直接對應到音訊波形生成。

多鏡頭場景擴展與首幀/末幀控制

在場景中途遇到人為的 Veo 3.1 8 秒長度限制,會破壞敘事節奏並強迫進行尷尬的剪輯。單次生成很少能為複雜的敘事弧或多階段物理動作提供足夠的跑道。

創作者經常問:如何使用 Veo 3.1 製作長影片?

延長專案長度需要超越孤立片段,並實施結構化的多通道連續工作流程。

方法 1:尾幀連續性(擴展模式)

要建立長達 148 秒的連續序列而不損失身份,請利用 Veo 3.1 場景擴展,透過迭代尾幀鏈接:

  1. 提取關鍵幀: 將初始 8 秒渲染段的最後一幀隔離出來,作為基準種子。
  2. 重新注入角色錨點: 將提取的幀上傳到主要參考插槽,同時保留你的核心角色配置 JSON 或提示詞標籤。
  3. 提示向前運動: 不要重述現有光影或背景細節,僅撰寫專注於即將發生的物理動作的提示詞更新。

通道 1 (0-8s) ──► 提取第 192 幀 ──► 重新注入第 192 幀 + 擴展提示詞 ──► 通道 2 (8-16s)

Veo 3.1 尾幀擴展模式工作流程圖,將兩個 8 秒片段鏈接成一個無縫的 16 秒影片

方法 2:書擋控制(首幀與末幀)

當連接兩個不同的視覺敘事點時,首幀與末幀控制可作為自動插值引擎。與其期望模型猜測你的目標終點,不如提供兩個視覺邊界:

   
工作流程步驟所需操作系統執行
1. 生成幀使用標準圖像生成工具建立起始與結束關鍵幀圖像。設定精確的視覺起點(幀 A)與終點(幀 B)目標。
2. 關鍵幀插槽將幀 A 載入首幀插槽,幀 B 載入末幀插槽。為影片擴散計算建立空間邊界。
3. 路徑指導撰寫一個橋接提示詞,詳細說明兩點之間的攝影機移動。插值運動物理,填充中間的 8 秒間隙。

使用書擋提示詞進行關鍵幀橋接,可消除隨機的攝影機偏移,在長篇專案的固定敘事節拍之間提供流暢的運動路徑。

透過瀏覽器介面手動實施多通道連續工作流程,很快就會成為工作室管線的瓶頸。對於可擴展的 API 驅動執行,開發者通常會將這些多通道渲染路由到 Atlas Cloud,該平台將底層模型 API 介面統一為單一端點。透過 Atlas Cloud 路由你的擴展提示詞與關鍵幀負載,可確保自動尾幀提取、降低延遲,並在長篇影片管線中提供可靠的標記調度。

Atlas Cloud Veo3.1 圖像轉影片 API 儀表板介面,顯示輸入提示詞、圖像關鍵幀上傳插槽與輸出影片預覽播放器

常見故障模式排除:偽影、變形與音訊同步丟失

沒有什麼比看著角色的下巴線條在句子中消散到背景幾何中,或口語對白與唇部運動不同步,更能毀掉一次生成。大多數擴散模型錯誤源於提示詞衝突或潛在指令過載,而非引擎故障。系統性診斷可在不浪費渲染額度的情況下解決這些問題。

實用診斷與修復矩陣

當遇到生成缺陷時,請將症狀與此操作維修指南進行交叉對照,以進行 Veo 3.1 故障排除

   
故障模式 / 症狀技術根本原因即時操作修復
面部扭曲 / 變形主體定義不清或運動指令衝突在提示詞第 2 層前置主體特徵。避免在單一句子中堆疊多個動作動詞。
漂浮 / 無重量運動過度使用被動動詞(例如 "he walks confidently")用基於力的動詞取代被動描述(例如 "he pushes off the curb, leaning forward into the wind")。
影音不同步對白字數超過片段運行時間限制括號內的口語台詞,每個 8 秒片段中,單次呼吸句子少於 12 個字。
跨片段背景變形缺少環境光影錨點明確定義一個單一的固定主光源(例如 "lit by a single 5600K overhead spotlight")。

防止潛在矛盾

為有效執行AI 影片偽影修復,請隔離那些迫使模型猜測空間物理的語法錯誤:

  1. 消除提示詞衝突錯誤: 避免在單一文字區塊中混合相反的向量指令,例如 "camera panning right while subject turns left quickly"。這種矛盾會導致身體幾何剪切或拉伸。
  2. 應用時間性漂移修復: 在擴展多片段序列時,清除先前幀中冗餘的形容詞,並使用乾淨的環境圖像插槽重新錨定背景素材。
  3. 修正負面提示詞: 不要將排除項作為肯定句列出(例如 "no blurry faces")。相反,應定義特定的攝影機參數,例如 "sharp 35mm focal plane",以從源頭修復 AI 影片變形

畫面比例格式化、升頻與匯出工作流程

將 16:9 寬螢幕影片裁剪為 9:16 用於 TikTok 或 YouTube Shorts,通常會切掉主要主體、破壞攝影機構圖並降低像素密度。強制後期重新構圖會毀掉精心設計的構圖並浪費渲染努力。在生成階段設定目標尺寸,可確保每個輸出頻道都獲得完整的空間構圖。

原生畫面比例選擇 vs. 後期裁剪

Veo 3.1 支援橫向與直式格式的原生畫面比例渲染,保留解析度與構圖意圖:

    
交付頻道目標格式比例設定空間優勢
YouTube / 廣播 / 電影橫向16:9 (1920x1080 / 3840x2160)完整水平視野與電影級背景深度。
TikTok / Reels / Shorts直式9:16 (9:16 直式 AI 影片)原生主體構圖,無中心裁切平移掃描偽影。

兩階段升頻管線

為在不浪費草稿迭代的額度預算下交付乾淨的主檔案,請執行此影片升頻工作流程

  1. 草稿階段: 使用 Fast 引擎變體以 720p 或 1080p 渲染初始運動測試,以驗證提示詞時機與音訊同步。
  2. 製作階段: 關鍵幀對齊後,執行最終渲染或應用第二階段空間升頻通道,以產生廣播級4K 影片匯出

選擇正確的畫面比例參數,並在最終製作前執行低成本草稿,可確保生產管線既精準又節省預算。透過結合 Veo 3.1 的多模態條件控制、結構化 7 層提示詞與 API 驅動的擴展工作流程,創作者可以從生成孤立的 8 秒片段,過渡到執行完全同步的廣播級 AI 影片製作。

最新模型

一個 API,暢享全模態 AI。

探索全部模型