Seedance 2.5 現已上線 — 首發於 Atlas Cloud

Wan 3.0 多鏡頭一致性:我計算了110個官方片段中的每個剪輯

Wan 3.0 多重連拍一致性:我數了全部110個片段

Wan 3.0 多鏡頭一致性:我數了 110 部官方影片的每一個剪接

你寫了一個四鏡頭腳本。鏡頭 1 完美落地:草帽、黑色串珠項鍊、白色亞麻洋裝,光線恰到好處。鏡頭 2 來了,卻是一個不同女人戴不同帽子。

這個落差正是大家緊盯 Wan 3.0 多鏡頭一致性 的原因——一個提示詞、六個鏡頭、三十秒、同一個角色貫穿始終。

於是我放下規格表。我下載了阿里巴巴隨其官方 Wan 3.0 創作者手冊發布的全部 110 部示範檔案,用 ffmpeg 逐一處理,解析了所有 64 組配對提示詞,然後做了搜尋結果中沒人做過的事:我數了實際影片中的剪接次數,並與每個提示詞要求的鏡頭數進行比對。

三個發現與你讀到的其他資訊相反。

影調調色套間中,一面監視器牆顯示同一個草帽角色在六個不同鏡頭中保持一致,這是 Wan 3.0 多鏡頭一致性的參考基準

調色師的參考牆是理解多鏡頭一致性的誠實心智模型:同一身份、六種取景,並列檢查。使用 openai/gpt-image-2 生成。

關鍵要點

  • 6 個鏡頭是真實的但非保證:阿里巴巴自己的多鏡頭提示詞中有 3 個完全命中宣告的鏡頭數,2 個未達標。
  • 最糟的情況是要求 4 個鏡頭,只渲染出 2 個。
  • 沒有 4K。110 部官方檔案中無一超過 1080p,且僅有 4 部是精確的 1920x1080。
  • 道具和鏡頭比臉部更早偏移。注意帽子,而非眼睛。
  • 目前阿里巴巴自家平台之外尚無公開的 Wan 3.0 API,因此以下教學在其可呼叫的模型上重建。

以下是來自阿里巴巴官方手冊的最佳案例。提示詞宣告六個鏡頭,六個鏡頭確實交付,同一對角色、同一套服裝、同一場雨:

六鏡頭動畫場景,雨中日式月台,同一女孩持透明雨傘、男孩背卡其色背包,每個剪接中保持一致

阿里巴巴官方 Wan 3.0 beta 示範(手冊片段 v013,1280x720,20.05 秒)。提示詞編號 1 至 6 鏡頭;ffmpeg 找到恰好 5 個硬剪接,因此 6 個鏡頭全部到位。非 Atlas Cloud 生成。

Wan 3.0 多鏡頭一致性到底是什麼?

簡而言之:這是三個不同承諾共用一個名稱,而阿里巴巴對這三個承諾的說明異常具體。

在發布文章中,阿里巴巴將一致性拆分為角色(「臉部特徵、髮型與髮色、體型、服裝及配件」)、道具(「多角度外觀、硬體結構、標誌及材質細節」)以及空間(「角色站位與攝影機視角」)(Alibaba Cloud, 2026)。這個三層拆分是以下所有評估的標準。同一張臉但項鍊不對,就是失敗。

該模型一次生成最多 30 秒,解析度為 480P、720P 或 1080P(Alibaba Cloud, 2026)。

現在來看搜尋結果中弄錯的部分。

搜尋結果常見說法第一手資料實際顯示的內容
「原生 4K 生成」官方文章僅列出 480P / 720P / 1080P。在 110 部官方示範檔案中,沒有任何一個超過 1080p,僅 4 個檔案是精確的 1920x1080。常見的「1080p」橫向輸出為 1920x1072。
「每次生成最多 6 個獨立鏡頭」阿里巴巴自己的發布文章未提及鏡頭數規格。實證上成立:手冊中 8 個明確多鏡頭提示詞,最高宣告 6 個,其中兩個確實交付了 6 個。
「最多 12 張參考圖片」實測報告指出最多 10 張圖片加上 5 個影片片段加上 5 個音訊片段(Curious Refuge, 2026)。阿里巴巴的文章未給出任何數字。
「開放權重,Apache-2.0」早期 Wan 版本為開放權重;Wan 3.0 以平台服務形式提供,尚未出現任何權重(Curious Refuge, 2026)。
「API 已推出」它在阿里雲 Model Studio 上運行。第三方推理平台尚未提供。

而這是最耗時建構的表格。每一個數字都來自我的 ffmpeg 場景偵測(比對交付檔案與配對提示詞中寫明的鏡頭數):

官方示範提示詞宣告找到的硬剪接數交付鏡頭數判定
v013 雨日月台,動畫6 個鏡頭56精確
v055 黃金獵犬日記6 個鏡頭,30.0 秒56精確
v021 拉麵店與小貓4 個鏡頭34精確
v008 森林湖,3D4 個鏡頭23少一個
v085 草帽女人4 個鏡頭12一半
v041 走廊到魔法巷3 個段落,「無硬剪接」01 個連續長鏡頭完全符合要求
v045, v084, v1023 / 5 / 多主體過多無法解析無法計數快速剪接與水墨閃爍使偵測失敗

再看中間幾行。三個提示詞完全命中數量。兩個沒有。你輸入的鏡頭數是請求,而非合約。

Wan 3.0 多鏡頭一致性為何失敗:4 種失效模式

先說結論:它很少在臉部出錯。它出錯在物件和攝影機,而且當你同時改變多個項目時最容易出錯。

以下是教我最多的一個片段,因為它是阿里巴巴自家展示中表現最差的。

GtZy2TUK4ak

阿里巴巴官方 Wan 3.0 beta 示範(手冊片段 v085,1240x742,30.08 秒)。提示詞編寫了四個時間碼鏡頭。ffmpeg 找到一個真實剪接,在 9.3 秒處。鏡頭 3 和 4 合併為一個持續的長鏡頭,然後淡出至黑。非 Atlas Cloud 生成。

失效模式 1:道具比臉部更早偏移。 在那個片段中,只看開場的長鏡頭,在任何剪接發生之前。0.6 秒時,平頂草帽有一條細黑帶,吊墜是一顆多面海軍藍寶石。9.2 秒時,帽帶變成一條寬黑緞帶,吊墜變成光滑的亮黑色淚滴。她的臉全程穩定。配件則不然。

同一連續九秒長鏡頭的兩個影格並排顯示,帽帶變寬,項鍊吊墜形狀與顏色改變

兩個影格皆來自官方 v085 示範的同一未中斷長鏡頭,相隔 8.6 秒,中間無剪接。帽帶與吊墜皆改變。這是道具層級在角色層級穩定的情況下失敗。

這就是為什麼真正有效的驗收測試是道具清單檢查,而非感覺檢查。對這個角色來說,有三項:帽子形狀與帽帶、串珠項鍊與吊墜、洋裝領口。

失效模式 2:多主體場景各自保持,但互動時模糊。 每個角色單獨出場時保持可辨識。讓他們同框互動時,身份開始滲混。獨立測試發現相同情況:「角色一致性開始崩壞,合成效果有時看起來更像糟糕的綠幕效果,而非自然生成的環境」,其中唇形同步被指出是最大弱點(Curious Refuge, 2026)。

失效模式 3:你在同一行改變了四個變數。 新地點加上新攝影角度加上新光線加上新服裝狀態,是喪失身份的可靠方式。手冊自己的提示詞透過在每個段落重申整套服裝來對抗這個問題。在 64 個配對提示詞中,9 個明確寫「保持不變」,5 個固定攝影機位置,4 個要求角色保持完全一致。

失效模式 4:一次任務 30 秒並非 30 秒的單一鏡頭。 這些是不同的產品。30 秒的多鏡頭任務在不同取景之間剪接。如果你想要的是連續不中斷的長鏡頭,串接續作會導致品質下降:每次交接時身份誤差會累積,因此乾淨的單一長鏡頭本質上就很短。

手冊中只有一個提示詞完美處理了無縫銜接,值得複製其句子結構:

三個提示詞段落渲染為一個連續不中斷的長鏡頭,從公寓走廊穿過一扇門進入燈光昏暗的哥德式小巷

阿里巴巴官方 Wan 3.0 beta 示範(手冊片段 v041,720x1280,15.04 秒)。三個提示詞段落,ffmpeg 找到零個硬剪接,完全符合提示詞要求。非 Atlas Cloud 生成。

其交接句(翻譯後)是整個手冊中重複使用性最高的句子:從前一段落的最後一格無縫銜接;角色、服裝、地點與攝影機位置保持完全一致;無硬剪接,無突兀場景轉換。 64 個提示詞中只有一個使用它。請直接借用。

你今天就能執行的多鏡頭一致性工作流程

問題是:你實際上在哪裡執行?

目前 Wan 3.0 位於阿里巴巴自家的 Model Studio。第三方推理平台均未代管。在 Atlas Cloud 上,它僅顯示為「即將推出」的條目,且無任何活躍端點,這是誠實的現狀,值得直接說清楚而非假裝有。

因此你有兩個選項:等待,或者停止要求一個提示詞做六件事。

第二個選項無論如何都更好,而我數剪接的工作正是支持它的論點。一個多鏡頭任務給出的鏡頭數在阿里巴巴自己的展示中就少了半數。拆分任務能將控制權交回你手中:

  1. 先用一張靜態影像鎖定外觀。
  2. 將該身份複製到每個鏡頭的關鍵影格,每次只改變一個變數。
  3. 分別用參考鎖定來動畫化每個鏡頭。
  4. 本地拼接。

設定較慢,但可預測性大幅提升。而且鏈中的每個模型今天都可以呼叫。

步驟模型在鏈中的角色標示價格
1bytedance/seedream-v5.0-pro/text-to-image鎖定角色外觀$0.045 / 張
2google/nano-banana-2/edit將身份複製到每個鏡頭的關鍵影格$0.08 / 張
3alibaba/wan-2.7/reference-to-video以參考鎖定動畫化每個鏡頭$0.10 / 秒
替代alibaba/wan-2.7/text-to-video一個提示詞,多個鏡頭(最不可控)$0.10 / 秒
修正alibaba/wan-2.7/video-edit修復一個錯誤道具,無需重新生成$0.10 / 秒

對於「哪個模型最適合多鏡頭一致性」這個問題,值得知道的是:參考到影片現在是一個完整的類別。bytedance/seedance-2.0-fast/reference-to-video 為 $0.072/秒(比 $0.09 便宜 20%,截至 2026 年 8 月),kwaivgi/kling-video-o3-pro/reference-to-video 為 $0.095/秒(比 $0.112 便宜 15%),minimax/h3/reference-to-video 為 $0.10/秒,google/veo3.1/reference-to-video 為 $0.20/秒。所有價格已於 2026 年 8 月 21 日與即時目錄核對。

步驟前的一個警告:標示價格是底價,並非最終報價。解析度與時間長度會改變實際金額,因此在執行前請先查看「執行」按鈕上的報價。

如何逐步建構 Wan 3.0 風格的多鏡頭一致性

我們正在重建阿里巴巴自家模型搞砸的完全相同分鏡表:草帽女人、四個鏡頭、花園到汽車。相同的腳本、每個鏡頭的控制,而這次你會得到四個鏡頭,因為你渲染了四個。

讓我們開始。

步驟 1:鎖定外觀。 一張影像成為後續所有內容的身份錨點。在 Seedream v5.0 Pro 上生成,16:9,頁面提供的最高解析度。明確命名三個檢查點道具,因為這些是會偏移的項目。

plaintext
135mm 底片劇照,復古陽光玫瑰園。一位優雅年輕女性,戴著自然草編平頂帽,帽帶為黑色,佩戴黑色串珠項鍊,單一淚滴形吊墜,身穿白色無袖亞麻洋裝。她站在盛開的粉紅與奶油色玫瑰牆前,一手輕觸帽沿,溫柔沉思的目光望向鏡頭外。柔和溫暖自然光,斑駁陽光光暈,淺景深,細緻底片顆粒,中近景。

Atlas Cloud 上的 Seedream v5.0 Pro 操作介面,已輸入草帽提示詞,輸出面板中顯示完成的角色關鍵影格

步驟 1 完成:整個四鏡頭序列的身份錨點。

步驟 2:將身份複製到鏡頭 2 至 4。 每個鏡頭一個關鍵影格,每次執行一次,使用 Nano Banana 2 Edit,以步驟 1 的輸出作為參考。重要的紀律:每次都要重申整套服裝,然後只改變一件事。

鏡頭 2,情緒轉折:

plaintext
1保持與參考影像完全相同的女性:相同的臉,相同的自然草編平頂帽搭配黑色帽帶,相同的黑色串珠項鍊搭配淚滴形吊墜,相同的白色無袖亞麻洋裝。新鏡頭:電影感特寫,她慢慢將草帽從頭上拿下並低下下巴,帶著淡淡的惆悵表情。相同玫瑰園背景。嚴格保持與參考影像相同的光線、膚色、底片顆粒與色調。

鏡頭 3,切到汽車:

plaintext
1保持與參考影像完全相同的女性:相同的臉,相同的黑色串珠項鍊搭配淚滴形吊墜,相同的白色無袖亞麻洋裝,草帽現在放在她膝上。新鏡頭:行駛中的汽車後座,側面輪廓,她的手撐在車門上,凝視著沾滿雨珠的車窗,模糊的綠色樹叢飛掠而過。陰天光線搭配溫暖車內補光,淺景深,優雅憂鬱。嚴格保持與參考影像相同的臉、相同的色調與相同的 35mm 底片顆粒。

鏡頭 4,最後一瞥:

plaintext
1保持與參考影像完全相同的女性:相同的臉,相同的黑色串珠項鍊搭配淚滴形吊墜。新鏡頭:極度臉部特寫,在車窗旁,雙眼緩緩閉上,平靜釋然的表情。雨滴在她面前的玻璃上滑落,焦點轉移到水滴上,背景變成散景。王家衛風格電影氛圍,細緻底片顆粒。嚴格保持與參考影像相同的臉、相同的光線與相同的色調。

Atlas Cloud 上的 Nano Banana 2 Edit 操作介面,已載入步驟 1 的關鍵影格作為參考,鏡頭 2 的關鍵影格已渲染,身份與服裝保持一致

步驟 2 完成:鏡頭 2 的關鍵影格,同一個女人,帽子現在在她手中。

步驟 3:以參考鎖定動畫化鏡頭 1。 現在每個鏡頭在 Wan 2.7 reference-to-video 上獨立成為影片。設定:720P,5 秒,並將步驟 1 的關鍵影格放入「圖片」欄位。執行前請查看「執行」按鈕的報價。

plaintext
1鏡頭 1 / 4。參考影像 1 定義角色:保持相同的臉,相同的自然草編平頂帽搭配黑色帽帶,相同的黑色串珠項鍊搭配淚滴形吊墜,以及相同的白色無袖亞麻洋裝,在整個片段中保持完全一致。35mm 底片風格,復古陽光玫瑰園。女性輕觸帽沿,微風吹起她的髮絲;攝影機極慢地推進。溫暖自然光,斑駁陽光光暈,淺景深,細緻底片顆粒。攝影機位置保持穩定。無硬剪接,無場景變化。

Atlas Cloud 上的 Wan 2.7 reference-to-video 操作介面,關鍵影格在「圖片」欄位中,完成的五秒片段正在輸出面板中播放

步驟 3 完成:輸出面板中顯示參考鎖定的片段。

這是產出的結果:

五秒參考鎖定片段,草帽女人在玫瑰園中,帽帶與項鍊在整個過程中保持穩定

我們在 Atlas Cloud 上的執行,非阿里巴巴示範。以靜態 GIF 顯示;交付檔案包含音軌。

步驟 4:串接鏡頭 2 至 4,然後拼接。 對每個剩餘關鍵影格重複步驟 3,並在每個後續提示詞的開頭貼上手冊中的交接句:

plaintext
1從前一段落的最後一格無縫銜接。角色、服裝、地點與攝影機位置保持完全一致。無硬剪接,無突兀場景轉換。

然後使用 ffmpeg 本地串接,並執行三點驗收檢查:帽子形狀與帽帶、串珠項鍊與吊墜,以及鏡頭之間的取景推進是否合理。如果某個鏡頭中剛好一個道具錯了,不要重新生成該鏡頭。將其送進 wan-2.7/video-edit,只改變那個道具,借用手冊的措辭:保持動作、服裝與其餘畫面不變。

變化:多主體場景與風格鎖定

手冊中值得借用的三個模式。

多主體鏡頭的角色卡。 當兩人或以上共享畫面時,官方提示詞會分配帶字母的角色卡,並在每個段落中重新宣告每個角色的完整服裝。冗長、不美觀,但比代名詞更有效。

風格化作品的全局風格宣告。 水墨、賽璐珞動畫等強烈風格需要將風格在整個作品中固定一次,然後在其下方放置時間碼分鏡表。

水墨武術場景,竹林劍客,風格鎖定在時間碼標記的五拍戰鬥中

阿里巴巴官方 Wan 3.0 beta 示範(手冊片段 v084,20.05 秒,裁剪)。在一個全局水墨風格宣告下,五個時間碼標記的節拍。閃爍的筆觸使得自動剪接偵測無法計數這個片段。非 Atlas Cloud 生成。

修復,而非重新生成。 對一個錯誤道具進行影片編輯通行證比重新渲染便宜,且不會破壞已經正確的鏡頭。

一個四鏡頭序列的成本

對於上述建構的序列,以標示價格計算的具體數字:

  • 1 個身份錨點在 Seedream v5.0 Pro 上:$0.045
  • 3 個鏡頭關鍵影格在 Nano Banana 2 Edit 上:3 x $0.08 = $0.24
  • 4 個片段,每個 5 秒,720P,在 Wan 2.7 reference-to-video 上:20 秒 x $0.10 = $2.00
  • 總計:約 $2.29,用於一個 20 秒、四鏡頭、身份鎖定的序列

將其擴展到六鏡頭 30 秒的片段,影片部分變成 $3.00,總計約 $3.44。

兩個誠實的注意事項。首先,標示價格是底價:解析度層級與時間長度會改變實際費用,而操作介面自己的「執行」報價是唯一有約束力的數字,這就是為什麼上方的螢幕截圖比這個列表更重要。其次,關於 Wan 3.0 本身,阿里巴巴按解析度層級對 Model Studio 影片生成進行每秒計費,但我無法從第一方頁面確認 Wan 3.0 的具體每秒費率,因此我不引用我無法驗證的數字。

值得注意你透過拆分任務方法所購買的:不是更低的價格,而是與你的腳本相符的鏡頭數。根據阿里巴巴自家展示的證據,這不是一個 30 秒的單一任務目前能向你保證的,而在 API 開放之前,這是對 Wan 3.0 多鏡頭一致性的實用答案。

常見問題

Wan 3.0 一次生成能保持多少個鏡頭一致?

六個,根據現有證據,但有個但書。阿里巴巴的發布文章未公布鏡頭數規格。在其官方手冊中 8 個明確的多鏡頭提示詞中,最高宣告的是 6 個,其中兩個確實交付了恰好 6 個經剪接驗證的鏡頭。請將 6 視為觀察到的上限,而非保證。

Wan 3.0 真的能生成原生 4K 嗎?

不能。官方文章僅列出 480P、720P 和 1080P。在全部 110 部官方示範檔案中,沒有任何一個超過 1080p,僅 4 個檔案是精確的 1920x1080,常見的橫向輸出為 1920x1072。幀率方面,63 個檔案為 24fps,46 個為 30fps。

Wan 3.0 API 是否可用?在哪裡可以執行?

它在阿里雲 Model Studio 上運行。第三方推理平台目前均未代管;Atlas Cloud 將其列為「即將推出」的條目,無任何活躍端點。如果你本週就需要多鏡頭輸出,上述的 Wan 2.7 reference-to-video 鏈是可行的替代方案。

為什麼即使使用了參考影像,我的角色在鏡頭之間仍然改變?

通常是因為一個提示詞同時改變了地點、攝影機角度和光線。每次只改變一個變數,並在每個提示詞中重申整套服裝。此外,要檢查正確的項目:在阿里巴巴自己的示範中,臉部保持穩定,而帽帶和項鍊吊墜在同一段未中斷的長鏡頭內都改變了。

Wan 3.0 的權重是開源的嗎?

尚未發布任何權重。早期的 Wan 版本可以下載並在本地執行,而 Wan 3.0 則以託管平台服務形式提供。任何引用 Wan 3.0 的 Apache-2.0 授權的人都是在重複沒有第一手來源支持的說法。

在沒有 Wan 3.0 存取權的情況下,獲得多鏡頭一致性的最快方法是什麼?

四個步驟:鎖定一個身份影像,將其複製到每個鏡頭的關鍵影格(每次只改變一個變數),使用 reference-to-video 動畫化每個鏡頭,然後本地拼接並檢查你的道具。一個四鏡頭序列大約需要 $2.29 和約半小時。


方法論:所有 110 部示範檔案與 64 組配對提示詞均來自阿里巴巴官方 Wan 3.0 創作者手冊,於 2026 年 8 月 11 日本地存檔。中繼資料使用 ffmpeg 逐檔案讀取;鏡頭數來自 ffmpeg 場景變化偵測(閾值 0.2),並與提取的影格交叉比對;提示詞結構以程式方式解析。Atlas Cloud 價格已於 2026 年 8 月 21 日與即時模型目錄核對。

來源: Alibaba Cloud(2026 年 8 月);Curious Refuge(2026 年)

最新模型

一個 API,暢享全模態 AI。

探索全部模型