Seedance 2.5 現已上線 — 首發於 Atlas Cloud

Wan 3.0 Multimodal Reference 需要 20 個資產,而 PDF 是其中之一。

Wan 3.0 多模態參考一次調用可處理 20 個資產:圖片、影片、音訊、PDF,甚至網址。立即查看阿里巴巴的成果與今日可執行的流程。

你為一支 15 秒的廣告建立了一個資料夾。兩張角色靜態圖。客戶寄來的品牌基調影片。一本只存在於 PDF 的品牌手冊。一段來自你真正想要之演員的語音樣本。

然後你打開了影片模型,它卻只要一張圖片。

所以你做了大家都會做的事:把資料夾轉譯成 800 字的提示詞,然後祈禱。第三個鏡頭裡,臉部開始漂移。夾克變了顏色。聲音完全是另一個人。

Wan 3.0 的全方位參考是影片模型第一次說:好,把資料夾給我。單次呼叫最多可容納 20 個素材,涵蓋五種輸入類型,並在單一連續 30 秒鏡頭中保持一致性。

這篇文章只做三件事,其餘略過:拆解那 20 個素材究竟是什麼,以阿里巴巴自家的生成片段作為證據,並提供你現在就能執行的等效工作流程。因為 Wan 3.0 仍在阿里巴巴自家雲端上進行公開測試版,尚未能從第三方平台呼叫。

重點摘要

  • Wan 3.0 的多模態參考單次呼叫最多可接受 20 個素材,涵蓋圖片、影片、音訊、文件和動態網頁,並在單一 30 秒鏡頭中維持一致性。
  • 它是第一個將 PDF、投影片檔案或 URL 視為創意輸入的主流影片模型,而非需要你改寫進提示詞的素材。
  • Wan 3.0 已於 2026 年 8 月 6 日在阿里雲 Model Studio 與 Qwen Cloud 上以 wan3.0-video 之名進入公開測試版。它目前是封閉權重。任何告訴你它已經開源為 Apache 2.0 的人,都只是在猜測。
  • 20 個素材這個標題焦點,其實不是它真正領先的地方。你現在就能呼叫的參考轉影片模型,很多已經接受超過 20 個素材。差距在於文件和網頁,而非數量。
  • 你可以用 Atlas Cloud 的免費 AI 廣告短劇產生器,完全不花錢測試這個雙角色、參考鎖定、完整配音的格式:輸入四張產品照片,輸出 15 秒的口說短劇,不需要信用卡。

蓬鬆貓咪和黑貓在豪華飯店走廊奔跑

兩隻貓被 Wan 3.0 帶著穿越五個不同場景,沒有任何角色漂移_Two 張參考圖片。五個完全不同的場景,從飯店走廊到洗衣機滾筒,再到紅色電話亭。沒有一幀漂移。來源:阿里巴巴官方_ Wan 3.0 創作者手冊 ,2026 年 8 月,本文中其他所有 Wan 3.0 片段也都出自此處。

為什麼多重參考影片會崩壞,以及 Wan 3.0 多模態參考改變了什麼

影片模型在片段之間沒有記憶。每一次生成都從零開始。這一句話就是整個問題的總和。

因此,當你的故事需要不只一個鏡頭時,你就得像拼接一樣。鏡頭一給了你一張你愛不釋手的臉。鏡頭二給了你那張臉的遠房親戚。鏡頭三靜靜地把夾克從梅紫色變成酒紅色,而等你發現時,你已經為十一次渲染付了錢。

單張圖片參考有幫助,但它永遠只能鎖定一件事:一張臉。它無法同時抓住臉、服裝、道具、地點和聲音,因為只有一個位置,卻有五個任務。

有兩條出路:給模型更多位置,或讓它不必重新開始。Wan 3.0 同時做到兩者,所以這兩個主打功能其實是同一個功能。原本就支援 30 秒的一鏡到底,意味著沒有剪接點讓角色漂移過去。二十個參考素材則讓每個必須保持不變的元素擁有自己專屬的位置,而不是爭搶一個。

以下是完全不拼接時的實際樣貌:三十秒,單一連續攝影機,一個坐在購物車裡的孩子最後嵌進廣告看板,然後又從看板底下走出來。

完整 30 秒一次生成,沒有剪接,配樂也在同一趟生成中完成。來源:阿里巴巴官方 Wan 3.0 創作者手冊。

Wan 3.0 多模態參考中的「20 個素材」究竟是什麼

二十是一個眼球數字。重要的是這二十個不全是同一類東西。Wan 3.0 的全方位參考涵蓋五種輸入類型,每一種控制輸出的不同面向。

圖片控制身分。 一張角色卡、一張產品照、一張場景參考圖。Wan 3.0 稱之為像素級一致性;在阿里巴巴自家範例中,鎖定範圍不只是臉部,還延伸到服裝:層疊的灰袍、綁帶皮背心、深色腰封,都在跨越三個地點的十六秒近身打鬥中完整保留。

夕陽下身穿中式傳統長袍的年輕男子站在戶外

兩張角色卡驅動一場武俠打鬥,服裝細節逐格保持

兩張角色卡加上一張蘆葦岸的場景參考圖。服裝和場景在每一次出手之間都維持不變。這裡以靜音 GIF 呈現;實際交付的檔案帶有 44.1kHz 立體聲混音。來源:阿里巴巴官方 Wan 3.0 創作者手冊。

音訊控制語音。 這一部分讓「多模態」不再只是行銷話術。你為每個角色附上一段語音樣本、在提示詞中寫好台詞,對白便會以那個音色、嘴型同步,在與畫面相同的生成流程中回傳。兩個人,兩段語音參考,一間健身房。

兩張主體圖片搭配兩段獨立的語音參考片段,對白以這兩種聲音回傳。這一個片段值得把聲音打開。來源:阿里巴巴官方 Wan 3.0 創作者手冊。

影片控制節奏。 參考影片不是拿來複製的。它提供的是節奏:一個節拍持續多久、轉場如何移動。在這個範例中,五張關鍵影格提供主體,一段參考影片提供它們之間的水平翻卡節奏。

女子配戴精緻中國傳統頭飾、身穿藍色刺繡長裙

五張關鍵影格以參考影片的節奏翻動_Five_ 主體用五張關鍵影格圖片,翻動節奏用一段參考影片。來源:阿里巴巴官方 Wan 3.0 創作者手冊。

文件與網頁控制結構。 這是真正全新的部分。Wan 3.0 接受文件檔案和動態 URL 作為創意輸入;Beta 版的報導列出 .doc.xls.ppt.pdf.txt 為可接受格式(AlphaSignal,2026 年 8 月)。同樣邏輯也適用於分鏡圖:一張分鏡板輸入,六個鏡頭輸出,按照分鏡板本身的順序。

撐著傘的兩個人在下雨的火車月台上

一張分鏡單頁擴展成雨中日式月台上的六個連續鏡頭

以一張分鏡板作為參考,依序生成六個鏡頭,連第五個鏡頭中傳遞紙條的手勢也忠實呈現。來源:阿里巴巴官方 Wan 3.0 創作者手冊。

首尾影格控制端點。 這是最老套的手法,仍然支援,仍然是框定一個鏡頭最快的方式。

以下是它與目前大多數人實際使用的版本相比之下,彼此的數據。

Wan 2.7 Reference-to-VideoWan 3.0 omni-reference
參考素材每個主體一張圖片,最多 3 個影片、1 個語音片段總計最多 20 個素材
模態圖片、影片、音訊圖片、影片、音訊、文件、網頁
單次生成最長時長10 秒原生 30 秒,另有智慧時長
同趟生成音訊
影片編輯與延伸未開放以指令與參考為基礎的編輯,加上延伸
可用性已在第三方 API 上線阿里雲 Model Studio 與 Qwen Cloud 測試版

有一條規則沒人寫進文件,但每個人都用學費換來:一個參考,一個任務。 Image1 鎖定臉部與服裝。Video1 只提供動作。Audio1 只提供音色。一旦你給單一素材兩個互相衝突的任務,或上傳一張有兩人的參考圖片,模型就必須猜測,而猜測正是你原本想避免的事。阿里巴巴的官方手冊對這點也直言不諱:每張參考圖片只放一個主體。

你現在就能執行的 Wan 3.0 多模態參考工作流程

先給直接答案。Wan 3.0 以模型 ID wan3.0-video 在阿里巴巴自家雲端上公開測試(Alibaba Wan,2026 年 8 月)。它尚未登上第三方 API 平台,Atlas Cloud 也不例外。現在任何人對你銷售 Wan 3.0 API 存取權,都是在轉售其他東西。

真正已經落地的是工作流程的形狀:參考素材包輸入、一次呼叫、完成帶聲音的片段輸出。這在現今的參考轉影片模型上就能執行,你只需在瀏覽器分頁中呼叫;一旦你把它們全部排開,20 個素材這個標題看起來就會不一樣。

模型參考素材模態最長時長原生音訊每秒價格
Wan 3.0(阿里巴巴測試版,尚未在 Atlas 上)總計 20 個圖片、影片、音訊、文件、網頁30 秒據報導依解析度為 $0.05 至 $0.20
Wan 2.7 Reference-to-Video每個主體一張圖片、3 個影片、1 個語音片段圖片、影片、音訊10 秒$0.10
Seedance 2.5 Reference-to-Video50(30 圖片 / 10 影片 / 10 音訊)圖片、影片、音訊30 秒$0.13
MiniMax H3 Reference-to-Video混合,未說明上限圖片、影片、音訊15 秒$0.10
Kling Video O3 Pro Reference-to-Video7 張圖片,或 4 張圖片 + 1 個影片圖片、影片15 秒$0.10
Vidu Q3-Mix Reference-to-Video4 張圖片圖片16 秒$0.11
Veo 3.1 Reference-to-Video3 張圖片圖片8 秒選用$0.20

以上價格是 Atlas Cloud 截至 2026 年 8 月的費率。Wan 3.0 的數字是阿里雲測試版所報導的費率,並非 Atlas 費率;且阿里巴巴尚未公布該模型的公開價格頁面,因此請將那一行視為暫定數值。

把這張表讀兩遍,真正的重點就會浮現。20 個素材這個標題不是 Wan 3.0 領先的地方,因為 Seedance 2.5 已經能接受 50 個並同樣達到 30 秒。那份清單上沒有任何其他模型能接受的是 PDF。

以下教學中的示範使用 Wan 2.7 Reference-to-Video 執行,因為它的輸入形狀是與全方位參考最接近的現行對應物:多張主體圖片、一段可選的參考影片,以及一段語音片段,全部對應到提示詞中的 character1character2 標籤。三個模型、一個瀏覽器分頁、無需在本機安裝。

自己動手做:四步驟建立一個多模態參考場景

場景:一個粉彩色調的飯店櫃台。一位面無表情的門房。一位抱著布偶貓的旅人。門房直視鏡頭說:「貓有訂位。你沒有。」

兩張圖片加上一段語音片段,也就是兩個模態、三個參考素材。這是最小的建置,真正稱得上多模態,而不只是多圖片。

步驟 1:生成參考圖片 1,你必須鎖定的主體

參考圖片只有三個任務,而且只有三個:一個主體、面向鏡頭、乾淨背景。其他都是裝飾。使用 GPT Image 2 ,品質 high、尺寸 16:9、n=1。

Plain
1Full-body studio portrait of a middle-aged hotel concierge with a deadpan expression, standing dead-centre against a flat dusty-pink wall. He wears a plum-purple double-breasted bellhop uniform with gold piping and brass buttons, a small round pillbox hat, and a thin moustache. Perfectly symmetrical framing, even soft frontal light, no cast shadow on the wall, 35mm film grain, muted pastel palette. One subject only, no other people, no text, no logo, no props in frame.

AI 圖片產生器介面,顯示編號步驟和生成的門房

Atlas Cloud 上的 GPT Image 2 遊樂場,輸出面板中呈現了門房參考肖像

Atlas Cloud 上的 GPT Image 2:品質 high、16:9、單一主體、平坦背景。這份檔案將成為 character1。

步驟 2:生成參考圖片 2,第二個鎖定主體

相同模型、相同設定。兩個角色之間的色彩對比是有意為之,因為這讓模型在他們同框時更容易區分彼此。

Plain
1Full-body studio portrait of a young woman traveller holding a fluffy ragdoll cat against her chest, standing dead-centre against a flat mustard-yellow wall. She wears a mustard wool coat, a red beret and round tortoiseshell glasses, and holds a small vintage leather suitcase in her free hand. Perfectly symmetrical framing, even soft frontal light, no cast shadow on the wall, 35mm film grain, muted pastel palette. One subject only, no other people, no text, no logo.

步驟 3:生成語音參考,這才是真正的多模態部分

語音片段正是將這個工作從多圖片轉換為多模態的關鍵。Wan 2.7 的音訊位置需要約 1 到 10 秒的短樣本,所以台詞要短。使用 MiniMax Speech 2.6 HD ,並選擇低沉、平淡、不以為意的男聲。

Plain
1Good evening. Checking in? Of course. Everyone is.

步驟 4:一次呼叫、三個參考、一支完成片段

現在把整個素材包一次投入 Wan 2.7 Reference-to-Video 。設定:resolution: 1080Pratio: 16:9duration: 10(這是此模型的上限)、prompt_extend: falseseed: -1。依序載入 images,先步驟 1,對應到 character1;再步驟 2 作為 character2;並將步驟 3 的檔案掛到 audio

Plain
1Symmetrical, dead-centre wide shot of a pastel hotel lobby front desk, dusty-pink walls and a mustard-yellow key rack behind it. character1 is the concierge standing behind the desk; character2 is the traveller standing in front of it, still holding her ragdoll cat. The camera pushes in slowly along a perfect centre axis and never tilts. character1 looks straight down the lens and says flatly: "The cat has a reservation. You do not." character2 blinks once, turns her head slowly towards the cat, then back to the desk. The cat stares directly into the camera without moving. 35mm film grain, even soft lighting, muted pastel palette, no camera shake, no cuts.

負向提示詞:

Plain
1handheld shake, jump cuts, subtitles, on-screen text, watermark, extra people, deformed hands, face morphing, colour shift, motion blur

AI 影片產生器介面截圖,包含輸入和輸出

Atlas Cloud 上的 Wan 2.7 Reference-to-Video 遊樂場,左側載入了兩張參考圖片和一個音訊檔案,輸出面板中顯示完成的片段

Atlas Cloud 上的 Wan 2.7 Reference-to-Video:左側掛載兩張參考圖片和一段語音片段,右側以 1080P 和 16:9 播放完成鏡頭。此截圖是以模型預設時長執行;要得到下方完整版本,請將其設為 10。

完成的片段。兩張臉都保持住、兩套服裝都保持住,台詞以步驟 3 的複製語音說出,所以這一個值得開聲音看。

女子在飯店櫃台抱貓,旁邊有門房

兩張參考肖像與完成片段的影格並排,顯示相同的臉孔和服裝

左邊是參考圖,右邊是交付片段的影格。制服的滾邊、貝雷帽、眼鏡和貓都完好度過整個過程。

Wan 3.0 多模態參考工作流程的變化形式

推到 30 秒。 同一組參考素材包可用 Seedance 2.5 Reference-to-Video 搭配 duration: 30 執行,讓你在不必等測試版的情況下獲得 Wan 3.0 承諾的長度。它最多可接受 30 張參考圖片、10 個影片和 10 段音訊,所以素材包還有成長空間。額外的 20 秒要以節拍寫進提示詞,而不是只寫氛圍,否則模型會自己灌水。

AI 影片產生器介面,顯示輸入設定和生成進度

Atlas Cloud 上的 Seedance 2.5 Reference-to-Video 遊樂場,時長設為 30,並渲染出長鏡頭

Atlas Cloud 上的 Seedance 2.5 Reference-to-Video,時長設為 30,並掛載相同的兩張參考肖像,捕捉到生成中畫面。請注意提示詞中的 @image1 @image2 標籤:這就是告訴 Seedance 哪個參考扮演哪個角色的方式。在送出之前先確認 Run 按鈕上的報價,因為它反映的是任務實際送出的時長。

同一場景的 30 秒版本,同一組參考素材包,逐鏡頭寫出節拍。

加入一段僅供動作的參考影片。 掛上一段你喜歡其節奏的片段,並在提示詞中明確說明,像是「只跟隨參考影片的剪接節奏,忽略它的主體和場景」。這就是稍早翻卡範例背後的技巧。

在動正向提示詞之前,先用負向提示詞修正漂移。 面部變形、色彩偏移和手持晃動是毀掉參考鎖定鏡頭的三個元兇;用負向提示詞壓制通常比用正向描述更省成本。

免費試用多模態參考格式

如果你想要的是這種格式本身,而不是先管參數,Atlas Cloud 上週推出了一款 免費 AI 廣告短劇產生器 ,能用同一個流程鏈,但完全不需要調整任何旋鈕。

你寫一行關於產品與賣點的說明。它會為你寫出一部雙角色喜劇劇本,包含鉤子、衝突、反轉,再渲染出一支 15 秒的影片,內建口說對白和音效。你可以掛上最多四張真實產品照片作為參考,廣告會從劇本到最終畫面都維持它們的形狀、顏色、標籤和標誌。它隨附六種風格,從搞笑迷因、劇情反轉、情境喜劇,到奢華感和強力推銷都有;對白會以你撰寫描述所用的語言回傳。

這與教學中的「雙角色 + 參考圖片 + 語音」流程鏈相同,只是少掉了撰寫提示詞,也少掉了帳單。這讓它成為一個不錯的方式,讓你在花任何錢調整之前,先了解這個格式是否適合你的產品。

想了解一堆參考靜態圖對產品影片的作用,這是 Wan 3.0 自己對這項工作的版本:五張圖片輸入,一支上市宣傳片輸出,每一張靜態圖錨定剪輯中的一個節拍。

白色和薄荷綠卡片的浮動動畫

五張參考靜態圖擴展成 Material Design 風格產品發表影片_Five_ 張參考圖片驅動一支九秒的產品影片,每張錨定一個節拍並交棒給下一張。來源:阿里巴巴官方 Wan 3.0 創作者手冊。

一支 Wan 3.0 多模態參考片段要花多少錢

步驟模型單價數量成本
1 和 2,兩張參考圖片GPT Image 2每張 $0.0092$0.02
3,語音參考MiniMax Speech 2.6 HD每 1K 字元 $0.0849 字元$0.00
4,10 秒鏡頭(1080P)Wan 2.7 Reference-to-Video1080P 下每秒 $0.1510 秒$1.50
教學總計約 $1.52
變化形式,30 秒Seedance 2.5 Reference-to-Video480P 下每秒 $0.13430 秒約 $4.02
免費路線免費 AI 廣告短劇產生器免費1 段,15 秒$0

這些是平台自己的費率,於 2026 年 8 月查詢,並按用量計費。有兩件事比人們預期更影響總額。第一是解析度:比較表中的每秒 $0.10 是 Wan 2.7 的基礎費率,而 1080P 是以 $0.15 計費,所以上面才會出現 $1.50。第二是 Seedance 會按像素數量計費,因此列出的每秒 $0.134 是 480P 的數字,而 720P 鏡頭的成本會高於直接乘法的結果。作為參考,Wan 3.0 在 1080p 下每秒 $0.20 的報導測試版費率,會讓完整的 30 秒鏡頭約為 $6,高於今天 Seedance 480P 路線的成本。

關於使用這類工具的一點提醒。 Wan 3.0 是測試版,其條款可能變動,因此在它以基礎建置流程前,請重新閱讀條款。如果你的參考圖片是真人,請先取得他們的許可,因為參考轉影片正是讓這件事變得重要的能力。本文中的示範片段是阿里巴巴自家從其公開創作者手冊生成的結果,在此僅供評論之用。

常見問題

Wan 3.0 的多模態參考實際上能接受多少參考素材?

單次呼叫最多 20 個素材,來自圖片、影片、音訊、文件和網頁。實務上限低於技術上限。每個素材只分配一個任務、每張圖片只放一個主體,大多數場景你用的會遠少於 20 個。

Wan 3.0 真的能把 PDF 或網頁變成影片嗎?

可以,這就是它真正獨特的地方。除了文字、圖片、音訊和影片之外,它還接受文件檔案和動態 URL,測試版報導列出 .doc.xls.ppt.pdf.txt。上表沒有任何其他參考轉影片模型能接受文件。

Wan 3.0 是開源嗎?我能在 ComfyUI 中執行它嗎?

不能,而且現在還不行。Wan 3.0 是封閉測試版,執行在阿里巴巴自家雲端上。較早的 Wan 世代曾以開放方式釋出,所以才會產生這種期待;但阿里巴巴尚未確認 3.0 的權重。聲稱 Wan 3.0 已有 1.3B 或 14B Apache 2.0 版本的頁面,沒有任何官方來源支持。

Wan 3.0 可以從第三方 API 使用嗎?

還不行,Atlas Cloud 也不例外。你今天可以呼叫的最接近選項是 Wan 2.7 Reference-to-Video,它的輸入形狀幾乎等同於全方位參考,只差文件和網頁模態;如果你需要完整 30 秒,則可用 Seedance 2.5 Reference-to-Video。

測試參考鎖定的雙角色影片,最便宜的方式是什麼?

上面連結的免費 AI 廣告短劇產生器。四張參考照片輸入,一支 15 秒口說雙角色片段輸出,沒有參數、沒有花費。如果它能鎖住你的產品和格式,再去調校付費流程鏈。

為什麼有了參考圖片,角色還是會漂移?

三個原因,依頻率排序。一個參考被賦予兩個任務,所以它同時被要求固定臉部和地點。參考圖片中有超過一個人或背景太複雜,模型不知道要鎖定哪個部分。或者是漂移來自渲染瑕疵,而非參考失敗;這種情況下,在改寫任何東西之前,先把 face morphing, colour shift 放進負向提示詞。

最新模型

一個 API,暢享全模態 AI。

探索全部模型