
最新更新: Wan 3.0 已於 2026 年 8 月 24 日正式上線。
兩台剪輯監視器並排播放同一段沙漠加油站畫面,一台下方顯示完整 30 秒時間軸,另一台則分割成兩段
在第 20 秒,油槍噴出鮮嫩的綠草,還帶著水珠。馬兒瞇起眼睛,一臉享受。加油員嘴裡的牙籤掉了出來。
這個笑點只有在一個連續 30 秒的鏡頭裡才成立。把四個 8 秒的片段剪在一起,馬的毛色會變,墨鏡形狀會變,天空色調會暖一格,而笑點就在接縫處死掉。
所以當 Wan 3.0 和 Seedance 2.5 同時宣稱支援原生 30 秒、一鏡到底、無拼接時,這就不再只是個基準測試故事。這是 AI 影片模型首次能在單一鏡頭中完成鋪陳、轉折和高潮。
我拆解了規格,對照阿里巴巴自家公布的示範檔逐一核對,發現了一件沒人寫出來的事:兩個模型都說是 30 秒,但背後解析度根本不是同一回事。
重點摘要
- 兩個模型確實都能單次生成 30 秒。這部分不是行銷話術。Wan 3.0 支援 2 到 30 秒,並有智慧時長選項;Seedance 2.5 支援 4 到 30 秒。
- 只有 Wan 3.0 能在 30 秒時以原生 1080p 輸出。Seedance 2.5 原生僅支援 480p 和 720p。其 1080p、1440p 和 4K 選項都是基於 720p 來源的後製放大,而其 API 文件也明確指出 4K 等級「並非原生 4K 生成」。
- Seedance 2.5 在參考素材數量上勝出:最多 30 張圖片、10 個影片、10 個音訊檔案,總計 50 個。Wan 3.0 的創作者手冊則將參考素材上限設為 20 個。
- Wan 3.0 擁有其他模型沒有的輸入選項:
.doc、.xls、.ppt、.pdf、.txt檔案以及即時網頁,可直接作為創意參考素材。 - 目前只有其中一個模型能在阿里巴巴以外的地方實際執行。Wan 3.0 在阿里雲模型工作室和通義千問雲上處於公開測試階段,第三方 API 存取仍在陸續開放中。Seedance 2.5 則已在 Atlas Cloud 上線,時長控制可直接設定為 30 秒。
- 想在付費生成前先測試 30 秒的故事結構?Atlas Cloud 的免費 AI 廣告短劇產生器提供一次免費試用:生成一支 15 秒的完整廣告,包含口白和音效,無浮水印下載。
阿里巴巴官方 Wan 3.0 示範,取自通義 Wan 3.0 創作者手冊。一鏡到底,無剪接,30.07 秒。以 ffprobe 測量:1920x1072,24fps,內嵌 AAC 立體聲音訊。開啟音效,可聽到第 29 秒的尾巴甩動和牙籤落地聲。此處僅作為比較與評論的參考素材。
Wan 3.0 vs Seedance 2.5 原生 30 秒:本月真正改變了什麼
十五秒長期以來一直是極限。Wan 2.7 止步於此。Seedance 2.0 也止步於此。過去一年你在動態牆上看到的每一部「一分鐘 AI 電影」,都是四到八個片段在非線性剪輯軟體中拼接而成,再經過調色師調校來隱藏接縫。
有兩件事在短短幾週內打破了這個極限。阿里巴巴於 2026 年 8 月 6 日開放 Wan 3.0 公開測試,支援原生 30 秒生成和完整多模態參考輸入 (AlphaSignal,2026 年 8 月)。字節跳動則將 Seedance 從 15 秒翻倍到 30 秒(2.5 版本),並明確定位為減少片段拼接及其帶來的視覺飄移問題。
「原生」在技術層面上有特定意義。它指的是對單一潛在序列進行一次前向傳遞,而非「最後一幀延伸」——後者是指模型將片段 A 的最後一幀作為起點,開始生成片段 B。延伸正是導致角色外套領子在鏡頭之間悄悄變形的原因。原生傳遞則讓整個 30 秒處於相同上下文,所以馬兒始終是同一匹馬。
加油站示範是測試這個概念最乾淨的方式。結構包含四個節拍:0 到 8 秒什麼事都沒發生,8 到 16 秒發生怪事,16 到 24 秒是笑點,24 到 30 秒是收尾。笑點在第 20 秒出現。這意味著只有在馬、墨鏡、青橙色調和固定鏡頭在前 19 秒都保持不變的情況下,笑點才能成立。拼接做不到這一點。不是因為剪輯師技術不好,而是因為片段 B 從來沒見過片段 A。
Wan 3.0 vs Seedance 2.5 原生 30 秒:畫面實際在哪裡崩壞
三十秒是十五秒的兩倍。飄移風險並非只是兩倍大,而是更糟,而且會轉移到不同的失敗模式。
拼接工作流的失敗發生在片段之間。原生 30 秒的失敗則發生在片段內部。在一篇 Seedance 2.5 短片的實作評測中,評測者發現影像在快速動作場景中出現「角色模型的視覺尖刺或不穩定」(即失諧與變形),並特別指出這些瑕疵無法透過放大修復(MindStudio,2026 年 8 月)。這對任何打算以 720p 渲染再放大到 4K 的人來說至關重要:放大只會讓變形更銳利,並不會消除它。
同一篇製作記錄提到 3.2 比 1 的拍攝比。大約 450 秒的原始生成,才能剪出 2 分 22 秒的最終成品。規劃長鏡頭工作時,要像有覆蓋拍攝的片場一樣,而不是像一個每個任務都會自動送出的渲染佇列。
該製作還有兩個發現值得直接借用。全片的視覺一致性只靠三張參考圖片:兩張角色肖像和一張場景照,即使系統允許最多 50 張參考素材。而在配音選角上,寫「American」修正了不想要的英國口音,但寫「American English」卻沒用,因為「English」這個詞會把語調拉回英國腔。
能夠撐過 30 秒的提示結構,正是阿里巴巴自己在手冊中使用的:明確標記時間戳記的節拍。不要寫一段感覺。要寫 0-8s、8-16s、16-24s、24-30s,每個區塊指定自己的鏡頭行為和事件,最後用一句涵蓋整個片段的音訊說明收尾。你會在下方步驟 4 中看到完全相同的骨架,因為我保留了阿里巴巴的結構,只進行了翻譯。
若想立即在託管環境中測試,請開啟 Atlas Cloud 上的 Wan 3.0,並在發布工作流程前先測試類似下方的提示。

Wan 3.0 vs Seedance 2.5 原生 30 秒:規格、價格與今日可執行內容
以下是真實的現況,也是兩個模型不再具有可比性的部分。
請閱讀解析度那一行兩次,因為這就是整篇文章的重點。Atlas Cloud 自家的 Seedance 2.5 文字轉影片 API 文件說明:720p-esr 是增強 480p 來源;1080p-esr、1440p-esr 和 4k-esr 都是增強 720p 來源;而 4K 選項提供的是 2160 像素短邊,但「並非原生 4K 生成」。因此,一個標示為 4K 的 30 秒 Seedance 片段,實際細節只有 720p,只是重新取樣。相比之下,Wan 3.0 的價格表直接列出 1080p 等級,每秒 0.20 美元,而阿里巴巴自家公布的 30 秒示範檔案測量為 1920x1072。
這個限制的好處是:整個測試可以在一個瀏覽器分頁中,使用三個模型完成,無需任何本地設定。
| 測試角色 | 模型 | 標示價格 |
|---|---|---|
| 開場畫面 | GPT Image 2 文字轉圖片 | 從 $0.009 / 張起 |
| 原生 30 秒生成 | Seedance 2.5 文字轉影片 | 從 $0.134 / 秒起 |
標示價格於 2026 年 8 月在 Atlas Cloud 模型頁面驗證。請視為最低價,而非報價。這些模型都是根據你實際要求的內容計費,而執行按鈕會在你點擊前顯示當前設定的確切價格。在此測試中,按鈕顯示一張高品質、2048x1152 的 GPT Image 2 圖片報價為 $0.1745;而一個五秒、720p、16:9 的 Seedance 2.5 任務報價為 $1.514799,相當於每秒約 $0.30,而非標示的 $0.134。標示價格是 480p 的費率。請查閱按鈕,而非目錄。Seedance 2.5 也提供參考素材轉影片端點,價格相同為每秒 $0.134,適合想挑戰 50 個參考素材上限的使用者。
如何在 Seedance 2.5 上重現這個原生 30 秒測試
五個步驟,三個模型,全部在瀏覽器中完成。請逐字複製提示。
步驟 1:鎖定帶時間戳記的 30 秒骨架
先不要執行任何東西。先閱讀結構,因為這決定了你的 30 秒能否撐住。
本文頂部的 Wan 3.0 加油站示範,由四個標記區塊構成,並在開頭統一說明固定鏡頭法則:冷靜客觀觀察、固定中景、僅在荒謬節拍時突然使用極特寫。每個事件都綁定在一個時間範圍。音訊則在結尾用一句話涵蓋全部 30 秒。
以下是空的骨架。填入內容後,你就擁有原生 30 秒模型能實際追蹤的提示:
Plain1一部 30 秒的 [類型] 短片,場景設定在 [地點]。[視覺風格、色調、飽和度]。鏡頭語言:[法則],並以 [例外] 作為點綴。 2 30-8 秒:[鋪陳,廣角,建立正常世界,引入地平線上的異常] 4 58-16 秒:[異常開始行動,仍以正常方式處理,一個主觀鏡頭或反應插入鏡頭] 6 716-24 秒:[高潮,對事物本身極特寫,硬切到反應臉部] 8 924-30 秒:[收尾,一個小小的物理動作,結束笑點] 10 11音訊:[環境音,三到四個具體的場景內音效,最後一個細小的聲音]。無音樂、無對白、無畫面文字。
阿里巴巴參考檔案的測量規格(供任何人驗證):30.07 秒,1920x1072,24fps,AAC 立體聲。這是 Seedance 測試的評比基準。
步驟 2:生成開場畫面
你需要一個固定的視覺錨點,讓 15 秒和 30 秒的生成從同一個世界開始。開啟 GPT Image 2 文字轉圖片。
設定: 品質 high,長寬比 16:9,1 張圖片。
Plain1一張廣角、靜止的定場鏡頭,畫面是明亮沙漠中一座孤獨的 66 號公路風格加油站。復古黃橙藍色建築,油漆微微褪色;前方是褪色的復古紅色加油機;旁邊有一家小便利商店,門口放著一台褪色的可樂販賣機。前景是龜裂的橙色乾燥土地,遠方是溫暖的赭紅色山脈,無雲清澈的青藍色天空。一名穿著油膩藍色工作服、戴著超大黑色太陽眼鏡的加油站員工,半睡半醒地癱在門口的椅子上,嘴裡叼著牙籤。嚴格的明亮青橙調色,高飽和度,高亮度,電影級寫實,固定鏡頭,16:9。

Atlas Cloud 上的 GPT Image 2 遊樂場,品質設為 high,16:9,輸出面板中顯示生成的 Route 66 加油站定場鏡頭
Atlas Cloud 上的 GPT Image 2:品質 high,16:9,一張圖片。執行按鈕對這張畫面的報價為 $0.1745,這是一張 2048x1152 高品質渲染的實際成本。模型頁面上的 $0.009 是最低價。

使用 GPT Image 2 生成的 Route 66 加油站定場畫面,青色天空和橙色龜裂土地,員工在門邊打盹
開場畫面。這是步驟 3 的輸入,也是步驟 4 的視覺目標。使用 openai/gpt-image-2 生成。
步驟 3:挑戰 15 秒極限
設定: 首幀 = 你的步驟 2 輸出,duration 拖到最大值 15,解析度 1080P。
Plain1固定廣角鏡頭保持不動。一名戴寬邊帽的女牛仔騎著一匹真馬,從地平線以步行速度出現。打盹的員工被馬蹄聲驚醒,推了推太陽眼鏡,坐直身體,嚼著牙籤,一臉不以為然。她俐落地下馬,牽著馬直接走向復古加油機。明亮的青橙調色,高飽和度,寫實,冷靜觀察式鏡頭,無剪接。
下拉選單停在 15 秒。這就是這一步的重點。你的笑點預定在第 20 秒,而這個管線無法一次到第 20 秒。要達到那裡,你必須從最後一幀生成第二個片段,但一旦這麼做,馬就變成了另一匹馬。

步驟 4:執行完整的原生 30 秒生成
設定: duration = 30,resolution = 720p,ratio = 16:9,generate_audio = 開啟,output_format = mp4,無浮水印。
刻意選擇 720p,而非 1080p-esr。720p 是模型的真實上限,因此這是像素對像素的比較,而非與放大器的比較。
以下提示是阿里巴巴自家加油站示範提示的忠實翻譯,取自 Wan 3.0 創作者手冊,並重新結構化。相同的節拍、相同的時間點、相同的鏡頭法則、相同的音訊清單。
Plain1一部 30 秒的荒誕冷面喜劇短片,場景設定在明亮沙漠中一座曬得褪色的 66 號公路風格加油站。寫實,嚴格的明亮青橙調色,高飽和度和高亮度,讓荒誕事件發生在一個完全正常、幾乎美麗的世界中。鏡頭語言:冷靜、客觀觀察,主要為固定中景和緩慢橫移,無情感引導,在荒誕節拍時突然使用極特寫。 2 30-8 秒:廣角,固定。青色天空,飄浮的塵土。復古黃橙藍色加油站獨自矗立在路邊;一名穿著油膩藍色工作服、戴著巨大黑色太陽眼鏡的員工,在椅子上打盹,嘴裡叼著牙籤。只有風聲。地平線上,一名女牛仔騎著真馬以步行速度出現。切到中景:馬蹄聲驚醒他,他推了推太陽眼鏡,坐直身體,將這對人馬解讀為「又一個來問路的」。 4 58-16 秒:她什麼都沒說。她俐落地下了馬,牽著馬直接走向老舊的加油機。馬隨意地把頭湊到加油機旁,就像以前做過一樣。從他太陽眼鏡後方短暫的輕微魚眼主觀鏡頭,女人和馬看起來更奇怪了。特寫:他皺起眉頭,摘下太陽眼鏡,正要大喊。慢動作特寫:當眼鏡摘下時,她將油槍對準馬的嘴巴,並扣下扳機。 6 716-24 秒:油槍的極特寫。噴出來的不是汽油,而是一股股鮮嫩亮綠的草,還帶著水珠。硬切到員工臉部的極特寫,定格:眼睛瞪得像銅鈴,嘴巴微張,牙籤忘了嚼。中景:馬開心吃草,滿足地瞇起眼睛,然後用力甩了一下尾巴,揚起的灰塵正好落在仍驚呆的員工臉上。 8 924-30 秒:「加滿」了草。她將油槍掛回加油機,從口袋裡掏出硬幣,走到商店門口,將硬幣叮噹作響地丟進櫃檯上的錫罐。她回頭瞥了一眼呆若木雞的員工;帽沿下,她的嘴角微微上揚。她重新上馬,揚起一陣塵土騎走了。鏡頭緩慢推向員工:同樣僵住的姿勢,滿臉灰塵,太陽眼鏡還捏在手裡,最後,牙籤從他嘴裡掉了下來,發出輕微的「喀」一聲。 10 11音訊:全程乾燥的沙漠風聲,馬蹄聲,加油機手柄的機械咔噠聲,濕草噴射聲,尾巴甩動聲,硬幣掉進錫罐聲,以及牙籤落地時的一聲輕微「喀」。無音樂、無對白、無畫面文字。
一個能幫你省錢的警告,和步驟 3 一樣的陷阱:將時長滑桿拖到 30,而不是在數字框中輸入 30。 數字框會顯示 30,但滑桿可能仍停留在預設的五秒,而執行按鈕會報價五秒。點擊前請檢查報價。在 720p 和 16:9 下,五秒任務報價 $1.514799,因此真正的 30 秒生成大約是這個價格的六倍。
這一步沒有完成後的截圖。三次自動擷取嘗試都送出了滑桿預設值(五秒)而非 30 秒,為了不展示一個標示為 30 秒的五秒片段,這裡省略截圖。以上提示和設定就是你需要貼上和調整的內容。
步驟 5:誠實檢視飄移
以下是 Seedance 2.5 使用相同提示、以原生 30 秒、720p、16:9、啟用音訊生成的結果。
Seedance 2.5,完全複製上述 Wan 3.0 加油站提示:原生 30 秒單次生成,1280x720,24fps,內嵌音訊。相同的四個節拍,女牛仔和馬抵達,油槍搞笑橋段,員工認知失調的特寫。與頂部的 Wan 3.0 片段並排比較,進行同條件對比。
將兩個片段並排,檢查五個具體事項。不要檢查「哪個看起來比較好」,那是品味問題,會浪費你的下午。
- 毛色和服裝一致性。 第 29 秒的馬和第 6 秒的馬顏色相同嗎?眼鏡摘下後再放回手中,形狀一樣嗎?
- 色調穩定性。 取樣第 2 秒和第 28 秒的天空。青橙調色在長時間生成中,往往會比預期更暖。
- 第 20 秒的物理節拍。 油槍噴出草是一個物理要求。草是呈弧線落下帶著重量,還是像紋理一樣淡入?
- 鏡頭紀律。 提示要求固定鏡頭。數數鏡頭未經要求而自行推近的次數。這是長時間生成最常見的失敗模式:模型用完了排程事件,就用移動來填滿時間。
- 快速動作變形。 尾巴甩動和揚起灰塵是片段中速度最快的動作。根據 MindStudio 的製作筆記,這正是失諧集中的地方,也是放大無法修復的問題。
根據這五項評分,而不是感覺。這才是你能向客戶辯護的比較。
另外三組 Wan 3.0 vs Seedance 2.5 原生 30 秒對應提示
一個示範只是軼事。以下是來自同一本手冊的三個官方 Wan 3.0 30 秒檔案,每個都針對 30 秒問題的不同部分進行壓力測試。對於海怪和黑暗奇幻獨白,Seedance 2.5 端使用相同提示以原生 30 秒生成,並直接嵌入在下方,以便你觀看兩者,而非僅聽我敘述。
| 提示 | 壓力測試內容 | Wan 3.0 官方檔案,測量結果 | Seedance 2.5 端,相同提示 |
|---|---|---|---|
| 海怪災難電影 | 10 個分鏡腳本加管弦樂配樂,全部在 30 秒內 | 1920x1072, 24fps, 30.07s, AAC | 以 30 秒生成,嵌入下方;移除了一個 IP 名稱和船隻品牌文字,以通過 Seedance 的內容過濾器,故事板其餘部分完全相同 |
| 黑暗奇幻英文獨白 | 原生英文語音和嘴型同步,配合緩慢連續推鏡 | 1280x720, 24fps, 30.05s, AAC | 以相同提示逐字生成 30 秒,嵌入下方 |
| 2D 運動動畫,兩行提示 | 模型能否在幾乎沒有指示的情況下填滿 30 秒 | 1280x720, 24fps, 30.05s, AAC | 此處未生成;僅以 Wan 的畫面格線展示,以閱讀整體時間結構 |
| 甩鏡喜劇短片(排除) | 8 次甩鏡和 8 個情緒節拍,無剪接 | 1280x720, 24fps, 30.04s, AAC | 未執行:對白密度為中文專用,英文改寫無法公平比較 |
官方 Wan 3.0 示範:十個分鏡腳本和完整的管弦樂鋪陳,在一個 30 秒的單次生成中完成,解析度 1920x1072。這是原生 1080p 最有力的論證,因為水的體積和生物潮濕皮膚的細節,正是 720p 放大版本會發明而非解析的內容。阿里巴巴通義創作者手冊,用於比較和評論。
Seedance 2.5,使用相同的十個分鏡災難提示,原生 30 秒,開啟音效。暴風雨中的漁船,驚恐的甲板水手,巨浪湧起,然後深海巨獸在閃電中破水而出。移除了 IP 參考和船體品牌文字,以通過 Seedance 的內容過濾器;故事板其餘部分完全相同,這使得水體體積和潮濕皮膚細節的比較,與上方 Wan 3.0 片段形成公平對比。
官方 Wan 3.0 示範,開啟音效。原生英文反派對白:「Ripe enough for the void」,在一個緩慢連續上搖鏡頭中完成,無剪接。這是英語團隊應該測試的片段,因為語音、嘴型同步和 30 秒連續鏡頭運動必須同時維持。
Seedance 2.5,完全複製相同的黑暗奇幻提示,原生 30 秒,開啟音效。相同的紫色眼睛反派,星符文標記,在他張開的手掌中形成的陰影星雲,以及兩句英文台詞。觀察嘴型同步和單一連續推鏡是否能像 Wan 3.0 端一樣,撐過完整 30 秒。
如果你要執行這個對應的 Seedance 2.5 測試,請逐字保留兩句英文台詞,並記得製作筆記中的口音訣竅:寫「American」,不要寫「American English」。「English」這個詞會把語調拉回英國腔。
第三個是意外的驚喜。阿里巴巴手冊中的 2D 運動動畫提示只有兩行。沒有時間戳記,沒有分鏡表,只是一個拳擊手在打沙袋,疲憊、痛苦。從這樣的提示生成 30 秒,是對模型能否自行創造結構的真正考驗。以下是從其運行時間中取樣的畫面:

官方 Wan 3.0 2D 運動動畫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣,顯示拳擊手設計和健身房背景在完整 30 秒內的變化
官方 Wan 3.0 2D 運動動畫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣。相同的角色設計、相同的背心、相同的沙袋、相同的置物櫃排,在提示未要求的情況下,從廣角變為特寫。這裡使用靜態畫面格線而非影片,因為比較重點是單一檔案內的時間變化,而非動作。
實用解讀:使用兩行提示時,模型自行創造了覆蓋鏡頭,從固定廣角移動到汗水和疲憊的特寫,並在此過程中保持角色設計。這是好消息。代價是你放棄了對事件發生時間的控制。如果你需要 30 秒在特定秒數精準落地一個節拍,請寫下時間戳記。
在付費之前,免費測試原生 30 秒敘事
一個 30 秒的 720p Seedance 2.5 生成,根據實際解析度而非目錄低價計算,報價約為 9 美元。Wan 3.0 價格表上的 30 秒 1080p 生成為 6.00 美元。以生產標準來看都不算貴,但考慮到 3.2 比 1 的拍攝比,你不是買一個片段,而是買三到四個。
在花錢之前,值得先回答一個更便宜的問題:我的劇本真的能撐住一個連續鏡頭嗎?多數 30 秒的失敗並非模型失敗,而是結構失敗:三個節拍塞進只能容納兩個的空間,或者在第 26 秒寫了高潮,但第 8 到 20 秒之間沒有任何東西支撐。
Atlas Cloud 的免費 AI 廣告短劇產生器可以免費回答這個問題。你提供一個產品描述和最多四張產品照片(每張小於 8MB),選擇六種風格之一(搞笑迷因、劇情反轉、情境喜劇、溫馨、奢華、強力推銷),它會先寫出一個包含兩個角色的劇本,具有三秒鉤子、衝突和轉折,然後根據劇本建立每個鏡頭。角色會大聲說出台詞,音效會渲染到影片中。
誠實的限制:這是 15 秒,而不是 30 秒;你需要登入;而且在你補充點數之前,只能免費生成一次。但一個具有鉤子、衝突和轉折的 15 秒,足以告訴你三個節拍是否能呼吸。如果結構在那裡可行,就將相同的節拍套用到步驟 1 的 0-8s / 8-16s / 16-24s / 24-30s 骨架,然後花九美元進行真正的原生 30 秒生成。
Wan 3.0 vs Seedance 2.5 原生 30 秒片段的實際成本
| 設定 | 費率 | 時長 | 單一片段 |
|---|---|---|---|
| Wan 3.0,原生 1080p(僅限阿里雲) | $0.20 / 秒 | 30s | $6.00 |
| Wan 3.0,原生 720p(僅限阿里雲) | $0.10 / 秒 | 30s | $3.00 |
| Wan 3.0,原生 480p(僅限阿里雲) | $0.05 / 秒 | 30s | $1.50 |
| Seedance 2.5,原生 720p,在 Atlas Cloud 上 | 720p 實測約 $0.30 / 秒,標示從 $0.134 起 | 30s | 約 $9.09 |
| GPT Image 2 開場畫面,高品質,2048x1152 | 標示從 $0.009 / 張起 | 1 張 | 報價 $0.1745 |
真正決定性的比較:Wan 3.0 在 720p 下每秒比 Seedance 2.5 的 720p 便宜,而在 1080p 下,它是兩者中唯一真正提供真實像素的。Seedance 2.5 的答案則是 50 個參考素材槽、即時可用性,以及今天下午就能對接上線的運作中 API。
這些原生 30 秒片段的來源與許可說明
本文中的每個 Wan 3.0 片段和每個 Wan 3.0 提示,均來自阿里巴巴公開發布的通義 Wan 3.0 創作者手冊,此處僅為比較和評論而重現,已標明來源,未經修改,且未移除浮水印。Seedance 2.5 輸出的商業使用受字節跳動和火山引擎條款約束;Atlas Cloud 端的 API 計費和資料處理則受 Atlas Cloud 自身條款約束。本測試中未重現任何真實人物的肖像。如果你要交付客戶專案,請閱讀你所呼叫的特定端點的模型條款,而非部落格摘要。
常見問題
Wan 3.0 的原生 30 秒真的是單次生成,還是拼接片段?
單次生成。Wan 3.0 可在單次生成中產生 2 到 30 秒,並有智慧時長選項,因此它也能決定片段不需要完整的 30 秒。這與最後一幀延伸不同,後者會從第一個片段的最後一幀生成第二個片段,導致身份在接縫處飄移。
哪一個在 30 秒時真的是 1080p,Wan 3.0 還是 Seedance 2.5?
Wan 3.0。它的價格表上有原生 1080p 等級,而阿里巴巴自家的 30 秒示範檔案測量為 1920x1072。Seedance 2.5 原生僅生成 480p 和 720p;其 1080p、1440p 和 4K 選項是基於 720p 來源的增強,且其 API 文件將 4K 等級描述為「並非原生 4K 生成」。
畫面在第 25 秒還是會崩壞嗎?
有可能,但失敗模式已經改變。不再是片段之間可見的接縫,而是鏡頭內部的變形和失諧,集中在快速動作段落,且放大無法修復。一份有記載的 Seedance 2.5 短片製作記錄了 3.2 比 1 的拍攝比,因此規劃長鏡頭時要考慮覆蓋拍攝。
哪個模型接受更多參考素材?
Seedance 2.5,差距很大:30 張圖片、10 個影片、10 個音訊檔案,總計 50 個,其中參考影片和音訊每次請求各限制在 30 秒內。Wan 3.0 的手冊將參考素材上限設為 20 個,但它是唯一接受 .pdf、.ppt、.xls、.doc、.txt 檔案和即時網頁作為創意輸入的模型。
Wan 3.0 會有開放權重嗎?
沒有官方承諾。截至 2026 年 8 月的公開測試版,尚未發布任何 Wan 3.0 權重、Hugging Face 檢查點或 ComfyUI 節點,旗艦影片系列的官方開放權重僅止於 Wan 2.2(Kingy AI,2026 年 8 月)。請將你讀到的任何關於 3.0 權重發布的其他資訊視為猜測,直到阿里巴巴另有說法。






