Seedance 2.0 Mini & Fast API 全球最低價 —— 比官方定價最高低 68%

Wan 3.0 vs Seedance 2.5 原生30秒:兩者都說30秒,只有一個是真正的1080p

Wan 3.0 與 Seedance 2.5 原生30秒,對照阿里巴巴自家的示範提示進行檢測:哪一個能渲染真正的1080p像素,哪一個是進行升頻(upscale),以及哪一個你現在就能執行。

Two monitors showing a western scene next to storyboards

最新更新: Wan 3.0 已於 2026 年 8 月 24 日正式上線。

兩台剪輯監視器並排播放同一段沙漠加油站畫面,一台下方顯示完整 30 秒時間軸,另一台則分割成兩段

在第 20 秒,油槍噴出鮮嫩的綠草,還帶著水珠。馬兒瞇起眼睛,一臉享受。加油員嘴裡的牙籤掉了出來。

這個笑點只有在一個連續 30 秒的鏡頭裡才成立。把四個 8 秒的片段剪在一起,馬的毛色會變,墨鏡形狀會變,天空色調會暖一格,而笑點就在接縫處死掉。

所以當 Wan 3.0 和 Seedance 2.5 同時宣稱支援原生 30 秒、一鏡到底、無拼接時,這就不再只是個基準測試故事。這是 AI 影片模型首次能在單一鏡頭中完成鋪陳、轉折和高潮。

我拆解了規格,對照阿里巴巴自家公布的示範檔逐一核對,發現了一件沒人寫出來的事:兩個模型都說是 30 秒,但背後解析度根本不是同一回事。

重點摘要

  1. 兩個模型確實都能單次生成 30 秒。這部分不是行銷話術。Wan 3.0 支援 2 到 30 秒,並有智慧時長選項;Seedance 2.5 支援 4 到 30 秒。
  2. 只有 Wan 3.0 能在 30 秒時以原生 1080p 輸出。Seedance 2.5 原生僅支援 480p 和 720p。其 1080p、1440p 和 4K 選項都是基於 720p 來源的後製放大,而其 API 文件也明確指出 4K 等級「並非原生 4K 生成」。
  3. Seedance 2.5 在參考素材數量上勝出:最多 30 張圖片、10 個影片、10 個音訊檔案,總計 50 個。Wan 3.0 的創作者手冊則將參考素材上限設為 20 個。
  4. Wan 3.0 擁有其他模型沒有的輸入選項:.doc、.xls、.ppt、.pdf、.txt 檔案以及即時網頁,可直接作為創意參考素材。
  5. 目前只有其中一個模型能在阿里巴巴以外的地方實際執行。Wan 3.0 在阿里雲模型工作室和通義千問雲上處於公開測試階段,第三方 API 存取仍在陸續開放中。Seedance 2.5 則已在 Atlas Cloud 上線,時長控制可直接設定為 30 秒。
  6. 想在付費生成前先測試 30 秒的故事結構?Atlas Cloud 的免費 AI 廣告短劇產生器提供一次免費試用:生成一支 15 秒的完整廣告,包含口白和音效,無浮水印下載。

阿里巴巴官方 Wan 3.0 示範,取自通義 Wan 3.0 創作者手冊。一鏡到底,無剪接,30.07 秒。以 ffprobe 測量:1920x1072,24fps,內嵌 AAC 立體聲音訊。開啟音效,可聽到第 29 秒的尾巴甩動和牙籤落地聲。此處僅作為比較與評論的參考素材。

Wan 3.0 vs Seedance 2.5 原生 30 秒:本月真正改變了什麼

十五秒長期以來一直是極限。Wan 2.7 止步於此。Seedance 2.0 也止步於此。過去一年你在動態牆上看到的每一部「一分鐘 AI 電影」,都是四到八個片段在非線性剪輯軟體中拼接而成,再經過調色師調校來隱藏接縫。

有兩件事在短短幾週內打破了這個極限。阿里巴巴於 2026 年 8 月 6 日開放 Wan 3.0 公開測試,支援原生 30 秒生成和完整多模態參考輸入 (AlphaSignal,2026 年 8 月)。字節跳動則將 Seedance 從 15 秒翻倍到 30 秒(2.5 版本),並明確定位為減少片段拼接及其帶來的視覺飄移問題。

「原生」在技術層面上有特定意義。它指的是對單一潛在序列進行一次前向傳遞,而非「最後一幀延伸」——後者是指模型將片段 A 的最後一幀作為起點,開始生成片段 B。延伸正是導致角色外套領子在鏡頭之間悄悄變形的原因。原生傳遞則讓整個 30 秒處於相同上下文,所以馬兒始終是同一匹馬。

加油站示範是測試這個概念最乾淨的方式。結構包含四個節拍:0 到 8 秒什麼事都沒發生,8 到 16 秒發生怪事,16 到 24 秒是笑點,24 到 30 秒是收尾。笑點在第 20 秒出現。這意味著只有在馬、墨鏡、青橙色調和固定鏡頭在前 19 秒都保持不變的情況下,笑點才能成立。拼接做不到這一點。不是因為剪輯師技術不好,而是因為片段 B 從來沒見過片段 A。

Wan 3.0 vs Seedance 2.5 原生 30 秒:畫面實際在哪裡崩壞

三十秒是十五秒的兩倍。飄移風險並非只是兩倍大,而是更糟,而且會轉移到不同的失敗模式。

拼接工作流的失敗發生在片段之間。原生 30 秒的失敗則發生在片段內部。在一篇 Seedance 2.5 短片的實作評測中,評測者發現影像在快速動作場景中出現「角色模型的視覺尖刺或不穩定」(即失諧與變形),並特別指出這些瑕疵無法透過放大修復(MindStudio,2026 年 8 月)。這對任何打算以 720p 渲染再放大到 4K 的人來說至關重要:放大只會讓變形更銳利,並不會消除它。

同一篇製作記錄提到 3.2 比 1 的拍攝比。大約 450 秒的原始生成,才能剪出 2 分 22 秒的最終成品。規劃長鏡頭工作時,要像有覆蓋拍攝的片場一樣,而不是像一個每個任務都會自動送出的渲染佇列。

該製作還有兩個發現值得直接借用。全片的視覺一致性只靠三張參考圖片:兩張角色肖像和一張場景照,即使系統允許最多 50 張參考素材。而在配音選角上,寫「American」修正了不想要的英國口音,但寫「American English」卻沒用,因為「English」這個詞會把語調拉回英國腔。

能夠撐過 30 秒的提示結構,正是阿里巴巴自己在手冊中使用的:明確標記時間戳記的節拍。不要寫一段感覺。要寫 0-8s、8-16s、16-24s、24-30s,每個區塊指定自己的鏡頭行為和事件,最後用一句涵蓋整個片段的音訊說明收尾。你會在下方步驟 4 中看到完全相同的骨架,因為我保留了阿里巴巴的結構,只進行了翻譯。

若想立即在託管環境中測試,請開啟 Atlas Cloud 上的 Wan 3.0,並在發布工作流程前先測試類似下方的提示。

Wan 3.0 prompt and generated effect screenshot for wan-30-vs-seedance-25-native-30s

Wan 3.0 vs Seedance 2.5 原生 30 秒:規格、價格與今日可執行內容

以下是真實的現況,也是兩個模型不再具有可比性的部分。

請閱讀解析度那一行兩次,因為這就是整篇文章的重點。Atlas Cloud 自家的 Seedance 2.5 文字轉影片 API 文件說明:720p-esr 是增強 480p 來源;1080p-esr、1440p-esr 和 4k-esr 都是增強 720p 來源;而 4K 選項提供的是 2160 像素短邊,但「並非原生 4K 生成」。因此,一個標示為 4K 的 30 秒 Seedance 片段,實際細節只有 720p,只是重新取樣。相比之下,Wan 3.0 的價格表直接列出 1080p 等級,每秒 0.20 美元,而阿里巴巴自家公布的 30 秒示範檔案測量為 1920x1072。

這個限制的好處是:整個測試可以在一個瀏覽器分頁中,使用三個模型完成,無需任何本地設定。

測試角色模型標示價格
開場畫面GPT Image 2 文字轉圖片從 $0.009 / 張起
原生 30 秒生成Seedance 2.5 文字轉影片從 $0.134 / 秒起

標示價格於 2026 年 8 月在 Atlas Cloud 模型頁面驗證。請視為最低價,而非報價。這些模型都是根據你實際要求的內容計費,而執行按鈕會在你點擊前顯示當前設定的確切價格。在此測試中,按鈕顯示一張高品質、2048x1152 的 GPT Image 2 圖片報價為 $0.1745;而一個五秒、720p、16:9 的 Seedance 2.5 任務報價為 $1.514799,相當於每秒約 $0.30,而非標示的 $0.134。標示價格是 480p 的費率。請查閱按鈕,而非目錄。Seedance 2.5 也提供參考素材轉影片端點,價格相同為每秒 $0.134,適合想挑戰 50 個參考素材上限的使用者。

如何在 Seedance 2.5 上重現這個原生 30 秒測試

五個步驟,三個模型,全部在瀏覽器中完成。請逐字複製提示。

步驟 1:鎖定帶時間戳記的 30 秒骨架

先不要執行任何東西。先閱讀結構,因為這決定了你的 30 秒能否撐住。

本文頂部的 Wan 3.0 加油站示範,由四個標記區塊構成,並在開頭統一說明固定鏡頭法則:冷靜客觀觀察、固定中景、僅在荒謬節拍時突然使用極特寫。每個事件都綁定在一個時間範圍。音訊則在結尾用一句話涵蓋全部 30 秒。

以下是空的骨架。填入內容後,你就擁有原生 30 秒模型能實際追蹤的提示:

Plain
1一部 30 秒的 [類型] 短片,場景設定在 [地點]。[視覺風格、色調、飽和度]。鏡頭語言:[法則],並以 [例外] 作為點綴。
2
30-8 秒:[鋪陳,廣角,建立正常世界,引入地平線上的異常]
4
58-16 秒:[異常開始行動,仍以正常方式處理,一個主觀鏡頭或反應插入鏡頭]
6
716-24 秒:[高潮,對事物本身極特寫,硬切到反應臉部]
8
924-30 秒:[收尾,一個小小的物理動作,結束笑點]
10
11音訊:[環境音,三到四個具體的場景內音效,最後一個細小的聲音]。無音樂、無對白、無畫面文字。

阿里巴巴參考檔案的測量規格(供任何人驗證):30.07 秒,1920x1072,24fps,AAC 立體聲。這是 Seedance 測試的評比基準。

步驟 2:生成開場畫面

你需要一個固定的視覺錨點,讓 15 秒和 30 秒的生成從同一個世界開始。開啟 GPT Image 2 文字轉圖片。

設定: 品質 high,長寬比 16:9,1 張圖片。

Plain
1一張廣角、靜止的定場鏡頭,畫面是明亮沙漠中一座孤獨的 66 號公路風格加油站。復古黃橙藍色建築,油漆微微褪色;前方是褪色的復古紅色加油機;旁邊有一家小便利商店,門口放著一台褪色的可樂販賣機。前景是龜裂的橙色乾燥土地,遠方是溫暖的赭紅色山脈,無雲清澈的青藍色天空。一名穿著油膩藍色工作服、戴著超大黑色太陽眼鏡的加油站員工,半睡半醒地癱在門口的椅子上,嘴裡叼著牙籤。嚴格的明亮青橙調色,高飽和度,高亮度,電影級寫實,固定鏡頭,16:9。

Screenshot of an AI image generator with prompt and output image

Atlas Cloud 上的 GPT Image 2 遊樂場,品質設為 high,16:9,輸出面板中顯示生成的 Route 66 加油站定場鏡頭

Atlas Cloud 上的 GPT Image 2:品質 high,16:9,一張圖片。執行按鈕對這張畫面的報價為 $0.1745,這是一張 2048x1152 高品質渲染的實際成本。模型頁面上的 $0.009 是最低價。

Man resting outside a vintage Route 66 desert gas station

使用 GPT Image 2 生成的 Route 66 加油站定場畫面,青色天空和橙色龜裂土地,員工在門邊打盹

開場畫面。這是步驟 3 的輸入,也是步驟 4 的視覺目標。使用 openai/gpt-image-2 生成。

步驟 3:挑戰 15 秒極限

設定: 首幀 = 你的步驟 2 輸出,duration 拖到最大值 15,解析度 1080P。

Plain
1固定廣角鏡頭保持不動。一名戴寬邊帽的女牛仔騎著一匹真馬,從地平線以步行速度出現。打盹的員工被馬蹄聲驚醒,推了推太陽眼鏡,坐直身體,嚼著牙籤,一臉不以為然。她俐落地下馬,牽著馬直接走向復古加油機。明亮的青橙調色,高飽和度,寫實,冷靜觀察式鏡頭,無剪接。

下拉選單停在 15 秒。這就是這一步的重點。你的笑點預定在第 20 秒,而這個管線無法一次到第 20 秒。要達到那裡,你必須從最後一幀生成第二個片段,但一旦這麼做,馬就變成了另一匹馬。

Screenshot of an AI video generator interface with input and output

步驟 4:執行完整的原生 30 秒生成

開啟 Seedance 2.5 文字轉影片。

設定: duration = 30,resolution = 720p,ratio = 16:9,generate_audio = 開啟,output_format = mp4,無浮水印。

刻意選擇 720p,而非 1080p-esr。720p 是模型的真實上限,因此這是像素對像素的比較,而非與放大器的比較。

以下提示是阿里巴巴自家加油站示範提示的忠實翻譯,取自 Wan 3.0 創作者手冊,並重新結構化。相同的節拍、相同的時間點、相同的鏡頭法則、相同的音訊清單。

Plain
1一部 30 秒的荒誕冷面喜劇短片,場景設定在明亮沙漠中一座曬得褪色的 66 號公路風格加油站。寫實,嚴格的明亮青橙調色,高飽和度和高亮度,讓荒誕事件發生在一個完全正常、幾乎美麗的世界中。鏡頭語言:冷靜、客觀觀察,主要為固定中景和緩慢橫移,無情感引導,在荒誕節拍時突然使用極特寫。
2
30-8 秒:廣角,固定。青色天空,飄浮的塵土。復古黃橙藍色加油站獨自矗立在路邊;一名穿著油膩藍色工作服、戴著巨大黑色太陽眼鏡的員工,在椅子上打盹,嘴裡叼著牙籤。只有風聲。地平線上,一名女牛仔騎著真馬以步行速度出現。切到中景:馬蹄聲驚醒他,他推了推太陽眼鏡,坐直身體,將這對人馬解讀為「又一個來問路的」。
4
58-16 秒:她什麼都沒說。她俐落地下了馬,牽著馬直接走向老舊的加油機。馬隨意地把頭湊到加油機旁,就像以前做過一樣。從他太陽眼鏡後方短暫的輕微魚眼主觀鏡頭,女人和馬看起來更奇怪了。特寫:他皺起眉頭,摘下太陽眼鏡,正要大喊。慢動作特寫:當眼鏡摘下時,她將油槍對準馬的嘴巴,並扣下扳機。
6
716-24 秒:油槍的極特寫。噴出來的不是汽油,而是一股股鮮嫩亮綠的草,還帶著水珠。硬切到員工臉部的極特寫,定格:眼睛瞪得像銅鈴,嘴巴微張,牙籤忘了嚼。中景:馬開心吃草,滿足地瞇起眼睛,然後用力甩了一下尾巴,揚起的灰塵正好落在仍驚呆的員工臉上。
8
924-30 秒:「加滿」了草。她將油槍掛回加油機,從口袋裡掏出硬幣,走到商店門口,將硬幣叮噹作響地丟進櫃檯上的錫罐。她回頭瞥了一眼呆若木雞的員工;帽沿下,她的嘴角微微上揚。她重新上馬,揚起一陣塵土騎走了。鏡頭緩慢推向員工:同樣僵住的姿勢,滿臉灰塵,太陽眼鏡還捏在手裡,最後,牙籤從他嘴裡掉了下來,發出輕微的「喀」一聲。
10
11音訊:全程乾燥的沙漠風聲,馬蹄聲,加油機手柄的機械咔噠聲,濕草噴射聲,尾巴甩動聲,硬幣掉進錫罐聲,以及牙籤落地時的一聲輕微「喀」。無音樂、無對白、無畫面文字。

一個能幫你省錢的警告,和步驟 3 一樣的陷阱:將時長滑桿拖到 30,而不是在數字框中輸入 30。 數字框會顯示 30,但滑桿可能仍停留在預設的五秒,而執行按鈕會報價五秒。點擊前請檢查報價。在 720p 和 16:9 下,五秒任務報價 $1.514799,因此真正的 30 秒生成大約是這個價格的六倍。

這一步沒有完成後的截圖。三次自動擷取嘗試都送出了滑桿預設值(五秒)而非 30 秒,為了不展示一個標示為 30 秒的五秒片段,這裡省略截圖。以上提示和設定就是你需要貼上和調整的內容。

步驟 5:誠實檢視飄移

以下是 Seedance 2.5 使用相同提示、以原生 30 秒、720p、16:9、啟用音訊生成的結果。

Seedance 2.5,完全複製上述 Wan 3.0 加油站提示:原生 30 秒單次生成,1280x720,24fps,內嵌音訊。相同的四個節拍,女牛仔和馬抵達,油槍搞笑橋段,員工認知失調的特寫。與頂部的 Wan 3.0 片段並排比較,進行同條件對比。

將兩個片段並排,檢查五個具體事項。不要檢查「哪個看起來比較好」,那是品味問題,會浪費你的下午。

  1. 毛色和服裝一致性。 第 29 秒的馬和第 6 秒的馬顏色相同嗎?眼鏡摘下後再放回手中,形狀一樣嗎?
  2. 色調穩定性。 取樣第 2 秒和第 28 秒的天空。青橙調色在長時間生成中,往往會比預期更暖。
  3. 第 20 秒的物理節拍。 油槍噴出草是一個物理要求。草是呈弧線落下帶著重量,還是像紋理一樣淡入?
  4. 鏡頭紀律。 提示要求固定鏡頭。數數鏡頭未經要求而自行推近的次數。這是長時間生成最常見的失敗模式:模型用完了排程事件,就用移動來填滿時間。
  5. 快速動作變形。 尾巴甩動和揚起灰塵是片段中速度最快的動作。根據 MindStudio 的製作筆記,這正是失諧集中的地方,也是放大無法修復的問題。

根據這五項評分,而不是感覺。這才是你能向客戶辯護的比較。

另外三組 Wan 3.0 vs Seedance 2.5 原生 30 秒對應提示

一個示範只是軼事。以下是來自同一本手冊的三個官方 Wan 3.0 30 秒檔案,每個都針對 30 秒問題的不同部分進行壓力測試。對於海怪和黑暗奇幻獨白,Seedance 2.5 端使用相同提示以原生 30 秒生成,並直接嵌入在下方,以便你觀看兩者,而非僅聽我敘述。

提示壓力測試內容Wan 3.0 官方檔案,測量結果Seedance 2.5 端,相同提示
海怪災難電影10 個分鏡腳本加管弦樂配樂,全部在 30 秒內1920x1072, 24fps, 30.07s, AAC以 30 秒生成,嵌入下方;移除了一個 IP 名稱和船隻品牌文字,以通過 Seedance 的內容過濾器,故事板其餘部分完全相同
黑暗奇幻英文獨白原生英文語音和嘴型同步,配合緩慢連續推鏡1280x720, 24fps, 30.05s, AAC以相同提示逐字生成 30 秒,嵌入下方
2D 運動動畫,兩行提示模型能否在幾乎沒有指示的情況下填滿 30 秒1280x720, 24fps, 30.05s, AAC此處未生成;僅以 Wan 的畫面格線展示,以閱讀整體時間結構
甩鏡喜劇短片(排除)8 次甩鏡和 8 個情緒節拍,無剪接1280x720, 24fps, 30.04s, AAC未執行:對白密度為中文專用,英文改寫無法公平比較

官方 Wan 3.0 示範:十個分鏡腳本和完整的管弦樂鋪陳,在一個 30 秒的單次生成中完成,解析度 1920x1072。這是原生 1080p 最有力的論證,因為水的體積和生物潮濕皮膚的細節,正是 720p 放大版本會發明而非解析的內容。阿里巴巴通義創作者手冊,用於比較和評論。

Seedance 2.5,使用相同的十個分鏡災難提示,原生 30 秒,開啟音效。暴風雨中的漁船,驚恐的甲板水手,巨浪湧起,然後深海巨獸在閃電中破水而出。移除了 IP 參考和船體品牌文字,以通過 Seedance 的內容過濾器;故事板其餘部分完全相同,這使得水體體積和潮濕皮膚細節的比較,與上方 Wan 3.0 片段形成公平對比。

官方 Wan 3.0 示範,開啟音效。原生英文反派對白:「Ripe enough for the void」,在一個緩慢連續上搖鏡頭中完成,無剪接。這是英語團隊應該測試的片段,因為語音、嘴型同步和 30 秒連續鏡頭運動必須同時維持。

Seedance 2.5,完全複製相同的黑暗奇幻提示,原生 30 秒,開啟音效。相同的紫色眼睛反派,星符文標記,在他張開的手掌中形成的陰影星雲,以及兩句英文台詞。觀察嘴型同步和單一連續推鏡是否能像 Wan 3.0 端一樣,撐過完整 30 秒。

如果你要執行這個對應的 Seedance 2.5 測試,請逐字保留兩句英文台詞,並記得製作筆記中的口音訣竅:寫「American」,不要寫「American English」。「English」這個詞會把語調拉回英國腔。

第三個是意外的驚喜。阿里巴巴手冊中的 2D 運動動畫提示只有兩行。沒有時間戳記,沒有分鏡表,只是一個拳擊手在打沙袋,疲憊、痛苦。從這樣的提示生成 30 秒,是對模型能否自行創造結構的真正考驗。以下是從其運行時間中取樣的畫面:

Four anime panels of an exhausted boxer training with a punching bag

官方 Wan 3.0 2D 運動動畫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣,顯示拳擊手設計和健身房背景在完整 30 秒內的變化

官方 Wan 3.0 2D 運動動畫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣。相同的角色設計、相同的背心、相同的沙袋、相同的置物櫃排,在提示未要求的情況下,從廣角變為特寫。這裡使用靜態畫面格線而非影片,因為比較重點是單一檔案內的時間變化,而非動作。

實用解讀:使用兩行提示時,模型自行創造了覆蓋鏡頭,從固定廣角移動到汗水和疲憊的特寫,並在此過程中保持角色設計。這是好消息。代價是你放棄了對事件發生時間的控制。如果你需要 30 秒在特定秒數精準落地一個節拍,請寫下時間戳記。

在付費之前,免費測試原生 30 秒敘事

一個 30 秒的 720p Seedance 2.5 生成,根據實際解析度而非目錄低價計算,報價約為 9 美元。Wan 3.0 價格表上的 30 秒 1080p 生成為 6.00 美元。以生產標準來看都不算貴,但考慮到 3.2 比 1 的拍攝比,你不是買一個片段,而是買三到四個。

在花錢之前,值得先回答一個更便宜的問題:我的劇本真的能撐住一個連續鏡頭嗎?多數 30 秒的失敗並非模型失敗,而是結構失敗:三個節拍塞進只能容納兩個的空間,或者在第 26 秒寫了高潮,但第 8 到 20 秒之間沒有任何東西支撐。

Atlas Cloud 的免費 AI 廣告短劇產生器可以免費回答這個問題。你提供一個產品描述和最多四張產品照片(每張小於 8MB),選擇六種風格之一(搞笑迷因、劇情反轉、情境喜劇、溫馨、奢華、強力推銷),它會先寫出一個包含兩個角色的劇本,具有三秒鉤子、衝突和轉折,然後根據劇本建立每個鏡頭。角色會大聲說出台詞,音效會渲染到影片中。

誠實的限制:這是 15 秒,而不是 30 秒;你需要登入;而且在你補充點數之前,只能免費生成一次。但一個具有鉤子、衝突和轉折的 15 秒,足以告訴你三個節拍是否能呼吸。如果結構在那裡可行,就將相同的節拍套用到步驟 1 的 0-8s / 8-16s / 16-24s / 24-30s 骨架,然後花九美元進行真正的原生 30 秒生成。

Wan 3.0 vs Seedance 2.5 原生 30 秒片段的實際成本

設定費率時長單一片段
Wan 3.0,原生 1080p(僅限阿里雲)$0.20 / 秒30s$6.00
Wan 3.0,原生 720p(僅限阿里雲)$0.10 / 秒30s$3.00
Wan 3.0,原生 480p(僅限阿里雲)$0.05 / 秒30s$1.50
Seedance 2.5,原生 720p,在 Atlas Cloud 上720p 實測約 $0.30 / 秒,標示從 $0.134 起30s約 $9.09
GPT Image 2 開場畫面,高品質,2048x1152標示從 $0.009 / 張起1 張報價 $0.1745

真正決定性的比較:Wan 3.0 在 720p 下每秒比 Seedance 2.5 的 720p 便宜,而在 1080p 下,它是兩者中唯一真正提供真實像素的。Seedance 2.5 的答案則是 50 個參考素材槽、即時可用性,以及今天下午就能對接上線的運作中 API。

這些原生 30 秒片段的來源與許可說明

本文中的每個 Wan 3.0 片段和每個 Wan 3.0 提示,均來自阿里巴巴公開發布的通義 Wan 3.0 創作者手冊,此處僅為比較和評論而重現,已標明來源,未經修改,且未移除浮水印。Seedance 2.5 輸出的商業使用受字節跳動和火山引擎條款約束;Atlas Cloud 端的 API 計費和資料處理則受 Atlas Cloud 自身條款約束。本測試中未重現任何真實人物的肖像。如果你要交付客戶專案,請閱讀你所呼叫的特定端點的模型條款,而非部落格摘要。

常見問題

Wan 3.0 的原生 30 秒真的是單次生成,還是拼接片段?

單次生成。Wan 3.0 可在單次生成中產生 2 到 30 秒,並有智慧時長選項,因此它也能決定片段不需要完整的 30 秒。這與最後一幀延伸不同,後者會從第一個片段的最後一幀生成第二個片段,導致身份在接縫處飄移。

哪一個在 30 秒時真的是 1080p,Wan 3.0 還是 Seedance 2.5?

Wan 3.0。它的價格表上有原生 1080p 等級,而阿里巴巴自家的 30 秒示範檔案測量為 1920x1072。Seedance 2.5 原生僅生成 480p 和 720p;其 1080p、1440p 和 4K 選項是基於 720p 來源的增強,且其 API 文件將 4K 等級描述為「並非原生 4K 生成」。

畫面在第 25 秒還是會崩壞嗎?

有可能,但失敗模式已經改變。不再是片段之間可見的接縫,而是鏡頭內部的變形和失諧,集中在快速動作段落,且放大無法修復。一份有記載的 Seedance 2.5 短片製作記錄了 3.2 比 1 的拍攝比,因此規劃長鏡頭時要考慮覆蓋拍攝。

哪個模型接受更多參考素材?

Seedance 2.5,差距很大:30 張圖片、10 個影片、10 個音訊檔案,總計 50 個,其中參考影片和音訊每次請求各限制在 30 秒內。Wan 3.0 的手冊將參考素材上限設為 20 個,但它是唯一接受 .pdf、.ppt、.xls、.doc、.txt 檔案和即時網頁作為創意輸入的模型。

Wan 3.0 會有開放權重嗎?

沒有官方承諾。截至 2026 年 8 月的公開測試版,尚未發布任何 Wan 3.0 權重、Hugging Face 檢查點或 ComfyUI 節點,旗艦影片系列的官方開放權重僅止於 Wan 2.2(Kingy AI,2026 年 8 月)。請將你讀到的任何關於 3.0 權重發布的其他資訊視為猜測,直到阿里巴巴另有說法。

最新模型

一個 API,暢享全模態 AI。

探索全部模型