Seedance 2.5 現已上線 — 首發於 Atlas Cloud

Wan 3.0 vs Seedance 2.5 Native 30s:兩者都說30秒,只有一個是真正的1080p

Wan 3.0 vs Seedance 2.5 原生30秒,對照阿里巴巴自己的示範提示詞:哪一個渲染真正的1080p畫素,哪一個進行上採樣,以及哪一個你今天就可以運行。

Two monitors showing a western scene next to storyboards

兩個剪輯監視器並排播放同一個沙漠加油站鏡頭,一個下方顯示不間斷的30秒時間軸,另一個則顯示分成兩段的時間軸

第20秒時,加油槍噴出新鮮的綠色草地,還帶著水珠。馬兒滿意地瞇起眼睛。店員的牙籤從他嘴裡掉出來。

這個笑點只有在連續30秒的單一鏡頭內才有效。把四個8秒的片段剪在一起,馬的毛色會變,太陽眼鏡的形狀會變,天空色溫會偏移一檔,而笑點就在接縫處消失。

所以當Wan 3.0和Seedance 2.5幾乎同時上市,都宣稱原生30秒、單次生成、無需拼接時,這就不再只是一個測試基準的故事。這代表AI影片模型首次能夠在單一鏡頭內,完成鋪陳、轉折和收尾。

我仔細分析了規格,並對照阿里巴巴官方公開的示範檔案進行了核對,發現了所有報導都沒有提及的一件事:兩個模型都號稱30秒,但這30秒背後的解析度,根本不是同一種產品。

重點整理

  1. 兩個模型確實都能單次生成30秒。這部分不是行銷話術。Wan 3.0支援2到30秒,具有智慧時長選項;Seedance 2.5支援4到30秒。
  2. 只有Wan 3.0在30秒時能渲染原生1080p。Seedance 2.5原生僅能生成480p和720p。其1080p、1440p和4K選項都是針對720p來源進行後生成放大,且其API文件說明4K層級「並非原生4K生成」。
  3. Seedance 2.5在參考素材量上勝出:最多30張圖片加上10部影片加上10個音檔,共50個。Wan 3.0的創作者手冊設定參考素材上限為20個。
  4. Wan 3.0擁有其他模型都沒有的輸入類型:.doc.xls.ppt.pdf.txt檔案,以及即時網頁,可直接作為創作參考。
  5. 兩者中只有一個目前能在阿里巴巴外部運行。Wan 3.0在阿里雲模型工作室和通義千問雲上公開測試,第三方API仍在逐步開放中。Seedance 2.5已在Atlas Cloud上線,時長控制可直接設定為30。
  6. 想在付費前先測試30秒的故事結構是否可行?Atlas Cloud的免費AI廣告小品產生器提供一次免費試用:15秒的完整廣告,包含口語對話和音效,可下載無浮水印版本。
Invalid YouTube video ID

阿里巴巴官方Wan 3.0示範,取自通義Wan 3.0創作者手冊。一鏡到底,無剪輯,30.07秒。以ffprobe測量:1920x1072,24fps,內建AAC立體聲。開啟音效聆聽尾巴甩動和牙籤在第29秒落地的聲音。此處作為比較和評論的參考素材。

Wan 3.0 vs Seedance 2.5 原生30秒:本月真正改變了什麼

十五秒曾是一道長期無法突破的牆。Wan 2.7止步於此,Seedance 2.0也止步於此。你過去一年在動態牆上看到的每一部「一分鐘AI電影」,都是四到八個片段在非線性剪輯軟體中拼接而成,再經過調色師處理來隱藏接合處。

有兩件事在同幾週內打破了這道牆。阿里巴巴於2026年8月6日開放了Wan 3.0公開測試,支援原生30秒生成和完整多模態參考輸入(AlphaSignal,2026年8月)。字節跳動將Seedance從15秒翻倍至30秒推出2.5版,明確定位為減少片段拼接及其伴隨的視覺飄移。

此處的「原生」在技術上具有特定意義。它指的是對單一潛在序列進行一次前向傳播,而非將片段A的最後一幀作為片段B起始的「最後一幀延伸」。延伸正是導致角色外套領子在鏡頭之間悄悄變形的原因。原生傳播將整個30秒放在同一個上下文中,因此馬匹會保持一致。

加油站示範是測試這個概念最乾淨的方式。其結構為四個節拍:0到8秒沒發生什麼事,8到16秒發生奇怪的事,16到24秒是笑點,24到30秒是離場。笑點落在第20秒。這意味著它只有在馬匹、太陽眼鏡、青橙調色和面無表情的固定鏡頭在前19秒都保持不變的情況下才能成立。拼接做不到這一點。不是因為剪輯師技術不好,而是因為片段B從未見過片段A。

Wan 3.0 vs Seedance 2.5 原生30秒:畫面究竟在哪裡崩壞

三十秒是十五秒的兩倍。飄移的風險不是兩倍大,而是更糟,而且會轉移到不同的失效模式。

拼接工作流程的失敗發生在片段之間。原生30秒的失敗發生在片段內部。在Seedance 2.5的實際短片製作中,評測者發現去相干性和變形表現為「角色模型的視覺尖刺或不穩定性」,集中在快速動作序列中,並特別指出這些瑕疵無法透過放大修復(MindStudio,2026年8月)。這對於任何打算在720p渲染後放大到4K的人來說至關重要:放大器只會銳化變形,而不是消除它。

同一製作記錄了3.2比1的拍攝比率。約450秒的原始生成,最終剪出2分22秒的成品。規劃長鏡頭工作時,要像拍攝有覆蓋率的鏡頭那樣,而不是像渲染佇列那樣每項工作都能直接產出。

該製作中還有兩個發現值得直接借用。整個影片的視覺一致性僅靠三張參考圖片維持:兩張角色肖像和一張地點場景圖,即使系統最多可接受50張。而在語音選角方面,寫「American」修正了意外的英國口音,但寫「American English」卻沒用,因為「English」這個詞會將發音拉回英式。

能夠撐過30秒的提示結構,正是阿里巴巴在其官方手冊中使用的形式:明確標註時間戳記的節拍。不要寫一段描述氛圍的段落。寫「0-8s8-16s16-24s24-30s」,為每個區塊指定各自的鏡頭行為和事件,最後用一句涵蓋整個片段的音訊描述結尾。你會在下方步驟4中看到完全相同的骨架,因為我保留了阿里巴巴的結構,只進行了翻譯。

Wan 3.0 vs Seedance 2.5 原生30秒:規格、價格與目前可執行的內容

以下是誠實的現狀,也是兩個模型不再可互相比較的產品的部分。

請仔細閱讀解析度那一行,因為這是整篇文章的核心。Atlas Cloud 自己的 Seedance 2.5 文字轉影片 API 文件說明 720p-esr 是增強 480p 來源,1080p-esr1440p-esr4k-esr 都是增強 720p 來源,而 4K 選項提供 2160 像素短邊,「並非原生 4K 生成」。因此,一個標示為 4K 的 30 秒 Seedance 片段,實際只有 720p 的真實細節,經過重新取樣。相比之下,Wan 3.0 的價格表有直接的 1080p 層級,每秒 $0.20,而阿里巴巴官方公佈的 30 秒示範檔案測量為 1920x1072。

這個限制的好處是:整個測試可以在一個瀏覽器分頁中完成,橫跨三個模型,無需任何本地設定。

在本測試中的角色模型標示價格
開場畫面GPT Image 2 文字轉圖片從 $0.009 / 張起
原生 30 秒執行Seedance 2.5 文字轉影片從 $0.134 / 秒起

標示價格於 2026 年 8 月在 Atlas Cloud 模型頁面上驗證。請將其視為底價,而非最終報價。這些模型都根據你實際要求的內容計費,而且「執行」按鈕會在你點擊前根據你的確切設定顯示價格。在此測試中,按鈕報價為:一張 GPT Image 2 高品質 2048x1152 畫面為 $0.1745;一個五秒的 Seedance 2.5 720p 16:9 工作為 $1.514799,這相當於每秒約 $0.30,而非標示的 $0.134。標示的價格是 480p 的費率。請檢查按鈕,而不是目錄。Seedance 2.5 也提供一個 參考轉影片端點,價格相同為每秒 $0.134,如果你想利用 50 個參考素材的上限。

如何在 Seedance 2.5 上重現這個原生 30 秒測試

五個步驟,三個模型,全部在瀏覽器中完成。請逐字複製提示詞。

步驟 1:鎖定含時間戳記的 30 秒骨架

先不要執行任何動作。請先閱讀結構,因為這決定了你的 30 秒能否維持穩定。

本文頂部的 Wan 3.0 加油站示範是根據四個標記區塊建構的,並在開頭一次聲明固定的鏡頭原則:冷靜的客觀觀察、固定的中景、只有在荒謬的節拍時才突然使用極特寫。每個事件都固定在一個時間範圍內。音訊是一句在最後涵蓋全部 30 秒的台詞。

以下是空的骨架。填入內容後,你就會有一個原生 30 秒模型能夠追蹤的提示詞:

Plain
1一個 30 秒的 [類型],設定在 [地點]。 [視覺風格、調色、飽和度]。鏡頭語言:[原則],並以 [例外情況] 作為間歇點綴。
2
30-8s:[鋪陳,廣角,建立正常世界,在地平線引入異常]
4
58-16s:[異常行動,仍以正常方式處理,一個主觀鏡頭或反應插入]
6
716-24s:[收尾,對事物本身的極特寫,硬切到反應的臉部]
8
924-30s:[離場,一個小型的物理動作來結束笑點]
10
11音訊:[環境音,三到四個特定的現場音,一個最後的小聲音]。無音樂,無對話,無螢幕文字。

阿里巴巴參考檔案的可測量規格(供任何想核對數字的人使用):30.07 秒,1920x1072,24fps,AAC 立體聲。這是 Seedance 執行即將被衡量的標準。

步驟 2:生成開場畫面

你需要一個固定的視覺錨點,讓 15 秒和 30 秒的執行從同一個世界開始。打開 GPT Image 2 文字轉圖片

設定: 品質 high,比例 16:9,1 張圖片。

Plain
1一個寬廣、靜止的定場鏡頭,展現一座孤獨的 66 號公路風格加油站,位於明亮的沙漠中。復古的黃橙藍色建築,油漆微微被陽光曬褪色;前方有一個褪色的復古紅色加油泵;旁邊有一間小便利商店,門口有一台褪色的可樂自動販賣機。前景是龜裂的橘色乾燥土地,遠處是溫暖的陶土色山脈,無雲清澈的青色藍天。一名穿著油膩藍色連身工作服、戴著超大型黑色太陽眼鏡的加油站員工,半睡半醒地癱坐在門邊的椅子上,嘴裡叼著牙籤。嚴格的明亮青橙調色,高飽和度,高亮度,電影級寫實,固定鏡頭,16:9。

Screenshot of an AI image generator with prompt and output image

Atlas Cloud 上的 GPT Image 2 操作介面,品質設為 high,比例 16:9,輸出面板中顯示生成的 66 號公路加油站定場鏡頭

Atlas Cloud 上的 GPT Image 2:品質 high,16:9,一張圖片。此畫面的執行按鈕報價為 $0.1745,這正是 2048x1152 高品質渲染的實際成本。模型頁面上的 $0.009 是底價。

Man resting outside a vintage Route 66 desert gas station

使用 GPT Image 2 生成的 66 號公路加油站定場畫面,青色天空與橘色龜裂大地,員工在門邊打盹

開場畫面。這是步驟 3 的輸入,也是步驟 4 的視覺目標。使用 openai/gpt-image-2 生成。

步驟 3:撞上 15 秒之牆

設定: 首幀 = 你的步驟 2 輸出,duration 拖曳到最大值 15,解析度 1080P

Plain
1固定廣角鏡頭保持不動。一名戴著寬邊帽的女牛仔,騎著一匹真馬,以步行速度從地平線出現。正在打盹的員工被馬蹄聲吵醒,推了推太陽眼鏡,坐直身體,嚼著牙籤,一臉不以為然。她乾淨俐落地跳下馬,牽著馬直接走向復古加油泵。明亮的青橙調色,高飽和度,寫實,冷靜觀察的鏡頭,無剪輯。

下拉選單停在 15。這就是這一步的重點。你的笑點預定在第 20 秒,而這個流程無法一次到達第 20 秒。要達到那裡,你需要從最後一幀生成第二個片段,而一旦你這麼做,馬就變成了一匹新馬。

Screenshot of an AI video generator interface with input and output

步驟 4:執行完整的原生 30 秒流程

打開 Seedance 2.5 文字轉影片

設定: duration = 30resolution = 720pratio = 16:9generate_audio = 開啟,output_format = mp4,浮水印關閉。

刻意選擇 720p,而不是 1080p-esr。720p 是該模型的真實天花板,因此這是一個像素對像素的比較,而不是與放大器的比較。

下面的提示詞是阿里巴巴自己的加油站示範提示詞,從 Wan 3.0 創作者手冊中忠實翻譯,並重組為純文字。相同的節拍、相同的時間點、相同的鏡頭原則、相同的音訊清單。

Plain
1一個 30 秒的荒誕面無表情喜劇短片,設定在明亮沙漠中一間被陽光曬褪色的 66 號公路風格加油站。寫實,嚴格的明亮青橙調色,高飽和度和高亮度,讓荒誕事件發生在一個完全正常、幾乎美麗的世界中。鏡頭語言:冷靜、客觀的觀察,大部分是固定的中景和緩慢的橫向移動,沒有情緒引導,並在荒誕的節拍處突然使用極特寫。
2
30-8s:廣角,固定。青色天空,飄動的灰塵。復古的黃橙藍色加油站獨自矗立在路邊;一名穿著油膩藍色連身工作服、戴著巨大黑色太陽眼鏡的員工在椅子上打盹,嘴裡叼著牙籤。只有風聲。地平線上,一名女牛仔騎著一匹真馬以步行速度出現。切到中景:馬蹄聲吵醒他,他推了推太陽眼鏡,坐直,將這對組合解讀為「又一個來問路的」。
4
58-16s:她一句話也沒說。她乾淨俐落地跳下馬,牽著馬直接走向舊加油泵。馬隨意地把頭湊到加油泵旁邊,就像以前做過一樣。短暫的、稍微帶有魚眼效果的主觀鏡頭,從他的太陽眼鏡後方看出去,女人和馬看起來更奇怪。特寫:他皺起眉頭,摘下太陽眼鏡,正要大喊。慢動作特寫:當眼鏡取下時,她將加油槍對準馬的嘴,並扣下扳機。
6
716-24s:加油槍的極特寫。噴出來的不是汽油,而是新鮮的亮綠色草叢,還帶著水珠。硬切到員工臉部的極特寫,凍結住:眼睛瞪得跟碟子一樣大,嘴巴微微張開,牙籤忘了嚼。中景:馬開心吃草,滿足地瞇起眼睛,然後滿意地用力甩了一下尾巴,揚起的灰塵正好落在仍然震驚的員工臉上。
8
924-30s:草「加滿」了。她將加油槍掛回加油泵,從口袋裡掏出硬幣,走向商店門口,將硬幣叮噹作響地丟進櫃檯上的一個錫罐裡。她回頭看了一眼嚇呆的員工;在帽簷下,她的嘴角微微上揚。她重新上馬,在一片灰塵中騎走。鏡頭緩慢推向他:同樣凍結的姿勢,臉上沾滿灰塵,太陽眼鏡還捏在手裡,最後,牙籤從他嘴裡掉落,發出細微的咔嗒聲。
10
11音訊:整段乾燥的沙漠風聲,馬蹄聲,加油泵手柄的機械咔噠聲,潮濕草叢噴出的聲音,尾巴甩動聲,硬幣掉進錫罐的聲音,以及牙籤落地時的一聲細微咔嗒。無音樂,無對話,無螢幕文字。

一個能幫你省下一筆冤枉錢的警告,而且和步驟 3 是同樣的陷阱:將時長滑桿拖曳到 30,不要在數字方塊中輸入 30。 方塊可能會開心地顯示 30,而滑桿卻停留在五秒的預設值上,執行按鈕會報價五秒的價格。在點擊之前檢查報價。在 720p 和 16:9 下,一個五秒的工作報價為 $1.514799,因此一個真正的 30 秒流程報價約為其六倍。

這一步沒有完成的執行畫面截圖。三次自動捕捉嘗試都提交了滑桿的預設值而非 30 秒,為了不向您展示一個標示為 30 秒但實際只有五秒的片段,因此省略了捕捉畫面。上面的提示詞和設定正是您需要貼上與設定的內容。

步驟 5:誠實地判讀飄移

以下是 Seedance 2.5 針對相同提示詞的結果,以原生 30 秒、720p、16:9、開啟音訊生成。

Seedance 2.5,完全複製相同的 Wan 3.0 加油站提示詞:一次生成的原生 30 秒,1280x720,24fps,內建音訊。相同的四個節拍,女牛仔和馬抵達,加油槍的梗,員工認知失調的特寫。將其與頂部的 Wan 3.0 片段並排觀看,進行像素對像素的閱讀。

將兩個片段並排,檢查五個特定事項。不要檢查「哪個看起來較好」,那是品味之爭,只會浪費你的下午。

  1. 毛色與服裝的一致性。 馬在第 29 秒的顏色是否與第 6 秒相同?太陽眼鏡在取下並放回他手中後,形狀是否相同?
  2. 調色穩定性。 在第 2 秒和第 28 秒取樣天空。青橙調色在長時間生成中比預期更常會向暖色飄移。
  3. 第 20 秒的物理節拍。 從加油槍噴出草地是一個物理請求。它是否以重量弧線落下,還是作為紋理淡入?
  4. 鏡頭紀律。 提示詞說固定鏡頭。計算鏡頭在未經要求的情況下自行發明推進的次數。這是長時間生成最常見的失敗:模型耗盡了預定的事件,並用移動來填滿時間。
  5. 快速動作變形。 尾巴甩動和灰塵揚起是片段中最快的動作。根據 MindStudio 的製作筆記,這正是去相干性集中的地方,也正是放大無法修復的地方。

根據這五點打分,而不是憑感覺。這是一個你可以向客戶辯護的比較。

另外三個 Wan 3.0 vs Seedance 2.5 原生 30 秒對應提示詞

一個示範只是個案。以下是來自同一手冊的三個官方 Wan 3.0 30 秒檔案,每個都測試了 30 秒問題的不同方面。對於海怪和黑暗奇幻獨白,Seedance 2.5 的部分是使用相同的提示詞以原生 30 秒生成,並直接嵌入在每個之後,這樣你可以觀看兩者,而不是只聽我的一面之詞。

提示詞測試重點Wan 3.0 官方檔案,測量值Seedance 2.5 部分,相同提示詞
海怪災難電影10 個指令分鏡加上管弦樂配樂在 30 秒內1920x1072, 24fps, 30.07s, AAC以 30 秒生成,嵌入下方;移除了一個 IP 名稱和船隻品牌文字,以便 Seedance 的內容過濾器能通過,分鏡表其餘部分相同
黑暗奇幻英文獨白原生英語配音和唇形同步,搭配緩慢連續推進1280x720, 24fps, 30.05s, AAC以 30 秒從提示詞逐字生成,嵌入下方
2D 運動動漫,兩行提示詞模型能否在幾乎沒有指令的情況下填滿 30 秒1280x720, 24fps, 30.05s, AAC未在此處生成;以 Wan 專用的畫面格網格顯示,以閱讀跨時間的結構
甩鏡喜劇短片(已排除)8 次甩鏡和 8 個情緒節拍,無剪輯1280x720, 24fps, 30.04s, AAC未執行:對話密度為普通話特定,英文改寫無法公平對等

官方 Wan 3.0 示範:十個指令分鏡和完整的管弦樂鋪陳,在一個 30 秒的流程內,解析度 1920x1072。這是原生 1080p 最有力的論證,因為水體體積和生物濕潤皮膚的細節,正是 720p 放大所發明而非還原的東西。阿里巴巴通義創作者手冊,用於比較和評論。

Seedance 2.5,相同的十個分鏡災難提示詞,原生 30 秒,開啟音效。暴風雨中的漁船,驚恐的甲板水手,海浪湧起,然後深海巨獸在閃電中破水而出。移除了 IP 參考和船體上的品牌文字,以便 Seedance 的內容過濾器能通過;分鏡表其餘部分完全相同,這使得水體體積和濕潤皮膚細節的比較,對於上方 Wan 3.0 片段來說是公平的像素對像素。

官方 Wan 3.0 示範,開啟音效。原生英語反派對話:「夠熟了,可以送入虛空」,在一個連續的緩慢上搖鏡頭中完成,無剪輯。這是英語團隊應該測試的片段,因為語音、唇形同步和 30 秒連續鏡頭移動必須同時維持穩定。

Seedance 2.5,相同的黑暗奇幻提示詞逐字複製,原生 30 秒,開啟音效。相同的紫眼反派,星形符文標記,他張開的手掌中形成的陰影星雲,以及兩句英語台詞。觀察唇形同步和單一連續推進是否能像 Wan 3.0 那側一樣,撐過完整的 30 秒。

如果你執行這一個的對應 Seedance 2.5 部分,請逐字保留兩句英語台詞,並記住製作筆記中的口音技巧:寫「American」,而不是「American English」。「English」這個詞會將發音拉回英式讀法。

第三個是意外的驚喜。阿里巴巴手冊中的 2D 運動動漫提示詞只有兩行。沒有時間戳記,沒有分鏡表,只是一個拳擊手在打沙袋,疲憊,痛苦。從那樣的提示詞生成 30 秒,是對模型能否自行創造結構的真正考驗。以下是它在自己運行時間內的取樣:

Four anime panels of an exhausted boxer training with a punching bag

官方 Wan 3.0 2D 運動動漫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣,顯示拳擊手的設計和健身房背景在整個 30 秒內保持不變

官方 Wan 3.0 2D 運動動漫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣。相同的角色設計,相同的背心,相同的沙袋,同一排置物櫃,從提示詞從未要求的廣角到特寫變化。這是一個靜態網格而不是片段,因為這裡的比較是同一檔案內跨時間的結構,而非運動。

實際解讀:使用兩行提示詞,模型自行發明了鏡頭覆蓋,從固定的廣角移動到汗水和疲憊的特寫,並在此過程中保持了角色設計。這是好消息。權衡是:你放棄了對事件發生時間的控制。如果你需要 30 秒在特定秒數落下一個特定節拍,請寫下時間戳記。

在付費之前,免費測試原生 30 秒敘事

Seedance 2.5 上一個 30 秒的 720p 執行,當你以實際解析度而非目錄底價計價時,報價約為 $9。Wan 3.0 價格表上一個 30 秒的 1080p 執行是 $6.00。以製作標準來說都不算貴,但考慮到 3.2 比 1 的拍攝比率,你買的不是一個片段,而是三四個。

在你花費任何費用之前,值得先回答一個更便宜的問題:我的劇本真的能作為一個連續鏡頭撐住嗎?大多數 30 秒的失敗不是模型失敗。而是結構失敗:三個節拍塞進本應只有兩個的空間,或者一個安排在 26 秒的笑點,而 8 到 20 秒之間沒有任何東西支撐。

Atlas Cloud 的免費 AI 廣告小品產生器可以免費回答這個問題。你提供一個產品描述和最多四張產品照片(每張低於 8MB),選擇六種風格之一(搞笑迷因、劇情反轉、情境喜劇、溫馨感人、奢華精品、或強力推銷),它會先寫出一個雙角色劇本,包含三秒鉤子、衝突和轉折,然後圍繞這個劇本建立每個鏡頭。角色會大聲說出他們的台詞,音效也會渲染到影片中。

誠實的限制:它是 15 秒,而不是 30 秒,你需要登入,而且你只能免費生成一次,之後需要加值點數。但是一個具有鉤子、衝突和轉折的 15 秒,可以告訴你你的三個節拍是否順暢。如果結構在那裡可行,那麼將相同的節拍拉長,放入步驟 1 的 0-8s / 8-16s / 16-24s / 24-30s 骨架中,然後花那九美元進行一次真正的原生 30 秒執行。

Wan 3.0 vs Seedance 2.5 原生 30 秒片段的實際成本

設定費率時長一個片段
Wan 3.0, 1080p 原生(僅限阿里雲)$0.20 / 秒30s$6.00
Wan 3.0, 720p 原生(僅限阿里雲)$0.10 / 秒30s$3.00
Wan 3.0, 480p 原生(僅限阿里雲)$0.05 / 秒30s$1.50
Seedance 2.5, 720p 原生,在 Atlas Cloud 上720p 測量為 $0.30 / 秒,標示從 $0.134 起30s約 $9.09
GPT Image 2 開場畫面,品質 high,2048x1152標示從 $0.009 / 張起1 張圖片報價 $0.1745

真正決定性的比較:Wan 3.0 在 720p 下每秒比 Seedance 2.5 在 720p 下便宜,而在 1080p 下,它是兩者中唯一銷售真實像素的。Seedance 2.5 的答案是 50 個參考插槽、即時可用性,以及一個你今天下午就可以使用並交付的運作中 API。

這些原生 30 秒片段的來源與授權說明

本文中的每個 Wan 3.0 片段和每個 Wan 3.0 提示詞均來自阿里巴巴公開發佈的「通義 Wan 3.0 創作者手冊」,此處為比較和評論而重現,已標明來源,未修改且未移除浮水印。Seedance 2.5 輸出的商業用途須遵守字節跳動和火山引擎的條款;Atlas Cloud 方面的 API 計費和資料處理須遵守 Atlas Cloud 自身的條款。本測試中未重現任何真實人物的肖像。如果你正在進行客戶工作,請閱讀你所呼叫的特定端點的模型條款,而不是本文的摘要。

常見問題

Wan 3.0 的原生 30 秒真的是單次生成,還是拼接的片段?

單次生成。Wan 3.0 在單次生成中產生 2 到 30 秒,並具有智慧時長選項,因此它也可以決定片段不需要完整的 30 秒。這不同於最後一幀延伸,後者從第一個片段的最後一幀生成第二個片段,並且身份會在接縫處飄移。

哪一個在 30 秒時真的是 1080p,Wan 3.0 還是 Seedance 2.5?

Wan 3.0。它的價格表上有一個原生 1080p 層級,而阿里巴巴自己的 30 秒示範檔案測量為 1920x1072。Seedance 2.5 原生僅生成 480p 和 720p;其 1080p、1440p 和 4K 選項是針對 720p 來源的增強,其 API 文件將 4K 層級描述為「並非原生 4K 生成」。

畫面在第 25 秒還是會崩壞嗎?

有可能,但失敗的形式改變了。不再是片段之間可見的接縫,而是鏡頭內部的變形和去相干性,集中在快速動作段落,而且放大無法移除它。有記錄的 Seedance 2.5 短片製作以 3.2 比 1 的拍攝比率運作,因此請規劃長鏡頭時要有覆蓋率。

哪個模型接受更多參考素材?

Seedance 2.5,差距很大:30 張圖片加上 10 部影片加上 10 個音檔,總共 50 個,其中參考影片和音檔每個請求的總時長上限為 30 秒。Wan 3.0 的手冊將參考素材上限設為 20 個,但它是唯一一個接受 .pdf.ppt.xls.doc.txt 檔案和即時網頁作為創作輸入的模型。

Wan 3.0 會有開放權重嗎?

沒有官方承諾。截至 2026 年 8 月的公開測試,尚未發佈任何 Wan 3.0 權重、Hugging Face 檢查點或 ComfyUI 節點,旗艦影片系列的官方開放權重止於 Wan 2.2(Kingy AI,2026 年 8 月)。除非阿里巴巴另行說明,否則請將你讀到的任何關於 3.0 權重發佈的資訊視為推測。

最新模型

一個 API,暢享全模態 AI。

探索全部模型