
兩個剪輯監視器並排播放同一個沙漠加油站鏡頭,一個下方顯示不間斷的30秒時間軸,另一個則顯示分成兩段的時間軸
第20秒時,加油槍噴出新鮮的綠色草地,還帶著水珠。馬兒滿意地瞇起眼睛。店員的牙籤從他嘴裡掉出來。
這個笑點只有在連續30秒的單一鏡頭內才有效。把四個8秒的片段剪在一起,馬的毛色會變,太陽眼鏡的形狀會變,天空色溫會偏移一檔,而笑點就在接縫處消失。
所以當Wan 3.0和Seedance 2.5幾乎同時上市,都宣稱原生30秒、單次生成、無需拼接時,這就不再只是一個測試基準的故事。這代表AI影片模型首次能夠在單一鏡頭內,完成鋪陳、轉折和收尾。
我仔細分析了規格,並對照阿里巴巴官方公開的示範檔案進行了核對,發現了所有報導都沒有提及的一件事:兩個模型都號稱30秒,但這30秒背後的解析度,根本不是同一種產品。
重點整理
- 兩個模型確實都能單次生成30秒。這部分不是行銷話術。Wan 3.0支援2到30秒,具有智慧時長選項;Seedance 2.5支援4到30秒。
- 只有Wan 3.0在30秒時能渲染原生1080p。Seedance 2.5原生僅能生成480p和720p。其1080p、1440p和4K選項都是針對720p來源進行後生成放大,且其API文件說明4K層級「並非原生4K生成」。
- Seedance 2.5在參考素材量上勝出:最多30張圖片加上10部影片加上10個音檔,共50個。Wan 3.0的創作者手冊設定參考素材上限為20個。
- Wan 3.0擁有其他模型都沒有的輸入類型:
.doc、.xls、.ppt、.pdf、.txt檔案,以及即時網頁,可直接作為創作參考。 - 兩者中只有一個目前能在阿里巴巴外部運行。Wan 3.0在阿里雲模型工作室和通義千問雲上公開測試,第三方API仍在逐步開放中。Seedance 2.5已在Atlas Cloud上線,時長控制可直接設定為30。
- 想在付費前先測試30秒的故事結構是否可行?Atlas Cloud的免費AI廣告小品產生器提供一次免費試用:15秒的完整廣告,包含口語對話和音效,可下載無浮水印版本。
阿里巴巴官方Wan 3.0示範,取自通義Wan 3.0創作者手冊。一鏡到底,無剪輯,30.07秒。以ffprobe測量:1920x1072,24fps,內建AAC立體聲。開啟音效聆聽尾巴甩動和牙籤在第29秒落地的聲音。此處作為比較和評論的參考素材。
Wan 3.0 vs Seedance 2.5 原生30秒:本月真正改變了什麼
十五秒曾是一道長期無法突破的牆。Wan 2.7止步於此,Seedance 2.0也止步於此。你過去一年在動態牆上看到的每一部「一分鐘AI電影」,都是四到八個片段在非線性剪輯軟體中拼接而成,再經過調色師處理來隱藏接合處。
有兩件事在同幾週內打破了這道牆。阿里巴巴於2026年8月6日開放了Wan 3.0公開測試,支援原生30秒生成和完整多模態參考輸入(AlphaSignal,2026年8月)。字節跳動將Seedance從15秒翻倍至30秒推出2.5版,明確定位為減少片段拼接及其伴隨的視覺飄移。
此處的「原生」在技術上具有特定意義。它指的是對單一潛在序列進行一次前向傳播,而非將片段A的最後一幀作為片段B起始的「最後一幀延伸」。延伸正是導致角色外套領子在鏡頭之間悄悄變形的原因。原生傳播將整個30秒放在同一個上下文中,因此馬匹會保持一致。
加油站示範是測試這個概念最乾淨的方式。其結構為四個節拍:0到8秒沒發生什麼事,8到16秒發生奇怪的事,16到24秒是笑點,24到30秒是離場。笑點落在第20秒。這意味著它只有在馬匹、太陽眼鏡、青橙調色和面無表情的固定鏡頭在前19秒都保持不變的情況下才能成立。拼接做不到這一點。不是因為剪輯師技術不好,而是因為片段B從未見過片段A。
Wan 3.0 vs Seedance 2.5 原生30秒:畫面究竟在哪裡崩壞
三十秒是十五秒的兩倍。飄移的風險不是兩倍大,而是更糟,而且會轉移到不同的失效模式。
拼接工作流程的失敗發生在片段之間。原生30秒的失敗發生在片段內部。在Seedance 2.5的實際短片製作中,評測者發現去相干性和變形表現為「角色模型的視覺尖刺或不穩定性」,集中在快速動作序列中,並特別指出這些瑕疵無法透過放大修復(MindStudio,2026年8月)。這對於任何打算在720p渲染後放大到4K的人來說至關重要:放大器只會銳化變形,而不是消除它。
同一製作記錄了3.2比1的拍攝比率。約450秒的原始生成,最終剪出2分22秒的成品。規劃長鏡頭工作時,要像拍攝有覆蓋率的鏡頭那樣,而不是像渲染佇列那樣每項工作都能直接產出。
該製作中還有兩個發現值得直接借用。整個影片的視覺一致性僅靠三張參考圖片維持:兩張角色肖像和一張地點場景圖,即使系統最多可接受50張。而在語音選角方面,寫「American」修正了意外的英國口音,但寫「American English」卻沒用,因為「English」這個詞會將發音拉回英式。
能夠撐過30秒的提示結構,正是阿里巴巴在其官方手冊中使用的形式:明確標註時間戳記的節拍。不要寫一段描述氛圍的段落。寫「0-8s、8-16s、16-24s、24-30s」,為每個區塊指定各自的鏡頭行為和事件,最後用一句涵蓋整個片段的音訊描述結尾。你會在下方步驟4中看到完全相同的骨架,因為我保留了阿里巴巴的結構,只進行了翻譯。
Wan 3.0 vs Seedance 2.5 原生30秒:規格、價格與目前可執行的內容
以下是誠實的現狀,也是兩個模型不再可互相比較的產品的部分。
請仔細閱讀解析度那一行,因為這是整篇文章的核心。Atlas Cloud 自己的 Seedance 2.5 文字轉影片 API 文件說明 720p-esr 是增強 480p 來源,1080p-esr、1440p-esr 和 4k-esr 都是增強 720p 來源,而 4K 選項提供 2160 像素短邊,「並非原生 4K 生成」。因此,一個標示為 4K 的 30 秒 Seedance 片段,實際只有 720p 的真實細節,經過重新取樣。相比之下,Wan 3.0 的價格表有直接的 1080p 層級,每秒 $0.20,而阿里巴巴官方公佈的 30 秒示範檔案測量為 1920x1072。
這個限制的好處是:整個測試可以在一個瀏覽器分頁中完成,橫跨三個模型,無需任何本地設定。
| 在本測試中的角色 | 模型 | 標示價格 |
|---|---|---|
| 開場畫面 | GPT Image 2 文字轉圖片 | 從 $0.009 / 張起 |
| 原生 30 秒執行 | Seedance 2.5 文字轉影片 | 從 $0.134 / 秒起 |
標示價格於 2026 年 8 月在 Atlas Cloud 模型頁面上驗證。請將其視為底價,而非最終報價。這些模型都根據你實際要求的內容計費,而且「執行」按鈕會在你點擊前根據你的確切設定顯示價格。在此測試中,按鈕報價為:一張 GPT Image 2 高品質 2048x1152 畫面為 $0.1745;一個五秒的 Seedance 2.5 720p 16:9 工作為 $1.514799,這相當於每秒約 $0.30,而非標示的 $0.134。標示的價格是 480p 的費率。請檢查按鈕,而不是目錄。Seedance 2.5 也提供一個 參考轉影片端點,價格相同為每秒 $0.134,如果你想利用 50 個參考素材的上限。
如何在 Seedance 2.5 上重現這個原生 30 秒測試
五個步驟,三個模型,全部在瀏覽器中完成。請逐字複製提示詞。
步驟 1:鎖定含時間戳記的 30 秒骨架
先不要執行任何動作。請先閱讀結構,因為這決定了你的 30 秒能否維持穩定。
本文頂部的 Wan 3.0 加油站示範是根據四個標記區塊建構的,並在開頭一次聲明固定的鏡頭原則:冷靜的客觀觀察、固定的中景、只有在荒謬的節拍時才突然使用極特寫。每個事件都固定在一個時間範圍內。音訊是一句在最後涵蓋全部 30 秒的台詞。
以下是空的骨架。填入內容後,你就會有一個原生 30 秒模型能夠追蹤的提示詞:
Plain1一個 30 秒的 [類型],設定在 [地點]。 [視覺風格、調色、飽和度]。鏡頭語言:[原則],並以 [例外情況] 作為間歇點綴。 2 30-8s:[鋪陳,廣角,建立正常世界,在地平線引入異常] 4 58-16s:[異常行動,仍以正常方式處理,一個主觀鏡頭或反應插入] 6 716-24s:[收尾,對事物本身的極特寫,硬切到反應的臉部] 8 924-30s:[離場,一個小型的物理動作來結束笑點] 10 11音訊:[環境音,三到四個特定的現場音,一個最後的小聲音]。無音樂,無對話,無螢幕文字。
阿里巴巴參考檔案的可測量規格(供任何想核對數字的人使用):30.07 秒,1920x1072,24fps,AAC 立體聲。這是 Seedance 執行即將被衡量的標準。
步驟 2:生成開場畫面
你需要一個固定的視覺錨點,讓 15 秒和 30 秒的執行從同一個世界開始。打開 GPT Image 2 文字轉圖片。
設定: 品質 high,比例 16:9,1 張圖片。
Plain1一個寬廣、靜止的定場鏡頭,展現一座孤獨的 66 號公路風格加油站,位於明亮的沙漠中。復古的黃橙藍色建築,油漆微微被陽光曬褪色;前方有一個褪色的復古紅色加油泵;旁邊有一間小便利商店,門口有一台褪色的可樂自動販賣機。前景是龜裂的橘色乾燥土地,遠處是溫暖的陶土色山脈,無雲清澈的青色藍天。一名穿著油膩藍色連身工作服、戴著超大型黑色太陽眼鏡的加油站員工,半睡半醒地癱坐在門邊的椅子上,嘴裡叼著牙籤。嚴格的明亮青橙調色,高飽和度,高亮度,電影級寫實,固定鏡頭,16:9。

Atlas Cloud 上的 GPT Image 2 操作介面,品質設為 high,比例 16:9,輸出面板中顯示生成的 66 號公路加油站定場鏡頭
Atlas Cloud 上的 GPT Image 2:品質 high,16:9,一張圖片。此畫面的執行按鈕報價為 $0.1745,這正是 2048x1152 高品質渲染的實際成本。模型頁面上的 $0.009 是底價。

使用 GPT Image 2 生成的 66 號公路加油站定場畫面,青色天空與橘色龜裂大地,員工在門邊打盹
開場畫面。這是步驟 3 的輸入,也是步驟 4 的視覺目標。使用 openai/gpt-image-2 生成。
步驟 3:撞上 15 秒之牆
設定: 首幀 = 你的步驟 2 輸出,duration 拖曳到最大值 15,解析度 1080P。
Plain1固定廣角鏡頭保持不動。一名戴著寬邊帽的女牛仔,騎著一匹真馬,以步行速度從地平線出現。正在打盹的員工被馬蹄聲吵醒,推了推太陽眼鏡,坐直身體,嚼著牙籤,一臉不以為然。她乾淨俐落地跳下馬,牽著馬直接走向復古加油泵。明亮的青橙調色,高飽和度,寫實,冷靜觀察的鏡頭,無剪輯。
下拉選單停在 15。這就是這一步的重點。你的笑點預定在第 20 秒,而這個流程無法一次到達第 20 秒。要達到那裡,你需要從最後一幀生成第二個片段,而一旦你這麼做,馬就變成了一匹新馬。

步驟 4:執行完整的原生 30 秒流程
設定: duration = 30,resolution = 720p,ratio = 16:9,generate_audio = 開啟,output_format = mp4,浮水印關閉。
刻意選擇 720p,而不是 1080p-esr。720p 是該模型的真實天花板,因此這是一個像素對像素的比較,而不是與放大器的比較。
下面的提示詞是阿里巴巴自己的加油站示範提示詞,從 Wan 3.0 創作者手冊中忠實翻譯,並重組為純文字。相同的節拍、相同的時間點、相同的鏡頭原則、相同的音訊清單。
Plain1一個 30 秒的荒誕面無表情喜劇短片,設定在明亮沙漠中一間被陽光曬褪色的 66 號公路風格加油站。寫實,嚴格的明亮青橙調色,高飽和度和高亮度,讓荒誕事件發生在一個完全正常、幾乎美麗的世界中。鏡頭語言:冷靜、客觀的觀察,大部分是固定的中景和緩慢的橫向移動,沒有情緒引導,並在荒誕的節拍處突然使用極特寫。 2 30-8s:廣角,固定。青色天空,飄動的灰塵。復古的黃橙藍色加油站獨自矗立在路邊;一名穿著油膩藍色連身工作服、戴著巨大黑色太陽眼鏡的員工在椅子上打盹,嘴裡叼著牙籤。只有風聲。地平線上,一名女牛仔騎著一匹真馬以步行速度出現。切到中景:馬蹄聲吵醒他,他推了推太陽眼鏡,坐直,將這對組合解讀為「又一個來問路的」。 4 58-16s:她一句話也沒說。她乾淨俐落地跳下馬,牽著馬直接走向舊加油泵。馬隨意地把頭湊到加油泵旁邊,就像以前做過一樣。短暫的、稍微帶有魚眼效果的主觀鏡頭,從他的太陽眼鏡後方看出去,女人和馬看起來更奇怪。特寫:他皺起眉頭,摘下太陽眼鏡,正要大喊。慢動作特寫:當眼鏡取下時,她將加油槍對準馬的嘴,並扣下扳機。 6 716-24s:加油槍的極特寫。噴出來的不是汽油,而是新鮮的亮綠色草叢,還帶著水珠。硬切到員工臉部的極特寫,凍結住:眼睛瞪得跟碟子一樣大,嘴巴微微張開,牙籤忘了嚼。中景:馬開心吃草,滿足地瞇起眼睛,然後滿意地用力甩了一下尾巴,揚起的灰塵正好落在仍然震驚的員工臉上。 8 924-30s:草「加滿」了。她將加油槍掛回加油泵,從口袋裡掏出硬幣,走向商店門口,將硬幣叮噹作響地丟進櫃檯上的一個錫罐裡。她回頭看了一眼嚇呆的員工;在帽簷下,她的嘴角微微上揚。她重新上馬,在一片灰塵中騎走。鏡頭緩慢推向他:同樣凍結的姿勢,臉上沾滿灰塵,太陽眼鏡還捏在手裡,最後,牙籤從他嘴裡掉落,發出細微的咔嗒聲。 10 11音訊:整段乾燥的沙漠風聲,馬蹄聲,加油泵手柄的機械咔噠聲,潮濕草叢噴出的聲音,尾巴甩動聲,硬幣掉進錫罐的聲音,以及牙籤落地時的一聲細微咔嗒。無音樂,無對話,無螢幕文字。
一個能幫你省下一筆冤枉錢的警告,而且和步驟 3 是同樣的陷阱:將時長滑桿拖曳到 30,不要在數字方塊中輸入 30。 方塊可能會開心地顯示 30,而滑桿卻停留在五秒的預設值上,執行按鈕會報價五秒的價格。在點擊之前檢查報價。在 720p 和 16:9 下,一個五秒的工作報價為 $1.514799,因此一個真正的 30 秒流程報價約為其六倍。
這一步沒有完成的執行畫面截圖。三次自動捕捉嘗試都提交了滑桿的預設值而非 30 秒,為了不向您展示一個標示為 30 秒但實際只有五秒的片段,因此省略了捕捉畫面。上面的提示詞和設定正是您需要貼上與設定的內容。
步驟 5:誠實地判讀飄移
以下是 Seedance 2.5 針對相同提示詞的結果,以原生 30 秒、720p、16:9、開啟音訊生成。
Seedance 2.5,完全複製相同的 Wan 3.0 加油站提示詞:一次生成的原生 30 秒,1280x720,24fps,內建音訊。相同的四個節拍,女牛仔和馬抵達,加油槍的梗,員工認知失調的特寫。將其與頂部的 Wan 3.0 片段並排觀看,進行像素對像素的閱讀。
將兩個片段並排,檢查五個特定事項。不要檢查「哪個看起來較好」,那是品味之爭,只會浪費你的下午。
- 毛色與服裝的一致性。 馬在第 29 秒的顏色是否與第 6 秒相同?太陽眼鏡在取下並放回他手中後,形狀是否相同?
- 調色穩定性。 在第 2 秒和第 28 秒取樣天空。青橙調色在長時間生成中比預期更常會向暖色飄移。
- 第 20 秒的物理節拍。 從加油槍噴出草地是一個物理請求。它是否以重量弧線落下,還是作為紋理淡入?
- 鏡頭紀律。 提示詞說固定鏡頭。計算鏡頭在未經要求的情況下自行發明推進的次數。這是長時間生成最常見的失敗:模型耗盡了預定的事件,並用移動來填滿時間。
- 快速動作變形。 尾巴甩動和灰塵揚起是片段中最快的動作。根據 MindStudio 的製作筆記,這正是去相干性集中的地方,也正是放大無法修復的地方。
根據這五點打分,而不是憑感覺。這是一個你可以向客戶辯護的比較。
另外三個 Wan 3.0 vs Seedance 2.5 原生 30 秒對應提示詞
一個示範只是個案。以下是來自同一手冊的三個官方 Wan 3.0 30 秒檔案,每個都測試了 30 秒問題的不同方面。對於海怪和黑暗奇幻獨白,Seedance 2.5 的部分是使用相同的提示詞以原生 30 秒生成,並直接嵌入在每個之後,這樣你可以觀看兩者,而不是只聽我的一面之詞。
| 提示詞 | 測試重點 | Wan 3.0 官方檔案,測量值 | Seedance 2.5 部分,相同提示詞 |
|---|---|---|---|
| 海怪災難電影 | 10 個指令分鏡加上管弦樂配樂在 30 秒內 | 1920x1072, 24fps, 30.07s, AAC | 以 30 秒生成,嵌入下方;移除了一個 IP 名稱和船隻品牌文字,以便 Seedance 的內容過濾器能通過,分鏡表其餘部分相同 |
| 黑暗奇幻英文獨白 | 原生英語配音和唇形同步,搭配緩慢連續推進 | 1280x720, 24fps, 30.05s, AAC | 以 30 秒從提示詞逐字生成,嵌入下方 |
| 2D 運動動漫,兩行提示詞 | 模型能否在幾乎沒有指令的情況下填滿 30 秒 | 1280x720, 24fps, 30.05s, AAC | 未在此處生成;以 Wan 專用的畫面格網格顯示,以閱讀跨時間的結構 |
| 甩鏡喜劇短片(已排除) | 8 次甩鏡和 8 個情緒節拍,無剪輯 | 1280x720, 24fps, 30.04s, AAC | 未執行:對話密度為普通話特定,英文改寫無法公平對等 |
官方 Wan 3.0 示範:十個指令分鏡和完整的管弦樂鋪陳,在一個 30 秒的流程內,解析度 1920x1072。這是原生 1080p 最有力的論證,因為水體體積和生物濕潤皮膚的細節,正是 720p 放大所發明而非還原的東西。阿里巴巴通義創作者手冊,用於比較和評論。
Seedance 2.5,相同的十個分鏡災難提示詞,原生 30 秒,開啟音效。暴風雨中的漁船,驚恐的甲板水手,海浪湧起,然後深海巨獸在閃電中破水而出。移除了 IP 參考和船體上的品牌文字,以便 Seedance 的內容過濾器能通過;分鏡表其餘部分完全相同,這使得水體體積和濕潤皮膚細節的比較,對於上方 Wan 3.0 片段來說是公平的像素對像素。
官方 Wan 3.0 示範,開啟音效。原生英語反派對話:「夠熟了,可以送入虛空」,在一個連續的緩慢上搖鏡頭中完成,無剪輯。這是英語團隊應該測試的片段,因為語音、唇形同步和 30 秒連續鏡頭移動必須同時維持穩定。
Seedance 2.5,相同的黑暗奇幻提示詞逐字複製,原生 30 秒,開啟音效。相同的紫眼反派,星形符文標記,他張開的手掌中形成的陰影星雲,以及兩句英語台詞。觀察唇形同步和單一連續推進是否能像 Wan 3.0 那側一樣,撐過完整的 30 秒。
如果你執行這一個的對應 Seedance 2.5 部分,請逐字保留兩句英語台詞,並記住製作筆記中的口音技巧:寫「American」,而不是「American English」。「English」這個詞會將發音拉回英式讀法。
第三個是意外的驚喜。阿里巴巴手冊中的 2D 運動動漫提示詞只有兩行。沒有時間戳記,沒有分鏡表,只是一個拳擊手在打沙袋,疲憊,痛苦。從那樣的提示詞生成 30 秒,是對模型能否自行創造結構的真正考驗。以下是它在自己運行時間內的取樣:

官方 Wan 3.0 2D 運動動漫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣,顯示拳擊手的設計和健身房背景在整個 30 秒內保持不變
官方 Wan 3.0 2D 運動動漫示範的四個畫面,分別在第 1、10、20 和 29 秒左右取樣。相同的角色設計,相同的背心,相同的沙袋,同一排置物櫃,從提示詞從未要求的廣角到特寫變化。這是一個靜態網格而不是片段,因為這裡的比較是同一檔案內跨時間的結構,而非運動。
實際解讀:使用兩行提示詞,模型自行發明了鏡頭覆蓋,從固定的廣角移動到汗水和疲憊的特寫,並在此過程中保持了角色設計。這是好消息。權衡是:你放棄了對事件發生時間的控制。如果你需要 30 秒在特定秒數落下一個特定節拍,請寫下時間戳記。
在付費之前,免費測試原生 30 秒敘事
Seedance 2.5 上一個 30 秒的 720p 執行,當你以實際解析度而非目錄底價計價時,報價約為 $9。Wan 3.0 價格表上一個 30 秒的 1080p 執行是 $6.00。以製作標準來說都不算貴,但考慮到 3.2 比 1 的拍攝比率,你買的不是一個片段,而是三四個。
在你花費任何費用之前,值得先回答一個更便宜的問題:我的劇本真的能作為一個連續鏡頭撐住嗎?大多數 30 秒的失敗不是模型失敗。而是結構失敗:三個節拍塞進本應只有兩個的空間,或者一個安排在 26 秒的笑點,而 8 到 20 秒之間沒有任何東西支撐。
Atlas Cloud 的免費 AI 廣告小品產生器可以免費回答這個問題。你提供一個產品描述和最多四張產品照片(每張低於 8MB),選擇六種風格之一(搞笑迷因、劇情反轉、情境喜劇、溫馨感人、奢華精品、或強力推銷),它會先寫出一個雙角色劇本,包含三秒鉤子、衝突和轉折,然後圍繞這個劇本建立每個鏡頭。角色會大聲說出他們的台詞,音效也會渲染到影片中。
誠實的限制:它是 15 秒,而不是 30 秒,你需要登入,而且你只能免費生成一次,之後需要加值點數。但是一個具有鉤子、衝突和轉折的 15 秒,可以告訴你你的三個節拍是否順暢。如果結構在那裡可行,那麼將相同的節拍拉長,放入步驟 1 的 0-8s / 8-16s / 16-24s / 24-30s 骨架中,然後花那九美元進行一次真正的原生 30 秒執行。
Wan 3.0 vs Seedance 2.5 原生 30 秒片段的實際成本
| 設定 | 費率 | 時長 | 一個片段 |
|---|---|---|---|
| Wan 3.0, 1080p 原生(僅限阿里雲) | $0.20 / 秒 | 30s | $6.00 |
| Wan 3.0, 720p 原生(僅限阿里雲) | $0.10 / 秒 | 30s | $3.00 |
| Wan 3.0, 480p 原生(僅限阿里雲) | $0.05 / 秒 | 30s | $1.50 |
| Seedance 2.5, 720p 原生,在 Atlas Cloud 上 | 720p 測量為 $0.30 / 秒,標示從 $0.134 起 | 30s | 約 $9.09 |
| GPT Image 2 開場畫面,品質 high,2048x1152 | 標示從 $0.009 / 張起 | 1 張圖片 | 報價 $0.1745 |
真正決定性的比較:Wan 3.0 在 720p 下每秒比 Seedance 2.5 在 720p 下便宜,而在 1080p 下,它是兩者中唯一銷售真實像素的。Seedance 2.5 的答案是 50 個參考插槽、即時可用性,以及一個你今天下午就可以使用並交付的運作中 API。
這些原生 30 秒片段的來源與授權說明
本文中的每個 Wan 3.0 片段和每個 Wan 3.0 提示詞均來自阿里巴巴公開發佈的「通義 Wan 3.0 創作者手冊」,此處為比較和評論而重現,已標明來源,未修改且未移除浮水印。Seedance 2.5 輸出的商業用途須遵守字節跳動和火山引擎的條款;Atlas Cloud 方面的 API 計費和資料處理須遵守 Atlas Cloud 自身的條款。本測試中未重現任何真實人物的肖像。如果你正在進行客戶工作,請閱讀你所呼叫的特定端點的模型條款,而不是本文的摘要。
常見問題
Wan 3.0 的原生 30 秒真的是單次生成,還是拼接的片段?
單次生成。Wan 3.0 在單次生成中產生 2 到 30 秒,並具有智慧時長選項,因此它也可以決定片段不需要完整的 30 秒。這不同於最後一幀延伸,後者從第一個片段的最後一幀生成第二個片段,並且身份會在接縫處飄移。
哪一個在 30 秒時真的是 1080p,Wan 3.0 還是 Seedance 2.5?
Wan 3.0。它的價格表上有一個原生 1080p 層級,而阿里巴巴自己的 30 秒示範檔案測量為 1920x1072。Seedance 2.5 原生僅生成 480p 和 720p;其 1080p、1440p 和 4K 選項是針對 720p 來源的增強,其 API 文件將 4K 層級描述為「並非原生 4K 生成」。
畫面在第 25 秒還是會崩壞嗎?
有可能,但失敗的形式改變了。不再是片段之間可見的接縫,而是鏡頭內部的變形和去相干性,集中在快速動作段落,而且放大無法移除它。有記錄的 Seedance 2.5 短片製作以 3.2 比 1 的拍攝比率運作,因此請規劃長鏡頭時要有覆蓋率。
哪個模型接受更多參考素材?
Seedance 2.5,差距很大:30 張圖片加上 10 部影片加上 10 個音檔,總共 50 個,其中參考影片和音檔每個請求的總時長上限為 30 秒。Wan 3.0 的手冊將參考素材上限設為 20 個,但它是唯一一個接受 .pdf、.ppt、.xls、.doc、.txt 檔案和即時網頁作為創作輸入的模型。
Wan 3.0 會有開放權重嗎?
沒有官方承諾。截至 2026 年 8 月的公開測試,尚未發佈任何 Wan 3.0 權重、Hugging Face 檢查點或 ComfyUI 節點,旗艦影片系列的官方開放權重止於 Wan 2.2(Kingy AI,2026 年 8 月)。除非阿里巴巴另行說明,否則請將你讀到的任何關於 3.0 權重發佈的資訊視為推測。






