
最新更新:Wan 3.0 已於 2026 年 8 月 24 日上線。
一個調色室牆面,顯示同一張雨夜屋頂畫面,時間碼從 00:00 到 00:30。
三十秒不間斷的一鏡到底,橫跨時間軸。要達到那一步,本身就是整個故事。
Wan 3.0 Preview 進入公開測試當天,我開始尋找它的規格表。搜尋結果第一頁告訴我:它支援原生 4K、以 Apache 2.0 授權釋出、還有「六鏡頭 AI 導演模式」。六個不同網站,同樣的宣稱,卻沒有一個連結到原始來源。
於是我打開阿里巴巴自家的模型頁面。480P、720P、1080P。沒有 4K。接著我直接呼叫 Hugging Face API,拉取 Wan-AI 組織下的所有倉庫。最新的是 Wan2.2-Animate-2,推送日期與 Wan 3.0 上線同一天。根本沒有任何 3.0 的東西。
然後我做了別人都沒做的事。Wan 3.0 的主打是單次生成 30 秒連續影片,而我沒有使用權限,所以我試著用今天實際能呼叫的模型來重現這個結果。我失敗了。而失敗的方式,反而成了這篇文章最有價值的部分。
重點摘要
- Wan 3.0 Preview 於 2026 年 8 月 6 日進入公開測試。 模型 ID
wan3.0-video,在阿里雲模型工作室和 Qwen Cloud 上需要申請才能使用,並非開放註冊。 - 真實規格: 單次生成最多 30 秒,支援 480P/720P/1080P,價格為每秒 $0.05/$0.10/$0.20。
- 沒有 4K,也沒有開放權重。 我查詢了 Hugging Face API 中
Wan-AI下的所有倉庫,沒有任何高於 Wan 2.2 的可下載版本。 - 真正的瓶頸是速率限制: 2 個並發請求、每分鐘 30 次請求、50 個排隊非同步任務。
- 你無法用 Wan 2.7 偽造 30 秒一鏡到底。 三個未公開的限制讓最長真正連續片段卡在 15 秒,而嘗試串接第二段續拍會讓模型倒退而非前進。
15 秒之牆:Wan 3.0 Preview 真正在賣的是什麼
這是我能拿到的最佳結果:15 秒不間斷的 1080P 畫面——從一個發光的霓虹招牌推進,到雨中的屋頂咖啡攤老闆收攤,接著鏡頭下搖到濕漉漉的街道和一輛計程車。單一連續生成的檔案,未經剪輯,附帶生成音訊。

十五秒連續的 Wan 2.7 影片:霓虹招牌、屋頂攤販、下搖到雨街與計程車
Wan 2.7 系列為我生成的最長真正連續片段:15 秒,1080P,單一檔案。此處顯示為無聲 GIF;實際交付檔案包含 44.1kHz 立體聲。
這效果不錯。但也正好是 Wan 3.0 宣稱一次呼叫能達到的長度的一半,而且 15 秒就是焊死的天花板。以下所有內容,都是在說明我如何找到那條焊縫。
為什麼你讀到的每一份 Wan 3.0 Preview 規格表很可能都是錯的
有兩個因素讓這次發佈格外嘈雜。第一,單次生成 30 秒對該系列來說確實是首創。Wan2.7-Video 最多只能到 15 秒,而大多數主流影片模型落在 5 到 15 秒之間(TNGlobal,2026 年 8 月)。第二,Wan 3.0 接受其他模型沒有的參考輸入:除了文字、圖片、音訊和影片,還接受 doc、xls、ppt、pdf、md 檔案以及網頁,所以一份投影片就能變成影片(AlphaSignal,2026 年 8 月)。
這個組合導致大量報導來自那些從未翻開過文件的網站。以下是每一個廣泛流傳的宣稱,並與原始來源進行核對。
表 A:Wan 3.0 Preview 規格核對
| 流傳的宣稱 | 原始來源的說法 | 判定 |
|---|---|---|
| 單次生成 30 秒 | 已確認,相較於 Wan 2.7 的 2 到 15 秒 | ✅ 真實 |
| 原生 4K 輸出 | 官方解析度僅有 480P、720P 和 1080P | ❌ 錯誤 |
| Apache 2.0 開放權重 | Hugging Face 上 Wan-AI 下無任何 Wan 3.0 倉庫 | ❌ 錯誤 |
| 文件轉影片(PDF、PPT、XLS) | 已確認為參考輸入類型 | ✅ 真實 |
| 「六鏡頭 AI 導演模式」 | 未出現在阿里巴巴任何文件中 | ❌ 不支援 |
| 「12 種語言唇形同步與身份鎖定」 | 未出現在阿里巴巴任何文件中 | ❌ 不支援 |
| 每秒 $0.05 / $0.10 / $0.20 | 已確認,對應 480P / 720P / 1080P | ✅ 真實 |
| 開放所有人使用 | 在 Model Studio 和 Qwen Cloud 上需申請 | ⚠️ 測試版,需要邀請 |
定價和速率限制直接來自模型頁面:2 個並發請求、每分鐘 30 次請求、以及 50 個非同步任務佇列(QwenCloud,2026 年 8 月)。這個並發數字幾乎沒有被報導,但卻是頁面上最重要的一行。兩個並行任務,每個耗時數分鐘,對發佈演示來說還行,但還不足以構成管線。
現在是開源社群真正關心的問題。Wan 2.1 和 Wan 2.2 提供了可下載的檢查點。Wan 2.5 承諾的權重從未實現,Wan 2.6 完全封閉,Wan 2.7 仍是僅限 API。我查詢了 Hugging Face API 中 Wan-AI 組織下按創建日期排序的所有模型,以確認 3.0 是否打破這個慣例。最新的三個倉庫都是 Wan2.2-Animate-2 的變體,創建於 2026 年 8 月 6 日,也就是 Wan 3.0 上線的同一天。下載量最高的倉庫仍然是 Wan2.2-TI2V-5B-Diffusers,過去 30 天約有 179,000 次下載(Hugging Face,2026 年 8 月)。
所以答案是否定的,Wan 2.2 仍然是開放權重的天花板。如果你的計畫包括在本機執行或微調這個模型,那麼目前沒有東西可以執行。
在 Atlas Cloud 上試用即時模型:在 Atlas Cloud 上開啟 Wan 3.0 文字轉影片。
一個真實的 Atlas Cloud Wan 3.0 文字轉影片遊樂場執行:提示詞顯示在左側,完成生成的片段顯示在右側。
Wan 3.0 Preview 堆疊:你今天實際能跑什麼
情況很清晰。Wan 3.0 位於一個需要申請的表單後面,並有兩個任務的並發上限。在此之前的所有版本,從 Wan 2.7 回溯到 2.2,都可以用一個 API 金鑰立即呼叫,還可以與 Seedance 和 Kling 進行跨模型比較。本文中的所有內容都是這樣執行的,在一個瀏覽器分頁中完成。
以下價格來自 2026 年 8 月 10 日的 Atlas Cloud 模型目錄,而非任何部落格文章。
表 B:Wan 3.0 Preview 與現有模型的比較
| 模型 | 最長單次生成 | 解析度 | 存取方式 | 並發數 | 列示每秒價格 |
|---|---|---|---|---|---|
| Wan 3.0 Preview | 30 秒 | 480P / 720P / 1080P | 需要申請 | 2 | $0.05 / $0.10 / $0.20 |
| Wan 2.7 文字轉影片 | 15 秒 | 720P / 1080P / 1080P-SR / 1440P-SR | 開放 | 標準 | 從 $0.10 起 |
| Wan 2.7 圖片轉影片 | 15 秒 | 720P / 1080P | 開放 | 標準 | 從 $0.10 起 |
| Wan 2.6 文字轉影片 | 15 秒 | 720p / 1080p | 開放 | 標準 | $0.07(原價 $0.10 打七折) |
| Wan 2.5 文字轉影片 | 10 秒 | 720p / 1080p | 開放 | 標準 | $0.035(原價 $0.05 打七折) |
| Wan 2.2 圖片轉影片 | 10 秒 | 480p / 720p | 開放,權重可下載 | 標準 | $0.03 |
| Seedance 2.5 文字轉影片 | 30 秒 | 480p / 720p | 開放 | 標準 | 從 $0.134 起 |
| Kling v3.0 Pro 文字轉影片 | 15 秒 | 模型預設 | 開放 | 標準 | $0.095(原價 $0.112 打八五折) |
折扣為 2026 年 8 月即時生效且有時限,因此在根據預算規劃前請先查看模型頁面。
從這張表可以得出兩個結論。Wan 3.0 的 30 秒單次生成已不再是獨一無二:Seedance 2.5 已經接受一次呼叫中 4 到 30 秒的時長,只是解析度上限為 720p。而 Wan 2.7 是唯一提供 1440P-SR 超解析度層級的選項,根據其自身定價模式,此層級收費為原生 1080P 的 80%,Wan 3.0 則沒有這個選項。
Wan 3.0 擁有而其他模型沒有的,是單次生成 30 秒且達 1080P,再加上文件參考輸入功能。Wan 3.0 在 Atlas Cloud 上有一個佔位頁面,標示為「即將推出」,因此當它正式發佈時,會使用同一個金鑰。在此期間,以下是舊版模型能帶你走多遠的詳細說明。
Wan 3.0 Preview 教學:步驟 1:撰寫一鏡到底的拍攝簡報
這份簡報會在每次生成之間沿用,所以一次寫好即可。Wan 3.0 偏愛長篇、附帶時間碼的鏡頭描述,而 Wan 2.7 在 5,000 字元的提示詞限制內也能接受相同的結構。
有效的範本:鏡頭 [時間碼] + 主體動作 + 攝影機移動 + 光線 + 環境音訊。在第一行就聲明這是一鏡到底,並明確描述音景,因為 Wan 2.7 會原生生成音訊,如果你留空,它會自己創造一些沒有幫助的內容。
我刻意選擇了一個雨夜屋頂咖啡攤的場景。這可以考驗四項通常會同時出問題的元素:持續的攝影機運動、人物臉部一致性、潮濕的霓虹燈反射,以及連續的環境音訊。
textCopy
text11BEAT 1 (0-10s): 從一個閃爍的粉紅與青色霓虹招牌緩慢推近,朝向一位在屋頂咖啡攤擦拭鋼製檯面的年輕女性攤主。 22BEAT 2 (10-15s): 攝影機越過屋頂邊緣下搖到下方濕漉漉的街道,滑向一輛在路邊怠速的計程車。 33不變元素:大雨、霓虹色調、35mm 變形寬銀幕、底片顆粒、無剪接。 44
這是計畫,不是提示詞。實際貼上的提示詞如下。
步驟 2:以 1080P 生成開場
開啟 Wan 2.7 文字轉影片頁面,並貼上完整的 Beat 1。
textCopy
text11連續單一鏡頭,無剪接。深圳一個雨夜屋頂咖啡攤。 22鏡頭 [0-4s]:從一個閃爍的粉紅與青色霓虹招牌緩慢推近,朝向一位年輕女性攤主擦拭鋼製檯面,雨水在霓虹光中劃過,壺中升起蒸氣。 33鏡頭 [4-10s]:攝影機停在胸口高度,她抬頭露出半個微笑,淺景深,檯面上潮濕的反射,身後黑暗的天空中可見雨滴。 44音訊:穩定的雨聲,遠處車流聲,陶瓷杯的碰撞聲。 55電影感,變形寬銀幕,35mm,高動態範圍,細緻底片顆粒。 66
設定: 解析度 1080P,長寬比 16:9,時長 10,提示詞擴展 OFF。
提示詞擴展預設為開啟,它會在生成前改寫你的提示詞,這會默默破壞時間碼控制的鏡頭描述。當鏡頭分鏡是重點時,請務必關閉它。
將時長設為 10 而非 15 秒的最大值。這不是成本考量,原因要到步驟 3 才會顯現。

Atlas Cloud 上的 Wan 2.7 文字轉影片,執行完成,OUTPUT 面板中顯示 1080P 輸出
步驟 2 的遊樂場畫面:提示詞已貼上,1080P,16:9,執行完成,結果顯示在右側。請注意 Run 按鈕顯示 $0.75 用於 5 秒 1080P 任務,相當於每秒 $0.15,而非目錄中標示的「從 $0.10 起」。
步驟 3:續拍,並觀察它在哪裡斷掉
Wan 2.7 的圖片轉影片端點有一個影片續拍模式,可以接收現有片段並繼續拍攝。將步驟 2 的輸出網址放入 video 欄位,將時長設為 15,然後貼上 Beat 2:
textCopy
text11以相同的攝影機語言和光線繼續同樣的不間斷鏡頭。 22下搖動作繼續越過屋頂邊緣到街道層,攝影機穿過雨水向前滑向一輛在路邊怠速的計程車,雨刷揮動著。 33保持與來源片段相同的雨勢、霓虹色調、底片顆粒和環境音訊。無剪接、無淡出、無場景轉換。 44
這會產生這篇文章頂部的 15 秒片段。現在說明我遇到的三個限制,這些限制都不在文件中。
一:來源片段必須是 2 到 10 秒。 這就是為什麼步驟 2 的上限設為 10。如果你生成一個 15 秒的開場,你就完全無法擴展它,因為 15 秒的檔案不是合法的輸入。
二:請求的時長必須大於來源時長。 輸入一個 10 秒的片段並要求 10 秒,API 會直接拒絕:first_clip duration (10s after trim) must be less than the requested duration (10s)。因此輸出會包含來源片段,而一次傳遞最多能增加的時間是 5 秒。
三:它不會保留你的來源片段。 這是最重要的一點。下方,上排是原始 10 秒片段在 5 秒和 9.9 秒的畫面。下排是續拍輸出在相同兩個時間碼的畫面。

四個影格比較來源片段與續拍輸出在 5 秒和 9.9 秒的狀況
上排:來源片段在 5 秒和 9.9 秒。下排:續拍輸出在相同時間碼。在 5 秒處兩者相符。到了 9.9 秒,來源片段仍在攤販處,而續拍輸出已經切到街道,因為它把來源片段壓縮到大約前六秒,然後用剩餘時間生成新材料。
所以續拍不是拼接。它會加快重新渲染你的片段以騰出空間,而你原始片段的最後幾秒就這麼不見了。
這自然引出一個顯而易見的點子:串接它。把 15 秒的結果再餵回去,要求再 15 秒。我試了。結果如下。

第二次串接續拍,結果漂回屋頂攤販,而非推進場景
第二次續拍傳遞。它重播了街道和計程車,然後迴圈回到序列最開始的屋頂攤販,而不是向前移動。串接無法累積。
這就是那堵牆。輸出上限是 15 秒,輸入上限是 10 秒,而串接鏈中的第二環會倒退。這個模型系列真正連續畫面的天花板就是 15 秒。任何更長的內容都是剪接,而不是一鏡到底,而剪接正是 30 秒單次生成所要消除的。
有一點需要揭露:步驟 3 的遊樂場畫面失敗了三次,因為頁面的預設參考圖片一直劫持執行,因此步驟 3 是透過 API 而非遊樂場 UI 執行的。上述的提示詞、設定和輸出均來自該次真實執行。
Wan 3.0 Preview 的 30 秒實際成本
步驟 2 中的 Run 按鈕顯示 $0.75 用於一個 5 秒 1080P 任務。這相當於每秒 $0.15,而非目錄中標示的 $0.10,因為標示價格是底價,而計費會隨解析度調整。永遠相信即時報價而非卡片上的數字。
以這個實際價格計算,我的 15 秒連續畫面成本為:10 秒開場 $1.50 加上續拍 $2.25,總計 $3.75 獲得 15 秒交付內容。
表 C:五種方式獲得 30 秒的成本
| 路徑 | 計算方式 | 總計 | 你實際得到的內容 |
|---|---|---|---|
| Wan 3.0 Preview,1080P | $0.20 × 30 | $6.00 | 30 秒連續,單次生成,無接縫 |
| Wan 3.0 Preview,720P | $0.10 × 30 | $3.00 | 30 秒連續,720P |
| Wan 3.0 Preview,480P | $0.05 × 30 | $1.50 | 30 秒連續,480P |
| Wan 2.7,開場加續拍 | $0.15 × 25 計費 | $3.75 | 僅 15 秒。 無法達到 30 秒。 |
| Seedance 2.5,480p | 從 $0.134 × 30 | ~$4.05 | 30 秒連續,解析度上限 720p |
再看一次第四行。用 Wan 2.7 產生 15 秒連續畫面的成本,比 Wan 3.0 以 720P 產生 30 秒連續畫面的收費還高。變通方案並不是便宜的選項,而是既貴又行不通的選項。
關於 Seedance 那一行有一個注意事項:其列示價格是 480p 的底價,且該模型按像素面積計費,因此 720p 在實務上大約是該數字的 2.25 倍。
關於授權,請務必小心。Wan 3.0 仍在測試版,因此商業條款來自你申請時接受的阿里雲服務協議,而非任何模型授權,並且在正式發佈前可能改變。由於沒有公開發布權重,本機部署和微調都不是選項。在交付客戶作品前,請根據你自己的帳戶條款確認屬性標註和浮水印要求。
常見問題
Wan 3.0 Preview 現在已經開放所有人使用了嗎?
沒有。它於 2026 年 8 月 6 日進入公開測試,但存取權限需要透過阿里雲模型工作室和 Qwen Cloud 申請。通過的帳號可獲得 2 個並發請求、每分鐘 30 次請求以及 50 個非同步任務佇列,這是為評估而非生產環境設計的規模。
Wan 3.0 Preview 是開源的嗎?權重在哪裡?
完全沒有。查詢 Hugging Face API 中 Wan-AI 組織下的所有倉庫,沒有任何高於 Wan 2.2 的內容。最新的三個倉庫都是 Wan2.2-Animate-2 的變體,創建於 Wan 3.0 上線的同一天。Wan 2.2 仍然是開放權重的天花板。
Wan 3.0 Preview 真的支援原生 4K 嗎?
不。官方文件列出的是 480P、720P 和 1080P。4K 的宣稱來自於聚合網站互相引用,而非原始來源,而且與阿里巴巴自己的定價表矛盾,因為定價表只有三個解析度層級。
一個 30 秒的 Wan 3.0 Preview 影片要多少錢?
以 1080P 計算,每秒 $0.20,30 秒總計 $6.00。720P 是 $3.00,480P 是 $1.50。作為比較,用 Wan 2.7 以 1080P 產生 15 秒連續畫面,以實際計費費率花了我 $3.75。
我現在沒有 Wan 3.0 Preview 的存取權限,能產生 30 秒一鏡到底嗎?
用 Wan 2.7 不行。它的續拍模式上限為 15 秒輸出,只接受 10 秒或更短的來源片段,而且串接時會倒退。Seedance 2.5 可以在單次生成中做到 4 到 30 秒,但解析度上限只有 720p。
Wan 3.0 Preview 與 Wan 2.7 相比,值得等待嗎?
如果你需要超過 15 秒的連續一鏡到底,或者需要文件和網頁參考輸入,答案是肯定的,而且沒有替代方案。對於 15 秒或以下的內容,Wan 2.7 現在更實用,因為 2 個請求的並發上限會讓批次工作在 3.0 上比它要取代的模型更慢。







