
最新更新: Wan 3.0 已於 2026 年 8 月 24 日正式上線。
兩個剪輯監視器並排,左側顯示海怪在暴風雨中躍出,右側顯示同一場暴風雨被截短。
播放阿里巴巴隨 Wan 3.0 測試版提供的 30 秒海怪片段。漁船、暴雨、閃電,然後海面向上炸裂。十個不同鏡頭。毫無剪接。其下的管弦樂配樂由模型生成。
你的第一反應不是「哇」。而是「我的 Wan 2.7 少了什麼?」
於是我去尋找答案,首先發現大部分網路上的回答都是錯的。搜尋 wan 3.0 vs wan 2.7,最熱門的結果自信地告訴你 Wan 3.0 原生支援 4K,而且權重已上傳至 Hugging Face。兩者皆非事實。我把官方示範檔案下載到筆電上,用 ffmpeg 讀取,然後檢查了模型註冊表和公佈的價格層級。真正的升級很大。只是並非人們所描述的那樣。
Wan 3.0 vs Wan 2.7:重點摘要
- 時長是焦點。 Wan 3.0 一次生成 30 秒,並具備自動「智慧時長」建議。Wan 2.7 在文字轉影片和圖片轉影片上限為 15 秒,參考轉影片和影片編輯上限為 10 秒。
- 參考項目從少數變成大量。 Wan 2.7 最多接受 5 個參考項目。Wan 3.0 最多接受 20 個,而且首次支援 doc、xls、ppt、pdf 和 md 檔案,以及網頁作為生成輸入。
- 沒有 4K。 阿里巴巴自己的 API 價格表只有三個層級:480P、720P 和 1080P。在 Atlas Cloud 上,Wan 2.7 實際上透過其 1080P-SR 和 1440P-SR 超解析度選項提供了更高的上限。
- 權重未開源。 Hugging Face 上的 Wan-AI 組織仍停留在 Wan 2.2。沒有 3.0 倉庫、沒有 2.7 倉庫、也沒有 2.5 倉庫。
- Wan 3.0 僅限測試版且僅限第一方。 它在阿里雲百煉、Wanxiang 網站、千問創作桌面應用程式以及少數兄弟產品上運行。如果你本週需要一個可在生產環境中呼叫的 API,Wan 2.7 仍然是可用的版本。
- 想在學習提示詞語法之前先看看格式? Atlas Cloud 提供一個免費的 AI 廣告短劇產生器,可將一個產品描述轉換成 15 秒的雙角色喜劇廣告,附帶對白。一次免費生成,無浮水印。
完整的 30 秒怪獸片段,由阿里巴巴在 Wan 3.0 公開測試期間生成,並發佈在官方 Wan 3.0 創作者手冊中。我們並未生成此片段。請開啟聲音:配樂是輸出的一部分,非後期添加的音樂墊。檔案規格:1920x1072,24fps,30.07s,44.1kHz 立體聲 AAC。
以下是規格表忽略的第一件事。該檔案是 1920x1072,而非 1920x1080。官方手冊中的每個「1080p」示範都落在 1072 像素高度,而其他幾個公開示範則是普通的 1280x720。手冊中 19 個片段中有 12 個長度為 30.05 到 30.07 秒,這告訴你 30 秒上限是真實的硬限制,而非行銷上的整數。
為什麼 Wan 3.0 vs Wan 2.7 的問題比看起來更難
誠實的答案是,幾乎沒有人用同一個提示詞同時跑過這兩個模型,因為幾乎沒有人能做到。Wan 3.0 於 2026 年 8 月 6 日開放公開測試,並僅在阿里巴巴自己的平台上運行(QbitAI,2026 年 8 月)。第三方推理平台尚未支援。因此,現有的比較內容都是規格表對規格表,而規格表已被橫向複製到錯誤固化。
三個關於 Wan 3.0 vs Wan 2.7 的「事實」根本是錯的
「Wan 3.0 原生 4K。」 並非如此。公佈的 API 價格表是 480P、720P 和 1080P,分別為 ¥0.3、¥0.6 和 ¥1.2 每秒。三個層級,沒有第四個。同時,Atlas Cloud 在 Wan 2.7 上提供 1080P-SR 和 1440P-SR,因此在純像素上限上,舊版本目前勝出。
「Wan 3.0 權重已開源。」 並未開源。瀏覽 Hugging Face,Wan-AI 組織最新釋出的系列是 Wan 2.2,包括 Animate 和 S2V 變體。核心影片線自 2.2 以來就沒有釋出過權重。如果你想要在本地 ComfyUI 圖中使用,2.1 和 2.2 是你的選項,這一點沒有改變。
「提示詞語法可以直接沿用。」 這個說法半真半假,而且會害到你。詞彙可以沿用,結構不行。Wan 3.0 的官方提示詞是帶時間戳的多鏡頭腳本:怪獸提示詞是十個編號鏡頭,廣告牌提示詞是四個帶明確秒數範圍的標記節拍。將一個十鏡頭腳本貼到 15 秒模型裡,它不會優雅地選取六個鏡頭,而是會壓縮。
為什麼你不能直接在 Wan 3.0 和 Wan 2.7 之間互換提示詞
這下面還有第二個陷阱,也是為什麼「只要拼接兩個片段」救不了你的原因。
Wan 2.7 有影片續接模式。看起來像是通往 30 秒的路徑。但並非如此。你餵入的來源片段必須是 2 到 10 秒,因此一個 15 秒的生成無法作為種子。輸出會重新編碼來源,吃掉你餵入片段的尾部。而且串聯續接往往會往開場節拍漂移,而非推動故事前進。15 秒是 Wan 2.7 單一連續檔案的硬上限。任何更長的內容都是編輯,而非生成。
這就是這兩個世代之間真正的遷移成本,沒有比較表會告訴你。
Wan 3.0 vs Wan 2.7 規格表,以及實際運行位置
要測試這些,你需要一個能在同一個帳戶上運行文字轉影片、參考轉影片和影片編輯的平台,並採用按秒計費,讓失敗的拍攝只花費秒數而非訂閱費用。本文 Wan 2.7 部分的所有內容都在 Atlas Cloud 上運行,該平台托管四個 Wan 2.7 端點以及用於參考測試的圖片模型。Wan 3.0 尚未在 Atlas Cloud 或任何其他第三方平台上線,這正是本文中 Wan 3.0 材料來自阿里巴巴自家測試版發佈的原因。
表 1:Wan 3.0 vs Wan 2.7,世代對比
| Wan 3.0(公開測試版) | Wan 2.7(生產環境) | |
|---|---|---|
| 單次最大時長 | 30 秒,具備智慧時長 | 15 秒(t2v, i2v),10 秒(r2v, 影片編輯) |
| 參考項目 | 最多 20 個 | 最多 5 個(每個主體 1 張圖片,最多 3 個影片) |
| 輸入模態 | 文字、圖片、影片、音訊、doc/xls/ppt/pdf/md、網頁 | 文字、圖片、影片、音訊 |
| 文件輸入 | 單一檔案或連結,最多 100MB 及 50 頁 | 不支援 |
| 解析度層級 | 480P / 720P / 1080P | 720P / 1080P / 1080P-SR / 1440P-SR |
| 原生音訊 | 有 | 有 |
| 影片編輯 | 指令和參考編輯 | 專用影片編輯端點 |
| 開源權重 | 無 | 無 |
| 運行位置 | 僅限阿里巴巴第一方平台 | 第三方 API,包括 Atlas Cloud |
| 公佈價格 | ¥0.3 / ¥0.6 / ¥1.2 每秒,依層級 | $0.1 每秒,720P 基準 |
表 2:本文使用的 Wan 2.7 端點
| 端點 | 最大時長 | 解析度 | 參考限制 | 公佈價格 |
|---|---|---|---|---|
| 文字轉影片 | 2-15 秒 | 720P, 1080P, 1080P-SR, 1440P-SR | 不適用 | $0.1 / 秒 |
| 參考轉影片 | 2-10 秒 | 720P, 1080P, 1080P-SR, 1440P-SR | 5 個項目 | $0.1 / 秒 |
| 圖片轉影片 | 2-15 秒 | 720P, 1080P, 1080P-SR, 1440P-SR | 來源片段 2-10 秒 | $0.1 / 秒 |
| 影片編輯 | 輸出 2-10 秒,輸入 2-10 秒 | 720P (1.0x), 1080P (1.5x) | 3 張圖片 | $0.1 / 秒 |
在開始任何操作前,有一個定價細節值得內化:「$0.1 每秒」的標題是 720P 基準。影片編輯頁面明確說明 1080P 有 1.5 倍乘數,而「執行」按鈕會顯示你選擇層級的實際價格。請閱讀按鈕,而非標題。
若要進行當前托管運行,請開啟 Atlas Cloud 上的 Wan 3.0,並在發佈工作流程前測試類似以下的提示詞。

Wan 3.0 提示詞到結果的截圖:匹配模型比較。
自行測試 Wan 3.0 vs Wan 2.7
四個步驟。其中兩個使用阿里巴巴已發佈的素材作為固定參考點,另外兩個是你自行進行的運行。這裡不需要存取 Wan 3.0 測試版。
步驟 1:取得 Wan 3.0 片段及其原始提示詞
此測試的 Wan 3.0 部分不是你要生成的,而是你要閱讀的。完整的怪獸提示詞已發佈在官方 Wan 3.0 創作者手冊中,連同完成的片段,位於「災難電影」範例下。這是一個中文腳本,包含十個編號鏡頭和一個獨立段落描述配樂。
在進行任何其他操作前先閱讀一次。結構是關鍵:十個鏡頭,每個都有自己的鏡頭、主體和燈光說明,最後以配樂簡報結尾。這就是一個 30 秒單次生成提示詞的樣子。
步驟 2:透過 Wan 2.7 文字轉影片執行相同的提示詞
開啟 Wan 2.7 文字轉影片遊樂場,並貼上同一個腳本的英文翻譯。暫時不要縮短。你想看看當意圖超出上限時模型會怎麼做。
Plain1A 30-second, photoreal cinematic sequence: a deep-sea kaiju emerges at night in a raging storm. Open on a small, battered fishing trawler with the white letters "WAN" on its hull, fighting through enormous waves under torrential rain; lightning briefly lights the whole ocean. Push to a mid-close shot on the deck: waves smash over the bow, ropes, nets and metal railings whip in the wind, rain streaks the lens. Then the sea ahead swells unnaturally, an enormous vortex forms, and a vast dark shape passes beneath the boat, lifting it. A crewman in a soaked rain jacket grips the rail, terrified, and turns toward the water. Finally the surface explodes upward and a colossal Pacific-Rim-style sea monster breaches: wet, scarred, ridged skin, huge jaws, tens of meters of spray. Close on its head roaring in the lightning. The trawler is nearly swallowed. End on a wide shot: the kaiju towering over the churning sea, the boat tiny in the foreground, one final lightning strike. Hollywood disaster-movie scoring: low sub-bass rumble and sparse strings building to brass and heavy percussion at the breach, ending on an oppressive sustained low chord. Photoreal scale, volumetric water, high-contrast storm lighting. 2
設定:解析度 1080P,時長 15 秒(最大值),畫面比例 16:9,音訊保持開啟讓模型自行配樂。參考音訊欄位留空。

Wan 2.7 文字轉影片遊樂場(Atlas Cloud),已載入怪獸提示詞,完成的 15 秒片段顯示在 OUTPUT 面板中
Wan 2.7 文字轉影片(Atlas Cloud),提示詞已貼上,選擇 1080P 和 16:9。執行按鈕顯示此簡短測試拍攝費用為 $0.75,相當於每秒 $0.15:這是顯而易見的 1.5 倍 1080P 乘數,而模型頁面的標題數字是 $0.1。
然後再執行一次,並在提示詞末尾附加一行:
Plain1Single continuous take, no cuts. Prioritize the breach moment; compress the setup. 2
這一行就是遷移工作的縮影。一個 30 秒的腳本必須重新撰寫成 15 秒的意圖,而由你決定哪七個鏡頭被刪除。
左:官方 Wan 3.0 輸出,30 秒。右:Atlas Cloud 上的 Wan 2.7 執行相同提示詞,在 15 秒上限處停止。
步驟 3:為 Wan 3.0 vs Wan 2.7 身份一致性測試建立參考圖片
時長是顯著的升級。像素級一致性才是真正改變製作工作的部分,而你可以用兩隻貓來測試。
阿里巴巴的手冊包含一個 Wes Anderson 風格的仿作,其中同一隻布偶貓和同一隻黑貓必須存活在五個截然不同的環境中:對稱的飯店走廊、剖面側視圖、洗衣機滾筒、機場行李輸送帶和一個紅色電話亭。兩隻貓都使用 @Image1 和 @Image2 參考標籤固定。
首先自己生成兩個參考圖片。使用 GPT Image 2,品質設為高,畫面比例 16:9,執行兩次。
Plain1A studio portrait of a fluffy ragdoll cat with blue eyes and a dark mask, sitting upright facing the camera, evenly lit against a plain pale pink background, sharp fur detail, full body visible, clean reference-sheet framing. 2
Plain1A studio portrait of a small sleek black cat with bright amber eyes, standing in profile facing right, evenly lit against a plain pale pink background, sharp fur detail, full body visible, clean reference-sheet framing. 2

Atlas Cloud 上的 GPT Image 2 遊樂場,品質設為高,布偶貓參考圖顯示在 OUTPUT 面板中
GPT Image 2,品質高,16:9。以相同方式執行第二個提示詞以獲得黑貓。
步驟 4:在 Wan 2.7 參考轉影片上執行身份測試
將兩隻貓上傳到 Wan 2.7 參考轉影片端點。解析度 1080P,畫面比例 16:9,時長 10 秒(此端點的最大值)。以下提示詞是手冊中鏡頭列表從五個節拍壓縮成三個,因為十秒無法容納五個。
Plain1Wes Anderson style, perfectly symmetrical, flat frontal compositions, pastel palette. Reference image 1 is the ragdoll cat, reference image 2 is the black cat; keep both cats identical in every shot. Shot 1: an endless symmetrical hotel corridor, the ragdoll cat running straight toward the camera with a solemn expression, the black cat sprinting away in the background with its head twisted back 180 degrees. Shot 2: a cutaway side view of the corridor, pink patterned wallpaper and gold picture frames, the ragdoll walking left to right and the black cat crossing right to left. Shot 3: frontal macro on a mint-green vintage washing machine door, both cats floating stiffly inside the drum among suds, eyes blank, rainbow-ordered detergent bottles lined up behind. Rigid horizontals and verticals, no camera tilt, deadpan absurd humor. 2

Atlas Cloud 上的 Wan 2.7 參考轉影片遊樂場,已載入兩隻貓的參考圖片,完成的片段顯示在 OUTPUT 面板中
Wan 2.7 參考轉影片:兩隻貓已載入圖片參考欄位,解析度設為 1080P,執行按鈕在開始前顯示拍攝費用。兩個參考已經佔用了此端點可接受數量中相當大的一部分。Wan 3.0 可接受 20 個參考項目。
現在將兩者並排比較。

官方 Wan 3.0 身份鎖定片段:同一隻布偶貓和黑貓在飯店走廊、剖面牆、洗衣機滾筒、行李輸送帶和紅色電話亭中保持一致
由阿里巴巴在 Wan 3.0 公開測試期間生成,並發佈在官方創作者手冊中。五個環境,19.9 秒,兩隻貓透過參考標籤固定。此處顯示為無聲 GIF;交付檔案包含 44.1kHz 立體聲音訊。

Wan 2.7 參考轉影片在相同簡報下的結果,三個鏡頭在 10 秒上限內
Atlas Cloud 上的 Wan 2.7 參考轉影片,相同的兩個參考圖片,此處顯示為無聲 GIF。這是端點預設的 5 秒拍攝,而非完整的 10 秒:值得知道的是,時長控制並非總是確實執行你所設定的值,因此請在按下執行按鈕前閱讀執行按鈕報價。觀察貓的斑紋和布偶貓的面具;這就是「像素級一致性」主張所涉及的維度。
另外四個值得重跑的 Wan 3.0 vs Wan 2.7 提示詞
怪獸片段強調時長和物理。這三個強調不同的東西,每個都與 Wan 2.7 的不同限制衝突。這三個都是阿里巴巴官方手冊中的測試版輸出。
Wan 3.0,官方測試版輸出:一個 30 秒的連續推後鏡頭,沿著日光燈照明的醫院走廊,淡綠色單色調,女演員大聲呼救。開啟聲音。表演、腳步聲和設備嗡嗡聲皆由模型生成。
表 3:每個提示詞的要求,以及 Wan 2.7 的限制
| 提示詞 | 腳本要求 | Wan 2.7 已發佈的限制 | 被測試的維度 |
|---|---|---|---|
| 怪獸躍出 | 30 秒內 10 個編號鏡頭,加上配樂簡報 | 15 秒文字轉影片上限 | 時長和多鏡頭敘事 |
| 醫院走廊 | 一個 30 秒連續拍攝,附帶對白 | 15 秒上限,原生音訊可用 | 長時間拍攝中的表演和對白 |
| 加油站女牛仔 | 四個定時幕的 30 秒喜劇弧 | 15 秒上限,因此兩個幕必須刪除 | 需要運行時間的喜劇節奏 |
| 廣告牌一鏡到底 | 四個節拍,附帶明確秒數範圍,無剪接 | 15 秒上限,因此範圍需要重寫 | 長鏡頭移動中的鏡頭物理 |
| 兩隻貓,五個房間 | 2 個標記主體在 5 個環境中保持一致 | 10 秒上限,5 個參考欄位 | 身份一致性 |
相同概念的免費 15 秒版本
再看一下加油站片段。這個格式——一個短喜劇小品,有兩個角色、一個反轉和一個笑點——正是 Wan 3.0 額外運行時間發揮最大效益的地方。也是最能賣東西的格式。
問題在於提示詞。手冊中的喜劇範例有 800 字,附帶明確時間戳和走位。這是一項真正的技能,需要一個週末來學習。
如果你只是想看看這個格式是否適合你的產品,然後再投入那個週末,Atlas Cloud 提供一個免費工具,完全跳過提示詞工程。你描述產品,選擇性上傳最多四張產品照片(每張 8MB),從六種語氣(搞笑迷因、劇情反轉、情境喜劇、暖心、奢華或強力推銷)中選擇一種,它會撰寫雙角色腳本、選角聲音、生成對白和音效,並以一個連續場景回傳完成的 15 秒廣告。下載檔案乾淨無浮水印。你需要登入,並在加值前獲得一次免費生成。

一行產品文案輸入,一個完成的 15 秒喜劇廣告輸出:Atlas Cloud 的免費 AI 廣告短劇產生器
免費 AI 廣告短劇產生器:一個產品描述輸入,一個 15 秒雙角色廣告輸出。

來自免費產生器的真實輸出。開啟聲音:腳本、兩個聲音和音效都來自一次運行。
進行 Wan 3.0 vs Wan 2.7 比較需要多少成本
按秒計,在 720P 層級上,這兩個世代價格相近。成本差異在於結構:一個過去是 15 秒的片段現在變成 30 秒,因此完成的成品大約加倍。
表 4:相同的怪獸序列,四種方式
| 運行 | 費率 | 總計 |
|---|---|---|
| Wan 3.0, 30 秒, 720P | ¥0.6 / 秒 | ¥18,約 $2.50 |
| Wan 3.0, 30 秒, 1080P | ¥1.2 / 秒 | ¥36,約 $5.00 |
| Wan 2.7, 15 秒, 720P | $0.10 / 秒 | $1.50 |
| Wan 2.7, 15 秒, 1080P | $0.10 / 秒,加上 1.5 倍層級乘數 | $2.25 |
| Wan 2.7, 15 秒, 1440P-SR | 執行按鈕上即時報價 | 即時報價 |
| 免費 AI 廣告短劇, 15 秒 | 免費,每個帳戶一次生成 | $0.00 |
兩個注意事項。測試版定價並非正式發行定價,阿里巴巴已表示 API 很快就會更廣泛開放,因此請將 ¥ 數字視為公開測試版的快照,而非最終費率。在 Atlas Cloud 方面,請務必在提交前閱讀執行按鈕上的即時報價,因為解析度乘數是在那裡套用,而非在標題價格中。
阿里巴巴也異常直接地指出 Wan 3.0 仍然薄弱的地方,表示該模型「在音質和文字準確性方面仍有改進空間。」這與檔案顯示的內容相符:官方示範的音訊是 44.1kHz 立體聲,但編碼率僅為 32 kb/s,這對預覽而言足夠,但對交付母帶來說則略顯不足。
Wan 3.0 vs Wan 2.7 授權:你實際上可以發佈什麼
簡短版本,請在將任何內容展示給客戶前自行核對當前條款。
Wan 3.0 處於公開測試階段,其商業條款尚未確定。由於權重尚未釋出,完全沒有自托管路徑;你製作的任何內容都通過阿里巴巴的 API 或其消費級平台,並且你受制於生成當天這些條款所規定的內容。Wan 2.7 在權重方面情況相同,但它已在生產環境中運行足夠長的時間,平台 API 條款已經穩定。如果你透過第三方平台運行,你的商業權利來自該平台的使用條款,因此請閱讀實際適用於你帳戶的條款。以上兩段均非法律建議。
Wan 3.0 vs Wan 2.7 FAQ
Wan 3.0 是開源的嗎?我可以在 ComfyUI 中運行嗎?
不是。截至 2026 年 8 月,Hugging Face 上的 Wan-AI 組織下沒有 Wan 3.0 倉庫,Wan-Video GitHub 上也沒有。最新釋出的 Wan 系列權重是 Wan 2.2,包括 Animate 和 S2V 變體。對於本地 ComfyUI 圖,你仍然只能使用 2.1 或 2.2。Wan 3.0 僅限 API 和網頁。
Wan 3.0 vs Wan 2.7 解析度:Wan 3.0 真的能生成 4K 嗎?
不能。已發佈的 API 價格表有三個解析度層級:480P、720P 和 1080P。幾個廣泛分享的比較文章聲稱原生 4K,這是錯誤的。在原始輸出上限上,Atlas Cloud 上的 Wan 2.7 實際上透過其 1080P-SR 和 1440P-SR 超解析度選項達到更高。
我可以透過延長片段從 Wan 2.7 獲得 30 秒嗎?
不能作為一個連續檔案。續接模式需要 2 到 10 秒的來源片段,因此完整的 15 秒生成無法作為種子。輸出會重新編碼並修剪你餵入的任何內容的尾部,而串聯續接往往會循環回開場節拍。超過 15 秒,你是在編輯,而非生成。
Wan 3.0 vs Wan 2.7:我現在可以在哪裡實際運行兩者?
Wan 3.0 處於公開測試階段,僅在阿里巴巴自己的平台上:阿里雲百煉、萬景一客、Wanxiang 網站、千問創作桌面客戶端、IF STUDIO 和堆友,以及在千問應用程式中以灰度存取。尚無第三方推理平台托管。Wan 2.7 是你可以直接呼叫的版本,涵蓋文字轉影片、圖片轉影片、參考轉影片和影片編輯端點。
Wan 3.0 vs Wan 2.7 定價:哪個每個完成片段成本更高?
在 720P 層級上按秒計算,它們接近。按每個完成片段計算,預計大約加倍,因為自然輸出長度從 15 秒變為 30 秒。預算要考慮運行時間的變化,而非費率的變化,並記住測試版定價可能不會在正式發行後維持。
我需要為 Wan 3.0 重寫我的 Wan 2.7 提示詞嗎?
是的,而且重寫是結構性的,而非詞彙性的。Wan 2.7 提示詞以豐富細節描述一個連續鏡頭。Wan 3.0 提示詞是帶時間戳的鏡頭列表,有時還有獨立的配樂段落,模型也能讀取 pdf 或簡報作為輸入。經驗法則:對於 Wan 2.7,寫一個段落描述一個鏡頭;對於 Wan 3.0,寫一個帶秒數範圍的編號場景分解。






