最新更新: Wan 3.0 已於 2026 年 8 月 24 日正式上線。
你開了六個分頁,每個都呈現清晰的表格:1.3B 在 8GB、14B 在 24GB、Apache-2.0、2026 年 4 月釋出。於是你打開 Hugging Face 上的 Wan-AI 頁面準備下載權重。
27 個儲存庫,最新的是 Wan2.2。
那些表格並沒有過時——它們是憑空捏造的。Wan 3.0 VRAM 需求 不可能被阿里巴巴以外的人實際測量過,因為 Wan 3.0 在 2026 年 8 月 6 日才進入公開測試,而且從未釋出任何權重檔案。四月份根本沒有東西可釋出。
那麼真正的答案是什麼?沒有人實際跑過基準測試。但 Wan 3.0 自己的規格表已經框出了答案,我們在下方做了計算。
重點摘要
- 沒有任何地方存在 Wan 3.0 權重。網路上所有關於它的 VRAM 表格都是偽造的。
- Wan 3.0 是第一方 API 測試版:最長 30 秒、最高 1080P、沒有 4K 層級。
- 其規格暗示潛在序列長度為 5 秒 720P 片段的 13.5 倍,這意味著約 180 倍的注意力計算量。
- 目前真正的本地上限是 Wan2.2 TI2V-5B 在 24GB 上運行,或透過社群量化降至 6GB。
- 本週若想輸出 1080P,請租用秒數而非購買 VRAM。

Wan VRAM 需求視覺化:左側為 720P 層級、右側為 1080P 層級,同一首幀動畫,均無本地 GPU 渲染。
相同首幀、相同動態提示、相同模型。僅解析度層級不同:左側 720P 5 秒 $0.50,右側 1080P 5 秒 $0.75。兩者皆在 Wan 2.7 上以零本地 VRAM 渲染,標籤上的價格是「執行」按鈕實際給出的報價。以無聲 GIF 顯示。
這正是整場爭論的核心:不是 GB,而是像素。
為什麼你找到的每個 Wan 3.0 VRAM 需求表都是虛構的
先說結論:這個關鍵字排名最前面的頁面,只是把 Wan 2.1 和 Wan 2.2 的數字拿來,貼上「3.0」標籤,並捏造了一個發佈日期。你大概花 60 秒就能拆穿這一切。
看這裡。

Hugging Face 上 Wan-AI 組織頁面,顯示 27 個儲存庫,最新版本為 Wan2.2,證明沒有 Wan 3.0 權重可供本地 VRAM 測試。
官方 Wan-AI 組織在 Hugging Face 上的模型分頁,依最新排序。27 個儲存庫,列表中最高版本號為 2.2(Hugging Face,2026 年 8 月)。
沒有 Wan3.0 儲存庫,也沒有 Wan2.7、Wan2.6 或 Wan2.5 儲存庫。該組織最新的是 Wan2.2-Animate-2-14B-Diffusers,更新於七天前(Hugging Face,2026 年 8 月)。
以下是逐項聲明拆解。
表 1:指南聲稱 vs 可驗證的事實
| 你在第一頁看到的聲明 | 截至 2026 年 8 月可驗證的內容 | 自己如何查證 |
|---|---|---|
| "Wan 3.0 於 2026 年 4 月釋出 1.3B + 14B 權重" | Wan 3.0 於 2026 年 8 月 6 日開放公開測試。無任何日期釋出權重。 | 載入 Wan-AI 組織頁面 |
| "Wan 3.0 採用 Apache-2.0" | 從未發佈過 3.0 的授權檔案 | 搜尋該組織是否有 3.0 儲存庫,根本沒有。 |
| "1.3B 可在 8GB 上運行,14B 可在 24GB 上運行" | 那些是 Wan 2.1/2.2 的數據。Wan 2.2 的 A14B 官方要求 80GB。 | Wan2.2 README 的硬體章節 |
| "完整的 4K / 30 秒工作流程層級" | 測試版最高僅 1080P。層級為 480P、720P、1080P。 | 阿里巴巴自己的每秒價格表 |
| "目前可在 ComfyUI / WanGP 中運行" | WanGP 支援的列表僅涵蓋 Wan 2.1/2.2 | Wan2GP README |
阿里巴巴在 2026 年 8 月實際推出的是一個 API 和網頁產品,而非權重檔案。一次生成最長 30 秒,解析度上限為 1080P,並接受文字、圖片、音訊、影片甚至文件(doc、xls、ppt、pdf、md)作為參考輸入。API 定價為 ¥0.3 / ¥0.6 / ¥1.2 每秒,分別對應 480P / 720P / 1080P(QbitAI,2026 年 8 月)。
注意這個列表中缺少了什麼:下載連結。
從 Wan 3.0 自身規格計算出的 VRAM 需求
保證:在本節結束前,你會知道為什麼「買一張 32GB 顯示卡」行不通,而且你可以自己重新推導出這些數字。證明:計算只需要兩個已公開的事實——Wan 的 VAE 壓縮比和 Wan 3.0 的 1080P/30s 上限。
我們開始吧。
關鍵在於序列長度,而非參數數量。 每個人都盯著那個 B 數字,但那是不對的變數。
影片擴散 Transformer 的記憶體和計算量取決於它需要處理的潛在 token 數量,而這個數量來自解析度乘以時間,而非參數。Wan2.2 的 VAE 在時間、高度和寬度上以 4x16x16 壓縮,再加上 DiT 的 patchify,因此每個潛在 token 大約覆蓋 4x32x32 像素區塊(Wan2.2 README,2026 年 8 月)。較舊的 Wan2.1 世代 VAE 壓縮率為 4x8x8,加上 patchify 後為 4x16x16 每個 token,對於相同片段,token 數量是前者的四倍。
將 Wan 3.0 自身上限代入計算,結果如下。
表 2:各目標片段的潛在 token 數(我們的計算,24fps)
| 目標片段 | 幀數 | 潛在幀數 | Token 數(2.2 代 VAE) | Token 數(2.1 代 VAE) | 相較於 5s 720P |
|---|---|---|---|---|---|
| 5s 480P (832x480) | 121 | 31 | 12,090 | 48,360 | 0.44x |
| 5s 720P (1280x704) | 121 | 31 | 27,280 | 109,120 | 1.0x(基準) |
| 10s 1080P (1920x1088) | 241 | 61 | 124,440 | 497,760 | 4.6x |
| 30s 1080P (1920x1088) | 721 | 181 | 369,240 | 1,476,960 | 13.5x |
再次閱讀最後一行。Wan 3.0 的旗艦能力是 5 秒 720P 片段序列長度的 13.5 倍——而你的 4090 在 5 秒 720P 片段上已經快撐不住了。
而且自注意力在序列長度上是二次方的。13.5 的平方大約是 180。因此,一個 30 秒 1080P 片段的注意力工作量,大約是 5 秒 720P 片段的 180 倍,還不計其他部分。
這就是 SERP 上沒有人計算出的數字,也是為什麼「多買 8GB」根本不是一個解決方案。
那麼這在 GB 中意味著什麼? 權重是最無聊的部分。一個 27B 總參數的 MoE 在 fp8 下約為 27GB 常駐,bf16 約為 54GB。MoE 只幫助每步的計算量(Wan2.2 的 A14B 每步僅啟動 27B 參數中的 14B),而不是記憶體中必須保留的內容。
有趣的部分是激活值。在 bf16 下,模型維度 5120 的一個 Transformer 層的隱藏狀態成本為 tokens x 5120 x 2 字節:
- 5s 720P (27,280 tokens):每層 0.28 GB
- 30s 1080P (369,240 tokens):每層 3.8 GB
- 30s 1080P 搭配 2.1 代 VAE (1,476,960 tokens):每層 15.1 GB
每層。乘以你注意力實作必須保持活躍的層數,再加上文字編碼器、VAE 解碼階段,那麼 80GB 的數字看起來就不再保守了。
表 3:若權重釋出時的估計 VRAM(估計值,非實際測量)
| 目標片段 | 若釋出 5B 級高壓縮模型(fp8) | 若為 A14B 級 MoE(fp8) | 實際結論 |
|---|---|---|---|
| 5s 480P | ~8-10 GB | ~30-34 GB | 12GB 顯示卡對於小型模型來說是可行的 |
| 5s 720P | ~10-14 GB | ~34-40 GB | 16GB 為下限,24GB 較舒適 |
| 10s 1080P | ~20-28 GB | ~45-60 GB | 32GB 顯示卡已經很勉強 |
| 30s 1080P | ~45-70 GB | ~90-140 GB | 沒有任何消費級顯示卡,無論何種量化方式 |
該表格中的每個欄位都是基於表 2 加上已發布的權重大小得出的估計值。實際數字取決於注意力核心、卸載策略,以及阿里巴巴是否會釋出權重。將其視為問題的輪廓,而非規格表。
這個輪廓很明確:旗艦設定從來就不是消費級 GPU 的工作負載。
你今天實際可達成的 Wan VRAM 需求
以下是那些偽造表格假裝要提供的部分。這些數字由 Wan 團隊發布,是真實的。
表 4:真實的 Wan VRAM 層級,2026 年 8 月
| 變體 | 最低 VRAM | 解析度 | 測量速度 | 你需要開啟的標誌 | 權重 |
|---|---|---|---|---|---|
| Wan2.2 T2V-A14B / I2V-A14B | 80GB 單 GPU | 480P / 720P | 未公布 | --offload_model True --convert_model_dtype | Apache-2.0 |
| Wan2.2 TI2V-5B | 24GB (RTX 4090) | 720P @ 24fps | 5 秒 720P 在 9 分鐘內 | --offload_model True --convert_model_dtype --t5_cpu | Apache-2.0 |
| Wan 2.1 / 2.2 透過 WanGP | 6GB 起 | 主要 480P | 較慢,品質有取捨 | int8 / fp8 / gguf / NVFP4 / Nunchaku | Apache-2.0 基礎 |
| Wan 2.5 / 2.6 / 2.7 | 無 | 僅 API | 無 | 無 | 無發布 |
| Wan 3.0 | 無 | 僅 API,第一方測試版 | 無 | 無 | 無發布 |
該表格中有兩點值得再看一眼。
首先:A14B 那一行已經開啟了兩個記憶體節省標誌,但仍然需要 80GB。這是官方單 GPU 數字,並非未經最佳化的數值。其次:5B 一行是誠實的消費者答案,其 README 提到在 4090 上 5 秒 720P 在 9 分鐘內完成。
低於 24GB 則屬於社群領域。WanGP(deepbeepmeep/Wan2GP 專案,自稱讓「GPU 貧困者」也能使用生成模型)透過 int8、fp8、gguf、NVFP4 和 Nunchaku 量化,將特定模型降至 6GB。它支援 Wan 2.1 和 2.2,但不支援 3.0,因為沒有東西可支援。
現在,這個部分應該改變你的購買決策:「下一個版本會是開源」的假設已經連續失敗三次了。 Wan 2.2 是 Apache-2.0,Wan 2.5 轉為 API-only,Wan 2.6 和 2.7 從未釋出權重,Wan 3.0 根本沒有授權檔案。
今天為了賭 3.0 權重會落地而買顯示卡,等於是在賭一個已經連續三代趨勢相反的賭注。
若要進行當前託管運行,請開啟 Atlas Cloud 上的 Wan 3.0,在發佈工作流程之前測試類似下方的提示詞。

Wan 3.0 提示詞到結果的螢幕截圖:無 GPU 渲染路徑。
跳過 VRAM 需求:無 GPU 的 Wan 工作流程
首先我要直接說清楚界線,因為這個領域的大多數頁面都不會這麼做。
沒有人託管 Wan 3.0。 沒有 Atlas Cloud,沒有其他人。因為沒有權重,所以沒有第三方推論。如果某個頁面提供你「Wan 3.0 API 存取」,那它賣的是別的東西。
你現在可以獲得的是家族中的其他成員,託管、按秒計費、無需考慮 VRAM。Atlas Cloud 在一個 API 和一個瀏覽器分頁背後運行 Wan 2.2 到 2.7,而 1080P 的 Wan 2.7 是阿里巴巴自家測試管道之外最接近 3.0 等級的輸出。
對於本文所針對的讀者來說,這解決了一個特定問題。你原本打算花四位數買一張顯示卡來追逐一個不存在的權重。租用秒數意味著你可以在購買任何東西之前先了解實際輸出長什麼樣;如果 3.0 權重永遠不釋出,你損失的也不過是幾塊錢。
表 5:託管 Wan 家族(2026 年 8 月牌價)
| 模型 ID | 解析度 | 最大時長 | 價格 | 最佳用途 |
|---|---|---|---|---|
| atlascloud/wan-2.2-turbo/image-to-video | 480p / 720p / 1080p, 30fps | 僅 5 秒 | $0.02 / s | 家族中最便宜的快速檢視 |
| atlascloud/wan-2.2/image-to-video | 480P 原生 + 720P VSR | 3-10 秒 | $0.03 / s | 預算批次 |
| alibaba/wan-2.5/text-to-video | 最高 1920x1080 | 10 秒 | $0.035 / s | 便宜的 1080P 文字轉影片 |
| alibaba/wan-2.6/text-to-video | 最高 1920x1080 | 5 / 10 / 15 秒 | $0.07 / s | 較長片段,無需首幀 |
| alibaba/wan-2.7/image-to-video | 720P / 1080P,加上 1080P-SR 和 1440P-SR | 15 秒 | $0.10 / s 牌價 | 最接近 3.0 等級輸出的層級 |
| alibaba/wan-2.2/animate-mix | 在現有素材中角色替換 | 匹配你的來源片段 | $0.126 / s | 將角色替換進現有鏡頭 |
在教學之前有一個警告,因為它會出現在你的帳單上:牌價只是最低價。 Wan 2.7 的頁面報價 $0.10 每秒。在我們 2026 年 8 月的運行中,同一個 5 秒工作在 720P 層級報價 $0.50,在 1080P 層級報價 $0.75,因此旗艦層級計費為 $0.15 每秒,是牌價的 1.5 倍。在點擊按鈕之前,一定要閱讀按鈕給你的報價。
表 6:四條通往 30 秒 1080P 的路徑
| 路徑 | 前期成本 | 每 30 秒 1080P 成本 | 你真的能獲得嗎? |
|---|---|---|---|
| 買一張 24GB 顯示卡(4090 級) | ~$1,600-2,000 | 電費 | 不行。 24GB 只能跑 Wan2.2 TI2V-5B 在 720P。沒有 3.0 權重存在。 |
| 租用 80GB 顯示卡 | 每小時 | 數小時的計算 + 設定 | 只有 Wan 2.2 A14B,而且仍然不是 1080P/30s |
| 阿里巴巴第一方測試版 | 無 | ¥1.2/s x 30 = ¥36 (~$5) | 可以,一個連續片段,僅限第一方管道 |
| 託管 Wan 2.7 在 1080P | 無 | 2 x 15s 約 $0.15/s = ~$4.50 | 30 秒的素材,但分為兩個片段(15 秒上限) |
做個除法。以每 30 秒 1080P 約 $4.50 計算,一張 $2,000 的顯示卡需要大約 440 次 30 秒渲染才能打平成本——而且它仍然連一個這樣的片段都無法產生。
這就是論點。現在是三步驟運行,讓你自己判斷輸出。
步驟 1:鎖定 16:9 的首幀
每個誠實的 VRAM 比較都需要一個固定變數。所以我們固定首幀,然後將相同的首幀和相同的動態提示輸入兩個層級。之後你看到的任何差異都是層級造成的,而非隨機因素。
開啟 Qwen Image 2.0 Pro 文字轉圖片 遊樂場,貼上以下內容:
text1Cinematic wide shot inside a dim home office at 2am: a young engineer in a grey hoodie leans back in a desk chair, face lit only by a triple-monitor rig showing a paused video timeline. Beside the desk an open PC case glows, a single oversized graphics card visible inside, fans spinning. Dust motes in the air, teal-and-amber color grading, shallow depth of field, 35mm anamorphic lens, photorealistic, highly detailed, 16:9 2
設定:點擊 16:9 尺寸晶片,它會將畫面設為 1280 x 720,其他保持預設。成本為每張圖片 $0.06(目前為 $0.075 的 8 折)。寬度和高度框最大可達 2048,如果你想要更大的畫面,但晶片的預設值已經適合兩個影片層級。
為什麼選這個場景?因為它正是讀者你自己。保留輸出檔案,你後面會用到兩次。

Atlas Cloud 上的 Qwen Image 2.0 Pro 遊樂場,已選取 16:9 尺寸晶片,輸出面板中顯示完成的 1280x720 首幀。
步驟 1 完成:選取 16:9 晶片(1280 x 720),以及兩個影片層級將從此開始的首幀。執行按鈕顯示 $0.06。
步驟 2:在 720P VRAM 層級製作動畫
這代表真正的 24GB 本地設置能達到的水準:720P、五秒,這就是上限。
這裡有一個刻意的選擇。我們不在此兩個層級之間切換模型,而是使用同一個模型在兩個層級上運行,這樣比較中的唯一變數就是解析度層級。將步驟 1 的圖片載入 Wan 2.7 圖片轉影片 遊樂場作為首幀,然後貼上以下動態提示:
text1The engineer slowly leans forward and rubs his eyes; the monitor glow flickers as the timeline scrubs; the camera pushes in slightly; dust motes drift through the beam of light; subtle handheld micro-shake; single continuous shot, no cuts. 2
設定:解析度 720P,時長 5s,其他保持預設。執行按鈕報價 $0.50,這是牌價 $0.10 每秒乘以五秒。記下這個數字,因為步驟 3 會改變它。

Wan 2.7 圖片轉影片遊樂場,720P 層級,已載入首幀,時長 5 秒,輸出面板中顯示完成的片段。
步驟 2 完成:720P 層級,5 秒,報價 $0.50,輸出面板中有真實片段。
步驟 3:使用相同首幀在 1080P 下製作動畫,無本地 GPU
同一頁面、相同首幀、相同動態提示(逐字相同)、相同 5 秒時長。只改變一個控制項:將解析度設為 1080P。
執行報價從 $0.50 變成 $0.75。這就是你實際測量到的 $0.15 每秒,而該頁面的牌價標示為 $0.10。
兩個設定陷阱需要注意,我們都花過實際運行才學到:
- 時長控制並不一定會生效。 我們將時長設為 10 秒,欄位顯示 10,但工作仍然渲染了 5 秒。執行按鈕的報價是唯一的事實來源:以 $0.15 每秒計算,一個真正的 10 秒 1080P 工作必須顯示約 $1.50,所以 $0.75 的報價意味著你仍然只買了 5 秒,無論滑桿顯示什麼。請閱讀報價,而非欄位。
- 確認你自己的圖片已載入。 如果參考欄位仍然保留頁面的預設示範圖片,運行會愉快地產生無關的內容。點擊前請先查看縮圖。

Wan 2.7 圖片轉影片遊樂場,1080P 層級,執行按鈕報價 $0.75,輸出面板中顯示完成的 1080P 片段。
步驟 3 完成,1080P 層級。執行報價是重點:同一 5 秒,在低一層級花費 $0.50,這裡花費 $0.75,而該頁面牌價標示 $0.10 每秒。
兩個渲染結果都在本文頂部的剪輯中左右並排顯示。這就是整個 VRAM 論點在五秒內的濃縮:兩個層級的輸出、相同的提示詞、沒有任何本地顯卡記憶體參與。
值得嘗試的變化。 在投入 1080P 渲染之前,先降到 480P 進行便宜的預覽。當你沒有首幀且想要一次 15 秒時,切換到 alibaba/wan-2.6/text-to-video($0.07/s)。使用 alibaba/wan-2.2/animate-mix($0.126/s)將不同角色放入你已有的素材中。如果你想要更接近 30 秒,請預算兩個片段,因為幾乎沒有教學提到每個片段有 15 秒的上限。
常見問題
24GB GPU 可以跑 Wan 3.0 嗎?
不行,因為目前沒有可載入的權重。就算未來釋出,表 2 的計算顯示 24GB 只能跑 480P 和短片段,且需搭配積極量化。旗艦的 1080P/30s 設定是不同數量級,無法在單一消費級顯示卡上達成。
哪裡可以下載 Wan 3.0 權重?
沒有地方。Hugging Face 上的 Wan-AI 組織最高只到 Wan2.2,而 Wan-Video GitHub 組織沒有 3.0 的推論儲存庫,也沒有 3.0 的授權檔案。任何提供「Wan 3.0 權重下載」的網站發送的都不是它聲稱的內容。
Wan 3.0 是開源或 Apache 2.0 嗎?
沒有發布任何授權檔案。趨勢正在朝反方向發展:Wan 2.2 是 Apache-2.0,Wan 2.5 轉為 API-only,2.6 和 2.7 根本沒有釋出權重。連續三代趨向封閉。請據此規劃。
我今天實際可以跑的最低 VRAM Wan 模型是什麼?
Wan2.2 TI2V-5B,官方要求 24GB(4090),可在 9 分鐘內完成 5 秒 720P。更低的話,WanGP 的量化路徑可將特定模型降至 6GB,但代價是速度和細節。
Wan 3.0 對比 Wan 2.7:哪個可以本地跑?
兩者都不行。兩者都是 API-only。如果需求是「在我的機器上跑」,你的選項是 Wan 2.1 和 2.2 家族。如果需求是 2.7 等級的輸出,那是託管呼叫,而非本地安裝。
如果我不能本地跑,如何現在獲得 30 秒 1080P?
阿里巴巴的第一方測試版按秒計費,一個片段可達 30 秒。在這些管道之外,每個片段有嚴格的 15 秒上限,因此 30 秒需要拼接兩個片段。在我們自己的 Wan 2.7 延續測試中,限制很嚴格:來源片段必須在 2 到 10 秒之間,輸出必須嚴格長於來源,來源幀數不會保留,而且串聯延續不會累積長度。大多數教學從未提及這些。
所以整個 Wan 3.0 VRAM 需求 問題的簡短答案:停止為顯示卡比價,因為你想買的那個權重根本不存在。如果你想在硬碟上擁有權重,請本地跑 Wan 2.2;當你想要那些偽造表格所販售的輸出時,請租用 1080P 秒數。






