最新更新: Wan 3.0 已于 2026 年 8 月 24 日正式上线。
你打开了六个标签页。每个页面都给你展示了一张清晰的图表:1.3B 在 8GB 上,14B 在 24GB 上,Apache-2.0 许可,2026 年 4 月发布。于是你打开了 Hugging Face 上的 Wan-AI 页面,准备下载检查点。
27 个仓库。最新的是 Wan2.2。
那些图表并未过时——它们根本就是编造的。Wan 3.0 的 VRAM 需求不可能由阿里巴巴以外的任何人测量过,因为 Wan 3.0 仅在 2026 年 8 月 6 日进入公测阶段,并且从未发布过任何权重文件。4 月份没有任何东西可发布。
那么,真正的答案是什么?没有人对它进行过基准测试。但 Wan 3.0 自己的规格说明书已经将答案框定在硬性限制内,我们在下面做了计算。
关键要点
- 网络上不存在任何 Wan 3.0 权重。今天互联网上关于它的每张 VRAM 表格都是捏造的。
- Wan 3.0 是一个第一方 API 测试版:最长 30 秒,最高 1080P,没有 4K 层级。
- 其自身规格暗示,其潜在序列长度是 5 秒 720P 片段的 13.5 倍,相当于约 180 倍的注意力计算量。
- 目前真正的本地上限是 Wan2.2 TI2V-5B 在 24GB 上运行,或通过社区量化版在 6GB 上运行。
- 本周要获得 1080P 输出,建议租用秒数而非购买 VRAM。

Wan VRAM 需求可视化:左侧为 720P 层级,右侧为 1080P 层级,均使用同一首帧动画,但无需本地 GPU 渲染
同一首帧,相同的运动提示,相同的模型。仅分辨率层级不同:左侧 720P,5 秒 0.50 美元;右侧 1080P,0.75 美元。两者均在 Wan 2.7 上渲染,零本地 VRAM,每个标签上的价格是“运行”按钮实际给出的报价。以静默 GIF 展示。
这就是整个争论的焦点:不是千兆字节,而是像素。
为什么你找到的每张 Wan 3.0 VRAM 需求表格都是虚构的
先说结论:这个关键词排名靠前的页面直接复用了 Wan 2.1 和 Wan 2.2 的数据,贴上“3.0”的标签,并编造了一个发布日期。你大约只需 60 秒就能推翻所有这些说法。
来看看这个。

Hugging Face Wan-AI 组织页面显示 27 个仓库,最高版本号为 Wan2.2,证明不存在可供本地 VRAM 测试的 Wan 3.0 权重
官方 Wan-AI 组织在 Hugging Face 上的模型页面,按最新排序。27 个仓库,列表中任何地方的最高版本号都是 2.2(Hugging Face,2026 年 8 月)。
没有 Wan3.0 仓库。也没有 Wan2.7、Wan2.6 或 Wan2.5 仓库。该组织中最新的东西是 Wan2.2-Animate-2-14B-Diffusers,七天前更新(Hugging Face,2026 年 8 月)。
以下是逐条声明的分析。
表 1:指南声称的内容与可验证的内容
| 你在第 1 页会看到的说法 | 截至 2026 年 8 月可验证的情况 | 如何自行验证 |
|---|---|---|
| “Wan 3.0 于 2026 年 4 月发布了 1.3B + 14B 权重” | Wan 3.0 于 2026 年 8 月 6 日开放公测。任何日期都无权重发布。 | 加载 Wan-AI 组织页面 |
| “Wan 3.0 采用 Apache-2.0 许可” | 从未为 3.0 发布过任何许可文件 | 搜索组织内是否有 3.0 仓库。不存在。 |
| “1.3B 在 8GB 上运行,14B 在 24GB 上运行” | 这些是 Wan 2.1/2.2 的数据。Wan 2.2 的 A14B 本身就需要 80GB。 | Wan2.2 README 的硬件部分 |
| “完整的 4K / 30 秒工作流层级” | 测试版最高为 1080P。层级为 480P、720P、1080P。 | 阿里巴巴自己的每秒价格列表 |
| “已在 ComfyUI / WanGP 中运行” | WanGP 支持的列表仅涵盖 Wan 2.1/2.2 | Wan2GP README |
阿里巴巴在 2026 年 8 月实际发布的是一个 API 和网页产品,而不是检查点。单次生成最长 30 秒,分辨率最高 1080P,接受文本、图像、音频、视频甚至文档(doc、xls、ppt、pdf、md)作为参考输入。API 定价为 480P / 720P / 1080P 每秒 ¥0.3 / ¥0.6 / ¥1.2(QbitAI,2026 年 8 月)。
注意该列表中缺少什么:下载链接。
Wan 3.0 VRAM 需求,根据其自身规格计算
承诺:在本节结束时,你将知道为什么“买一张 32GB 的卡”行不通,并且你可以自己重新推导出这些数字。证明:计算只需要两个已发布的事实:Wan 的 VAE 压缩比和 Wan 3.0 的 1080P/30 秒上限。
让我们开始吧。
关键在于序列长度,而不是参数数量。 每个人都盯着 B 这个数字。但那是错误的变量。
视频扩散 Transformer 的内存和计算量取决于它需要处理的潜在令牌数量,而这个数量来自分辨率乘以持续时间,而不是参数。Wan2.2 的 VAE 在时间、高度和宽度上以 4x16x16 进行压缩,并且 DiT 在此基础上进行分块处理,因此每个潜在令牌大约覆盖 4x32x32 的像素块(Wan2.2 README,2026 年 8 月)。较旧的 Wan2.1 代 VAE 以 4x8x8 进行压缩,因此加上分块后,每个令牌对应 4x16x16,对于相同的片段,令牌数量是四倍。
将 Wan 3.0 自己的上限代入这个公式,结果如下。
表 2:目标片段的潜在令牌数量(我们的计算,24fps)
| 目标片段 | 帧数 | 潜在帧数 | 令牌数(2.2 代 VAE) | 令牌数(2.1 代 VAE) | 与 5s 720P 对比 |
|---|---|---|---|---|---|
| 5s 480P(832x480) | 121 | 31 | 12,090 | 48,360 | 0.44x |
| 5s 720P(1280x704) | 121 | 31 | 27,280 | 109,120 | 1.0x(基准) |
| 10s 1080P(1920x1088) | 241 | 61 | 124,440 | 497,760 | 4.6x |
| 30s 1080P(1920x1088) | 721 | 181 | 369,240 | 1,476,960 | 13.5x |
再看最后一行。Wan 3.0 的主要能力是序列长度是 5 秒 720P 片段的 13.5 倍,而你的 4090 目前处理 5 秒 720P 片段已经吃力。
而自注意力在序列长度上是二次的。13.5 的平方大约是 180。因此,一个 30 秒 1080P 片段的注意力工作量大约是 5 秒 720P 片段的 180 倍,这还不算其他任何东西。
这就是 SERP 中没有人计算过的数字。这也是为什么“再买 8GB”不是一个好计划。
那么,这在千兆字节中意味着什么? 权重是无聊的部分。一个 27B 总参数的 MoE 模型在 fp8 下大约占用 27GB,在 bf16 下大约 54GB。MoE 只帮助每步的 计算(Wan2.2 的 A14B 每步激活 27B 参数中的 14B),而不是内存中必须驻留的内容。
有趣的部分是激活值。在 bf16 下,模型维度为 5120 的一个 Transformer 层的隐藏状态成本为令牌数 x 5120 x 2 字节:
- 5s 720P(27,280 个令牌):0.28 GB 每层
- 30s 1080P(369,240 个令牌):3.8 GB 每层
- 30s 1080P 使用 2.1 代 VAE(1,476,960 个令牌):15.1 GB 每层
每层。乘以你的注意力实现需要保持存活状态的层数,加上文本编码器,加上 VAE 解码过程,80GB 的数字看起来就不再保守了。
表 3:如果权重最终发布,估计的 VRAM(估计值,非实测)
| 目标片段 | 如果发布 5B 类高压缩模型(fp8) | 如果是 A14B 类 MoE(fp8) | 实际结论 |
|---|---|---|---|
| 5s 480P | ~8-10 GB | ~30-34 GB | 12GB 卡可能仅适用于小模型 |
| 5s 720P | ~10-14 GB | ~34-40 GB | 16GB 起步,24GB 舒适 |
| 10s 1080P | ~20-28 GB | ~45-60 GB | 32GB 卡已经边缘化 |
| 30s 1080P | ~45-70 GB | ~90-140 GB | 没有任何消费级显卡(无论何种量化)能达到 |
该表中的每个单元格都是基于表 2 和已发布检查点大小的 估计值。实际数字取决于注意力内核、卸载策略以及阿里巴巴是否最终发布权重。将其视为问题的轮廓,而非规格表。
这个轮廓足够清晰:旗舰设置从来就不是消费级 GPU 的工作负载。
你今天实际能达到的 Wan VRAM 需求
以下是捏造表格试图假装成的内容。这些数字由 Wan 团队发布,是真实的。
表 4:真实的 Wan VRAM 层级,2026 年 8 月
| 变体 | 最低 VRAM | 分辨率 | 实测速度 | 需要的标志 | 权重 |
|---|---|---|---|---|---|
| Wan2.2 T2V-A14B / I2V-A14B | 单 GPU 80GB | 480P / 720P | 未发布 | --offload_model True --convert_model_dtype | Apache-2.0 |
| Wan2.2 TI2V-5B | 24GB(RTX 4090) | 720P @ 24fps | 5s 720P 在 9 分钟内 | --offload_model True --convert_model_dtype --t5_cpu | Apache-2.0 |
| Wan 2.1 / 2.2 通过 WanGP | 6GB 及以上 | 主要是 480P | 较慢,质量有损失 | int8 / fp8 / gguf / NVFP4 / Nunchaku | Apache-2.0 基础 |
| Wan 2.5 / 2.6 / 2.7 | 不适用 | 仅 API | 不适用 | 不适用 | 未发布任何权重 |
| Wan 3.0 | 不适用 | 仅 API,第一方测试版 | 不适用 | 不适用 | 未发布任何权重 |
该表中有两件事值得再看一眼。
第一:A14B 行已经同时开启了两个内存节省标志,但仍然需要 80GB。这是官方单 GPU 数字,不是天真的数字。第二:5B 行是诚实的消费者答案,其自述文件引用在 4090 上 5 秒 720P 在 9 分钟内完成。
在 24GB 以下,你进入了社区领域。WanGP(deepbeepmeep/Wan2GP 项目,自称“GPU 穷人”可访问的生成模型)使用 int8、fp8、gguf、NVFP4 和 Nunchaku 量化,将某些模型降至 6GB。它支持 Wan 2.1 和 2.2。它不支持 3.0,因为没有什么可支持的。
现在,这部分应该改变你的购买决策:“下一个版本会开源”的假设已经连续三次失败。 Wan 2.2 是 Apache-2.0。Wan 2.5 变成了纯 API。Wan 2.6 和 2.7 从未发布权重。Wan 3.0 根本没有许可文件。
今天基于“3.0 权重明天就会发布”的赌注买卡,是在与一个连续三代的趋势对赌。
对于当前的托管运行,请打开 Atlas Cloud 上的 Wan 3.0,并在发布工作流之前测试一个类似下面的提示。

Wan 3.0 提示到结果的截图:无 GPU 渲染路径。
跳过 VRAM 需求:无 GPU 的 Wan 工作流
让我先直截了当地说明边界,因为该领域的大多数页面不会这样做。
没有人托管 Wan 3.0。 无论是 Atlas Cloud 还是其他任何人。没有权重,因此没有第三方推理。如果一个页面提供“Wan 3.0 API 访问”,它是在卖给你别的东西。
你现在可以获得的是家族中的其他成员,托管形式,按秒计费,无需考虑 VRAM。Atlas Cloud 通过一个 API 和一个浏览器标签页运行 Wan 2.2 到 2.7,而 Wan 2.7 在 1080P 下是阿里巴巴自有测试版渠道之外最接近 3.0 级输出的东西。
对于本文所针对的读者来说,这解决了一个特定问题。你正打算花四位数的钱买一张卡,去追逐一个不存在的检查点。租用秒数意味着在购买任何东西之前,你就能看到输出到底是什么样子;如果 3.0 权重永远不发布,你损失的只有几美元。
表 5:托管的 Wan 家族(2026 年 8 月标价)
| 模型 ID | 分辨率 | 最长时长 | 价格 | 最适合 |
|---|---|---|---|---|
| atlascloud/wan-2.2-turbo/image-to-video | 480p / 720p / 1080p, 30fps | 仅 5 秒 | $0.02 / 秒 | 家族中最便宜的预览 |
| atlascloud/wan-2.2/image-to-video | 原生 480P + 720P VSR | 3-10 秒 | $0.03 / 秒 | 预算批量 |
| alibaba/wan-2.5/text-to-video | 最高 1920x1080 | 10 秒 | $0.035 / 秒 | 便宜的 1080P 文本转视频 |
| alibaba/wan-2.6/text-to-video | 最高 1920x1080 | 5 / 10 / 15 秒 | $0.07 / 秒 | 较长片段,无需首帧 |
| alibaba/wan-2.7/image-to-video | 720P / 1080P,外加 1080P-SR 和 1440P-SR | 15 秒 | $0.10 / 秒(标价) | 最接近 3.0 级输出的层级 |
| alibaba/wan-2.2/animate-mix | 在现有镜头中替换角色 | 匹配你的源片段 | $0.126 / 秒 | 将角色替换到镜头中 |
在教程之前有一个警告,因为它会出现在你的账单上:标价是底线。 Wan 2.7 页面报价每秒 $0.10。在我们 2026 年 8 月的运行中,同一个 5 秒任务在 720P 层级报价 $0.50,在 1080P 层级报价 $0.75,因此旗舰层级计费为每秒 $0.15,是标价的一半。在点击按钮之前,务必阅读按钮给出的报价。
表 6:获得 30 秒 1080P 的四种途径
| 途径 | 前期投入 | 每 30 秒 1080P | 你真的能得到吗? |
|---|---|---|---|
| 买一张 24GB 卡(4090 级) | ~$1,600-2,000 | 电费 | 不能。 24GB 运行 Wan2.2 TI2V-5B 只能到 720P。没有 3.0 权重存在。 |
| 租用 80GB 卡 | 按小时 | 数小时计算 + 设置 | 只有 Wan 2.2 A14B,仍然不是 1080P/30 秒 |
| 阿里巴巴第一方测试版 | 无 | ¥1.2/秒 x 30 = ¥36(约 $5) | 是的,一个连续片段,仅限第一方渠道 |
| 托管 Wan 2.7 1080P | 无 | 2 x 15 秒,约 $0.15/秒 = 约 $4.50 | 30 秒镜头,但作为两个片段(15 秒上限) |
做除法。以每次 30 秒 1080P 约 $4.50 的价格计算,一张 $2,000 的卡需要大约 440 次 30 秒渲染才能收支平衡,而且它仍然无法产生其中任何一个。
这就是论点。现在,这里有三步运行流程,以便你可以自己判断输出质量。
第 1 步:锁定 16:9 的首帧
每个诚实的 VRAM 比较都需要一个变量。所以我们固定首帧,然后将相同的帧和相同的运动提示输入两个层级。之后你看到的任何差异都是层级造成的,而不是骰子。
打开 Qwen Image 2.0 Pro 文生图 游乐场,粘贴以下内容:
text1Cinematic wide shot inside a dim home office at 2am: a young engineer in a grey hoodie leans back in a desk chair, face lit only by a triple-monitor rig showing a paused video timeline. Beside the desk an open PC case glows, a single oversized graphics card visible inside, fans spinning. Dust motes in the air, teal-and-amber color grading, shallow depth of field, 35mm anamorphic lens, photorealistic, highly detailed, 16:9 2
设置:点击 16:9 尺寸芯片,它会将帧锁定为 1280 x 720,其余保持默认。每张图片成本为 $0.06(目前是 $0.075 的 8 折)。如果你想要更大的帧,宽度和高度框可以设置到每边 2048,但芯片的默认值已经是两个视频层级的正确形状。
为什么选这个场景?因为它正是读者本人。保留输出文件,你需要在两个地方使用它。

Atlas Cloud 上的 Qwen Image 2.0 Pro 游乐场,选中 16:9 尺寸芯片,输出面板中显示完成的 1280x720 首帧
第 1 步完成:在 1280 x 720 下选中 16:9 芯片,以及两个视频层级都将从该首帧开始。运行按钮上显示 $0.06。
第 2 步:在 720P VRAM 层级下生成动画
这是真实 24GB 本地设置所能达到的替代:720P,五秒,这就是上限。
这里有一个刻意的选择。我们没有在两个层级之间切换模型,而是在两者上运行相同的模型,因此比较中唯一的变量是分辨率层级。将第 1 步的图像作为首帧加载到 Wan 2.7 图生视频 游乐场,然后粘贴以下运动提示:
text1The engineer slowly leans forward and rubs his eyes; the monitor glow flickers as the timeline scrubs; the camera pushes in slightly; dust motes drift through the beam of light; subtle handheld micro-shake; single continuous shot, no cuts. 2
设置:分辨率 720P,时长 5s,其余默认。运行按钮报价 $0.50,即每秒 $0.10 的标价乘以五秒。记下这个数字,因为第 3 步会改变它。

Wan 2.7 图生视频游乐场,720P 层级,已加载首帧,5 秒时长,输出面板中显示完成的片段
第 2 步完成:720P 层级,5 秒,报价 $0.50,输出面板中有真实片段。
第 3 步:无本地 GPU 在 1080P 下生成相同帧的动画
相同页面,相同首帧,逐字相同的运动提示,相同 5 秒时长。只更改一个控制项:将分辨率设置为 1080P。
运行报价从 $0.50 变为 $0.75。这就是每秒 $0.15,实测值,出现在标价显示 $0.10 的页面上。
需要注意两个设置陷阱,我们都通过实际运行才学会:
- 时长控制并不总是生效。 我们设置时长为 10 秒,字段显示 10,但作业仍然渲染了 5 秒。运行按钮的报价是唯一的事实来源:如果真正的 10 秒 1080P 作业每秒 $0.15,报价应该约为 $1.50,所以 $0.75 的报价意味着无论滑块显示什么,你仍然只购买了 5 秒。阅读报价,而不是字段。
- 确认你自己的图像已加载。 如果参考槽仍然保存着页面的预设演示图像,运行将愉快地生成无关内容。在点击之前查看缩略图。

Wan 2.7 图生视频游乐场,1080P 层级,运行按钮报价 $0.75,输出面板中显示完成的 1080P 片段
第 3 步完成,1080P 层级。运行报价是关键点:同样的五秒,低一个层级只需 $0.50,而这个层级要 $0.75,在标价显示每秒 $0.10 的页面上。
两个渲染结果都在本文顶部的片段中,并排显示。这就是五秒内整个 VRAM 争论的全部内容:两个层级的输出,相同的提示,没有涉及任何本地视频内存的千兆字节。
值得尝试的变体。 在提交 1080P 渲染之前,先降至 480P 进行廉价预览。当你没有首帧并且想要一次性获得 15 秒时,可以切换到 alibaba/wan-2.6/text-to-video,价格为 $0.07/秒。使用 alibaba/wan-2.2/animate-mix,价格为 $0.126/秒,将不同角色放入你已有的镜头中。如果你想要接近 30 秒,请预算两个片段,因为每个片段有 15 秒的上限,几乎没有教程提到这一点。
常见问题解答
24GB GPU 能否运行 Wan 3.0?
目前不能,因为没有可加载的权重。如果它们最终发布,表 2 中的数学计算表明,在激进量化下,24GB 只能获得 480P 和短片段。旗舰级的 1080P/30 秒设置是另一个数量级,任何单张消费级显卡都无法达到。
我在哪里可以下载 Wan 3.0 权重?
无处可下载。Hugging Face 上的 Wan-AI 组织最高只到 Wan2.2,并且 Wan-Video GitHub 组织没有 3.0 的推理仓库,也没有 3.0 的许可。任何提供“Wan 3.0 检查点下载”的网站都在分发并非其声称的东西。
Wan 3.0 是开源还是 Apache 2.0 许可?
没有发布任何许可。趋势是相反的:Wan 2.2 是 Apache-2.0,Wan 2.5 变成了纯 API,2.6 和 2.7 根本没有发布权重。连续三代闭源。请相应规划。
我今天实际能运行的最低 VRAM Wan 模型是什么?
Wan2.2 TI2V-5B,官方要求 24GB(RTX 4090),在 9 分钟内完成 5 秒 720P。低于此,WanGP 的量化路径在某些模型上降至 6GB,但会在速度和细节上付出代价。
Wan 3.0 与 Wan 2.7:我可以在本地运行哪一个?
两者都不能。两者都是纯 API。如果要求是“在我的机器上运行”,你的选择是 Wan 2.1 和 2.2 系列。如果要求是 2.7 级输出,那是托管调用,而不是本地安装。
如果我不能在本地运行,我现在如何获得 30 秒的 1080P?
阿里巴巴的第一方测试版按秒计费,并在一个片段中提供 30 秒。在这些渠道之外,每个片段有 15 秒的硬性上限,因此 30 秒意味着拼接两个片段。在我们自己的 Wan 2.7 延续测试中,限制非常严格:源片段必须为 2 到 10 秒,输出必须严格长于源,源帧不会被保留,并且链接延续不会累积长度。大多数教程从未提及这些。
所以整个 Wan 3.0 VRAM 需求 问题的简短版本是:停止为卡购物,因为你打算购买它的检查点并不存在。如果你想要磁盘上的权重,请在本地运行 Wan 2.2;当你想要假表格所出售的输出时,请租用 1080P 秒数。






