MiniMax H3 Developer 现已上线 — 官方定价 4 折,低至 $0.02/秒

Wan 3.0 VRAM要求:为什么80GB不够,以及目前实际能运行什么

Wan 3.0 的 VRAM 需求,根据其自身的 1080P/30s 规格计算:序列长度的 13.5 倍、零公开权重,以及当前运行的本地 Wan 层级。

最新更新: Wan 3.0 已于 2026 年 8 月 24 日正式上线。

你打开了六个标签页。每个页面都给你展示了一张清晰的图表:1.3B 在 8GB 上,14B 在 24GB 上,Apache-2.0 许可,2026 年 4 月发布。于是你打开了 Hugging Face 上的 Wan-AI 页面,准备下载检查点。

27 个仓库。最新的是 Wan2.2。

那些图表并未过时——它们根本就是编造的。Wan 3.0 的 VRAM 需求不可能由阿里巴巴以外的任何人测量过,因为 Wan 3.0 仅在 2026 年 8 月 6 日进入公测阶段,并且从未发布过任何权重文件。4 月份没有任何东西可发布。

那么,真正的答案是什么?没有人对它进行过基准测试。但 Wan 3.0 自己的规格说明书已经将答案框定在硬性限制内,我们在下面做了计算。

关键要点

  • 网络上不存在任何 Wan 3.0 权重。今天互联网上关于它的每张 VRAM 表格都是捏造的。
  • Wan 3.0 是一个第一方 API 测试版:最长 30 秒,最高 1080P,没有 4K 层级。
  • 其自身规格暗示,其潜在序列长度是 5 秒 720P 片段的 13.5 倍,相当于约 180 倍的注意力计算量。
  • 目前真正的本地上限是 Wan2.2 TI2V-5B 在 24GB 上运行,或通过社区量化版在 6GB 上运行。
  • 本周要获得 1080P 输出,建议租用秒数而非购买 VRAM。

对比 768p 与 2k

Wan VRAM 需求可视化:左侧为 720P 层级,右侧为 1080P 层级,均使用同一首帧动画,但无需本地 GPU 渲染

同一首帧,相同的运动提示,相同的模型。仅分辨率层级不同:左侧 720P,5 秒 0.50 美元;右侧 1080P,0.75 美元。两者均在 Wan 2.7 上渲染,零本地 VRAM,每个标签上的价格是“运行”按钮实际给出的报价。以静默 GIF 展示。

这就是整个争论的焦点:不是千兆字节,而是像素。

为什么你找到的每张 Wan 3.0 VRAM 需求表格都是虚构的

先说结论:这个关键词排名靠前的页面直接复用了 Wan 2.1 和 Wan 2.2 的数据,贴上“3.0”的标签,并编造了一个发布日期。你大约只需 60 秒就能推翻所有这些说法。

来看看这个。

Hugging Face 上 Wan-AI 的 AI 模型列表页面

Hugging Face Wan-AI 组织页面显示 27 个仓库,最高版本号为 Wan2.2,证明不存在可供本地 VRAM 测试的 Wan 3.0 权重

官方 Wan-AI 组织在 Hugging Face 上的模型页面,按最新排序。27 个仓库,列表中任何地方的最高版本号都是 2.2(Hugging Face,2026 年 8 月)。

没有 Wan3.0 仓库。也没有 Wan2.7、Wan2.6 或 Wan2.5 仓库。该组织中最新的东西是 Wan2.2-Animate-2-14B-Diffusers,七天前更新(Hugging Face,2026 年 8 月)。

以下是逐条声明的分析。

表 1:指南声称的内容与可验证的内容

你在第 1 页会看到的说法截至 2026 年 8 月可验证的情况如何自行验证
“Wan 3.0 于 2026 年 4 月发布了 1.3B + 14B 权重”Wan 3.0 于 2026 年 8 月 6 日开放公测。任何日期都无权重发布。加载 Wan-AI 组织页面
“Wan 3.0 采用 Apache-2.0 许可”从未为 3.0 发布过任何许可文件搜索组织内是否有 3.0 仓库。不存在。
“1.3B 在 8GB 上运行,14B 在 24GB 上运行”这些是 Wan 2.1/2.2 的数据。Wan 2.2 的 A14B 本身就需要 80GB。Wan2.2 README 的硬件部分
“完整的 4K / 30 秒工作流层级”测试版最高为 1080P。层级为 480P、720P、1080P。阿里巴巴自己的每秒价格列表
“已在 ComfyUI / WanGP 中运行”WanGP 支持的列表仅涵盖 Wan 2.1/2.2Wan2GP README

阿里巴巴在 2026 年 8 月实际发布的是一个 API 和网页产品,而不是检查点。单次生成最长 30 秒,分辨率最高 1080P,接受文本、图像、音频、视频甚至文档(doc、xls、ppt、pdf、md)作为参考输入。API 定价为 480P / 720P / 1080P 每秒 ¥0.3 / ¥0.6 / ¥1.2(QbitAI,2026 年 8 月)。

注意该列表中缺少什么:下载链接。

Wan 3.0 VRAM 需求,根据其自身规格计算

承诺:在本节结束时,你将知道为什么“买一张 32GB 的卡”行不通,并且你可以自己重新推导出这些数字。证明:计算只需要两个已发布的事实:Wan 的 VAE 压缩比和 Wan 3.0 的 1080P/30 秒上限。

让我们开始吧。

关键在于序列长度,而不是参数数量。 每个人都盯着 B 这个数字。但那是错误的变量。

视频扩散 Transformer 的内存和计算量取决于它需要处理的潜在令牌数量,而这个数量来自分辨率乘以持续时间,而不是参数。Wan2.2 的 VAE 在时间、高度和宽度上以 4x16x16 进行压缩,并且 DiT 在此基础上进行分块处理,因此每个潜在令牌大约覆盖 4x32x32 的像素块(Wan2.2 README,2026 年 8 月)。较旧的 Wan2.1 代 VAE 以 4x8x8 进行压缩,因此加上分块后,每个令牌对应 4x16x16,对于相同的片段,令牌数量是四倍。

将 Wan 3.0 自己的上限代入这个公式,结果如下。

表 2:目标片段的潜在令牌数量(我们的计算,24fps)

目标片段帧数潜在帧数令牌数(2.2 代 VAE)令牌数(2.1 代 VAE)与 5s 720P 对比
5s 480P(832x480)1213112,09048,3600.44x
5s 720P(1280x704)1213127,280109,1201.0x(基准)
10s 1080P(1920x1088)24161124,440497,7604.6x
30s 1080P(1920x1088)721181369,2401,476,96013.5x

再看最后一行。Wan 3.0 的主要能力是序列长度是 5 秒 720P 片段的 13.5 倍,而你的 4090 目前处理 5 秒 720P 片段已经吃力。

而自注意力在序列长度上是二次的。13.5 的平方大约是 180。因此,一个 30 秒 1080P 片段的注意力工作量大约是 5 秒 720P 片段的 180 倍,这还不算其他任何东西。

这就是 SERP 中没有人计算过的数字。这也是为什么“再买 8GB”不是一个好计划。

那么,这在千兆字节中意味着什么? 权重是无聊的部分。一个 27B 总参数的 MoE 模型在 fp8 下大约占用 27GB,在 bf16 下大约 54GB。MoE 只帮助每步的 计算(Wan2.2 的 A14B 每步激活 27B 参数中的 14B),而不是内存中必须驻留的内容。

有趣的部分是激活值。在 bf16 下,模型维度为 5120 的一个 Transformer 层的隐藏状态成本为令牌数 x 5120 x 2 字节:

  • 5s 720P(27,280 个令牌):0.28 GB 每层
  • 30s 1080P(369,240 个令牌):3.8 GB 每层
  • 30s 1080P 使用 2.1 代 VAE(1,476,960 个令牌):15.1 GB 每层

每层。乘以你的注意力实现需要保持存活状态的层数,加上文本编码器,加上 VAE 解码过程,80GB 的数字看起来就不再保守了。

表 3:如果权重最终发布,估计的 VRAM(估计值,非实测)

目标片段如果发布 5B 类高压缩模型(fp8)如果是 A14B 类 MoE(fp8)实际结论
5s 480P~8-10 GB~30-34 GB12GB 卡可能仅适用于小模型
5s 720P~10-14 GB~34-40 GB16GB 起步,24GB 舒适
10s 1080P~20-28 GB~45-60 GB32GB 卡已经边缘化
30s 1080P~45-70 GB~90-140 GB没有任何消费级显卡(无论何种量化)能达到

该表中的每个单元格都是基于表 2 和已发布检查点大小的 估计值。实际数字取决于注意力内核、卸载策略以及阿里巴巴是否最终发布权重。将其视为问题的轮廓,而非规格表。

这个轮廓足够清晰:旗舰设置从来就不是消费级 GPU 的工作负载。

你今天实际能达到的 Wan VRAM 需求

以下是捏造表格试图假装成的内容。这些数字由 Wan 团队发布,是真实的。

表 4:真实的 Wan VRAM 层级,2026 年 8 月

变体最低 VRAM分辨率实测速度需要的标志权重
Wan2.2 T2V-A14B / I2V-A14B单 GPU 80GB480P / 720P未发布--offload_model True --convert_model_dtypeApache-2.0
Wan2.2 TI2V-5B24GB(RTX 4090)720P @ 24fps5s 720P 在 9 分钟内--offload_model True --convert_model_dtype --t5_cpuApache-2.0
Wan 2.1 / 2.2 通过 WanGP6GB 及以上主要是 480P较慢,质量有损失int8 / fp8 / gguf / NVFP4 / NunchakuApache-2.0 基础
Wan 2.5 / 2.6 / 2.7不适用仅 API不适用不适用未发布任何权重
Wan 3.0不适用仅 API,第一方测试版不适用不适用未发布任何权重

该表中有两件事值得再看一眼。

第一:A14B 行已经同时开启了两个内存节省标志,但仍然需要 80GB。这是官方单 GPU 数字,不是天真的数字。第二:5B 行是诚实的消费者答案,其自述文件引用在 4090 上 5 秒 720P 在 9 分钟内完成。

在 24GB 以下,你进入了社区领域。WanGP(deepbeepmeep/Wan2GP 项目,自称“GPU 穷人”可访问的生成模型)使用 int8、fp8、gguf、NVFP4 和 Nunchaku 量化,将某些模型降至 6GB。它支持 Wan 2.1 和 2.2。它不支持 3.0,因为没有什么可支持的。

现在,这部分应该改变你的购买决策:“下一个版本会开源”的假设已经连续三次失败。 Wan 2.2 是 Apache-2.0。Wan 2.5 变成了纯 API。Wan 2.6 和 2.7 从未发布权重。Wan 3.0 根本没有许可文件。

今天基于“3.0 权重明天就会发布”的赌注买卡,是在与一个连续三代的趋势对赌。

对于当前的托管运行,请打开 Atlas Cloud 上的 Wan 3.0,并在发布工作流之前测试一个类似下面的提示。

Wan 3.0 提示词与生成效果截图

Wan 3.0 提示到结果的截图:无 GPU 渲染路径。

跳过 VRAM 需求:无 GPU 的 Wan 工作流

让我先直截了当地说明边界,因为该领域的大多数页面不会这样做。

没有人托管 Wan 3.0。 无论是 Atlas Cloud 还是其他任何人。没有权重,因此没有第三方推理。如果一个页面提供“Wan 3.0 API 访问”,它是在卖给你别的东西。

你现在可以获得的是家族中的其他成员,托管形式,按秒计费,无需考虑 VRAM。Atlas Cloud 通过一个 API 和一个浏览器标签页运行 Wan 2.2 到 2.7,而 Wan 2.7 在 1080P 下是阿里巴巴自有测试版渠道之外最接近 3.0 级输出的东西。

对于本文所针对的读者来说,这解决了一个特定问题。你正打算花四位数的钱买一张卡,去追逐一个不存在的检查点。租用秒数意味着在购买任何东西之前,你就能看到输出到底是什么样子;如果 3.0 权重永远不发布,你损失的只有几美元。

表 5:托管的 Wan 家族(2026 年 8 月标价)

模型 ID分辨率最长时长价格最适合
atlascloud/wan-2.2-turbo/image-to-video480p / 720p / 1080p, 30fps仅 5 秒$0.02 / 秒家族中最便宜的预览
atlascloud/wan-2.2/image-to-video原生 480P + 720P VSR3-10 秒$0.03 / 秒预算批量
alibaba/wan-2.5/text-to-video最高 1920x108010 秒$0.035 / 秒便宜的 1080P 文本转视频
alibaba/wan-2.6/text-to-video最高 1920x10805 / 10 / 15 秒$0.07 / 秒较长片段,无需首帧
alibaba/wan-2.7/image-to-video720P / 1080P,外加 1080P-SR 和 1440P-SR15 秒$0.10 / 秒(标价)最接近 3.0 级输出的层级
alibaba/wan-2.2/animate-mix在现有镜头中替换角色匹配你的源片段$0.126 / 秒将角色替换到镜头中

在教程之前有一个警告,因为它会出现在你的账单上:标价是底线。 Wan 2.7 页面报价每秒 $0.10。在我们 2026 年 8 月的运行中,同一个 5 秒任务在 720P 层级报价 $0.50,在 1080P 层级报价 $0.75,因此旗舰层级计费为每秒 $0.15,是标价的一半。在点击按钮之前,务必阅读按钮给出的报价。

表 6:获得 30 秒 1080P 的四种途径

途径前期投入每 30 秒 1080P你真的能得到吗?
买一张 24GB 卡(4090 级)~$1,600-2,000电费不能。 24GB 运行 Wan2.2 TI2V-5B 只能到 720P。没有 3.0 权重存在。
租用 80GB 卡按小时数小时计算 + 设置只有 Wan 2.2 A14B,仍然不是 1080P/30 秒
阿里巴巴第一方测试版¥1.2/秒 x 30 = ¥36(约 $5)是的,一个连续片段,仅限第一方渠道
托管 Wan 2.7 1080P2 x 15 秒,约 $0.15/秒 = 约 $4.5030 秒镜头,但作为两个片段(15 秒上限)

做除法。以每次 30 秒 1080P 约 $4.50 的价格计算,一张 $2,000 的卡需要大约 440 次 30 秒渲染才能收支平衡,而且它仍然无法产生其中任何一个。

这就是论点。现在,这里有三步运行流程,以便你可以自己判断输出质量。

第 1 步:锁定 16:9 的首帧

每个诚实的 VRAM 比较都需要一个变量。所以我们固定首帧,然后将相同的帧和相同的运动提示输入两个层级。之后你看到的任何差异都是层级造成的,而不是骰子。

打开 Qwen Image 2.0 Pro 文生图 游乐场,粘贴以下内容:

text
1Cinematic wide shot inside a dim home office at 2am: a young engineer in a grey hoodie leans back in a desk chair, face lit only by a triple-monitor rig showing a paused video timeline. Beside the desk an open PC case glows, a single oversized graphics card visible inside, fans spinning. Dust motes in the air, teal-and-amber color grading, shallow depth of field, 35mm anamorphic lens, photorealistic, highly detailed, 16:9
2

设置:点击 16:9 尺寸芯片,它会将帧锁定为 1280 x 720,其余保持默认。每张图片成本为 $0.06(目前是 $0.075 的 8 折)。如果你想要更大的帧,宽度和高度框可以设置到每边 2048,但芯片的默认值已经是两个视频层级的正确形状。

为什么选这个场景?因为它正是读者本人。保留输出文件,你需要在两个地方使用它。

AI 图像生成器界面截图,显示输入和输出

Atlas Cloud 上的 Qwen Image 2.0 Pro 游乐场,选中 16:9 尺寸芯片,输出面板中显示完成的 1280x720 首帧

第 1 步完成:在 1280 x 720 下选中 16:9 芯片,以及两个视频层级都将从该首帧开始。运行按钮上显示 $0.06。

第 2 步:在 720P VRAM 层级下生成动画

这是真实 24GB 本地设置所能达到的替代:720P,五秒,这就是上限。

这里有一个刻意的选择。我们没有在两个层级之间切换模型,而是在两者上运行相同的模型,因此比较中唯一的变量是分辨率层级。将第 1 步的图像作为首帧加载到 Wan 2.7 图生视频 游乐场,然后粘贴以下运动提示:

text
1The engineer slowly leans forward and rubs his eyes; the monitor glow flickers as the timeline scrubs; the camera pushes in slightly; dust motes drift through the beam of light; subtle handheld micro-shake; single continuous shot, no cuts.
2

设置:分辨率 720P,时长 5s,其余默认。运行按钮报价 $0.50,即每秒 $0.10 的标价乘以五秒。记下这个数字,因为第 3 步会改变它。

AI 视频生成界面,显示文本提示输入和视频输出

Wan 2.7 图生视频游乐场,720P 层级,已加载首帧,5 秒时长,输出面板中显示完成的片段

第 2 步完成:720P 层级,5 秒,报价 $0.50,输出面板中有真实片段。

第 3 步:无本地 GPU 在 1080P 下生成相同帧的动画

相同页面,相同首帧,逐字相同的运动提示,相同 5 秒时长。只更改一个控制项:将分辨率设置为 1080P

运行报价从 $0.50 变为 $0.75。这就是每秒 $0.15,实测值,出现在标价显示 $0.10 的页面上。

需要注意两个设置陷阱,我们都通过实际运行才学会:

  • 时长控制并不总是生效。 我们设置时长为 10 秒,字段显示 10,但作业仍然渲染了 5 秒。运行按钮的报价是唯一的事实来源:如果真正的 10 秒 1080P 作业每秒 $0.15,报价应该约为 $1.50,所以 $0.75 的报价意味着无论滑块显示什么,你仍然只购买了 5 秒。阅读报价,而不是字段。
  • 确认你自己的图像已加载。 如果参考槽仍然保存着页面的预设演示图像,运行将愉快地生成无关内容。在点击之前查看缩略图。

AI 视频生成器界面,显示文本提示和生成的视频

Wan 2.7 图生视频游乐场,1080P 层级,运行按钮报价 $0.75,输出面板中显示完成的 1080P 片段

第 3 步完成,1080P 层级。运行报价是关键点:同样的五秒,低一个层级只需 $0.50,而这个层级要 $0.75,在标价显示每秒 $0.10 的页面上。

两个渲染结果都在本文顶部的片段中,并排显示。这就是五秒内整个 VRAM 争论的全部内容:两个层级的输出,相同的提示,没有涉及任何本地视频内存的千兆字节。

值得尝试的变体。 在提交 1080P 渲染之前,先降至 480P 进行廉价预览。当你没有首帧并且想要一次性获得 15 秒时,可以切换到 alibaba/wan-2.6/text-to-video,价格为 $0.07/秒。使用 alibaba/wan-2.2/animate-mix,价格为 $0.126/秒,将不同角色放入你已有的镜头中。如果你想要接近 30 秒,请预算两个片段,因为每个片段有 15 秒的上限,几乎没有教程提到这一点。

常见问题解答

24GB GPU 能否运行 Wan 3.0?

目前不能,因为没有可加载的权重。如果它们最终发布,表 2 中的数学计算表明,在激进量化下,24GB 只能获得 480P 和短片段。旗舰级的 1080P/30 秒设置是另一个数量级,任何单张消费级显卡都无法达到。

我在哪里可以下载 Wan 3.0 权重?

无处可下载。Hugging Face 上的 Wan-AI 组织最高只到 Wan2.2,并且 Wan-Video GitHub 组织没有 3.0 的推理仓库,也没有 3.0 的许可。任何提供“Wan 3.0 检查点下载”的网站都在分发并非其声称的东西。

Wan 3.0 是开源还是 Apache 2.0 许可?

没有发布任何许可。趋势是相反的:Wan 2.2 是 Apache-2.0,Wan 2.5 变成了纯 API,2.6 和 2.7 根本没有发布权重。连续三代闭源。请相应规划。

我今天实际能运行的最低 VRAM Wan 模型是什么?

Wan2.2 TI2V-5B,官方要求 24GB(RTX 4090),在 9 分钟内完成 5 秒 720P。低于此,WanGP 的量化路径在某些模型上降至 6GB,但会在速度和细节上付出代价。

Wan 3.0 与 Wan 2.7:我可以在本地运行哪一个?

两者都不能。两者都是纯 API。如果要求是“在我的机器上运行”,你的选择是 Wan 2.1 和 2.2 系列。如果要求是 2.7 级输出,那是托管调用,而不是本地安装。

如果我不能在本地运行,我现在如何获得 30 秒的 1080P?

阿里巴巴的第一方测试版按秒计费,并在一个片段中提供 30 秒。在这些渠道之外,每个片段有 15 秒的硬性上限,因此 30 秒意味着拼接两个片段。在我们自己的 Wan 2.7 延续测试中,限制非常严格:源片段必须为 2 到 10 秒,输出必须严格长于源,源帧不会被保留,并且链接延续不会累积长度。大多数教程从未提及这些。

所以整个 Wan 3.0 VRAM 需求 问题的简短版本是:停止为卡购物,因为你打算购买它的检查点并不存在。如果你想要磁盘上的权重,请在本地运行 Wan 2.2;当你想要假表格所出售的输出时,请租用 1080P 秒数。

最新模型

一个 API,畅享全模态 AI。

探索全部模型