MiniMax H3 Developer 提供開始 — 60%オフ、1秒あたりわずか$0.02から

Wan 3.0 VRAM要件:なぜ80GBでは不十分なのか、今日実際に動作するもの

Wan 3.0のVRAM要件は、自身の1080P/30秒仕様から計算すると:シーケンス長の13.5倍、公開された重みはゼロ、そして現在動作するローカルWanのティア。

最新情報: Wan 3.0 は 2026 年 8 月 24 日より一般公開されています。

あなたは 6 つのタブを開きました。どのタブにもきれいな表が表示されていました。1.3B は 8GB、14B は 24GB、Apache-2.0、2026 年 4 月リリース。そこで、チェックポイントを取得するために Hugging Face の Wan-AI ページを開きました。

27 個のリポジトリ。最新は Wan2.2。

これらの表は古くなったわけではありません。捏造されたものです。Wan 3.0 の VRAM 要件は、Alibaba 以外の誰も測定できません。なぜなら、Wan 3.0 は 2026 年 8 月 6 日にパブリックベータ版が開始されたばかりで、重みファイルは一度もリリースされていないからです。4 月にリリースされたものは何もありません。

では、本当の答えは何でしょうか?誰もベンチマークを取っていません。しかし、Wan 3.0 の仕様書自体が答えを明確に示しており、私たちはその計算を以下で行いました。

重要なポイント

  • Wan 3.0 の重みはどこにも存在しません。現在ウェブ上にある、Wan 3.0 に関する VRAM 表はすべて捏造です。
  • Wan 3.0 はファーストパーティの API ベータ版です。最大 30 秒、最大 1080P、4K ティアはありません。
  • その仕様から、5 秒 720P クリップの約 13.5 倍の潜在シーケンス長が必要となり、注意機構の計算量は約 180 倍になります。
  • 現時点で実際にローカルで動作する上限は、Wan2.2 TI2V-5B を 24GB、またはコミュニティによる量子化で 6GB です。
  • 今週 1080P 出力が必要なら、VRAM を買う代わりに秒単位でレンタルしましょう。 comparison 768p vs 2k

Wan VRAM 要件を可視化: 左側の 720P ティアと右側の 1080P ティアで同じ最初のフレームをアニメーション化。どちらもローカル GPU なしでレンダリング。

同じ最初のフレーム、同じモーションプロンプト、同じモデル。解像度ティアのみ変更: 左側の 720P は 5 秒で $0.50、右側の 1080P は $0.75。どちらも Wan 2.7 でローカル VRAM ゼロでレンダリングされ、各ラベルの価格は Run ボタンが実際に提示した金額です。無音 GIF で表示。

これがこの議論のすべてです。ギガバイトではなく、ピクセルです。

なぜ Wan 3.0 VRAM 要件の表はすべて虚構なのか

結論から先に言います。このキーワードで上位表示されているページは、Wan 2.1 と Wan 2.2 の数値を流用し、それに「3.0」とラベルを貼り、リリース日をでっち上げたものです。約 60 秒でそのすべてを論破できます。

これを見てください。

Hugging Face profile page for Wan-AI listing their AI models

Hugging Face の Wan-AI 組織ページ。27 のリポジトリがあり、最新バージョンは Wan2.2。Wan 3.0 の重みがローカル VRAM テスト用に存在しないことを証明。

公式の Wan-AI 組織の Hugging Face ページ、モデルタブ、新着順。27 のリポジトリで、リスト内のバージョン番号の最大は 2.2 です (Hugging Face、2026 年 8 月)。

Wan3.0 リポジトリはありません。Wan2.7、Wan2.6、Wan2.5 のリポジトリもありません。組織内で最も新しいのは、7 日前に更新された Wan2.2-Animate-2-14B-Diffusers です (Hugging Face、2026 年 8 月)。

以下が主張ごとの内訳です。

表 1: ガイドが主張する内容と検証可能な内容

ページ 1 で見られる主張2026 年 8 月時点で検証可能な内容自分で確認する方法
「Wan 3.0 は 2026 年 4 月に 1.3B + 14B の重みをリリース」Wan 3.0 は 2026 年 8 月 6 日にパブリックベータ開始。いかなる日付でも重みはなし。Wan-AI 組織ページを読み込む
「Wan 3.0 は Apache-2.0」3.0 用のライセンスファイルは一度も公開されていない組織内で 3.0 リポジトリを検索する。存在しない。
「1.3B は 8GB で動作、14B は 24GB で動作」これらは Wan 2.1/2.2 の数値。Wan 2.2 の A14B 自体は 80GB を要求。Wan2.2 README のハードウェアセクション
「フル 4K / 30 秒ワークフローティア」ベータ版の上限は 1080P。ティアは 480P、720P、1080P。Alibaba 公式の秒単位の価格表
「ComfyUI / WanGP で現在動作」WanGP のサポートリストは Wan 2.1/2.2 のみをカバーWan2GP README

Alibaba が 2026 年 8 月に実際にリリースしたのは、API とウェブ製品であり、チェックポイントではありません。1 回の生成は最大 30 秒、解像度は 1080P が上限で、テキスト、画像、音声、動画、さらにはドキュメント (doc、xls、ppt、pdf、md) を参照入力として受け付けます。API 価格は 480P / 720P / 1080P でそれぞれ 1 秒あたり ¥0.3 / ¥0.6 / ¥1.2 です (QbitAI、2026 年 8 月)。

このリストに何が欠けているかお気づきですか?ダウンロードリンクです。

Wan 3.0 VRAM 要件、仕様から計算

約束します。このセクションを読み終える頃には、「32GB カードを買えばいい」がなぜダメなのか、自分で再計算できる数字とともに理解できるでしょう。証明方法: 計算には、Wan の VAE 圧縮率と Wan 3.0 の 1080P/30 秒上限という 2 つだけの公開情報が必要です。

始めましょう。

問題はシーケンス長であり、パラメータ数ではありません。 誰もが B の数字に注目します。それは間違った変数です。

ビデオ拡散トランスフォーマーのメモリと計算量は、処理する必要のある潜在トークンの数に比例します。その数は、パラメータではなく、解像度×時間から決まります。Wan2.2 の VAE は時間、高さ、幅で 4x16x16 に圧縮し、DiT がその上でパッチ化を行うため、各潜在トークンはおおよそ 4x32x32 ピクセルのブロックをカバーします (Wan2.2 README、2026 年 8 月)。より古い Wan2.1 世代の VAE は 4x8x8 に圧縮するため、パッチ化後はトークンあたり 4x16x16 となり、同じクリップに対して 4 倍のトークン数になります。

Wan 3.0 自身の上限をこれに当てはめると、以下の結果が出ます。

表 2: ターゲットクリップごとの潜在トークン数 (当社計算、24fps)

ターゲットクリップフレーム数潜在フレーム数トークン数 (2.2世代 VAE)トークン数 (2.1世代 VAE)5秒720P比
5秒 480P (832x480)1213112,09048,3600.44x
5秒 720P (1280x704)1213127,280109,1201.0x (基準)
10秒 1080P (1920x1088)24161124,440497,7604.6x
30秒 1080P (1920x1088)721181369,2401,476,96013.5x

最後の行をもう一度見てください。Wan 3.0 の見出しとなる機能は、あなたの 4090 が現在処理に苦労している 5 秒 720P クリップの 13.5 倍のシーケンス長です。

そして、自己注意機構はシーケンス長に対して二次関数的に増加します。13.5 の二乗は約 180 です。つまり、1 つの 30 秒 1080P クリップに対する注意機構の計算量は、1 つの 5 秒 720P クリップの約 180 倍になります。他の要素は一切考慮していません。

SERP 上の誰も計算しなかった数字がこれです。また、「あと 8 ギガバイト買えばいい」という計画が成り立たない理由でもあります。

では、これはギガバイトで何を意味するのでしょうか? 重みは退屈な部分です。合計 27B の MoE を fp8 で使用した場合、常駐は約 27GB、bf16 では約 54GB です。MoE は 1 ステップあたりの 計算量 にのみ役立ちます (Wan2.2 の A14B は、27B のパラメータのうち 14B を 1 ステップで活性化します)。メモリに常駐させる必要があるものには影響しません。

興味深いのはアクティベーションです。bf16 のモデル次元 5120 での 1 つのトランスフォーマー層の隠れ状態のコストは、トークン数 x 5120 x 2 バイトです:

  • 5s 720P (27,280 トークン): 0.28 GB 層あたり
  • 30s 1080P (369,240 トークン): 3.8 GB 層あたり
  • 2.1 世代 VAE での 30s 1080P (1,476,960 トークン): 15.1 GB 層あたり

層あたりです。注意機構の実装がライブで保持する必要がある層の数だけ掛け算し、テキストエンコーダと VAE デコードパスを追加すると、80GB という数字は控えめに見えなくなります。

表 3: 重みがリリースされた場合の推定 VRAM (推定値、未測定)

ターゲットクリップ高圧縮モデル (5B クラス) が fp8 でリリースされた場合A14B クラス MoE が fp8 でリリースされた場合実用的な結論
5秒 480P~8-10 GB~30-34 GB小型モデルに限り 12GB カードでも可能性あり
5秒 720P~10-14 GB~34-40 GB16GB が最低、24GB で快適
10秒 1080P~20-28 GB~45-60 GB32GB カードでもすでに厳しい
30秒 1080P~45-70 GB~90-140 GBコンシューマー向けカードでは不可能、どの量子化でも

この表のすべてのセルは、表 2 と公開されているチェックポイントサイズから導出された 推定値 です。実際の数値は、注意機構カーネル、オフロード戦略、そして Alibaba が重みをリリースするかどうかに依存します。仕様書ではなく、問題の形状として扱ってください。

形状は明確です。フラッグシップ設定は、そもそもコンシューマー向け GPU のワークロードではありませんでした。

今日実際に達成可能な Wan VRAM 要件

ここが、捏造された表が装っていた部分です。これらの数値は Wan チームによって公開されており、本物です。

表 4: 実際の Wan VRAM ティア、2026 年 8 月

バリアント最小 VRAM解像度測定速度必要なフラグ重み
Wan2.2 T2V-A14B / I2V-A14Bシングル GPU で 80GB480P / 720P未公開--offload_model True --convert_model_dtypeApache-2.0
Wan2.2 TI2V-5B24GB (RTX 4090)720P @ 24fps5秒 720P を 9 分未満--offload_model True --convert_model_dtype --t5_cpuApache-2.0
Wan 2.1 / 2.2 (WanGP 経由)6GB 以上主に 480P低速、画質低下int8 / fp8 / gguf / NVFP4 / NunchakuApache-2.0 ベース
Wan 2.5 / 2.6 / 2.7n/aAPI のみn/an/a公開なし
Wan 3.0n/aAPI のみ、ファーストパーティベータn/an/a公開なし

この表の中で、2 つの点に注目する価値があります。

まず、A14B の行は、すでに両方のメモリ節約フラグがオンになっていて、それでも 80GB を要求しています。これは単純な数値ではなく、公式のシングル GPU の数値です。次に、5B の行は正直なコンシューマー向けの答えであり、その README には、4090 上で 5 秒の 720P を 9 分未満で処理すると記載されています。

24GB 未満はコミュニティの領域です。WanGP (deepbeepmeep/Wan2GP プロジェクト。自身を「GPU 貧乏人向け」の生成モデルと説明) は、int8、fp8、gguf、NVFP4、Nunchaku 量子化を使用して、特定のモデルを 6GB まで削減します。Wan 2.1 と 2.2 をサポートしています。3.0 はサポートしていません。サポートするものが存在しないからです。

そして、あなたの購入判断を変えるべき部分です。「次のバージョンはオープンになる」という前提は、3 回連続で外れています。 Wan 2.2 は Apache-2.0 でした。Wan 2.5 は API のみになりました。Wan 2.6 と 2.7 は重みをリリースしませんでした。Wan 3.0 にはライセンスファイルすらありません。

3 世代にわたるトレンドに逆らって、明日 3.0 の重みがリリースされるという賭けで、今日カードを買うことになります。

現在のホスト型実行については、Atlas Cloud 上の Wan 3.0 を開き、ワークフローを公開する前に以下のようなプロンプトをテストしてください。

Wan 3.0 prompt and generated effect screenshot for wan-3.0-vram-requirements

Wan 3.0 プロンプトから結果へのスクリーンショット: GPU 不要のレンダリングパス。

VRAM 要件をスキップ: GPU 不要の Wan ワークフロー

まず、境界線について率直に述べます。この分野のほとんどのページはそうしないでしょうから。

誰も Wan 3.0 をホストしていません。 Atlas Cloud も、他の誰もです。重みがないため、サードパーティによる推論はありません。もしページが「Wan 3.0 API アクセス」を提供しているなら、それは別の何かを売っているのです。

現在すぐに入手できるのは、ファミリーの残りの部分を、VRAM を考慮せずに、秒単位で課金されるホスト型で利用することです。Atlas Cloud は、Wan 2.2 から 2.7 を 1 つの API と 1 つのブラウザタブの背後で実行しており、Wan 2.7 の 1080P は、Alibaba 自身のベータチャネル以外で利用可能な 3.0 クラスの出力に最も近いものです。

この記事が対象としている読者にとって、これは特定の問題を解決します。あなたは、存在しないチェックポイントを追い求めて、4 桁の金額をカードに費やそうとしていたところです。秒単位でレンタルすれば、何かを購入する前に出力が実際にどのようなものかを確認でき、3.0 の重みが決してリリースされなくても、失うのは数ドルだけです。

表 5: ホスト型 Wan ファミリー (2026 年 8 月時点の表示価格)

モデル ID解像度最大時間価格最適な用途
atlascloud/wan-2.2-turbo/image-to-video480p / 720p / 1080p, 30fps5秒のみ$0.02 / 秒ファミリーで最も安価な試用
atlascloud/wan-2.2/image-to-video480P ネイティブ + 720P VSR3-10秒$0.03 / 秒予算バッチ
alibaba/wan-2.5/text-to-video最大 1920x108010秒$0.035 / 秒安価な 1080P テキスト→動画
alibaba/wan-2.6/text-to-video最大 1920x10805 / 10 / 15秒$0.07 / 秒長時間、最初のフレーム不要
alibaba/wan-2.7/image-to-video720P / 1080P、さらに 1080P-SR と 1440P-SR15秒$0.10 / 秒 (表示価格)3.0 クラスの出力に最も近いティア
alibaba/wan-2.2/animate-mix既存映像のキャラクター交換ソースクリップに一致$0.126 / 秒ショット内のキャラクターを交換

チュートリアルの前に一つ警告です。これはあなたの請求書に表示されます。表示価格は最低価格です。 Wan 2.7 のページは 1 秒あたり $0.10 と表示しています。2026 年 8 月の当社の実行では、同じ 5 秒のジョブが 720P ティアで $0.50、1080P で $0.75 と見積もられました。つまり、フラッグシップティアは 1 秒あたり $0.15 で請求され、表示レートの 1.5 倍です。ボタンが表示する見積もりを、クリックする前に必ず確認してください。

表 6: 30 秒の 1080P を実現する 4 つのルート

ルート初期費用30秒の1080Pあたり実際に得られるもの
24GB カード (4090 クラス) を購入~$1,600-2,000電気代いいえ。 24GB は Wan2.2 TI2V-5B を 720P で実行。3.0 の重みは存在しない。
80GB カードをレンタル時間単位計算時間 + セットアップWan 2.2 A14B のみで、しかも 1080P/30s は不可
Alibaba ファーストパーティベータなし¥1.2/s x 30 = ¥36 (~$5)はい、1 つの連続クリップ、ファーストパーティチャネルのみ
ホスト型 Wan 2.7 1080Pなし2 x 15s at ~$0.15/s = ~$4.5030 秒の映像、ただし 2 つのクリップ (15秒制限)

割り算をしてください。1080P の 30 秒あたり約 $4.50 として、$2,000 のカードの元を取るには約 440 回の 30 秒レンダリングが必要であり、それでも 1 つも生成することはできません。

それが論点です。ここで、出力を自分で判断できるようにするための 3 ステップの実行手順を示します。

ステップ 1: 最初のフレームを 16:9 で固定する

誠実な VRAM 比較には、1 つの変数を固定する必要があります。そこで、最初のフレームを固定し、同じフレームと同一のモーションプロンプトを両方のティアに与えます。その後ろに見える違いはすべて、ティアの違いであり、偶然ではありません。

Qwen Image 2.0 Pro テキスト→画像 プレイグラウンドを開き、以下を貼り付けます:

text
1Cinematic wide shot inside a dim home office at 2am: a young engineer in a grey hoodie leans back in a desk chair, face lit only by a triple-monitor rig showing a paused video timeline. Beside the desk an open PC case glows, a single oversized graphics card visible inside, fans spinning. Dust motes in the air, teal-and-amber color grading, shallow depth of field, 35mm anamorphic lens, photorealistic, highly detailed, 16:9
2

設定: 16:9 サイズチップをクリックすると、フレームが 1280 x 720 にスナップされます。それ以外はデフォルトのままにします。コストは画像あたり $0.06 (現在 $0.075 の 20% オフ)。幅と高さのボックスは、より大きなフレームが必要な場合、片面 2048 まで設定可能ですが、チップのデフォルトは両方のビデオティアに適した形状になっています。

なぜこのシーンか?文字通り読者だからです。出力ファイルは保持しておいてください。2 回必要になります。

Screenshot of an AI image generator interface showing input and output

Atlas Cloud 上の Qwen Image 2.0 Pro プレイグラウンド。16:9 サイズチップが選択され、出力パネルに完成した 1280x720 の最初のフレームが表示されている。

ステップ 1 完了: 1280 x 720 で 16:9 チップが選択され、両方のビデオティアが出発する最初のフレーム。Run ボタンで $0.06。

ステップ 2: 720P VRAM ティアでアニメーション化する

これは、実際の 24GB ローカルセットアップで得られるものを代用したものです。720P、5 秒、それが上限です。

ここには意図的な選択があります。2 つのティア間でモデルを切り替えるのではなく、両方で同じモデルを実行することで、比較の唯一の変数が解像度ティアになります。ステップ 1 の画像を Wan 2.7 画像→動画 プレイグラウンドに最初のフレームとして読み込み、次にこのモーションプロンプトを貼り付けます:

text
1The engineer slowly leans forward and rubs his eyes; the monitor glow flickers as the timeline scrubs; the camera pushes in slightly; dust motes drift through the beam of light; subtle handheld micro-shake; single continuous shot, no cuts.
2

設定: 解像度 720P、時間 5s、その他はデフォルト。Run ボタンは $0.50 と表示しました。これは、表示レートの 1 秒あたり $0.10 × 5 秒です。この数字をメモしておいてください。ステップ 3 で変わります。

AI video generation interface showing text prompt input and video output

Wan 2.7 画像→動画プレイグラウンド。720P ティア、最初のフレーム読み込み済み、5 秒間、出力パネルに完成したクリップ。

ステップ 2 完了: 720P ティア、5 秒、$0.50 と見積もられ、出力パネルに実際のクリップあり。

ステップ 3: ローカル GPU なしで同じフレームを 1080P でアニメーション化する

同じページ、同じ最初のフレーム、同じモーションプロンプトを一字一句同じ、同じ 5 秒間。1 つのコントロールだけを変更します: 解像度を 1080P に設定します。

Run の見積もりは $0.50 から $0.75 に変わります。これが実測の 1 秒あたり $0.15 であり、表示価格が $0.10 のページでの値です。

注意すべき 2 つの設定の落とし穴。どちらも、実際の実行を通じて学んだものです。

  • 時間コントロールは常に反映されるとは限りません。 時間を 10 秒に設定し、フィールドには 10 と表示されていても、ジョブは 5 秒をレンダリングしました。Run ボタンの見積もりが唯一の信頼できる情報源です。1 秒あたり $0.15 の場合、真の 10 秒 1080P ジョブは約 $1.50 になるはずなので、$0.75 の見積もりは、スライダーが何を表示していようと、まだ 5 秒を購入していることを意味します。フィールドではなく、見積もりを読んでください。
  • 自分の画像が読み込まれていることを確認してください。 参照スロットにページのプリセットデモ画像がまだ入っている場合、実行は喜んで無関係なものを生成します。クリックする前にサムネイルを確認してください。 AI video generator interface showing a text prompt and generated video

Wan 2.7 画像→動画プレイグラウンド、1080P ティア。Run ボタンが $0.75 と表示し、出力パネルに完成した 1080P クリップ。

1080P ティアでのステップ 3 完了。Run の見積もりがポイント: 1 秒下のティアで $0.50 だった同じ 5 秒が $0.75 であり、1 秒あたり $0.10 と表示されているページでの値。

両方のレンダリングは、この記事の上部にあるクリップに並べて表示されています。これが 5 秒間の VRAM 議論のすべてです。2 つのティアの出力、同じプロンプト、そしてローカルビデオメモリは 1 ギガバイトも使用していません。

試す価値のあるバリエーション。 1080P レンダリングにコミットする前に、安価な試用として 480P に落としてみてください。最初のフレームがなく、15 秒を一度に生成したい場合は、$0.07/s の alibaba/wan-2.6/text-to-video に切り替えてください。すでに持っている映像に別のキャラクターを配置するには、$0.126/s の alibaba/wan-2.2/animate-mix を使用してください。また、30 秒に近づけたい場合は、ほとんどどのチュートリアルも言及していない 1 クリップあたり 15 秒の上限があるため、2 つのクリップ分の予算を計上してください。

よくある質問

24GB GPU で Wan 3.0 を実行できますか?

現時点ではできません。読み込む重みが存在しないからです。もし重みがリリースされたとしても、表 2 の計算によれば、24GB では 480P と、強力な量子化を施した短いクリップが限界です。フラッグシップの 1080P/30s 設定は桁違いであり、単一のコンシューマーカードでは到達不可能です。

Wan 3.0 の重みはどこでダウンロードできますか?

どこにもありません。Hugging Face の Wan-AI 組織は Wan2.2 で止まっており、Wan-Video GitHub 組織には 3.0 の推論リポジトリも 3.0 のライセンスもありません。「Wan 3.0 チェックポイントダウンロード」を提供するサイトは、主張するものを配布していません。

Wan 3.0 はオープンソースまたは Apache 2.0 ですか?

ライセンスは公開されていません。傾向は逆方向です。Wan 2.2 は Apache-2.0 でしたが、Wan 2.5 は API のみになり、2.6 と 2.7 は重みをまったくリリースしませんでした。3 世代連続でクローズドになっています。それに応じて計画を立ててください。

今日実際に実行できる最も低 VRAM の Wan モデルは何ですか?

Wan2.2 TI2V-5B で、公式には 4090 で 24GB、5 秒の 720P を 9 分未満で処理します。それ以下では、WanGP の量子化パスが特定のモデルで 6GB まで到達しますが、速度と詳細で代償を払うことになります。

Wan 3.0 vs Wan 2.7: どちらをローカルで実行できますか?

どちらもできません。両方とも API のみです。「自分のマシンで動く」ことが要件であれば、選択肢は Wan 2.1 および 2.2 ファミリーです。要件が 2.7 クラスの出力であれば、それはローカルインストールではなく、ホスト型呼び出しです。

ローカルで実行できない場合、どうすれば今すぐ 30 秒の 1080P を入手できますか?

Alibaba のファーストパーティベータは秒単位で課金され、1 つのクリップで 30 秒を提供します。それ以外のチャネルでは、1 クリップあたり 15 秒の厳格な上限があるため、30 秒を得るには 2 つをつなぎ合わせる必要があります。当社の Wan 2.7 継続テストでは、制約は厳格でした。ソースセグメントは 2 ~ 10 秒である必要があり、出力はソースより厳密に長くなければならず、ソースフレームは保持されず、継続を連鎖させても長さは蓄積されませんでした。ほとんどのチュートリアルはこれらについて一切言及していません。

したがって、Wan 3.0 VRAM 要件 全体の短い答えは次のとおりです。カードの買い物はやめましょう。なぜなら、そのために購入するチェックポイントは存在しないからです。重みをディスクに置きたいなら Wan 2.2 をローカルで実行し、偽の表が売っていた出力が欲しいなら 1080P の秒単位をレンタルしてください。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索