Wan 3.0 マルチショット一貫性:公式クリップ110本のカット数をすべてカウントした
あなたは4ショットの脚本を書いた。ショット1は完璧に決まる:麦わら帽子、黒いビーズネックレス、白いリネンのドレス、照明も完璧。ショット2が届くと、そこには別の女性が別の帽子をかぶっている。
そのギャップこそ、人々がWan 3.0 マルチショット一貫性に注目する理由だ。1つのプロンプト、6つのショット、30秒、同じキャラクターを維持するという約束。
そこで私はスペックシートを読むのをやめた。AlibabaがWan 3.0公式クリエイターハンドブックとともに公開した全110個のデモファイルをダウンロードし、すべてにffmpegをかけ、64個のペアプロンプトを解析し、検索結果で誰もやっていないことを実行した:実際に納品された動画のカット数を数え、プロンプトが要求したショット数と比較した。
以下の3つの発見は、他のどこに書かれていることとも矛盾する。

カラリストのリファレンス壁はマルチショット一貫性の正直なメンタルモデル:同一のアイデンティティ、6つのフレーミングを並べて確認。openai/gpt-image-2で生成。
重要なポイント
- 6ショットは現実的だが保証はされていない:Alibaba自身のマルチショットプロンプトのうち、宣言通りのショット数が実現したのは3つ、2つは未達。
- 最悪のケースは4ショット要求で2ショットしかレンダリングされなかった。
- 4Kはなし。公式ファイル110本のうち、1080pを超えるものはゼロ、1920x1080ぴったりは4本のみ。
- プロップとカメラは顔よりも先にずれる。目ではなく帽子をチェックせよ。
- Alibaba自身のプラットフォーム以外に公開のWan 3.0 APIはまだない。そのため、以下のチュートリアルでは現在呼び出せるモデルで再構築する。
以下が最高の結果。Alibabaの公式ハンドブックより。プロンプトで6ショット宣言、6ショット納品、同じ2人のキャラクター、同じ衣装、同じ雨:

雨の駅プラットフォームでの6ショットアニメシーケンス。透明傘の少女とカーキのリュックの少年が全カットで一貫保持。
Alibaba公式Wan 3.0ベータデモ(ハンドブッククリップv013、1280x720、20.05秒)。プロンプトはショット1~6と番号打ち。ffmpegはハードカットをちょうど5つ検出、全6ショット着地。Atlas Cloud生成ではありません。
Wan 3.0 マルチショット一貫性の正体
短く言えば、1つの名前に3つの別々の約束が込められており、Alibabaはその3つを異常に具体的に明示している。
ローンチ記事で、Alibabaは一貫性をキャラクター(「顔の特徴、髪型と髪色、体型、衣装、アクセサリー」)、プロップ(「多角度からの外観、ハードウェア構造、ロゴ、素材の詳細」)、空間(「キャラクターのブロッキングとカメラアングル」)の3層に分割している(Alibaba Cloud、2026)。この3層分割が以下のすべての評価基準となる。同じ顔でもネックレスが違えば不合格。
モデルは1ジョブで最大30秒、480P、720P、1080Pで生成する(Alibaba Cloud、2026)。
ここからが検索結果が間違っている部分だ。
| 検索結果でよく見られる主張 | 実際に一次資料が示すこと |
|---|---|
| 「ネイティブ4K生成」 | 公式記事は480P / 720P / 1080Pのみ記載。110の公式デモファイルで1080pを超えるものはなく、1920x1080ぴったりは4ファイルのみ。一般的な「1080p」風景出力は1920x1072。 |
| 「1生成あたり最大6つの独立ショット」 | Alibabaの公式ローンチ記事にはショット数スペックなし。経験的に成り立つ:ハンドブック内の明示的なマルチショットプロンプト8つのうち、最高宣言は6、うち2つが6ショットを納品。 |
| 「最大12枚のリファレンス画像」 | 実機テストでは最大10画像+5ビデオクリップ+5オーディオクリップと報告(Curious Refuge、2026)。Alibabaの記事は数字を一切示していない。 |
| 「オープンウェイト、Apache-2.0」 | 以前のWanリリースはオープンウェイトだったが、Wan 3.0はプラットフォームサービスとして出荷され、ウェイトは公開されていない(Curious Refuge、2026)。 |
| 「APIは公開済み」 | Alibaba Cloud Model Studio上で動作。サードパーティの推論プラットフォームではまだ利用不可。 |
そして、これが最も時間をかけて作った表。すべての数値は私がffmpegのシーン検出で納品ファイルから算出し、ペアプロンプトに書かれたショット数と比較したものだ。
| 公式デモ | プロンプト宣言 | 検出されたハードカット数 | 実際のショット数 | 判定 |
|---|---|---|---|---|
| v013 雨のプラットフォーム、アニメ | 6ショット | 5 | 6 | 正確 |
| v055 ゴールデンレトリバーの日記 | 6ショット、30.0秒 | 5 | 6 | 正確 |
| v021 ラーメン屋と子猫 | 4ショット | 3 | 4 | 正確 |
| v008 森の湖、3D | 4ショット | 2 | 3 | 1ショット不足 |
| v085 麦わら帽子の女性 | 4ショット | 1 | 2 | 半分 |
| v041 廊下から魔法の路地へ | 3セグメント、「ハードカットなし」 | 0 | 1回の連続テイク | 要求通り |
| v045、v084、v102 | 3 / 5 / 複数被写体 | 解像不能多 | カウント不可 | 高速カットと水墨ストロボで検出不能 |
真ん中の行をもう一度読んでほしい。3つのプロンプトは宣言通りに到達した。2つは到達しなかった。入力したショット数は要求であり、契約ではない。
Wan 3.0 マルチショット一貫性が崩れる理由:4つの失敗モード
先に結論:めったに顔では崩れない。オブジェクトとカメラで崩れ、複数の要素を同時に変えると最も崩れる。
以下は私に最も多くのことを教えてくれたクリップ。Alibaba自身のショーケースで最悪のパフォーマンスを示したものだ。
GtZy2TUK4ak
Alibaba公式Wan 3.0ベータデモ(ハンドブッククリップv085、1240x742、30.08秒)。プロンプトは4つのタイムコード付きショットを指定。ffmpegは9.3秒で1つのリアルカットを検出。ショット3と4は1つの持続テイクに統合され、フェードアウト。Atlas Cloud生成ではありません。
失敗モード1:プロップは顔より先にずれる。 そのクリップで、カットが行われる前のオープニングテイクだけを見てみよう。0.6秒でボーター帽は細い黒いバンド、ペンダントはファセットカットの紺碧の石。9.2秒でバンドは幅広の黒いリボン、ペンダントは滑らかな光沢のある黒いドロップ。彼女の顔はずっと安定している。アクセサリーは安定していない。

同じ連続9秒テイクの2フレームを並べて表示。ハットバンドが広がり、ネックレスのペンダントが形と色を変えている。
両フレームとも公式v085デモの同じ途切れないテイクから、8.6秒間隔。カットなし。ハットバンドとペンダントの両方が変化。キャラクター層が保持されている間にプロップ層が失敗している例。
これが、実際に機能する受け入れテストが雰囲気チェックではなくプロップチェックリストである理由だ。このキャラクターの場合、3つのアイテム:帽子の形とバンド、ビーズネックレスとペンダント、ドレスのネックライン。
失敗モード2:複数被写体のシーンでは個別には保持されるが接触すると混ざる。 各キャラクターは単独では認識可能。フレーム内で一緒に配置し相互作用すると、アイデンティティがにじむ。独立したテストでも同じことが確認されている:「キャラクターの一貫性が崩れ始め、合成が自然生成環境というより悪いグリーンスクリーン効果のように見えることがある」と、リップシンクが最大の弱点として挙げられている(Curious Refuge、2026)。
失敗モード3:1行で4つの変数を変更した。 新しい場所+新しいカメラアングル+新しい照明+新しい衣装状態は、アイデンティティを失う確実な方法。ハンドブックのプロンプト自体が、各セグメントで衣装全体を再記述することでこれを防いでいる。64のペアプロンプトのうち、9つは明示的に「変更なし」、5つはカメラ位置を固定、4つはキャラクターが同一であることを要求している。
失敗モード4:1ジョブで30秒は、1ショットで30秒ではない。 これらは異なる製品だ。30秒のマルチショットジョブはフレーミングを切り替える。本当に必要なのが1つの連続した途切れないテイクなら、継続をつなぐと劣化する:受け渡しごとにアイデンティティエラーが蓄積されるため、クリーンな単一テイクは本質的に短い。
ハンドブックには、シームレスさを正しく実現したプロンプトが1つだけある。その文構造をコピーする価値がある:

3つのプロンプトセグメントが1つの途切れない連続テイクとしてレンダリング。アパートの廊下からドアを通り抜け、ランプの灯るゴシック調の路地へ。
Alibaba公式Wan 3.0ベータデモ(ハンドブッククリップv041、720x1280、15.04秒)。3つのプロンプトセグメントで、ffmpegはハードカットを0検出。プロンプトの要求通り。Atlas Cloud生成ではありません。
その受け渡しライン(翻訳)は、ハンドブック全体で最も再利用可能なものだ:「前のセグメントの最終フレームからシームレスに続ける。キャラクター、衣装、場所、カメラ位置は完全に同一のまま。ハードカットや急なシーン遷移なし。」64のプロンプト中、これを使っているのは1つだけ。盗め。
今日から実行できるマルチショット一貫性ワークフロー
問題は、実際にこれをどこで実行するかだ。
現時点でWan 3.0はAlibaba独自のModel Studio上にある。サードパーティの推論プラットフォームではホストされていない。Atlas Cloudでは「近日公開」としてのみ表示され、稼働中のエンドポイントはゼロ。これが正直な現状であり、そうでないふりをするよりはっきり言う価値がある。
したがって、選択肢は2つ:待つか、1つのプロンプトに6つのことをさせるのをやめるか。
2番目の選択肢のほうがとにかく優れており、私のカットカウントがその根拠になる。1つのマルチショットジョブでは、Alibaba自身のショーケースでショット数が半分も外れた。ジョブを分割すれば、その制御はあなたの手に戻る:
- ルックを静止画像として一度ロックする。
- そのアイデンティティをショットごとのキーフレームにクローンし、毎回1つの変数だけを変更する。
- 各ショットをリファレンスロックで別々にアニメートする。
- ローカルで結合する。
セットアップは遅くなるが、劇的に予測可能になる。そしてチェーン内のすべてのモデルは今日呼び出し可能だ。
| ステップ | モデル | チェーン内の役割 | 記載価格 |
|---|---|---|---|
| 1 | bytedance/seedream-v5.0-pro/text-to-image | キャラクタールックをロック | $0.045 / 画像 |
| 2 | google/nano-banana-2/edit | 各ショットのキーフレームにアイデンティティをクローン | $0.08 / 画像 |
| 3 | alibaba/wan-2.7/reference-to-video | リファレンスロックで各ショットをアニメート | $0.10 / 秒 |
| 代替 | alibaba/wan-2.7/text-to-video | 1プロンプト、多数ショット(最も制御困難) | $0.10 / 秒 |
| 修正 | alibaba/wan-2.7/video-edit | 再生成せずに1つの間違ったプロップを修正 | $0.10 / 秒 |
「マルチショット一貫性に最適なモデル」という質問に関して知っておくべきこと:リファレンス・トゥ・ビデオは今やカテゴリ全体だ。bytedance/seedance-2.0-fast/reference-to-videoは$0.072/秒(2026年8月時点で$0.09から20%オフ)、kwaivgi/kling-video-o3-pro/reference-to-videoは$0.095/秒($0.112から15%オフ)、minimax/h3/reference-to-videoは$0.10/秒、google/veo3.1/reference-to-videoは$0.20/秒。すべての価格は2026年8月21日のライブカタログに対して確認済み。
ステップの前に1つの警告:記載価格は下限であり、見積もりではない。解像度と時間が実際の数字を変えるため、コミットする前に「実行」ボタンの見積もりを確認すること。
Wan 3.0スタイルのマルチショット一貫性を段階的に構築する方法
Alibaba自身のモデルが失敗したまさにそのビートシートを再構築する:麦わら帽子の女性、4ショット、庭から車へ。同じ脚本、ショットごとの制御、今回は4ショットをレンダリングするので確実に4ショット得られる。
始めよう。
ステップ1:ルックをロックする。 1枚の画像が下流すべてのアイデンティティアンカーになる。Seedream v5.0 Proで生成、16:9、ページが提供する最高解像度で。3つのチェックポイントプロップを明示的に名前を挙げよ。それらがずれるからだ。
plaintext135mmフィルムスチル、ビンテージの日差しのバラ園。エレガントな若い女性が、黒いバンドの付いた天然麦わらボーター帽、黒いビーズネックレスにティアドロップペンダント1つ、白いノースリーブリネンドレスを着用。満開のピンクとクリームのバラの壁の前に立ち、片手で帽子のつばに軽く触れ、穏やかで物思いにふける視線はカメラのわずかに外。柔らかな暖かい自然光、まだらな太陽のフレア、浅い被写界深度、細かいフィルムグレイン、ミディアムクローズアップ。

Atlas Cloud上のSeedream v5.0 Proプレイグラウンド。麦わら帽子プロンプトを入力し、出力パネルに完成したキャラクターキーフレームがレンダリングされている。
ステップ1完了:4ショットシーケンス全体のアイデンティティアンカー。
ステップ2:ショット2~4にアイデンティティをクローンする。 ショットごとに1キーフレーム、1回ずつ実行。ステップ1の出力をリファレンスとしてNano Banana 2 Editを使用。重要な規律:毎回必ず衣装全体を再記述し、その後1つだけ変更する。
ショット2、感情の転換:
plaintext1リファレンス画像と同じ女性を完全に維持:同一の顔、同一の天然麦わらボーター帽(黒バンド付き)、同一の黒いビーズネックレス(ティアドロップペンダント付き)、同一の白いノースリーブリネンドレス。新しいショット:シネマティッククローズアップ、彼女がゆっくり麦わら帽子を頭から持ち上げ、あごを引く、かすかに物悲しい表情。同じバラ園の背景。リファレンスと同じ照明、肌色、フィルムグレイン、カラーグレードを厳格に維持。
ショット3、車へのカット:
plaintext1リファレンス画像と同じ女性を完全に維持:同一の顔、同一の黒いビーズネックレス(ティアドロップペンダント付き)、同一の白いノースリーブリネンドレス、麦わらボーター帽は今ひざの上に。新しいショット:走行中の車の後部座席、横顔、肘をドアに立て、雨粒のついた窓の外を眺める、ぼやけた緑の葉が後ろに流れる。曇り空の光に暖かい室内照明、浅い被写界深度、優雅な憂鬱。リファレンスと同じ顔、同じカラーグレード、同じ35mmフィルムグレインを厳格に維持。
ショット4、最後の一瞥:
plaintext1リファレンス画像と同じ女性を完全に維持:同一の顔、同一の黒いビーズネックレス(ティアドロップペンダント付き)。新しいショット:車の窓際の極端な顔クローズアップ、目がゆっくり閉じる、落ち着いて解放された表情。彼女の前のガラスを雨粒が滑り落ち、焦点が水滴に移り、背景がボケに沈む。ウォン・カーウァイ風のシネマティックムード、細かいフィルムグレイン。リファレンスと同じ顔、同じ照明、同じカラーグレードを厳格に維持。

Atlas Cloud上のNano Banana 2 Editプレイグラウンド。ステップ1のキーフレームをリファレンスとして読み込み、ショット2のキーフレームがレンダリング。アイデンティティと衣装は保持。
ステップ2完了:ショット2のキーフレーム。同じ女性、帽子は手に。
ステップ3:リファレンスロックでショット1をアニメートする。 ここで各ショットはWan 2.7 reference-to-videoで独立してビデオになる。設定:720P、5秒、ステップ1のキーフレームを画像スロットにドロップ。実行ボタンの見積もりを確認してから発射すること。
plaintext1ショット1/4。リファレンス画像1がキャラクターを定義:クリップ全体で同じ顔、同じ天然麦わらボーター帽(黒バンド付き)、同じ黒いビーズネックレス(ティアドロップペンダント付き)、同じ白いノースリーブリネンドレスを同一に保つ。35mmフィルムルック、ビンテージの日差しのバラ園。女性が帽子のつばにそっと触れ、柔らかな風が髪の毛先を揺らす。カメラは非常にゆっくりと押し込む。暖かい自然光、まだらな太陽のフレア、浅い被写界深度、細かいフィルムグレイン。カメラ位置は安定。ハードカットなし、シーン変更なし。

Atlas Cloud上のWan 2.7 reference-to-videoプレイグラウンド。キーフレームを画像スロットに配置し、完成した5秒のクリップが出力パネルで再生中。
ステップ3完了:リファレンスロックされたクリップが出力パネルにレンダリング。
そして、これが出てきたものだ:

バラ園の麦わら帽子の女性の5秒リファレンスロッククリップ。ハットバンドとネックレスは全体を通して安定。
Atlas Cloud上での独自実行。Alibabaのデモではない。サイレントGIFとして表示。納品ファイルにはオーディオトラックが含まれます。
ステップ4:ショット2~4を連鎖させ、結合する。 残りの各キーフレームに対してステップ3を繰り返し、後続の各プロンプトの先頭にハンドブックの受け渡し文を貼り付ける:
plaintext1前のセグメントの最終フレームからシームレスに続ける。キャラクター、衣装、場所、カメラ位置は完全に同一のまま。ハードカットや急なシーン遷移なし。
その後、ffmpegでローカルに連結し、3点の受け入れチェックを実行する:帽子の形とバンド、ビーズネックレスとペンダント、ショット間のフレーミングの進行が実際に意味をなすかどうか。1つのショットでちょうど1つのプロップが間違っている場合、そのショットを再生成しない。wan-2.7/video-editに通して、その部分だけを変更する。ハンドブックの表現を借りて:アクション、衣装、フレームの残りは変更しない。
バリエーション:複数被写体シーンとスタイルロック
ハンドブックから盗む価値のある3つのパターン。
複数被写体ショット用のキャラクターカード。 2人以上がフレームを共有する場合、公式プロンプトは英字のキャラクターカードを割り当て、各セグメントで各キャラクターのフルコスチュームを再宣言している。冗長で見苦しいが、代名詞を使うよりはうまくいく。
スタイルワーク用のグローバルスタイル宣言。 水墨画、セルアニメーション、その他重いスタイルは、作品全体で一度スタイルを固定し、その下にタイムコード付きのビートシートを置く必要がある。

水墨画風の武侠シーケンス。竹林の剣士がタイムコード付き5ビートの戦闘全体でスタイルロック。
Alibaba公式Wan 3.0ベータデモ(ハンドブッククリップv084、20.05秒、切り抜き)。1つのグローバル水墨画スタイル宣言の下に5つのタイムコード付きビート。ストロボのような筆致のため、自動カット検出ではこのクリップをカウントできない。Atlas Cloud生成ではありません。
修正、再生成するな。 1つの間違ったプロップに対するビデオ編集パスは、新しいレンダリングよりも安価であり、すでに正しいショットを壊すことはない。
4ショットシーケンスのコスト
上記で構築したシーケンスの具体的な数値、記載価格ベース:
- 1アイデンティティアンカー(Seedream v5.0 Pro):$0.045
- 3ショットキーフレーム(Nano Banana 2 Edit):3 x $0.08 = $0.24
- 4クリップ、5秒、720P、Wan 2.7 reference-to-video:20秒 x $0.10 = $2.00
- 合計:約$2.29(20秒、4ショット、アイデンティティロックのシーケンス)
6ショット30秒に拡張すると、動画部分は$3.00になり、合計約$3.44。
正直な注意点が2つ。第一に、記載価格は下限である:解像度の階層と時間が実際の請求額を変えるため、プレイグラウンドの「実行」見積もりだけが拘束力を持つ。だからこそ、上のスクリーンショットがこのリストよりも重要だ。第二に、Wan 3.0自体について、AlibabaはModel Studioの動画生成を解像度階層ごとに秒単位で価格設定しているが、一次資料のページから正確なWan 3.0の秒単位料金を確認できなかったため、検証できない数字は引用しない。
分割ジョブアプローチで購入しているものに注目する価値がある:低価格ではなく、あなたの脚本に合ったショット数だ。Alibaba自身のショーケースの証拠から、それは1つの30秒ジョブがまだ約束できるものではなく、APIが開くまでのWan 3.0マルチショット一貫性への実用的な答えである。
よくある質問
Wan 3.0は1回の生成で何ショットまで一貫性を維持できますか?
現在の証拠では6ショット、ただし但し書き付き。Alibabaのローンチ記事はショット数のスペックを公開していない。公式ハンドブック内の明示的なマルチショットプロンプト8つのうち、最高宣言は6、うち2つが正確に6カット確認済みのショットを納品。6は観測された上限であり、保証ではないと扱うこと。
Wan 3.0は本当にネイティブ4Kを生成しますか?
いいえ。公式記事は480P、720P、1080Pのみ記載。全110の公式デモファイルで1080pを超えるものはなく、1920x1080ぴったりは4ファイルのみ。一般的な風景出力は1920x1072。フレームレートは63ファイルが24fps、46ファイルが30fpsに分かれる。
Wan 3.0 APIは利用可能ですか?どこで実行できますか?
Alibaba Cloud Model Studio上で動作。サードパーティの推論プラットフォームではまだホストされていない。Atlas Cloudでは「近日公開」としてのみ表示され、稼働中のエンドポイントはない。今週中にマルチショット出力が必要な場合、上記のWan 2.7 reference-to-videoチェーンが現在の代替手段となる。
リファレンス画像を使っても、なぜキャラクターがショット間で変わってしまうのですか?
通常、1つのプロンプトで場所、カメラアングル、照明を同時に変更したため。ショットごとに1つの変数だけを変更し、すべてのプロンプトで衣装全体を再記述すること。また、正しいものをチェックすること:Alibaba自身のデモでは、顔は安定している一方で、ハットバンドとネックレスのペンダントが途切れない1テイク内で変化した。
Wan 3.0のウェイトはオープンソースですか?
ウェイトは公開されていない。以前のWanバージョンはダウンロード可能でローカル実行可能だったが、Wan 3.0はホスト型プラットフォームサービスとして出荷されている。Wan 3.0にApache-2.0ライセンスを引用している人は、一次資料のない情報を繰り返している。
Wan 3.0にアクセスせずにマルチショット一貫性を得る最も速い方法は?
4つの手順:1つのアイデンティティ画像をロックし、それをショットごとに1つのキーフレームにクローン(毎回1変数のみ変更)、各ショットをreference-to-videoでアニメート、ローカルで結合してプロップをチェック。4ショットシーケンスで約$2.29、約30分。
手法: 全110のデモファイルと64のペアプロンプトは、Alibaba公式Wan 3.0クリエイターハンドブックから、2026年8月11日にローカルアーカイブ。メタデータはffmpegでファイルごとに読み取り。ショット数はffmpegのシーン変化検出(閾値0.2)で、抽出フレームとクロスチェック。プロンプト構造はプログラムで解析。Atlas Cloudの価格は2026年8月21日のライブモデルカタログに対して確認済み。
出典: Alibaba Cloud(2026年8月);Curious Refuge(2026年)。






