あなたは、1本の15秒広告用のフォルダを作りました。2枚のキャラクター静止画。クライアントから送られてきたブランドトーンの動画。PDFでしか存在しないブランドブック。本当に使いたい俳優の声サンプル。
それから動画モデルを開くと、画像を1枚だけ要求されました。
だから誰もがやることをやりました。フォルダの中身を800ワードのプロンプトに翻訳して、祈りました。3ショット目で顔が変わった。ジャケットの色が変わった。声はまったく別人だった。
Wan 3.0のオムニリファレンスは、動画モデルが初めて「よし、フォルダをよこせ」と言ったものです。1回の呼び出しで最大20のアセット、5種類の入力、1回の連続した30秒テイクで保持されます。
この記事は3つのことを行い、残りは省略します。その20のアセットが実際に何であるかを分解し、Alibaba自身が生成したクリップを証拠として使用し、そして今日実行できる同等のワークフローを提供します。なぜなら、Wan 3.0はAlibaba自身のクラウド上でパブリックベータ版であり、まだサードパーティのプラットフォームから呼び出すことができないからです。
主なポイント
- Wan 3.0のマルチモーダルリファレンスは、1回の呼び出しで最大20のアセットを受け入れ、画像、動画、音声、ドキュメント、ライブWebページに及び、1回の30秒テイク全体でそれらを一貫して保持します。
- PDF、スライドデッキ、URLを、プロンプトに言い換えるものではなく、クリエイティブな入力として扱う最初の主流動画モデルです。
- Wan 3.0は2026年8月6日にAlibaba Cloud Model StudioとQwen Cloudで
wan3.0-videoとしてパブリックベータ版になりました。クローズドウェイトです。すでにApache 2.0であるとあなたに言う人は誰でも推測しています。 - 20アセットという見出しは、実際に優位に立つところではありません。今すぐ呼び出せるリファレンス動画モデルは、すでに20以上のアセットを受け入れます。ギャップはドキュメントとWebページであり、数ではありません。
- 2キャラクター、リファレンスロック、フルボイスのフォーマットを無料でテストできます。Atlas Cloudの無料AI広告スキットジェネレーターを使用して、4枚の商品写真を入力し、15秒の音声付きスキットを出力します。カードは不要です。

Wan 3.0によって5つの異なるセットを追いかけられる2匹の猫、キャラクタードリフトなし_2枚のリファレンス画像。ホテルの廊下から洗濯機のドラム、赤い電話ボックスまで、まったく異なる5つのセット。ドリフトのフレームは1つもありません。出典:Alibaba公式の_ Wan 3.0クリエイターハンドブック _、2026年8月。この記事の他のすべてのWan 3.0クリップもここからです。
マルチリファレンス動画が崩壊する理由、そしてWan 3.0マルチモーダルリファレンスが変えるもの
動画モデルにはクリップ間のメモリがありません。生成のたびにゼロから始まります。これがすべての問題を一文で表しています。
そのため、ストーリーに複数のショットが必要になった瞬間、つなぎ合わせることになります。ショット1で好きな顔が得られます。ショット2ではその顔のいとこが得られます。ショット3ではジャケットがプラムからバーガンディに静かに変わり、気づいた頃にはすでに11回のレンダリングにお金を払っています。
単一画像リファレンスは役に立ちましたが、ロックできるのは常に1つのことだけでした。顔です。顔、衣装、小道具、場所、声を同時に保持することはできませんでした。なぜなら、1つのスロットに5つの仕事があったからです。
2つの逃げ道があります。モデルにより多くのスロットを与えるか、最初からやり直すのをやめさせるかです。Wan 3.0は両方を同時に行います。そのため、2つの主要な機能は実際には1つの機能です。ネイティブの30秒テイクは、キャラクターがドリフトするためのカットがないことを意味します。20のリファレンスアセットは、固定する必要があるすべての要素が、1つのスロットを争う代わりに、専用のスロットを取得することを意味します。
これが、何もつなぎ合わせていない場合の様子です。30秒、1回の連続カメラ、ショッピングカートに乗った子供が最終的にビルボードに埋め込まれ、その後その下から歩き出てきます。
1回のパスで30秒、カットなし、サウンドトラックも同じパスで生成。出典:Alibaba公式のWan 3.0クリエイターハンドブック。
Wan 3.0マルチモーダルリファレンス内の「20アセット」の実際の意味
20は見出しの数字です。重要なのは、20がすべて同じ種類のものではないということです。Wan 3.0のオムニリファレンスは5つの入力タイプをカバーし、それぞれが出力の異なる軸を制御します。
画像はアイデンティティを制御します。 キャラクターカード、商品ショット、場所のプレート。Wan 3.0はこれをピクセルレベルの一貫性と呼び、Alibaba自身の例では、ロックは顔を超えてワードローブにまで及びます。重ねられた灰色のローブ、ストラップ付きの革のジャーキン、暗いウエストラップはすべて、3つの場所にまたがる16秒の格闘戦を生き延びます。

2枚のキャラクターカードが武術の格闘シーンを駆動し、コスチュームの詳細がフレーム間で保持される
2枚のキャラクターカードと1枚の葦原の場所プレート。ワードローブと設定はすべてのスローを通して保持されます。ここではサイレントGIFとして表示されていますが、配信ファイルには44.1kHzステレオミックスが含まれています。出典:Alibaba公式のWan 3.0クリエイターハンドブック。
音声は声を制御します。 これが「マルチモーダル」を単なるマーケティング以上のものにする部分です。キャラクターごとに音声サンプルを添付し、プロンプトにセリフを書き、画像と同じパスで、その声色で、リップシンクされたダイアログが返ってきます。2人、2つの音声リファレンス、1つのジム。
2つの被写体画像と2つの別々の音声リファレンスクリップ、ダイアログはそれらの2つの声で返ってきます。このクリップは音声をオンにする価値があります。出典:Alibaba公式のWan 3.0クリエイターハンドブック。
動画はタイミングを制御します。 リファレンス動画はコピーされるためのものではありません。そのリズムを提供するためのものです。ビートがどれだけ持続するか、トランジションがどのように動くか。この例では、5つのキーフレームが被写体を提供し、リファレンス動画がそれらの間の水平カードフリップのケイデンスを提供します。

5つのキーフレームがリファレンス動画から取られたペーシングでフリップされる_被写体用の5枚のキーフレーム画像、フリップリズム用の1つのリファレンス動画。出典:Alibaba公式のWan 3.0クリエイターハンドブック。_
ドキュメントとWebページは構造を制御します。 これが真に新しい部分です。Wan 3.0はドキュメントファイルとライブURLをクリエイティブ入力として受け入れ、ベータ版の報告では受け入れられる形式として.doc、.xls、.ppt、.pdf、.txtが挙げられています(AlphaSignal、2026年8月)。同じロジックはすでにストーリーボード画像でも機能します。1枚のボードを入力し、6つのショットを出力し、ボード自身の順序で。

1枚のストーリーボードシートが雨の駅プラットフォームで6つの連続ショットに拡張される
1枚のストーリーボードシートをリファレンスとして、6つのショットがその順序で生成され、ショット5で手渡されるメモまで。出典:Alibaba公式のWan 3.0クリエイターハンドブック。
最初と最後のフレームはエンドポイントを制御します。 最も古いトリックですが、まだサポートされており、ショットをバウンドする最も速い方法です。
これが、ほとんどの人が実際に今日使用しているバージョンとどのように比較されるかです。
| Wan 2.7 リファレンス動画 | Wan 3.0 オムニリファレンス | |
|---|---|---|
| リファレンスアセット | 被写体ごとに1枚の画像、最大3つの動画、1つの音声クリップ | 合計最大20アセット |
| モダリティ | 画像、動画、音声 | 画像、動画、音声、ドキュメント、Webページ |
| 1パスあたりの最大持続時間 | 10秒 | 30秒ネイティブ、さらにスマート持続時間 |
| 同じパス内の音声 | はい | はい |
| 動画編集と拡張 | 公開されていない | 指示およびリファレンスベースの編集、さらに拡張 |
| 利用可能性 | サードパーティAPIで利用可能 | Alibaba Cloud Model StudioおよびQwen Cloudベータ |
誰もドキュメントに書かないが、誰もが苦労して学ぶルールが1つあります。1つのリファレンス、1つの仕事。 画像1は顔と衣装をロックします。動画1はモーションのみを提供します。音声1は音色のみを提供します。1つのアセットに2つの競合する仕事を与えたり、2人が写っているリファレンス画像をアップロードしたりすると、モデルは推測する必要があり、推測はまさにあなたが止めようとしていたものです。Alibabaのハンドブックもこれについて率直です。リファレンス画像1枚につき被写体1人。
今日実行できるWan 3.0マルチモーダルリファレンスワークフロー
最初に率直な答え。Wan 3.0はAlibaba自身のクラウド上で、モデルID wan3.0-videoとしてパブリックベータ版です(Alibaba Wan、2026年8月)。まだAtlas Cloudを含むサードパーティのAPIプラットフォームには登場していません。今すぐあなたにWan 3.0 APIアクセスを販売している人は、他の何かを転売しています。
着地したのはワークフローの形状です。リファレンスパックを入力し、1回の呼び出しで、完成したクリップとサウンドを出力します。これは今日、ブラウザタブで呼び出せるリファレンス動画モデルで実行でき、すべてを並べると、20アセットの見出しは異なって見えます。
| モデル | リファレンスアセット | モダリティ | 最大持続時間 | ネイティブ音声 | 1秒あたりの価格 |
|---|---|---|---|---|---|
| Wan 3.0(Alibabaベータ、Atlasでは未対応) | 合計20 | 画像、動画、音声、ドキュメント、Webページ | 30秒 | はい | 解像度により報告された$0.05~$0.20 |
| Wan 2.7 リファレンス動画 | 被写体ごとに1枚の画像、3つの動画、1つの音声クリップ | 画像、動画、音声 | 10秒 | はい | $0.10 |
| Seedance 2.5 リファレンス動画 | 50(画像30 / 動画10 / 音声10) | 画像、動画、音声 | 30秒 | はい | $0.13 |
| MiniMax H3 リファレンス動画 | 混合、明示された上限なし | 画像、動画、音声 | 15秒 | はい | $0.10 |
| Kling Video O3 Pro リファレンス動画 | 画像7枚、または画像4枚 + 動画1つ | 画像、動画 | 15秒 | はい | $0.10 |
| Vidu Q3-Mix リファレンス動画 | 画像4枚 | 画像 | 16秒 | はい | $0.11 |
| Veo 3.1 リファレンス動画 | 画像3枚 | 画像 | 8秒 | オプション | $0.20 |
価格は2026年8月現在のAtlas Cloudレートです。Wan 3.0の数値はAlibaba Cloudベータ版について報告されたものであり、Atlasレートではありません。Alibabaはまだモデルの公開価格ページを公開していないため、その行は暫定的なものとして扱ってください。
その表を2回読むと、本当の話が浮かび上がります。20アセットの見出しはWan 3.0が優位に立つところではありません。なぜなら、Seedance 2.5はすでに50を受け入れ、30秒に一致しているからです。そのリストの他の何もPDFを受け入れません。
以下のチュートリアルでは、デモはWan 2.7リファレンス動画で実行されます。その入力形状はオムニリファレンスに最も近い現存の親戚だからです。複数の被写体画像、オプションのリファレンス動画、音声クリップ。すべてプロンプト内のcharacter1およびcharacter2ラベルにマッピングされます。3つのモデル、1つのブラウザタブ、ローカルインストールは不要です。
自分で構築する:4ステップのマルチモーダルリファレンスシーン
シーン:パステル調のホテルフロントデスク。無表情のコンシェルジュ。ラグドールキャットを抱えた旅行者。コンシェルジュはレンズの真下を見て言います。「猫は予約があります。あなたにはありません。」
2枚の画像と1つの音声クリップ。これは、2つのモダリティにわたる3つのリファレンスアセットです。これは、単なるマルチイメージではなく、正直にマルチモーダルである最小のビルドです。
ステップ1. リファレンス画像1を生成する、ロックする必要のある被写体
リファレンス画像には3つの仕事があり、それだけです。1人の被写体、カメラに向かって、クリーンな背景。それ以外はすべて装飾です。品質 high、サイズ 16:9、n=1でGPT Image 2を使用します。
Plain1中年のホテルコンシェルジュの全身スタジオポートレート、無表情、フラットなダスティピンクの壁に対して真ん中に立っている。彼はプラムパープルのダブルブレストのベルホップユニフォームを着て、金のパイピングと真鍮のボタン、小さな丸いピルボックスハット、細い口ひげ。完全に対称的なフレーミング、均一なソフトフロントライト、壁に影がない、35mmフィルムグレイン、ミュートされたパステルパレット。被写体は1人だけ、他の人はいない、テキストなし、ロゴなし、フレーム内に小道具なし。

Atlas Cloud上のGPT Image 2プレイグラウンド、出力パネルにレンダリングされたコンシェルジュリファレンスポートレート
GPT Image 2 on Atlas Cloud: 品質high、16:9、1被写体、フラット背景。これがcharacter1になるファイルです。
ステップ2. リファレンス画像2を生成する、2番目のロックされた被写体
同じモデル、同じ設定。2人のキャラクター間の色のコントラストは意図的であり、フレームを共有するときにモデルがそれらを簡単に区別できるようにします。
Plain1若い女性旅行者の全身スタジオポートレート、ふわふわのラグドールキャットを胸に抱えて、フラットなマスタードイエローの壁に対して真ん中に立っている。彼女はマスタードウールのコート、赤いベレー帽、丸い亀甲縁の眼鏡を着用し、空いている手に小さなヴィンテージレザースーツケースを持っている。完全に対称的なフレーミング、均一なソフトフロントライト、壁に影がない、35mmフィルムグレイン、ミュートされたパステルパレット。被写体は1人だけ、他の人はいない、テキストなし、ロゴなし。
ステップ3. 音声リファレンスを生成する、これが実際のマルチモーダル部分
音声クリップは、これをマルチイメージジョブからマルチモーダルなものに変えるものです。Wan 2.7の音声スロットは短いサンプル(約1~10秒)を必要とするため、セリフは短くします。MiniMax Speech 2.6 HDを使用し、低く、平坦で、気にしない男性の声を選びます。
Plain1Good evening. Checking in? Of course. Everyone is.
ステップ4. 1回の呼び出し、3つのリファレンス、1つの完成クリップ
ここで、パック全体をWan 2.7リファレンス動画に一緒に入れます。設定:resolution: 1080P、ratio: 16:9、duration: 10(このモデルの上限)、prompt_extend: false、seed: -1。imagesを順序にロードし、ステップ1を最初にしてcharacter1にマッピングし、次にステップ2をcharacter2として、ステップ3のファイルをaudioに添付します。
Plain1対称的な、真ん中のワイドショットのパステルホテルロビーフロントデスク、ダスティピンクの壁とその後ろのマスタードイエローのキーラック。character1はデスクの後ろに立っているコンシェルジュ。character2はその前に立っている旅行者、まだラグドールキャットを抱えている。カメラは完全な中心軸に沿ってゆっくりと押し出し、決して傾かない。character1はレンズの真下を見て平坦に言う:「猫は予約があります。あなたにはありません。」character2は一度まばたきし、ゆっくりと猫の方に頭を向け、次にデスクに戻す。猫は動かずにカメラを直接見つめる。35mmフィルムグレイン、均一なソフトライティング、ミュートされたパステルパレット、カメラシェイクなし、カットなし。
ネガティブプロンプト:
Plain1handheld shake, jump cuts, subtitles, on-screen text, watermark, extra people, deformed hands, face morphing, colour shift, motion blur

Atlas Cloud上のWan 2.7リファレンス動画プレイグラウンド、2枚のリファレンス画像と1つの音声ファイルがロードされ、出力パネルに完成クリップ
Wan 2.7リファレンス動画 on Atlas Cloud: 左側に2枚のリファレンス画像と1つの音声クリップが添付され、右側で完成したテイクが1080P、16:9で再生されています。このキャプチャはモデルのデフォルト持続時間で実行されました。以下の完全版では10に設定してください。
完成したクリップ。両方の顔が保持され、両方の衣装が保持され、セリフはステップ3のクローン声で配信されます。このクリップは音声をオンにして再生する価値があります。

完成したクリップのフレームと並んだ2つのリファレンスポートレート、同じ顔と衣装を示す
左側がリファレンス、右側が配信されたクリップのフレーム。ユニフォームのパイピング、ベレー帽、眼鏡、猫はすべて変換を生き延びます。
Wan 3.0マルチモーダルリファレンスワークフローのバリエーション
30秒にプッシュする。 同じリファレンスパックは、duration: 30でSeedance 2.5リファレンス動画で実行でき、ベータを待たずにWan 3.0が約束する長さを得られます。最大30枚のリファレンス画像、10の動画、10の音声クリップを受け入れるため、パックには成長の余地があります。追加の20秒は、プロンプトに「雰囲気」としてではなく、ビートとして記述します。そうしないと、モデルがパディングします。

Atlas Cloud上のSeedance 2.5リファレンス動画プレイグラウンド、持続時間を30に設定し、ロングテイクをレンダリング中
Seedance 2.5リファレンス動画 on Atlas Cloud、持続時間を30に設定し、同じ2枚のリファレンスポートレートを添付、生成中にキャプチャ。プロンプト内の@image1および@image2チップに注意:これはSeedanceにどのリファレンスがどの部分を再生するかを伝える方法です。コミットする前にRunボタンの見積もり価格を確認してください。これはジョブが実際に送信する持続時間を反映するためです。
同じシーンの30秒バージョン、同じリファレンスパック、ビートはショットごとに書き出されています。
モーションのみのリファレンス動画を追加する。 ペーシングが気に入ったクリップを添付し、プロンプトで明示的に「カッティングリズムについてはリファレンス動画に従い、被写体と設定は無視する」のように述べます。これは、上のカードフリップの例の背後にあるトリックです。
ドリフトを修正するには、ポジティブプロンプトに触れる前にネガティブプロンプトを使用する。 顔のモーフィング、色のシフト、手持ちシェイクは、リファレンスロックされたショットを台無しにする3つであり、通常は説明するよりも抑制する方が安上がりです。
マルチモーダルリファレンスフォーマットを無料で試す
パラメータの前にこの形状を試したい場合、Atlas Cloudは先週、ノブなしで同じチェーンを実行する無料AI広告スキットジェネレーターをリリースしました。
製品とそのセールスポイントについて1行書くだけで、2キャラクターのコメディスクリプト(フック、対立、どんでん返し)を書き、その後、音声ダイアログと効果音が組み込まれた15秒の動画をレンダリングします。最大4枚の実際の商品写真をリファレンスとして添付でき、広告はスクリプトから最終フレームまで、形状、色、ラベル、ロゴを保持します。6つのスタイル(面白いミームからプロットツイスト、シットコム、ラグジュアリー、ハードセルまで)が付属し、ダイアログは説明を書いた言語で返ってきます。
これは、チュートリアルの同じ2キャラクター+リファレンス画像+音声チェーンですが、プロンプト作成と請求書が不要です。そのため、このフォーマットがあなたの製品に合うかどうかを、チューニングにお金をかける前に調べるのに適した方法です。
リファレンス静止画のスタックが製品ピースに何をするかを知るには、これがWan 3.0自身のそのジョブのバージョンです。5枚の画像を入力し、1つのローンチリールを出力し、各静止画が編集の1ビートを固定します。

5枚のリファレンス静止画がマテリアルデザインスタイルの製品ローンチリールに拡張される_5枚のリファレンス画像が9秒の製品フィルムを駆動し、各画像がビートを固定し、次に引き継ぎます。出典:Alibaba公式のWan 3.0クリエイターハンドブック。_
Wan 3.0マルチモーダルリファレンスクリップのコスト
| ステップ | モデル | 単価 | 数量 | コスト |
|---|---|---|---|---|
| 1と2、2枚のリファレンス画像 | GPT Image 2 | 1枚あたり$0.009 | 2 | $0.02 |
| 3、音声リファレンス | MiniMax Speech 2.6 HD | 1,000文字あたり$0.08 | 49文字 | $0.00 |
| 4、1080Pでの10秒テイク | Wan 2.7 リファレンス動画 | 1080Pで1秒あたり$0.15 | 10秒 | $1.50 |
| チュートリアル合計 | 約$1.52 | |||
| バリエーション、30秒 | Seedance 2.5 リファレンス動画 | 480Pで1秒あたり$0.134 | 30秒 | 約$4.02 |
| 無料ルート | 無料AI広告スキットジェネレーター | 無料 | 1クリップ、15秒 | $0 |
これらはプラットフォーム自身のレートであり、2026年8月に確認され、従量課金制です。合計を人々が予想以上に動かす2つのことがあります。解像度が最初です。比較表の1秒あたり$0.10はWan 2.7のベースレートであり、1080Pは$0.15で請求されるため、上記の$1.50が発生します。2つ目は、Seedanceがピクセル数で価格設定するため、リストされている1秒あたり$0.134は480Pの数値であり、720Pのテイクは単純な掛け算よりもコストがかかることです。参考までに、報告されているWan 3.0ベータ版の1080pでの1秒あたり$0.20のレートでは、30秒のフルテイクは約$6になり、これは今日の480PでのSeedanceルートよりも高くなります。
これらを使用する際の注意事項。 Wan 3.0はベータ版であり、その条件は変わる可能性があるため、パイプラインを構築する前に再読してください。リファレンス画像が実在の人物である場合は、事前に許可を得てください。リファレンス動画はまさにそれを重要にする機能だからです。この記事の例のクリップは、Alibaba自身が公開クリエイターハンドブックから生成した結果であり、解説のためにここで再現されています。
よくある質問
Wan 3.0のマルチモーダルリファレンスは実際にいくつのリファレンスを受け入れられますか?
1回の呼び出しで最大20アセット、画像、動画、音声、ドキュメント、Webページから引き出されます。実用的な制限は技術的なものよりも低くなります。各アセットに正確に1つのジョブを割り当て、画像ごとに1つの被写体とすれば、ほとんどのシーンで20よりもはるかに少なく使用します。
Wan 3.0は本当にPDFやWebページを動画に変換できますか?
はい、それが真にユニークな部分です。テキスト、画像、音声、動画に加えて、ドキュメントファイルとライブURLを受け入れ、ベータ版の報告では.doc、.xls、.ppt、.pdf、.txtがリストされています。上記の比較表の他のリファレンス動画モデルは、ドキュメントをまったく受け入れません。
Wan 3.0はオープンソースですか?ComfyUIで実行できますか?
いいえ、そして今のところはできません。Wan 3.0はAlibaba自身のクラウド上で動作するクローズドベータです。初期のWan世代はオープンにリリースされたため、期待が存在しますが、Alibabaは3.0のウェイトを確認していません。Wan 3.0の1.3Bまたは14BのApache 2.0リリースを主張するページは、公式のものに裏付けられていません。
Wan 3.0はサードパーティのAPIからまだ利用可能ですか?
まだです。Atlas Cloudも含めて。今日呼び出せる最も近いものはWan 2.7リファレンス動画で、その入力形状はドキュメントとWebページのモダリティを除いてオムニリファレンスとほぼ正確に一致します。または、完全な30秒が必要な場合はSeedance 2.5リファレンス動画です。
リファレンスロックされた2キャラクター動画をテストする最も安い方法は何ですか?
上記のリンク先の無料AI広告スキットジェネレーター。4枚のリファレンス写真を入力し、15秒の音声付き2キャラクタークリップを出力します。パラメータも費用もかかりません。製品とフォーマットが保持される場合は、有料チェーンをチューニングしてください。
リファレンス画像を使用しているのに、なぜキャラクターはまだドリフトするのですか?
3つの原因、頻度順。1つのリファレンスが2つのジョブを担っているため、顔と場所の両方を修正するように求められている。リファレンス画像に複数の人物や忙しい背景が含まれているため、モデルはどの部分をロックするかわからない。または、ドリフトはリファレンスの失敗ではなくレンダリングアーティファクトであり、その場合は何かを書き直す前にネガティブプロンプトにface morphing, colour shiftを入れてください。






