Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

Wan 3.0 プロンプトの書き方:3つの公式事例が教える、パラメータリストでは得られないこと

Wan 3.0のプロンプトの書き方:公式の30秒ケースからリバースエンジニアリングされた三層構造、パフォーマンスライティング、サウンドシンタックス、モーションコントロール

Wanラインは、インターネット上で最もフォークされたオープン動画ファミリーです。Wan 2.2とWan 2.1のリポジトリはそれぞれ約17,000スターを獲得しており(GitHub、2026年8月)、Wan-AIページはチェックポイント全体で月に数十万ダウンロードを動かしています(Hugging Face、2026年8月)。そのため、Wan 3.0がネイティブ30秒生成、最大20の参照入力、画像と同じパスで生成される音声を備えてアーリーアクセスに入ったとき、最初の疑問は「人々が使うかどうか」ではありませんでした。それは「誰もそれに向けて書き方を知っているかどうか」でした。

なぜなら、30秒の単一生成は5秒のクリップの拡大版ではないからです。それは別の書き方の問題です。5秒のプロンプトは動く絵を説明します。30秒のプロンプトは時間を指示します:誰が変わるか、いつ、どのカットで、その下にどんな音が流れるか。

アーリーアクセスとともに配布されているWan 3.0クリエイターハンドブックは、19の公式プロンプトと結果のケースを収録しています。私はその19すべてを研究し、最も転用可能なテクニックを教えてくれる3つを選び、それぞれを分解しました:プロンプトが実際に制御しているもの、なぜそのように構築されているか、そして自分のショットでその骨格を再利用する方法。以下の各動画は、議論中のケースの実際の未編集出力です。オリジナルのケースプロンプトは中国語で書かれていますが、ここでの骨格はその構造の英語による言い換えであり、Wanラインは両方の言語のプロンプトを受け付けます。

重要なポイント

  • 長いWan 3.0プロンプトは共通のアーキテクチャを持っています:最初に参照バインディング、次にグローバルルール、最後にタイムスタンプ付きのショットリスト。短いテストプロンプトはレイヤーを省くことができますが、プロダクションプロンプトは省くべきではありません。
  • パフォーマンスは可視的なアクションの連鎖として書き、感情ラベルとしては決して書かないでください。「不安」は願望です。「噛む速度が遅くなり、眉が寄り、視線が手元に落ちる」は指示です。
  • サウンドはプロンプトの一部であり、ポスト工程ではありません。ダイアログは中括弧で囲み、効果音や音楽は独自の文で書き、無音は明示的に要求する必要があります。
  • 公式ケースは最も重要な制約を繰り返し、予想される失敗を禁止します。あるハンドブックのプロンプトは「スムーズな滑走」を異なる3つの言い回しで禁止しています。なぜなら、モデルはデフォルトでスムーズになるからです。
  • 動きは定量化できます:バーストあたりのフレーム数、ダッシュあたりのフレーム幅のパーセント、繰り返し回数。以下のトンボのケースがその証明です。

一回の生成、30秒、10の番号付きストーリーボードビートとフルスコアアークを単一のプロンプトに書き込んだもの:漁船、嵐、そして時間通りに浮上する海の怪物。公式Wan 3.0ハンドブックケース、未編集のまま表示。

Wan 3.0プロンプトを書くことの何が違うのか

3つの能力が仕事を変え、それぞれが短いモデルがこれまで要求しなかった書き方のスキルを追加します。

ネイティブ30秒は構造を意味します。 モデルが5秒をレンダリングするとき、プロンプトは1つの密な文で済みます。30秒では、構造化されていないプロンプトは漂流します:キャラクターが服を交換し、カメラがルールを忘れ、エンディングが始まりと無関係になります。ハンドブックの長いケースはすべて、明示的な段階と終了状態で漂流と戦っています。この構造がこのガイドの核心です。

ジョイントオーディオはサウンドディレクションを意味します。 Wan 3.0は映像とともにサウンドトラックを生成します。ダイアログ、効果音、アンビエンス、音楽はすべてプロンプト可能であり、つまり、書かれていないサウンドトラックは即興のものになります。公式ケースは、オーディオを光と同じ規律で扱います:述べられ、スコープされ、時には意図的に沈黙されます。

最大20の参照はバインディング構文を意味します。 顔、衣装、場所、声、さらにはストーリーボード画像もアップロードされた素材に固定できます。ハンドブックのケースは、各参照を一度名前付きサブジェクトにバインドし、その後すべての後のショットでその名前を再利用します。現在の世代で同じ規律をテストしたことがあるなら、たとえばWan 2.7参照から動画で、3.0バージョンは新しいものではなく親しみやすく感じられるでしょう。

これは毎回小説を書くことを要求するものではありません。ハンドブックの最短の優れたケースは、手描きスタイルで牛を盗むUFOについての一文です。スキルは、自分のショットにどのレイヤーが必要かを知ることであり、それがまさに以下の3つのケースの目的です。

Wan 3.0プロンプトスタック:すべての長いケースが共有する3つのレイヤー

19の公式ケースを骨格まで削ると、長いものはすべて同じ3つのレイヤースタックです。

レイヤー1: 参照バインディング。 アップロードされた素材ごとに1行で、それが何であり、そこから何を取るかを述べます。画像1の女性をサブジェクト1と定義します。画像2からは衣装のみを取ります。サブジェクト2の声はオーディオ1に従います。一度バインドし、その後は名前で永遠に参照します。「画像がキャラクターを定義する」のような曖昧な複数形は、まさにこのレイヤーが防ぐものです。

レイヤー2: グローバルルール。 クリップ全体で真実であり続けなければならないすべてのこと。アクションの前に書かれます:ビジュアルスタイルとその参照点、名前付きのカラーシステム、ライトの振る舞い、カメラ文法、パフォーマンス規律、オーディオ規律、そして禁止された失敗のリスト。このレイヤーは、ハンドブックのケースで最も攻撃的です。ある格闘技ケースは、スローモーションを2回、各1秒未満に制限し、画面上の字幕を禁止し、背景音楽を完全に禁止し、カメラが1.5秒以上静止することを禁止します。

レイヤー3: タイムライン。 タイムスタンプ付きまたは番号付きのビート。それぞれが1つのメインイベントと可視的な終了状態を持ちます。「彼らはしばらく戦う」ではなく「0~1.5秒:彼は葦の線に立ち、逆光、コートに風が吹き、一言を言う」。終了状態は、15秒目を5秒目と一貫させるものです。

頭の中に保持する便利な方法:レイヤー1はキャスティング、レイヤー2はルールブック、レイヤー3はショットリスト。以下に続く3つのケースは、それぞれが1つのレイヤーを最も強調しています。

ケース1:パフォーマンスのためのWan 3.0プロンプトの書き方、30秒間1つの顔

ハンドブックの中で最も派手でないケースは、ほとんどの人が最初に学ぶべきものです:青い卒業ガウンを着た若い女性の単一の固定クローズアップ、30秒間保持され、彼女が話し、心配し、最後に自分の手を見下ろします。

30秒、ワンショット、カットなし。ガウンがシーンを伝え、眉が賭け金を伝え、視線の落下はプロンプトが置いた正確な場所に着地します。公式ハンドブックケース、未編集出力。

公式プロンプトが何をするか、動きごとに、私の言葉で:

  1. 被写体の前にカメラ。 フレームをロックして始まります:正面クローズアップ、頭と上半身、そして1つの意図的な不完全さ、左端に完全にぼかされた2人目の人物。背景を名前で指定してぼかせば、モデルはショット途中でシャープにしません。
  2. 衣装を説明として。 1つの青い卒業ガウンが、シーン設定の段落を置き換えます。モデルは式典、群衆、日を推測します。世界を暗示する1つの衣服や小道具を選び、世界の説明をスキップします。
  3. 感情を可視的な行為の連鎖として。 プロンプトは決して「不安」を要求しません。彼女が話すときの口の動き、わずかに編まれた眉、真剣な表情を書きます。各項目はカメラが検証できるものです。感情ラベルは願望です。筋肉の動きは指示です。
  4. リアリズムを売るマイクロムーブ。 2つの詳細が他のすべてを合わせた以上に効果を発揮します:カメラがかすかな手持ち呼吸の揺れを保持し、彼女の視線が前方から自分の手元へ、指定された軌道で移動します。どんな長いテイクにも、そのようなゆっくりとした意図的な変化を1つ与えれば、ショットは生成されたものではなく、ディレクションされたものとして読まれます。

再利用可能な骨格、英語で、ケースと同じ構造:

Plain
1正面 [ショットサイズ] で [被写体]、[フレーミング詳細]。ぼかした [要素] がフレームの [端] にあります。[被写体] は [シーン全体を暗示する1つの衣服] を着ています。[被写体] は [アクション] をしており、口が動き、[眉/目/顎の詳細]。光は [方向] から落ち、[肌/布地の質感のメモ] を保ちます。カメラはロックされていますが、かすかな手持ち呼吸の揺れを帯びています。ショット全体を通して、[1つのゆっくりとした可視的な変化:視線の軌道、姿勢の変化、下げられた物体]。

そのテンプレートを自分の被写体で埋めてから、30秒の叙事詩に触れてください。顔が30秒間保持されるなら、あなたの構造は健全です。

ケース2:ディレクターのように30秒のWan 3.0プロンプトを構造化する方法

ハンドブックの不条理な短編は、文書全体で最高の構造的教材です:カウガールが本物の馬に乗って寂れたルート66のガソリンスタンドに乗り込み、ポンプを手に取り、馬に新鮮な草を補充する一方、店員の世界観が静かに崩壊します。

30秒の無表情なセットアップと1つの完璧な視覚的ギャグ。コメディは構造に書き込まれています:固定された観察的フレーミング、その後、不条理なことが起こるまさにその瞬間に突然の極端なクローズアップ。公式ハンドブックケース、未編集出力。

そのプロンプトは5つの名前付きモジュールとして整理されており、モジュールリスト自体が教訓です:

  1. ログライン。 何が起こるか、ジョークは何かという2文。ビジュアルではなく、ストーリー。これを最初に書くことで、30秒が何のためかを知ることを強制されます。
  2. 名前付きカラーシステム。 「カラフル」ではなく、2色の法則:ティールの空とオレンジの大地、そしてすべての主要なオブジェクトをその一方に割り当て、色あせた赤いポンプ、オレンジのスカーフ、テラコッタの山々。システムを命名し、それを分配します。AI動画における一貫性は、通常、キャラクターの問題よりもパレットの問題です。
  3. ナラティブジョブを持つキャストリスト。 各キャラクターは2つまたは3つの可視的な特性と、決定的に、機能を得ます:店員は明示的に映画のリアクションショットキャリアとして指定されます。ジョブを割り当てることで、モデルにそのキャラクターが現れるすべてのビートでカメラの注意がどこにあるべきかを伝えます。
  4. 名前付きカメラ哲学。 ケースはルールを発明し、それを1行で定義します:冷静な観察と不条理なクローズアップ。つまり、デフォルトとして固定ミッドショットとスローパン、不条理なイベントが発生したときだけ突然の極端なクローズアップで中断されます。カメラルールを命名してから参照することは、すべてのビートでカメラムーブを再記述するよりも優れています。それはまた、コメディのメカニズム全体でもあります:平坦な視線が、草ポンプのクローズアップを着地させるのです。
  5. 終了状態を持つ4幕タイムライン。 セットアップ、エスカレーション、パンチライン、余波、それぞれに時間範囲、1つのメインイベント、そして凍結された最終画像、最後のビートで店員の口からついに落ちる爪楊枝まで。

転用可能なモデルはコメディよりも大きいです。ログライン、パレット法、ジョブ付きキャスト、1つの名前付きカメラルール、終了状態を持つ4幕:それはプロダクションブリーフであり、Wan 3.0はこのファミリーで初めて、30秒という十分な滑走路を持つ世代で、ブリーフが重要になるのです。この記事の冒頭にある海の怪物のショーケースは、スコア付き音楽アークを持つ10ビートの同じ骨格であり、同じ方法で書かれています:各ビート1イベント、各ビート可視的な終了状態。

ケース3:Wan 3.0プロンプトにモーション物理を書き込む

どんな動画モデルからも得るのが最も難しいのは、スムーズでない動きです。モデルは優しく連続的な動きに平均化する傾向があり、そのためすべてのAI妖精はスローバルーンのように浮遊します。ハンドブックの妖精は浮遊しません。彼女はトンボのように動きます:デッドホバー、瞬時ダッシュ、デッドストップ、新しい方向。

カーペットの上に浮かぶ、ピンクの髪と翼を持つ小さな妖精

ホバー、ダッシュ、ハードストップ。各バーストの中央のブラーは1~2フレーム幅で、まさにプロンプトが予算化した通り。公式ハンドブックケース、サイレントGIFで表示。配信されたクリップは独自のアンビエンスを持ちます。

このプロンプトは、直接持ち上げられる4つのテクニックで勝ちます:

  1. 優先宣言を先頭に。 最初の行は、どんな景色よりも先に、単一の最優先要件、つまりトンボの動きの法則を宣言します。注意は予算です。成功を決めるルールに冒頭のトークンを使い、カーペットの色には使いません。
  2. 現実世界の物理的アンカー。 「速くて機敏」のような形容詞の代わりに、プロンプトはモデルが何千回も見た動きのシグネチャーを持つ動物、つまりポイントホバー、バースト発射、フルストップ、シャープリターゲットを名前で指定します。1つの馴染みのあるアンカーは、10の抽象的な副詞より優れています。
  3. 形容詞がぼやける場所に数字を。 ダッシュは3~5フレーム以内にフレーム幅の60~90%を横切らなければなりません。ストップは2~4フレーム保持しなければなりません。最初の8秒間に少なくとも6つの明確に分離されたバーストが発生しなければなりません。残留モーションブラーは1~2フレームと予算化されています。この時点で詩を書いているのではなく、仕様を書いており、モデルはそれを尊重します。以下のストリップを見てください:ダッシュ中のフレームは純粋なストリークであり、その両側のフレームはピンシャープです。
  4. デフォルトを禁止する。 プロンプトは予測する失敗を明示的に禁止し、複数の言い回しで:スローな妖精の浮遊なし、等速巡航なし、連続的なスムーズな滑走なし、そして動きが何でないかを言う修正文「連続的な飛行経路ではなく、短く鋭い、ほとんどフレームをスキップするような変位」。モデルが自動操縦で何をするかを知っているなら、その自動操縦をショットから書き出します。

テディベアやカラフルなブロックの間を飛ぶピンク髪のおもちゃの妖精

トンボケースからの4つの連続スチル:テディベアのそばでホバー、ダッシュ中のモーションブラー、ブロックの上に到着、デッドストップホバー

上記の出力からの4フレーム。シャープ、ストリーク、シャープ、シャープ:プロンプトからのブラー予算がフレームごとに可視。

同じ4つの動きは、あらゆるモーション問題に一般化できます:カットになってはいけないホイップパン、重量を必要とするインパクト、有機的になってはいけない機械的動き。アンカー、定量化、優先順位付け、そしてデフォルトを禁止する。

Wan 3.0プロンプトにおけるダイアログ、サウンド、参照構文

上記の3つのケースは、Wan 3.0プロンプトを話させるメカニクスについては沈黙しているので、ここにハンドブックの残りのケースからコンパイルされた構文レイヤーを示します。

ダイアログは中括弧に入れます。 話されるセリフは、{今日はどの筋肉群}のように、オープンな散文のままにせずにラップします。これにより、モデルがダイアログをキャプションとしてナレーションするのを防ぎます。セリフはリップシンクで着地し、ダイアログシーンは、台本のように、アクションと中括弧で囲まれたセリフを交互に書きます。

声はキャストできます。 参照構文はオーディオに拡張されます:画像1の女性をサブジェクト1と定義し、次にサブジェクト1の声はオーディオ1に従うと述べます。あるファイルからの顔、別のファイルからの声、両方とも期間中ロックされます。

オーディオには規律ステートメントが必要です。 最も強いケースは、パレットを宣言するのと同じようにサウンドスケープを宣言します。アニメーションケースは、そのオーディオタイプを前もって述べます:アンビエンスと音楽のみ、スピーチなし。格闘技ケースはさらに進み、背景音楽を完全に禁止し、呼吸、布の摩擦、打撃、風だけを残し、そしてまさにそれを得ます。音楽が望まれるときは、タイムライン全体にわたるアークとして書かれ、低い恐怖のドローンから弦のエスカレーション、金管のインパクト、長いドームノートへと、それがヒットしなければならないビートにマッピングされます。

沈黙もリクエストです。 プロンプトがない場合、モデルはトラックを埋めます。ショットにルームトーンと1つのサウンドイベントだけが必要なら、そう言ってください。Wan 3.0におけるサウンドディレクションは飾りではありません。それはメディアの後半部分です。

今日Wan 3.0プロンプトの公式を練習する場所

Wan 3.0はまだ登場しておらず、ユーザーは今すぐに使えません。それでも上記の構造は今でも積み重なります。なぜなら、その中の何もバージョンロックされていないからです:バインディング、グローバルルール、タイムライン、中括弧で囲まれたダイアログ、禁止されたデフォルトはすべて、現在のWan世代で動作します。

Wanファミリー全体は現在、Atlas Cloudで利用可能です:Wan 2.7テキストから動画、画像から動画、参照から動画、そして動画編集が、1つのキーで、実行前に実行ごとの価格が表示されます。実践的なドリル:ケース1の骨格を取り、自分の被写体で埋め、Wan 2.7テキストから動画で短いテイクとして実行します。パフォーマンスの連鎖がそこで保持されれば、同じファイルがWan 3.0のドラフトとして初日から使え、期間を書き直すのではなくダイヤルアップするだけです。Atlas Cloudは、このファミリーがアップデートされたときにDay-0アクセスを提供する習慣があるため、練習環境と目的地は同じページになる可能性が高いです。

よくある質問

Wan 3.0プロンプトはどれくらいの長さにすべきですか?

ショットが必要とする長さであり、それ以上ではありません。公式ハンドブックは、一文の手描きUFOギャグから、10ビートのモンスター映画のための1000語以上のプロンプトまでさまざまです。決定変数は持続時間とキャストサイズです:5秒の単一被写体テストは1つの密な文が必要、30秒の複数キャラクターストーリーは3つのレイヤーすべて(バインディング、グローバルルール、タイムライン)が必要です。

Wan 3.0はプロンプトからサウンドを生成しますか?

はい、オーディオは画像と同じパスで生成されます。ダイアログは中括弧で書かれ、リップシンクで着地します。効果音とアンビエンスは散文として書かれ、音楽はタイムライン全体にわたるアークとして指示できます。規律は両刃の剣です:ニアサイレンスやスコアなしのアンビエンスが欲しいなら、そう言わなければなりません。さもなければモデルは自分でトラックを埋めます。

Wan 3.0プロンプトの中括弧構文とは何ですか?

中括弧はキャラクターが声に出して話す言葉をマークします。例:{フィニッシュラインで会おう}。ダイアログを中括弧内に保つことで、シーン説明から分離され、モデルはそれを説明するのではなく実行します。多言語作業では、セリフの前に言語と配信スタイルを述べてください。

30秒のWan 3.0動画全体で1つのキャラクターを一貫させるにはどうすればいいですか?

キャラクターを一度参照にバインドし、スコープを指定します:画像1の人物をサブジェクト1と定義し、顔、髪、衣装のみを取ります。その後、サブジェクトの名前を彼らが現れるすべてのタイムラインビートで繰り返し、衣装に隣接するアクションや照明の変化など、リスクの高い瞬間に2つまたは3つのロックされた特性を言い直します。ハンドブックの格闘シーンケースは、モジュールごとに特性ロックを言い直すことさえしており、これはベルトとサスペンダーのバージョンです。

Wan 3.0プロンプトの書き方は、アクセスがある前に練習できますか?

はい、そしてそうすべきです。3層構造、中括弧で囲まれたダイアログ、参照バインディング、禁止されたデフォルトテクニックはすべて、現在のファミリーで今日動作します。Atlas Cloud上のWan 2.7は、テキストから動画、画像から動画、参照から動画、動画編集を1つのキーでカバーしているため、そこで証明されたテンプレートは、書き直しではなく持続時間の変更として3.0に転送されます。

結論

19の公式ケースは、同じことを3つの異なる方法で言っています:Wan 3.0プロンプトはプロダクション文書であり、キャプションではありません。参照をキャストし、スタイルを立法化し、ビートをスケジュールし、サウンドを画像の半分として扱います。卒業式クローズアップの骨格から始め、5モジュールのブリーフに進み、フレーム予算化されたモーションスペックはそれを必要とするショットのために取っておきます。モデルは変わり続けるでしょう。絵を説明するのではなく時間を書くという規律は、あなたが保持できる部分です。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索