MiniMax H3 Developer 提供開始 — 60%オフ、1秒あたりわずか$0.02から

Wan 3.0 ダンスモーションの一貫性を、伝統舞踊とベリーダンスの30秒間でテスト

Wan 3.0がAIダンスモーションの劣化を解決するかどうかをご確認ください。30秒間の連続ベリーダンスとペアダンスを、未編集動画テスト、劣化タイムライン、プロンプトを用いてベンチマークしました。

Wan 3.0 ダンスモーションの一貫性を、伝統舞踊とベリーダンスの30秒間でテスト

長尺のAIダンス生成は、8秒目あたりで手足が溶け始めると、たいてい絶望的な結果に終わる。Wan 3.0のネイティブ出力による実環境テストでは、モーション保持が大幅に向上し、30秒間の連続レンダリング全体で身体の解剖構造とキャラクターの同一性が維持されることが確認された。

今回のWan 3.0ダンスベンチマークでは、厳格なゼロ編集制約のもとで2種類の長尺ダンススタイルを評価し、モデルが複雑な衣服物理、複数被写体の追跡、ネイティブカメラ安定性のバランスをどのように取るかを検証した。その結果、平均スコアは5点満点中4.2点を獲得した。

    
ダンス スコア時間的安定性主なアーティファクト
ベリーダンス ベールテスト4.6 / 5顔の同一性保持が高く、360°ベールの物理挙動もクリーン24秒以降に軽微な床面摩擦の喪失と指の形状軟化
伝統的ペアダンス3.8 / 5完全なオクルージョン下でも2人キャラクターの同一性ロックは完璧意図しないジャンプカットによるフレームのちらつきとライティングポップ

このテストにより、Wan 3.0が長尺生成時の深刻なAIビデオのモーション劣化に耐えることが確認された。従来の動画生成モデルは複雑な関節運動を溶かしていたが、Wan 3.0は30秒間のフルAIダンス動画全体で構造的アライメント、顔の同一性、衣服のダイナミクスを維持する。

テスト方法論:連続モーションロジックと解剖学的保持の評価

ほとんどのAIビデオベンチマークは、3秒に切り詰めたクリップや複数テイクからのいいとこ取りで、高い失敗率を隠している。真の物理的安定性を評価するため、当社のWan 3.0ダンステスト方法論は厳格なゼロ編集プロトコルを採用している。このテストで評価されたすべての出力は、ポストプロダクション修正なしのシングルショット動画生成による30秒間のフル尺の生出力である。

標準化された生成制約

コアモデルの物理挙動を切り分けるため、すべての実行パラメータを固定した:

  • 解像度と速度: 1080pネイティブ出力を毎秒24フレームでレンダリング。
  • シード制御: 比較プロンプト実行全体でシード値を固定。
  • モーション制御: ベースラインのモーション強度設定はデフォルト値0.50で維持。
  • ポストプロセッシング: 時間的カット、ステッチング、速度調整は一切なし。

主要評価の柱

  1. 解剖学的完全性: 高速ピボット動作における指の本数、手首の関節構造、顔の幾何学形状を追跡。
  2. 物理とモメンタム: シルクスリーブやベリーダンスベールなどの流動的な衣服における重心移動と重力反応を測定。
  3. 空間的連続性: 360度回転と複数被写体のオクルージョン中におけるモーションを通じた同一性の一貫性を評価。

このフレームワークにより、単なる短時間の視覚的トリックと真の時間的推論を区別する、再現可能なAIダンス生成ベンチマークが確立される。

テストケース1:ベリーダンスの流動性、トルソー分離、布地物理

従来の動画モデルで長いドレープやスローモーションの布地操作をプロンプトすると、布の破れ、手のメッシュクリップ、薄手の織物越しの顔の歪みなどが発生するのが常だった。当社のWan 3.0ベリーダンステストを実行したところ、モデルが30秒の連続タイムライン全体で、連続的なベールのレイヤリング、手と顔のオクルージョン、回転する衣服のモメンタムをどれほど効果的に処理できるかが明らかになった。

注記: 以下の動画クリップはすべて、Atlas CloudのWan 3.0 Image-to-Video 経由で生成された未編集の生出力である。1080p、30秒、1レンダリングあたり$4.80。

動画の先頭フレーム画像:

Wan 3.0によるベリーダンス動画の先頭フレーム画像

プロンプト設計:

Wan 3.0によるベリーダンス動画のプロンプト

動画出力:

モーションのリアリズムとベールのオクルージョンの評価

高速なカメラ切り替えに頼らず、モデルは意図的なスローテンポの振り付けと全身スピンを通じてフレーム安定性を維持する。このテストは、Wan 3.0がレイヤードされた透明テキスタイルと至近距離の指追跡を、視覚的アーティファクトなしで処理する方法を示している。

   
動作要素観察されたモーション挙動スコア
ベースライン姿勢とフレーム保持広く広げたベールを維持する初期姿勢が非常に安定し、背景のちらつきゼロ4.9 / 5
手の形状と顔のオクルージョンゆっくりとした蛇のような腕のうねりで、顔にベールを重ねながら指5本を明確に維持4.4 / 5
回転時における布地物理シースルーのシルクベールが360度スピン中の角運動量に正確に反応4.6 / 5

衣服のダイナミクスと衝突挙動

30秒の連続レンダリングから得られた主な物理的観察結果は以下のとおり:

  • 静的ベースラインロック(0〜13秒): モデルはステージスポットライトの下で両腕を広げた初期ポーズをアンカーし、ベドラ衣装のビーズテクスチャの明瞭さを、マイクロフリッカーや姿勢ドリフトなしで維持する。
  • 指の完全性とレイヤードオクルージョン(14〜23秒): ダンサーがシアーブルーのベールを顔と胸に巻き付ける間、個々の指関節の関節構造が保たれる。高い追跡安定性により、手の形状が顔のメッシュに融合したり、布地テクスチャに溶け込んだりするのを防ぐ。
  • 遠心力による衣服のモメンタム(24〜29秒): シルクベールは、360度のフル回転中に現実的な遠心力で広がる際、皮膚や髪を突き抜けることがなく、停止時にはスムーズに肩に掛かる。

こうしたクリーンな布地のラップと安定した顔追跡により、Wan 3.0は長尺AIレンダリングに典型的なフレーム破れを起こさずに、レイヤードテキスタイルの動きを処理できることが確認された。

テストケース2:伝統的ペアダンス、2人の身体接触、空間的オクルージョン

2人のダンサーを1ショットでレンダリングすると、通常は数秒以内にAIビデオモデルが破綻し、手足が融合したり、スピン中に一方のパフォーマーがもう一方のダンサーの衣装を奪い取ったりする。伝統的な2人組のデュエットを特徴とするWan 3.0ペアダンスのテストでは、モデルが複雑な空間的相互作用、衣服の重なり、複数被写体の追跡をどのように処理するかが明らかになる。

動画の先頭フレーム画像:

Wan 3.0による伝統的ペアダンス動画の先頭フレーム画像

プロンプト設計:

Wan 3.0による伝統的ペアダンス動画のプロンプト

動画出力:

複数被写体追跡と空間的オクルージョンのパフォーマンス

当社のテストでは、伝統的なGuofeng AIダンス動画において、赤と青の対照的な漢服を着た2人のパフォーマーが、30秒の連続テイクで同期したスピンとスリーブ操作を実行した。

   
複数人メトリクス観察されたモデル挙動スコア
2キャラクターの同一性ロック赤と青の漢服のディテールがすべてのカメラカットを通じて明確に維持4.7 / 5
空間的オクルージョンからの回復赤のダンサーの背面ターン(12〜17秒)後、背景のダンサーがクリーンに回復4.3 / 5
カメラ連続性とトランジション頻繁なネイティブジャンプカットにより、突然のフレーミングジャンプと軽微な光のちらつきが発生3.2 / 5

衣服の交差と時間的欠陥

  • オクルージョン全体での同一性ロック(0〜17秒): 赤のダンサーが振り返り、青のダンサーを完全に視界から遮ったとき(12〜16秒)、モデルは隠れたダンサーをシームレスに回復し、正確な顔の幾何学、髪飾り、青い漢服の縁取りを維持した。
  • スリーブのダイナミクスと分離(18〜23秒): 重なり合う水袖が胸元のラインを通過する際、テクスチャの融合、布の破れ、色のにじみは発生しなかった。
  • ネイティブジャンプカットとライティングポップ(1秒、11秒、23秒): 単一の連続テイクに留まらず、Wan 3.0はカメラアングルを切り替える傾向がある——たとえば11秒目にタイトな背面カットを強制するように。こうした急激な切り替えはリズムを壊し、一時的なライティングポップとフレームのスタッターを引き起こす。

クリエイター向け注記: Wan 3.0は複数被写体の同一性ロックを非常に得意とする一方、連続したフレーミングを固定するには、カメラのジャンプカット、突然のシーン切り替え、ライティングポップなどの明示的なネガティブプロンプトが必要であり、意図しないアングルカットを防ぐことができる。

30秒間の時間的劣化タイムライン:0秒から30秒までの解剖学的完全性の追跡

30秒のAIダンスクリップを生成すると、20秒あたりで潜在的な劣化が現れるのが常で、足が床との摩擦を失い、指が軟化する。テストレンダリングを分析すると、Wan 3.0が拡張タイムライン全体で劣化をどのように管理しているかが明らかになる。

0〜10秒:ベースラインロックと静的安定性

最初の10秒間、Wan 3.0は低速度のポーズでシャープなエッジ定義とドリフトゼロを実現する。

  • 足のアンカリング: 静的スタンスと繊細なハンドパス中、足はステージ床とのしっかりとした摩擦を維持する。
  • 衣装のシャープネス: メタリックフリンジ、シルクドレープ、髪飾りは、マイクロフリッカーなしで鮮明な高周波ディテールを保持する。
  • 解剖学的完全性: 顔の特徴と指の本数は100%ロックされている。

10〜20秒:マイクロ劣化とフレーミングカット

10秒から20秒の間、体の核となるメカニクスはしっかりと維持されるが、モデルが生成するカメラジャンプにより一時的なトランジションアーティファクトが発生する。

  • オクルージョンパフォーマンス: ゆっくりとした顔と胸へのベールラップ中も指の形状は無傷(ベリーダンステスト)。
  • 意図しないフレーミングカット: デュエットテストの11秒目に発生した背面カットのような突然の視点切り替えにより、一時的なライティングポップが発生するが、キャラクターの同一性はロックされたまま。

20〜30秒:ターミナルリミットと床面摩擦の喪失

最後の10秒間で、Wan 3.0のモーションバジェットの限界が露呈する。

  • 回転時のフロアスライディング(24〜28秒): 全身スピンと2人での回転中、足が木製ステージとの機械的摩擦を失い、微妙な「アイススケート」のような床滑りが発生する。
  • 同一性の分離: 床滑りやカメラ切り替えにもかかわらず、顔の幾何学形状は最初のフレームと完全に同一。

Wan 3.0は後期段階のモーション劣化——特に20秒以降の床面摩擦の喪失——に対して完全に免疫があるわけではないが、物理的ドリフトから顔の同一性を隔離する能力は、真の世代的な飛躍を示している。クリエイターにとってこれは、25秒付近での全身スピンをミディアムフレーミングや短いポストプロダクションカットで管理すれば、長尺レンダリングが引き続きプロダクション利用可能であることを意味する。

Wan 3.0で安定したAIダンス生成を行うためのコピペ用プロンプトレシピ

Wan 3.0に「女性が踊っている」のような単純なリクエストを入力すると、通常はカオスなカメラスイングとアンカーされていない手足のスピンが発生する。予測可能な30秒のモーション連続性を実現するには、構造化された空間的手がかり、正確な解剖学的モーション記述子、および包括的なWan 3.0プロンプトエンジニアリングの原則に基づくカメラ制約構文が必要である。

このWan 3.0ダンスプロンプトガイドは、シングルショット生成用に最適化された実証済みのAIダンス動画プロンプトレシピを提供する。

マイクロアイソレーションレシピ:ベリーダンスパラメータ

チェストアイソレーションやヒップシミーなどのマイクロムーブメントをプロンプトする場合は、不要な全身スピンを防ぐために、まずカメラ距離を指定する。

  • ポジティブプロンプトテンプレート:

    アイレベルからのミディアムショット、スタティックなロックオフフレーミング。黒髪を低い位置でお団子にまとめたプロの女性ダンサー。銀色のコインフリンジで縁取られた、宝石をちりばめた装飾的なロイヤルブルーのベドラを着用。暗い木製ステージで、足を床面にしっかりと固定して、連続的なベリーダンスルーティンを披露する。シアーロイヤルブルーのシルクベールを操りながら、コントロールされたトルソーアイソレーション、繊細なチェストのうねり、流動的なスネークアームウェーブを実行する。自然な布地のモメンタム、浅い被写界深度、暖かみのあるボリュメトリックなステージスポットライト、視点の切り替えのない30秒の連続テイク。

  • 実行上の重要ポイント: ベリーダンスプロンプトパラメータに「トルソーアイソレーション」や「リズミカルなヒップシミー」などの正確な動作用語を使用し、注意メカニズムを広範な手足の動きではなく、コアとなるトルソーのグリッド座標に強制的に集中させる。

複数被写体の振り付けレシピ:Guofengペアダンス

2人を単一のフレーズにまとめて説明すると、デュアルキャラクター生成は失敗する。衣装の色と明示的な空間的位置によってパフォーマーを分離する。

  • ポジティブプロンプトテンプレート:

    フルボディショット、ワイドアングル。木製ステージで伝統的な中国のGuofengデュエットを披露する2人の女性ダンサー。左のダンサーは長く幅広い袖の赤い漢服を着用し、右のダンサーは青い漢服を着用。同期したスリーブスピン、ゆっくりとした手をつないでのターン、エレガントな重心移動、優雅なフットワーク。彼女たちの円運動に追従するスムーズなカメラトラッキングショット。リッチなステージライティング、明確な空間的奥行き、30秒の連続ロングテイク、フォトリアリスティック。

  • 実行上の重要ポイント: このGuofengダンスプロンプト例は、各パフォーマーを明確な色分けされた衣装でアンカーし、空間的クロスオーバーターン中の同一性の一貫性をロックする。

ダンス安定性のための必須ネガティブプロンプト

急激な速度変化中の物理的歪みを防ぐには、以下のターゲットを絞ったWan 3.0ダンス用ネガティブプロンプトを適用する:

  
対象アーティファクト推奨ネガティブキーワード文字列
手足・関節の歪みmerged limbs, extra arms, floating feet, joint dislocation, melted hands, fused fingers
時間的不安定性jittery frame interpolation, sudden camera cuts, morphing clothing, flickering fabric
モーションアーティファクトfloor sliding, ice skating feet, sudden motion blur, unnatural body warping

これらの構造化レシピを使用することで、Wan 3.0はカメラジッターではなくリズミカルな動きにモーションバジェットを割り当てることができる。

クリエイターワークフロー:ネイティブ30秒とマルチカット編集の使い分け

30秒のミュージッククリップをレンダリングするのに何時間も費やした挙げ句、22秒目でパフォーマーの足が床摩擦を失っていることに気づく——これはデジタルビデオパイプラインにおける大きな悩みの種だ。途切れのないテイクとモジュラーカットのどちらを選ぶかは、ターゲットプラットフォームと動作テンポに依存する。

戦略的パイプラインの選択:ネイティブ30秒 vs マルチカットAIダンス

ネイティブ30秒 vs マルチカットAIダンス戦略のトレードオフを理解することで、ショートビデオフォーマット全体で視覚品質を維持しながら、GPUレンダーバジェットを最適化できる。

    
制作アプローチ最適なコンテンツフォーマット主な技術的利点既知の制限
ネイティブ30秒テイク雰囲気重視のGuofengダンスリール、シネマティックなロングテイク、ソロショーケース途切れのない空間的連続性、同期されたネイティブオーディオ、ゼロカット編集25秒付近での軽微な床滑りと指のぼやけ
モジュラー8〜12秒カットハイテンポなダンスバトル、高速フットワーククリップ、マルチアングルミュージックビデオ時間的劣化を排除、視覚的ペーシングを向上、ダイナミックなカメラ切り替えが可能ポストプロダクションでのタイムライン編集が必要

ネイティブ30秒生成の活用

シングルショットレンダリングは、流動的なスリーブモーションと途切れのないカメラトラッキングが優先される雰囲気重視のGuofengショーケースで優れている。Wan 3.0のネイティブ音声・映像同期を活用することで、手動のリップシンクや外部オーディオのステッチングなしで、連続的な振り付けをサウンドトラックのビートに合わせ続けることができる。

ショートモジュラー編集の活用

ペースの速いTikTokやShortsには、8〜12秒のクイックカットが最適だ。ショートテイクはペーシングをテンポよく保ち、フレームドリフトが始まる前にモデルのメモリをリセットし、ワイドショットと顔追跡の間に編集者向けのクリーンなカットポイントを提供する。

AIダンスクリエイター向けの実用的な制作パイプライン

効率的なWan 3.0ショートビデオクリエイターワークフローを実装するには、レンダリングを開始する前に入力を構造化する必要がある:

  1. 参照画像をロックする: キャラクター写真をWan 3.0マルチモーダル参照入力に渡し、複雑なスピン全体で顔の幾何学形状を保存する。
  2. オーディオガイダンスを適用する: 参照トラックをモデルに直接入力し、内蔵の音声・映像アライメントを活用する。
  3. フレーミング制限を設定する: ミディアムワイドカメラタグと明示的なネガティブプロンプトを組み合わせ、アクティブなカメラ境界内に空間的動きを収める。

この体系的なアプローチにより、AIダンス動画制作に一貫した品質管理をもたらす。当社の実践的なWan 3.0推奨事項は、連続的なソロルーティンにはネイティブ30秒パスを展開し、高速なグループ振り付けには8秒のマルチアングルカットを予約することだ。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索