Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

Wan 3.0 リアルな顔: 人間のように見える3つのプロンプト

Wan 3.0 リアルな顔:プロンプト、設定、検証テスト

最新情報: Wan 3.0 は 2026 年 8 月 24 日より提供開始。

AI 動画はまず顔で判断される。カメラワークでも背景でもない。顔だ。

目が浮く、肌がロウのように見える、口が AI 特有のゴムのような動きをする——それでスクロールは終了。だからこそ、Wan 3.0 のリアルな顔は、UGC 広告、短編映画、体験談、ソーシャルクリップを制作するクリエイターにとって、本物のプロダクションテストとなる。

実用的な答えはシンプルだ。リアルな顔は美しさの設定ではない。演出の問題である。安定したリファレンス、小さな人間の動作、明確なカメラルール、そして厳しい失敗条件が必要だ。

このガイドでは、ブラウザ上で動作する Atlas Cloud をワークスペースとして使用する。Wan-3.0 の Text-to-video、Image-to-video、Reference-to-video を一箇所でテストでき、実行状態を確認し、送信前に表示されるコストも確認できる。

要点

  • リアルな顔の品質とは、アイデンティティ、肌、視線、口、動作の連続性を意味する。
  • 特定の顔が重要な場合、通常は Image-to-video の方が安全。
  • 感情ラベルだけでなく、筋肉の動きや微小な動作をプロンプトに含める。
  • 24 秒や 30 秒のストレステストの前に、8 秒の下書きで確認する。
  • Atlas Cloud では、Wan-3.0 の各モードは $0.05/秒から利用可能。

泣いている卒業生を表示するAI動画生成インターフェース

Wan 3.0 リアルな顔のショーケース:卒業式のクローズアッププロンプトカード、完了した実行証拠、顔の安定性フレーム

ショーケース:卒業式のクローズアップ事例では、一人の顔、微妙な表情、視線の動き、30.07 秒のハンドブッククリップを使用し、リアルな顔の連続性をストレステストする。

ケース1 モーションプルーフ:青いガウンの黒人女性が、30.07 秒の Wan 3.0 ハンドブッククリップ全体で、クローズアップの顔の演技を維持する。

Wan 3.0 のリアルな顔が注目される理由、そしてほとんどの試みが失敗する理由

結論から言うと、顔が失敗するのは、プロンプトが「雰囲気」を求めているからだ。モデルには方向性が必要なのに。

Wan 3.0 はより大きな領域で登場した。最大 30 秒のクリップ、1080P 出力、ネイティブ音声・動画生成、幅広いリファレンス入力に対応する。Alibaba のリリースカバレッジでも、マルチモーダル入力と人間の顔や微小表情の視覚的連続性が強調されている(Alibaba Cloud Community、2026 年 8 月)。公式の Model Studio ページでは、30 秒のストーリーテリング、1080P の映画品質、ネイティブ A/V、オムニリファレンス入力としてリリースを位置づけている(Alibaba Cloud Model Studio、2026 年 8 月)。

大きく聞こえる。実際その通りだ。

しかし、クリエイターの問題はより実用的だ。「この人物は瞬き、話し、ためらい、同じ人物であり続けられるか?」

よくある失敗パターンは次の通り。

  • 目の漂流:視線に明確な目標がない。
  • ゴムのような肌:毛穴が消え、頬がシリコンのように動く。
  • 骨格のずれ:頬骨と顎の形がフレーム間で変わる。
  • 偽の笑顔:口は笑っているが目は笑っていない。
  • 口のちらつき:話すときに歯と唇がパルス状に動く。
  • カメラが引き起こすアイデンティティ損失:パンやターンの後に顔が変わる。

これは単なるローンチ時の誇張ではない。以前の Wan ワークフローでは、Image-to-video 実行時に顔の不一致や不気味な結果が報告されており、元の画像に忠実でなくなることがある(ComfyUI GitHub discussion、2025 年 4 月)。

問題は、どうやってそれを回避するかだ。

Atlas Cloud での Wan 3.0 リアルな顔ワークフローの概要

十分な制御が得られる最もシンプルなモードを使用する。

リファレンスとなる人物がいない場合は、Text-to-video から始める。特定の顔が重要な場合は、強力な最初のフレームを使用して Image-to-video を使用する。アイデンティティ、動き、音声のリファレンスがある場合は、Reference-to-video を使用する。

Atlas Cloud ホームページ から開始し、Wan 3.0 モデルページを開き、プロンプトを貼り付け、長さと解像度を選択し、1 つのブラウザタブでテストを実行できる。実用的な利点は単なるアクセスだけではない。プロンプト、設定、出力パネル、表示されたコストがすべて表示されたまま、反復作業ができることだ。

ニーズAtlas Cloud モデル実行場所使用目的確認のための価格
純粋なプロンプトから開始Wan-3.0 Text-to-videoWan 3.0 Text-to-video プレイグラウンド汎用の俳優やシーン$0.05/秒から
最初のフレームをアニメーション化Wan-3.0 Image-to-video同じ Wan 3.0 ファミリー、Image-to-video モード安定した顔、ポートレート UGC$0.05/秒から
動き全体でリファレンスを固定Wan-3.0 Reference-to-video同じ Wan 3.0 ファミリー、Reference-to-video モードアイデンティティ、動き、音声、シーンリファレンス$0.05/秒から

Atlas Cloud の models/all には、現在 Wan-3.0 Text-to-video、Image-to-video、Reference-to-video が $0.05/秒からリストされている。Alibaba の公式ページでも、自社プラットフォームの解像度に応じた価格設定が示されているため、送信前に表示される「実行」ボタンのコストを最終的な情報源として扱うこと。

ステップ 1: Wan 3.0 リアルな顔のモードを選択する

リスクに合ったワークフローから始める。

リファレンス顔なし? Text-to-video を使用。安定した俳優が1人必要? Image-to-video を使用。既知のアイデンティティと動き、音声、または以前のクリップが必要? Reference-to-video を使用。

モードの簡単な確認だけが必要な場合は、このプロンプトをコピーする。

Plain
116:9、8秒、リアルなシネマティッククローズアップ。窓際に座った人物が柔らかい日差しの中で、自然な口の動き、小さな目の動き、リラックスした呼吸で短い一文を話す。クリップ全体で同じ顔、肌のトーン、生え際、服装、照明、背景のぼかしを維持する。顔の漂流、ロウのような肌、歪んだ目、余分な歯、ジャンプカット、背景の人物を避ける。

選択する設定:

設定推奨重要度
アスペクト比記事テストは 16:9、縦型ソーシャルは 9:16顔のスケールとクロップが失敗モードを変える
解像度最終は 1080P、下書きは必要に応じて 720P高解像度は肌と目のディテールに役立つ
長さ8秒の下書き、24秒~30秒のストレステスト長回しはアイデンティティの漂流を明らかにする
音声スピーチが目的でない限り、ルームトーン顔のテストに集中させる

末尾にピリオドなし?

Atlas Cloud Wan 3.0 リアルな顔モード設定、完了した実行と表示された出力パネル

ステップ 1: Atlas Cloud Wan 3.0 モード設定。完了した実行後にキャプチャし、入力と出力が同時に表示されている。

ステップ 2: ケース 1 を実行する — Wan 3.0 リアルな顔のクローズアップ

これが難しいケースだ。

クローズアップは隠れる場所をすべて排除する。視聴者は口元、眉の緊張、視線のターゲット、肌の質感を直接見ることができる。ケース 1 では、青い卒業ガウンを着た黒人女性の Wan 3.0 ハンドブッククリップを使用し、顔をクローズアップでフレームに収め、静かに話しながら視線を落とす。

このプロンプトをコピーする。

Plain
116:9、8秒、リアルなシネマティッククローズアップ。青い卒業ガウンを着た黒人女性が、柔らかな室内セレモニー照明の中に立ち、頭から胸の上までフレームに収まる。左端には、完全にぼかされた別の人物のシルエットだけが見える。彼女はカメラのすぐ外にいる誰かに向かって静かに話し、口は自然に動き、眉は寄り、目は少し潤んでいるが泣いてはいない。ショット全体で、視線は目の高さからゆっくりと自分の手元に落ちる。カメラは固定されているが、かすかな手持ちの呼吸揺れがある。自然な肌の質感、見える毛穴、柔らかなオーバーヘッドライト、浅い被写界深度。クリップ全体で同じ顔、同じガウン、同じ肌のトーン、同じ目の形、同じ背景のぼかしを維持する。プラスチックのような肌、変化する頬骨、余分な歯、誇張された笑顔、歪んだ目、ジャンプカットを避ける。

選択する設定:

設定選択
モデル最初のフレームがある場合は Wan-3.0 Image-to-video、なければ Wan-3.0 Text-to-video
長さ下書きは 8秒、ロングテイクの証明は 30秒
解像度1080P が利用可能なら、そうでなければ 720P
アスペクト比16:9
音声ダイアログをテストしている場合を除き、ルームトーンのみ

AI動画生成インターフェース:入力設定と生成された動画出力

Wan 3.0 リアルな顔 ケース 1 完了実行スクリーンショット(卒業式クローズアッププロンプト)

ステップ 2: 卒業式クローズアップのリアルな顔テストのケース 1 実行証拠。完全なモーションプルーフは上記のショーケースクリップを参照。

ステップ 3: ケース 2 を実行する — Wan 3.0 リアルな顔の UGC 電話

UGC の顔は異なる形で失敗する。

ビューティークローズアップほどタイトではないが、スピーチ、手の位置、柔らかな窓からの光が顔のモーフィングをすぐに露呈する可能性がある。このケースでは、雨のアパートでの電話を使用する。若い女性が窓際に座り、聞き、答え、最後に小さな半笑いを浮かべる。

このプロンプトをコピーする。

Plain
116:9、8秒、自然な UGC スタイルのリアル動画。長い黒髪の若い女性が、雨のアパートの窓際にある木製のテーブルに座り、スマートフォンを耳に当てている。窓ガラスの外にはネオン街の灯りがぼやけて見える。彼女は聞き、次に穏やかな低い声で答える。唇は柔らかく動き、目は一拍下にずれ、最後に小さな半笑いを浮かべる。カメラはテーブル越しの安定したミディアムクローズアップ、50mm レンズ風、顔の片側に柔らかい窓からの光、背景に暖かい実用的なランプ。顔、生え際、鼻の形、手の位置、電話、テーブル、窓の雨、照明を一貫して保つ。過度に美化された肌、ロウのような頬、不一致な口の動き、顔のモーフィング、余分な指、背景の人物を避ける。

選択する設定:

設定選択
モデル汎用俳優なら Wan-3.0 Text-to-video、固定顔なら Image-to-video
長さ8秒の下書き
解像度1080P 推奨
アスペクト比16:9
音声音声をテストする場合のみネイティブ音声をオン、それ以外は柔らかい雨音とルームトーン

AI動画生成インターフェース:入力設定と生成された動画

Wan 3.0 リアルな顔 ケース 2 完了実行スクリーンショット(雨の窓辺の電話)

ステップ 3: 雨の窓辺の電話の顔テスト、ケース 2 実行証拠。

雨の窓辺で電話する笑顔の女性

ケース 2 モーションプルーフ GIF(雨の窓辺の電話の顔テスト)

ケース 2 モーションプルーフ GIF:15.04 秒の Wan 3.0 ハンドブッククリップで、スピーチ、目の動き、手と電話の一貫性、柔らかな室内照明をテスト。

ステップ 4: ケース 3 を実行する — Wan 3.0 リアルな顔の縦型ソーシャルクリップ

今度は顔を小さくする。

縦型クリップは厄介だ。顔は小さいが、視聴者は目のサイズの変化、脚の歪み、鏡の反射が別の人物になることに気づく。このケースでは、鏡、服装の詳細、リラックスした笑顔を使った全身の動きをテストする。

このプロンプトをコピーする。

Plain
19:16、8秒、リアルな縦型ソーシャル動画。白い刺繍ブラウス、白いプリーツスカート、黒いベルト、白いプラットフォームスニーカーを着た若い女性が、柔らかな照明のアパートで、清潔な全身鏡の前に立っている。彼女は袖を直し、自然に体重を移動し、鏡からカメラへ視線を移し、小さくリラックスした笑顔を見せる。全身フレーミング、固定された安定したカメラ、自然な昼光、強い美容フィルターなし、リアルな布地の質感と身体のプロポーション。ショット全体で同じ顔、同じ服装、同じ髪型、同じ鏡の位置、同じ部屋のレイアウトを維持する。顔の漂流、人形のような肌、目のサイズの変化、歪んだ脚、余分な反射、ジャンプカットを避ける。

選択する設定:

設定選択
モデルWan-3.0 Text-to-video または Image-to-video
長さ8秒の下書き
解像度1080P 推奨
アスペクト比9:16
音声音楽なし、柔らかいルームトーンのみ

AI動画生成インターフェース:テキストプロンプトと生成された動画

Wan 3.0 リアルな顔 ケース 3 完了実行スクリーンショット(縦型ファッションミラークリップ)

ステップ 4: 縦型全身の顔の一貫性テスト、ケース 3 実行証拠。

白い刺繍シャツとプリーツスカートを着た女性、キッチンにて

ケース 3 モーションプルーフ GIF(縦型ファッションの顔の一貫性)

ケース 3 モーションプルーフ GIF:15.04 秒の Wan 3.0 ハンドブッククリップで、小さな顔が安定し、体、服装、鏡が一貫しているかどうかをチェック。

ステップ 5: 再生成する前に Wan 3.0 リアルな顔を監査する

「何か変」という理由で再生成しない。まず失敗を特定する。

このチェックリストでレビューを客観的に保つ。

チェック項目合格サイン再生成条件
アイデンティティ目の間隔、鼻、頬骨が同じ顔が別人のように見える
毛穴と柔らかい質感が維持されているロウ、プラスチック、過度に滑らか
スピーチが小さく人間らしい顎がゴムのように動く、歯がちらつく
視線に明確なターゲットがある目が浮く、または交差する
動き一つの連続したアクションジャンプカット、体のスナップ
背景ぼかしが背景として残っているランダムな顔が鮮明になる

Wan 3.0 でのリアルな顔評価のための監査チェックリスト表

Wan 3.0 リアルな顔監査チェックリストを、アイデンティティ、肌、口、目、動き、背景のチェック用に整理した表として表示

ステップ 5: もう一度実行する前に使用できる、顔のリアリズム監査表。

独自のテストを作成する際に使用できる再利用可能なテンプレート。

Plain
1[アスペクト比]、[長さ]、リアルなシネマティック動画。[安定したアイデンティティアンカーを持つ被写体] が [具体的な設定と照明] の中にいる。[可視アクションチェーン:顔、目、口、手、姿勢が何をするか]。カメラ:[ショットサイズ、レンズ感、動き]。音声:[ルームトーン / ダイアログ / 環境音]。[顔、肌のトーン、服装、小道具、背景] を維持する。[顔の漂流、ロウのような肌、歪んだ目、悪い歯、ジャンプカット、余分な指] を避ける。

試してみるべき Wan 3.0 リアルな顔のバリエーション

3 つのコアテストが合格したら、以下を試す。

バリエーション簡易プロンプトスターターテスト内容
創業者の体験談中年の創業者が静かなオフィスで、8秒で一つの製品結果を説明する美容フィルター肌なしの信頼できる UGC
俳優のリアクションショット俳優が驚くニュースを聞き、笑顔が消えて沈黙する微小表情の制御
製品試着の顔ショット人が眼鏡、口紅、スキンケアを適用しながら、少し顔を回す顔と製品の安定性
ドキュメンタリーインタビュー手持ちクローズアップ、自然な肌、柔らかい背景、グラムフィルターなしリアルな不完全さ

Atlas Cloud での Wan 3.0 リアルな顔のコスト

簡単な計算式を使用する。

コスト = 秒数 × モデルの1秒あたりの価格 × 該当する場合は解像度ティア

2026 年 8 月現在、Atlas Cloud の models/all には、3 つの Wan-3.0 動画モードが $0.05/秒からリストされている。これにより計画の下限が得られる。

テスト長さ使用目的推定下限
顔の下書き8秒簡単なプロンプト確認$0.40 から
UGC 広告クリップ12秒ソーシャルカット$0.60 から
長いクローズアップ30秒完全な Wan 3.0 ストレステスト$1.50 から

最終納品の際は、送信前に表示される実行コストを確認すること。1080P は、プラットフォームやティアによっては下限よりも高くなる可能性があり、実際のコストは「実行」ボタンに表示される。

Wan 3.0 リアルな顔に関する法的注意事項

実際の従業員、クリエイター、顧客、認識可能な肖像を使用する場合は同意を得ること。実際の人物が言っていないことを言ったと暗示しないこと。広告、体験談、医療関連の主張、金融関連の主張、政治的なコンテンツについては、開示とレビューを厳格に行うこと。

以上が成熟した回答である。楽しい部分は依然としてクリエイティブな演出だが、責任ある部分は公開可能な状態を保つことだ。

よくある質問

Wan 3.0 はリアルな顔を作れますか?

はい。ただし、最良の結果は、指示されたプロンプトと強力なリファレンスから得られる。安定したアイデンティティアンカー、小さな顔の動き、明確な視線ターゲット、具体的な失敗条件を求めること。

なぜ顔が不気味に見えることがあるのですか?

顔は小さな誤差を露呈するからだ。目の方向、歯、頬骨、唇のタイミング、肌の質感がすべて同時に一貫している必要がある。「悲しそうに話す女性」のような漠然としたプロンプトでは、漂流の余地が大きすぎる。

Text-to-video か Image-to-video か?

信頼できる俳優であれば Text-to-video で十分。特定の顔、ブランド俳優、クリエイター、最初のフレームが重要な場合は Image-to-video を使用する。

話す顔に最適な Wan 3.0 プロンプトは?

最適なプロンプトは、一つの連続したアクションチェーンを記述する。人物がどこを見るか、口がどのように動くか、手が何をするか、何が変わらないままであるべきか。さらに、プラスチックのような肌、歪んだ目、悪い歯、顔のモーフィングを避けるための用語を追加する。

Atlas Cloud でのコストは?

Atlas Cloud の models/all には、現在 Wan-3.0 Text-to-video、Image-to-video、Reference-to-video が $0.05/秒からリストされている。8秒の下書きは約 $0.40 から、30秒のストレステストは約 $1.50 から(高解像度ティアを適用する前)。

Wan 3.0 のリアルな顔を広告や UGC に使用できますか?

はい。通常のクリエイティブおよび法的規律の範囲内で。肖像には同意を得て、偽の体験談を避け、開示ルールやクライアントポリシーで要求される場合には合成 UGC であることを明示すること。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索