最新情報: Wan 3.0 は 2026 年 8 月 24 日より提供開始。
AI 動画はまず顔で判断される。カメラワークでも背景でもない。顔だ。
目が浮く、肌がロウのように見える、口が AI 特有のゴムのような動きをする——それでスクロールは終了。だからこそ、Wan 3.0 のリアルな顔は、UGC 広告、短編映画、体験談、ソーシャルクリップを制作するクリエイターにとって、本物のプロダクションテストとなる。
実用的な答えはシンプルだ。リアルな顔は美しさの設定ではない。演出の問題である。安定したリファレンス、小さな人間の動作、明確なカメラルール、そして厳しい失敗条件が必要だ。
このガイドでは、ブラウザ上で動作する Atlas Cloud をワークスペースとして使用する。Wan-3.0 の Text-to-video、Image-to-video、Reference-to-video を一箇所でテストでき、実行状態を確認し、送信前に表示されるコストも確認できる。
要点
- リアルな顔の品質とは、アイデンティティ、肌、視線、口、動作の連続性を意味する。
- 特定の顔が重要な場合、通常は Image-to-video の方が安全。
- 感情ラベルだけでなく、筋肉の動きや微小な動作をプロンプトに含める。
- 24 秒や 30 秒のストレステストの前に、8 秒の下書きで確認する。
- Atlas Cloud では、Wan-3.0 の各モードは $0.05/秒から利用可能。

Wan 3.0 リアルな顔のショーケース:卒業式のクローズアッププロンプトカード、完了した実行証拠、顔の安定性フレーム
ショーケース:卒業式のクローズアップ事例では、一人の顔、微妙な表情、視線の動き、30.07 秒のハンドブッククリップを使用し、リアルな顔の連続性をストレステストする。
ケース1 モーションプルーフ:青いガウンの黒人女性が、30.07 秒の Wan 3.0 ハンドブッククリップ全体で、クローズアップの顔の演技を維持する。
Wan 3.0 のリアルな顔が注目される理由、そしてほとんどの試みが失敗する理由
結論から言うと、顔が失敗するのは、プロンプトが「雰囲気」を求めているからだ。モデルには方向性が必要なのに。
Wan 3.0 はより大きな領域で登場した。最大 30 秒のクリップ、1080P 出力、ネイティブ音声・動画生成、幅広いリファレンス入力に対応する。Alibaba のリリースカバレッジでも、マルチモーダル入力と人間の顔や微小表情の視覚的連続性が強調されている(Alibaba Cloud Community、2026 年 8 月)。公式の Model Studio ページでは、30 秒のストーリーテリング、1080P の映画品質、ネイティブ A/V、オムニリファレンス入力としてリリースを位置づけている(Alibaba Cloud Model Studio、2026 年 8 月)。
大きく聞こえる。実際その通りだ。
しかし、クリエイターの問題はより実用的だ。「この人物は瞬き、話し、ためらい、同じ人物であり続けられるか?」
よくある失敗パターンは次の通り。
- 目の漂流:視線に明確な目標がない。
- ゴムのような肌:毛穴が消え、頬がシリコンのように動く。
- 骨格のずれ:頬骨と顎の形がフレーム間で変わる。
- 偽の笑顔:口は笑っているが目は笑っていない。
- 口のちらつき:話すときに歯と唇がパルス状に動く。
- カメラが引き起こすアイデンティティ損失:パンやターンの後に顔が変わる。
これは単なるローンチ時の誇張ではない。以前の Wan ワークフローでは、Image-to-video 実行時に顔の不一致や不気味な結果が報告されており、元の画像に忠実でなくなることがある(ComfyUI GitHub discussion、2025 年 4 月)。
問題は、どうやってそれを回避するかだ。
Atlas Cloud での Wan 3.0 リアルな顔ワークフローの概要
十分な制御が得られる最もシンプルなモードを使用する。
リファレンスとなる人物がいない場合は、Text-to-video から始める。特定の顔が重要な場合は、強力な最初のフレームを使用して Image-to-video を使用する。アイデンティティ、動き、音声のリファレンスがある場合は、Reference-to-video を使用する。
Atlas Cloud ホームページ から開始し、Wan 3.0 モデルページを開き、プロンプトを貼り付け、長さと解像度を選択し、1 つのブラウザタブでテストを実行できる。実用的な利点は単なるアクセスだけではない。プロンプト、設定、出力パネル、表示されたコストがすべて表示されたまま、反復作業ができることだ。
| ニーズ | Atlas Cloud モデル | 実行場所 | 使用目的 | 確認のための価格 |
|---|---|---|---|---|
| 純粋なプロンプトから開始 | Wan-3.0 Text-to-video | Wan 3.0 Text-to-video プレイグラウンド | 汎用の俳優やシーン | $0.05/秒から |
| 最初のフレームをアニメーション化 | Wan-3.0 Image-to-video | 同じ Wan 3.0 ファミリー、Image-to-video モード | 安定した顔、ポートレート UGC | $0.05/秒から |
| 動き全体でリファレンスを固定 | Wan-3.0 Reference-to-video | 同じ Wan 3.0 ファミリー、Reference-to-video モード | アイデンティティ、動き、音声、シーンリファレンス | $0.05/秒から |
Atlas Cloud の models/all には、現在 Wan-3.0 Text-to-video、Image-to-video、Reference-to-video が $0.05/秒からリストされている。Alibaba の公式ページでも、自社プラットフォームの解像度に応じた価格設定が示されているため、送信前に表示される「実行」ボタンのコストを最終的な情報源として扱うこと。
ステップ 1: Wan 3.0 リアルな顔のモードを選択する
リスクに合ったワークフローから始める。
リファレンス顔なし? Text-to-video を使用。安定した俳優が1人必要? Image-to-video を使用。既知のアイデンティティと動き、音声、または以前のクリップが必要? Reference-to-video を使用。
モードの簡単な確認だけが必要な場合は、このプロンプトをコピーする。
Plain116:9、8秒、リアルなシネマティッククローズアップ。窓際に座った人物が柔らかい日差しの中で、自然な口の動き、小さな目の動き、リラックスした呼吸で短い一文を話す。クリップ全体で同じ顔、肌のトーン、生え際、服装、照明、背景のぼかしを維持する。顔の漂流、ロウのような肌、歪んだ目、余分な歯、ジャンプカット、背景の人物を避ける。
選択する設定:
| 設定 | 推奨 | 重要度 |
|---|---|---|
| アスペクト比 | 記事テストは 16:9、縦型ソーシャルは 9:16 | 顔のスケールとクロップが失敗モードを変える |
| 解像度 | 最終は 1080P、下書きは必要に応じて 720P | 高解像度は肌と目のディテールに役立つ |
| 長さ | 8秒の下書き、24秒~30秒のストレステスト | 長回しはアイデンティティの漂流を明らかにする |
| 音声 | スピーチが目的でない限り、ルームトーン | 顔のテストに集中させる |

Atlas Cloud Wan 3.0 リアルな顔モード設定、完了した実行と表示された出力パネル
ステップ 1: Atlas Cloud Wan 3.0 モード設定。完了した実行後にキャプチャし、入力と出力が同時に表示されている。
ステップ 2: ケース 1 を実行する — Wan 3.0 リアルな顔のクローズアップ
これが難しいケースだ。
クローズアップは隠れる場所をすべて排除する。視聴者は口元、眉の緊張、視線のターゲット、肌の質感を直接見ることができる。ケース 1 では、青い卒業ガウンを着た黒人女性の Wan 3.0 ハンドブッククリップを使用し、顔をクローズアップでフレームに収め、静かに話しながら視線を落とす。
このプロンプトをコピーする。
Plain116:9、8秒、リアルなシネマティッククローズアップ。青い卒業ガウンを着た黒人女性が、柔らかな室内セレモニー照明の中に立ち、頭から胸の上までフレームに収まる。左端には、完全にぼかされた別の人物のシルエットだけが見える。彼女はカメラのすぐ外にいる誰かに向かって静かに話し、口は自然に動き、眉は寄り、目は少し潤んでいるが泣いてはいない。ショット全体で、視線は目の高さからゆっくりと自分の手元に落ちる。カメラは固定されているが、かすかな手持ちの呼吸揺れがある。自然な肌の質感、見える毛穴、柔らかなオーバーヘッドライト、浅い被写界深度。クリップ全体で同じ顔、同じガウン、同じ肌のトーン、同じ目の形、同じ背景のぼかしを維持する。プラスチックのような肌、変化する頬骨、余分な歯、誇張された笑顔、歪んだ目、ジャンプカットを避ける。
選択する設定:
| 設定 | 選択 |
|---|---|
| モデル | 最初のフレームがある場合は Wan-3.0 Image-to-video、なければ Wan-3.0 Text-to-video |
| 長さ | 下書きは 8秒、ロングテイクの証明は 30秒 |
| 解像度 | 1080P が利用可能なら、そうでなければ 720P |
| アスペクト比 | 16:9 |
| 音声 | ダイアログをテストしている場合を除き、ルームトーンのみ |

Wan 3.0 リアルな顔 ケース 1 完了実行スクリーンショット(卒業式クローズアッププロンプト)
ステップ 2: 卒業式クローズアップのリアルな顔テストのケース 1 実行証拠。完全なモーションプルーフは上記のショーケースクリップを参照。
ステップ 3: ケース 2 を実行する — Wan 3.0 リアルな顔の UGC 電話
UGC の顔は異なる形で失敗する。
ビューティークローズアップほどタイトではないが、スピーチ、手の位置、柔らかな窓からの光が顔のモーフィングをすぐに露呈する可能性がある。このケースでは、雨のアパートでの電話を使用する。若い女性が窓際に座り、聞き、答え、最後に小さな半笑いを浮かべる。
このプロンプトをコピーする。
Plain116:9、8秒、自然な UGC スタイルのリアル動画。長い黒髪の若い女性が、雨のアパートの窓際にある木製のテーブルに座り、スマートフォンを耳に当てている。窓ガラスの外にはネオン街の灯りがぼやけて見える。彼女は聞き、次に穏やかな低い声で答える。唇は柔らかく動き、目は一拍下にずれ、最後に小さな半笑いを浮かべる。カメラはテーブル越しの安定したミディアムクローズアップ、50mm レンズ風、顔の片側に柔らかい窓からの光、背景に暖かい実用的なランプ。顔、生え際、鼻の形、手の位置、電話、テーブル、窓の雨、照明を一貫して保つ。過度に美化された肌、ロウのような頬、不一致な口の動き、顔のモーフィング、余分な指、背景の人物を避ける。
選択する設定:
| 設定 | 選択 |
|---|---|
| モデル | 汎用俳優なら Wan-3.0 Text-to-video、固定顔なら Image-to-video |
| 長さ | 8秒の下書き |
| 解像度 | 1080P 推奨 |
| アスペクト比 | 16:9 |
| 音声 | 音声をテストする場合のみネイティブ音声をオン、それ以外は柔らかい雨音とルームトーン |

Wan 3.0 リアルな顔 ケース 2 完了実行スクリーンショット(雨の窓辺の電話)
ステップ 3: 雨の窓辺の電話の顔テスト、ケース 2 実行証拠。

ケース 2 モーションプルーフ GIF(雨の窓辺の電話の顔テスト)
ケース 2 モーションプルーフ GIF:15.04 秒の Wan 3.0 ハンドブッククリップで、スピーチ、目の動き、手と電話の一貫性、柔らかな室内照明をテスト。
ステップ 4: ケース 3 を実行する — Wan 3.0 リアルな顔の縦型ソーシャルクリップ
今度は顔を小さくする。
縦型クリップは厄介だ。顔は小さいが、視聴者は目のサイズの変化、脚の歪み、鏡の反射が別の人物になることに気づく。このケースでは、鏡、服装の詳細、リラックスした笑顔を使った全身の動きをテストする。
このプロンプトをコピーする。
Plain19:16、8秒、リアルな縦型ソーシャル動画。白い刺繍ブラウス、白いプリーツスカート、黒いベルト、白いプラットフォームスニーカーを着た若い女性が、柔らかな照明のアパートで、清潔な全身鏡の前に立っている。彼女は袖を直し、自然に体重を移動し、鏡からカメラへ視線を移し、小さくリラックスした笑顔を見せる。全身フレーミング、固定された安定したカメラ、自然な昼光、強い美容フィルターなし、リアルな布地の質感と身体のプロポーション。ショット全体で同じ顔、同じ服装、同じ髪型、同じ鏡の位置、同じ部屋のレイアウトを維持する。顔の漂流、人形のような肌、目のサイズの変化、歪んだ脚、余分な反射、ジャンプカットを避ける。
選択する設定:
| 設定 | 選択 |
|---|---|
| モデル | Wan-3.0 Text-to-video または Image-to-video |
| 長さ | 8秒の下書き |
| 解像度 | 1080P 推奨 |
| アスペクト比 | 9:16 |
| 音声 | 音楽なし、柔らかいルームトーンのみ |

Wan 3.0 リアルな顔 ケース 3 完了実行スクリーンショット(縦型ファッションミラークリップ)
ステップ 4: 縦型全身の顔の一貫性テスト、ケース 3 実行証拠。

ケース 3 モーションプルーフ GIF(縦型ファッションの顔の一貫性)
ケース 3 モーションプルーフ GIF:15.04 秒の Wan 3.0 ハンドブッククリップで、小さな顔が安定し、体、服装、鏡が一貫しているかどうかをチェック。
ステップ 5: 再生成する前に Wan 3.0 リアルな顔を監査する
「何か変」という理由で再生成しない。まず失敗を特定する。
このチェックリストでレビューを客観的に保つ。
| チェック項目 | 合格サイン | 再生成条件 |
|---|---|---|
| アイデンティティ | 目の間隔、鼻、頬骨が同じ | 顔が別人のように見える |
| 肌 | 毛穴と柔らかい質感が維持されている | ロウ、プラスチック、過度に滑らか |
| 口 | スピーチが小さく人間らしい | 顎がゴムのように動く、歯がちらつく |
| 目 | 視線に明確なターゲットがある | 目が浮く、または交差する |
| 動き | 一つの連続したアクション | ジャンプカット、体のスナップ |
| 背景 | ぼかしが背景として残っている | ランダムな顔が鮮明になる |

Wan 3.0 リアルな顔監査チェックリストを、アイデンティティ、肌、口、目、動き、背景のチェック用に整理した表として表示
ステップ 5: もう一度実行する前に使用できる、顔のリアリズム監査表。
独自のテストを作成する際に使用できる再利用可能なテンプレート。
Plain1[アスペクト比]、[長さ]、リアルなシネマティック動画。[安定したアイデンティティアンカーを持つ被写体] が [具体的な設定と照明] の中にいる。[可視アクションチェーン:顔、目、口、手、姿勢が何をするか]。カメラ:[ショットサイズ、レンズ感、動き]。音声:[ルームトーン / ダイアログ / 環境音]。[顔、肌のトーン、服装、小道具、背景] を維持する。[顔の漂流、ロウのような肌、歪んだ目、悪い歯、ジャンプカット、余分な指] を避ける。
試してみるべき Wan 3.0 リアルな顔のバリエーション
3 つのコアテストが合格したら、以下を試す。
| バリエーション | 簡易プロンプトスターター | テスト内容 |
|---|---|---|
| 創業者の体験談 | 中年の創業者が静かなオフィスで、8秒で一つの製品結果を説明する | 美容フィルター肌なしの信頼できる UGC |
| 俳優のリアクションショット | 俳優が驚くニュースを聞き、笑顔が消えて沈黙する | 微小表情の制御 |
| 製品試着の顔ショット | 人が眼鏡、口紅、スキンケアを適用しながら、少し顔を回す | 顔と製品の安定性 |
| ドキュメンタリーインタビュー | 手持ちクローズアップ、自然な肌、柔らかい背景、グラムフィルターなし | リアルな不完全さ |
Atlas Cloud での Wan 3.0 リアルな顔のコスト
簡単な計算式を使用する。
コスト = 秒数 × モデルの1秒あたりの価格 × 該当する場合は解像度ティア
2026 年 8 月現在、Atlas Cloud の models/all には、3 つの Wan-3.0 動画モードが $0.05/秒からリストされている。これにより計画の下限が得られる。
| テスト | 長さ | 使用目的 | 推定下限 |
|---|---|---|---|
| 顔の下書き | 8秒 | 簡単なプロンプト確認 | $0.40 から |
| UGC 広告クリップ | 12秒 | ソーシャルカット | $0.60 から |
| 長いクローズアップ | 30秒 | 完全な Wan 3.0 ストレステスト | $1.50 から |
最終納品の際は、送信前に表示される実行コストを確認すること。1080P は、プラットフォームやティアによっては下限よりも高くなる可能性があり、実際のコストは「実行」ボタンに表示される。
Wan 3.0 リアルな顔に関する法的注意事項
実際の従業員、クリエイター、顧客、認識可能な肖像を使用する場合は同意を得ること。実際の人物が言っていないことを言ったと暗示しないこと。広告、体験談、医療関連の主張、金融関連の主張、政治的なコンテンツについては、開示とレビューを厳格に行うこと。
以上が成熟した回答である。楽しい部分は依然としてクリエイティブな演出だが、責任ある部分は公開可能な状態を保つことだ。
よくある質問
Wan 3.0 はリアルな顔を作れますか?
はい。ただし、最良の結果は、指示されたプロンプトと強力なリファレンスから得られる。安定したアイデンティティアンカー、小さな顔の動き、明確な視線ターゲット、具体的な失敗条件を求めること。
なぜ顔が不気味に見えることがあるのですか?
顔は小さな誤差を露呈するからだ。目の方向、歯、頬骨、唇のタイミング、肌の質感がすべて同時に一貫している必要がある。「悲しそうに話す女性」のような漠然としたプロンプトでは、漂流の余地が大きすぎる。
Text-to-video か Image-to-video か?
信頼できる俳優であれば Text-to-video で十分。特定の顔、ブランド俳優、クリエイター、最初のフレームが重要な場合は Image-to-video を使用する。
話す顔に最適な Wan 3.0 プロンプトは?
最適なプロンプトは、一つの連続したアクションチェーンを記述する。人物がどこを見るか、口がどのように動くか、手が何をするか、何が変わらないままであるべきか。さらに、プラスチックのような肌、歪んだ目、悪い歯、顔のモーフィングを避けるための用語を追加する。
Atlas Cloud でのコストは?
Atlas Cloud の models/all には、現在 Wan-3.0 Text-to-video、Image-to-video、Reference-to-video が $0.05/秒からリストされている。8秒の下書きは約 $0.40 から、30秒のストレステストは約 $1.50 から(高解像度ティアを適用する前)。
Wan 3.0 のリアルな顔を広告や UGC に使用できますか?
はい。通常のクリエイティブおよび法的規律の範囲内で。肖像には同意を得て、偽の体験談を避け、開示ルールやクライアントポリシーで要求される場合には合成 UGC であることを明示すること。






