期間限定オファー | Seedance 2.0 & 2.0 Mini が 20% OFF!

一枚の静止画から一曲へ:Seedream 5.0 ProとSeedance 2.0で感情的なMVを制作する

検証済みのSeedream 5.0 Pro + Seedance 2.0ワークフロー:AIミュージックビデオのためのキーフレームプロンプトレシピ、リップシンクと物理キュー、クリップチェーン、そして実際のコスト内訳。

その歌手は存在しない。その歌はあなたの言語ではない。それでもあなたは感じる。

それが、2026年7月19日にクリエイターCia0がXで共有したクリップの下の反応だ。歌っているキャラクターの15秒間。「一言も理解できなくても感じられる歌」と銘打たれている。キャプションには、全体のスタックが一行で書かれている。画像はSeedream 5.0 Pro、動画はSeedance 2.0、実行環境はCapCut。それを売りにしているのはディテールの仕事だ。唇がボーカルを追う。髪が髪らしく動く。顔がポーズではなく感情を保持している。

このガイドでは、そのパイプラインをステップごとに再構築する。どのモデルが何をするのか、画像から動画への引き継ぎで感情を運ぶプロンプト、そして完成したMVの実際のコスト。

夜のクリエイターの編集机、モニターにAI歌手のクローズアップ、もう一つのモニターにオーディオ波形のある動画タイムライン

重要ポイント

  • ワークフローは画像ファースト。Seedream 5.0 Proでキーフレームをアートディレクションするのに0.045ドル。ルックが確定してから動画の料金を支払う。静止画で顔を修正するコストは、クリップを再生成する場合の約20分の1。
  • Seedance 2.0の画像から動画への変換は、最初のフレームとオプションの最後のフレームを受け取り、1回の実行で4~15秒、ネイティブオーディオ付きで生成し、最後のフレームを返すことができるため、次のクリップがショットを継続できる。
  • キャラクターを自分のトラックにリップシンクさせるには、reference-to-videoエンドポイントを使用。最大9枚の画像、3本の動画、3つのオーディオクリップを参照として、プロンプトで@メンションを使用。
  • 40秒、720pの縦型MVは、2026年7月の割引料金で約10ドル。サウンドトラックは唯一別途カウントされないコスト。

模倣する価値のあるSeedream + Seedance MV

2日間で3つの投稿、それ以前のリップシンクテストにより、このペアリングがカバーする領域の全体像が描かれている。どれもラボのデモではない。それぞれが使用ツールを明記している。

クリエイター投稿日クリップの内容ツールチェーン
@Cia0_exe2026年7月19日15秒のバラードパフォーマンス:リップシンク、髪の物理演算、保持された感情Seedream 5.0 Pro + Seedance 2.0、キャプションによるとCapCut上
@Cia0_exe2026年7月20日15秒の「最高の2.5Dアニメアクション」、スタジオが「何年もかけて」出荷するタイプ同じモデルのペアリング、サードパーティアプリで実行
@tjb_shizuka2026年7月20日スイスの湖を舞台にした30秒の「目薬ワープ」トラベルミーム、フォーマットコピーの招待付きSeedream静止画、Seedance 2.0モーション、Mureka V9サウンドトラック、OpenShot編集
@CuriousRefuge2026年5月5日実写とアニメーションにわたるマルチスピーカーリップシンクテスト参照画像、オーディオファイル、カメラと会話のプロンプト

1.png

4つすべてに共通することが2つある。1つ目は、画像モデルと動画モデルが別々のジョブとして扱われていること。キャスティングはSeedreamで、パフォーマンスはSeedanceで行われる。2つ目は、動画モデルはスタックの真ん中に過ぎないこと。すべてのキャプションが、その周囲にあるものを明記している。実行されたアプリ、サウンドトラックのソース、編集用のエディタ。両方のCia0の投稿は、返信で「中国語の」プロンプトを約束しており、日本語の投稿はキャプション自体で4つのツールの組み立てラインを説明している。

Seedreamファーストのワークフローが純粋なテキストから動画に勝る理由

Seedance 2.0には十分に良いテキストから動画へのモードがある。上記のクリップを作っている人たちはそれをスキップしている。その理由は計算と制御の両方にある。

Atlas Cloudでは、Seedream 5.0 Proの静止画は0.045ドル。5秒、720pのSeedance 2.0クリップは、現在の割引で約0.97ドル。静止画の段階でキャッチした間違った顔、間違った服装、間違ったフレーミングは、1枚の静止画で修正できる。動画の段階でキャッチしたものは、約20倍の価格で完全な再生成が必要で、待ち時間も発生する。

 純粋なテキストから動画Seedreamキーフレームファースト
悪い顔を修正するコスト5秒あたり約0.97ドル再生成静止画1枚あたり0.045ドル
ショット間のキャスティングの一貫性クリップごとに新たなダイスロール同じキャラクターブロック、同じ顔
フレーミングの制御プロンプトと願望最初に正確な構図を承認する
エラーが表面化する場所高価なステップで安価なステップで

一貫性のポイントは、MVにとって最も重要だ。ミュージックビデオは同じ顔を8回か10回繰り返す。テキストから動画への変換は、生成のたびにキャラクターを再発明する。キーフレームパイプラインは、2つの方法でアイデンティティを保持する。承認済みの静止画を各クリップの最初のフレームとして再利用するか、同じ参照画像をすべての生成にフィードする。アートディレクションは一度行い、すでに気に入った決定をアニメーション化するために動画の予算を使う。

Atlas CloudでSeedream + Seedanceワークフローを実行する

パイプラインの両方の半分は一か所で実行できる。Atlas Cloudは完全なByteDanceモデルファミリーをホストしているため、Seedream 5.0 Pro(2026年7月8日からパブリックAPI)とSeedance 2.0(2026年2月12日ローンチ)は同じアカウント、同じクレジット、同じAPI形状の背後にある。作業方法は2つある。プレイグラウンドをクリックして操作するか、コードでエンドポイントを連鎖させる。

方法1:プレイグラウンドでMVショットを生成する

ステップ1:Seedreamでキャラクターをキャスティングする。 Seedream 5.0 Proプレイグラウンドを開き、キーフレームプロンプトを書く(完全なレシピは2セクション下にあります)。アスペクト比を今のうちに配信フォーマットに合わせる。ShortsやTikTokなら9:16、YouTubeなら16:9。各実行は1枚の画像を0.045ドルで返すので、顔、衣装、照明が正確に決まるまで反復する。

Atlas Cloud上のSeedream 5.0 Proプレイグラウンドのスクリーンショット。キーフレームプロンプトがフォームにあり、出力パネルに9:16の歌手のクローズアップ、実行ボタンに0.045ドルと表示。

ステップ2:静止画をSeedanceにロードする。 Seedance 2.0画像から動画プレイグラウンドを開く。フォームには1つの必須画像、承認済みのキーフレーム、およびオプションの最後のフレーム画像(ショットを特定の構図で終了させたい場合)が必要。

ステップ3:モーションプロンプトを書き、クリップを設定する。 長さは4~15秒、またはAuto(モデルに選択させる)。キーフレームに合わせて比率を選択するか、Autoのままにする。解像度のデフォルトは720p。

ステップ4:3つのトグルを確認する。 「オーディオを生成」はクリップにネイティブサウンドを与える。「ウォーターマーク」はクリーンマスターのためにオフのままにする。「最後のフレームを返す」は、閉じるフレームを別の画像として渡す。それを次の生成の最初のフレームとしてフィードバックすると、新しいクリップは前のクリップが止まったところから続く。このトグルが、4つの断片的なクリップと1つの連続したパフォーマンスの違いを生む。

ステップ5:価格を確認し、実行する。 実行ボタンは、コミットする前に正確な設定のコストを表示する。2026年7月21日現在、5秒の720pクリップは、プラットフォームの期間限定20%割引が適用され、約0.97ドル(リスト価格は約1.21ドル)となる。

方法2:1つのAPIでSeedreamとSeedanceを連鎖させる

ステップ1:APIキーを取得する。 Atlas Cloudコンソールでキーを作成し、環境変数としてエクスポートする。クライアントコード内に保持しない。

Atlas Cloudホームページコンソールナビゲーションのスクリーンショット、APIキー管理にアクセスするためのトップナビゲーションバーのコンソールボタンの位置を示す.png

Atlas Cloud APIキー管理ダッシュボードのスクリーンショット、APIキーメニューをクリックし、APIキー作成ボタンをクリックし、生成されたAPIキーをコピーするステップバイステップのプロセスを示す.png

ステップ2:APIドキュメントを確認する。 エンドポイント、パラメータ、ポーリング動作はAPIドキュメントに記載されている。パイプライン全体は、2つのサブミット&ポーリングサイクルである。

ステップ3:2つの呼び出しを行う。 最初にキーフレーム:

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "bytedance/seedream-v5.0-pro/text-to-image",
6    "prompt": "<your keyframe prompt>",
7    "size": "1152*2048"
8  }'

ジョブが完了するまでGET /api/v1/model/prediction/をポーリングし、出力からホストされている画像URLを取得し、それを直接動画呼び出しに渡す:

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "bytedance/seedance-2.0/image-to-video",
6    "prompt": "<motion and performance prompt>",
7    "image": "<Seedream output URL>",
8    "duration": 10,
9    "resolution": "720p",
10    "ratio": "adaptive",
11    "generate_audio": true,
12    "return_last_frame": true
13  }'

imageはURL、Base64、またはアセット参照を受け取り、durationは-1を受け付けてモデルに選択させる。watermarkのデフォルトはfalse。return_last_frameが設定されている場合、完了した予測には最終フレームが画像として含まれるため、スクリプトはループできる。クリップを生成し、最後のフレームを取得し、次のクリップを送信する。このループが、約30行のコードでMVパイプライン全体となる。

両方の呼び出しは同じベースURL、同じベアラーヘッダー、同じ予測ポーリングを使用する。これがワンAPIデザインの実用的な利点です。Seedream統合とSeedance統合は、モデル文字列といくつかのフィールドだけが異なり、次のByteDanceリリースも同じコードにスロットインされる。

MVキーフレームのためのSeedream 5.0 Proプロンプトレシピ

MVキーフレームはキャスティングの決定であるため、プロンプトの最初の仕事は、再度呼び出せる人物を定義することである。作業パターンはキャラクターブロックである。1文、40~60語で、顔、髪、衣装を固定する。プロジェクトのすべてのキーフレームプロンプトでそのまま再利用される。単語を変えると、見知らぬ人をキャスティングするリスクがある。

以下はそのパターンでの完全なキーフレームプロンプトです:

腰まである黒い髪、柔らかく丸みを帯びた特徴、銀のドロップイヤリングを身に着け、オーバーサイズのクリーム色のニットセーターを着た若い女性。彼女は夕暮れの雨に濡れた屋上に一人で立ち、肩から上、目の高さでフレームに収まっている。瞳は潤み、唇は歌おうとしてわずかに開き、視線はカメラのすぐ横を向いている。背後には冷たい青い街の輝き、頬に暖かいリムライト一つ、浅い被写界深度、シネマティックなフィルムスチル、柔らかい粒子、9:16。

最初の文がキャラクターブロックです。それ以降はすべてショットごとに変わります。MVには1枚の画像ではなく、小さなカバレッジセットが必要です:

ショット目的プロンプトで変更される内容固定される内容
ワイド場所とムードを確立するロケーションの詳細、全身フレーミングキャラクターブロック、照明の方向
ミディアムバースパフォーマンス「腰から上でフレームに収める」、ジェスチャーキャラクターブロック
クローズアップコーラスの感情的なピーク「肩から上」、顔の表情キャラクターブロック

Seedream固有の注意点が2つ。感情はラベルではなく物理的な証拠として書く:「瞳が潤み、顎が緊張し、息を止めている」は後でアニメーション化されるが、「悲しい」は決まりきった表情に平らになる。そして、アスペクト比は散文だけでなくサイズピッカーでも設定する。パラメータが優先されるため。より深いプロンプトの解剖学、除外パターンやモデルの既知のバグを含む、当社のプロンプトガイドを参照。

リップシンク、物理演算、感情のためのSeedance 2.0プロンプト

キーフレームは、アニメーション化する価値のある顔をSeedance 2.0に渡す。モーションプロンプトは、クリップがパフォーマンスするか、単に動くだけかを決定する。Seedance 2.0はネイティブでデュアルチャンネルオーディオを生成し、ByteDanceのローンチ投稿によると、8以上の言語で音素レベルでリップシンクする。そのため、プロンプトの仕事は、何が誰によって実行され、カメラがそれをどのように扱うかを伝えることである。

歌うキャラクターにたどり着く方法は2つある。

ルートA、生成された歌: 画像から動画のままにし、「オーディオを生成」をオンにし、プロンプトでボーカルを説明する。モデルが音楽を考案し、独自のトラックに合わせて唇を同期させる。これがCia0スタイルのパフォーマンスクリップへの最速の道である。

ルートB、自分のトラック: reference-to-videoに切り替える。これは実行ごとに最大9枚の参照画像、3本の動画、3つのオーディオクリップを受け付ける。曲のセクションをオーディオ参照としてアップロードし、キーフレームを画像参照として追加し、プロンプトで@メンションしてキャラクターをアクションにバインドする。これがCurious Refugeが5月に検証したマルチスピーカーリップシンクのレシピである:「参照画像」、「黒く塗りつぶされた動画とオーディオ、またはオーディオファイル」、および「プロンプト(カメラモーション+VO/会話)」。アップロード前にオーディオをクリップの長さにトリミングする。請求されるトークンは入力時間と出力時間の両方をカウントするため、パディングは実際のコストがかかる。

Curious RefugeによるX投稿。Seedance 2.0リップシンクテストの説明:参照画像、黒く塗りつぶされた動画とオーディオ、またはオーディオファイル、およびカメラモーションと会話のプロンプトをアップロードし、続いて4ショットのサンプルプロンプトと夜の車の後部座席にいる男性と女性の参照画像。

パフォーマンスをスクリーンセーバーから区別する手がかり:

求めているもの効果的なプロンプトの手がかり効果の理由
読み取れるリップシンク言語とボーカルスタイルを指定:「彼女は中国語でスローバラードを歌う、柔らかく息の混じった声」音素レベルの同期は、何が歌われているかを知る必要がある
髪と布地の物理演算力に原因を与える:「突風が彼女の髪を持ち上げ、セーターが波打つ」物理演算は形容詞ではなく、記述された力に従う
目に見える感情タイミングを伴う物理的な兆候:「彼女は持続音で目を閉じ、外側の端に一粒の涙」モデルは気分よりもアクションをはるかにうまくアニメーション化する
カメラの感じクリップごとに1つの動き:「ミディアムからクローズアップへのゆっくりとしたプッシュイン」積み重ねられたカメラの動きは、15秒以内で互いに競合する
マルチショットドラマ順序に従ってシーケンスを説明:「スカイラインで開き、ボーカルが入るにつれて彼女の顔にカット」Seedance 2.0は1回の実行でマルチショットシーケンスをネイティブに処理する

15秒より長いものはチェーンジョブである。セットアップセクションの最後のフレームを返すトリックを使い、新しいプロンプトごとに曲の次の行を含める。Seedreamプロンプトからのキャラクターブロックのフレージングをモーションプロンプト内にも保持する。冗長性はアイデンティティのための安価な保険である。

Seedanceクリップから完成したMVへ:編集と予算

日本語の「目薬ワープ」の投稿は、仕上げ段階の最も明確な絵を提供している。なぜなら、クリエイターはキャプションで組み立てライン全体をリストしているからだ。Seedreamが静止画、Seedance 2.0がモーション、Mureka V9がサウンドトラック、そして無料のデスクトップエディタOpenShotがカットを担当。Cia0のクリップは代わりにCapCutをその場として挙げている。どのエディタを選んでも、カットは同じ仕事である。最初に完全なトラックを配置し、ビートに合わせてクリップをトリミングし、最初から最後まで1つのアスペクト比を維持する。

日本語のX投稿、タグ #AI目薬ワープ、ツールチェーンをリスト:画像生成にSeedream、動画にSeedance 2.0、背景音楽にMureka V9、編集にOpenShot、暖かいオレンジ色の光の中の木製の螺旋階段の動画フレームの上。

そのCapCutルートに関する注意点。CapCut内部では、Seedance 2.0はDreamina Seedance 2.0として実行され、2026年4月7日から米国で利用可能であり、CapCutの独自の発表によると、実際の顔を含む画像からの動画生成をブロックすること、出力に可視のウォーターマークを含むことなどの制限が付属している。ミームには良いが、クリーンなMVマスターには制限がある。APIとプレイグラウンドのルートは、デフォルトでウォーターマークをオフにし、生成した任意のキーフレームを受け取る。

2026年7月のAtlas Cloudの割引料金での全体のコスト:

ステージモデルまたはツールボリュームコスト
キーフレームSeedream 5.0 Pro10枚の静止画、各0.045ドル$0.45
モーションドラフトSeedance 2.0 Mini 画像から動画4クリップ×10秒、各0.045ドル/秒$1.80
最終クリップSeedance 2.0 画像から動画、720p4クリップ×10秒、約0.1935ドル/秒≈$7.74
サウンドトラック自分のトラック、またはAI音楽モデル1曲変動
編集CapCutまたはOpenShot1セッション$0
合計 約40秒の完成MV≈$10

ドラフトラインは、人々がスキップしてはならないものだ。Seedance 2.0 Miniは、同じ最初のフレーム+プロンプトのワークフローを1秒あたり0.045ドル(リスト0.056ドル)で実行し、フラッグシップの720pレートの約4分の1のコストであるため、ブロッキング、カメラの動き、物理演算は最終レンダリングの前に安価にデバッグされる。割引がない場合、同じ予算はリスト価格で約12.40ドルとなり、それでもほとんどのストックフッテージサブスクリプションが1か月に請求する額よりも少ない。

よくある質問

Seedance 2.0は自分の曲に合わせてキャラクターをリップシンクできますか?

はい。reference-to-videoエンドポイントを使用します。これは生成ごとに最大3つのオーディオクリップを9枚の画像と3本の動画と一緒に受け付けます。曲のセクションをオーディオ参照としてアップロードし、Seedreamキーフレームを画像参照として追加し、プロンプトで@メンションし、パフォーマンスとカメラを説明します。最初にオーディオをクリップの長さにトリミングします。請求されるトークンは入力時間と出力時間の両方をカウントするためです。

SeedreamとSeedanceのプロンプトは中国語でなければなりませんか?

いいえ。Cia0は中国語でプロンプトを共有しており、ByteDanceモデルをめぐる中国語のプロンプト文化は強いですが、両方のモデルは英語のプロンプトを受け付け、Seedance 2.0のリップシンクは8以上の言語で音素レベルで機能します。重要なのは、プロンプトでボーカルの言語を指定して、口の形がトラックに合うようにすることです。

1回のSeedance 2.0生成の最大長はどのくらいですか?

1回の実行で4~15秒、そのウィンドウ内でマルチショットシーケンスがサポートされるか、durationを-1に設定するとモデルが選択します。フルMVの場合は、生成をチェーンします。「最後のフレームを返す」を有効にし、前のクリップの終了フレームから次のクリップを開始して、パフォーマンスが連続するようにします。

私のMVクリップにウォーターマークは付きますか?

APIまたはプレイグラウンドではデフォルトでは付きません。watermarkパラメータはデフォルトでfalseであり、マスターはクリーンに出力されます。CapCutのコンシューマーバージョンは異なります。Dreamina Seedance 2.0は可視のウォーターマークを適用し、実際の顔を含む画像からの生成をブロックします。これは2026年に再リリースされたガードレールパッケージの一部です。

完全なSeedream + Seedance MVのコストはいくらですか?

2026年7月の割引料金で、40秒の720p縦型動画で約10ドル。キーフレームに0.45ドル、Miniドラフトに1.80ドル、最終720pクリップに約7.74ドル、編集はCapCutまたはOpenShotで無料。リスト価格では同じランで約12.40ドルです。キーフレームステージがその数字を低く抑えています。ルックの決定が、1回の再生成あたり約0.97ドルではなく、0.045ドルで行われるためです。

結論

今月話題になっているクリップは、秘密の機能の成果ではない。それらは作業の分割である。Seedream 5.0 Proが画面上の人物とフレームの雰囲気を決定し、Seedance 2.0が動きと音を決定し、無料のエディタがクリップを顔のある歌に変える。すべてのステップは検査可能であり、すべての間違いは最も安価な場所でキャッチされる。

作業の順序を盗め。キャラクターブロックを固定し、0.045ドルで間違いを購入し、すでに承認したものだけをアニメーション化し、1つのクリップの最後のフレームが次のクリップを開くようにする。ツールは新しい。規律はただの映画製作である。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索

Join our Discord community

Join the Discord community for the latest model updates, prompts, and support.