Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

たった32秒のフックからMiniMax H3のミュージックビデオを$4.80で作りました。そのオーディオトラックに驚きました。

32秒のフックをMiniMax H3に無料の参照音声として入力し、ビートに同期した4つのショットを得て、実際のMiniMax H3ミュージックビデオを4.80ドルで制作しました。プロンプトと請求書も含まれています。

A video editor working at a console with multiple video monitors

深夜のカラー調整室、6台のモニターに同じ銀髪シンガーの異なる6つのショットが映し出されている。1人のアーティスト、1曲、6つのショット。openai/gpt-image-2/text-to-image で生成。

Sunoユーザーは1日あたり約700万曲を生成しており、これは約2週間ごとにSpotifyの全カタログに相当する量です(TechCrunch、2026年2月)。そのほとんどが、画像を添付されることはありません。画像が不可能だからではなく、従来の方法では4つのツール(静止画生成、アニメーション化、リップシンク処理、編集)を経る必要があり、そのたびに顔、衣装、ビートが失われるからです。

そこで私は、その段階を飛ばしました。コーラスの8秒間をそのままビデオモデルの参照スロットに落とし込み、実行ボタンを押しました。オーディオには課金されませんでした。

次に、完成したmp4を分解して、誰もインターネットで明確に答えていない疑問に答えました。モデルから出力される音声は、私の曲なのか、それとも似ているだけでモデルが作り出したものなのか? 測定しました。答えは予想外で、その後の編集方法が変わります。

重要なポイント

  • 参照オーディオは無料。 MiniMax H3は出力秒数のみ課金。私の4つの8秒参照スライスは、請求額に$0.00追加。参照動画が高価な方。
  • 15秒は1生成あたりの上限であり、プロジェクト全体の上限ではない。 曲をスライスし、1ショットごとに1スライスを生成し、連結。私の32秒カットは4つの生成。
  • フックは120 BPMで書く。 1小節が正確に2.000秒になるため、H3の整数秒duration値が手動調整なしで小節線に合う。8秒=4小節。
  • 出力オーディオはあなたのトラック、サンプル単位で一致。 入力スライスとH3が出力したステレオミックス間の、ゼロラグでの波形相関は0.892。再生成ではない。ただし、最終カットではマスターを上書きすることを推奨(理由は後述)。
  • 実際の総支出:$7.53(失敗を含む9回の生成)。最終カットに使用した4ショット+曲+ベースフレームで**$4.80**。

たった32秒のフックから作ったMiniMax H3ミュージックビデオ

音声オン。これは4つの独立した生成を、トランジションなしで連結し、元の32秒マスターを上書きしたものです。

TfrOvWHf4ys

「MIRA」、32秒、2560x1440、24fps。minimax/h3/reference-to-video 4回生成、各8秒、1ショットあたり$1.12。曲は参照オーディオとして入力され、費用は$0.00。

4つの生成、4つのまったく異なる照明世界、1つの顔。間での修正は一切なし。

Four views of a silver haired woman wearing a glowing red collar

4つのショットからそれぞれ1フレームを抜粋。同じシンガーが、ネオンの屋上、砂漠のハイウェイ、白いスタジオ、黒い水槽の中。雨、低い太陽、フラットなハイキー、水中でも、同じ髪、同じメッシュトップ、同じ赤いLEDチョーカー。


ほとんどのMiniMax H3ミュージックビデオの試みが16秒目で崩れる理由

3つの失敗パターン。すべて回避可能。

1つ目:15秒をプロジェクトの限界と誤解する。 H3は1回の生成を15秒に制限しています。これを読んで「ミュージックビデオは無理」と諦める人がいます。しかし、ミュージックビデオはもともと1ショットではありません。実際のミュージックビデオは4〜8秒ごとにカットされます。この制限は、編集者が本来やるべきことを強制しているだけです。

2つ目:リズムを言葉で説明する。 「アップテンポで、エネルギッシュで、ビートに合わせて踊る」では、モデルにロックするものは何もありません。テンポをでっち上げ、カットポイントが永遠に半拍ずれます。実際のオーディオを渡せば、推測は不要になります。

3つ目:衣装をずらす。 すべてのショットで同じ参照画像同じ衣装の単語を、そのまま使用する必要があります。「黒いメッシュトップ」を「ダークメッシュシャツ」に変えると、別人が生成されます。

2つのルートの実際のコストは次のとおりです。

 従来の4ツールチェーン単一のH3参照呼び出し
1ショットあたりのツール画像モデル、動画モデル、リップシンクツール、NLE1エンドポイント、最後にNLE
1ショットあたりの手順4回の受け渡し、3回のファイルエクスポート1回の送信
キャラクターの保持方法手動での再プロンプトと運1つの参照画像をそのまま使い回す
画像と音声別々にレンダリング、後で同期同一パスで生成、32kHzステレオ
8秒ショットあたりのコスト4つの別々のメーター$1.12(2K)、$0.80(768P)

従来のルートにも公平に言えば、それは夢物語ではありません。日本人クリエイターのArata Fukoe氏は、完全AIミュージックビデオでProject Odysseyの銅賞を受賞しており、QueenやLinkin Parkも公式のAIアシストビデオを公開しています。ただし、それらのチェーンは4〜5つのツールを経由しており、それがまさに、1曲しか持たない独立系アーティストには時間がないことです。

参照オーディオが実際にMiniMax H3ミュージックビデオにもたらすもの

これは、お金を使う前に理解しておくべき部分です。

H3は、完成したフレームにオーディオを後付けするのではなく、画像と音声を1パスで生成します。参照トラックを渡すと、そのトラックは単なるムードノートではありません。入力スライスと、出力されたmp4内のオーディオストリームを、波形レベルで、8kHzモノラルダウンミックスで比較しました。

  • エンベロープ相関:0.956(ゼロラグ)
  • 2秒ウィンドウでの生波形相関:0.892ゼロサンプルオフセット

これは、モデルが類似した曲を再現しているのではありません。あなたのファイルが、サンプル単位で一致し、プロンプトが要求したアンビエンスが重ねられ、1回のAAC再エンコードが施されたものです。比較として、参照オーディオなしで生成したコントロールテイクを同じ測定にかけたところ、0.26(ノイズフロア)でした。

Two nearly identical audio waveforms showing blue input and red output

入力スライス(上)とH3が出力したオーディオ(下)の波形。ゼロオフセットで一致。上:アップロードした8秒mp3。下:H3が返したmp4内のオーディオストリーム。同じピーク、同じ位置、オフセットなし。

入力制限は厳格で、サイレントに処理されるのではなく、送信時に強制されます。

参照入力制限課金
画像最大9枚Atlas CloudのH3エンドポイントでは無料
動画最大3本、各2〜15秒出力レートで課金
オーディオ最大3本、各2〜15秒、全クリップ合計15秒$0.00
オーディオのみ拒否(少なくとも1つの画像または動画が必要)なし

私は意図的に、3つの8秒スライスを1回の呼び出しで送信して、オーディオの合計制限をテストしました。5.8秒で「無効なパラメータ、オーディオの合計時間24138msが15000msを超えています」と失敗し、課金されませんでした。良いニュース:H3は余分なファイルを静かに破棄して課金することはありません。

もう一つ、それ以前に引っかかった罠があります。オーディオをbase64データURLとして渡す場合、MIMEタイプによってAPIが推測する拡張子が決まります。data:audio/mpeg は「audio format ".mpeg" not allowed」で拒否されます。data:audio/mp3 は問題なく通ります。これに気づくまでに4回の送信が失敗しましたが、すべて無料でした。


MiniMax H3ミュージックビデオのワークフローと、各秒のコスト

以下はすべて、私が実行と課金を行ったAtlas Cloudの1つのAPIキーを通じて実行されます。3つのモデル、1つのブラウザタブ。

ステップモデル機能実際に請求された金額
フックを書くminimax/music-2.6スタイルプロンプトと歌詞からフル曲を生成、mp3で最大約5分曲1つにつき$0.15、固定
アーティストを固定openai/gpt-image-2/text-to-imageすべてのショットが継承する1つのベースフレームを生成品質high、2048x1152で$0.1745
各ショットを撮影minimax/h3/reference-to-video画像+オーディオを入力、ビートにロックされたクリップをステレオ音声で出力2Kで$0.14/s、768Pで$0.10/s。オーディオ入力は$0.00

この表には2つの注意点があります。リストされている数値は両方向で誤解を招くからです。GPT Image 2のカタログには$0.009の下限が表示されていますが、それは最下位のトークン層であり、実際の2048x1152「high」レンダリングでは$0.1745が請求されます。H3のカタログエントリには$0.10とありますが、これは768P層のみ。私の8秒2Kジョブはそれぞれ正確に$1.12が請求され、これは1秒あたり$0.14です。

最初のフレームのロックが必要で、被写体の参照が不要な場合は、[minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) が同じレートで利用でき、[minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) は純粋なプロンプトショットをカバーします。

修正すべき点:この計画の初期バージョンでは、プラットフォームに曲全体を生成する機能がなかったため、自分で曲を持ち込む必要があると想定していました。現在は存在します。minimax/music-2.6 でトラックが作成されるため、曲を含むチェーン全体が1つの場所で完結します。


MiniMax H3ミュージックビデオの作り方(ステップバイステップ)

ステップ1:120 BPMのフックを書き、ショットごとにスライスする

明示的に120 BPMを要求します。120 BPMでは、1小節が正確に2.000秒であるため、H3の整数秒のduration列挙型が自動的に小節線に合います。4秒=2小節、6秒=3小節、8秒=4小節、10秒=5小節。マーカーを1つも触らずに、カットがダウンビートに乗ります。

モデル:minimax/music-2.6。設定:format: mp3sample_rate: 44100bitrate: 256000is_instrumental: false

スタイルプロンプト:

plaintext
1正確に120 BPMのシンセポップ、ストレートな4つ打ちキック、ブライトなアナログ
2サイドチェインパッド、ミックスの中で前に出るクリアな女性リードボーカル、
3ワイドなステレオコーラス、ラップなし、持続する開母音、シネマティックでやや
4メランコリック、ラジオ対応のマスタリング

歌詞:

plaintext
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

70秒のトラックが75秒で$0.15で返ってきました。その後、信頼せずにテンポを確認するため、ファイルに対してオンセットノベルティの自己相関を実行しました。最も強いラグは正確に0.500秒で、これは120 BPMであり、ビートグリッドはデコードされたファイルの先頭から0.24秒で始まっています。このオフセットは重要です。0.24秒からカットすれば、すべてのスライスがダウンビートで始まります。

plaintext
1# 32秒マスター、ダウンビートの0.24秒から開始
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# 4つの8秒スライス、各ショット1つ、各4小節で15秒制限を十分下回る
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

すでに自分のトラックを持っている場合は、このステップを完全にスキップしてください。それが通常のケースであり、最も安価です。

ステップ2:1つのGPT Image 2ベースフレームでアーティストを固定する

すべてのショットがこの単一ファイルを参照します。ここで間違うと、4回間違えることになります。$0.17をかけて、適切に確認しましょう。

モデル:openai/gpt-image-2/text-to-image。設定:quality highsize 2048x1152 (16:9)

plaintext
1シネマティックなミュージックビデオの静止画、腰から上のポートレート。25歳の東アジア人女性
2シンセポップシンガー、シルバーホワイトの短めの髪とストレートカットの前髪、マットブラックの
3メッシュトップ、鎖骨に輝く細い赤いLEDチョーカー、シルバーのイヤーカフ1つ。雨に濡れた
4夜の屋上に立ち、ビンテージのクロームハンドマイクを口元に近づけて持っている。背後には、
5ピンぼけのマゼンタとシアンのネオンサイン、ハードバックライトに捉えられた細かい雨、
6通気口から立ち上る蒸気。35mmアナモルフィックで撮影、浅い被写界深度、ティール&マゼンタの
7グレーディング、目に見えるフィルムグレイン。顔はシャープで、カメラ左側からのソフトキーで均一に
8照らされている。フレーム内にテキストは一切なし。

Woman with silver hair holding a vintage microphone in a rainy neon city

生成されたベースフレーム:雨に濡れたネオン屋上でクロームマイクを持つ銀髪シンガー。後のすべてのショットが継承するベースフレーム。openai/gpt-image-2/text-to-image で生成、品質high、2048x1152、請求額$0.1745。

AI image generator interface showing input settings and the generated output

Atlas Cloudのプレイグラウンドでこのプロンプトを実行中のGPT Image 2、出力パネルに完成フレーム

プレイグラウンドでの同じプロンプト:サイズ16:9で2048x1152、品質high、実行ボタンに表示された$0.1745(実際にAPIが請求した金額)。カタログの$0.009は最下位トークン層であり、これではありません。同じプロンプト、異なるシードのため、このレンダリングは上記のファイルと正確には一致しません。

そのプロンプト内の衣装の単語(シルバーホワイトの短めの髪、マットブラックのメッシュトップ、赤いLEDチョーカー、シルバーのイヤーカフ)は、以下のすべてのプロンプトでそのまま再利用されます。この繰り返しが一貫性のメカニズム全体です。言い換えてはいけません。

ステップ3:無料の参照オーディオで最初のMiniMax H3ミュージックビデオショットを実行する

モデル:minimax/h3/reference-to-video。設定:refers = ベースフレームと slice-0.mp3resolution: 2Kduration: 8ratio: 16:9

ratio を明示的に設定します。プレイグラウンドのデフォルトは adaptive であり、エンドポイントは希望する形状を指定するとより安定します。

plaintext
1ミュージックビデオショット。参照画像の女性が、濡れたネオン屋上で、クロームマイクを口元に当て、
2参照トラックをレンズに向かって歌う。最初のラインをダウンビートに強く合わせ、目をカメラに固定し、
3そのまま持続音で頭を後ろに傾ける。腰上からタイトなクローズアップへのスロープッシュインが8秒間、
4手持ちのマイクロドリフト、雨の筋がハードバックライトを横切る。口の形は参照オーディオの歌う母音に
5正確に従い、彼女は話しているのではなく歌っている。シルバーホワイトの短めの髪、マットブラックの
6メッシュトップ、光る赤いLEDチョーカーは参照画像と同一。サウンドスケープ:参照トラック(ステレオ)
7に加え、かすかな雨と遠くの街の騒音がミックス内で低く入る。

7sPeYEe-xII

ショット1、音声オン。2560x1440、正確に8.00秒、24fps、32kHzステレオ。送信からファイルまで345秒、請求額$1.12。5秒あたりで持続音で頭を後ろに傾ける様子に注目。

AI video generator interface showing input settings and the generated video

参照動画プレイグラウンド、ベースフレームとオーディオスライスが読み込まれ、出力パネルに完成クリップ

参照素材は2/9:一方のスロットにslice-0.mp3、もう一方にベースフレーム。解像度2K、長さ8、実行ボタンに$1.12(8×$0.14)。アスペクト比ドロップダウンがadaptiveになっているのはページのデフォルト。私のAPI呼び出しではratioを16:9に明示的に設定。

記録しておくべき数値:duration: 8 は正確に8.00秒のコンテナを返しました。duration: 4 は4.46秒を返しました。小節線で連結する予定がある場合は、正確に戻ってくる継続時間を使用してください。

ステップ4:顔を失わずにさらに3つの世界を撮影する

同じベースフレーム、同じ衣装の文、次のオーディオスライス。それ以外はすべて変更。

4a. ゴールデンアワーの砂漠のハイウェイ。 refers = ベースフレーム + slice-8.mp32Kduration: 8ratio: 16:9

plaintext
1ミュージックビデオショット。参照画像と同じ女性が、ゴールデンアワーの空の砂漠のハイウェイの中央線に
2立ち、マイクはなし。開いたインディゴデニムジャケットを同じマットブラックメッシュトップの上に羽織り、
3赤いLEDチョーカーはまだ光っている。彼女は風に向かって参照トラックのコーラスを口ずさみながら、
4カメラはアスファルトの上を低く後方にトラッキング。道路からの陽炎、立ち上る砂埃、影がレンズに向かって
5長く伸び、途中でアナモルフィックフレアが交差。髪、顔、衣装は参照画像と同一。
6サウンドスケープ:参照トラックが開けた砂漠の風の上に、広く風通しよく。

4XEki-v2vCU

ショット2、音声オン。同じ顔、反対の色温度、参照トラックが開けた風の下でリミックス。332秒、$1.12。

4b. 白いインフィニティコーブ。 refers = ベースフレーム + slice-16.mp32Kduration: 8ratio: 16:9

plaintext
1ミュージックビデオショット。参照画像と同じ女性が、純白のインフィニティコーブスタジオで、フラットな
2ハイキーライトの下に影はなく、光沢のある赤いビニールトレンチコートを同じマットブラックメッシュトップの
3上に羽織り、襟元に赤いLEDチョーカーが見える。彼女は参照トラックに合わせて4小節を踊り、シルバーホワイトの
4髪がターンのたびに舞う。ロックオフのワイドフレームから、2番目のダウンビートでハードスナップズームで
5ミディアムに。最後の2秒間、小さな白い紙の正方形が紙吹雪のように落ちる。顔と髪は参照画像と同一。
6サウンドスケープ:参照トラック、ドライで近く、スタジオの床での靴のきしむ音。

VAyqdkVpnm0

ショット3、音声オン。フラットで影のない光は、顔の入れ替えを隠すのが最も難しい場所ですが、維持されました。8.00秒、$1.12。

4c. 水中Bロール、リップシンクなし。 refers = ベースフレーム + slice-24.mp32Kduration: 8ratio: 16:9

plaintext
1ミュージックビデオショット。参照画像と同じ女性が、黒い水槽に水中で浮かび、シルバーホワイトの髪は
2周りに漂い、赤いLEDチョーカーが水を通して輝き、黒いメッシュトップがゆっくりとはためく。
3真上から1本の硬い光のビーム。スローモーションで泡がレンズの前を通り過ぎる。彼女はダウンビートで
4目を開け、片手を水面に向かって伸ばす。歌わず、口は閉じたまま。カメラはショット全体で彼女の周りを
530度回転する。顔は参照画像と同一。サウンドスケープ:参照トラックが水面から聞こえるように、
6こもってローパスされ、泡の過渡音が混ざる。

fibdweUMRpY

ショット4、音声オン。「歌わず、口は閉じたまま」という指示が守られました。参照オーディオはタイミングを駆動するものであり、必須のパフォーマンスではないという点で有用です。329秒、$1.12。

ステップ5:オーディオスロットを空にしてコントロールテイクを実行する

ステップ3と同じプロンプト、一字一句同じ。唯一の変更点:refers は画像のみを保持し、他はなし。768Pduration: 8

この1つのクリップが、メカニズム全体をどんな段落よりも明確に説明します。ステップ3と聴き比べてください。

FAoPplGmKJc

コントロールテイク。同一プロンプト、参照オーディオなし、1344x768、8.00秒、200秒、$0.80。H3が独自のサウンドトラックを作成し、パフォーマンスは「誰かが歌っている」という汎用的なものであり、特定の歌詞ではありません。

私のマスターに対する測定では、コントロールのオーディオはエンベロープ相関0.26。ステップ3は0.956。この差が、無料のオーディオスロットがもたらすものです。

ステップ6:意図的にリップシンクを破壊する

すべてのモデルには音節の限界があります。あなたの限界を見つけるのに$0.40かかります。

別のダブルタイムラップトラック(minimax/music-2.6、$0.15)を生成し、約毎秒6音節の4秒スライスを切り出し、同じ屋上設定に768Pduration: 4で入力しました。

plaintext
1ミュージックビデオショット。参照画像の女性が、濡れたネオン屋上で、クロームマイクを口元に当て、
2参照トラックをレンズに向かってラップし、速いダブルタイムの詩のすべての音節を発音する。
3ロックオフのミディアムクローズアップ、わずかな手持ちドリフト、ハードバックライトの雨の筋。
4口の形は参照オーディオのラップされた音節に正確に従う。シルバーホワイトの短めの髪、マットブラックの
5メッシュトップ、光る赤いLEDチョーカーは参照画像と同一。サウンドスケープ:参照トラック(ステレオ)
6に加え、かすかな雨。

jiQVCjOCbKg

ストレステスト、音声オン。1344x768、4.46秒、192秒、$0.40。口は忙しく動き、ビートに乗っているが、個々の子音を解像するのをやめ、開閉の繰り返しパターンに落ち着いている。歌われるラインは明確な母音の形状を得るが、これはそうではない。

出力ファイルから私が正直に読み取ったところ:持続する歌われる母音がH3の口の動きが本当に説得力があるところであり、密度の高いラップの子音は、もっともらしい動きに劣化するところです。クローズアップは歌われるラインの周りに計画し、速いバーはBロールに回してください。音声と歌の違いの詳細については、リップシンクとオーディオの解説を参照してください。

ステップ7:連結、ミュート、マスターをMiniMax H3ミュージックビデオに重ねる

正確に8.00秒の4つのクリップを連結すると、正確に32.00秒になり、120 BPMで16小節になります。トリミングは不要。

plaintext
1# 1. 各クリップのオーディオを削除
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. 小節順に連結(4×8s=32s=16小節@120BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. 元のマスターを重ねる
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

なぜミュートするのか?モデルがすでにトラックを返してくるのに。各クリップのステレオミックスには、そのクリップのプロンプトが要求したアンビエンス(ショット1の雨、ショット2の砂漠の風、ショット4の水中ローパスフィルター)が含まれているからです。各ショット単体では素晴らしいですが、カットをまたぐと一貫性がありません。マスターは、1つの連続したミックスをフルビットレートで、ショットごとの再エンコードなしで提供します。H3はパフォーマンスの同期を提供し、あなたのマスターが曲を提供します。


MiniMax H3ミュージックビデオレシピの4つのバリエーション

縦型リリースカット。 ratio: 9:16 に設定すると、同じベースフレームと同じスライスから、Spotify CanvasやShorts用のスライスが得られます。768x1344の本当のサイズで返ってきたため、プレイグラウンドのアスペクトドロップダウンとは異なり、APIのratio値は確かに固定されます。Canvasループはデフォルトで無音のため、これはGIFとして出力されます。

Silver haired woman holding a microphone on a rainy city rooftop

同じアーティストのネオン屋上での縦型9:16ループカット。同じベースフレーム、同じ参照スライス、ratio: 9:16、768Pで$0.80。1つ正直な問題:「歌わない」と指定したが、実際には歌っている。参照スロットにボーカルがある場合、オーディオが優先される。無音のパフォーマーが必要な場合は、インストゥルメンタルスライスを入力。

参照画像の代わりに参照動画。 H3には最大3つの参照動画クリップを渡して、モーションとフレーミングを記述ではなく伝えることができます。メーターに注意:参照動画は出力レートで課金されるのに対し、参照オーディオは無料。この非対称性が、このエンドポイントで最も有用な価格設定の事実です。

純粋なBロールビジュアライザー。 パフォーマーを完全に排除します。プロダクトショット、アルバムカバーのオブジェクト、テクスチャプレートにオーディオスライスを加え、カメラの動きのみをプロンプトします。保持する顔も、壊れるリップシンクもなく、すべてを768Pで撮影できます。

安価にドラフト、高価に仕上げる。 768Pは$0.10/s、2Kは$0.14/s。どちらも同じ32kHzステレオを返すため、評価するパフォーマンスは同じです。節約になるのはキープしたものではなく、失敗したもの:失敗した8秒テイクは$0.80で済み、$1.12の代わりになります。テイクが正しくなるまで768Pで回し、正しいテイクにだけ$1.12を支払います。3回の試行が必要なショットでは、$2.72対$3.36になります。層の違いの詳細は768P vs 2K比較と、単一クリップがどこまで拡張できるかはクリップ長ガイドを参照。


フルMiniMax H3ミュージックビデオの実際のコスト

以下の各行は、完了後に予測レコードから取得した実際の請求額であり、定価ではありません。

項目モデルと設定請求額
フック、70秒曲minimax/music-2.6、mp3 44.1kHz$0.15
アーティストベースフレームopenai/gpt-image-2/text-to-image、high、2048x1152$0.17
ショット1、ネオン屋上minimax/h3/reference-to-video、2K、8秒$1.12
ショット2、砂漠のハイウェイ同、2K、8秒$1.12
ショット3、白いコーブ同、2K、8秒$1.12
ショット4、水中同、2K、8秒$1.12
完成ビデオ小計 $4.80
検証プローブ768P、4秒$0.40
コントロールテイク(オーディオ無)768P、8秒$0.80
ストレステスト用ラップトラックminimax/music-2.6$0.15
リップシンクストレステスト768P、4秒$0.40
縦型Canvasカット768P、8秒、9:16$0.80
本記事用ヒーロー画像openai/gpt-image-2/text-to-image、high$0.17
制限超過テスト(24秒オーディオ)送信時に拒否$0.00
間違ったオーディオMIMEで4回送信送信時に拒否$0.00
参照オーディオ(4×8秒)無料入力$0.00
総支出 $7.53

これは、カットに採用されたショットの2Kでの完成1分あたり$9.00であり、私のミスを含む前の金額です。すべてを768Pで撮影した場合、同じ1分は$6.61になります。人間のMVクルーはどちらの数字も見積もりません。

長めの作品を予算化する場合の2つの運用上の注意。送信時の拒否は無料であるため、悪いパラメータは時間の損失のみで、他には何もかかりません。予測のpriceフィールドは遅延して入力されるため、ファイルのダウンロード後にリクエストIDを再度ポーリングして、nullではなく実際の請求額を取得してください。


誰の曲、誰の顔:公開前に確認すべきこと

短く、重要であり、説教は不要です。

参照トラックの権利が必要です。 無料入力が無料クリアランスを意味するわけではありません。商業リリースされたシングルを参照オーディオとして入力し、その出力を公開することは、削除申請への早道です。自分の録音、発注したトラック、または自分で生成したものは問題ありません。

ベースフレームを実際の存命アーティストの顔から構築しないでください。 ここでの一貫性メカニズムは、ショット間で顔を保持することに非常に優れており、それがまさに実在の人物を対象にすると悪いアイデアになる理由です。

オープンウェイトとAPIアクセスは2つの異なるライセンスです。 MiniMaxは2026年8月にH3のウェイトをHugging Faceで公開しました。そのコミュニティライセンスは現在、EU、英国、韓国、米国を除外しており、これらの地域向けに正式なライセンスチャネルが開かれています。この制限は、自分でウェイトを実行する場合に適用されます。ホスト型APIを介してモデルを呼び出すことはサービス関係であり、ウェイトライセンスの対象にはなりません。どちらの状況にいるかを認識しておく価値があります。

H3が代替案と比較してどこに位置するかについては、Seedance 2.5比較プロンプト構造ガイドを参照。なぜこの手間をかける価値があるのかの文脈として:オーディオ対応の動画編集リーダーボードでは、H3が現在1位(1,126 Elo)、Gemini Omni Flashが1,119、Dreamina Seedance 2.0が1,027です(Artificial Analysis、2026年8月10日確認)。これらのスコアは投票に応じて変動するため、スナップショットとして扱ってください。


MiniMax H3ミュージックビデオ:よくある質問

1つのMiniMax H3ミュージックビデオでフル3分間を実行できますか?

1回の生成ではできません。1回の呼び出しは15秒で制限されています。ただし、それは生成ごとの上限であり、プロジェクトごとの上限ではありません。3分間のビデオを8秒ショットで構成すると、23回の生成、約$25.76(2K)で、トラックが120 BPMであれば、それぞれが小節線に乗ります。スライス、撮影、連結、マスターの重ね合わせ。

MiniMax H3ミュージックビデオは、実際の曲を使用するのですか、それともモデルがオーディオを再生成するのですか?

実際の曲を使用します。アップロードした8秒mp3と返されたmp4内のオーディオストリームの間で、ゼロサンプルオフセットでの生波形相関が0.892であることを測定しました。プロンプトが要求したアンビエンスが重ねられています。参照オーディオなしで生成されたコントロールテイクは、同じマスターに対して0.26でした。ただし、最終的な連結では、各クリップが独自のショットごとのアンビエンスと独自のAACエンコードを持ち、カットをまたいでクリーンに残らないため、自分のマスターを重ねることをお勧めします。

MiniMax H3ミュージックビデオに曲を入力すると追加料金がかかりますか?

いいえ。私の4つの8秒参照スライスは、$4.48のショット請求に$0.00を追加しました。注意すべきは参照動画で、出力レートで課金されます。制限は、オーディオクリップ3つ、各2〜15秒、合計15秒まで。オーディオのみを参照にすることはできません。

MiniMax H3のリップシンクは、歌唱と発話でどれくらい優れていますか?

持続する歌われる母音が得意です:明確な口の形、音符に合わせたホールド、長い音符での頭を後ろに傾ける動きが、ループではなくパフォーマンスとして読み取れます。密度の高い発話は苦手です。私の毎秒6音節のラップテストでは、ビートは保ちましたが、子音の解像をやめ、開閉の繰り返しパターンに陥りました。速いバーはBロールに回してください。

MiniMax H3ミュージックビデオのすべてのショットで同じ顔を保つにはどうすればよいですか?

3つのこと、すべて退屈です。1つの参照画像を毎回の呼び出しで再利用し、再生成しない。同じ衣装の単語をプロンプト間で一字一句コピーし、言い換えない。各プロンプトに「参照画像と同一」という明示的な句を含める。私の4つのショットは、雨、低い太陽、フラットなハイキー、水中をまたいでも、ずれはありませんでした。

MiniMax H3ミュージックビデオの完成1分あたりのコストはいくらですか?

2Kでの完成1分あたり$9.00。私の実際の請求額$4.80(32秒カット)に基づきます。すべてを768Pで撮影した場合、同じ1分は$6.61で、768Pは同じ32kHzステレオを提供するため、評価するパフォーマンスは同一です。失敗したテイクは$0.80で回し、編集に残ったテイクにのみ$1.12を支払ってください。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索