Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

MiniMax H3 リップシンクとオーディオ: 6秒の音声を入力し、パイプラインから4つのツールを削除しました

MiniMax H3のリップシンクと音声は、私の6段階の吹き替え工程を1回のAPI呼び出しに置き換えました。実際のテイク2回、誰も文書化しない参照音声の制限、そして本当の請求額。

Man wearing headphones speaks into a microphone while reading a script

この記事で使うすべてのテイクの起点となる、夜勤ラジオのフレーム。openai/gpt-image-2/text-to-image、品質高、2048x1152で生成。

この1枚の静止画が、以下のチュートリアル全体の入力です。openai/gpt-image-2/text-to-image、品質高、2048x1152で生成。

最後に8秒のショットを仕上げて、音が出なかったときのことを思い出してください。

クリップをエクスポートし、TTSタブを開いてセリフを打ち込み、雨や部屋の雰囲気のサウンドライブラリを探し、それらすべてをタイムラインにドラッグして、口が嘘をつかなくなるまで波形を左右に調整し、さらに別のリップシンクモデルにお金を払って口だけを直してもらう。4つのツール、3つのWAVファイル、1時間、そしてパフォーマンスはそれでも吹き替えられたように感じられる。なぜなら吹き替えだからだ。

その連鎖こそ、MiniMax H3が静かに消し去ったものです。それは「オーディオが付いている」からではありません(そのようなモデルは数多くあります)。リクエストボディの中に、ほとんど誰も試さないスロットが1つあるからです。それが、あなたがすでに持っているオーディオを無料で渡し、その声を顔に乗せることができるというものです。

以下は、そのスロットを切り離す2テイクのテスト、それが置き換える各ステップの実際の価格、リクエストを拒否する厳しい制限、そして実際の請求額です。

主なポイント

  • 1回の呼び出しで、映像、台詞、室内音、口の動きがすべて一緒に返ってくる。テキスト、ビジュアル、オーディオはそれぞれ別々にエンコードされ、単一のOmni Transformerがビデオとオーディオの潜在変数を共同で予測する(Hugging Faceモデルカード、2026年8月)。
  • 入力オーディオは無料。入力ビデオは無料ではない。MiniMaxは参照ビデオを出力レートで請求するため、同じ15秒の素材が、楽曲としては0ドル、ビデオクリップとしては約1.95ドルになる。
  • ハードリミット:オーディオクリップは最大3つ、各2~15秒、合計15秒まで。オーディオは単体で使用できず、少なくとも1枚の画像またはビデオと一緒に送る必要がある。
  • Atlas Cloudでの2Kの料金は1秒あたり0.14ドルで、フル10秒のサウンド付きショットは1.40ドル。これは、レンダリング済みクリップに専用のリップシンクモデル(1秒あたり0.22ドル)を適用するよりも安い。

サウンドオン:2つのMiniMax H3リップシンク&オーディオテイク、6秒の違い

ヘッドホンをご用意ください。両方のテイクは、同じベースフレーム、同じ2行の台詞、同じプロンプトを、一字一句同じで使っています。違いは、片方だけが最初に6秒間の音声録音を聞いたことだけです。

fXlyer__czg

サウンドオン、ヘッドホン推奨:左側(テイクA、参照オーディオなし)は左耳で、右側(テイクB、6秒の参照オーディオあり)は右耳で再生されます。同じフレーム、同じ台詞、同じプロンプト。両テイクとも:minimax/h3/reference-to-video、2K、10秒、2560x1440、24fps、32kHzステレオトラックで納品。

テイクAはプロンプトに書かれた「落ち着いた、低く、磁気を帯びた男性の放送声」という言葉だけを頼りに、声を創作しました。テイクBは、まったく別の文の6.19秒を渡され、それを音色のアンカーとしてのみ扱うように指示されました。どちらのテイクも後から吹き替えはしていません。どちらもリップシンクモデルには触れていません。両方とも、口の動きはモデルが生成した声に従います。なぜなら、口と声は同時に生成されたからです。

音色の評価は私の言葉ではなく、ご自身の耳でお願いします。私が事実として述べられるのは、メカニズム、設定、そして請求額であり、それらを次に説明します。

MiniMax H3リップシンク&オーディオが、誰もが使っていた6ステップの吹き替えチェーンを壊した理由

これまでのチェーンは、ワークフローというより修理作業でした。

ImGr2NgcCCY

サウンドオン。夜のサーカステントの中で、3Dアニメーションのヒキガエルとカメレオンが会話している。囲いの雰囲気が台詞の下に流れている。H3ネイティブオーディオのMiniMax参照クリップ。アニメキャラクターの口の形は、偽装するのが最も難しいケースであり、だからこそ20秒の価値がある。

3つのことが常に壊れていました。それは不運ではなく、構造的な理由によるものです。

タイムラインはあなたの手の中にあった。 ビデオモデルがフレームを生成し、TTSモデルが波形を生成しました。どちらの出力も互いを知らないため、アライメントは1秒間に30フレーム、肉眼で、午前1時に行われる人間の判断でした。レンダリングのたびに、その判断をやり直す必要がありました。

パッチ式リップシンクには限界がある。 専用のリップシンクモデルは、既存の映像の口元領域だけを担当します。音声に口を合わせることはできますが、硬い子音の前に顎を緊張させたり、台詞の前に呼吸を入れたり、文が終わったときに肩を落としたりすることはできません。なぜなら、それらのフレームは、キャラクターが何を言うかが誰にもわからないままレンダリングされたからです。正確さは得られますが、パフォーマンスは得られず、不気味の谷に入ります。

サウンドデザインは別のプロジェクトだった。 雨、室内音、椅子の軋み、台詞の下に流れるベースライン。すべて別のソースから到着し、それ自体が貼り付けられた声とバランスを取る必要がありました。

オーディオVAEがMiniMax H3リップシンク&オーディオについて教えてくれること

ここがマーケティング用語ではない部分です。なぜなら、ファイル名で確認できるからです。

H3では、テキストはH3-Encoderを通り、ビジュアル入力はH3-EncoderとH3-VisualVAEの両方を通り、オーディオは単独のH3-AudioVAEのみを通ります。H3-Omni-Transformerはビデオとオーディオの潜在変数を共同で予測し、それらはビデオとステレオオーディオに別々にデコードされます。AudioVAEは左チャンネルと右チャンネルで1つのエンコーダとデコーダを共有し、それぞれを独立して処理し、ステレオ用に再結合し、32kHzのオーディオを40Hzの時間レートで潜在トークンシーケンスに圧縮します(Hugging Faceモデルカード)。

ComfyUIがデイゼロサポートをリリースしたとき、そのアーキテクチャはVAEフォルダに2つの別々のファイルとして現れました:minimax_h3_video_vae_fp16.safetensorsminimax_h3_audio_vae_fp32.safetensors。これらは、ビデオパスとオーディオパスを受け取るデュアルVAEローダーによって読み込まれます(ComfyUIブログ、2026年8月)。オーディオは、モデルが最初から組み込まれたモダリティであり、後から付け加えられたポストプロセスではありません。

リーダーボードもその効果を裏付けています。Artificial Analysisは、H3をビデオ編集リーダーボードで1位に置き、オーディオで5,043のブラインドプリファレンスサンプルから1,130 Eloを獲得しました。また、テキストtoビデオと画像toビデオの両方でトップ3に入っています(Artificial Analysis、2026年7月)。「非常に良い映像」と「そのランキングでの1位」の差は、オーディオです。

MiniMax H3リップシンク&オーディオワークフロー、従来のチェーンと比較した価格設定

これを判断する正直な方法は、雰囲気ではありません。それは、完成した10秒のショットに対して、実際の1秒あたりのレートを使って、従来のチェーンをステップごとに価格設定し、次に代替案を価格設定することです。

#従来のチェーン、ステップごと実行したものそのステップのコストMiniMax H3リップシンク&オーディオの場合
1無音の画像をレンダリングビデオモデル(例:bytedance/seedance-2.0、$0.112/s)$1.12同じ1回の呼び出し
2台詞を音声化minimax/speech-2.6-hd約$0.02(約250文字)同じ1回の呼び出し
3楽曲を探すか作るminimax/music-2.6$0.15/トラック同じ1回の呼び出し
4アンビエンスとスポットエフェクトを重ねるサウンドライブラリ+あなたの作業あなたの夜同じ1回の呼び出し
5タイムラインですべてを整列エディター+あなたの作業あなたの夜存在しない
6ミックスエディター+あなたの作業あなたの夜存在しない
7口を修正sync/lipsync-v3、$0.22/s$2.20存在しない
合計4つのモデル+2つの手作業約$3.49+あなたの夜1回の呼び出し、$1.40

7行目を2回読んでください。すでにレンダリングしたクリップの口を修正するには1秒あたり$0.22かかるのに対し、声、アンビエンス、口の動きを含むショット全体を生成するのは1秒あたり$0.14です。修正の方がオリジナルより高価です。この比較だけで全体の議論が成り立ちます。

誰も言及しない非対称性:自分のオーディオは無料だが、自分のビデオは無料ではない。

MiniMaxの従量課金価格表は、入力素材と出力を別々に記載しています。H3の場合、オーディオ入力は無料です。最初の5枚の入力画像は無料で、それ以降は1枚あたり$0.04です。入力ビデオは、出力解像度のレートで入力クリップの時間に対して課金され、2Kでは1秒あたり$0.13です(MiniMax価格ドキュメント、2026年8月3日確認)。つまり、同じ15秒の参照素材が、楽曲、ボイスメモ、クライアント提供のVOとしては無料で、ビデオクリップとしては約$1.95になります。

それが、あなたの構築方法を変えるべきラインです。参照オーディオは、モデルの中で最も安価なコントロールサーフェスであり、誰もテストしていないものです。

参照入力1クリップあたり合計課金(MiniMax)
画像最大9枚n/an/a最初の5枚は無料、その後$0.04/枚
ビデオ最大3つ2~15秒最大15秒出力レートで課金、2Kでは$0.13/秒
オーディオ最大3つ2~15秒最大15秒無料
任意の組み合わせ最大12ファイルn/an/a上記、タイプごと
オーディオ単独不可。オーディオは画像またはビデオ入力と一緒に送る必要があり、単独入力としては使用不可。

制限はモデルカードのH3-Base-Ref2VA仕様から。Atlas Cloudのminimax/h3/reference-to-videoスキーマも同じことを言っています:「少なくとも1つの画像またはビデオが必要です(オーディオ単独は許可されません)」。

Atlas側のメーターに関する2つの脚注。両方とも私自身の実行からのもので、ドキュメントページではありません。Atlasは3つのH3エンドポイントすべてに対して、出力秒数あたり一律$0.14を請求します。そして、私が添付した参照ビデオは、その上に追加料金は発生しませんでした。これは1回の観察であり、ポリシーではありません。そのため、MiniMaxのルールを予算に組み込み、一律料金はボーナスとして扱ってください。Atlasはresolution: "768P"も受け入れ、同じ$0.14で請求します。これは、こちらではなくMiniMax H3 API価格内訳で読む価値のある不一致です。

以下はすべて、Atlas Cloud上の1つのブラウザタブで実行されます:ベースフレーム、音声参照、両方のH3テイクを、1つのAPIキーと1つのポールループで。3つのH3エンドポイントは入力の形状のみが異なるため、refersimageになり、プレーンテキストになり、コードの他の部分は何も変わりません。

MiniMax H3リップシンク&オーディオ、ステップバイステップ

5つのステップ。そのうち2つは安価なセットアップ、2つは実際のテスト、最後の1つは失敗するように設計されているため、0円です。

ステップ1:GPT Image 2でベースフレームを構築

デモは夜勤のラジオホストです。理由は1つ:口のアップは、リップシンクを実際に判断できる唯一のフレーミングだからです。ワイドショットではモデルがごまかせます。

このプロンプトで譲れないことが2つあります。口は単語の途中でわずかに開いている必要があります。これにより、最初のフレームがすでに発話として読み取れます。また、フレーム内にテキストがあってはなりません。これにより、後で動的なキャプションが焼き付けられた文字と競合しません。

plaintext
1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a
2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm,
3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp
4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his
5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks
6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts
7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on
835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame.
9

openai/gpt-image-2/text-to-imageの設定:品質、サイズ16:9、2048x1152、1枚の画像。モデルリストの$0.009はトークン層の最低額であり、実際に支払う額ではありません。このサイズと品質では、実行ボタンに1回の描画あたり$0.1745と表示されます。これは以下のスクリーンショットで確認できます。

AI image generator interface showing a prompt and its generated output

Atlas Cloud上のGPT Image 2、ラジオブースのプロンプトを入力、品質高、16:9 2048x1152を選択、完成したベースフレームがOUTPUTパネルに表示されている。Atlas Cloud上のGPT Image 2:上記のプロンプト、品質高、16:9 2048x1152、そして同じフレームの2回目の描画がOUTPUTに表示。

ステップ2:6秒の音声参照を作成

このステップは多くの人が間違えるので、プロンプトの前に理由を読んでください。

参照オーディオは、ビデオで使用したい異なる文を言っている必要があります。これは音色のアンカーに過ぎません。台詞はプロンプトから来ます。MiniMax自身のreference-to-videoの例では、この分割を明示しています。あるクリップを音楽用に部分的に再利用するソーストラックとしてラベル付けし、別のクリップを純粋に「声の音色参照」として、新しい台詞はプロンプトにインラインで書かれています。参照にあなたが求めたのと同じ単語が含まれていると、モデルは声を転送する代わりにトラックをコピーするように誘導されます。

plaintext
1You're listening to Night Line, ninety-one point four, and it is coming up on
2three in the morning.
3

minimax/speech-2.6-hdの設定:落ち着いた低い男性の声ならどれでも機能します。私はMagnetic-voiced MaleEnglish_magnetic_voiced_man)を選びました。speed0.95に設定して、テイクが2~15秒のウィンドウに余裕を持って収まるようにします。volは1.0のまま、mp3出力を保持します。モデルは1,000文字あたり$0.08で、$0.10から20%割引されており、2026年8月現在有効です。私の台詞は6.19秒で返ってきて、$0.00792が請求されました。

Voice generator interface with text input and audio waveform output

Atlas Cloud上のMiniMax Speech 2.6 HD、参照の台詞がテキストフィールドに入力され、レンダリングされたオーディオ波形がOUTPUTパネルに表示されている

Atlas Cloud上のMiniMax Speech 2.6 HD:1行入力、短いmp3出力、実行ボタンに20%割引が表示されている。スクリーンショットはデフォルトのExpressive Narrator音声でキャプチャされているため、実行する前に音声ピッカーをMagnetic-voiced Maleに切り替え、Speedを0.95に下げてください。

ステップ3:参照オーディオを使用してMiniMax H3リップシンク&オーディオを実行

ここで、両方のファイルをrefersに一緒に入れます:ステップ1の静止画とステップ2のmp3です。これがテイクBです。

プロンプトは、H3がトレーニングされたセクション構造を使用します。subject_definitionsは参照が誰で何であるかを指定し、detailed_description<d>[English] ...</d>タグ内に台詞を保持し、2つのオーディオセクションはミックスを説明します。セクション名が初めての場合は、MiniMax H3プロンプトガイドで完全な構造を説明しています。オーディオワークで重要なフィールドは3つだけで、それらはすべてここにあります。

plaintext
1subject_definitions:
2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones
3half-off one ear, red ON AIR neon behind his shoulder.
4<Picture 1> is the opening frame of the target video.
5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male
6broadcast voice. Reference the timbre only; do not reuse its words.
7
8summary:
9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1>
10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the
11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone
12are generated together.
13
14detailed_description:
15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto
16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath,
17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning,
18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with
19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script,
20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d>
21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout,
22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second
23seven. No on-screen text.
24
25overall_soundscape:
26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it:
27a low electrical hum from the desk, rain steady against the glass, one distant car passing on
28the wet street, the soft creak of the chair as he leans in, and a single audible breath before
29each line.
30
31non_diegetic_music:
32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around
33second two and never rising above the dialogue.
34

minimax/h3/reference-to-videoの設定:解像度2K、時間10、アスペクト比16:9refersに両方のファイルを保持します。配列内の順序は重要ではなく、少なくともそのうちの1つが画像またはビデオであることだけが必要です。Durationスライダーのデフォルトは8なので、それを移動し、希望するフレームが必要な場合はAspect Ratioをadaptiveから切り替えてください。

4つのパラメータの罠、そのうち3つは私に費用がかかりました。キーはratioであり、aspect_ratioではありません。間違えると400が返ってきます。常にdurationを明示的に送信してください。スキーマのデフォルトは8ですが、指定しないリクエストは5秒のファイルで返ってきました。このエンドポイントでは、imagerefersと一緒に送信すると、処理は完了し、全額請求され、そのうちの1つが静かにドロップされます。また、オーディオをbase64データURLとして渡す場合は、data:audio/mp3とラベル付けし、data:audio/mpegとはしないでください。私の最初の試みはまさにこれで失敗しました:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

これは少なくとも無料なので、制限を学ぶのに役立つ方法です。

AI video generator interface showing text prompt input and video output

Atlas Cloud上のMiniMax H3 reference-to-videoプレイグラウンド。mp3がスロット1、ベースフレームがスロット2のReference Materialsに入り、解像度2K、完成したクリップがOUTPUTパネルで再生されている

Atlas Cloud上のMiniMax H3 reference-to-video:Reference Materialsが2/9で、mp3がスロット1、静止画がスロット2、解像度2K、右側に完成したクリップ。このキャプチャはプレイグラウンドのデフォルトの8秒で実行されたため、実行ボタンは$1.12と表示されています。私の上の2つのテイクは10秒で実行され、それぞれ$1.40でした。

ステップ4:MiniMax H3リップシンク&オーディオのコントロールテイクを実行

1つの入力と、それに関するすべての言及を変更します。refersからmp3を削除して画像のみにし、<Audio 2>の定義を削除し、概要から「in the voice timbre of <Audio 2>」というフレーズを削除し、ブラケットタグを[image reference]に変更します。他は何も動かさず、設定は同じまま:2K、10秒、16:9。

これが、2回目の試行ではなくコントロールにする理由です。モデルには音色のアンカーがなくなるため、書かれた説明から声を創作し、その創作した声にリップシンクします。両方のテイクは10.13秒で返ってきて、それぞれ$1.40が請求されました。セント単位で。

WnfqR2I-a-8

サウンドオン。テイクA単体:同じフレーム、同じ台詞、参照オーディオなし。ここの声はモデルの創作であり、口はそれに従います。

2つのテイク、1つの変数。これがこの記事全体で最も安価な実験であり、オーディオスロットが実際に何をするかを教えてくれる唯一の実験です。

ステップ5:意図的にMiniMax H3リップシンク&オーディオを壊す

最後のステップは無料で、一度やっておく価値があります。そうすれば、午前2時に失敗を認識できます。

mp3をrefersに入れて、それ以外は何も入れません。画像もビデオもなし、オーディオだけです。その後、送信します。

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

ここからが知っておくべき部分です。スキーマが示唆する内容とは異なります。送信呼び出しはHTTP 200を返し、通常のタスクIDと"status": "processing"を返すため、単純なクライアントは成功したと思い込みます。23ミリ秒後にはタスクは終了しています:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

その予測にはpriceフィールドは一度も表示されなかったため、費用はかかりませんでした。実用的な教訓はあなたのコードに関するものであり、ウォレットに関するものではありません。送信時の200は成功ではありません。IDをポーリングし、クリップがあると想定する前にstatusを確認してください。

MiniMax H3リップシンク&オーディオをさらに押し進める4つの方法

2テイクのテストは、最小限の有用な実験です。ここからは、同じスロットの次の使い道です。

1つのショット、複数の言語。 フレームとブロッキングはそのままに、<d>...</d>内の言語タグを変更して再実行します。口は古い言語ではなく新しい言語に従います。なぜなら、口と声は同じフォワードパスから出てくるからです。モデルカードには、アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語の11言語で安定したダイアログサポートが記載されており、他の言語もさまざまな程度でサポートされています。これら2つのクリップは、同じトレーラーに2つの異なるボイストラックを付けたもので、MiniMaxは同じセットアップからフランス語版とナレーションなし版も作成しました。

hj7ZId3KOKk

サウンドオン。英語のナレーション版:ダストオレンジの惑星での宇宙飛行士のアップ、ナレーションとスコアが映像とともに到着。トレーラー作業は、異なるサウンドスケープを持つ同じ3つのプロンプトフィールドです。

Hv62FGyBNPM

サウンドオン。日本語版、フレームごとに同じトレーラー。吹き替えは行われておらず、別のVOセッションもありません。

歌う、あなたがすでに所有しているフックを使って。 ここで、無料の入力オーディオが脚注ではなくなります。既存のフックやインストゥルメンタルを15秒以内でrefersにドロップし、パフォーマンスを記述すると、キャラクターがそれに合わせてパフォーマンスします。あなたが持ってきた音楽に対しては支払いません。

zui3Zw_UWnY

サウンドオン。レトロなカムコーダールックのバンドカット、バックステージからパフォーマンスへ、トラックと映像が一緒に到着。これが、ほとんどのミュージックビデオ作業が実際に望む形です。

2人の会話は1人より難しい。 アップでの単一話者は簡単なケースであり、まさにこの記事がそれを使用した理由です。2人のキャラクター間のダイアログの場合、MiniMax自身の例のように、各<d>行に<Subject 1> (S1)<Subject 2> (S2)を付けて明示的にラベル付けし、モデルが順序や帰属を間違えた場合に再実行することを想定してください。2人の会話には2回の実行を予算に組み込んでください。

一言も発さないアンビエンス。 overall_soundscapeはそれ自体がフィールドであり、台詞がまったくなくても機能します。窓の雨、椅子の軋み、冷蔵庫のハム、部屋そのもの。これにより、同じエンドポイントが正当なASMRおよびアンビエンスツールとなり、口が問題にならない唯一の用途です。

私自身の2つのテイクからの正直な限界:同時生成により、口と声は一致しますが、フレーム内のすべての物理的な詳細が音と一致するわけではありません。短い時間に詰め込まれた長い台詞、曖昧なパフォーマンス指示、および複数話者のシーンはすべて結果を劣化させます。出荷する前に、人間の俳優のテイクを見るのと同じように、クリップを確認してください。

MiniMax H3リップシンク&オーディオが実際に私にいくらかかったか

以下の数字はすべて、実際のアカウントでの実際の請求額であり、後から取得しました。予測のpriceフィールドは遅れて入力されるため、completedになるまでポーリングしても何も返ってこないことがよくあります。IDを再取得して数値を取得してください。

ステップモデル実行したもの請求額
1openai/gpt-image-2/text-to-image1枚のベースフレーム、品質高、2048x1152$0.1745(実行ボタンに表示)
2minimax/speech-2.6-hd99文字、6.19秒の参照音声$0.01
3minimax/h3/reference-to-videoテイクB、10秒、2K、refersに画像+オーディオ$1.40
4minimax/h3/reference-to-videoテイクA、10秒、2K、画像のみ$1.40
5minimax/h3/reference-to-videoオーディオのみのリクエスト、23msで失敗$0.00
実験全体、両方のテイク約$2.98

2つの会計メモ。正直さは脚注よりも安価です。ステップ3の悪いaudio/mpegデータURLも、送信時に400になったため、費用はかかりませんでした。拒否は無料ですが、適切に形成されたリクエストで入力が壊れている場合は無料ではありません。つまり、静かに404を返す参照URLは、全額請求されます。また、ステップ3のスクリーンショットのプレイグラウンドキャプチャは、パネルのデフォルトの8秒での3回目のH3実行であり、テーブルの上に$1.12が請求されました。その実行は、この記事のためであり、実験のためではありません。

上記の表で価格設定された従来のチェーンは、1つの10秒ショットで約$3.49、さらに手動調整の夕方分でした。これは、サウンド付きの2つの完全な10秒ショット、管理されたA/B、および2つの意図的に壊したリクエストで、それよりも少ない費用でした。

とはいえ、H3は多くの人が渡そうとするいくつかのジョブには間違ったツールであり、代替案はより安価です。

実際に欲しいもの適切なモデル価格理由
1枚のポートレート+既存のオーディオファイル、トーキングヘッドにbytedance/avatar-omni-human-v1.5$0.12/s専用のオーディオtoビデオ、出力長はオーディオに従う
口を新しい言語で話させたい完成したクリップsync/lipsync-v3$0.22/sH3は既存のレンダリングを変更せず、パッチ適用はまさにこのモデルの仕事
トーキングヘッドの最も安価な口の修正veed/lipsync$0.013/s約10倍安く、口だけに触れ、パフォーマンスには触れない
音色、アンビエンス、スコアがすべて一緒になった完全な指示されたショットminimax/h3/reference-to-video$0.14/s映像と音声が1パスから来るため、パフォーマンスは修理ではなく設計される

H3と、オーディオではなくキャラクターワークで最も近いライバルを比較する場合は、Seedance 2.5の比較の方が適切です。また、オープンウェイトでこれが無料になるかどうか疑問に思っているなら、それは高速にはなりません。2KはまだAPI側から来ており、コミュニティのレポートによると、コンシューマーカードでの10秒480pのローカルレンダリングは秒ではなく数分かかります。

声、歌、権利に関する正直な注意

無料でアップロードできることと、無料で使用できることは同じではありません。あなたが書いていない曲と、あなたのものではない声は、それぞれ別の許可であり、アップロードに料金を請求しないAPIによって付与されるものではありません。あなた自身の録音、ライセンスされた音楽、または自分で生成した合成音声を使用してください。これはまさにステップ2が行うことです。

別途、コミュニティウェイトには、現在EU、英国、韓国、米国をカバーしていない地域制限があり、代わりに正式なライセンスチャネルが開かれています。これはより長い話であり、MiniMax H3オープンウェイトガイドで説明されています。

MiniMax H3リップシンク&オーディオ:よくある質問

MiniMax H3リップシンク&オーディオは、本当に同じパスで音を生成するのですか、それとも後から吹き替えられるのですか?

同じパスです。テキストはH3-Encoderを通り、ビジュアルはH3-EncoderとH3-VisualVAEを通り、オーディオは単独のH3-AudioVAEを通ります。H3-Omni-Transformerはビデオとオーディオの潜在変数を共同で予測し、その後、別々に画像と32kHzステレオオーディオにデコードされます。後から何も重ねられないため、口、呼吸、部屋の音はすべて同じテイクに属します。

自分の曲や声をMiniMax H3リップシンク&オーディオにフィードできますか?また、追加料金はかかりますか?

できます。無料です。MiniMaxの従量課金表では、H3オーディオ入力は無料と記載されています。注意すべき非対称性はビデオです。入力ビデオは出力レートで時間に対して課金され、2Kでは1秒あたり$0.13です。そのため、15秒の参照ビデオは約$1.95かかりますが、15秒の参照オーディオは$0です。

なぜMiniMax H3リップシンク&オーディオは、オーディオのみのリクエストを拒否するのですか?

オーディオは単独で使用できない唯一の参照タイプだからです。少なくとも1枚の画像またはビデオを伴う必要があります。その他の制限(H3-Base-Ref2VA仕様より):画像は最大9枚、ビデオは最大3つ、オーディオクリップは最大3つ、各ビデオまたはオーディオクリップは2~15秒、タイプごとに合計15秒、1つのリクエスト内の全タイプで最大12ファイル。

MiniMax H3リップシンク&オーディオは、クリップ全体で保持されますか、それとも最初の行だけですか?

呼吸の余地がある単一話者の場合、1行を決めてドリフトするのではなく、クリップ全体で保持されます。それを壊す3つのこと:短い時間に長い台詞を詰め込むこと、曖昧または欠落したパフォーマンス指示、およびモデルが誰がいつ話すかを決定する必要がある複数話者のシーン。各台詞にラベル付きの話者と、それを言うのに十分な秒数を与えてください。

MiniMax H3リップシンク&オーディオは、別の言語のために再吹き替えが必要ですか?

いいえ。ダイアログマークアップ内の言語タグを、<d>[English] ...</d>から<d>[Japanese] ...</d>に変更し、同じプロンプトを再実行します。口は新しい声とともに生成されるため、古い言語ではなく新しい言語に一致します。モデルカードには、11言語で安定したダイアログサポートが記載されています。

MiniMax H3リップシンク&オーディオをローカルで実行する方が安いですか?

クリップあたりのコストは安くなりますが、他のすべての面で高価です。ウェイトはオープンですが、16GBのコンシューマーカードでのローカル実行に関するコミュニティレポートでは、10秒の480p生成が数分かかり、セルフホスティングは768の短辺でレンダリングされ、2Kは依然としてAPI側の再生成ステップから来ます。コミュニティライセンスの地域制限を加えると、完成した作品にはAPIが実用的な道です。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索