このモデルに関する記事は、どれも同じところで足踏みしている。9枚の画像、3本の動画クリップ、3本の音声クリップ、合計12ファイル。保証書のようだ。
そこで、私は保証書のように扱うことにした。キャラクターを作り、小道具を作り、夜のシーンを生成し、その夜のシーンを参照動画として再入力し、8秒のジャズを参照音声トラックに切り出し、3種類の参照すべてを1回のリクエストで送信した。そして、どのルールをAPIが実際に守るのかを確かめるために、意図的にルールを破り始めた。
そのうちの4つは、予想とは異なる守られ方をしている。1つは、頼んでもいない動画に対して全額を請求し、期待するエラーメッセージは決して届かない。最後まで読む価値があるのは、その1つだ。
重要なポイント
- 3種類の参照、1つの配列。 最大9枚の画像、3本の動画クリップ、3本の音声クリップ、合計12ファイル。これらはすべて同じ
refersフィールドに入れられ、typeはオプション(APIがファイル拡張子から推測するため)。 - 音声だけでは絶対に使えない。 音声のみのリクエストは、名前付きエラーで拒否される。少なくとも1枚の画像か1本の動画と一緒に送る必要がある。
- 動画への参照と画像からの動画生成は排他的だが、そのことを知らせるものは何もない。 先頭フレームの
imageをrefersと一緒に送ると、ジョブは普通に完了する。2つの入力のうち1つは、黙って破棄され、全額が請求される。2026年8月12日に、両方のエンドポイントで2回確認済み。 - 送信時には何も検証されない。 この記事のすべての間違ったリクエストはHTTP 200とIDを返した。本当の判定は、2~3分後の生成段階で下される。そこで拒否されれば無料、完了すれば有料。
- 余分な参照ファイルは無料。 参照画像1枚でも10枚でも、同じクリップ長に対してまったく同じ金額が請求される。料金は入力ファイル数ではなく、出力秒数に従う。
以下がその結果だ。2つのショット、1人の顔、まったく異なる2つの場所。そして2つ目のショットは、画像、動画、音声ファイルを同時に使って生成された。
ショットA(雨、夜、ネオン街の路地)、次にショットB(翌朝の誰もいない屋内市場)、つなぎ以外は何も加えずにカット編集。同じ女性、同じ右眉上の傷、同じインディゴブルーのジャケット、同じタオル。ショットBは、3つの参照(彼女のポートレート、ショットAのクリップ自体、8秒のジャズの断片)から同時に生成された。両方のショットは、minimax/h3/reference-to-video、2K、2560x1440、24fps、ネイティブの32kHzステレオトラック。後半で彼女がセリフを言う場面では、音声をオンにする価値がある。
なぜMiniMax H3参照-to-動画が、あなたが書けるどんなプロンプトよりも優れているのか
プロンプトは人物を説明する。参照はその人物そのものだ。この違いこそが、このエンドポイントが存在する理由のすべてであり、MiniMax H3が現在ビデオ編集リーダーボードのトップ(Elo 1,125、10,280票、Artificial Analysis、2026年8月)にいる理由でもある。ただし、この数字については正確にしておく価値がある。同じ表では、ランク範囲は1~2位で、Google Gemini Omni Flash(1,122)と統計的に同率である。1位だが、信頼区間を共有している。H3がテキストから動画と画像から動画の両方でトップ3に入るという関連する主張は、同じラボの発表ポストからのものだ(Artificial Analysis on X、2026年8月)。
ランクは安い。ここに実際の挙動を示す。同じプロンプト、3段階の参照、他はすべて同一。

同じプロンプトでの3つのMiniMax H3参照-to-動画実行:参照なし、キャラクター参照画像1枚、参照画像2枚
同じプロンプト、同じ768P 4秒設定、左から右:参照なし(テキストから動画)、キャラクター参照画像1枚、参照画像2枚(キャラクター+ラーメン丼)。プロンプトは3つすべてで「参照画像の女性」と言っている。左のパネルでは、そのフレーズは誰も指していないため、モデルは見知らぬ人をでっち上げる。minimax/h3/text-to-videoとminimax/h3/reference-to-videoで生成。
このストリップから正直に読み取れることが2つある。パネル1からパネル2への飛躍は大きい。参照がない場合、「参照画像の女性」は何も指さないフレーズであり、モデルは静かにその穴を埋め、あなたのプロジェクトとは無関係な人物を生成する。パネル2からパネル3への飛躍はずっと小さい。なぜなら、私のプロンプトはその丼についても言葉で説明しており、H3はテキストだけからでも、鶴の描かれたまずまずの紺色の丼を描いたからだ。これが有用な部分だ。参照画像と適切な名詞句は同じ役割を競うため、言語では特定できないもの(特定の顔、特定の製品、特定のロゴ)に参照スロットを使うべきだ。
この記事のほぼすべての失敗の背後にあるパターンは、パネル1と同じだ。リクエストの一部が何もないところに着地したことを警告するものは何もない。
参照が実際に固定するものと、固定しないもの。 参照画像はアイデンティティを固定する。顔の構造、髪、識別マーク、衣服。照明は固定しない。これが最もよくある驚きだ。また、参照写真の光も一緒に引きずってくる。そのため、雰囲気のある環境で撮影されたキャラクターシートは、シーンチェンジに耐えられないキャラクターを生み出す。参照はフラットでニュートラルに撮影すべきだ。参照動画は動き、グレーディング、グレインを固定する。アイデンティティは固定しない。参照音声は音声ベッドそのものを固定する。同じ顔が同じ声でセリフを言い、それが一連のシーンにわたって必要な場合、参照スタックは3つの異なる役割を果たしており、どれがどれかを指定する必要がある。実務者ガイドは、プロンプト内でそれらを位置的に命名する(「画像1はキャラクター、画像2は製品」)ことに収束しており、その慣習を採用する価値がある。以下の私のプロンプトでは代わりにプレーンな説明的命名を使用しているが、これは参照が視覚的に曖昧でない場合にも機能する。
なぜ最初の呼び出しはたいてい期待を裏切るのか。 4つの理由、すべて2026年8月12日に測定:
- 送信エンドポイントは何も検証しない。間違ったMIME、164秒の音声、デッドURL、排他的なフィールド:すべてがHTTP 200と予測IDを返す。後で判明する。
ratioのデフォルトはadaptiveで、「モデルに選択させる」とドキュメントに記載されている。16:9の参照では、adaptiveのままでも16:9を強制しても1344x768(768P)になったので、入力が既に一致している場合、デフォルトは無害だ。一致していない場合はコイントスであり、これがH3エンドポイントの中で、単にモデルに決定を委ねることができる唯一のものではない。- 先頭フレームの画像と参照を一緒に送ってもエラーにならない。そのうちの1つを黙ってドロップし、請求する。
- モデルが具体的に掴むものを持たない場合、自信を持って穴を埋める。自信満々の間違った顔は、成功した実行とまったく同じに見える。
プロンプト作成の側面については、MiniMax H3プロンプトガイドが、ここで私ができるよりも詳しく説明している。
MiniMax H3参照-to-動画ルールブック:3つのタイプ、1つのリクエスト
3つの参照タイプはすべて1つの配列を共有する。以下が公開されている契約書と、実際にエンドポイントを押したときに何が起こったかを並べたものだ。
表1:3つの参照タイプ
| 参照画像 | 参照動画 | 参照音声 | |
|---|---|---|---|
| 最大ファイル数 | 9 | 3クリップ | 3クリップ |
| 合計上限 | 3タイプ全部で12ファイル | ||
| ファイルあたりの長さ | n/a | 2~15秒 | 2~15秒 |
| 合計時間 | n/a | 15秒 | 15秒 |
| フォーマット | png, jpeg, jpg, webp | mp4, mov | mp3, wav |
| 単独使用の可否 | 可 | 可 | 不可、画像または動画が必要 |
| 固定するもの | アイデンティティ、衣服、製品、スタイル | 動き、カメラ、グレーディング、グレイン | 音声ベッドそのもの |
| 固定しないもの | 新しいシーンの照明 | ショットに誰が映っているか | 正確なトラック(ステップ6参照) |
| 配信方法 | 公開URLまたはbase64 data URL | 公開URLまたはbase64 data URL | audio/mp3(audio/mpegではない)と宣言する必要がある |
| 強制されるか? | 10枚の画像は問題なく通った | 1クリップ以上はテストしていない | クリップごとのウィンドウは強制、合計15秒は強制されなかった |
ファイル数と時間枠はMiniMaxの公開制限(Hailuo、2026年8月)であり、同じ参照動画のウィンドウ(各2~15秒、合計15秒)を記載したローンチ記事(MarkTechPost、2026年8月)と照合済み。最後の3行はすべて私が測定したものだ。
仕様書に書かれていないことが2つある。第一に、各エントリのtypeフィールドはオプションで、URLの拡張子から推測される。つまり、base64 data URLまたは拡張子のないリンクは、必ずタイプを宣言する必要がある。そうしないとリクエストが間違った推測をする。第二に、ブラウザのアップローダーは9ファイル(Reference Materials (2/9)、MAX:9、下のステップ5のスクリーンショット参照)で上限に達するが、これはMiniMax自身の12ファイルよりも少ない。私はとにかくAPI経由で10枚の参照画像を送信したが、ジョブは正常に完了した。したがって、9はUIの制限であり、モデルの制限ではない。
表2:参照-to-動画 vs 画像-to-動画 vs テキスト-to-動画
| reference-to-video | image-to-video | text-to-video | |
|---|---|---|---|
| refersを受け入れるか | はい、必須、最低1つ | いいえ(黙って無視される) | いいえ |
| 先頭フレーム画像を受け入れるか | いいえ(黙って無視される) | はい、必須 | いいえ |
| 最終フレーム画像(end_image)を受け入れるか | いいえ | はい | いいえ |
| アスペクト比オプション | 7つすべて(16:9、9:16、21:9を含む) | adaptiveのみ | 7つすべて |
| 解像度 | 768Pまたは2K、デフォルト2K | 同じ | 同じ |
| 長さ | 4~15秒の整数、デフォルト8 | 同じ | 同じ |
| もう一方のエンドポイントの入力を混在させる | ジョブ完了、入力ドロップ、全額請求 | ジョブ完了、refersドロップ、全額請求 | n/a |
この4行目が、誰も言及しない違いだ。画像から動画では、アスペクト比の列挙型にはadaptiveの1つだけが含まれている。なぜなら、最初のフレームが形状を決定するからだ。参照から動画では、7つすべてが利用可能であり、これがキャラクターを固定しながらもフレーム形状を強制できる唯一のH3エンドポイントとなる。この作業の階層を選ぶなら、MiniMax H3の2K vs 768Pで、追加のピクセルが何をもたらすかを説明している。
最後の行が高くつく。ドキュメントでは2つのエンドポイントを排他的としているが、その意味では(入力パスの1つだけが尊重されるという意味で)排他的である。しかし、エラーはない。2026年8月12日に両方向でテストした。reference-to-video呼び出しに先頭フレームのimageを含めたものは115秒で完了し、$0.40が請求された。また、image-to-video呼び出しにrefersを含めたものは167秒で完了し、$0.40が請求された。両方とも動画を生成した。両方とも、私が送信した半分を捨てた。そして、レスポンスのどのフィールドも、どの半分が捨てられたかを示さない。
表3:このワークフローで使用するモデル
以下はすべて、Atlas Cloudの1つのブラウザタブで実行される。価格とスクリーンショットの典拠もそこから。レートは2026年8月12日現在。
| ステップ | モデル | レート | 実行回数 | コスト |
|---|---|---|---|---|
| キャラクター+小道具の参照 | openai/gpt-image-2/text-to-image | 記載価格 $0.009から;2048x1152の高品質で測定値 $0.1745 | 2 | $0.35 |
| 参照音声 | minimax/music-2.6 | トラックあたり $0.15 | 1 | $0.15 |
| ショットAとショットB | minimax/h3/reference-to-video | 768Pで $0.10/秒、2Kで $0.14/秒 | 2 x 8s at 2K | $2.24 |
| 参照ラダー | 同じ、さらに minimax/h3/text-to-video | 768Pで $0.10/秒 | 3 x 4s at 768P | $1.20 |
今月、3つのH3エンドポイントのいずれにも割引は適用されていない。参照静止画のみを構築するのであれば、近隣の2つのモデルが現在安い。gpt-image-2-developer/text-to-imageは50%オフで、$0.009から$0.004(2026年8月現在)。完全な秒単位の内訳は、MiniMax H3 API価格ガイドに記載されている。
MiniMax H3参照-to-動画、ステップバイステップ
シチュエーション:ラーメン屋台を営む女性。ショットAは雨のネオン街の路地、夜。ショットBは同じ女性の翌朝、誰もいない屋内市場、別の場所、別の時間帯、別のレンズ。2つの呼び出しの間で、参照以外に引き継がれるものは何もない。これがテストのポイントだ。
ステップ1:キャラクター参照を、意図的にフラットな照明で作る
これが多くの人が間違えるステップだ。キャラクター参照は、あなたのキャラクターの素敵な写真ではなく、その顔の測定値である。ニュートラルな光、無地の背景、シーンなし、ムードなし。H3は顔と一緒に光も学習するため、雰囲気のある参照は、その雰囲気に固定されたキャラクターを生み出す。
モデル:openai/gpt-image-2/text-to-image。設定:品質 高、サイズ 2048x1152(16:9)、フォーマット png。
text1Editorial photograph of a woman in her early thirties, a street-food chef. Close three-quarter portrait, neutral expression, direct eye contact with camera. Short black hair tucked behind one ear, a small scar above the right eyebrow, warm olive skin. She wears a faded indigo work jacket with the sleeves rolled to the elbow and a folded white towel over the left shoulder. Plain light grey studio background, soft even key light, no props, sharp focus on the face, natural skin texture, no retouching. Photorealistic, 50mm lens. 2

Atlas Cloud上のGPT Image 2プレイグラウンド。キャラクター参照プロンプトが読み込まれ、出力パネルに完成したポートレートが表示されている。
Atlas Cloud上のGPT Image 2。品質を高、16:9に設定。右側にキャラクターシートがレンダリングされている。

MiniMax H3参照-to-動画用のキャラクター参照画像。右眉の上に傷のあるラーメンシェフのニュートラルなスタジオポートレート。
参照画像1。右眉の上の傷と折り畳まれた白いタオルは、意図的なものだ。後のすべてのフレームで確認できる、安価で曖昧さのないアイデンティティのアンカーとなる。
ステップ2:小道具の参照を作る
2つ目の参照スロット、2つ目の仕事。物体は顔よりもここでうまく動作する。そのため、特徴的な小道具は、参照がちゃんと使われたことを証明する最も簡単な方法となる。同じモデル、同じ設定。
text1Product photograph of a single dark navy ceramic ramen bowl with a hand-painted white crane on the side, chipped at the rim, filled with steaming shoyu ramen. Straight-on view, plain light grey background, soft even light, sharp focus, photorealistic, 50mm lens. 2

小道具の参照画像。手描きの白い鶴と欠けた縁のある濃紺のラーメン丼。
参照画像2。手描きの鶴と縁の欠けが目印だ。これらが動画でもそのまま残っていれば、参照が読み込まれた証拠となる。
ステップ3:ショットA、2枚の画像をMiniMax H3参照-to-動画へ
2枚の参照画像(両方ともtype: "image")をrefersに入れる。アスペクト比は明示的に設定する。adaptiveがデフォルトで、参照が既に16:9の場合は通常は正しく動作するが、モデルが決定する。そしてこのエンドポイントでは、その決定を許す必要はない。
モデル:minimax/h3/reference-to-video。設定:解像度 2K、長さ 8、アスペクト比 16:9。
text1Wide establishing shot. Heavy rain at night in a narrow neon-lit alley. The woman from the reference image works alone behind a small steaming ramen stall under a plastic awning, ladling broth into the navy bowl with the white crane from the reference image. Steam rises through pink and green neon reflections on the wet pavement. Slow push-in on the stall. Ambient sound: rain on plastic, boiling broth, distant traffic. No dialogue. 2
この呼び出しの出力が、冒頭のショーケースクリップの前半部分だ。そのURLを保持しておく。ステップ5への入力となる。
ステップ4:8秒の参照音声をカットする
参照音声はサウンドトラックスロットではない。モデルが自身のミックスを照合するためのベッドであり、このエンドポイントで最も扱いにくい入力だ。トラックを生成し、それを切り詰める。フルソングは拒否されるため。
モデル:minimax/music-2.6、is_instrumental: true、format: "mp3"。
text1Sparse late-night jazz, brushed snare, upright bass, one muted trumpet, melancholic, 70 BPM, instrumental. 2
次に、大体8秒程度にスライスし、data:audio/mp3 URLとしてエンコードする。ここで最初に3つの間違いを犯したが、すべて正確なエラーテキスト付きだ。
- MIME文字列はバイトよりも重要。
data:audio/mpegと宣言すると、ファイルは完全に普通のMP3であるにもかかわらず、参照は「audio format ".mpeg" not allowed」で拒否される。audio/mp3と書くこと。 - クリップあたり2~15秒、これは強制される。 生成したトラックは164秒だった。
invalid param: audio duration 164258 ms, expected [2000, 15000] msというエラーが返ってきた。8.05秒にスライスすると修正された。どちらの拒否も無料だった。 - 15秒の合計上限はドキュメントに記載されているが、強制されない。 同じリクエストで8秒のクリップを2つ(合計16.1秒)送信し、拒否を期待した。ジョブは正常に完了し、請求された。それを当てにしてはいけない。公開された制限であり、いつでもそのように振る舞い始める可能性がある。

Atlas Cloud上のMiniMax Music 2.6プレイグラウンド。ジャズのプロンプトと、出力パネルに完成したトラックが表示されている。
Atlas Cloud上のMiniMax Music 2.6、1回の実行で$0.15。右側に完成したトラック。このスクリーンショットからコピーすべきことと、すべきでないことが1つずつある。価格とmp3フォーマットは正しいが、Is Instrumentalがまだオフになっており、ページのデモ歌詞がまだボックスに入っている。そのため、この特定の実行はボーカル入りの1:35の曲として返ってきた。実行する前にそのトグルをオンにし、歌詞フィールドをクリアしておくこと。そうしないと、誰かが歌っている上に参照ベッドを重ねることになる。私のAPI実行(isinstrumental: true)では、209秒で2:44のインストゥルメンタルが返ってきた。
ステップ5:ショットB、3つのタイプすべてを使った1回のMiniMax H3参照-to-動画呼び出し
これがキーワードが本当に指している呼び出しだ。3つの参照タイプ、3つの異なる役割、1つの配列:
- ステップ1のキャラクターポートレート、
type: "image"、彼女の顔を保持するため - ステップ3のショットA mp4、
type: "video"、カットをまたいでグレードとグレインを運ぶため - ステップ4の8秒のジャズスライス、
type: "audio"、ベッドとして
プラットフォーム上の他の生成物の出力URLは、動画参照としてそのままrefersにドロップできる。これがマルチショットの連続性の背後にある実際のメカニズムだ。「H3があなたのキャラクターを覚えている」わけではない。前のショットをそれに手渡すのだ。
モデル:minimax/h3/reference-to-video。設定:解像度 2K、長さ 8、アスペクト比 16:9。
text1The same woman from the reference image, the next morning. Bright empty covered market, cold clean daylight through a skylight, shutters still down behind her. Medium close-up, static camera. She wipes the counter with the folded white towel, looks up at the camera and says one line, then goes back to work. Keep her face, hair, scar and indigo jacket identical to the reference. Carry the grade and grain of the reference clip. Use the reference audio as the underscore. 2

Atlas Cloud上のMiniMax H3参照-to-動画プレイグラウンド。画像と音声の参照が読み込まれ、出力パネルに生成されたクリップが表示されている。
2K、8秒でのMiniMax H3 Reference-to-Videoプレイグラウンドでの同じ呼び出し。Reference Materials (2/9)に、異なるタイプの2つの参照スロットが見える。スロット1はref-audio-8s.mp3、スロット2は彼女のポートレートだ。動画参照は、「Add via link」(そのパネルの右上)またはAPI経由で入力される。これはディスク上ではなくURLにあるためだ。このパネルから読み取るべきことが3つある。アップローダーはMAX:9と表示しているが、MiniMax自身の上限は12である。アスペクト比は変更しない限りadaptiveのままである。2K、8秒での実行価格は$1.12で、これは$0.14/秒のティアに相当する。
ステップ6:参照が実際に使われたことを確認する
ジョブが完了したことは、成功したことを意味しない。2つの確認方法、どちらも安価だ。
顔を確認する。 各ショットから1フレームを抽出し、並べて表示する。あなたが植えたアンカー(傷、髪の生え際、ジャケット、タオル)を探している。

ショットAのフレームとショットBのフレームを並べたもの。同じMiniMax H3参照-to-動画キャラクターが2つの異なるシーンにいることを示している。
左:ショットA、夜、ネオン、ワイド。右:ショットB、屋内市場、翌朝、ミディアムクローズアップ。同じ顔、同じ右眉の上の傷、同じジャケットとタオル。参照だけを共有して、シーンとフレーミングが変わっている。
プロンプトに書いた通りにならなかったことが1つある。私は「明るく誰もいない屋内市場、冷たく清潔な日光」と「参照クリップのグレードとグレインを引き継ぐ」の両方を要求したが、参照クリップが勝った。ショットBは間違いなく朝であり、間違いなく別の場所であるが、「明るい」という言葉が示唆するよりもはるかにムーディーだ。なぜなら、夜のグレードが動画参照と一緒に引き継がれたからだ。同じルックと反対の光を1回の呼び出しで要求することはできない。光を変える必要があるなら、グレードの指示を外すか、動画参照を外して画像だけでアイデンティティを保持する。
音声を確認する。 アップロードした8秒のスライスの波形と、mp4の中に戻ってきたトラックを並べてプロットする。さらに、音声参照をまったく使わずに生成したクリップをコントロールとして追加する。

アップロードした8秒の参照音声、生成されたクリップ内に返された音声トラック、音声参照なしのコントロールの波形。
上:参照として送信した8.05秒のジャズスライス。中:返されたショットBのmp4から抽出されたトラック。約5.5秒のセリフのラインが支配的。下:ショットA、同じワークフロー、音声参照なし。
ここで、私が当初信じていたことを修正しなければならない。参照音声は逐語的に返ってくるわけではない。私のスライスと返されたトラックの間のエンベロープ相関は0.25であり、参照なしのコントロールは−0.05だった。したがって、両者は関連しているが、同一にはほど遠い。返された形状は、明らかに私のファイルに何かが重ねられたものではなく、独自のミックスである。参照が明らかに行ったことは、何かを下に置いたことだ。ショットBのベッドは、セリフが始まる前の最初の5秒間、音声なしのコントロールよりも約7dBホットである。参照音声は、ミックスへのステアリングとして読み取るべきであり、音楽スロットではない。正確なトラックを映像の下に必要とするなら、後で重ねること。
この音声面を構築するなら、MiniMax H3リップシンクと音声およびMiniMax H3ミュージックビデオのチュートリアルは、どちらもこの同じ参照音声の動作から始まっている。これらすべてに関するポーリングとリトライコードについては、MiniMax H3チュートリアルにループが記載されている。
さらに4つのMiniMax H3参照-to-動画セットアップ(盗む価値あり)
既に持っているクリップをリスタイルする。 完成したクリップを動画参照としてrefersに入れ、画像は一切入れずに、別の画風をリクエストする。動き、フレーミング、プッシュイン、小道具はそのまま残り、表面だけが変わる。これがH3のビデオ編集ランキングの背後にあるメカニズムであり、MiniMax H3 vs Veo 3.1 for animeのアニメ作品の背後にあるものと同じだ。

ショットAのクリップをMiniMax H3参照-to-動画の参照として使用して生成されたアニメスタイルへのリスタイル。
ショットAの路地を唯一の参照として渡し、セルシェーディングアニメのプロンプトを与えた。同じ屋台、同じおたま、同じ鶴の丼、同じプッシュイン、描き直されている。知っておく価値のある詳細が1つある。変換は最初のフレームで最も弱く、カメラが動きにコミットすると最も強くなる。無音のGIFとして表示。minimax/h3/reference-to-video、768P、4s、$0.40で生成。
写真を歌わせる。 1枚のポートレートと、2~15秒のウィンドウ内の1つのボーカルクリップ。パフォーマンスをプロンプトで指定する。リップシンクパイプラインよりも安価。なぜなら、それは単一の呼び出しだからだ。
製品を任意のシーンに固定する。 参照画像は顔よりも物体を強く固定する。したがって、実際の製品写真とシーンプロンプトの組み合わせは、このエンドポイントで最も信頼性が高い。広告で使用する前に、結果をどう扱うことが許可されているかを確認すること。
シリーズを構築する(クリップではない)。 チェーン接続する。ショットNの出力がショットN+1の動画参照になる。各呼び出しは依然として15秒に制限されているため、連続性はあなたの仕事であり、モデルの仕事ではない。MiniMax H3の動画の最大長で、その上限がどこで問題になるかを説明している。
シリーズを1つのエンジンにコミットする前にエンジンを比較する?Seedance 2.5 vs MiniMax H3とMiniMax H3の代替案が読むべき2つだ。
2ショットのMiniMax H3参照-to-動画シーンの実際のコスト
以下の各行は、2026年8月12日からの実際のジョブであり、金額は各完了予測に対してAPIが返すpriceフィールドから取得したものだ。
表4:実際の請求額
| ジョブ | モデル | 設定 | 結果 | 請求額 |
|---|---|---|---|---|
| キャラクター参照 | gpt-image-2 | high, 2048x1152 | 完了 | $0.1745 |
| 小道具参照 | gpt-image-2 | high, 2048x1152 | 完了 | $0.1745 |
| 参照音声 | music-2.6 | instrumental, mp3 | 完了、164sトラック、209s待機 | $0.15 |
| ショットA | h3/reference-to-video | 2K, 8s, 2 image refs | 309秒で完了 | $1.12 |
| ショットB | h3/reference-to-video | 2K, 8s, image + video + audio refs | 557秒で完了 | $1.12 |
| ラダー、参照なし | h3/text-to-video | 768P, 4s | 154秒で完了 | $0.40 |
| ラダー、画像参照1枚 | h3/reference-to-video | 768P, 4s | 119秒で完了 | $0.40 |
| ラダー、画像参照2枚 | h3/reference-to-video | 768P, 4s | 128秒で完了 | $0.40 |
| アニメリスタイル | h3/reference-to-video | 768P, 4s, 1 video ref | 239秒で完了 | $0.40 |
| プレイグラウンドでのステップ5再実行 | h3/reference-to-video | 2K, 8s, image + audio refs | 完了 | $1.12 |
| コントロール:画像参照10枚 | h3/reference-to-video | 768P, 4s | 150秒で完了 | $0.40 |
| コントロール:先頭フレーム画像 + refers | h3/reference-to-video | 768P, 4s | 完了、1つの入力がドロップ | $0.40 |
| コントロール:image-to-videoにrefers | h3/image-to-video | 768P, 4s | 完了、refersがドロップ | $0.40 |
| コントロール:参照音声16.1秒 | h3/reference-to-video | 768P, 4s | 文書化された制限を超えて完了 | $0.40 |
| コントロール:ratio省略、次にratio adaptive | h3/reference-to-video | 768P, 4s, 2回 | 両方完了、同一の1344x768 | $0.80 |
| ステップ1と4のスクリーンショット再実行 | gpt-image-2, music-2.6 | 上記と同じ | 完了 | $0.32 |
| コントロール:音声参照のみ | h3/reference-to-video | 768P, 4s | 7msで失敗 | $0.00 |
| コントロール:164秒参照音声 | h3/reference-to-video | 768P, 4s | 16秒で失敗 | $0.00 |
| コントロール:audio/mpeg MIME | h3/reference-to-video | 768P, 4s | 17秒で失敗 | $0.00 |
| コントロール:デッド参照URL | h3/reference-to-video | 768P, 4s | 21秒で失敗 | $0.00 |
| 合計 | $8.18 |
その合計を正直に分割する。この記事の冒頭にある完成した2ショットシーン(参照と音声を含む)は、そのうちの$2.74である。残りの$5.44は調査費用だ。コントロール、意図的な破壊テスト、スクリーンショットのためのブラウザでのステップの再実行。ルールを既に知っていれば、16秒の2ショットシーケンス(2K)は、サンドイッチ1つ分よりも安い。
その表から3つのことが浮かび上がる。
参照は無料だ。 10画像のコントロールは、同じ長さと解像度の1画像のラダー実行とまったく同じ$0.40だった。このプラットフォームでは、メーターは出力秒数と解像度のみを測定し、それ以外は何も測定しない。ただし、1つの矛盾を指摘しておく価値がある。MiniMax自身のプラットフォームルールは、入力動画が出力レートで課金されることを説明しており、OpenRouter上の統一スキーマには別個のreference_imagesラインアイテムが存在する。どちらもここでの私の請求書には表示されなかった。他の場所で予算を立てる場合は、自分で価格を確認すること。仮定しないこと。
失敗は無料だが、遅れてやってくる。 4つの拒否はすべて無料だった。それは良いニュースだ。悪いニュースは、それらがいつ到着するかだ。音声単独ルールは7ミリ秒、音声長、間違ったMIME、デッドURLは16~21秒、そして送信時には全くなし。この記事のすべての不正なリクエストは、最初にHTTP 200と予測IDを取得した。したがって、送信レスポンスをレシートとして扱い、検証として扱わないこと。何かを信じる前に、statusフィールドをポーリングすること。
無言の成功が高くつく失敗だ。 2つの混合コントロールはそれぞれ全額$0.40かかり、入力の半分から構築された完全に有効な動画を返した。エラーはなく、警告フィールドもなく、レスポンスから何かが破棄されたことを知る方法もない。それが、表の中で、お金が口座から出て行き、私が望んだものを何も得られなかった唯一の行だ。
最後の点について、1つ正直な修正を述べておく。なぜなら、私がこれを書いている間に状況が変わったからだ。8月初旬、404を返す参照URLも同じように動作していた。ジョブは完了し、参照は黙って無視され、全額が請求された。2026年8月12日に再実行したところ、エンドポイントは現在到達可能性をチェックし、名前付きエラー(content[1].image_url: media not found (HTTP 404))でジョブを無料で失敗させる。その特定の穴は塞がれた。しかし、相互排他的な入力の穴は塞がれていない。クリップあたりのクレジット計算については、MiniMax H3の動画あたりのクレジットに表がある。
誰の顔、誰の声:参照をアップロードする前にこれを確認すること
このエンドポイントは、テキストから動画とは、法的に関連する1つの点で異なる。あなたが似顔絵を提供するのだ。実在の人物の参照画像、誰かの映画からの参照クリップ、認識可能な声の参照ボーカル、それらはすべて、あなたが使用権を主張している素材である。モデル側のコンテンツルールはその上に依然として適用され、実在の人物については、架空の人物よりも厳しい。クライアントが出力を見る前に読む価値のある2つのガイド:MiniMax H3コンテンツ制限と、商用利用とライセンスの内訳。これにはMiniMaxの利用規約における地域の除外事項もカバーされている。
MiniMax H3参照-to-動画:よくある質問
MiniMax H3参照-to-動画は、2つの異なるショット間で同じキャラクターを維持できますか?
はい。上記の2ショットテストは、夜から朝への完全な照明の逆転をまたいでそれを実現している。しかし、キャラクター画像だけでは不十分だ。信頼性の高いパターンは、前のショットの出力URLをキャラクター画像と一緒に参照動画として渡すことだ。これにより、2回目の呼び出しはアイデンティティだけでなく、グレードとグレインも継承する。
同じMiniMax H3参照-to-動画呼び出しで、先頭フレーム画像と参照を同時に使用できますか?
いいえ。そして、その障害モードが問題だ。imageとrefersの両方を送信してもエラーにはならない。2026年8月12日にテストしたところ、ジョブは115秒で完了し、$0.40が請求され、2つの入力のうち1つが黙って破棄された。同じことは、画像から動画エンドポイントでも逆方向に起こる。呼び出しごとに1つのパスを選択すること。
音声ファイルのみをMiniMax H3参照-to-動画の参照として送信できますか?
いいえ。音声は少なくとも1つの参照画像または動画と一緒に送信する必要があり、エンドポイントは明示的なエラーでそれを強制する。reference-to-video requires at least one reference image or video。これは送信時ではなく生成段階で発生し、拒否されたジョブは無料だ。音声参照はまた、2~15秒(合計15秒)以内に収まり、audio/mpegではなくaudio/mp3と宣言する必要がある。
MiniMax H3参照-to-動画は、参照ファイルごとに追加料金がかかりますか?
Atlas Cloudではかからない。10枚の参照画像を使用した実行と1枚の参照画像を使用した実行は、768P、4秒で同じ$0.40が請求された。したがって、メーターは出力秒数と解像度のみを追跡する。ただし、矛盾に注意。MiniMax自身のルールは、入力動画が出力レートで測定されることを言及しており、他のプラットフォームは別個の参照画像ラインアイテムを公開している。請求を行っている表面で確認すること。
MiniMax H3参照-to-動画のURLの1つが壊れているとどうなりますか?
2026年8月12日現在、エンドポイントは到達可能性を検証し、約21秒後にcontent[1].image_url: media not found (HTTP 404)でジョブ全体を無料で失敗させる。これは変更だ。8月初旬では、同じリクエストは完了し、欠落した参照を黙って無視し、全額を請求した。古い動作のレポートがまだ有効であると仮定しないこと。また、送信時の200を意味があると見なさず、statusフィールドを確認すること。
MiniMax H3参照-to-動画は、実際にこれに最適なモデルですか?
それを測定する唯一の公開された直接対決では、はい、僅差で。MiniMax H3はビデオ編集リーダーボードをElo 1,125(10,280票)でリードしているが、そのランク範囲は1~2位と記載されており、Gemini Omni Flashは3 Eloポイント差で重複する区間にある。「共同最良」として扱い、残りのワークフローで選択し、その同率が気になるならMiniMax H3の代替案を読むこと。






