高解像度は常に高額を意味してきた。MiniMax H3は、そのルールを静かに打ち破る。ネイティブ2Kを直接レンダリングし、秒あたりの価格は、多くの人が最初に手に取る動画モデルで720pクリップを生成するコストを下回る。
それが見出しだが、解像度と価格はMiniMax H3を興味深くしている要素の半分に過ぎない。残りの半分はその動作方法だ。テキスト、画像、動画、音声を一つのコンテキストとして読み取り、完成したクリップ(映像と音声)を単一パスで返す、たった一つのモデルである。以下に、その機能、コスト、そしてこの記事のすべてのクリップを生成した正確なプロンプトを示す。
主なポイント
- MiniMax H3は、ネイティブ2K(2560×1440)をレンダリングし、同期したステレオサウンドトラックを同一パスで生成する(後付けではない)。
- モデルページで確認済みの価格(2026年7月):2Kは秒間0.14ドル、768pは秒間0.10ドル。比較として、Seedance 2.0は720pで秒間約0.24ドル。つまりH3は、より低い単価でより高解像度のフレームを提供する。
- 3つのエントリーポイント(テキスト、画像、動画リファレンス)は1つのAPIキーを共有する。リファレンス-to-動画は、最大9つの画像・クリップと1つのオーディオトラックを同一性アンカーとして受け入れる。
MiniMax H3は3つのツールではなく、1パスで動作する
1つの完成したクリップを作るには、通常は作業を分割する必要がある。あるモデルで画像を生成し、別のモデルで音声を生成し、さらにエディタで両方を合わせる。受け渡しのたびに元の意図が少しずつ失われ、タイムラインもすぐに長くなる。
MiniMax H3はそれを一元化する。キャラクターの外見、動きの流れ、カメラの動き、感情の鍵、サウンドの雰囲気といったすべてを1つのコンテキストとして読み取り、1つのクリップとして返す。MiniMaxはこの方向性を、タスク特化型モデルから汎用マルチモーダル知能への移行と位置づけており、実際には同時に開くツールの数を減らすことを意味する。
2つの点を明確に述べておく価値がある。どちらも出力で簡単に確認できる。第一に、クリップには実際の音声が含まれている。以下のショーケースファイルは、ポストプロダクションで追加されたものではなく、ステレオオーディオトラックが焼き込まれた状態で出力される。第二に、解像度は本当に2K、2560×1440、24fpsであり、アップスケールではない。
Atlas CloudでMiniMax H3を実行する3つの方法
MiniMax H3はAtlas Cloud上で3つのエントリーポイントで利用可能であり、すべて同じAPIキーで応答する。各エントリーポイントには、コードを書く前にブラウザで試せるプレイグラウンドがある。
| エントリーポイント | 駆動元 | 入力 | 最適な用途 |
|---|---|---|---|
| テキスト-to-動画 | テキストプロンプトのみ | リファレンス素材なし | シーンをゼロから構築する |
| 画像-to-動画 | 最初のフレームと、オプションで最後のフレーム | 1~2枚の静止画像 | 既存の固定フレームをアニメーション化する |
| リファレンス-to-動画 | テキストプロンプト+リファレンス素材 | 最大9つの画像・動画クリップと1つのオーディオトラック | クリップ全体でキャラクター、製品、スタイルの一貫性を保つ |
リファレンス-to-動画パスは柔軟性が高い。リファレンスを同一性アンカーとして扱い、キャラクター、製品、ルックを一貫させたまま、プロンプトで新しいシーンや動きに配置する。画像と動画クリップを混在させ、1つのオーディオトラックを追加してアクションをビートに同期できる。少なくとも1つの画像または動画が必要。音声単独は不可。
プラットフォーム上のすべてのモデルが1つの呼び出し規約を共有しているため、他の動画モデルからH3への移行は、modelフィールドを変更するだけである。認証、ポーリング、結果取得は同一であり、これが1つのキーと1つの請求書で動画、画像、音声、言語モデルを実行する静かな利点である。
MiniMax H3のコスト:2K、768p、Seedanceとの比較
MiniMax H3は、生成された動画の秒数と解像度に基づいて課金される。これらの数値は、2026年7月31日に確認されたモデルページからの直接の数字である。
| 解像度 | 秒あたりのコスト | 8秒クリップの場合 |
|---|---|---|
| 2K (2560×1440) | $0.14 | $1.12 |
| 768p | $0.10 | $0.80 |
ここで一見逆転のように見える部分がある。H3のネイティブ2Kの1秒は$0.14である。比較として、プラットフォームのもう一つのフラッグシップ動画モデルであるSeedance 2.0は、720pで秒間約$0.24かかる。つまりH3は、Seedanceの低解像度クリップよりも低い秒単価で、より高解像度のフレームを提供する。解像度は上がり、単価は下がる、同時に。
予算を誤らないよう、正直な注意を一つ。H3の価格にはプロモーションは含まれていない。現在プラットフォームで実施中の20%割引は、Seedream 5.0 Pro画像モデルに対するものであり、H3ではない。したがって、2Kで秒間$0.14は、2026年7月下旬時点での通常料金である。768pティアは秒間$0.10と記載されている。2Kが現在利用可能で呼び出せるティアである。
MiniMax H3プロンプトブック:コピーして使えるショーケース
以下の各クリップは、その横に記載されたプロンプトで生成された。プロンプトをコピーし、自分のリファレンスに置き換えて実行してほしい。各ブロックには、入力されたリファレンス画像も、プロンプトで呼び出される順序(画像1、画像2、…)で表示されている。
ブランドフィルムと映画/テレビ
トレーラー、TVCスポット、ブランドテクスチャフィルムが最も直接的な用途である。これらは既存のコンテンツパイプラインに最小限の手直しで投入できる。
リファレンス入力:画像1はムードとスタイル、画像2は主人公。
リファレンス画像1、全体的なムードとスタイル
リファレンス画像2、主人公
Plain1リアルな映画的ルック、ハイコントラストの光と影、タイトなテンポ。画像1は全体的なムードとスタイルのリファレンス。画像2は主人公のリファレンス。ショット1、超広角の見せ場。巨大な円形の宇宙ゲートがフレームのほとんどを占め、人物はその前の小さなシルエットだけ、低く、中央よりやや右に立っている。地面は濡れて反射しており、ゲートの中心は真っ黒。カメラはゆっくりと押し込む。メインタイトルが暗闇の端からフェードイン、最初はぼやけてからシャープに:「THE STARS WERE LISTENING」、非常に細く、太字、オールキャップス、ダークレッドとさび色の混ざった色、軽いグレインとぼやけたエッジ。音声:低周波のパルス、遠くの金属的な震え、テキストが確定するときの柔らかい一打。ハードカット。
ビジュアルクリエイティブとコンテンツパッケージング
クリエイティブショート、タイトルシーケンス、ムード駆動のミュージックビデオ、モーションポスター。ここでは、画面上のテキストとリズムに対するモデルの処理能力が最も顕著に現れる。
軽サスペンス犯罪ドラマのタイトルシーケンス。 5つのスタイルリファレンスでレトロアニメ/コミックコラージュ風のルックを設定。モデルはすべての英字クレジットを判読可能に保ち、ドラムビートに合わせてトランジションを決める。
スタイルリファレンス
スタイルリファレンス
Plain1軽サスペンス犯罪映画のオープニングタイトルシーケンスを15秒、16:9横長で生成する。全体的なスタイルはこれらの画像のビジュアルランゲージに従う:レトロな日本アニメのタイトルシーケンス、硬質なシルエット、コミックコラージュ、非対称の分割画面、強い幾何学的なカラーブロック、英字クレジット、いくつかの日本語カタカナ装飾、ジャズ犯罪の雰囲気。ムードはサスペンス60%、ジャズ40%:神秘的でクール、機敏で、都市犯罪の感覚、ホラーでも重くもない。動きはモーショングラフィックコラージュのように読める:まず黒の上にラインフレームが現れ、分割画面の境界線が高速でスワイプ、カラーブロックとパネルがブロックごとにペーストされる。キャラクターのシルエット、小道具のクローズアップ、英字クレジットがスライドイン、ポップ、マスクリビールでドラムビートに合わせて順に現れる。英字クレジットは明確に判読可能でなければならず、アニメーション化してもよい。中国語は追加しない、文字化けなし、英語のスペルミスなし。各英字クレジットと役割は正確に一度だけ登場する。トランジションはバラエティ豊かに保つ:円形のビニールマスク、垂直のカードア切断、長い人間の影が画面を横切る、赤い線のカット、巨大な英字マスク、分割画面のフレーム再構成、ハードなカラーブロックカット。すべてのトランジションはドラムビートに合わせる。ソフトディゾルブはなし。BGM:オリジナルの15秒タイトル音楽、サスペンス60%、ジャズ40%。持続するベーストーン、緊張感のあるピチカート弦楽器、冷たいシンセパルス、キックドラム、まばらなジャズブラシと短いローサックスフレーズで構成。最初の2秒は低周波とハイハットでサスペンスを確立。3秒で低いドラムビートが入る。6秒でジャズベースグルーヴが加わる。10秒で短いサックスリフが現れる。最後の2秒は緊張したコードとドラムヒットでフレームを固定する。既存のメロディーを模倣しないこと。
実写キッチンと手描きアニメーションの融合。 リファレンス素材なし、テキスト-to-動画のみ。プロンプトは不完全なスマホカメラの質感を強調し、コマーシャルに見えないようにしている。
Plain115秒、16:9横長。夕暮れの小さなキッチンの実写映像に、手描きの光るアニメーションを融合。窓にはまだ夕日が差し込んでいる。使い込まれた小さなキッチンには、古い木製のテーブル、半分洗ったマグカップ、少し曇ったガラス瓶、吊るされた布巾がある。画像には、片手スマホ撮影の微かな手ブレ、近接フォーカスの迷い、逆光による露出変動、影の部分のやや粗いノイズが含まれる。コマーシャルのようにきれいに構成しないこと。誰かが家で不可能なものを急いで撮影しているような感覚。巨大な目、裂けた口、牙、脅威的または飛びかかる動き、突然の真っ黒へのカット、ジャンプスケアはなし。音声は、キッチンの部屋トーン、布巾の擦れる音、マグカップの軽いチャリンという音、蛇口からの水滴、撮影者の足音と微かな呼吸、そして手描きの生き物の柔らかい電子音と小さな鳴き声のみを使用。
ダークポップ/サイバーグランジのミュージックビデオ。 2つのリファレンスでタイプ処理と印刷テクスチャを設定。カットはハードで、ディゾルブなし。
タイプ処理リファレンス
タイプ処理リファレンス
Plain1スタイル:ダークポップ/サイバーグランジ/ラップミュージックビデオ、リアルなハイファッションテクスチャ、フィルムマガジンテクスチャ、ハイコントラストだが安っぽくない。全体的なリファレンス:90年代後半から00年代初頭のインディーズ雑誌、コピー用紙、フィルムスキャン、アンダーグラウンド音楽ポスターとジンコラージュの美学。画像には粗いグレイン、わずかなフィルムジッター、ハーフトーンドット、印刷バリ、スキャンミスレジストレーションがある。高速カットのリズム、ハードカットのみ、フェードやソフトトランジションなし。タイプ処理のスタイルとテクスチャはリファレンス画像に従う。
モーションポスター。 リファレンスは元の静止ポスター1枚。プロンプトはレイアウトとパレットを固定し、タイプの出現のみをアニメーション化する。
元の静止ポスター
Plain1モーションポスタービデオを作成する。元の画像のギャラリーホワイトフレーム、内側フレーム、赤白黒のパレット、3Dフィギュア感、レイアウト構造はそのまま維持。タイプが入ってくるときに、機敏なテキスト出現の効果音を追加する。
デジタル体験とゲームクリエイティブ
ゲームUI、プロダクトインターフェース、インタラクションデモ。特筆すべきは、H3がタイムブロックとして書かれたプロンプトに従うことである。
ゲーム装備UIウォークスルー、秒単位でプロンプト。 これはよく読む価値がある。プロンプトは時間セグメントとして書かれており、モデルはそれに従う:メニュー状態、カーソルクリック、パネルスライドイン、武装グリッド、0%から100%までのローディングバー、そしてキャラクターの周りにフル環境がロードされる。
リファレンス画像1、キャラクター
リファレンス画像2、UIスタイル
Plain1キャラクターリファレンスは画像1、UIスタイルリファレンスは画像2。 2 3[0秒-2秒] ハイアングル俯瞰ショット。キャラクターは高彩度の明るい紫の床に座り、画像1を参照、カメラを見上げる。右側にゲームメニューUIが表示:START NEW GAME、CONTINUE(ハイライト)、SETTINGS、EXIT GAME。左上にプレイヤープロフィールMINIMAX。カーソルが「CONTINUE」をクリック。 4 5[2秒-4秒] 右腕にスムーズズーム。右からUIパネルがスライドインし、「RIGHT ARM EQUIPMENT」パネルが表示。選択が「PHANTOM GRIP」をハイライトし、次に「CHRONOS CLAW」にスライド。彼女の右手が機械的に再構成、指が分割され、新しい爪のような関節が所定の位置にロック、シアンLEDが明るく点滅。 6 7[4秒-7秒] カメラはスムーズに弧を描いて左側に回り込む。新しいUIがスライドイン、「ARMAMENT CUSTOMIZATION」グリッド、手、前腕、肘、上腕のコンポーネントを表示。選択が素早くパーツを循環。彼女の左腕がセグメントごとに分解、交換中に露出した配線とピストンが見える。 8 9[7秒-8.5秒] カメラはミディアムショットに引き。CONFIRM CONFIGボタンが点滅。クリック。すべてのUIパネルが収縮して消失。キャラクターは脚をほどき、片膝を立ててリラックスして座る。 10 11[8.5秒-10秒] 下部にLOADINGバーが現れ、素早く0%から100%まで満たされる。明るい紫の環境が暗くなり始め、端から影が忍び寄り、暖かい金色の光が染み込む。 12 13[10秒-15秒] 彼女が立ち上がると、周囲にフル環境がロードされる。密集したサイバーパンクのスラムが現れる:ネオンがちらつき、濡れた通りが光を反射、群衆が動き、バイクが縫うように進み、積み重なった建物が遠くの超高層ビルへと続く。カメラは彼女の背後、三人称視点に落ち着く。HUD要素がフェードイン、右上にミニマップ、左下に体力と弾薬カウンター。クエストマーカーが現れる。彼女は通りに足を踏み出す。
プロダクトランディングページUI/UXデモ。 プロダクトショット1枚をリファレンスに。プロンプトはスクロールするハイエナジーなランディングページを要求。
プロダクトショットリファレンス
Plain1ウェブサイトページ、ウェブサイトページUIデザイン、ウェブモーション。動画はスムーズな下方向へのページスクロールを示す。爆発的でハイエナジーなナイキ公式サイト風のプロダクトランディングページUI/UXデモ動画で、中心に表示されるコアテーマは画像1の製品。ページはラフで力強い、斜めの特大サンセリフ書体を使い、派手なレイアウト。背景には高速で動く光と影、ダークカーボンファイバーまたはアスレチックな通気メッシュテクスチャが織り交ざり変化する。動画はタイトなテンポの下方向スクロールと、ホバー時の強い視覚的拡大や色反転などのUIインタラクションを示す。
ウェブUIモーション、最小限のプロンプト。 タイム指定の詳細スタイルは必須ではないことの証明。短い指示でも機能する。
リファレンス画像
Plain1ウェブサイトUIデザインをシミュレート:最初に上部の見出しがスライドダウンして表示され、次に下のテキストバーが上方向にワイプ、車のライトが暗い状態から赤に変化する。
MiniMax H3を始める方法
2つの方法があり、どちらも時間はかからない。
プレイグラウンドで実行する。 Atlas Cloudにサインインし、モデルページでMiniMax H3を開く。プロンプトを入力し、解像度と長さを選んで生成する。コードは不要。パイプラインに組み込む前に、モデルが自分のショットに合うかどうかを確認する最も速い方法である。
または、APIを3ステップで呼び出す。
- APIキーを取得する。Atlas Cloudコンソールを開き、API Keysページでキーを作成する。H3の3つのエントリーポイントすべてがこのキーを共有する。
- モデルページのフィールドを確認する。パラメータリファレンスとコピペ可能なコードは、各エントリーポイントに用意されている:テキスト-to-動画、画像-to-動画、リファレンス-to-動画。これらは異なる入力を受け取るので、リクエストボディを混同しないこと。
- 最初のリクエストを送信する。1つのエンドポイントと1つの呼び出し規約でプラットフォーム上のすべてのモデルにアクセスできるため、他の動画モデルからH3に切り替えるには、modelフィールドを対応するH3エントリーポイントに変更するだけである。認証、ポーリング、結果取得は同じまま。
H3以外にも、同じキーで動画、画像、音声、言語モデルにアクセスでき、組み合わせて使用できる。1つのAPIと1つの請求書で済むため、完成品を作るためにアセットや請求書をベンダー間でやり取りする必要はない。
よくある質問
MiniMax H3とは何ですか?
MiniMax H3は、MiniMaxのマルチモーダル動画生成モデルであり、Atlas Cloud上でテキスト-to-動画、画像-to-動画、リファレンス-to-動画の3つのエントリーポイントを通じて利用可能です。テキスト、画像、動画、音声を一つのコンテキストとして読み取り、同期したサウンド付きの完成した2Kクリップを単一パスで返します。
MiniMax H3の料金はいくらですか?
MiniMax H3は動画の秒数に応じて課金されます。2026年7月にモデルページで確認したところ、ネイティブ2K(2560×1440)は秒間0.14ドル、768pは秒間0.10ドルです。したがって、8秒の2Kクリップは1.12ドルになります。現時点でH3にプロモーション割引はありません。
MiniMax H3は音声も生成しますか?それとも動画だけですか?
両方を同時に生成します。ショーケースクリップは、MiniMax H3から、画像と同じパスで生成された同期ステレオオーディオトラックと共に出力されます(別ステップで追加されるのではありません)。プロンプトで音楽、効果音、タイミングを映像と共に指示することで、サウンドを指定できます。
3つのMiniMax H3エントリーポイントの違いは何ですか?
テキスト-to-動画はプロンプトのみで動作します。画像-to-動画は最初のフレーム(オプションで最後のフレーム)をアニメーション化します。リファレンス-to-動画は、最大9つのリファレンス素材(画像、動画クリップ、1つのオーディオトラック)を使用して被写体の一貫性を保ちます。3つすべてが1つのAPIキーと1つの呼び出し規約を共有します。
MiniMax H3がサポートする解像度とクリップ長は?
MiniMax H3はネイティブ2K(2560×1440、24fps)をレンダリングし、価格表にはより安価な768pティアもあります。クリップの長さは約5秒から15秒で、アスペクト比はアダプティブ、21:9、16:9、4:3、1:1、3:4、9:16に対応しています。






