2週間限定 | Seedream 5.0 Pro が20%OFF!
Hero background 1Hero background 2

MiniMax H3 API for Video Generation and Editing

MiniMax H3 API は、MiniMax の汎用マルチモーダル動画モデルを利用できる API です。テキスト、画像、動画、音声を個別のタスクとしてではなく、ひとつのコンテキストとして扱います。クリップは 24 FPS で 5〜15 秒、アスペクト比は 21:9 から 9:16 まで対応し、1 つのプロンプトでキャラクターの差し替え、背景の置換、台詞の書き換え、参照クリップからの音声クローン作成が可能です。Atlas Cloud は、これらすべてを 1 つの OpenAI-compatible endpoint 経由で提供します。今すぐ開発を始めましょう。

主要モデルを探索

Atlas Cloudは、業界をリードする最新のクリエイティブモデルを提供します。

テキストから最大9つのリファレンスまで:MiniMax H3 APIのモダリティ

MiniMax H3 APIの各エンドポイントは、テキスト、画像、動画、音声の扱い方がそれぞれ異なります。以下の行を確認し、構築しているものに合うモダリティを選んでください。

モダリティ説明
MiniMax H3 T2V API(Text to Video)最大7,000文字のプロンプトを入力すると、モデルは24 FPS・1440pの5〜15秒のクリップを返します。同じ処理の中でネイティブのステレオ音声も生成されます。アスペクト比はリクエストごとに21:9、16:9、4:3、1:1、3:4、9:16から指定できるため、1回の呼び出しでシネマティックなトレーラーから縦型SNS向けのカットまで対応できます。
MiniMax H3 I2V API(Image to Video)1枚の画像で冒頭フレームを指定でき、2枚の画像を使うと最初と最後のフレームを固定できます。H3は入力画像のアスペクト比に合わせて、その間の動きを補完します。各辺256〜5760ピクセルのソースに対応しているため、キーアート、商品スチル、絵コンテのフレームを簡単に動かせます。
MiniMax H3 Omni Reference API(Reference to Video)複数のソースを組み合わせたい場合に対応できます。最大9枚の画像、3本の動画クリップ、3本の音声トラックを、合計12ファイル以内で1つのリクエストに含められ、それらすべてが1つのマルチモーダルコンテキストとして読み取られます。キャラクター、カメラワーク、声の音色をショット間で引き継いだり、被写体、背景、セリフを差し替えて既存のクリップを編集したりできます。

映像・音声・編集を1回のMiniMax H3 API呼び出しで

MiniMax H3 APIが返すすべてのクリップは、最大15秒、1440p、ネイティブステレオ音声付き。テキスト、画像、動画、音声リファレンスを自由に組み合わせて生成でき、同じ呼び出しで既存の映像内のキャラクター、シーン、セリフも編集できます。

12個のリファレンスファイルを1回のMiniMax H3 API呼び出しで

1回のMiniMax H3 APIリクエストで、最大9枚のリファレンス画像、3本の動画クリップ、3本の音声トラックを受け付け、合計12ファイルまで指定できます。モデルはそれらを別々のスロットとして読むのではなく、テキスト、画像、音を1つのコンテキストとして扱い、写真からキャラクターを、クリップからカメラワークを、トラックからムードを取り込み、同じシーンに統合します。既存素材を持つチームは、完成ショットまでの直接的なワークフローを得られます。

すべてのクリップにネイティブステレオ音声

すべての出力に音声が含まれます。映像を24フレーム/秒でレンダリングするのと同じパスで、セリフ、環境音、音楽がネイティブステレオで生成されるため、後から作曲や吹き替えを行う必要がありません。ショット生成時にタイミングが決まるので、足音、発話、カットはアクションと同期したまま保たれます。短尺広告やソーシャル向け動画を、そのまま公開できる状態で出力できます。

MiniMax H3 APIでプロンプト単位の編集

猫を犬に差し替えたい、グリーンスクリーンを置き換えたい、セリフを1行だけ書き換えたい。MiniMax H3 APIは、提供された動画に対してこうした編集を適用できます。キャラクター、オブジェクト、背景、ライティング、エフェクトに対応し、指定していない部分は元の映像に近い状態を保ちます。プロンプトは7000文字まで入力できるため、十数個の変更を1回の処理にまとめられます。承認済みカットの反復修正が現実的になります。

声の音色転写とセリフ差し替え

画像や映像と一緒に音声サンプルを送信すると、生成されたキャラクターがその音色で話します。1リクエストあたり最大3つの音声リファレンスを指定でき、それぞれ2〜15秒の長さが必要です。また、音声は単独ではなく、必ず視覚入力と組み合わせる必要があります。既存のセリフを置き換え、演技を合わせて調整することもできます。シリーズ制作でも、すべてのエピソードで認識しやすい同じ声を維持できます。

MiniMax H3 APIで1440pと6つのアスペクト比

クリップの長さは5〜15秒です。1440pモードでは、16:9から9:16の範囲で短辺が1440ピクセルになり、21:9向けの2976×1248など、より横長の比率では約3.7メガピクセルになります。シネマティックな21:9から縦型の9:16まで、6つの比率を選択でき、MiniMax H3 APIに自動選択させることも可能です。この範囲で、トレーラー、商品ループ、縦型ドラマまで、モデルを切り替えずに対応できます。

制作フォーマットをそのまま入力、変換ステップ不要

ソースファイルがカメラや編集タイムラインから直接出力されたものでも、そのまま入力できます。対応形式は、H.264およびH.265動画、JPG、PNG、WEBP、HEIC、HEIF静止画、さらにWAVおよびMP3音声です。ファイルごとの上限は動画が50MB、画像が30MB、音声が15MBで、アセットをURLで渡せば、リクエストを64MBのボディ上限内に収められます。Atlas Cloudでは、セット全体をOpenAI互換キー1つで実行でき、従量課金で利用できます。

同じプロンプト、3つのエンジン:MiniMax H3 API 徹底比較

このセットの各クリップは、同一のプロンプトを MiniMax H3 API と、Atlas Cloud 上でホストされている他の2つの動画モデルに送信して生成したものです。これにより、モーション、サウンド、指示への忠実度を、一語も変えずに比較できます。

プロンプト

15 seconds、16:9 横長のショート動画。深夜のセルフサービス式コインランドリーを実写で撮影し、手描きの発光アニメーションを重ねたミクストメディア映像。小さなセルフサービス式コインランドリーで、蛍光灯がかすかにちらついている。店内には稼働中の洗濯機、プラスチック製のランドリーバスケット、古びたベンチがあり、床には片方だけの靴下が落ちている。空間全体は静かで、ほのかに懐かしい雰囲気を帯びている。片手でスマートフォンを持って撮影した手持ち映像の質感があり、はっきりとしたカメラの揺れがある。白い蛍光灯の影響で露出が明るくなったり暗くなったり揺らぎ、ガラス面には周囲の反射が映り込む。レンズが被写体に近づくとフォーカスが遅れて追従する。映像は商業広告のように洗練され整然としていてはいけない。全体の印象は、本物のドキュメンタリーの一瞬を切り取ったように、深夜に偶然入り込み、奇妙で夢のような光景を追いかけながら撮った映像のようにする。

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

プロンプト

一人称視点・目線の高さ・手持ち風ゲームカメラ シーン:現代戦の FPS game をプレイヤーが操作しているようなショット。両手でアサルトライフルを構え、軍事基地の外周に沿ってゆっくり前進する。プレイヤーは遮蔽物の横の道路を進み、クロスヘアが前方の通路をなぞるように動く。短く停止した後、遠くの目標に向けて数発発砲し、そのまま前進を続ける。一般的なプレイヤーの実際のゲームプレイ映像のように。 ライティング:現代的な軍事基地の寒色系の自然光に、煙とマズルフラッシュが交差する。映像はリアルでシャープ。金属質の武器、戦場の砂塵や霞には AAAゲーム 品質の質感がある。 カメラワーク:プレイヤーの移動に合わせて、カメラにはわずかな手持ちの揺れがある。最初はゆっくり前進し、その後、観察するために左右へ小さくスイープする。発砲時には控えめなリコイルの揺れが入り、最後は再び安定して前進を続ける。

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

MiniMax H3 API が制作現場で活きる領域

ブランドフィルムや縦型ドラマから、商品カット、ゲームビジュアル、既存映像の精密な編集まで、MiniMax H3 API は、ネイティブステレオ音声付きの動画を返す単一のマルチモーダルリクエストで各シナリオに対応します。

MiniMax H3 API によるシネマティックなブランドフィルム

絵コンテのフレームとショットリストを 1 回の呼び出しに入力するだけで、1440p のトレーラー、TVC スポット、ファッションキャンペーンを 24 FPS で生成できます。すべての結果にネイティブステレオ音声が付属するため、ブランドチームは完成版として試写できます。

縦型ショートドラマ制作

縦型 9:16 出力により、衣装ミステリーから家族の対立まで、脚本のあるドラマシーンをカバーし、同じ処理でセリフの音声も付与できます。ショートドラマのライブラリを構築するスタジオは、俳優やステージを手配せずに 15 秒のフックを制作できます。

複数リファレンスによるショット構築

特定の顔や動きが必要なショットでは、最大 9 枚の画像、3 本の動画、3 つの音声クリップで 1 回の呼び出しをガイドできます。キャラクターの同一性、カメラワーク、声の音色をエピソード間で安定して維持できます。

MiniMax H3 API による既存映像の編集

後から変更が必要ですか?既存映像はプロンプトで編集できます。被写体の差し替え、背景の置換、ライティングの調整、セリフの書き換えを、1 フレームも撮り直さずに行えます。

商品・E コマース向けマーケティング

商品写真を動きのあるコンテンツに変換できます。1 枚のリファレンス画像から、360 degree のショーケース、機能紹介、または有料ソーシャル向けのカットを生成できます。21:9 から 9:16 までのアスペクト比に対応し、1 つのアセットセットをあらゆる配信面に展開できます。

ゲーム・アニメビジュアル向け MiniMax H3 API

ゲーム CG、キャラクター PV、アニメのオープニング、インターフェースデモなど、メニュー、HUD 要素、テキストオーバーレイの可読性が求められる用途でも、スタイライズされた出力の品質を維持できます。アートチームは本制作前のコンセプト検証に活用できます。

MiniMax H3 API と他のマルチモーダル動画モデルの比較

エンドポイントを決める前に、MiniMax H3 API を Atlas Cloud 上の他の動画モデルと並べて比較し、入力モダリティ、参照上限、長さ、解像度、音声出力の違いを確認できます。

モデル入力モダリティ最大参照ファイル数出力時間最大解像度ネイティブ音声
MiniMax H3テキスト、画像、動画、音声画像 9 点、動画 3 本、音声クリップ 3 点、合計 12 ファイル5s〜15s1440p、24 FPS√ すべての出力でネイティブステレオ音声に対応
Seedance 2.0 Reference-to-Videoテキスト、画像、動画、音声画像 9 点、動画 3 本、音声クリップ 3 点最大 15s720p√ ステレオのセリフ、効果音、音楽を 1 回の生成で作成
Veo3.1 Reference-to-videoテキストと画像参照画像 3 点4s、6s、または 8s4K は長さ 8s の場合のみ√ タイムラインに同期したセリフ、環境音、効果音
Wan-2.7 Reference-to-videoテキスト、画像、動画、音声画像または動画クリップ 5 点に加え、音声クリップ 1 点2s〜15s1080p√ 音楽と効果音を生成、または独自音声でリップシンクを駆動
Kling v3.0 Pro Image-to-Videoテキストと画像-最大 15s1080p√ 5 言語でリップシンク付きの多言語セリフに対応

Atlas Cloud で MiniMax H3 を使う方法

数分で始められます — 以下の簡単なステップに従って、Atlas Cloud プラットフォームでモデルを統合・デプロイしましょう。

Atlas Cloud アカウントを作成

atlascloud.ai でサインアップし、認証を完了します。新規ユーザーには無料クレジットが付与され、プラットフォームの探索やモデルのテストに使用できます。

Atlas CloudでMiniMax H3を使用する理由

高度なMiniMax H3モデルとAtlas CloudのGPU加速プラットフォームを組み合わせることで、比類のないパフォーマンス、スケーラビリティ、開発者エクスペリエンスを提供。

パフォーマンスと柔軟性

低レイテンシ:
リアルタイム推論のためのGPU最適化推論。

統合API:
1つの統合でMiniMax H3、GPT、Gemini、DeepSeekを実行。

透明な料金:
サーバーレスオプション付きの予測可能なtoken単位の課金。

エンタープライズとスケール

開発者エクスペリエンス:
SDK、分析、ファインチューニングツール、テンプレート。

信頼性:
99.99%の稼働率、RBAC、コンプライアンス対応ロギング。

セキュリティとコンプライアンス:
SOC 2 Type II、HIPAA準拠、米国内のデータ主権。

MiniMax H3 API:開発者向けFAQ

MiniMax H3 APIは、テキスト、画像、動画、音声を1つの共有コンテキストとして扱うオープンな汎用マルチモーダル動画モデル、MiniMax H3にプログラムからアクセスできるAPIです。生成、編集、参照を別々のタスクモデルに分けるのではなく、H3は入力全体を読み取り、音声付きの完成したクリップを返します。Atlas Cloudでは、従量課金制で単一のAPIキーを使って実行できます。

ブランドムービー、予告編、縦型ショートドラマ、商品・EC向け広告、ゲームやUIのモーションデモ、スタイライズされたアニメーションまで幅広く対応します。モデルが画面上のテキスト、字幕、ブランドアセットを扱えるため、制作予算を確定する前のコンセプト検証、絵コンテのプレビュー、ビジュアル提案にも活用されています。

Atlas Cloudアカウントを作成し、APIキーを生成してから、プロンプトと必要な参照ファイルを動画生成endpointに送信し、完成結果をポーリングします。リクエスト本文は64MBに制限されているため、インラインアップロードよりもホストされたURLとしてメディアを渡すことを推奨します。今すぐ開発を始められます。

課金は従量課金制のため、サブスクリプションやシートライセンスを購入するのではなく、呼び出しごとに支払います。コストは実際にレンダリングした内容に応じて決まり、バッチ全体の料金は解像度とクリップの長さによって変わります。大量実行を計画する前に、モデルページで現在の生成単価を確認してください。

はい。H3のすべての結果はネイティブステレオの音声付きで提供されるため、セリフ、効果音、環境音が映像と同じパスで生成されます。参照音声クリップを指定すると、モデルはその音色をキャラクターに反映できるため、パイプラインから個別の音声合成ステップを省けます。

クリップは24 FPSで5〜15秒です。1440pモードでは、16:9から9:16までの比率で短辺が1440ピクセルでレンダリングされ、その範囲外ではフレーム全体がおよそ3.7Mピクセルに保たれます。たとえば21:9では2976×1248です。Text to videoおよびomni referenceリクエストでは21:9、16:9、4:3、1:1、3:4、9:16を指定でき、first and last frameリクエストでは入力画像のアスペクト比を継承します。

1つのプロンプトに、最大9枚の画像、3つの動画セグメント、3つの音声クリップを含められ、ファイル数は合計12個までです。動画と音声はいずれも合計15秒以内で、音声は単独ではなく画像または動画と一緒に指定する必要があります。プロンプトは7000文字まで入力できるため、カメラ、演技、音声を含むショットごとの指示を十分に記述できます。

入力として、H.264およびH.265動画、JPG、JPEG、PNG、WEBP、HEIC、HEIF画像、WAVまたはMP3音声に対応しています。動画ファイル内の音声トラックはAACまたはMP3です。ファイルごとの上限は、動画が50MB、画像が30MB、音声が15MBです。リクエスト本文は64MBに制限されているため、容量の大きいアセットではホストされたURLを使う方が安全です。

編集は主要なモードの1つです。ソースクリップと指示を送信すると、MiniMax H3 APIはキャラクターやオブジェクトの差し替え、背景やライティングの置換、視覚効果の追加、セリフの書き換えを行いながら、変更しない領域を安定して維持できます。複合的な指示も1回のリクエストで処理されるため、複数の変更を繰り返しの往復なしにまとめて反映できます。

多くの動画モデルは、1つのプロンプトと1枚の画像を受け取り、音声なしのクリップを返します。一方H3は、複数種類の参照を混在させて取り込み、キャラクター、動き、カメラ、音声の意図をそれら全体から読み取ったうえで、ネイティブ音声付きのクリップを返します。現在のパイプラインで動画モデル、音声モデル、エディターをつなぎ合わせている場合、H3ならそれらの段階を1回の呼び出しに集約できます。

さらにファミリーを探索

Seedance 2.0

Seedance 2.0 APIは、ByteDanceのマルチモーダルビデオモデルへのプロダクションアクセスを提供します。これには、クアッドモーダル入力(テキスト、画像、ビデオ、オーディオ)と、ショット間で構図、カメラワーク、キャラクターのアクションを固定する業界最高水準の「Universal Reference」システムが含まれます。1回のAPIコールでディレクターレベルの制御を統合でき、一律$0.09/秒、即時キー発行、順番待ちリストなしで利用可能です。これらはエンタープライズクラスの稼働率とコンプライアンスによって裏付けられています。Seedance 2.0 Native 4Kが提供開始されました!

ファミリーを表示

GPT Image 2

GPT Image 2 API は、GPT Image 1.5 の後継となる OpenAI の最新画像モデルへのアクセスを開発者に提供します。ラテン文字およびCJKスクリプト全体で正確なテキストレンダリングを使用して画像を生成および編集できるほか、ポスター、モックアップ、インフォグラフィック向けの強力なコンポジション(構図)機能を備えています。Atlas Cloud では、300以上のモデルと並んで1つの統合 API を通じてアクセスでき、無料クレジット、99.99% のアップタイムが提供され、OpenAI の組織検証は不要です。

ファミリーを表示

Seedream 5.0 Pro

Seedream 5.0 Pro API は、開発者に Atlas Cloud 上で ByteDance の制御可能な画像編集モデルを提供します。アンカーと座標を使用して編集を正確に配置し、画像を編集可能なレイヤーに分離し、複数の参照を融合し、正確な色と素材を一致させ、2K および 3K での多言語テキストをサポートします。Atlas Cloud では、単一のキーでアクセスできます!

ファミリーを表示

Gemini Omni Flash

Gemini Omni API は、Google I/O 2026 で発表された Google DeepMind のマルチモーダル動画生成・編集モデルを、あなたのスタックで利用可能にします。Gemini Omni は Gemini の推論エンジンと生成メディアを融合し、テキスト・画像・動画・音声を自由に組み合わせた入力から、一貫性があり知識に裏付けられた出力を生成します。自然な対話で結果を磨き上げましょう。オブジェクトの差し替え、シーンの書き換え、スタイルの変更を行っても、物理法則、キャラクター、連続性はそのまま保たれます。Atlas Cloud は、テキストからの動画生成、最大 7 枚の参照画像に対応した画像からの動画生成、そして参照ベースの動画生成という Gemini Omni Flash の全ラインアップを、単一の統合 API で提供します。料金は $0.112 からの秒単位の透明な従量課金で、サブスクリプションは不要です。今すぐ開発を始めましょう。

ファミリーを表示

Grok Imagine

Grok Imagine API は、開発者に xAI の画像、動画、音声生成を1つのスイートで提供します。多言語テキストレンダリングを備えた最大 2K の画像に加え、ネイティブで同期された音声とリファレンスベースの編集を備えた最大15秒の動画を生成します。Atlas Cloud 上では、1つのキーで Grok Imagine のすべてのモードを実行できるため、個別の設定なしで画像、動画、音声の間を移行できます。料金は画像1枚あたり0.02ドル、1秒あたり0.05ドルからです。

ファミリーを表示

Google

Googleの最も強力なクリエイティブモデルはすべてAtlas Cloudで利用可能です。Veo 3.1はシネマティックな動画生成を実現し、Nano Banana 2は高忠実度な画像作成を強化し、Geminiはあらゆるワークフローにマルチモーダルなインテリジェンスをもたらします。Day-0の可用性と従量課金制(pay-as-you-go)の料金体系を備えた単一のAPI keyを通じて、Googleモデルスイート全体にアクセスできます。

ファミリーを表示

Seedance 2.0 Mini

Seedance 2.0 Mini は、速度とコストが最も重視されるワークフローに ByteDance のマルチモーダル動画生成をもたらします。より軽量なフットプリントで Seedance 2.0 のコア機能を提供し、より高速な生成、動画あたりのコスト削減、そしてすでに使用しているものと同じ API 統合を実現します。大容量のパイプラインを運用したり、大規模なプロトタイピングを行ったりするチームにとって、Mini は実用的なデフォルトの選択肢です。

ファミリーを表示

ByteDance

シネマティックな動画生成から高忠実度の画像作成まで、ByteDanceの最も強力なモデルがAtlas Cloudで利用可能になりました。最低水準の推論価格とゼロのインフラストラクチャオーバーヘッドで、SeedanceとSeedreamを大規模に実行できます。

ファミリーを表示

Alibaba

Atlas Cloudは、Alibabaの全モデルラインナップを単一のAPIに統合します。言語および画像タスク用のQwen、最大1080pの動画生成用のWanが利用可能です。すべてのモデルはサブスクリプション不要の従量課金制(pay-as-you-go)でアクセスできます。Alibaba APIは、既存のOpenAI互換クライアントを使用し、単一のベースURLを介して利用可能です。

ファミリーを表示

OpenAI

Atlas Cloudは、画像生成用のGPT Image 2から動画用のSora 2まで、OpenAI APIの全ラインナップへのアクセスを提供します。すべてのモデルは、月額の固定コミットメントなしの従量課金制でご利用いただけます。OpenAI互換APIを使用し、ベースURLを一つ変更するだけで簡単に組み込むことができます。

ファミリーを表示

xAI

Atlas Cloud 上で xAI API を使用して、完全な画像および動画パイプラインを構築します。2K解像度での生成、参照画像を使用した編集、そして画像を音声同期クリップへとアニメーション化することが可能です。

ファミリーを表示

Kwaivgi

Kwaivgi APIを標準価格より15%オフで提供。Atlas Cloudは、新しいKlingリリースへのDay-0アクセスを、従量課金制(Pay-as-you-go)およびシート数無制限で提供します。1つのアカウント、1つのキーで、スタンダードからマスター階層まで、すべてのKlingモデルをご利用いただけます。

ファミリーを表示

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索