MiniMax H3 vs Gemini Omni Flash:Googleが5ポイント差で盤面を制す。その後、クライアントが変更を求める。

MiniMax H3とGemini Omni Flashを3つのリーダーボードで比較したが、その3つの差はすべて誤差範囲内に収まった。そこで、両方に対して1回ずつ試行し、同じ修正指示を送り返した。

3つのArtificial Analysisリーダーボードを10分間見つめて、実際に勝ったのは誰か考えようとした。

テキストから動画へ:Gemini Omni Flashが5ポイント差。画像から動画へ:Geminiが2ポイント差。動画編集:MiniMax H3が9ポイント差。

次に、信頼区間の列を見た。±7。±9。±10。

3つのボード、3つの差、そのすべてが誤差範囲内に収まっている。ブラインド投票なら、この2つのモデルは同じモデルだ。

だからリーダーボードを閉じて、代わりにドロップダウンを開いた。その差は5ポイントではない。解像度の階層全体だ。

主要なポイント

  • Artificial Analysisの3つの差(+5, +2, +9、2026年8月6日時点)はすべて±7~±10の信頼区間に収まる。品質面では引き分けであり、勝利ではない。
  • H3は2K、最大15秒、6つのアスペクト比を提供。Gemini Omni FlashのAPIは720p、10秒、2つのアスペクト比に制限されている。これらは意見ではなく、列挙値である。
  • H3は音声を入力として受け付ける。Geminiは受け付けない。Geminiにはseedthinking_levelがある。H3にはない。
  • Geminiにはソースクリップを変更する専用のvideo-editエンドポイントがある。H3のリビジョンパスはreference-to-videoで、クリップを参照として用いて再生成する。これらは同じ操作ではなく、第2ラウンドでその違いが現れる。
  • 2つのうち、ダウンロード可能な重みを持つのは1つだけであり、それはGoogleのものではない。

異なる解像度の夜の屋台シーンの比較

MiniMax H3 vs Gemini Omni Flashテストの第1ラウンド、両モデルが同一の最初のフレームをアニメーション化、並べて表示

第1ラウンド:同じ最初のフレーム、同じプロンプト、同じ長さ。左がMiniMax H3(2K)、右がGemini Omni Flash(720p)。ここではサイレントGIFとして表示。両方の配信ファイルにはネイティブオーディオが含まれており、両方とも後ほど再生可能な動画として埋め込まれている。これが問題だ。どちらも優れているのだ。


MiniMax H3 vs Gemini Omni Flashのリーダーボードの差が誤って読まれている理由

あなたが見つけるほとんどすべてのMiniMax H3 vs Gemini Omni Flashの投稿は、1つのリーダーボードと1つの価格を引用している。どちらの習慣も間違った答えを生む。

以下に、3つのArtificial Analysisボードすべてを示す。誰もが見逃している列を含めて。

表A:MiniMax H3 vs Gemini Omni Flash、3つのArtificial Analysisリーダーボード(音声あり)、2026年8月6日時点

リーダーボードGemini Omni FlashMiniMax H3誤差範囲内か?
テキスト→動画1,243 (#1) ±7, 11,842票1,238 (#2) ±9, 6,830票Gemini +5はい
画像→動画1,191 (#2) ±9, 6,506票1,189 (#3) ±10, 5,545票Gemini +2はい
動画編集1,123 (#2) ±5, 11,706票1,132 (#1) ±6, 9,128票H3 +9はい、ぎりぎり

EloスコアはArtificial Analysis Video Arena(Artificial Analysis、2026年8月)より。画像→動画はDreamina Seedance 2.0 720p(1,197)がリードしており、これら2つのモデルはその王座を保持していない。これらは変動する群衆投票スコアであり、まさにそれが理由で5ポイントの差は決定的なものではない。

±9の区間を持つ5ポイントのリードは、投票のノイズだけで来週には順位が逆転する可能性があることを意味する。それは「Geminiはテキスト→動画に優れている」ではない。それはスコアボードが付いたコイントスだ。

人々が誤解しているさらに3つのこと:

1分あたりのドル列は、あなたが支払う金額ではない。 Artificial AnalysisはGeminiを$6.00/分、H3を$7.80/分と記載している。その列は、デフォルト設定での1080p 1分間のコストに正規化したものだ。Gemini Omni Flashは1080pをまったく生成できない。したがって、その数値はモデルによる推定値であり、実際の請求書ではない。秒数ではなく、完成した成果物を比較せよ。

1つのボードがモデル全体を表すわけではない。 H3は3つのボードで2位、3位、1位に位置している。Geminiは1位、2位、2位。どちらか1つだけを引用すれば、あなたがすでに信じていることを証明できる。

「Omni」は「何でも受け入れる」という意味ではない。 良い名前であり、誤解を招く名前でもある。この2つのうち、音声ファイルを入力として受け取るのは1つだけだ。名前に「omni」が付いている方ではない。

誰も印刷しないMiniMax H3 vs Gemini Omni Flashのスペックシート

Eloスコアで区別できないなら、制約テーブルで区別できる。私は両モデルの実際の入力スキーマを取得した。発表時の投稿を信頼するのではなく、その違いは微妙ではない。

表B:MiniMax H3 vs Gemini Omni Flashのハード制約、2026年8月6日のライブAPIスキーマから取得

制約MiniMax H3Gemini Omni Flash
解像度768P または 2K720p、そしてそれが列挙型の唯一の値
長さ4~15秒3~10秒
アスペクト比21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9 と 9:16 のみ
リビジョンパスreference-to-video(参照で再生成)専用のvideo-editエンドポイント(ソースを変更)
最終フレーム制御end_image 対応利用不可
参照制限画像≤9、動画≤3、音声≤3、合計12ファイル1~10枚の画像
音声入力ありなし
seed再現性なしあり
thinking_levelなしあり(default / high / low)
オープンウェイトあり、Hugging Face上なし

その表を正直に読めば、Geminiは3つの行で明確に勝っている。再現可能なシードは、同じフレームを2回レンダリングする必要があるパイプラインを構築する場合に重要だ。実際のvideo-editエンドポイントは、参照条件付き再生成とは真に異なるツールである。そしてthinking_levelは、H3が単純に公開していない品質調整機能を提供する。

H3は5つの行で勝っており、それらはクライアントが要求したファイルを配信できるかどうかを決定する行である。

以下のすべてはAtlas Cloudで実行した。なぜなら、両モデルが同じ/api/v1/model/generateVideoエンドポイントの背後にあるため、テスト全体で1つのポーリングループと1つの認証ヘッダーで済んだからだ。モデルの切り替えはmodel文字列の変更だった。その詳細こそが、「両方を使う」が逃げ口上ではなく現実的な答えである理由のすべてである。

表C:このテストの各エンドポイントのコスト、2026年8月6日のライブ価格表で確認

エンドポイント価格このテストの10秒クリップ
openai/gpt-image-2/text-to-image$0.009 / 画像$0.01
minimax/h3/image-to-video$0.14 / 秒$1.40
minimax/h3/reference-to-video$0.14 / 秒$1.40
google/gemini-omni-flash/image-to-video$0.13 / 秒$1.30
google/gemini-omni-flash/video-edit$0.14 / 秒$1.40
google/gemini-omni-flash/text-to-video$0.125 / 秒未使用
minimax/h3/text-to-video$0.14 / 秒未使用

今月、どちらのモデルにも割引はない。Geminiはより安い開発者向けティアも公開している(テキスト→動画と画像→動画は$0.112/秒、参照→動画は$0.12/秒)。H3には同等のティアはない。

Gemini Omni Flashが越えられないオープンウェイトライン。 H3の重みはHugging Face(MiniMax、2026年8月)で公開されている:33Bの高密度シングルストリームOmni Transformer、Qwen3-VL-32Bテキストエンコーダ、ビジュアルVAE、オーディオVAE。ダウンロードサイズよりも重要な注意点が2つある。まず、セルフホストで実行されるものは768ピクセルの短辺で動作する。Context-IR前処理ステージとRegenerate-2Kモジュールはリリースに含まれておらず、2K出力はこれら2つから得られる。次に、コミュニティライセンスは現在、EU、英国、韓国、米国をカバーしておらず、これらの地域には別の申請フォームがある。それを基に製品を構築する前に読んでおくこと。Gemini Omni Flashには同等の議論はない。ダウンロードするファイルがないからだ。

このオープンウェイトの立場は、攻撃的な価格設定と組み合わさって、このローンチの戦略的全容を物語っている(South China Morning Post、2026年8月)。

MiniMax H3 vs Gemini Omni Flashのリビジョンテストを自分で実行する

ここが誰も実行していない部分だ。誰もが最初の生成をベンチマークする。誰も2回目をベンチマークしない。

実際の仕事は1つのプロンプトではない。実際の仕事は、あなたがすでに気に入っているクリップと、それに「すごい、看板を24Hにできる?それと彼女のエプロンを赤にできる?」と書き返してくるクライアントだ。その一言が、この2つのモデルが互換性を失う瞬間であり、それはまさに動画編集リーダーボードが測定するタスクである。

シーンは意図的に残酷に設定されている:雨に濡れた夜の麺屋台、ベンダーがレンズに向かって直接話しかけ、背後に手描きの看板(読みやすい文字)、スープから立ち上る湯気、雨が天蓋に当たる。リップシンク、画面上のテキストの安定性、流動的な動き、重層的な周囲の音声を同時に試す1フレーム。

両モデルは同一の最初のフレーム、同一のプロンプト、同一のリビジョンノートを受け取る。以下のすべての実行は10秒であり、これはGemini Omni Flashの上限であり、H3の範囲内である。

ステップ 1: GPT Image 2で最初のフレームを固定する

両モデルは同じ画像から開始しなければならない。そうでなければ、第1ラウンドはモデルではなく構図の運を測定することになる。 GPT Image 2プレイグラウンドを開き、品質をhigh、アスペクト比を16:9に設定し、以下を貼り付ける:

plaintext
1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

AI画像生成インターフェース、プロンプトと生成画像を表示

Atlas Cloud上のGPT Image 2プレイグラウンド。左側に麺屋台のプロンプト、出力パネルに生成された最初のフレーム

Atlas Cloud上のGPT Image 2:左側にプロンプト、OUTPUTに共有された最初のフレーム。このステップのコストは$0.009。

女性が夜の屋台に立っている画像

生成された最初のフレーム:藍色のエプロンを着た女性が、雨の夜に湯気の立つ麺カウンターの後ろに立ち、背後に手描きの「OPEN LATE」の看板が光っている

両モデルが受け取った単一の入力。リビジョンが対象とする2つのものに注意:「OPEN LATE」の看板と藍色のエプロン。openai/gpt-image-2/text-to-imageで生成。

ステップ 2: MiniMax H3での第1ラウンド

MiniMax H3プレイグラウンドに移動し、image-to-videoタスクを選択し、ステップ1のフレームをアップロードし、resolution2Kduration10ratioadaptive(画像→動画の列挙型ではadaptiveのみ)に設定する。プロンプト:

plaintext
1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

AI動画生成インターフェース、テキストプロンプト入力と動画出力を表示

Atlas Cloud上のMiniMax H3画像→動画プレイグラウンド。2K解像度が選択され、出力パネルで完成したクリップが再生中

Atlas Cloud上のMiniMax H3画像→動画:2K選択、OUTPUTに完成したクリップ。このキャプチャはプレイグラウンドのデフォルト8秒で実行され、価格は$1.12。比較に使用した10秒バージョンは以下に埋め込まれており、コストは$1.40。

A8bowsMJgME

MiniMax H3、第1ラウンド、2K、10秒。音声オン:会話、雨、スープの音はすべて同じパスで生成され、後から重ねられたものではない。

ステップ 3: Gemini Omni Flashでの第1ラウンド、同じフレーム、同じ言葉

Gemini Omni Flashプレイグラウンドを開き、image-to-videoを選択し、同じステップ1のフレームをアップロードし、ステップ2のプロンプトを文字を変えずに貼り付ける。設定:resolution 720pduration 10aspect_ratio 16:9thinking_level defaultseed -1

そのフォームにある間に注意すべき2つのこと。なぜなら、それらはこの記事の縮図だからだ。resolutionドロップダウンには正確に1つのオプションしかない。durationフィールドは10で止まる。私はより良いものではなく720pを選んだわけではない。他に選ぶものがないのだ。

ここで欠けているものについての注意:Geminiのステップでは、実行完了のプレイグラウンドスクリーンショットを撮ることができなかった。私がスクリーンショットを撮るステージング環境は、3回の試行すべてでGoogle側から403 PERMISSION_DENIEDを返した。そのため、私が持っているGeminiのキャプチャは失敗したOUTPUTパネルを示すものだけであり、成功した実行のように偽装するつもりはない。以下のクリップは本物であり、上記の設定でプロダクションAPIを通じて生成されたものである。2つのH3ステップはきれいにキャプチャでき、それらのスクリーンショットは本物である。

pllIxfhjUR4

Gemini Omni Flash、第1ラウンド、720p、10秒、同一入力。上記のH3クリップの直後にこれを再生し、音声を自分で判断してほしい。

ステップ 4: 第2ラウンド、リビジョンをGemini Omni Flashに送信

これが重要なラウンドだ。同じGeminiモデルページでvideo-editタスクに切り替え、Geminiがステップ3で生成したクリップvideo入力としてアップロードし、resolution720pthinking_levelhigh(2部構成の編集指示は、まさにこのダイヤルが対象とする複雑なケースである)に設定する。このノートを、クライアントが送信するのとまったく同じように貼り付ける:

plaintext
1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.

UKw9LEogi0I

リビジョンノート後のGemini Omni Flash。看板、次にエプロンを確認し、他のものが動いたかどうかを確認する。

ステップ 5: 第2ラウンド、同一のリビジョンをMiniMax H3に送信

ここが正直な構造上の違いであり、結果を読む前に知っておくべきことだ。H3にはvideo-editエンドポイントがない。そのリビジョンパスはreference-to-videoである:元のクリップを参照として渡し、その参照に基づいて新しい動画を生成する。それはファイルを編集するのではない。あなたのもののように見える新しいファイルを作成するのだ。

MiniMax H3ページで、reference-to-videoタスクを選択し、H3がステップ2で生成したクリップを動画参照としてrefersに追加し、resolution2Kduration10ratioadaptiveに設定する。ステップ4のプロンプトを編集せずに貼り付ける。

このステップにもプレイグラウンドのスクリーンショットはない。理由は異なり、もっと退屈だ:私がキャプチャに使用するヘッドレスブラウザが、動画参照のアップロード中に3回クラッシュした。実行自体はAPIを通じて問題なく行われた。

TKIThp6r_oU

MiniMax H3、同一のリビジョンノート後、reference-to-videoで2K。

雨の夜の屋台で調理する女性の比較

第2ラウンドの並べて比較:Gemini Omni Flashのvideo-edit結果とMiniMax H3のreference-to-video結果、同じリビジョンノートから

第2ラウンドの並べて比較、サイレントGIF。左がGemini Omni Flash(video-edit)、右がMiniMax H3(reference-to-video)。両方とも同じ文章を元に作業した。

第2ラウンドで実際に起こったこと。 私はH3がここで負けると予想していた。参照条件付き再生成は、実際の編集エンドポイントよりも鈍い道具であり、「クリップ全体を再生成して、同じ場所に収まることを願う」というのは、まさに別の顔、動くカメラ、そして「ショットに何が起こったのか」と尋ねるクライアントを得る方法である。

しかし、帰ってきたのはそうではなかった。両方のモデルが仕事をこなし、どちらもきれいに仕上げた。

Geminiのvideo-editは宣伝通りに動作した。看板は同じ手描きの文字で「OPEN 24H」と読め、同じ琥珀色の輝きと缶の風化具合を保っていた。エプロンは深紅色になっていた。他のすべては手付かずだった:同じ顔、同じ表情、同じお玉の角度、同じ蒸気の形、同じ雨、同じ背景のテールライト。それは元のファイルに2つのピクセル単位の修正を加えたように見える。なぜなら、本質的にそれがそうだからだ。

H3のreference-to-videoは同じ2つの変更を生成し、アーキテクチャが示唆するよりもはるかにうまくショットを維持した。看板は変わり、エプロンは変わり、10秒間すべてにおいて、フレーミング、お玉から流れ落ちるスープの様子、蒸気の柱、彼女の顔は、第1ラウンドのクリップと一貫していた。ここにドリフトがあるとしても、フレームをステップ実行しても見つけることができなかった。

したがって、第2ラウンドは3番目の統計的引き分けであり、よりきれいな話にするためにそうでないふりをするつもりはない。2つの出力を分けるのは編集の品質ではない。H3が2560x1440の32kHzステレオトラックを返したのに対し、Geminiは1280x720を返したという点である。同じ指示、同じ成功、異なる成果物。

方法に関する正直な注意点が1つある:これは単一のショットに対する単一のリビジョンであり、管理された研究ではない。看板と衣服に対する2部構成の変更は、かなり親切な編集である。より難しいケース(カメラが通り過ぎる物体の削除、被写体が隠しているものの変更、積み重なった4ラウンドのノート)では、専用の編集エンドポイントがリードし、再生成が揺らぎ始めるはずである。決定する前に、あなた自身のケースを実行してほしい。

テストする価値のあるさらに3つのMiniMax H3 vs Gemini Omni Flashの分割

第2ラウンドは、納品を変える分割である。さらに3つは、あなた自身のクレジットで20分を費やす価値がある。

音声ファイルを入力する。 H3のreference-to-videoは、最大3つの音声クリップ(2~15秒)を受け付ける。ただし、少なくとも1つの画像または動画参照がそれらに付随している必要がある。つまり、実際の音声録音を渡して、キャラクターにそれを実行させることができる。Gemini Omni Flashには、4つのエンドポイントのいずれにも音声入力フィールドがない。したがって、この比較はまったく実行できない。Googleにとってスコアリングの損失ではない。それは単に存在しない機能である。

21:9を要求する。 H3のreference-to-videoratio列挙型には、21:9、16:9、4:3、1:1、3:4、9:16が含まれている。Geminiのaspect_ratio列挙型には16:9と9:16が含まれている。成果物がワイドスクリーンのタイトルシーケンスまたは1:1のソーシャルカットである場合、これらの2つのモデルのうち1つは会話に参加していない。

シードを固定して再実行する。 これは逆方向に進む。Geminiはseedを公開している。H3はどのエンドポイントでもそれを公開していない。同じリクエストが火曜日に返したのと同じフレームを月曜日に返す必要があるパイプラインを構築している場合、Geminiはハンドルを提供し、H3は何も提供しない。回帰テスト、A/Bコピーバリアント、または自動化されたレンダーファームの場合、それは真の利点であり、Google側の台帳に属する。

MiniMax H3 vs Gemini Omni Flashテストの実際のコスト

上記の実験全体(4つの動画生成と1つの画像)には、約**$5.51**かかった。最初のフレームに$0.009、2つの10秒の第1ラウンドクリップに$1.40と$1.30、2つの10秒の第2ラウンドクリップにそれぞれ$1.40。

1秒あたりでは、Geminiの方が安い:$0.125~$0.14対H3の一律$0.14。したがって、エンドポイントによって約7~11パーセント安い。その数字は真実であり、またそれだけではほとんど役に立たない。

その理由は次のとおりである。成果物が15秒の21:9シネマティックオープナー(2K)であると仮定する。H3はそれを1つのクリップとしてレンダリングする。Geminiはそれをまったくレンダリングできない:解像度、長さ、アスペクト比のいずれも。10秒と5秒の16:9クリップをつなぎ合わせ、トリミングしてワイドスクリーンを偽装し、720pで出荷することになる。配信できないものの1秒あたりの価格は節約にはならない。

逆もまた同様である。成果物が16:9のソーシャルカットで、クライアントからの修正が4ラウンドあり、法務チームが3週間後に再レンダリングを要求したときにバイト単位で同一でなければならないと仮定する。Geminiのvideo-editseedはまさにそのループのために構築されており、1秒あたりのコストも低い。

表D:どのMiniMax H3 vs Gemini Omni Flashのジョブをどこに送るか

目前のジョブ送信先
2K納品MiniMax H3
10秒より長い単一ショットMiniMax H3
21:9、4:3、1:1、3:4のフレーミングMiniMax H3
実際の音声トラックの入力MiniMax H3
自社GPUでのセルフホスティングMiniMax H3
特定の最終フレームに着地MiniMax H3
対話型の複数ラウンドのリビジョンGemini Omni Flash
クリップの手付かずの部分を保存Gemini Omni Flash
シードによる再現可能なレンダリングGemini Omni Flash
プレーンな16:9の短尺フォーマット、最低の1秒あたりレートGemini Omni Flash

この記事の結論は、その表であり、スコアではない。ベンチマークが2つのモデルを自身の誤差範囲以上に分離できない場合、ベンチマークは知っているすべてを伝えており、その後はスペックシートが引き継ぐ。

H3が他のモデルと比較してどの位置にあるかについては、MiniMax H3の代替案の内訳で、H3がリードしていないボードでそれを上回るモデルをカバーしている。

よくある質問

MiniMax H3はGemini Omni Flashより優れていますか?

ブラインド投票では両者を分離できません。3つのArtificial Analysisリーダーボード全体で、差は5、2、9 Eloポイントであり、それぞれが±7~±10の信頼区間内に収まっています。ランクではなく、仕様で選んでください。解像度の上限、長さの制限、アスペクト比のリストは成果物を変えます。5 Eloポイントは変えません。

MiniMax H3とGemini Omni Flashではどちらが安いですか?

1秒あたりではGeminiです。Atlas Cloudでは、H3の一律$0.14/秒に対して$0.125~$0.14/秒で動作し、H3に同等のものがない開発者ティアが$0.112/秒であります。ただし、Geminiは720p、10秒、2つのアスペクト比に制限されているため、多くの成果物では同じ製品を比較していません。秒ではなく、完成したカットの価格を設定してください。

Gemini Omni Flashは1080p、2K、または15秒の動画を生成できますか?

いいえ。そのAPIのresolutionパラメータには1つの有効な値720pしかなく、durationは3~10秒を受け付けます。MiniMax H3は768Pまたは2Kと4~15秒を提供します。これらは2026年8月6日のライブスキーマから読み取った列挙型の制約であり、編集上の意見ではなく、Googleは後でこれらを引き上げる可能性があります。

Gemini Omni FlashをMiniMax H3のようにセルフホストできますか?

いいえ。H3の重みはHugging Faceにあり、768ピクセルの短辺でローカル実行されます。2K出力を生成するContext-IRステージとRegenerate-2Kモジュールはリリースに含まれておらず、API側に残ります。また、ライセンスを確認してください。現在、EU、英国、韓国、米国をカバーしておらず、これらの地域には別の申請が必要です。

1つだけ選ばなければなりませんか?

いいえ、上記のジョブ分割表がより良い答えです。両方のモデルはAtlas Cloud上の同じgenerateVideoエンドポイントの背後にあるため、両方を実行するということは、1つのポーリングループと異なるmodel文字列を意味し、2つの統合ではありません。毎週変動するリーダーボードに賭けるよりも、成果物ごとにルーティングする方が賢明です。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索