Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

MiniMax H3 アニメ動画生成器: 15秒、4:3、そしてVeo 3.1が台無しにしたタイトルカード

同じキーフレームにおけるMiniMax H3アニメ動画生成器とVeo 3.1の比較。H3は4〜15秒、6つの比率に対応し、Veoは最大8秒、2つの比率に制限される。日本語の台詞、9つの参照、実際の実行。

この夏、私のフィードは同じ動画がループしていた。ワールドカップの選手たちが少年漫画の主人公として描き直されている。独裁者。海賊船長。最後の4秒で現れる老練なメンター。投稿は数百万 views、そして試合のたびにストーリーが更新される。

それらを作っている誰も、ベンチマーク記事を書いているわけではない。モデルを選び、クレジットを消費し、次のキックオフまでに投稿している。

そこで私は、アニメのキーフレーム1枚とプロンプト1つを使い、MiniMax H3をアニメ動画生成機としてVeo 3.1と比較テストした。両方とも同一入力で最大設定にした。

最初に壊れたのは画質ではなかった。ドロップダウンだった。Veo 3.1は8秒で止まり、アスペクト比は2つだけ。顔を捉えたショット、ボールに合わせたウィップパン、そしてタイトルカードを表示する――これが8秒に収まらない。そもそも品質で失敗する機会がなかった。

重要なポイント

  • Veo 3.1のduration enumは[4, 6, 8]aspect_ratio enumは[16:9, 9:16]。MiniMax H3は4から15までの任意の整数秒、21:9, 16:9, 4:3, 1:1, 3:4, 9:16を提供。Veoに4:3がないため、レトロOVAフレーミングは不可能。
  • H3のモデルカードには11のネイティブ安定ダイアログ言語が記載され、日本語も含まれる。オーディオと画像は32kHzステレオで同時生成され、後から吹き替えられるわけではない。
  • リファレンスパックは大きく異なる:H3は最大9枚の画像+最大3つの動画と3つのオーディオクリップ(最大12ファイル)。Veo 3.1のリファレンスエンドポイントは3画像で、それを使うとduration[8]のみに縮小される。
  • テストを静かに台無しにする2つの落とし穴:VeoのAPIはデフォルトでgenerate_audiofalseresolution720p。H3のテキスト→動画のratioはデフォルトで1:1。これらをそのままにすると、無音の720pクリップと正方形のクリップを比較することになる。
  • Veo 3.1にはH3に全くない2つの機能がある:seednegative_prompt。2Dアニメでは後者は本当に重要で、その理由を示す。

MiniMax H3 アニメ動画生成機 vs Veo 3.1、同じフレームを連続比較

オリジナルキャラクター1体。キーフレーム1枚。プロンプト1つ、両モデルに一字一句同じものをコピー。それ以外は各側で最大設定。

MiniMax H3、画像→動画、2K、8秒、ネイティブオーディオ。音声をオンに:観客のざわめき、ボールを打つ音、日本語の叫び声が画像と同じパスで生成される。Atlas Cloud上でminimax/h3/image-to-videoを使用して生成。

Veo 3.1、画像→動画、1080p、8秒、generateaudioを手動でオン、negativepromptで線画をフラットに保持。同じ最初のフレーム、同じ言葉。Atlas Cloud上でgoogle/veo3.1/image-to-videoを使用して生成。

両方とも美しく描画する。Veoのワイドショットのストライク、手描きのインパクトラインと空中に浮かぶ漫画の効果音は、本当に素晴らしい。それが正直な出発点であり、この記事の残りが雰囲気ではなくパラメータと指示追従についてである理由だ。

なぜほとんどのMiniMax H3アニメ動画生成機 vs Veo 3.1テストが間違うのか

この夏、2つのことが同時に起こった。

アニメはAI動画で最もボリュームのあるフォーマットになった。2026年ワールドカップは少年漫画のトーナメントとして書き直され、選手たちは独裁者、海賊船長、海兵隊将軍、メンターとしてキャストされ、TikTok、Instagram、X、YouTubeで「ほぼ毎試合後に進化する」ストーリーが展開された(Complex、2026年7月)。

そしてMiniMax H3がオープンウェイトでリリースされた。初日のComfyUIスレッドは330ポイント、95コメントに達し、数時間以内に実際のローカル数値を投稿する人々がいた(Hacker News、2026年8月)。

これらを合わせると、山のようなアニメ比較が期待される。しかしほとんど存在しない。なぜなら、ほとんどのテストが4つの方法で間違って構築されているからだ。

写真を比較し、制約を比較しない。 アニメのショットはタイミングである。ウィップパンからタイトルカードは、レンダリングの問題になる前に時間の問題である。

VeoのAPIがデフォルトで無音であることを忘れている。 APIではgenerate_audiofalseresolution720p。「Veoはアニメで音声がない」という投稿の多くは、誰かがブール値を切り替えなかっただけである。

H3のテキスト→動画がデフォルトで正方形であることを忘れている。 ratioのデフォルトは1:1であり、16:9ではない。設定せずにt2vアニメプロンプトを実行すると、正方形のクリップと混乱した結論を得る。

フォトリアルなプロンプトでテストする。 「シネマティック、ボリューメトリックライト、浅い被写界深度」は、まさに2Dモデルを3Dレンダリングシェーディングに引きずり込む語彙である。アニメでの失敗モードはブラーではない。プラスチックである。

実行前にアニメテストを決定する3つの設定

何よりも先に、両側でこれらを設定しないと比較は無効である。

設定MiniMax H3Veo 3.1スキップした場合の結果
オーディオ画像と同時生成、常にオンgenerate_audioのデフォルトはfalseVeoは無音クリップを返し、実際より悪く見える
フレーム形状ratioはテキスト→動画でデフォルト1:1aspect_ratioのデフォルトは16:9H3は使えない正方形のアニメカットを渡す
解像度デフォルト2Kデフォルト720p2Kと720pを比較して品質差と呼ぶ

MiniMax H3 vs Veo 3.1アニメスペックシート:長さ、比率、オーディオ、リファレンス

ランチ記事を信頼するのではなく、両モデルのライブ入力スキーマを取得した。以下のすべての値は、モデルページで直接確認できるenumであり、印象ではない。

表1: MiniMax H3 vs Veo 3.1、アニメショットを決定するパラメータ

MiniMax H3Veo 3.1
時間4~15、任意の整数秒(デフォルト8)4, 6, 8(デフォルト8)
アスペクト比21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
比率デフォルト(テキスト→動画)1:0116:09
解像度768P, 2K(デフォルト2K)720p, 1080p, 4k(デフォルト720p)
オーディオ同時生成、32kHzステレオgenerate_audio、デフォルトfalse
ネイティブダイアログ言語11安定、日本語含む安定リストとして公開なし
リファレンスパック最大9画像、3動画、3オーディオクリップ、合計12ファイル3画像
リファレンス使用時の時間4~15のまま8のみに縮小
seed利用不可利用可能
negative_prompt利用不可利用可能
ウェイトダウンロード可能クローズド

時間、比率、解像度、オーディオ、リファレンス制限は、MiniMax H3 image-to-videoH3 text-to-videoH3 reference-to-videoVeo 3.1 image-to-videoVeo 3.1 reference-to-videoのライブスキーマから読み取った。9画像・12ファイルのリファレンス上限と11言語のダイアログリストは、MiniMax H3モデルカード(Hugging Face、2026年8月)から。

次にスコアボード。スペックシートとは異なることを示しており、両方とも重要である。

表2: 群衆投票Eloと1分あたりのリスト価格、2026年8月7日時点

モデルテキスト→動画(音声あり)画像→動画(音声あり)$/分
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6トップ10にリストなし$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6トップ10にリストなし$9.00
Veo 3.1 Lite1,089 (#15) ±7トップ10にリストなし$4.80

Eloと価格はArtificial Analysis Video Arena(Artificial Analysis、2026年8月)から。これらは変動する群衆投票である。$/分の列は正規化されたモデル推定値であり、実際の請求書ではない。

145ポイントのElo差は大きいが、汎用投票であり、アニメ投票ではない。そしてここで率直に言わなければならない:MiniMaxはH3をアニメモデルとして売り込んでいない。内部の一次フィードバックでは、映画、アニメーション、漫画ドラマはH3が対象としない領域としてリストされている。したがって、興味深い質問は「どちらがアニメモデルか」ではない。なぜアニメで売り込んでいないモデルがショットで勝つのか、そしてGoogleがまだどこでラウンドを取るのかである。

チュートリアルの前に、実用的な注意点。以下のすべてのモデルは同じコンソールと同じAPIキーを通じて実行される。これがパラメータを比較可能にする唯一の理由である。同じキュー、同じ認証、1つの請求書。GPT Image 2をあるサービスで、Veoを別のサービスで設定すると、違いの半分は配管の問題になる。

ショットを構築する:MiniMax H3 vs Veo 3.1、ステップバイステップ

1つの実行例、最初から最後まで。「ラストホイッスル」:オリジナルの10代ストライカー、赤い髪、白と紺の9番ユニフォーム、フラッドライト、ストライク時のウィップパン、そして最後の2秒で着地して安定しなければならない日本語のタイトルカード。

実在の選手なし、公式キャラクターなし、既存のアニメIPなし。スタイルとオマージュのみ。その理由については後ほど。

ステップ1: GPT Image 2でアニメキーフレームをデザインする

キーフレームはアートディレクションを伝えるので、動画モデルがそれを発明する必要はない。左3分の1のネガティブスペースに注意:意図的である。タイトルカードはそこに動画モデルによって書き込まれる。これがテキスト安定性テストである。

Plain
1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked
2line art with consistent line weight, flat colour fills, hard-edged graphic shadows,
3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker:
4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across
5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him,
6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst
7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette,
8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of
9centre, clean negative space on the left third. No text anywhere in the image.

設定: model openai/gpt-image-2/text-to-image, quality high, size 16:9 (2048x1152)。それ以外はなし。

AI画像生成インターフェース:アニメ画像を作成するための番号付きステップを表示

Atlas Cloud上のGPT Image 2プレイグラウンド、ラストホイッスルのキーフレームプロンプトと出力パネル内の完成したアニメフレーム

GPT Image 2 on Atlas Cloud: quality を high に設定、右側に完成したキーフレーム。

スタジアムで叫ぶ赤髪のアニメアスリートのクローズアップ

ベースとなるアニメキーフレーム:スタジアムのフラッドライトの下で叫ぶオリジナルの赤髪ストライカー、セルシェーディング、フラットカラー、スピードライン

両モデルが受け取るキーフレーム。フラットカラー、ハードな影、タイトルカードを待つ空の左3分の1。

ステップ2: MiniMax H3画像→動画、すべて最大設定

同じ画像を入力、2K出力。ここではH3を8秒に制限しているが、Veoの上限に合わせるためである。H3の限界ではなく、ステップ4で制限を外す。

Plain
1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the
2striker's face for one beat, then a violent whip pan follows the ball as he strikes it,
3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence
4at impact. Over the final two seconds, bold white Japanese title lettering reading
5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping,
6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」
7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the
8title card.

設定: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive(画像→動画は入力画像からフレーム形状を取得), image = ステップ1の出力。

テキスト→動画に分岐する場合の警告:明示的にratio: 16:9と書くこと。デフォルトは1:1で、喜んで正方形のアニメカットを提供する。

AI動画生成インターフェース:入力プロンプトと出力動画を表示

Atlas Cloud上のMiniMax H3画像→動画プレイグラウンド、ラストホイッスルプロンプト、キーフレーム読み込み、出力パネル内の完成したクリップ

Atlas Cloud上のMiniMax H3画像→動画:左側にステップ1のキーフレーム読み込み、右側で完成したクリップが再生中。

ステップ3: Veo 3.1画像→動画、音声を手動でオン

プロンプトは同一、一字一句。形容詞を1つ変えると比較でなくなる。変わるのは、Veoが提供しH3にはない追加フィールドである。

negative_prompt。2Dアニメでは、このリストで最も有用なコントロールである。

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

設定: model google/veo3.1/image-to-video, resolution: 1080p(変更する、デフォルトは720p), duration: 8(これが上限), aspect_ratio: 16:9, generate_audio: true(APIデフォルトはfalse、これが無音クリップの罠), seed: 20260807, image = 同じステップ1の出力。

AI動画生成インターフェース:入力設定と生成されたアニメ動画を表示

Atlas Cloud上のVeo 3.1画像→動画プレイグラウンド、generate audio有効、アニメキーフレーム読み込み、出力パネル内の完成したクリップ

Atlas Cloud上のVeo 3.1画像→動画、Generate Audioがオン、右側に完成したクリップ。

ステップ4: アニメ固有の5つの軸でスコアリング

ここで生成するものはない。ただ見るだけ、アニメが実際に壊れる点で。両方のクリップはこの記事の上部近くに埋め込まれているので、私の言葉を信じずに自分でスコアリングできる。

サッカースタジアムシーンの左右比較、MiniMax H3とVeo 3.1のラベル

両方のクリップの最終フレームのサイドバイサイド。左:MiniMax H3、クリーンな日本語タイトル文字。右:Veo 3.1、乱れた縦書き文字。

各クリップの最後のフレーム。左:H3は「ラストホイッスル」と、8つのカタカナすべて正確で安定。右:Veo 3.1は3文字を書き、要求された単語でもなく、単語も形成していない。

タイトルカードがラウンドを決定した場所であり、接戦ではなかった。H3は要求されたカタカナを正確に、硬いエッジで安定して、ゴール前のスミアパンの上にレンダリングした。Veo 3.1は3文字の縦書きスタックを生成したが、それは要求された単語でも単語でもない。同じフレームでキャラクターをショット外に落とし、背景を半フォトリアルなスタジアムプレートに向かってドリフトさせた。photorealistic skin3D renderがネガティブプロンプトにあるにもかかわらず。

表3: アニメカットを決定する5つの軸(これら2つの実行から)

MiniMax H3Veo 3.1
キーフレームからのキャラクター継続性正確な顔、髪、ユニフォームを8秒間保持新しいワイドショットでキャラクターを描き直し、モデルには合っているが別の描画
線の太さとフラットセルシェーディング保持、3Dへのドリフトなしミッドショットでは保持、終わりに向けて写真のようなスタジアムプレートにドリフト
日本語タイトルカードラストホイッスルが正しくレンダリングされ安定3文字、要求された単語でなく、単語でもない
提供されたオーディオトラック32kHzステレオ、モデルカードの通り正確48kHzステレオ、自分でgenerate_audioを設定したためにのみ存在
ウィップパンと作画スミアスミアパンとして実行されタイトルへ新しいセットアップへのハードカットに置き換え

最後の行は、これまでのH3に対する最も大きな批判であり、まさにそれを両方のプロンプトに書いた理由である。初日のComfyUIスレッドで、ユーザーfwipは公式デモプロンプトさえ無視されたと不満を述べた:「屋上からの激しいウィップパンで、浮かんでいる言葉を一緒にスミアさせ、モーションストリークが入る。そして動画はそのトランジションを全く行わず、カットに置き換えただけだった。」

今回の実行では、パンをカットに置き換えたのはVeoであり、H3はスミアした。各1テイクは判定ではなく、そう主張するつもりはない。しかし、批判がH3特有ではないことを意味する:ウィップパンはこのテスト全体で最も信頼性の低い指示であり、どちらの側でも同じである。ストーリーボードがそれに依存する場合は、それを通してではなく、その周りでストーリーボードを組むこと。

ステップ5: Veo 3.1が構造的に出力できない4:3レトロOVAカット

これは品質の好みではない。壁である。Veoのaspect_ratio enumには2つの値があり、4:3はなく、duration enumには12がない。90年代のOVAルックは単純にアドレス不可能である。

Plain
1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush
2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the
3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a
4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a
5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese:
6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio:
7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.

設定: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3。この比率は手動で設定、デフォルトを忘れずに。

AI動画生成インターフェース:テキストプロンプトと生成されたアニメ動画を表示

Atlas Cloud上のMiniMax H3テキスト→動画プレイグラウンド、OVAプロンプト入力、完成したレトロクリップが出力パネルに

Atlas Cloud上のMiniMax H3テキスト→動画、OVAプロンプト入力、クリップ完了。ただし、この特定の実行ではAspect Ratioが16:9、Durationが8のままだったため、右側に見えるのはワイドスクリーンの短縮版である。以下の4:3の12秒カットは、ratio: 4:3duration: 12を明示的に設定したAPIコールからのもの。

赤い髪のアニメサッカー選手が、汚れたユニフォームでスタジアム内に立っている

4:3レトロOVAカット:同じストライカーが90年代アニメスタイルで雨に濡れたピッチを去る

H3テキスト→動画、4:3、12秒。配信されたファイルは1920x1440(ピクセル単位で4:3)、32kHzステレオトラック付き。ページを軽くするために、フレームレートを下げた無音GIFで表示。Atlas Cloud上でminimax/h3/text-to-videoを使用して生成。

ステップ6: 9枚のリファレンス画像、1キャラクター、4カット

クロスショットのキャラクター一貫性はAIアニメで最も難しい問題であり、リファレンスボリュームで解決される。まずパックを構築する:ステップ1のプロンプトを再実行し、フレーミングを正面、斜め、完全な横顔、背面、笑顔、歯を食いしばった、全身、ユニフォーム詳細、ブーツ詳細に変更する。9枚の画像、合計約8セント。

具体的で明確?はい(4つのイラスト、赤髪、アニメ、サッカーを指定)

同じオリジナルストライカーキャラクターの4つの角度をリファレンスパックとして生成、2x2のグリッドに配置

9枚のリファレンスアングルのうち4つ。H3は1つのリファレンスパックで最大9枚の画像、さらに動画とオーディオリファレンスを受け入れる。

Plain
1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep
2the referenced striker's face, hair silhouette and number 9 kit identical across every cut.
3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf,
4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three
5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines
6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the
7freeze.

設定: model minimax/h3/reference-to-video, refers = 画像(type: image), resolution: 2K, duration: 8 以上, ratio: adaptive または 16:9

Veo 3.1の同等機能はこれらの設定では実行できず、試す必要もない理由がわかる。そのリファレンスエンドポイントは最大3画像を受け入れ、そのエンドポイントを選択するとdurationは単一の有効値8に縮小される。9画像パックと10秒テイクはどちらも範囲外である。

AI動画生成インターフェース:入力プロンプトと生成されたアニメ動画を表示

Atlas Cloud上のMiniMax H3リファレンス→動画プレイグラウンド、リファレンスカウンターが4/9、出力パネルに最初のカット

Atlas Cloud上のMiniMax H3リファレンス→動画。カウンターはReference Materials (4/9)と表示され、下にMAX:9、これはインターフェースの上限であり、スペックシートの主張ではない。出力はカット1、ブーツへの低アングルプッシュイン。

さらに4つのMiniMax H3アニメ動画生成機の実行が価値がある

ラストホイッスルのショットは、違いのうち4つだけを強調している。これら4つは残りを強調する。すべてH3で実行;Veo 3.1が一致できるかどうかのメモを各実行に付記する。

  1. ウルトラワイド作画バトル、21:9、10秒。 Veoは21:9を全く出力できない。
Plain
1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows,
2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade
3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact
4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a
5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth
6snap, a low taiko hit on the final freeze, no music.
  1. ビート同期AMVカット、オーディオリファレンス付きリファレンス→動画。 H3は最大3つのオーディオクリップをリファレンス入力として受け入れる。Veo 3.1にはオーディオ入力が全くなく、オーディオ出力のみ。
Plain
1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on
2a window, a hand tightening a bandage, a city skyline flashing past a train window, a
3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of
4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep
5indigo and neon magenta.
  1. 2行の日本語ダイアログシーン、12秒。 これがリップシンクのストレステストであり、12秒はすでにVeoの範囲外である。
Plain
1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at
2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second
3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim
4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant
5traffic, one cicada.
  1. 縦型少年漫画ショート、9:16、8秒。 両モデルとも縦型は可能なので、ここが実際にA/Bテストする唯一の場所であり、仮定してはいけない。
Plain
1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a
2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates
3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky.
4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd
5surge, one breath held then released.

これらの背後にあるプロンプト文法が必要な場合、MiniMax H3プロンプトガイドでは、H3がカメラとオーディオの指示を解析する方法について、ここでできるよりも深く掘り下げている。

MiniMax H3 vs Veo 3.1での60秒アニメOPのコスト

標準的なアニメOPは約90秒。8秒のショット8つ、完成動画64秒、各ショット1キーフレーム($0.009/枚)と仮定する。

実際の価格差があり、それを隠すよりも知っておくべきである。Atlas CloudカタログはMiniMax H3を$0.10/秒のフラットレートでリストしているが、モデルreadmeは2Kで$0.14/s、768Pで$0.10/sと内訳を示している。Veo 3.1は$0.20/秒でリストされているが、readmeは音声あり$0.40/s、音声なし$0.20/sと分けている。

私のスクリーンショットの実行ボタンがそれを確定する。H3リファレンス→動画、8秒2K、引用Run $1.12、これは正確に$0.14/秒。Veo 3.1画像→動画、8秒1080p音声あり、引用Run $3.2、これは正確に$0.40/秒。したがって、readmeレートが実際に請求されるものであり、カタログの見出しはエントリーティアである。以下では両方の読み値を示す。これらは2026年8月時点のリスト価格である。

表4: 8秒のショット8つ、キーフレーム込み

設定動画コスト(カタログレート)動画コスト(readmeレート)キーフレーム合計範囲
MiniMax H3, 2K$6.40$8.96$0.07$6.47 to $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p 音声あり$12.80$25.60$0.07$12.87 to $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

価格は表1にリンクされたAtlas Cloudモデルページから、2026年8月。これらの4つはいずれも現在割引なし。

この表に含まれていない2つのこと、どちらも秒単位のレートより影響が大きい。

リトライ。 アニメショットの最初のテイクを出荷する人はいない。どのような倍率を仮定しても、両方の列に適用すると、同じ割合で差が広がる。

実時間、これは逆方向に働く。 2026年8月7日に端から端まで計測:H3の2K 8秒は447秒、約7.5分。H3テキスト→動画2K 12秒は334秒。Veo 3.1の1080p 8秒音声ありは152秒、3分未満。Veoはここで最初のテイクまで約3倍速い。深夜にショットを反復している場合、これは実際の金銭的価値がある。キューは動くので、これらは1回の午後のスナップショットであり、仕様ではない。しかし、「2〜3分」とH3の2Kについて引用している人は、readmeを引用しているのであり、キューではない。詳細は2K vs 768Pの内訳で、上位ティアが追加の数分に値する場合をカバーしている。

アニメスタイル、オマージュ、そして実際に公開できるもの

この記事のすべてはスタイルとオマージュである。オリジナルキャラクター、オリジナルユニフォーム、オリジナルタイトル。公式アニメキャラクターは生成も要求もされておらず、実在のサッカー選手の名前や肖像も使用されていない。ワールドカップのトレンドはフォーマットとして参照されている。それが有用だからである。

その区別は飾りではない。アニメスタイルのコンテンツを商業的に制作する場合、「90年代OVAのスタイルで」と「この特定の番組のこの特定のキャラクター」は異なる法的対象であり、そのうちの1つだけがビジネスになる。

オープンウェイトについて:H3は実際にダウンロード可能であり、人々は初日に実行した。あるコメンターは、4070 Ti Super 16GBで10秒480pクリップに10分を報告し、他の人は5080で3分、RTX 6000 Proで68秒を投稿した。しかし、セルフホスティングは768短辺で実行され、2Kを生成するContext-IRとRegenerate-2KステージはAPI側に残る。

ライセンスには実際の落とし穴がある。コミュニティライセンスは現在、EU、英国、韓国、米国をカバーしておらず、「現在AI関連規制を策定または施行している地域」を挙げている。正式なライセンスリクエストチャネルが開かれており、あるHNコメンターは「ディズニーを怒らせないとピンキーサインすれば、ライセンスを送ってくれる」と要約した。面白いが、これらの4つの地域のいずれかにいる場合、スキップできないコンプライアンスステップでもある。完全な地域リストはオープンウェイトの記事に記載されている。

よくある質問

MiniMax H3はVeo 3.1と比較して良いアニメ動画生成機ですか?

ほとんどのアニメ作業では、H3の方が優れている。主な理由はレンダリングに関するものではない。H3は4〜15秒(Veoは4,6,8)、6つのアスペクト比(4:3,21:9を含む、Veoは2つ)、11のネイティブ安定ダイアログ言語(日本語含む)、9枚のリファレンス画像(Veoは3枚)を提供する。Veo 3.1が勝る特定の状況:再現可能なリテイクにseedが必要な場合、またはショットが3Dレンダリングシェーディングにドリフトするのを防ぐnegative_promptが必要な場合。H3にはどちらのパラメータもない。パイプラインがどちらかに依存している場合、それは本当に留まる理由になる。

Veo 3.1は4:3や15秒のクリップでアニメを生成できますか?

いいえ、スタイル上の理由ではない。Veo 3.1のaspect_ratio enumは正確に16:99:16duration enumは正確に468である。選択可能な4:3の値はなく、12秒や15秒をリクエストする方法もない。リファレンスが90年代のテレビアニメやOVAの場合、フレーミングはVeoでは不可能で、H3では可能である。

なぜ私のVeo 3.1アニメクリップは無音で返ってきたのですか?

APIでgenerate_audioのデフォルトがfalseだからである。プレイグラウンドのトグルは通常すでにオンなので、これはAPIを直接呼び出す人だけに影響する。明示的にgenerate_audio: trueを設定する。ついでにresolutionも設定する。デフォルトは720pであり、おそらく意図した1080pや4kではない。

MiniMax H3はアニメで日本語のダイアログとリップシンクを行いますか?

はい。モデルカードには11の安定したダイアログサポート言語がリストされている:アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語。オーディオは画像と同時に32kHzステレオで生成され、後から吹き替えられるわけではない。そのため、最初の数音節だけでなく、ライン全体で口のタイミングが合う。日本語のラインはプロンプトに直接日本語で書くこと。

アニメキャラクターの一貫性を保つために、どのくらいのリファレンス画像を使用できますか?

MiniMax H3は最大9枚の画像、最大3つの動画クリップ、最大3つのオーディオクリップを受け入れ、全タイプで最大12ファイルのハードリミット。Veo 3.1のリファレンス→動画エンドポイントは1〜3画像を受け入れ、それを選択するとdurationは唯一の有効値8に縮小される。シリーズ全体で繰り返し登場するアニメキャラクターにとって、その違いがすべてである。

MiniMax H3はオープンウェイトなので、アニメパイプラインを無料でローカル実行できますか?

ダウンロードして実行できるが、3つの注意点がある。セルフホスト推論は768短辺で実行され、2K出力を生成するContext-IRとRegenerate-2KステージはAPI側に残る。実際のローカル速度はカードによって大きく異なる:初日のComfyUIスレッドによると、4070 Ti Superで10秒480pクリップに約10分、5080で約3分、RTX 6000 Proで約68秒。そしてコミュニティライセンスは現在、EU、英国、韓国、米国をカバーしていない。これらの地域にいる場合は、商業利用の前に正式なライセンスが必要である。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索