Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

MiniMax H3の動画の長さは15秒です。そのうちの1つに10カット数えました。

MiniMax H3の動画の長さは、24 FPSで4秒から15秒です。フレームごとに実際に何が得られるか、1つのクリップに何カット収まるか、そして45秒をつなぐ方法をご確認ください。

初日、誰もが同じことをする。ドロップダウンでdurationを開き、15を見て、割り算を始める。10分の映画?40世代。3分の説明動画?12。そして、その割り算の結果を見て、タブを閉じ、「このモデルはストーリーのあるものにはまだ使えない」と判断する。

私も割り算をした。その後、実際のH3クリップ9本に対してffmpegを実行し、その計算を馬鹿げたものにする何かを発見した。

そのうちの1本は長さ15.10秒。その中で、シーン検出器は10個の明確なカットを検出した。10個。異なる衣装、異なるフレーミング、異なる背景、全画面タイプのカード、すべてが1世代の生成の中にあり、そのコストは1世代分の料金だけだ。もし、割り算が示すように、ショットごとに1世代という計画でそのクリップを作っていたら、同じ15秒に対して10倍のコストを支払っていたことになる。

割り算が間違いなのだ。上限はストップウォッチではなく、コンテナであり、ほとんど誰もそれを満たしていない。

Sequence of a skateboarder jumping over a concrete ledge at night

スケートボーダーが夜間にコンクリートの段差を飛び越えるシーケンス。ストロボ効果のように捉えられ、1フレームの中に多数の異なるポジションが凍結されている。

1フレーム、多くの瞬間。durationドロップダウンがあなたから遠ざける考え方。

重要ポイント

  • durationパラメータは、4から15までの整数のみを受け付ける。デフォルトは8。7.5や15を超える値は存在しない。
  • すべてのクリップは24FPS、最大ネイティブ2K、ステレオオーディオが画像と同時に生成される。
  • 「15秒」のクリップは実際には362フレーム、つまり15.083秒である。長さは17フレームのグリッドに切り上げられ、duration: 8のみがちょうど1秒に収まる。
  • 1世代で複数のショットを保持できる。プロンプトに「SHOT 1 / CUT TO」と書けば、モデルが追加料金なしでカットしてくれる。
  • APIにはextendパラメータはない。15秒を超えるにはチェーンを使う:最後のフレームを次の最初のフレームに、参照画像で見た目を維持し、ハードコンカットで繋ぐ。

MiniMax H3の動画長、3クリップから構成される45秒を見る

理論の前に、実際のものを見てほしい。MIDNIGHT BOWLという45秒のヌードルストールのスポット。3世代、それぞれ15秒、それぞれの中に3つのショット。9つのショット、1つの連続したナラティブ、継ぎ目を隠すディゾルブはなし。

45秒の完全なカット。3つのMiniMax H3世代をトランジション効果なしで連結。シェフ、エプロン、電球、手描きの看板が2回の引き継ぎを生き延びている。

Nine video frames showing a chef preparing and serving ramen

MIDNIGHT BOWLスポットからの9フレームを3x3のコンタクトシートに配置。SHOT 1からSHOT 9までタイムコード付きでラベル付け。

9つのショット、3世代。各行が1世代、各列がモデルが自ら行ったカット。ショット3と4は、世代2が世代1の最終フレームから始まるため韻を踏んでおり、それが継ぎ目を見えなくする要因である。

3世代。9ではない。そのギャップこそがこの記事の全てのポイントである。

私は手動でカットを一切行っていない。各世代にタイムコード付きの3つのショットを要求し、ffmpegのシーン検出器が、最初の世代で4.9秒と9.1秒、2番目で4.9秒と9.0秒、3番目で5.3秒と11.0秒にカットがあることを発見した。9つのショット、3つの請求書。

なぜMiniMax H3の動画長が長尺計画を台無しにするのか

数字自体は問題ない。この世代のモデルとしては、範囲の上限15秒は十分であり、クリップは2Kで実際のステレオサウンドが付属している。人々を台無しにするのは、計画の単位である。

秒単位で予算を立てると、1分の作品は「4クリップ」、10分の作品は「40クリップ」となり、40クリップもの連続性を維持するのは悪夢である。ショット単位で予算を立てれば、1分の作品は約12ショットを保持する4世代となり、コマーシャルとしては通常のカバレッジ量である。同じモデル、同じ上限、全く異なる制作計画。

Fingers holding a sepia film strip showing a street, hands, and silhouette

セピア色の35mmフィルムストリップを指で持つレトロなフラットポスターイラスト。連続する3フレームのそれぞれに全く異なるシーンが収められている。

秒単位ではなくショット単位で予算を組む。1枚の請求書、その中に3つの異なるシーン。

長尺計画を壊すもう一つの要素があり、それは上限ではない。継ぎ目である。個々のクリップが途中で崩れることはほとんどない。崩れるのは結合部であり、各世代が独自のオーディオベッドを生成し、衣装や照明がわずかにずれるからだ。継ぎ目を計画すれば45秒は簡単だ。無視すれば、完璧な4つのクリップも、4つのクリップにしか見えない。

MiniMax H3の動画長の正体:17フレームグリッド上の4~15秒の整数

まず仕様から始めよう。2つの異なる数字が出回っているからだ。Atlas Cloud上の3つのH3エンドポイントすべてのAPIスキーマでは、duration4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15の列挙型であり、デフォルトは8である。整数のみ、小数はなく、15を超えるものもない。ローンチ時の報道もこれと一致している:2K出力、4~15秒、整数の長さのみ(MarkTechPost、2026年8月)。MiniMax自身のローンチ投稿では、最大15秒、2K、ネイティブステレオサウンドと説明されている(MiniMax、2026年8月)。

それでも、様々なプロフィールの概要やクイックスタートガイド、一部のプラットフォーム上のコピーで「5~15秒」と書かれているのを目にするだろう。スキーマの列挙型を真実とみなせ。下限は4であり、私は4秒のクリップを請求して証明している。

さて、ほとんど誰も言及しない部分。15秒を要求しても、360フレームは得られない。362フレーム得られるのだ。

H3は17フレームのブロックで動画を構築し、要求された長さを24FPSで次の17k + 5フレーム数に切り上げる。このグリッドはComfyUIの公式H3チュートリアルで文書化されており(ComfyUI Docs、2026年)、API側でも保持されている。私はffmpegを使って9つの実際のH3ファイルのフレーム数を数えた:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

すべての15秒ファイルは362フレームで返ってきた。すべての10秒ファイルは243フレームだった。この記事のために新たに生成した3世代も362フレームで、ステップ5の4秒リハーサルは107フレームだった。これらをグリッドに当てはめると、362は17x21+5、243は17x14+5、107は17x6+5である。この式は3つすべてを正確に予測しており、これは表の残りを信頼できるような一致である。

duration配信フレーム数 (17k+5)24FPSでの実時間ちょうど1秒になるか?出典
41074.458 sいいえ実測
51245.167 sいいえグリッド
61586.583 sいいえグリッド
71757.292 sいいえグリッド
81928.000 sはいグリッド
92269.417 sいいえグリッド
1024310.125 sいいえ実測
1127711.542 sいいえグリッド
1229412.250 sいいえグリッド
1332813.667 sいいえグリッド
1434514.375 sいいえグリッド
1536215.083 sいいえ実測

この表から3つのことがわかる。

duration: 8は範囲全体で唯一、きれいな整数秒を与える値であり、デフォルトになっている。これは偶然ではない。17x11+5 = 192 = 8 x 24 だからだ。

6を要求すると6.583秒が渡される。0.5秒以上の無料の映像がついてくる。13を要求すると13.667秒になる。グリッドは常に切り上げ、切り捨ては決してしないので、不足することはない。

そして、音楽に合わせてカットする場合やフレーム精度の編集を行う場合、タイムラインをduration x 24で計算してはいけない。ファイルを計測すること。40クリップのプロジェクトを整数秒の前提で計画すると、最後には約4秒のずれが生じる。

1つの15秒MiniMax H3世代内の10カット

冒頭で述べたクリップがこれだ。1世代、362フレーム、コンテナ内で15.10秒。ファッションのキネティックタイプ作品で、単一テイクというより編集されたミュージックビデオのように振る舞う。

Close-up of a woman's eyes behind bold white text ONE LOOK

1つのMiniMax H3世代。衣装替え、フレーミング変更、分割画面、全画面タイプカード、すべて1つの15秒ジョブの中に。

私は目視ではなく、ffmpegのシーン検出器を実行した:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 breaks flagged, at 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

そのうちの10個は、最初の13秒間にわたる明確なショットチェンジである。末尾は黒背景で点滅するタイトルカードで、生のカウントを増やしているため、控えめな正直な数字として10を採用する。いずれにせよ、1ショットでも3ショットでもない。

さて、対照実験。なぜなら、「H3は常にクリップを細かく切り刻む」というのは逆の誤りであり、同様に間違っているからだ。次のファイルも同じ15秒の1世代、同じ362フレームであり、同じ検出器はその中にまったくカットを検出しない。

First-person view of skyscrapers collapsing onto a city street

別の単一世代、同じ362フレーム、検出されたカットは0。15秒間、1つの連続したカメラ移動。

つまり、上限は「15秒の映像」ではない。それは15秒のスクリーンタイムであり、1つの途切れのないテイクから10カットまで、好きなように細分化できる。プロンプトから制御し、どちらにしても同じ料金を支払う。

MiniMax H3動画長の背後にある3つのエンドポイント、1つのタブで

15秒を超えるには3つの異なるジョブが必要だ:アンカーフレームを作るもの、アニメーション化してチェーンするもの、被写体を失わずにカメラを動かすもの。Atlas Cloudでは、これらすべてが1つのキーと1つの残高で同じカタログに存在する。これは、次のセクションのチェーンがファイルを繰り返し受け渡すため、ここで重要である。

ステップモデルこのビルドでの役割長さの範囲2026年8月4日時点の表示レート
アンカーフレームopenai/gpt-image-2/text-to-image全体のルックを定義する1枚の静止画n/aハイで$0.1745
オープニング、静止画不要minimax/h3/text-to-videoプロンプトから直接クリップへ4~15秒、デフォルト8$0.14 / 秒
世代1と2minimax/h3/image-to-video最初のフレームをアニメーション化、次に最終フレームからチェーン4~15秒、デフォルト8$0.14 / 秒
世代3minimax/h3/reference-to-video新しいカメラ位置、同じ被写体4~15秒、デフォルト8$0.14 / 秒

3つのH3エンドポイントすべてに現在割引はなく、レートはそのままである。詳細はフルモデルカタログで確認できる。

1つのリクエストを書く前に知っておくべき3つのパラメータの落とし穴。すべてドキュメントの散文ではなく、実際のスキーマから取ったものだ:

  1. ratioはエンドポイントごとに動作が異なる。 text-to-videoは6つの比率を提供し、デフォルトは1:1。設定し忘れると静かに正方形のクリップが渡される。また、adaptiveはまったく受け付けない。image-to-videoは**adaptiveのみ**を提供するため、フレーミングは最初のフレームに従う。reference-to-videoadaptiveを含むフルセットを持つ唯一のもの。
  2. resolution768Pまたは2K、デフォルトは2K 両方のティアはカタログで1秒あたりの単一レートの下にあるため、768Pに下げてもコストは節約できない。2Kを使用する。
  3. image-to-videoはオプションのend_imageも受け付ける。 クリップの両端を固定できる。以下のチェーンのトリックを双方向から制御できるようになる。

MiniMax H3動画長の制限を打ち破る方法、ステップバイステップ

これがMIDNIGHT BOWL構築の全容である。以下のプロンプトはすべて実際に送信したものであり、そのままコピーしてほしい。総実行時間は3つのH3世代と1つの静止画であり、ブラウザのタブで再現可能である。

ステップ1:1つのアンカーフレームでルックを固定する

動画から始めてはいけない。本当に気に入った1枚の静止画から始めよう。チェーン内のすべてのクリップがその光、衣装、看板を継承するからだ。これを間違えると高くつく。正しく行えば数セントで済む。

モデル: openai/gpt-image-2/text-to-image。設定: quality high、ratio 16:9

text
1映画の静止画、午前2時、狭い東京の路地裏にあるヌードルストール。50歳のシェフがネイビーのエプロンと白いバンダナを身につけ、傷ついた木製カウンターの後ろで湯気の立つストックポットの上にかがんでいる。袖は肘までまくり上げられ、前腕は一本の吊り下げ電球で熱いオレンジ色に照らされている。雨に濡れたアスファルトは赤と緑の看板を反射し、紙の提灯と「MIDNIGHT BOWL」と手描きされた木の看板がカウンターの上にぶら下がっている。フレームの右側からカメラに向かって湯気が流れる。35mmレンズ、f/2、浅い被写界深度、深い影、クールな青い夜に対して暖かいタングステンキーライト、目に見える微細なフィルムグレイン、テキストオーバーレイなし。

AI image generator interface showing text prompt and the resulting image

Atlas Cloud上のGPT Image 2プレイグラウンド。MIDNIGHT BOWLのアンカープロンプトが入力され、出力パネルに完成した画像が表示されている。

Atlas Cloud上のGPT Image 2:品質をhigh、16:9に設定。右側にアンカーフレームがレンダリングされている。

4

MIDNIGHT BOWLのアンカーフレーム:雨の路地裏、吊り下げ電球の下で湯気の立つストックポットの後ろにいるネイビーのエプロンのシェフ。

アンカーフレーム。下流のすべてがこの電球、このエプロン、この看板を継承する。

ステップ2:1つの15秒MiniMax H3世代の中に3つのショットを入れる

これが予算を変える一手である。連続した15秒を1つ要求する代わりに、明示的なタイムコードと「CUT TO」という言葉を含むショットリストをモデルに渡す。モデルがあなたのためにカットし、1世代の請求内で行う。

モデル: minimax/h3/image-to-video。設定: resolution 2Kduration 15ratio adaptive(ここでは唯一のオプション、フレーミングは最初のフレームに従う)、最初のフレーム = ステップ1の静止画。

text
1SHOT 1 (0-5秒): ストールの固定ワイド。湯気が立ち込め、シェフが黒い丼にスープを注ぎ、雨がひさしの端から滴る。SHOT 2 (5-10秒): CUT TO お玉がスープの表面を割るマクロクローズアップ、金色の脂が渦を巻き、刻んだネギがゆっくりと弧を描いて落ちる。SHOT 3 (10-15秒): CUT TO シェフがレンズをまっすぐ見つめ、エプロンで手を拭き、疲れた笑顔で日本語で「一杯、どうぞ」と言うミディアムショット。彼は丼をカウンターに置き、ショットは彼の顔で止まる。
2オーディオ: ひさしに降り注ぐ強い雨、スープの煮える音、お玉が鍋の縁に当たる音、遠くの電車、低い深夜の街のざわめき。クリアな男性の日本語の台詞1行、自然な部屋のトーン、音楽なし。
3すべてのショットで同じシェフ、エプロン、バンダナ、電球、看板を維持。ハードカットのみ、ディゾルブなし、カメラホイップトランジションなし。暖かいタングステンキー、クールな青い夜、35mmルック、フィルムグレイン。

これを機能させる3つの要素は、明示的な秒数の範囲、文字通りの文字列「CUT TO」、そしてカット間で維持しなければならないすべての要素を挙げた連続性の句である。連続性の句を省略すると、ショット3は異なるエプロンで返ってくる。

AI video generator interface showing input settings and completed video output

Atlas Cloud上のMiniMax H3 image-to-videoプレイグラウンド。アンカーフレームが最初のフレームとして読み込まれ、duration 15、2Kが選択され、出力パネルで完成したクリップが再生されている。

Atlas Cloud上のMiniMax H3 image-to-video:アンカーフレームが最初のフレームとして読み込まれ、解像度2K、右側に完成したクリップ。Durationスライダーとそれに連動する価格に注目。この実行ではdurationがデフォルトの8のままだったため、ボタンには$1.12と表示されている。15の場合は$2.10と表示される。

Chef preparing food at a steaming street stall on a rainy night

世代1。1つの請求ジョブ、3つのショット(カットは4.92秒と9.13秒で計測)、リップシンク付きの台詞1行、ネイティブ2560x1440、同じファイル内の32kHzステレオオーディオ。

ステップ3:次の15秒を最後のフレームからチェーンする

extendパラメータはない。チェーンは手動で、簡単だ:世代1の最終フレームを取り出し、世代2の最初のフレームとしてフィードバックする。

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

モデル: 再びminimax/h3/image-to-video。設定: 最初のフレーム = handoff-frame-01.jpgresolution 2Kduration 15ratio adaptive

ここで重要な規律は、何を省略するかである。シェフを再説明してはいけない。彼は渡したピクセルの中にすでに存在しており、再説明するとモデルに再解釈の許可を与えてしまう。

text
1この正確なフレームから続ける。同じ男性、同じエプロン、同じ照明。SHOT 1 (0-5秒): 彼は両手で丼をカウンターの向こう側へ滑らせる。SHOT 2 (5-10秒): CUT TO カスタマーの手が木製の箸を持ち上げ、それを割るオーバー・ザ・ショルダーショット。濡れた灰色のレインコートの袖口が見える。SHOT 3 (10-15秒): CUT TO 極限のマクロ麺引き、湯気がレンズの横を渦巻き、スープが丼に滴り落ちる。
2オーディオ: 前から続く連続した雨と煮える音、陶器が木に当たる音、箸の割れる音、すする音、同じ遠くの電車。音楽なし、ナレーションなし。
3ハードカットのみ。吊り電球からの同じタングステンキー、後ろの同じクールな青い夜、同じ35mm浅い被写界深度とフィルムグレイン。

Smiling chef in a bandana serving a steaming bowl of food

世代2、世代1の最後のフレームから開始。同じシェフ、同じバンダナの柄、同じネイビーのトップス、後ろの同じキッチン。再び3つのショット、カットは4.92秒と9.04秒。

Smiling chef wearing a bandana serves a steaming black bowl

世代1と世代2の継ぎ目をまたぐ2秒ループ。

継ぎ目自体:世代1の最後の1秒から世代2の最初の1秒へ。トランジション効果なし、単なるカット。

ステップ4:参照動画でカメラを動かす

最後のフレームチェーンには1つの固有の制限がある:常に前のカメラが立っていた位置から再開する。同じ被写体を維持しながら真に新しいアングルにジャンプするには、エンドポイントを切り替える。

モデル: minimax/h3/reference-to-video。設定: refers = ステップ1のアンカーフレームと世代2の最後のフレーム、resolution 2Kduration 15、そしてratioはここでは16:9に明示的に設定し、adaptiveのままにしない。このエンドポイントは最大9枚の参照画像、3本の参照動画、3つのオーディオクリップを受け付け、参照動画は合計15秒が上限である(MarkTechPost、2026年8月)。

text
1濡れた道路の真ん中から同じヌードルストール、その中にいる同じシェフを見返すワイドローアングルショット。SHOT 1 (0-6秒): 雨がフレームを横切って筋を描く。カウンターに2人のシルエットの客が座る。シェフは1つの電球の下で働く。SHOT 2 (6-11秒): CUT TO 手描きの木の看板に、白いキネティックタイプが一文字ずつアニメーションしながら隣に現れる:「MIDNIGHT BOWL - OPEN TILL 4AM」。タイプはカメラが動く間も鋭くシャープで看板に固定されたまま。SHOT 3 (11-15秒): CUT BACK TO ワイド。シェフが顔を上げ、片手を小さく振り、電球が一度ちらつく。
2オーディオ: 雨、街の雰囲気、通り過ぎるスクーター、同じかすかな電車、タイプが着地するときの低いサブヒット1回。台詞なし。
3参照画像と同じシェフ、同じエプロンとバンダナ、同じ看板と提灯の色。ハードカットのみ、フィルムグレイン、35mm、クールな青に対する暖かいタングステン。

このratio指定は過剰な心配ではない。このエンドポイントでドロップダウンをそのままにしておくと何が起こるかを以下に示す:

AI video generator interface displaying an input validation error message

Atlas Cloud上のMiniMax H3 reference-to-videoプレイグラウンド。2枚の参照画像が読み込まれ、アスペクト比がadaptiveのまま、出力パネルに400バリデーションエラーが表示されている。

Atlas Cloud上のMiniMax H3 reference-to-video:両方の参照画像が読み込まれ、解像度2K、アスペクト比がデフォルトのadaptiveのまま。実行は400エラーで返ってくる:「ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9」。明示的に設定すると同じリクエストが通り、下のクリップが作成された。上のページの概要にも「768P/1080P/2K, 5s/10s」と書かれているが、スキーマは768Pまたは2K、4~15秒と示している。スキーマを信頼せよ。

プレイグラウンドの比率ドロップダウンをスクリプトで変更しようとしたが、3回試行しても保持できなかった。そのため、以下の成功した世代3は、リクエストボディにratio: "16:9"を設定してAPIから取得した。失敗した実行は無料だった。

Chef preparing food for customers at a rainy night food stall

世代3。濡れた道路の向こう側からの真新しいカメラ位置、同じシェフ、看板上のアニメーションする白いタイプはカメラが動く間も鋭くシャープ。カットは5.29秒と10.96秒。

Side-by-side comparison of a Japanese food stall at night

元のアンカーフレームと世代3のフレームのサイドバイサイド比較。41秒後、2回の引き継ぎ後も同じシェフと看板を示している。

左:ステップ1のアンカー。右:41秒時点の世代3、2回の引き継ぎ後。同じシェフ、同じバンダナ、同じネイビーのトップス、同じ手描きの看板、同じ赤い提灯。

ステップ5:実際のMiniMax H3動画長を計測し、その後ステッチする

最後に2つの習慣を。まず、15秒を購入する前に安価なリハーサルを行う。同じプロンプト、duration 4。モデルがショットリストを理解したかどうかを、約4分の1の価格で確認できる。

Chef cooking at a steaming outdoor stall in a rainy alley

同じショットリストの4秒リハーサル。107フレーム、つまり4.458秒と計測。グリッドの予測と正確に一致。フルテイクを購入する前にモデルがシーンを理解したかどうかを確認するのに十分。

次に、カットする前にすべてのファイルを計測する。なぜなら、要求した長さのものはどれもないからだ:

bash
1# 実際のフレーム数とコンテナの長さ。duration x 24ではない
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# ハードカットのconcat、トランジションなし、再エンコードなし
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

それぞれ362フレームの3ファイルで1086フレームとなり、完成したconcatで計測したところ、45.25秒の映像となった(45秒ではない)。小さいが、40本をステッチするときには無視できない。

バリエーション:会話、縦型、4秒リハーサル

チェーンが機能すれば、同じ3つのエンドポイントで人々が実際に求めるほとんどのものをカバーできる。

ショット&リバースショットの会話。 会話の両側を2つの世代に分けるのではなく、1世代内に収める。リップシンクとオーディオベッドは単一ジョブ内では連続し、ジョブ間では独立している。したがって、2世代にまたがる会話は、無関係な2つの部屋のトーンになる。やり取りは1つのクリップ内に収めること。

Crying young woman looks up at a man in a stairwell

コンクリートの階段踊り場で口論する2人の若い俳優。硬い窓からの光が彼らを斜めに照らし、肩越しに撮影。

ショット&リバースショットは機能する。両方のアングルが同じ世代内にある限り。

縦型。 image-to-videoでは、比率を設定せず、最初のフレームを設定する。背の高いアンカーを生成し、adaptiveがそれに従う。私が計測したクリップの1つは、16:9の兄弟と同じ243フレーム数で1280x2276で返ってきた。つまり、フレームグリッドはアスペクト比を気にしない。

4秒リハーサルを標準的な慣行に。 1秒あたり$0.14の場合、4秒は$0.56であり、フルテイクの$2.10に対して。9ショットのビルドでは、コミットする前にすべての世代をリハーサルしても、無駄になる15秒ジョブ1回分よりもコストがかからない。

上限が本当に効くところ。 15秒を超える途切れのないパフォーマンスが必要なもの。連続した30秒のモノローグはチェーンの問題ではなく、継ぎ目をまたぐリップシンクの問題であり、プロンプトの規律では解決できない。

45秒のMiniMax H3動画長のコスト

1秒あたり$0.14の場合、15秒のフル世代は$2.10。これだけ覚えておけばよく、あとは掛け算だけだ。興味深いのは最後の列である。

目標の長さ15秒での世代数直線的なコスト現実的な1/3のキープ率提供されるショット数ショットあたりのコスト
15秒1$2.10$6.303$0.70
45秒(このビルド)3$6.30$18.909$0.70
60秒4$8.40$25.2012$0.70
3分12$25.20$75.6036$0.70
10分40$84.00$252.00120$0.70

ショットあたりのコストの列を見れば、上限へのパニックはほとんど消える。1世代あたり1ショットで計画すると、1ショットあたり$2.10になる。各世代に3ショット詰め込むと、$0.70になる。同じモデル、同じ15秒の上限、請求額は3分の1。

キープ率の列は、人々が忘れがちなものだ。毎回最初の試行で使えるものが返ってくるわけではない。それを前提にした計画は、2分目で予算が尽きる。

上限がカタログ内の他のすべてと比較してどこにあるかについての文脈として、以下はすべて2026年8月4日現在のものである:

モデル最大単一世代注目点表示レート
minimax/h34~15秒768Pまたは2K、ネイティブステレオオーディオ$0.14 / 秒
bytedance/seedance-2.04~15秒、または-1で自動480p~ネイティブ4K$0.112 / 秒
kwaivgi/kling-v3.0-pro3~15秒ショットごとのプロンプトを持つ明示的なmulti_shotフラグあり$0.095 / 秒、15%オフ
alibaba/wan-2.72~15秒最も広い下限、720Pまたは1080P$0.10 / 秒
google/veo3.14、6、または8秒のみ15秒オプションなし$0.20 / 秒
alibaba/wan-2.5/video-extend5~10秒追加新規生成ではなく既存ファイルを拡張$0.052 / 秒

2つの結論。H3の15秒は現在の世代のトップであり、それに遅れているわけではない。Veo 3.1は8秒で打ち止めである。そして、本当に1つの長いファイルを1つのエンドポイントから必要とするなら、専用の拡張モデルが存在するが、チェーンの中でモデルを切り替えることは顔を切り替えることを意味する。

オーディオ、重み、そしてMiniMax H3動画長に関する正直な注意点

3つの注意点。いずれも上限を動かすものではない。

オーディオは世代をまたがない。 各ジョブはゼロから独自のステレオベッドを構成する。3つのチェーンされたクリップは、3つの無関係な雨のベッドを意味し、画像が完全に一致していても変化が聞こえる。2つの修正方法:すべてのプロンプトにアンビエンス句を同一に記述してベッドを近づけるか、ステッチしたカットをミュートしてその下に1つの連続トラックを配置する。台詞の場合は、やり取りを単一世代内に収めること。

Six small black soundwaves next to one long orange soundwave

左側に目に見える隙間がある複数の短いオーディオ波形の断片、右側に1つの連続した波形、薄い統一された背景の上。

左:チェーンが実際に与えるもの。右:その下に構築しなければならないもの。

セルフホスティングでは長いクリップは解除されない。 オープンウェイトは2026年8月2日に公開された(Hugging Face、2026年8月)。ローカルで実行すると、ComfyUIのセットアップノートによると、32の倍数に丸められた768ピクセルの短辺が得られる。17フレームグリッドと15秒の上限は同じである。コミュニティライセンスは現在、EU、英国、韓国、米国をカバーしていないため、ほとんどのチームにとってAPIが実用的なルートである。

モデルは静かにあなたを書き換えることができる。 H3が、私が要求した要素を静かにドロップしたジョブでcompletedを返したことがある。すべてのクリップからフレームを取得し、ステッチする前にそれらを見ること。9ショットのチェーンでは、1つの監視されていないクリップは1つの無駄な継ぎ目である。

よくある質問

MiniMax H3の最大動画長は?

15秒。durationパラメータは4から15までの整数の列挙型で、デフォルトは8。したがって、16は拒否され、7.5は有効な値ではない。すべてのクリップは24FPS、最大ネイティブ2K、ステレオオーディオが画像と同時に生成される。

MiniMax H3は15秒より長い動画を生成できますか?

単一世代ではできません。APIにextendパラメータはありません。15秒を超えるにはチェーンを使います:あるクリップの最後のフレームを次のクリップの最初のフレームとして取り込み、新しいカメラアングルが必要な場合はreference-to-videoを使用し、ハードカットで連結します。一部のコンシューマー向けフロントエンドは、H3上に独自の拡張機能をレイヤーして約30秒に達することがありますが、それはモデルがより長く生成しているのではなく、製品がステッチを行っているのです。

15秒のMiniMax H3クリップが実際には15.08秒なのはなぜ?

長さが17フレームのグリッドに切り上げられるためです。15秒を要求すると362フレーム(17x21+5)が返され、24FPSでは15.083秒になります。10を要求すると243フレーム(10.125秒)になります。duration: 8だけがちょうど1秒(正確に192フレーム)になります。フレーム精度の編集を行う場合は、duration x 24で計算するのではなく、各ファイルを計測してください。

1つのMiniMax H3世代に複数のショットを入れることはできますか?

はい、そしてそれは最大の節約になります。明示的なタイムコード付きのショットをプロンプトに書き、文字通り「CUT TO」という言葉を入れ、カット間で維持するものを指定する連続性の句を追加します。私は実際の15秒世代内で10個のきれいなカットを計測しました。1世代あたり3ショットは快適で信頼性が高く、$2.10のクリップが3つの$0.70のショットになります。

MiniMax H3の動画長を短くするとコストは安くなりますか?

はい、線形に。課金は1秒あたり$0.14なので、4秒のリハーサルは$0.56で、フル15秒テイクの$2.10に対して。解像度は別の話です:768P2Kはカタログで1つの表示レートの下にあるため、解像度を下げても節約にはなりません。ピクセルではなく、クリップを短くしてください。

1分の動画にはいくつのMiniMax H3クリップが必要ですか?

毎回15秒すべてを使うなら4つ。しかし、ショットで数えてください:1世代あたり3ショットの4世代で、12ショットのカバレッジが得られます。これは1分のコマーシャルとしては標準的な量です。そして、廃棄するテイクを考慮して、予算を約3倍にしてください。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索