2週間限定 | Seedream 5.0 Pro が20%OFF!

Seedance 2.5 vs MiniMax H3: 誰もが30秒のフレックスを試した。ショット4を試した者は誰もいない。

Seedance 2.5 vs MiniMax H3、同じキャラクターシート、同じプロンプト。実際のスペック、コピペ可能な5ステップのショートドラマワークフロー、そして、4ショットにわたって顔を維持できるのはどちらか。

MiniMaxは金曜日にH3をリリースした。24時間も経たないうちにSeedance 2.5が人々の手に渡り、タイムラインは一つの会話に収束した。30秒、ネイティブ4K、50の参照入力。H3のリリース告知はその下に静かに置かれ、実際にテストを実行した人はほとんどいなかった。

その理由は分かる。30秒は素晴らしい数字だ。見出しに収まる。

しかし、実際に縦型ショートドラマを制作しているなら、夜を台無しにするのは30秒目ではないことを知っている。それはショット4だ。男性主人公の顎のラインが0.5センチずれ、クラヴァットの折り目が消え、視聴者はフックがかかる前にスワイプしていく。クリップが15秒ではなく30秒だったからといって、離脱する人はいない。離脱するのは、クローズアップの男が引きの画の男と違うからだ。

そこで私はスペックシートの対決をスキップした。キャラクター見返しシートを1枚、6パネルのロケーションボードを1枚作成し、15秒のゴシックショートドラマ用プロンプトを1つ書き、同一のパッケージを両方に送った。そして顔を見つめた。

主なポイント

  • どちらも本物だが、到達可能性は同じではない。 H3の3つのエンドポイント(テキスト、画像、参照から動画へ)は現在ライブで呼び出し可能。Seedance 2.5のAPIはByteDanceから出ているが、私がすべてを実行したマルチモデルプラットフォームではまだDay-0のページであり、私の対決のSeedance側はSeedance 2.0 参照から動画へである。影響がある箇所にはすべてフラグを立てている。
  • スペックは明確に分かれる。 Seedance 2.5 = 1回の生成で最大30秒、ネイティブ4K、最大50のマルチモーダル参照、リージョンレベル編集。H3 = 5〜15秒、ネイティブ2K(24fps)、画像9枚+動画3本+音声3クリップ(最大12ファイル)、すべての出力にステレオ音声、クリップ全体への指示編集。
  • キャラクター安定性はパッケージングの問題であり、モデル生成の問題ではない。 1枚の合成見返しシート+1枚のライティングボードを使えば、両モデルとも同じ顔と同じ衣装を保持した。生成回数がショットを救ったり壊したりしたわけではなく、パッケージがそうした。
  • 誰もテストしなかったモデルがすでに3位にランクされている。 Artificial Analysisの画像から動画へのアリーナで、H3は1,185 EloでSeedance 2.0の1,196の後ろにいる。Seedance 2.5はまだボードにすら載っていない。
  • 両方とも独自の音声を生成する。 H3はさらに最大3つの音声参照を受け付けて、キャラクターに声を固定できる。これにより、ショートドラマパイプラインからTTSと同期のステージ全体が削除される。
  • 秒数ではなく、ピクセル/フレームについて問うこと。 同じ参照パック、同じ実行時間:H3の参照から動画への出力は1440p、Seedance 2.0の参照から動画への出力は720p。これによりコスト問題全体が再構成される。

Seedance 2.5の独自のペア数字はまだ入っていない。私がテストするエンドポイントが開いた日に追加する。

Seedance 2.5 vs MiniMax H3 結果、理論の前に

理論の前に、ワークフローが何を生み出すかを示す。これらは完成した15秒の縦型クリップから抜き出した4つのショットをタイル状に並べたもの。MiniMax自身のH3参照実行で、ステップ1とステップ2で見るまさにそのキャラクターシートとロケーションボードから構築され、ネイティブ1440x2560。同じパックを使った私自身の実行結果は、チュートリアルで後ほど、プレイグラウンドの状態を表示しながら示す。

彼女は彫刻されたドア(ロケーションボードのパネル4)にたどり着き、次に廊下での対峙、そして彼のタイトなクローズアップ、最後にツーショット。彼のヘアラインは横顔とクローズアップで同じ分かれ方をしている。彼女のハーフアップの編み込みクラウンは、フルフェイスクローズアップでも生き残っている——これはまさに、ほとんどのモデルが静かに顔を再構築するポイントだ。クリーム色のレースボディスは、最初のフレームから最後まで同じネックラインと袖口を保っている。

これがテストのすべてだ。30秒ではない。4つのショットと顎のラインだ。

なぜSeedance 2.5 vs MiniMax H3が同じ週にリリースされ、なぜほとんどのキャラクターテストが役に立たないのか

MiniMaxは7月30日にH3をリリースした。テキスト、画像、動画、音声を1つのコンテキストとして読み取り、最大2Kの5〜15秒のクリップをネイティブステレオ音声付きで返す汎用マルチモーダル動画モデルだ。既存の映像を編集し、あるクリップから別のクリップへモーションを転送することもでき、MiniMaxは数日以内にウェイトが公開されると述べた(Reuters、2026年7月)。

Seedance 2.5は同じ時期に、より大きな数字を掲げて登場した。1回の生成で30秒、ネイティブ4K、1ジョブで最大50のマルチモーダル参照入力(The Next Web、2026年7月)。そのAPIはすでに開発者の手に渡っており、パフォーマンス、照明、カメラ動作をそのままにしてフレームの一部を再描画するローカライズド編集、グリーンスクリーンプレートや3Dホワイトモデルのブロックアウトを受け付ける参照から動画、11言語、実験的なロングビデオモード(180秒まで)を備えている(CineD、2026年7月)。

注目の差が興味深い部分だ。私が見つけられたほぼすべての投稿は2.5のクリップだった。一方、公開アリーナの数字は別のことを示している。Artificial Analysisの画像から動画リーダーボードでは、720pのSeedance 2.0が1,196 Eloでトップ、Gemini Omni Flashが1,195で続き、MiniMax H3はリリースから4日で1,185で3位だ。Seedance 2.5にはまだそこに評価がない(Artificial Analysis、2026年7月)。最も話題が少ないモデルが、スコアと注目の比率が最も高いのだ。

さて、実際に出力を決める部分——ロゴの選択とはほとんど関係ない。

ほとんどのキャラクター一貫性テストは、モデルが関与する前に失敗する。4つの失敗モードがあり、そのすべてを修正するのはあなたの責任だ。

失敗モード出力に見られるもの修正方法
マルチビューの参照を別々のファイルとして送信各ショットの顔が「ほぼ正しい」が、どれも一致しないビューを1つの画像に合成し、プロンプトで役割を割り当てる(「左の男性」「右の女性」)
ショットごとにキャラクター説明を書き直す衣装やアクセサリーがショットごとにずれるアイデンティティブロックを一度書き、それをそのまま使い回す。ショットごとに変更するのはカメラとアクションのみ
照明をシーンに合わせて動かす顔が新しい光の中で構造的に再構築される光の方向、フォグ、床の反射を固定する別のロケーションボードを作成し、参照として与える
最大持続時間を品質指標として扱う30秒以内の1つのドリフトがすべての30秒を台無しにする再ロールできる粒度でカットし、その後長さについて語る

1行目が最もよく間違われる。6枚のシングルビュー画像を送ると、モデルはそれらを6人の候補人物として扱い平均化する。1枚のきれいな合成画像を送ると、それを3方向から見た1人として扱う。同じピクセル、まったく異なる結果。

Seedance 2.5 vs MiniMax H3 スペックシート、そして今日実際に呼び出せるもの

能力と可用性を分けると、緊張関係が明確になる。生の能力では、Seedance 2.5が持続時間、解像度の上限、参照数、編集の粒度でリードする。可用性では、H3が今週、汎用モデルプラットフォーム上に3つのライブエンドポイントを持つ。2026年の計画のためにAI動画モデル比較を行うなら、2列目は1列目と同じくらい重要だ。

 MiniMax H3Seedance 2.5Seedance 2.0 Ref-to-Video(私が実行したもの)
1回の生成の最大長5〜15秒最大30秒、ステッチなし(ベータモードで180秒まで、実験的)ショートクリップメニュー、モデルページ参照
解像度ネイティブ2K、16:9〜9:16で短辺1440p、768pティアが近日登場予定ネイティブ4K、10ビット色このエンドポイントでは最大720p
フレームレート24 fps個別公開なし個別公開なし
参照入力画像9枚+動画3本+音声3、合計12ファイル最大50のマルチモーダル参照画像9枚+動画3本+音声3
ネイティブ音声はい、すべての出力、ステレオはい、11の字幕と言語対応はい
編集の粒度クリップ全体への指示編集(キャラクター、背景、照明、ダイアログの交換)フレームの一部を再描画するリージョンレベル編集クリップ全体への指示編集
プロンプト上限7,000文字非公開非公開
オープンウェイトリリース後数日以内に公開予定公開予定なし公開予定なし
Artificial Analysis I2V Elo、2026年7月31日1,185(3位)未評価1,196(1位、Dreamina 720pエントリ)
テストしたプラットフォームで呼び出し可能はい、3エンドポイントいいえ、Day-0ページはい

テスト設定の完全な開示。 これを実行した時点でSeedance 2.5は私のプラットフォームでオープンされていなかったため、Seedance側はSeedance 2.0 Reference-to-Video(同じファミリーの現在出荷中のメンバーで、同一のクワッドモーダル参照システムを持つ)である。2.5が答えを変える箇所では、そのように述べる。Seedance 2.5ページは現時点ではDay-0のお知らせである。

以下はすべて1つのブラウザタブ、1つのキー、3つのモデル合計で実行される。

ステップモデル生成物主要設定コストを決めるもの
1OpenAI GPT Image 2 Text-to-Imageキャラクター見返しシートquality high, 16:9画像ごと、従量課金、現在の料金はモデルページ参照
2同じモデル、2回目の実行6パネルのロケーション&ライティングボードquality high, 16:9画像ごと、従量課金
3MiniMax H3 Reference-to-Videoネイティブ音声付き9:16クリップ9:16, 2K, テスト用5秒、本番カット用15秒秒数×解像度、秒単位で課金
4Seedance 2.0 Reference-to-Videoコントロール実行、同一入力9:16, 利用可能な最高解像度、同じ持続時間秒数×解像度、秒単位で課金
5H3 Reference-to-Video、クリップを入力としてすべてを再ロールせずに1つのショットを修正同じ解像度、短い持続時間秒数×解像度、秒単位で課金

H3には、純粋なテキストベースラインや最初と最後のフレーム制御が必要な場合のtext-to-videoおよびimage-to-videoエントリもある。

バッチを計画する前に知っておくべきもう1つのこと:画面上のテキスト。この15秒のH3タイトルシーケンスは、8回のハードカットを通して英語のクレジットを1つの誤字もなく保持している。これは生成動画で最も安定させるのが難しいことの1つだ。

Seedance 2.5 vs MiniMax H3 ショートドラマワークフロー、ステップバイステップ

5つのステップ。プロンプトは書かれたまま正確にコピーすること。見苦しい部分も含めて。記事のためにきれいにしなかったし、モデルのためにきれいにするべきでもない。

ステップ1:GPT Image 2でキャラクターシートを作成する

動画を作成する前に、参照パックを作成する。1枚の画像、2人のキャラクター、それぞれ3つのビュー、純白のシームレスな背景、均一なスタジオ照明。これにより、気になる唯一の曖昧さ(この人はどのような見た目か)以外のすべてが排除される。

plaintext
1純白のシームレスな背景上のフルボディキャラクター見返し参照シート。2人のキャラクターを並べ、合計6体。均一なニュートラルスタジオ照明、床に影なし、テキストなし、ラベルなし、ウォーターマークなし。
2
3左半分:男性主人公、3つのビューを横に並べる:正面、右横顔、背面。20代後半、色白、暗いウェーブのかかったミディアム丈の髪、シャープな顎のライン。床までの長さの黒いベルベットのフロックコート(ラペルと袖口に微妙なトーンオントーンの刺繍)、黒いブロケードのウエストコート、黒いシルクのクラヴァット、ストレートの黒いパンツ、磨き上げられた黒いレザーのダービーシューズ。腕は体側でリラックス、無表情。
4
5右半分:女性主人公、3つのビューを横に並べる:正面、右横顔、背面。20代前半、色白、長いウェーブのかかった栗色の髪、ハーフアップの編み込みクラウン。クリーム色のビクトリアンコットンレースドレス、長袖にレースの袖口、フィットしたボディスに小さなボタン、くるぶしまでのフルスカート、クリーム色のアンクルストラップのローヒールシューズ。腕は体側でリラックス、無表情。
6
7フォトリアリスティック、6体すべてで一貫したスケール、同じベースラインに揃った足、端から端までシャープなフォーカス。

設定: モデル OpenAI GPT Image 2 Text-to-Image、Quality high、アスペクト比 16:9、その他はデフォルト。 合計: 11語。完璧。AI画像生成インターフェース、プロンプト入力と生成されたキャラクターを表示 Atlas Cloud上のGPT Image 2 Text-to-Image、実行完了:左側に見返しプロンプト、OUTPUTパネルに1枚の白いシート上の6体の人物。

これが目標の形状。6体、1つのベースライン、背景に議論の余地はない。 さあ デモクリップを駆動した参照パック:黒いベルベットの男性主人公、クリーム色のビクトリアンレースの女性主人公、それぞれ3ビュー、1ファイル。 ビクトリア調の黒とクリームの衣装の正面、側面、背面図 ステップ1のプロンプトの私自身のGPT Image 2実行結果。上記の参照と比較用。

ステップ2:6パネルシーンボードでロケーションを固定する

顔は固定した。しかし、照明は依然としてあなたを裏切る。2枚目の参照画像は、6つのカメラ位置、月明かりの方向、空気中のフォグの量、床の濡れ具合を固定する。この映画には1つの照明設定しかないことをモデルに伝えている。

plaintext
16パネルのシネマティックロケーションボード、2行×3列、パネル間に細い黒い溝、各パネルの下部に小さなエレガントな白いオールキャップスの文字間隔を空けたタイプでキャプション。主題:夜の放棄されたゴシック城の内部。冷たい青い月明かり、漂う低いフォグ、濡れた反射する石の床、高いステンドグラスの窓、小さな暖かい炎のある鉄の燭台、深い彩度を落とした黒、厚いベルベットのカーテン。どのパネルにも人はいない。
2
3パネル1、キャプション「ワイドエスタブリッシングビュー - 廊下」:照明のあるステンドグラスの窓へと続く長い柱のある廊下。
4パネル2、キャプション「ローアングル - 床を横切る月明かり」:低いカメラ、濡れた敷石を斜めに横切る月明かりの光。
5パネル3、キャプション「玄関と階段の構図」:アーチ型の玄関、曲線の石階段を額縁のように捉える。
6パネル4、キャプション「クローズ詳細 - 彫刻されたドア」:鉄の取っ手付きの重い彫刻された木製ドアのタイトショット。
7パネル5、キャプション「窓際ビュー - フォグとカーテン」:高い窓、フォグが入り込み、前景にカーテンの端。
8パネル6、キャプション「最終ポスターフレーム - 空のホール」:対称的な空のホール、模様入りのランナーラグが窓へと続く。
9
10フォトグラフィック、シネマティック、フィルムグレイン、6パネルすべてで一貫したカラーグレード。

設定: 同じモデル、Quality high、アスペクト比 16:9。 月明かりのある暗いゴシック城内部の6つのストーリーボードパネル デモクリップを駆動したロケーションボード:6つのゴシック城内部、1つのカラーグレード、キャプション読み取り可能。 暗いゴシック城内部の6つのシネマティックカメラアングル ステップ2のボードプロンプトの私自身のGPT Image 2実行結果。

ステップ3:MiniMax H3参照から動画でショットを生成する

2つの参照画像と、カメラ位置と音声指示を含む1つのプロンプト。サウンドは同じパスで生成されるため、別の音声やスコアのステップはない。調整中は持続時間を短く保ち、本番カットでは15秒に伸ばす。

plaintext
1参照画像1はキャラクターシート:左の男性が男性主人公、右の女性が女性主人公。両方のアイデンティティをそのまま完全に維持すること:彼の顎のライン、暗いウェーブのかかった髪、黒いベルベットのフロックコート、黒いブロケードのウエストコート、黒いシルクのクラヴァット;彼女の栗色のハーフアップの編み込み髪とクリーム色のビクトリアンレースドレス。参照画像2はロケーション&ライティングボード:その冷たい青い月明かり、漂うフォグ、濡れた反射する石の床、彩度を落とした黒いトーンに合わせること。
2
39:16縦型、プレミアムライブアクションショートドラマルック、浅い被写界深度、シネマティックコントラスト、字幕なし、画面上のテキストなし、ウォーターマークなし。
4
5ショット1:ミディアムクローズアップ、カメラがゆっくりと押し込む。女性主人公が月明かりの廊下に立ち、浅く呼吸し、フレーム右外の何かを見つめている。フォグが膝の高さで彼女の横を通り過ぎる。
6ショット2:ハードカット。彼女の背後からのオーバー・ザ・ショルダー、男性主人公が暗いアーチ道から月明かりの中に足を踏み出す、コートが光を浴び、表情は冷たく好奇心に満ちている。
7ショット3:彼の顔のタイトクローズアップ、窓からの半光、そして彼女の顔のマッチングクローズアップ、彼女が視線をそらさない。
8
9音声:低く持続するベースドローン、遠くの石のこだま、彼女の不安定な息遣い、彼が光の中に足を踏み入れるときの1つの重い足音、最後のカットで1つの柔らかいストリングスの盛り上がり。

設定: モデル MiniMax H3 Reference-to-Video、解像度 2K、持続時間 8(スライダーデフォルト;本番カットでは15にプッシュ)、アスペクト比 アダプティブ、参考資料に両ファイル。パネルはそれらを9のうち2としてカウントするため、後で衣装や小道具のプレートを追加する余地は十分にある。

比率で起こったことに注目する価値がある。アスペクト比をアダプティブのままにし、プロンプト内に「9:16縦型」と書いただけだった。H3はそれでも縦型で返したため、フォームフィールドではなくテキストからフレーミングを読み取った。 AI動画生成インターフェース、テキストプロンプトと完了した動画プレビューを表示 Atlas Cloud上のMiniMax H3 Reference-to-Video、実行完了:両方の参照ファイルが9のうち2としてロードされ、解像度2K、生成された縦型クリップがOUTPUTパネルで再生中。

最初のフレームは、クリーム色のレースボディスを着た女性主人公が、ボードパネル1の廊下に立ち、膝の高さにフォグがあり、月明かりがボードが置いたまさにその場所で濡れた床を照らしている。両方の参照画像が着地した。

ステップ4:同一パックでSeedance 2.5 vs MiniMax H3のコントロールを実行する

一言も変えない。同じ2つの参照画像、同じプロンプト、異なるモデル。各ページの持続時間デフォルトはそのままにして強制的に合わせず、それぞれが何を返したかを以下に述べる。プロンプトを「他のモデル用に」言い換えることは、まさに比較が嘘をつき始める方法である。

plaintext
1ステップ3と同じプロンプト、逐語的に。他のモデル用に言い換えないこと。

設定: モデル Seedance 2.0 Reference-to-Video、解像度 720p、同じ2つの参照画像を参照画像に(再び9のうち2、別個のスロットに最大3つの参照動画と3つの参照音声ファイル)。持続時間はページデフォルトのままにし、10秒のクリップとして返ってきた。 テキストプロンプトと完了した動画を表示するAI動画生成インターフェース Atlas Cloud上のSeedance 2.0 Reference-to-Video、ステップ3と同じ参照パックとプロンプトで実行完了、OUTPUTパネルに10秒の結果。

2つのOUTPUTパネルが実際に示したものは以下の通りであり、勝者を選ぶのではなく、そのまま報告する。

両方の実行でキャラクターは保持された。同じクリーム色のレースドレス、同じネックラインと袖口、同じ栗色の髪、ボードから引き出された同じフォグと月明かりの廊下。どちらも異なる女性を発明しなかった。参照パックが両側でその仕事をした。これが私が最も気にする発見である。

違いは顔ではなく、形式に関するものだった。このSeedanceエンドポイントは720pを提供した。H3は同一入力から2Kを提供した。そしてフレーミングが分かれた:H3はプロンプトテキストから直接「9:16縦型」を読み取り縦型を返したが、Seedanceの実行は16:9で返ってきた。なぜならそのページは独自のアスペクト比制御を持ち、プロンプトテキストだけではそれをオーバーライドできなかったからだ。TikTok用にカットしている場合、この違いはフォームフィールドを忘れたときに1回の実行を無駄にすることになる。Seedance 2.5はおそらくこの解像度の半分を変更し、リージョンレベルの再ロールを追加するだろう。そして私はそれを測定したふりはしない。

ステップ5:クリップ全体を再ロールせずに1つのショットを修正する

ショートドラマの実際のコストは最初の生成ではない。それは7回目の修正である。H3は既存のクリップを入力として受け入れ、指示に従って編集し、触れなかった部分を保持する。Seedance 2.5のここでの売りはより細かい:フレームのリージョンを再描画し、パフォーマンス、照明、カメラはそのままにする。

plaintext
1提供されたクリップを使用:2人のキャラクター、衣装、カメラの動き、カットのリズムをそのまま維持すること。環境のみを変更し、月明かりの石の廊下を同じ城の舞踏室に置き換える。高いアーチ型の窓、照明のあるシャンデリア、暖かいキャンドルライト。両方のキャラクターの照明を再設定し、キーライトが窓の代わりにフレーム左のシャンデリアから来るようにする。彼女の唯一の台詞を「あなたは決して眠っていなかったのね」に書き換える。彼女のパフォーマンスのタイミングは同じビートに保つ。

設定: MiniMax H3 Reference-to-Video、ステップ3のクリップを参照入力として、持続時間 5、解像度 2K。

Seedance 2.5 vs MiniMax H3テストを超えて:参照パックを活用する4つの方法

同じキャラクター、次のエピソード。 ステップ1のシートをアセットとして保存し、プロンプト内のショットリストとストーリーブロックのみを変更する。アイデンティティはファイルから得られ、先週の火曜日にどう表現したかという記憶からではない。

声も固定する。 H3は最大3つの音声参照(2〜15秒)を受け付け、画像または動画の入力と一緒に提供する必要がある。音声サンプルを与えると、キャラクターはその音色で話す。エピソード間で声優を再キャストする必要はない。

レンダリングに支払う前にカメラをブロックする。 Seedance 2.5の参照から動画は、3Dホワイトモデルのブロックアウトとグリーンスクリーンプレートを受け付けるため、グレーのジオメトリでフレーミングを固定し、その後で完成ルックにコミットできる。この例はSeedance 2.1(ファミリーの初期メンバー)で実行されたが、ワークフローの形状は同じである。

1つのマスターカットを再撮影する代わりにローカライズする。 リージョンレベルの置き換えは、カメラ、タイミング、リップの長さをそのままにして、顔、製品、または話し言葉を交換する。ここでは、1つのマスタービューティカットがスペイン語、韓国語、ヒンディー語向けに再キャストされ、再音声化され、部屋、フレーミング、リップの長さは固定されたままである。

そして、誰かが常識をやめたときにモーション転送がどのように見えるかを尋ねるだろうから:3人のスーツ姿の男性が、3匹のフォトリアリスティックなカピバラに置き換えられ、元のクリップのモーションパスをビートごとに追跡し、最終的にピラミッドに積み重なる。

また、誰も投稿しない、このすべてのプレーンなバージョンもある。静止ポスターが動くポスターになり、レイアウトは生き残る。 ピンクの恐竜パーカーを着て、巨大な爪を前に伸ばす漫画の少年 静止したソースポスター。これを「フレーム、パレット、レイアウトを維持し、タイプをアニメーション化する」という指示で参照から動画に与えると、同じデザインの動くバージョンが得られる。

Seedance 2.5 vs MiniMax H3ショートフィルムの実際のコスト

ここに数字はない。数字は動き、構造は動かないからだ。両方のファミリーは秒単位、従量課金、シートやサブスクリプションはない。これにより3つの変数が残る:秒数、解像度ティア、再ロール数。

3つ目が全体の請求額である。最初の試行で着地する15秒のクリップは1回の課金。同じクリップの7回目の試行は7回の課金。したがって、お金を節約する方法は、より安い秒単位のモデルを選ぶことではなく、何かを生成する前に参照パックを正しくすることだ。ステップ1とステップ2の2つの画像呼び出しは、パイプライン全体で最も安いラインであり、何回の動画呼び出しを行うかを決定する。チェーン全体で最も高いリターン・オン・スペンドであり、はるかに差がある。

次に、秒単位の本能を修正する。同じ参照パック、同じ実行時間:H3の参照から動画は1440pを返し、このSeedance参照から動画エンドポイントは720pを返す。秒単位は間違った単位だ。ピクセル/フレーム、そしてその後別のアップスケールパスに支払う必要があるかどうかが正しい単位である。

音声も計算に入れるべきだ。両側とも、同じパスでネイティブの同期サウンドを生成する。現在のパイプラインが動画モデル+TTS+トラックを整列させる編集者である場合、節約できるのは2回のAPI呼び出しと1人の午後であり、その節約はどの料金表にも表示されない。

どのジョブにどちらを選ぶか:

ジョブ選択理由注意点
縦型ショートドラマ、9:16、TikTokまたはReelShortMiniMax H3ネイティブステレオ付き1440p縦型、今すぐ呼び出し可能、15秒は完全なフック15秒でカットするため、それに合わせてビートを計画すること
連続30秒のブランドフィルムSeedance 2.51回の生成、ステッチなし、ネイティブ4K最初にプラットフォームでの可用性を確認すること
承認済みカット内の1ショットを修正Seedance 2.5リージョンレベルの再描画で残りはそのままH3のクリップ全体編集でも今日はほぼ同じことができる
プロダクトおよびeコマースのカットダウンどちらでも両方とも画面上のテキストとブランドマークをうまく保持する出荷する解像度でテキストを確認すること
ゲームまたはインターフェースデモMiniMax H32KでのUIとタイポグラフィの安定性が強い1回のパスで15秒の上限
1つのマスターの多言語バージョンSeedance 2.5リージョン置き換え+多言語音声ローカライゼーションの品質は依然としてネイティブチェックが必要
今夜出荷するMiniMax H33つのエンドポイントがライブ、Seedance 2.0全体も利用可能Seedance 2.5へのアクセスはプラットフォームによる

出荷する前に。 MiniMaxはH3のウェイトがリリース後数日以内に公開されると述べた。オープンウェイトは商用ライセンスと同じではないため、セルフホストする前に条項を読むこと。ウォーターマークと商用利用ポリシーは、コンシューマーアプリとAPIアクセスで両側とも異なり、これを書いている間にプライマリ条項ページからどちらも確認できなかったため、プロバイダーの条項を確認すること。また、モデルライセンスのいずれも肖像権や商標をカバーしていない。実在の人物、実在のブランド、または他人の知的財産が参照パックに含まれている場合、それは別の法的問題であり、モデルの条項はそれに答えない。

上の表のすべてのモデルは同じキーで実行され、モデルページには現在のレートとコピーペーストコードが含まれており、今週Seedanceラインで行われているプロモーションも含まれる。

よくある質問

キャラクターの一貫性において、Seedance 2.5はMiniMax H3より優れていますか?

紙面上では、H3の12ファイルに対して最大50のマルチモーダル参照、さらにリージョンレベルの再ロールがあるため、優れているはずである。しかし、2026年7月31日現在、私が参照できるペアの公開テストはなく、Seedance 2.5にはまだアリーナ評価がない。私が実際に実行できたテストでは、アイデンティティの安定性を決定した変数はモデルの生成ではなく、参照パックの構造だった。1つの合成見返しシートと1つのライティングボードを使えば、両側ともキャラクターを保持した。モデルを比較する前に、パックを正しく作ること。

Seedance 2.5は今すぐ使えますか、それとも待つ必要がありますか?

そのAPIはByteDanceでライブである。サードパーティのモデルプラットフォームでの可用性は不均一であり、私がテストしたプラットフォームではまだDay-0のお知らせである。今夜出力が必要な場合、呼び出し可能なオプションはMiniMax H3の3つのエンドポイントと、出荷中のSeedance 2.0ライン全体である。

MiniMax H3は本当に30秒の動画を生成しますか?

いいえ。仕様は1回の生成で5〜15秒、24fpsである。それ以上長いものは拡張またはステッチであり、ドリフトリスクの異なる別のものである。30秒の単一生成はSeedance 2.5のものだ。2つの主張を混同してはならない。

両方のモデルは音声を生成しますか?また、エピソード間で同じ声を維持できますか?

両方とも同じパスでネイティブの同期音声を生成し、H3はすべての結果でステレオを出力する。永続的な声については、H3は2〜15秒の音声参照を最大3つ受け付ける。これらは単独ではなく、画像または動画の入力と一緒に提出する必要がある。

実際に何枚の参照画像を送るべきですか?

思うよりも少なく、構造化はより良く。1枚の適切に構成された合成画像は、一般的に6枚のばらばらのクロップに勝る。なぜなら、別々のファイルはモデルにそれらを平均化して存在しない人物を作り出すよう促すからだ。アイデンティティと照明という2つの明確なジョブを与え、互いに競合するスタイルサンプルは含めないこと。

TikTokやReelShortスタイルの縦型ショートドラマにはどのモデルを使うべきですか?

今週出荷する場合、9:16、高解像度、すでにミックスされたサウンドで:MiniMax H3。単一のリージョンではなくクリップ全体を再ロールすることを想定した30秒の連続シーンを計画している場合:Seedance 2.5用に構築し、プラットフォームでいつ開くか確認すること。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索