YouTubeが偽のトレーラーの10億回の視聴を削除。私はMiniMax H3 Movie Trailer Generatorを使って本物のトレーラーを作った。

MiniMax H3 ムービートレーラー生成ツールは、1回の実行で15秒のティーザーを生成します:マルチショット、ネイティブステレオ、ナレーション、タイトルカード。完全なプロンプトと実際の料金は内部にあります。

2025年12月、YouTubeはScreen CultureとKH Studioを停止した。2つのチャンネル、合計200万人以上の登録者、10億回以上の再生回数。彼らは公式映像とAI画像を組み合わせ、公式のようなフランチャイズ予告編を作成していた。Screen Cultureは3月までに1つの『ファンタスティック・フォー』予告編を23バージョン出荷し、そのうちいくつかは検索で本物の予告編を上回っていた(Deadline、2025年12月)。

彼らがBANされたのはAIを使ったからではない。スパムと誤解を招くメタデータ——他人の映画を公式公開作品として通したこと——が原因だ。

しかし、10億回の再生は別のことを証明した。予告編は映画マーケティングにおいて最もレバレッジの効く15秒だ。フォーマット自体が問題だったわけではない。帰属(アトリビューション)が問題だった。

そこで、その実験の有用なバージョンがこちらだ。あなた自身の映画に対して同じフォーマットを使う。15秒のティーザー1本、2K、ネイティブステレオ、1行のナレーション、スコア、タイトルカード。1回の生成。編集タイムラインも、ボイスブースも、音楽ライセンスも、After Effectsパスもなし。

重要なポイント

  • 予告編は、動画モデルに依頼できる最も密度の高いものだ。複数カット、ナレーション、スコア、サウンドデザイン、画面上のタイポがすべて積み重なる。H3は現在、Artificial Analysisの「動画編集+音声」リーダーボードで1位にランクされており、映画タイトルシーケンスはMiniMax自身のファーストパーティユースケースリストに含まれている。
  • 15秒はH3のハードな上限である。これは劇場用ティーザー(30~60秒)ではないが、実際の仕事の大半を担うソーシャルカットの長さとまったく同じだ。
  • プロンプトは、形容詞の羅列ではなく、タイムコード付きのキューシートとして書く。導入、葛藤、クライマックス、タイトルカード。4つのビート。
  • APIのどこにもオーディオパラメータはない。スコア、ナレーション、サウンドデザインを言葉で指示しなければ、モデルが気の向くままに出力する。
  • Atlas Cloudでの実数値:768pドラフト $1.50、2Kファイナル $2.10、オープニングフレーム約$0.17。完成したティーザーは $2.03 から $3.77 の間。

オレンジ色のスーツを着た人物が潜水艦の舷窓の外を見ている

GPT Image 2で生成したオープニングフレーム。1970年代の鋼鉄製潜水鐘の内部、擦れたオレンジ色の潜水服を着た女性、琥珀色の計器ランプとソナーグリーンの光。すべてのフレームの基盤となるフレーム。openai/gpt-image-2/text-to-image で、品質 high、2048×1152で生成。この単一画像が、768pドラフトと2Kファイナルを別の映画にしない鍵となる。

1回の生成で作ったMiniMax H3映画予告編

まずは理論抜きで、実際のものを見てほしい。オリジナルの深海スリラーティーザー『SALVAGE』。1回のAPI呼び出し、後からカットを追加していない。

SALVAGE、15秒、minimax/h3/image-to-video で1回生成。音声オン:船体の軋み、ソナーのping、弦楽器のクラスター、1行のナレーション、すべて画像と同じ呼び出しから出力。課金 $2.10。

このファイルに含まれているものと、各要素の出所:

  • 4つの異なるショット、ハードカット、ディゾルブはなし。1回の生成。
  • 24fps、AACステレオ32kHz。後処理で追加したものではない。
  • 1行のナレーション、女性、5~7.5秒の間に配置(プロンプトで指定)。
  • 最後の2秒間、完全に静止したタイトルカード。

これで、従来の5つのポストプロダクションパスが1つに凝縮されている。これこそが、予告編がこのモデルにとって優れたストレステストであり、他のほとんどのモデルにとっては悪いテストである理由だ。

なぜほとんどのMiniMax H3映画予告編の試みは9秒目で崩れるのか

予告編は、偽造するのが最も難しいカテゴリだ。なぜなら弱点を隠せないから。タイポが震えればわかる。リップシンクがずれれば聞こえる。スコアがカットに合わなければ、全体が音楽がかかったスライドショーのように感じられる。

それがH3が現在の位置にいるおおよその理由だ。Artificial Analysisの「動画編集+音声」リーダーボードで、8,249票のElo 1,130で1位、Gemini Omni Flashに9ポイント差、Dreamina Seedance 2.0に93ポイント差をつけており、そのトップグループの中でOpen Weightsとマークされている唯一のモデルだ(Artificial Analysis、2026年8月)。MiniMaxの公式発表資料では、映画タイトルシーケンスを、アニメーションポスターやキャラクター一貫性のあるゲームシネマティックと並ぶファーストパーティユースケースとして挙げている(MarkTechPost、2026年8月)。

以下は、その発表セットからの公式15秒SFオープニング。お金を使う前に「ネイティブオーディオ」が何を意味するか聞いてほしい。

THE LAST FLEET LEFT EARTH、MiniMax公式H3ショーケースセットより。2560×1440、24fps、AACステレオ32kHzで提供。トラッキングアウトするタイトルカードと、予告編中盤の「SHE KNEW WHY」カードが、カメラが動き続ける間も静止している様子を見てほしい。

次に失敗リスト。以下のすべては、この記事のトップにあるクリップに至るまでに実際に起こった問題だ。

  1. 1回の呼び出しで60秒の予告編に収めようとする。 15秒はハードな上限。フル予告編のストーリーを求めると、8ビートを4つに圧縮するため、グチャグチャになる。ティーザーを書くこと。
  2. 形容詞の代わりにキューシートを書かない。 「壮大なシネマティック予告編、ドラマチック、緊張感」では雰囲気は出ても構造は得られない。タイムコードで構造を与えること。
  3. ぼやけたタイトルカード。 プロンプトに文字列そのもの、タイポの処理方法、そして明示的な「完全静止」指示を入れなければ、近似の文字ができる。3行以上のタイポは崩れ始める。
  4. 無音ファイル、または頼んでいないスコアができる。 text-to-video、image-to-video、reference-to-videoには音声パラメータがない。音声はプロンプト内の散文で指示するか、まったく出力しないかのどちらか。
  5. text-to-videoで安くドラフトする。 最初のフレームが固定されていないと、768pと2Kで異なる映画になる。2Kパスはインコンテキストの再生成であり、アップスケールではないからだ。安いドラフトでは、高価なファイナルについて何も学べない。
  6. duration を送らない。 スキーマではデフォルト8とされているが、省略すると5秒ジョブとして課金され、5秒のファイルが返されることがある。予告編は葛藤のビートでギロチンにかけられる。
  7. HTTP 200が正常応答だと決めつけない。 実際のフランチャイズ名を指定すると、入力スクリーニングが数秒でジョブを拒否する。その他のプロンプトは静かにトリミングされ、通常どおり課金される。

ポイント4、5、6は高くつくもので、ドキュメントにはどこにも書いていない。

MiniMax H3映画予告編ジェネレーターのワークフローと各ステップのコスト

5つのステップ、5つのモデル、1つのブラウザタブ、1つのAPIキー。以下の価格は本日(2026年8月)の各モデルページの実際の秒単位レートであり、ブログの数字ではない。

ステップモデル機能本日の価格(2026年8月)
オープニングフレームを固定するGPT Image 2(text-to-image)キャスト、衣装、グレードを固定する1フレームトークンベース。2048×1152のhighで実測 $0.1745
ティーザーのドラフトと仕上げMiniMax H3 image-to-video15秒の予告編そのもの、映像と音声2K $0.14/秒、768p $0.10/秒
テキストのみのバリエーションMiniMax H3 text-to-videoフレーム固定なしの同じビートシート同じレート
縦型カット、キャスト固定MiniMax H3 reference-to-video9:16ソーシャルバージョン、最大9枚の画像リファレンス同じレート
768pキーパーの救出Atlas Cloud Video Upscaler再実行ではなく、気に入ったドラフトを引き上げる1080p $0.018/秒、2K $0.024/秒、5秒最小

Atlas Cloudモデルディレクトリ上の3つのH3エンドポイント。text-to-video、image-to-video、reference-to-videoは同じキー上の別々のルートであり、以下のチェーン全体が1つのタブから離れない。

手のひらに書き留めておく価値のあるパラメータの事実。すべて、本日(READMEではなく)実際のスキーマで確認済み:resolution768P または 2K、デフォルトは 2Kduration は4から15の任意の整数。フィールド名は ratio であって aspect_ratio ではない。image-to-videoでは、出力形状が入力フレームから継承されるため、ratio は完全に無視される。text-to-videoとreference-to-videoは 21:9 から 9:16 を受け付ける。すべて非同期で動作:POST /api/v1/model/generateVideo の後、/api/v1/model/prediction/{id} をポーリングする。

MiniMax H3映画予告編チュートリアル:15秒、4ビート、1回の生成

この映画はオリジナルの深海スリラー。タイトルは1語で、タイポに余裕を持たせる。ナレーションは1行。プロンプトをそのままコピーし、名詞を自分のプロジェクトに置き換えてほしい。

ステップ1:GPT Image 2でオープニングフレームを固定する

動画モデルから始めてはいけない。フレーム1枚は約17セント、15秒の2K生成は$2.10かかるため、一桁安いコストでルックを確定させたい。さらに重要なのは、固定された最初のフレームだけが、768pドラフトを2Kファイナルの予測可能なものにするという点だ。

Plain
1Cinematic film still, anamorphic look inside a 16:9 frame: the interior of a 1970s steel
2diving bell descending into black water, seen over the shoulder of a woman in a scuffed
3orange dive suit. Her face is lit only by a single amber instrument lamp and the pale
4green wash of a sonar screen. Condensation beads on the thick porthole glass; beyond it,
5absolute darkness with one faint drift of particles. Heavy 35mm film grain, deep crushed
6blacks, teal-and-amber palette, shallow depth of field, practical lighting only.
7No lens flare, no text, no logos, no watermark, no subtitles.

設定:品質 high、サイズ 2048x1152、出力形式 png。ここで品質 high は必須ではない。なぜなら、粒子とつぶれた黒が、動画モデルによって15秒間引き継がれるからだ。

AI画像ジェネレーターのスクリーンショット。プロンプトと生成された出力が表示されている

Atlas Cloud上のGPT Image 2プレイグラウンド。潜水鐘のプロンプトが読み込まれ、完成したオープニングフレームが出力パネルに表示されている。Atlas Cloud上のGPT Image 2、実行完了。左に上記のプロンプト、右にこの記事のヒーローとなったフレーム。

ステップ2:15秒の予告編ビートシートを書く(導入、葛藤、クライマックス、タイトルカード)

これが、「最高の予告編ジェネレーター」まとめ記事では誰も教えてくれない部分だ。予告編のプロンプトはキューシートである。画像にはタイムコード、音声にはタイムコード、ナレーションにはウィンドウ、タイトルカードにはその文字列そのものを入れる。

以下は単体の構造。自分の映画に合わせて中身を書き換えてほしい。

ビート時間帯画像カット音声の合図
導入0.0~4.0秒主人公が自分の世界にいる1つのスロームーブカットなし、単一の押し込みまたはトラックルームトーン、1つの特徴的な音、低いベッド
葛藤4.0~8.0秒問題の規模を示すワイド、次に詳細に戻る2つのハードカットベッドが締まる、1つの金属音、弦楽器が入る
クライマックス8.0~12.0秒3つの素早い詳細、その後ブラック3つのハードカット、その後6フレームのブラック上昇するクラスター、1つの衝撃、その後ハードサイレンス
タイトルカード12.0~15.0秒タイトルがフェードアップ、最後の2秒間完全静止動きは一切なし1つのサブベースヒット、その後減衰するテール

そして、この構造を埋めたものがこちら。ステップ1のフレームを添付して、image-to-videoに貼り付ける準備ができている。

Plain
115-second 16:9 teaser trailer for an original deep-sea thriller. Continue exactly from the
2supplied first frame: same woman, same orange dive suit, same amber-and-sonar-green
3lighting, same heavy grain. Four beats, hard cuts, no dissolves.
4
50.0-4.0s  ESTABLISH. Slow push-in past her shoulder toward the porthole. Dust motes drift.
6The sonar screen sweeps once. She breathes; her exhale fogs the glass.
74.0-8.0s  CONFLICT. Hard cut to a low wide: the dive bell tiny against a black cliff face,
8cable taut above it. Hard cut back to her hand snapping a switch. The instrument lamp
9stutters. A shape passes the porthole, out of focus, unidentifiable.
108.0-12.0s CLIMAX. Three rapid cuts: extreme close-up of her eye catching a red overload
11light; the porthole glass flexing with a hairline crack; total black for six frames.
1212.0-15.0s TITLE CARD. Fade up from black on one title, centred, holding dead still for the
13last two seconds: SALVAGE
14Extremely wide letter-spacing, heavy condensed serif, brushed cold steel with a faint rust
15edge and a restrained inner glow, not pure white. Below it, small caps at half the size:
16NOTHING DOWN HERE STAYS LOST
17Both lines rock-steady: no jitter, no warping, no drift, no re-render between frames.
18
19AUDIO, generate natively, do not deliver a silent track:
200.0-4.0s  low hull groan around 40 Hz, one sonar ping at 1.5s with a long tail, distant
21pressure hiss.
224.0-8.0s  the hiss tightens; a single metallic clank at 6.2s; strings enter on one
23sustained low note.
248.0-12.0s rising string cluster, a rivet pop at 10.5s, then hard silence at 11.8s.
2512.0-15.0s one deep sub-bass impact on the title card, then a slow decaying reverb tail
26over quiet sonar.
27NARRATION, one line only, female voice, low and unhurried, mixed under the music, spoken
28between 5.0s and 7.5s: "Nothing down here stays lost."
29
30NEGATIVE: no on-screen text other than the two title lines; no subtitles, no captions, no
31watermark, no studio logo, no lens flare, no whip pans, no camera shake beyond a slow
32handheld float, no daylight, no visible creature, no gore, no blood.

この中の3つの要素が、見た目以上に多くの仕事をしている。AUDIOブロックは、設定する音声パラメータがないから存在する。「rock-steady」という行は、タイプの安定性が予告編で最も一般的な失敗だから存在する。そして11.8秒の6フレームのブラックは、タイトルカードを単なる別のショットではなく、タイトルカードらしく見せるためにある。

SALVAGEの海底ビデオタイムラインを示す4つのストーリーボードパネル

完成したSALVAGEティーザーから抽出した4つのフレーム。ラベルはESTABLISH、CONFLICT、CLIMAX、TITLE CARD。ビートシートが実際にレンダリングされた様子を示す。実際に出力された同じ4つのビート。2Kファイルから抽出。左から右へ:2秒の押し込み、5秒の低いワイド、10秒の過負荷ライト、14秒のタイトルカード。

ステップ3:768pでMiniMax H3映画予告編をドラフトする($1.50)

同じフレーム、同じプロンプト、resolution: "768P"duration: 15duration は明示的に送ること。省略すると5秒ジョブとして課金されることがある。1344×768、24fps、AACステレオ、請求額は$1.50。

768pドラフト。最初のフレームが固定されているため、2Kファイナルと構造的に同じ映画。タイトルカードの小さなタイポで解像度の差がわかる。

以下の4つのことだけを評価し、シャープネスは完全に無視する。

  1. カットはビートのタイミングに合っているか、それとも1つのビートが別のビートを食ってしまっているか?
  2. ナレーションは存在するか、5〜7.5秒のウィンドウ内に収まっているか?
  3. タイトルカードは静止しているか、それとも動いているか?
  4. スコアは12秒の衝撃に合っているか?

これらのいずれかが失敗した場合、プロンプトを修正して$1.50で再ドラフトする。$2.10で修正してはいけない。

ステップ4:MiniMax H3映画予告編を2Kで仕上げる

1つのフィールドだけを変更する。同じ image、同じプロンプト、resolution: "2K"。出力は2560×1440、請求額は$2.10。

最初のフレームが固定されているため、2つのパスは内容ではなく細部で異なる。正直な話:大きいタイポは768pでも読めるが、2行目は2Kで初めて実際の文字形状に解像される。

SALVAGEのドラフトとファイナルのロゴデザインの比較

タイトルカードの100%クロップ。左が768p、右が2K。サブタイトル行が2Kでのみ読み取り可能な文字形状に解像される様子を示す。同じ秒、同じフレーム、100%クロップ。ワイドトラッキングのSALVAGEは両方で生き残る。その下の半分のサイズの行が、2Kで仕上げる理由。

AI動画ジェネレーターのインターフェース。テキストプロンプト入力と動画出力を表示

Atlas Cloud上のMiniMax H3 image-to-videoプレイグラウンド。潜水鐘のフレームが読み込まれ、出力パネルに完成したクリップが表示されている。Atlas Cloud上のMiniMax H3 image-to-video、実行完了。このキャプチャではプレイグラウンドの解像度と時間選択をデフォルトのままにしているため、OUTPUTのクリップは上記の15秒呼び出しよりも短いランであり、完成したティーザーではない。

より安い仕上げ方もある。768pのテイクがすでにキーパーなら、ビデオアップスケーラーに秒$0.024で2Kに送る。15秒で$0.36だ。すでに気に入っているテイクは保護されるが、元のソースになかった文字形状の細部を発明することはできず、2Kルートは入力の23秒までに制限される。

ステップ5:Reference-to-Videoで縦型MiniMax H3映画予告編をカットする

16:9ファイルはサイト用。9:16ファイルは実際に視聴されるもの。reference-to-videoは最大9枚の画像リファレンスとビデオ/オーディオリファレンスを受け付けるため、同じ主人公とグレードをポートレートリフレームに固定できる。テキストだけで期待するよりも確実だ。

refers をステップ1のフレームとルックボードを含む配列として送り、ratio: "9:16"duration: 15resolution: "2K"。プロンプトは同じビートシートだが、縦型のブロッキングに変更:葛藤のビートは低いワイドではなく単一のミディアムクローズアップになり、タイトルカードは大きいタイポでサブタイトルが2行に分割される。

エラーにならずにお金を無駄にする落とし穴が1つ:同じリクエスト内で imagerefers を両方送ってはいけない。これらは相互排他的であり、APIは両方を受け付けるが、一方が静かに破棄される。

minimax/h3/reference-to-video からの縦型カット。同じキャスト、同じグレード、スマホ用に再ブロッキング。

AI動画ジェネレーターのインターフェース。テキストプロンプトと動画出力を表示

Atlas Cloud上のMiniMax H3 reference-to-videoプレイグラウンド。リファレンス素材が読み込まれ、出力パネルに完成したクリップが表示されている。Atlas Cloud上のMiniMax H3 reference-to-video、実行完了。リファレンススロットが埋められている。解像度と時間は再びプレイグラウンドデフォルト。

MiniMax H3映画予告編プロンプトの4つのバリエーション

同じビートシート、4つの異なるデリバラブル。

スコープ。 text-to-videoまたはreference-to-videoで ratio21:9 に変更。同じキューシート、より広いレターボックス、タイトルカードには明らかにより多くのトラッキングスペースができる。

タイトルスティングのみ。 ビート1~3を削除し、タイトルカードだけを残し、duration: 4 に設定。2Kで$0.56で、サブベースヒットが乗ったロゴアニメーションができる。映画以外でも非常に有用。なぜなら「予告編」はしばしばゲーム、本、ポッドキャストのためのものだから。

別の言語。 H3は複数の言語でのナレーションをネイティブに処理する。したがって、同じビートシートでナレーション行を日本語に書き換えれば、別の吹き替えトラックなしでローカライズされたティーザーが得られる。

別のカテゴリ。 縦型ドラマティーザーは、同じ4ビートだが、ナレーションではなく会話になる。以下はH3ショーケースセットからの公式9:16の例:15秒、8ショット、すべてのショットで一貫した1人のキャラクター、ボイスオーバーではなく話し言葉。

公式MiniMax H3縦型ティーザー、1440×2560、15秒、8ショット、AACステレオ、会話付き。同じビート構造で、ショートドラマのオーディエンスを狙っている。

30秒のティーザーが欲しい?クリップ1の最後のフレームをクリップ2の最初のフレームとして使う。詳細はMiniMax H3動画長さガイドを参照。

MiniMax H3映画予告編の実際のコスト

完成した15秒2Kティーザーへの4つの正直なパス。フレームコストはGPT Image 2の high、2048×1152での実測 $0.1745。

パス明細合計
直接2Kフレーム $0.1745 + 2K $2.10$2.27
ドラフト→仕上げ(推奨)フレーム $0.1745 + 768p $1.50 + 2K $2.10$3.77
ドラフト→アップスケールフレーム $0.1745 + 768p $1.50 + アップスケール $0.36$2.03
現実的なセッション、3ドラフトフレーム $0.1745 + 3×$1.50 + 2K $2.10$6.77
縦型カット追加+ $2.10

MiniMax自身の直接価格はAtlasレートより1秒あたり若干低いため、15秒2Kクリップの$1.95という数字が他で引用されているのを見るかもしれない。Atlasではレートは秒$0.14で、$2.10になる。この記事のすべての請求はこの数字を使用している。

そして、その$2.10が何を置き換えたのか、正直に評価したものは以下の通り。

従来のポストプロダクションパス通常の担当者H3は1回の実行で提供するか?測定結果
マルチショットアセンブリ編集者はい4ビート保持;カットは書かれたタイムコードに合致
ナレーション録音VOアーティスト+ブースはい書かれた5~7.5秒のウィンドウ内に収まった
スコア作曲家またはライブラリライセンスはいアークと12秒の衝撃の両方が存在
サウンドデザインサウンドデザイナーはい、ただし注意点あり合図はビートに合うが、指定されたタイムコードにはフレーム精度ではない
タイトルカードアニメーションモーションデザイナーはい2Kで安定;768pでは半分のサイズの行がソフト

この価格を他のH3エンドポイントと1行ずつ比較したい場合は、MiniMax H3 API価格内訳に呼び出しごとの計算があり、上記の3つのエンドポイントは同じモデルディレクトリの1つのキーに存在する。自分でチェーンを実行したい場合に。

ファン予告編、実際の映画、そして10億回の再生を削除させたメタデータ

あのチャンネルに実際に何が起こったのかを正確に述べておく価値がある。なぜなら教訓は「AIで予告編を作るな」ではないからだ。

両チャンネルとも停止され、修正を行い、パートナープログラムに再承認された後、元に戻り、YouTubeのスパムおよび誤解を招くメタデータポリシーに基づいて停止された。問題は表示方法だった。タイトルとサムネイルが、そのような予告編が存在しない映画の公式スタジオ素材として読めるものであった。既存の作品のコンセプトピースを作る場合は、タイトル、サムネイル、説明に明記し、メタデータがスタジオからのものだと暗示しないようにする。

H3もAPIレベルでこの点を牽制している。プロンプトに実際のフランチャイズ名や特定の映画を指定すると、入力スクリーニングが数秒でジョブを拒否し、生成してから考えるという事態を防ぐ。これは大雑把なフィルターであり、無実のプロンプトに引っかかることもあるが、線がどこにあるかを示す有用なシグナルである。

APIを呼び出すのではなくセルフホスティングする場合の注意点:リリースされた重みはMiniMax H3 Community License Agreementの下で配布されており、2Kパスを生成するH3-Context-IRおよびH3-Regenerate-2Kモジュールはオープンリリースの一部ではなく、API側に残る。商用利用およびライセンスガイドで条件をカバーしている。この記事で使用したAPIルートには当てはまらない。

よくある質問

MiniMax H3映画予告編ジェネレーターはフル予告編を作れますか、それとも15秒だけですか?

1回の生成あたり15秒がハードな上限です。劇場用ティーザーは30~60秒、フル予告編は90秒~3分(Beverly Boy、2026年)のため、1回の呼び出しではソーシャルカットが得られ、劇場用のものは得られません。より長いものが必要な場合は、1つのクリップの最後のフレームを次のクリップの最初のフレームとしてフィードすることで、生成をつなぎ合わせます。

MiniMax H3は予告編のナレーションと音楽を生成しますか?それとも後で追加する必要がありますか?

ネイティブに、画像と同じ呼び出しで、24fpsの動画とともにAACステレオ32kHzで配信されます。ただし、3つのエンドポイントのいずれにもオーディオパラメータはありません。スコア、ナレーション、効果音は、タイムコード付きでプロンプト内の散文で指示します。そのブロックをスキップすると、選択していないサウンドトラックになります。

画面上のタイトルカードのテキストは実際に読めるようになりますか?

はい、文字列そのものを書き、タイポの処理方法を説明し、「rock-steady, no jitter, no warping」のような明示的な安定性指示を追加すれば。2行以内に抑えてください。大きいトラッキングされたタイポは768pでも生き残りますが、小さい2行目は2Kでのみ適切に解像されます。

MiniMax H3映画予告編1本のコストはいくらですか?

Atlas Cloudでは、2Kで15秒は秒$0.14で$2.10、同じ長さの768pは秒$0.10で$1.50です。オープニングフレームに約$0.17を追加します。完成したティーザーは、ドラフトをアップスケールするか2Kで再実行するかにより、$2.03から$3.77の間になります。duration は必ず明示的に送ってください。

実際に存在する映画の予告編を作れますか?

技術的には、入力スクリーニングが名前付きフランチャイズをブロックするため、モデルは課金前に拒否します。実際には、YouTubeはこのコンテンツに関する誤解を招くメタデータで10億回の再生があったチャンネルをすでに停止しています。オリジナルにするか、タイトルと説明でコンセプトまたはファン作品であることを明確にラベル付けしてください。

より長い予告編で同じ主人公を維持できますか?

reference-to-videoを使用します。これは最大9枚のリファレンス画像とリファレンス動画/音声を受け付け、テキストだけで期待するよりも確実にキャストを固定します。同じリクエスト内で imagerefers を両方送らないでください。これらは相互排他的であり、APIは文句を言わず、一方が静かに破棄されます。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索