Seedance 2.0 Mini & Fast APIを世界最安値で — 公式価格から最大68%オフ

MiniMax H3 プロンプトガイド: 公式プロンプト45個を研究したので、あなたはやらなくて済みます

MiniMaxの全45個のサンプルプロンプトから構築されたMiniMax H3プロンプトガイド:6ブロック構造、end_imageトリック、ネイティブオーディオキュー、文字化け修正。

MiniMax H3を、単一の画像プロンプトではなく、短い制作ブリーフのように使う。再利用可能な構造はシンプルだ。すべての参照アセットをバインドし、コアアイデアを述べ、シーンをタイムドな視聴覚シーケンスとして、カメラの動き、台詞、アンビエンス、音楽、制約を別々のブロックに書く。

このガイドでは、公式のMiniMax H3の45の例を逆解析し、6パートのプロンプトの公式を示し、end_imageの属する場所を説明し、ネイティブオーディオキューが結果をどう変えるかを解説し、生成されたクリップ内の文字化けに対する実用的な修正方法を提供する。

あなたはすでにビデオモデルにプロンプトを送る方法を知っている。「シネマティックライティング、スロープッシュイン、4K」。その語彙は2年間あなたを支えてきた。

そして、それをMiniMax H3に貼り付けると、独自のサウンドトラックを伴った2Kのクリップが返ってくる。絵は素晴らしい。ペーシングはぐちゃぐちゃだ。タイトルの2文字が綴り間違っている。オーディオはモデルが勝手に選んだ部屋のトーンだ。

問題はモデルではない。あなたが一文を渡しただけだ。モデルはスケジュールを欲しがっていた。

そこで、MiniMaxがH3に同梱した45のサンプルプロンプトすべてと、それに付属する完成クリップを読み、フレームを分解した。公式プロンプトは説明文ではない。優れたものは、裏に音楽キューシートをホチキス止めしたショットリストだ。以下に、構造、現在実際に露出しているパラメータ、そして約20分で再現できるデモを一つ示す。

重要なポイント

  • H3プロンプトはタイムラインであり、説明文ではない。最も強力な公式サンプルは、クリップを[0s-2s]、[2s-4s]のマーカーで文字通りスライスしており、完成したフィルムはすべてのビートを正確に捉えている。
  • 音声と映像は同じパスから出力されるため、オーディオはプロンプト本文内に記述しなければならない。公式プロンプトでは、独自のブロックを与え、「6秒でジャズベースのグルーヴが入る」まで指定している。
  • あなたが綴ったテキストはきれいに出力される。綴らなかったテキストは文字の形をしたノイズになる。 単一の公式クリップから両方を同時に証明するフレームクロップがある。
  • イメージ・トゥ・ビデオはend_imageを受け付ける。最初のフレームと最後のフレームを与えれば、コンピュートを1秒も使う前に感情の弧が固定される。
  • プロンプトの長さは美徳ではない。参照画像が説明を担っている場合、短い公式プロンプトは機能する。長さは、あなたが参照画像に任せることを拒否した仕事の量に比例する。

This Is Fineの犬、左はそのまま、右は10秒のMiniMax H3出力で燃え尽きる

両側とも同じ絵だ。左はKC Greenのオリジナルパネル、そのまま。右は1回のイメージ・トゥ・ビデオ呼び出し:最初のフレームを入力、最後のフレームを入力、10秒出力、そしてパチパチという火の音と平坦な小さな「this is fine」はモデル自身のオーディオトラック。誰もスコアを付けてはいない。このガイドのすべては、あなたをその後半に到達させることを目的としている。

MiniMax H3プロンプトの実際の姿(全45個を読んだ)

現在検索の最初のページにある「MiniMax H3プロンプトガイド」は、どれもスペックシートだ:2K、24fps、5~15秒、ネイティブオーディオ。それはモデルカードであって、プロンプトではない。

以下が本物だ。これはMiniMaxのノワール風タイトルシーケンスの背後にある公式プロンプトの一部を、中国語原文から翻訳し、全長の約3分の1を抜粋したもの:

15秒、16:9の軽サスペンス・クライム映画のタイトルシーケンスを生成する。全体的なスタイルは、これらの画像のビジュアルランゲージを参照する:レトロな日本アニメのタイトルカード、ハードエッジのシルエット、コミックコラージュ、非対称分割画面、強い幾何学的な色のブロック、英語のクレジットタイトル、少しの日本語カタカナ装飾、ジャズ・クライムの雰囲気。ムードはサスペンス60%、ジャズ40%:神秘的で、クールで、機敏で、都会のクライム、ホラーではなく、重くなく、陽気なジャズMVにしないこと。

[...] 英語のクレジットははっきりと判読できること [...] 中国語を追加しない、文字化けを生じない、英語の綴りを間違えない。全体のルール:すべての英語クレジットと役職名は正確に一度だけ出現する。役職名を繰り返さない、名前を繰り返さない、一人に複数の肩書きを与えない。

トランジションは多様であること:円形のレコード盤マスク、垂直の車のドアワイプ、人物の長い影が画面を横切る、赤い線のカット、巨大な英字マスク、分割画面のフレーム再構成、ハードな色のブロックカット、パネルをブロックごとに貼り付ける。すべてのトランジションはドラムのヒットに合わせる:鮮明で、サスペンスフルで、機敏で、コミックコラージュ。ソフトディゾルブなし、流動的なトランジションなし。

BGM:オリジナル15秒のタイトル音楽、サスペンス60%、ジャズ40%。持続するベーストーン、緊張したピチカート弦、冷たいシンセパルス、キックドラム、まばらなジャズブラシ、ウォーキングベースの断片、短いバリトンサックスのフレーズ、短いブラススタブで構成。最初の2秒は低音域とハイハットでサスペンスを確立、3秒で低音ドラムが入り、6秒でジャズベースグルーヴが加わり、10秒で短いサックス/ブラスリフが現れ、最後の2秒は緊張したコードとドラムヒットで締める。

言葉がどこに使われているかを見てほしい。「美しい」や「シネマティック」に使われたものはほとんどない。代わりに、ネガティブリストトランジションリスト、そして秒単位の音楽キューシートに使われている。それが仕事の形だ。ノワールアニメのバナー、地下鉄の電車の中のシルエットの人物MiniMax H3公式ノワールタイトルシーケンス:MIDNIGHT LINE、クリーンなSTARRINGクレジット

そのクリップのクレジットを見てほしい。MIDNIGHT LINE、STARRING、MAYA CROSS、REN KATO、LENA WARD、DIRECTED BY NOAH VOSS。正しく綴られ、役職名は二度使われず、カタカナ装飾は指定された位置にある。プロンプトは「いいタイトルを作れ」とは言っていない。繰り返し禁止、綴り間違い禁止、中国語禁止と、美的感覚を5つの異なる方法で指定した。5つの映画的なノワールパネル、青とオレンジのシルエットのキャラクターノワールタイトルプロンプトと共にMiniMax H3に渡された5つのスタイル参照ボード

その5つのボードがテキストと一緒に入力された。5つの画像と1つの長いブリーフ、1回の生成。これが今のこの仕事の姿だ。

そして、45のプロンプトのうち非常に多くが短い理由は、その絵の中にある。全体を通して、プロンプトの中央値は約130文字の中国語だが、最も長い2つは657と858である。短いものは、参照ボードが説明を担っているから短い。長いものは、他にそれを担うものがないから長い。

ほとんどのMiniMax H3プロンプトが平坦になる理由と、文字化けの修正

うまくいかないのは3つのことで、それらはすべて間違いではなく、欠如である。

タイムラインがない。 10秒を要求し、1つの瞬間だけを説明したので、1つのスロープッシュインが10秒間引き伸ばされただけになる。モデルは7秒目に何もすることがなかった。

オーディオブロックがない。 音声は映像と同じパスで生成される。何も言わなければ、モデルはそれでもトラックを出荷する。ただ、適当に選ぶだけだ。

ネガティブリストがない。 放っておくと、モデルはソフトディゾルブに手を出し、画面上のテキストを勝手に作り出し、誰も頼んでいない字幕ストリップを追加する。

最も明確な証拠は、公式のゲームUIプロンプトである。これは6つのタイムスタンプ付きビートで構成されている:[0s-2s]メニュー、[2s-4s]右腕パネル、[4s-7s]武装グリッド、[7s-8.5s]確認、[8.5s-10s]ローディングバー、[10s-15s]世界がロードされる。完成クリップはその6つすべてを、順番通り、時間通りにヒットしている。ゲームメニュー、ロボットのPhantom Gripアームの選択表示MiniMax H3ゲームUIクリップ:メニュー、装備パネル、ローディングバー、ワールドロード

さて、正直な半分、同じクリップから、フル解像度2560x1440で。判読可能なゲームUIテキストと文字化けしたAIテキストの比較左:プロンプトで綴られたテキストはきれいにレンダリングされる。右:綴られなかったテキストは文字の形をしたノイズになる。

左側では、プロンプトが実際に入力したすべての文字列:RIGHT ARM EQUIPMENT、PHANTOM GRIP、CHRONOS CLAW。鮮明で、正しく、実際のゲームメニューのようにカーニングされている。

右側では、最終的な街のショットのHUD。プロンプトは「HUD要素」とだけ呼んでいた。ETR METNO CITFEPと読める。装備アイコンの上には、プロンプトが何も言わなかった部分に、MNALEαIN IAMG。これはレンダリングバグではない。モデルは英語のテクスチャを描いている。文字列が与えられなかったからだ。

したがって、修正方法は設定ではなく、習慣である:

読みやすくする必要がある単語は、その単語を入力する。 そして、ネガティブラインを追加する:綴りを間違えない、他のテキストを追加しない、字幕を追加しない。

そして、すべての強力な公式プロンプトが共有することになる6ブロックの形状がここにある。

ブロック何を書くか公式プロンプトの例それをスキップすると得られるもの
1. スタイル契約媒体、テクスチャ、パレット、時代、失ってはならない見た目"レトロな日本アニメのタイトルカード、ハードエッジのシルエット、コミックコラージュ、強い幾何学的な色のブロック"6秒目にはドリフトする、一般的な光沢のあるレンダリング
2. タイムライン文字通りの時間スライスと、それぞれのアクション[2s-4s] 彼女の右腕にスムーズズーム。UIパネルが右からスライドイン全体の長さに引き伸ばされた1つのアイデア
3. カメラ動き、または動かないという明示的な拒否"ロックオフ、スタティックワイドショット、プッシュインなし、カットなし"あなたが頼んでいないデフォルトのスロードリー
4. オーディオすべての音と、それが入るタイミング"6秒でジャズベースのグルーヴが加わり、最後の2秒は緊張したコードで締める"モデルが今日気に入った部屋のトーン
5. テキスト、綴られたもの文字通りの文字列、引用符で"THIS IS FINE." / CONFIRM CONFIG上記のような文字の形をしたノイズ
6. ネガティブリスト拒否するトランジション、オブジェクト、クリシェ"ソフトディゾルブなし、流動的なトランジションなし、中国語を追加しない、役職名を繰り返さない"ソフトディゾルブ、発明されたテキスト、不気味なドリフト

ブロック5と6は無料だ。生成に追加コストはかからず、品質のほとんどはここに詰まっている。

MiniMax H3プロンプトワークフロー:あなたのプロンプトが属するエンドポイント

同じキー、同じサブミット&ポールの形状、3つの扉。どれを選ぶかで、プロンプトがまだやらなければならないことが決まる。

エンドポイント何を渡すか何を固定するか知っておく価値のあるパラメータいつ使うか課金
minimax/h3/text-to-videoプロンプトのみなし。テキストがすべてを担うduration 5-10 (デフォルト8)、解像度2K、アスペクト比は明示的に設定する必要ありコミットする前にルックやサウンドデザインをテストする出力の秒単位、現在のレートはモデルページ参照
minimax/h3/image-to-videoプロンプト + 画像(最初のフレーム)、オプションのend_imageクリップの開始点、そしてオプションで終了点end_image、duration 5-10 (デフォルト8)、アスペクト比はデフォルトでアダプティブアートワークがあり、それを再描画せずに動かしたい出力の秒単位
minimax/h3/reference-to-videoプロンプト + refers[]被写体の同一性とスタイル、あなたが発明したシーン全体refers[] mixed array、duration 5-15、アスペクト比は最大21:9同じキャラクターや製品、新しい環境出力の秒単位

refers[]は、現実世界では本当に文書化が不十分なものだ。以下がそれが望む形状である:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

それぞれが1回の無駄な生成を節約する4つのルール:

  1. オーディオは単独では使えない。 少なくとも1つの画像またはビデオが配列に含まれていなければならない。ビートトラックだけでは拒否される。
  2. typeはオプション。 URLから推測されるが、拡張子があいまいな場合は明示的に指定する。
  3. 上限は現実的。 最大9つの画像、3つのビデオ、3つのオーディオクリップ、合計12ファイル。参照ビデオとオーディオはそれぞれ2~15秒(MiniMax APIドキュメント、2026年7月)。
  4. すべての参照にプロンプトテキスト内で役割を与える。 これがこのリストの中で最もレバレッジの高い習慣である。公式プロンプトは「画像1は全体的なムードとスタイルの参照、画像2は主人公の参照」という行で始まる。その一文がなければ、モデルはどのボードが何を意味するかを推測しなければならない。大きな黒い文字「BASS HITS」、微笑む女性MiniMax H3ダークポップミュージックビデオ:CUT BACK、ONE LOOK、DETONATEタイポグラフィ 3人の女性、グランジファッション、大胆なタイポグラフィポスターの横ダークポップクリップの背後にある2つのタイポグラフィ参照ボード

そのクリップはルール4の論拠である。そのプロンプトは決して文字の形を説明していない。「テキストのパッケージングスタイルとテクスチャは画像を参照する」と言い、2つのボードを渡している。レイアウトは、説明されたからではなく、示されたから到着した。

もう一つ表を。モデルカードとAPIが現在同じことを言っていないため、そのギャップが人々の午後を無駄にしている。

項目MiniMax自身のドキュメントエンドポイントが実際に今日受け付けるものそれがあなたのプロンプトにとって何を意味するか
長さ4~15秒、整数のみtext-to-videoとimage-to-video:5~10、デフォルト8。reference-to-video:5~15、デフォルト815秒のショットリストは今のところreference-to-videoにしか合わない。長いボードは10に書き直す
解像度2K解像度はデフォルトで2K、現在実行できる唯一の値は2K。768pのジョブはモデルMiniMax-H3は解像度768Pをサポートしていません、サポートされている解像度:2Kと返される。価格表には768pがあるにもかかわらず1440pxの短辺で書く。あなたが要求した詳細は実際に生き残る
アスペクト比一般的な比率またはアダプティブimage-to-videoとreference-to-videoはデフォルトでアダプティブ。テキストのみはアダプティブを拒否し、許可されたセットを返す:16:9、4:3、1:1、3:4、9:16、21:9text-to-videoでは、明示的に比率を設定しないとバリデーションに失敗する
混合参照9画像、3ビデオ、3オーディオ、12ファイル、オーディオは単独不可refers[]は{url, type}を取る。image、video、audioのいずれか、少なくとも1つの画像またはビデオ供給されたビートにモーションを同期させることは本当に可能だ。ただし、ビートだけを供給することはできない
ネイティブオーディオ同じパスでのステレオオーディオ調査した9つの公式クリップすべて:2560x1440、24fps、AACステレオ32kHzオーディオブロックは飾りではない。成果物の半分である

上記のすべてはAtlas Cloud上で実行された。ここでは3つのH3エンドポイントすべてが1つのキーと1つのサブミット&ポールループの背後にあり、それらの切り替えはモデル文字列の変更だけで、他には何も必要ない。

MiniMax H3プロンプトチュートリアル:This Is Fineの犬を火の中に、音付きで

以下が最初から最後までの全体だ。このジョークが機能するのは、犬が何もしないからだ。その否定を10秒の実時間に引き伸ばし、本物の火を追加し、最後の2秒を元のコミックが実際に行った場所に進ませると、より面白く、あなたにとっては少し悪くなる。ほとんどの人は最初の2つのパネルしか見たことがない。

ステップ1:オリジナルのコミックをダウンロードする。AIに描き直させてはいけない。

このストリップは6パネル、2列×3行、600×887。パネル2とパネル6だけが必要だ。

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 panels, 2 cols x 3 rows
3
4# crop panel 2 (the "THIS IS FINE." panel):  x 302-584, y 20-293
5# crop panel 6 (the melting dog):            x 302-584, y 595-868
6# upscale each 4x with Lanczos  ->  1128x1092
7

はっきり言う:画像モデルに「This Is Fineに似た犬」を描かせてはいけない。 AIによる再現は0.5秒で偽物だとバレ、ジョークは即座に死ぬ。水彩の滲み、不安定な手書き文字、紙の粒子感がすべての契約だ。4倍のLanczosアップスケールは、ソースの282pxが薄いからだけのもので、モデルが保持するための実際のピクセルを与え、何も発明させない。「This is Fine」の犬が火の中で溶ける2つのパネルパネル2とパネル6、最初のフレームとエンド画像の入力としてラベル付け

ステップ2:end_imageを使ってイメージ・トゥ・ビデオで実行する。

モデル:minimax/h3/image-to-video。設定:解像度2K、画像=パネル2、end_image=パネル6、比率1:1(正方形に近いソースに合わせる)。長さを10に設定する。スライダーはデフォルトで8にあるので、ドラッグする。

text
1ハンドペイントされた2Dウェブコミックパネル、命を吹き込む。すべてのフレームで、
2オリジナルの水彩テクスチャ、可視のインクアウトライン、位置ずれした紙の粒子、
3フラットなコミックパレットを維持する。スムージングしない、3Dで再レンダリングしない、
4ラインをクリーンアップしない、新しいオブジェクトを追加しない、新しいテキストを追加しない。
5
6[0s-3s] ほとんど何も動かない。犬は完全に静止して座り、マグカップを手に持ち、
7目は正面を見つめたまま。彼の後ろの炎だけが動く:ゆっくりとしたオレンジの舌が壁を
8這い上がり、1つの火の粉が舞い上がる。「THIS IS FINE。」と書かれた吹き出しは、
9完全に判読可能で、変更されず、手書きのまま、正確にその場所に留まる。
10
11[3s-6s] 犬はマグカップを持ち上げ、小さく穏やかな一口をすする。一口の後、
12吹き出しはフェードアウトする。火は明るくなる。彼の後ろの壁は熱で歪み始める。
13彼の帽子のつばが燻り始める。
14
15[6s-8.5s] 熱が彼に届く。耳が垂れ、輪郭が柔らかくなり、濡れたペンキのように
16下に流れ始める。それでも彼は目を動かさない。マグカップは彼の手の中に留まる。
17
18[8.5s-10s] 完全に溶ける。顔が歪み、片方の目が滑り、歯は固定された笑顔で剥き出し、
19毛皮は赤とオレンジに流れる。彼はポーズを保持する。最後の半秒、最終フレームで
20静止する。
21
22カメラ:ロックオフ、単一のスタティックワイドショット、プッシュインなし、
23ハンドヘルドなし、カットなし。フレームは決して動かない。これは1つのコミックパネル内の
241つの連続テイクである。
25
26オーディオ:全体を通して室内火災の部屋トーン - 低いパチパチ音、時折の燃える木の
27ポップ音、かすかな構造のきしみ音。3秒で、陶器のマグカップが歯に触れ、小さな
28飲み込む音。穏やかで平坦で、邪魔されていない男性の声が正確に言う:「This is fine。」
29- 無表情で、感情なし、少しリラックスしすぎ。6秒からパチパチ音が大きくなり、
30部屋のトーンが厚くなる。最後の2秒は低いサブベースのうねりを追加する。音楽なし、
31笑い声なし、このリストにない効果音なし。
32
33字幕を追加しない。ウォーターマークを追加しない。画像にすでにある単語以外の
34単語を綴らない。「THIS IS FINE。」を変更しない。カットアウェイしない。
35

そのプロンプトは、構造表を生かしたものだ。最初の段落はスタイル契約。4つのブラケット区切りはタイムライン。次にカメラ、次にオーディオ、そしてネガティブリスト。その中に装飾的なものは何もない。AIビデオジェネレーターのスクリーンショット、This is fineミームを表示Atlas Cloud上のMiniMax H3イメージ・トゥ・ビデオ:最初のフレームとエンド画像がロードされ、10秒の2K、出力パネルに完成クリップ

ステップ3:QAパスのように出力を読む。

4つのチェック。それぞれがプロンプトの異なるブロックをテストする。

  1. 吹き出しの中のTHIS IS FINE.はまだ判読可能で、正しく綴られているか? ブロック5をテストする。
  2. ラインは生き残ったか、それとも何かが「改善」してクリーンな3Dにしてしまったか? ブロック1をテストする。
  3. オーディオにはあなたがリストした音だけが含まれているか? コンテナを調べる:h264とAACステレオで戻ってくるはずだ。
  4. 最終フレームはパネル6のポーズに着地しているか? end_imageをテストする。
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

私のものは1472x1440、24fps、h264とAACステレオ、10.13秒で戻ってきた。注目すべき点:比率1:1を要求したが、1472x1440が返ってきた。つまり、イメージ・トゥ・ビデオでは、ソースフレームの形状が勝つ。2つのパネルを、実際に欲しい形状に合わせること。「This is fine」と言ってから火の中で溶ける漫画の犬完成クリップの4フレーム(0s、3s、6.5s、10s)、プロンプトの4つのタイムスライスに対応

ステップ4:reference-to-videoで犬を新しい場所に移動させる。

同じキャラクター、新しい部屋。モデル:minimax/h3/reference-to-video。設定:refers[] = パネル2を画像として、長さ8、解像度2K、比率16:9。

text
1画像1はキャラクターとアートスタイルの参照:この正確なハンドペイント2Dウェブコミックの
2ルック、同じ水彩テクスチャ、同じインクアウトラインの太さ、同じ犬、同じ小さな帽子、
3同じマグカップを維持する。彼を3Dで描き直さない、プロポーションを変えない、
4ラインをクリーンアップしない。
5
6彼を別の部屋に置き、その落ち着きを保つ。夜の窮屈なオープンプランのオフィス、
7蛍光灯がちらつき、すべてが赤いエラー状態を示すモニターの壁、プリンター用紙が
8フレームを通って漂い、隅に小さな電気火災。彼はフレームの中央のオフィスチェアに
9座り、マグカップを手に、カメラをまっすぐ見つめ、完全にリラックスしている。
10
11カメラ:ロックオフ、スタティックワイドショット。プッシュインなし、カットなし。
12
13オーディオ:蛍光灯のハム、プリンターの擦れる音、2秒ごとに繰り返す柔らかい
14アラームチャープ、遠くの電気のパチパチ音、4秒での1回の穏やかなすする音。
15音楽なし。声なし。
16
17画面上のテキストを追加しない。字幕を追加しない。他のキャラクターを追加しない。
18

転送可能なルール:refers[]は同一性とスタイルを運び、テキストはシーンを運ぶ。 その分割がキャラクター一貫性の全体のトリックであり、プロンプトの最初の行がそもそも存在する理由である。「試してみよう:赤い画面と燃えるプリンターの中でコーヒーカップを抱える漫画の犬」同じウェブコミックの犬が、夜の燃えるオープンプランのオフィスに移動、MiniMax H3 reference-to-videoによって生成

同じ帽子、同じマグカップ、同じインクの太さ、新しい部屋。1つの参照画像がそれをすべてやった。

盗む価値のあるさらに3つのMiniMax H3プロンプトパターン

パターン1:モーションポスター、レイアウトが動いてはいけない場合。 漫画のキャラクターが、無地のピンクの背景に向かって走るMiniMax H3モーションポスター:POPUP!レイアウトはアニメーションするが、フレームとタイポグラフィはロックされたまま ピンクのモンスターパーカーを着た少年、巨大な爪を伸ばすMiniMax H3に渡されたオリジナルの静止ポスター

プロンプト全体は2行:ギャラリーの白いフレーム、内側のフレーム、赤白黒のパレット、3Dフィギュアの感じ、レイアウト構造を変更せずに維持し、テキストの入り口に機敏な効果音を置く。ルール:生き残らなければならない部分に名前を付ける。「レイアウトを維持する」はスタイルノートではなく、制約であり、モデルはそれを制約として扱う。

パターン2:インターフェースデモ、動詞が形容詞を打ち負かす場合。 ミントグリーンのNike ZoomXランニングシューズ、ピンクのグラデーションソールMiniMax H3ランディングページデモ:スクロール、ホバー、カラーインバージョン(製品ページ) 水色のNikeランニングシューズ、緑とピンクのアクセントランディングページクリップの背後にある単一の製品参照画像

そのプロンプトは、下方向へのページスクロール、ホバー状態、強いスケールアップ、カラーインバージョンを要求している。4つの動詞。「モダン」や「スリック」とは決して言わない。インタラクションはアクションなので、アクションとして書く。 特大のイタリック体タイプとカーボンウィーブの背景は形容詞から来た。実際のページとして読ませるものは動詞から来た。

パターン3:実写と手描きの融合、拒否によって維持される。 アニメーション化された緑の発光する芽が、開いた手の中で成長するMiniMax H3クリップ、実写のキッチンフッテージと手描きの発光する生き物を融合

これは、夕方のキッチンをスマホで撮影したものに、小さな光る手描きの生き物がいるというものだ。これがホラー短編ではなく魅力的であり続ける理由は、禁止事項のリストにある:巨大な目なし、裂けた口なし、牙なし、脅迫的な姿勢なし、飛びかかりなし、突然のブラックアウトなし、ジャンプスケアなし。ネガティブリストは、パッチではなく、主要なスタイルコントロールである。 また、センスをコード化する場所でもある。暗いトンネルの中の女性とテキストの4つのパネル公式SFトレーラーからの4フレーム:THE STARS WERE LISTENING 「The Stars Were Listening」のポスターとキャラクターデザインシートトレーラーの背後にあるムードボードとキャラクター参照

上のトレーラーは、両方のアイデアをループで閉じている。プロンプトは1つのタイトル、THE STARS WERE LISTENINGを詳細に綴っている:非常に細く、太字、すべて大文字、錆びた濃い赤、わずかな粒子とかすんだエッジ。それは注文通りに正確に戻ってくる。2つの参照ボードがムードと主人公を処理するため、テキストは顔を説明する必要がまったくない。分業、ずっと下まで。

これらのMiniMax H3プロンプトを実行するのにかかるコスト

H3は生成されたビデオの秒数、解像度ごとに課金されるため、コストモデルは驚くほど退屈だ:15秒のテイクは、約3回の5秒の試行と同じくらいのコストがかかる。その他はすべてそれに従う。

  • 5秒で反復し、10秒または15秒で納品する。 構図、パレット、サウンドデザインはすべて5秒で解決する。ロックオフショットについて、全体の長さが間違っていることを教えてくれるものは何もない。
  • end_imageは、クリエイティブツールであるだけでなく、コストツールでもある。 ほとんどのやり直しは、エンディングがずれたために発生する。最後のフレームを固定することで、その失敗モードは支払いの前に取り除かれる。
  • ネガティブリストと綴られたテキストは無料だ。 プロンプトに文字を追加するが、トークンではなく秒単位で課金される。これらを積極的に使う。
  • 書く前にエンドポイントに長さを合わせる。 15秒のショットリストを作成し、その後エンドポイントの上限が10秒であることを発見すると、やり直しだけでなく書き直しが発生する。

まだ計画してはいけないことの一つ:価格表にはより安い768pの階層が記載されているが、この記事の執筆時点では768pのジョブははっきりと拒否され、2Kが実行できる唯一の解像度である。あたかも毎秒が2Kの秒であるかのように予算を組む。現在の秒あたりのレートはモデルページにあり、768pの階層が開かれたときにそこに表示される場所でもある。

MiniMax H3プロンプト、ミーム、著作権

犬はパブリックドメインではない。This Is FineはKC GreenのウェブコミックGunshow #648から来ており、2013年1月9日に公開され、最初の2つのパネルだけがバイラルになった(Know Your Meme、2013年1月)。Greenは、画像が永遠に再利用され続けるのを見ていることについて、公に、そしてかなり疲れた様子で話している。彼が共有しない政治を持つ人々による使用も含めて(NPR、2023年1月)。

このウォークスルーは解説と教育であり、ストックライブラリではない。商業的に何かを出荷したい場合は、自分でフレームを描くか、使用するものをライセンスする。また、クライアントの仕事の前に、独自のポリシーチェックを実行する:H3は認識可能な実在の人物やよく知られたIPにコンテンツルールを適用する。それを締め切りの途中で知るのは楽しいことではない。

よくある質問

MiniMax H3はオーディオを生成しますか、それとも後で追加しますか?

同じパスだ。映像と音声は一緒に出てくる。それがまさに、オーディオを後付けではなくプロンプト本文に書かなければならない理由だ。独自のAudio:ブロックを与え、各音がいつ入るかを述べる。調査した9つの公式クリップすべてが、2560x1440、24fpsのビデオストリームと共に、AACステレオ32kHzで戻ってきた。

MiniMax H3プロンプトはどのくらいの長さにできますか?

最大7,000文字、MiniMaxのドキュメントによる。実際には、公式サンプルは広い範囲に及び、中央値は約130文字の中国語、最も長い2つは657と858である。参照画像が説明を担っている場合、短いプロンプトは問題なく機能する。参照がない場合は、ショットリストを書くことを期待する。

なぜ私のMiniMax H3ビデオではテキストが文字化けするのですか?

あなたがそれを入力しなかったからだ。プロンプトに文字通り現れる文字列はきれいにレンダリングされる。一般的にジェスチャーしたもの(「HUD要素」、「いくつかのラベル」)は、文字の形をしたテクスチャとして戻ってくる。読みやすくする必要があるすべての単語を綴り、次に「綴りを間違えない、他のテキストを追加しない、字幕を追加しない」と追加する。

1つのMiniMax H3プロンプトで使用できる参照画像、ビデオ、オーディオクリップの数は?

9つの画像、3つのビデオ、3つのオーディオクリップ、合計12ファイル。参照ビデオとオーディオはそれぞれ2~15秒。オーディオを唯一の参照にすることはできない。モデルの機能と、特定のエンドポイントが公開するものは別物であることに注意。現在の入力リストについてはモデルページを確認すること。

MiniMax H3プロンプトは、クリップの開始方法だけでなく、終了方法も制御できますか?

はい、image-to-videoでは、オプションのend_imageパラメータを介して可能だ。最初のフレームと最後のフレームを与えると、クリップはそれらの間を補間する。上のデモはまさにそれだ:コミックパネル2を入力、パネル6を出力。2つの画像を同じようなアスペクト比に保つか、トランジションが醜くなる。

現在実際に取得できる長さと解像度は?

2K、そして2Kのみ。768pのジョブは現在、サポートされている解像度:2Kと拒否される。価格表には768pが表示されているにもかかわらず。長さはエンドポイントによって異なる:text-to-videoとimage-to-videoは5~10秒(デフォルト8)、reference-to-videoは5~15秒(デフォルト8)。もう一つの落とし穴:テキストのみの生成では、APIはアダプティブを拒否し、明示的な比率を必要とする。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索