Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

オープンソース化から1週間後にコピーする価値のあるMiniMax H3ワークフロー(さらに公式プロンプト52個)

MiniMax H3がオープンソース化されてから1週間後、コピーすべきワークフローはローカルでの下書き、クラウドでの仕上げです。両方の側面にわたる唯一のアセットはプロンプトであり、さらに52の公式プロンプトがあります。

MiniMaxは、H3がオープンモデルとして公開された最初の1週間のコミュニティラウンドアップを公開しました。それによると、300近い派生モデル、さまざまな量子化ビルド、ネイティブMac推論エンジン、エージェント駆動型の制作パイプラインが登場したとのことです。どれも一見の価値があります。

しかし、最も注目すべき点は、最初のセクションの終わり近くにある、あるアニメーションクリエイターが実際にどのように作業しているかを説明した一文です。公式の言葉を借りれば:

彼はRTX 3060で480pの動画を生成して反復作業を行い、ローカルハードウェアでプレビュー、選択、試行錯誤を行い、満足するバージョンができて初めてクラウドに移行し、高解像度で最終レンダリングを行い、超解像で仕上げます。

公式の記事では、この習慣に「ローカルでの下書き、クラウドでの仕上げ」という名前を付けています。

この3つの言葉は、数ヶ月にわたるモデル比較作業で私たちが繰り返し辿り着いた結論と同じものです。この記事は、それを適切に説明する試みです。なぜこの分割が有効なのか、そしてそれが有効になったときに、実際に何を保持すべきなのか。

重要なポイント

  • ローカルのMiniMax H3はついにコンシューマー向けハードウェアで動作するようになりましたが、ローカルは低解像度側です。2Kの最終出力は、より大きなレンダリングではなく、別のパスです。
  • 下書きから最終版に渡す必要がある唯一のものはプロンプトです。したがって、ワークフロー全体は、プロンプトがその旅に耐えられるかどうかに依存します。
  • 1つのMiniMax H3プロンプトをそのまま複数のモデルで同時に実行し、モデルをランク付けするのではなく、プロンプトの健全性をチェックします。
  • 制約は文字通り満たされても、ポイントを見逃す可能性があります。副作用ではなく、概念を運ぶプロパティを固定してください。
  • 保持する価値のある2つの資産は、カテゴリ化されたプロンプトライブラリと、各プロンプトの背後にある決定ロジックです。

「ローカルでの下書き、クラウドでの仕上げ」が今のところMiniMax H3でのみ機能する理由

この分割は、1つのことに依存しています。ローカル側が突然強力になったことです。

オープンソース化から1週間で、コミュニティは推論効率を急速に向上させました。ComfyUIチームは、パラメータ数の約40%を占めていた変調重みを削減し、事前計算テーブルに置き換え、INT8量子化とカスタムカーネルを追加し、最小のモデル組み合わせを123.6GBから42.5GBのメモリに削減しました。動的オフロードを追加すれば、コンシューマー向けグラフィックスカードでもローカル推論が実行できます。

別途、Redisの作成者であるantirez氏は、C言語とMetalでネイティブのApple Silicon推論エンジンをゼロから作成しました。これはsafetensorsの重みを直接読み取り、テキストエンコーダーとビジョンエンコーダー、DiT、ビジョンVAEとオーディオVAEを1つのネイティブMacプログラムにパッケージ化し、PythonやPyTorchに依存しません。

NVIDIAの研究チームは、ローンチ日から4.5時間以内に推論最適化の最初のパスを完了し、8枚のカード構成でDiffusers比3.95倍のエンドツーエンド高速化を報告しました。

これらすべてを積み重ねると、結果は明らかです。ローカル実行は可能になりましたが、レンダリングされるのは低解像度です。

したがって、クリエイターの分割は自然に続きます。低解像度は高速で安価であり、反復可能であり、これはまさに試行錯誤が求めるものです。最終的な納品は依然としてクラウドに戻ります。2つの端は代替品ではありません。1つのライン上の2つのステーションです。

MiniMax H3の2つの段階の間で実際に渡されるもの

これが私たちが本当に気にしている質問です。

ローカルで480pで20回パスを実行し、ようやく望みのルックを調整します。次に、最終版のためにクラウドに移動します。実際に持ち運べるものは何ですか?

480pのクリップではありません。解像度が低すぎます。モデルの重みではありません。クラウドには独自のものがあります。

それはプロンプトです。

ライン全体を通して、両端で効果を発揮し、変更されずに渡される必要がある唯一のものはプロンプトです。このワークフローにおいて、それが唯一の資産です。

その意味は、聞こえる以上に重要です:

  • 環境が変わったときにプロンプトが機能しなくなった場合、この階層化されたワークフローはまったく実行できません。 ローカルで調整したすべてがクラウドへの道中で無駄になります。
  • モデルごとに書き換える場合、モデルを切り替えるたびに下書き段階を繰り返すことになります。
  • 逆に言えば、プロンプトが十分に移植可能であれば、より安価なモデルで下書きすることも可能です。ただし、同じ文の読み取りが予測可能であることを前提とします。

したがって、問題は次のようになります。環境が変わっても機能するプロンプトを書くにはどうすればよいか? 私たちはこれをテストしました。

1つのMiniMax H3プロンプト、4つのモデルを同時に

過去数日間、私たちは次のような比較を12回以上実行しました。1つのプロンプトをそのまま使用し、送信パラメータのみを変更して、VFXから製品UIモーション、音楽ショートまで、さまざまなテーマで4つのモデルに送信しました。

以下は、8つのテーマで同じテストを実行したものです。各クリップは、同一のプロンプトの4分割です。左上がSeedance 2.5、右上がMiniMax H3、左下がSeedance 2.0、右下がKling v3.0proです。

武侠の決闘:1つのプロンプト、4つのモデル。音声オン。

アニメロマンスシーン、同じ4分割。

ハンドバッグのコマーシャル:同じプロンプトからの製品スポット。

ガールズグループのパフォーマンス、分割全体で同期されたオーディオ。

KNNOfby0vtw
Invalid YouTube video ID

キャラクター主導のシーン、4つのモデルを並べて比較。

カメラのコマーシャル、同じプロンプトを並列実行。

スニーカーのコマーシャル、8つのテーマの最後。

この実行が実際にテストしているもの

これはランキングではありません。これはプロンプトのための物理的なテストです。

プロンプトはそのままで、送信パラメータのみが変更されているため:

  1. 4つの間の違いは、モデル間の違いです。 これは自明に聞こえますが、この演習全体の基礎であり、4つが同じ実行環境で実行されている場合にのみ成立します。異なるソースからのいくつかのインターフェースをつなぎ合わせると、リンクレベルの変数が違いに混入し、モデルの違いとプラットフォームの違いを区別できなくなります。
  2. 4つすべてが失敗することは、モデルの問題ではなく、プロンプトの問題です。 これは下書き段階で最も価値のあるシグナルであり、単一のモデルを実行するだけでは決して得られません。1つのモデルが失敗すると、モデルを疑います。4つが失敗すると、答えは明らかです。モデルを切り替えるのではなく、その1行を修正しに戻ってください。
  3. バージョンごとに1つのことだけを変更し、残りはそのままにします。 これが「このバージョンの方が良い」という主張が成り立つ唯一の方法です。変更を分散させると、何も帰属できなくなります。複数のモデルを並列実行するということは、1つの変数変更で一度に4つの観測点が得られることを意味します。

では、ファイルに何を記録するのか

パラメータテーブルではありません。パラメータはモデルページにあり、それらをコピーしても情報は伝わりません。記録する価値があるのは、「私が書いたもの、そして私が観察したもの」です。 2つの例:

プロンプトの内容4つの実行結果
4秒 / 8秒 / 12秒で3ビート両方とも時間ドリフトが発生し、方向は逆。MiniMax H3は早めに実行され、リードが累積し、約4/6/8秒に。Seedance 2.0は遅れ、中央のビートを完全にドロップ。
「フラットなグラフィックに保ち、現実的な生き物としてレンダリングしないでください」両方とも文字通りに従い、滑らかなベクターネオンの輪郭を返す。フラット?はい。手描き?まったく違います。

最初のものの価値は方向性です。エラーの大きさだけを記録しても無駄です。次に補正するときに、間違った方向に補正することになるからです。一方は後でプッシュする必要があり、もう一方は早めにプレスする必要があります。

2つ目のものはさらに価値があり、次のセクションの主題です。

このためのスクリプトはもう必要ありません

これらの比較を実行したとき、私たちは独自のスクリプトを作成してジョブを送信し、結果をポーリングしていました。もうそんなことは必要ありません。Atlas CloudはModel Explorerをローンチしました。

1つのプロンプトを書き、最大10のモデルを選択して並列実行し、結果が並べて表示されます。

その真の価値は利便性ではなく、制御です。比較が結論に到達できた理由は、4つが1つの実行環境で実行されたからです。異なるソースからの4つのインターフェースを配線すると、プラットフォーム変数が違いに漏れ込みます。ゲートウェイの動作、デフォルトパラメータ、アセットのエンコード方法などです。いずれかを変更すると、モデルを比較しているつもりが、実際にはプラットフォームを比較していることになります。1つのモデルプール内で実行すれば、これらの変数は構造的に抑制されます。

下書き段階に直接マッピングできるいくつかの点:

  • プリセットのモデルグループ。 SOTA、トレンド、格安、そして独自の保存セット。格安グループで下書きして方向性を決め、SOTAグループで最終版に移行します。これは上記と同じ分割であり、両端がクラウド上にあるだけです。
  • 実行前のコスト見積もり。ラウンドのコストを最後まで知らずに待つことがなくなります。
  • 画像と動画の両方。画像側ではテキストから画像、画像から画像も利用可能。

Atlas Cloud Model Explorerのインターフェース。異なるAI画像モデルを比較するためのもの。

Atlas Cloud Model Explorer:1つのプロンプトから並列実行するために選択されたプリセットモデルグループ。実行前の実行あたりのコスト見積もりが表示されています。

検証可能であることと、正しい次元をロックすることは同じではない

前のセクションの「フラットに保ち、フォトリアルにしない」という行は、私たちが直面した最も典型的な罠です。

奇妙な部分は、制約が完全に満たされても、完全に失敗する可能性があるということです。フラット?はい。手描き?まったく違います。チェックリストのすべてのボックスにチェックを入れて、満点を獲得します。

問題:私たちは「フラットさ」をロックしましたが、実際に概念を運ぶプロパティは**「見える道具の跡」**です。「クレヨン、色鉛筆、粗いブラシ、ハッチング方向、不均一な塗りつぶし、粗いエッジ」に置き換えると、同じモデルが完全に反転します。

4つのモデルにわたる手描きのテーマ。「フラット」は簡単に満たせますが、「目に見えて手作りである」というプロパティが実際にロックする必要があったものです。

これは次のテストに要約されます:

あなたが書いた各制約を取り出して、次のように尋ねてください:モデルはこの文を満たしても、私が実際に欲しいものを落とすことができますか?

はいの場合、ロックは概念ではなく副作用を狙っています。

症状はおなじみです:出力はチェックリストの各項目に一致しますが、リファレンスを知っている人は一目で間違っているとわかります。

その時点での正しい動きは、もっとロックを追加することではありません。 戻って、実際に概念を運ぶプロパティを見つけることです。

「ローカルでの下書き、クラウドでの仕上げ」に戻すと、これはさらに重みを持ちます。間違った次元に向けられた制約は、下書き解像度では見えない可能性があります。 480pでは、滑らかな輪郭と粗いブラシの違いはすでにぼやけており、クラウド最終版に労力を費やした後で初めて方向性が間違っていたことに気づきます。下書きが時間を節約するかどうかは、下書き中にロックしたプロパティが本当のものだったかどうかに依存します。

コミュニティはすでにMiniMax H3プロセスをパッケージ化しています

公式の記事には、もう1つ注目に値するシグナルがあります。開発者は、制作プロセス全体を再利用可能なものにラップし始めています。

あるAIアーティストは、Mac上でClaude Codeを使用して、2台目のマシンでローカルモデルを調整しています。Macはプロジェクト設定、ファクトチェック、スクリプト、タイムライン、字幕、ストーリーボード、構造レビューを処理し、もう一方の端はモデル推論を処理します。全体は14の段階に分割されており、ブリーフからバッチレンダリング、編集アセンブリ、台帳への書き戻しまで、従来のエディタを開くことなく行われます。

別のプロジェクトは、同じアイデアをプラグインにラップし、ストーリーやビジネスブリーフからキャラクターとシーンの設定、ストーリーボードとキーフレームデザインに至るまでの組み込みスキルを備え、ショットごとにワークフローを選択します。プロンプト、入力アセット、ワークフロー、候補ショット、選択はすべてプロジェクトレコードに保持されるため、中断されたタスクは停止した場所から再開されます。

方向性は同じです。すべての人が、「この作品がどのように作られたか」を再利用可能な資産に変えており、完成したフィルムの山を残すのではありません。私たちが作成した2つのものは、まさにその線上にあります。

今すぐ入手できる2つのMiniMax H3リソース

  1. 公式MiniMax H3プロンプトライブラリ(52プロンプト、16カテゴリ、各プレビュー付き)

Plain
1https://github.com/AtlasCloudAI/awesome-minimax-h3-prompts

書き直しではなく、公式ショーケースからのオリジナルプロンプトをシナリオ別に整理し、各プロンプトに実際に生成されたプレビュー動画がペアになっているため、コピーする前に結果を確認できます。

16のカテゴリは、ブランド&シネマティック、ビジュアルクリエイティブ&パッケージング、モーショングラフィックス&VFX、AIナラティブ、プロダクト&eコマース、デジタル&ゲームクリエイティブ、インダストリアル&エンボディAI、アニメーション&スタイライゼーション、マルチマテリアルリファレンス、キャラクター/アクション/カメラリファレンス、ボイスクローニング、キャラクター&オブジェクト編集、シーン&VFX編集、オーディオ&ダイアログ編集、精密指示追従、スタイルプリセットをカバーしています。20言語をサポートし、投稿を受け付けています。

下書き中に最も時間を節約できる使用方法:自分のテーマに近いプロンプトを見つけ、そのプレビューを視聴し、それを出発点として編集すること。 空白のボックスから始めるよりはるかに速いです。

GitHubリポジトリページ。awesome-minimax-h3-promptsプロジェクトのもの。

GitHub上のawesome-minimax-h3-promptsリポジトリ。カテゴリインデックスと、プレビュー動画付きのエントリの1つを示しています。

  1. ユニバーサルビデオプロンプトスキル

Plain
1https://github.com/kiana-liang/universal-video-prompt-skill
Plain
1npx skills add kiana-liang/universal-video-prompt-skill

これは2番目のセクションの問題を解決します。プロンプトをコピーしても、その作成中に行われた判断をコピーすることはできません。 スローガンはまさにそれを言っています。プロンプトをコピーしてもコピーできない基礎となる決定ロジックがここにあります。

これが行うことは、「まず考え抜き、それをフォームに書き込む」を再利用可能な決定チェックリストに分解することです:

  • 各行の前の2つの質問: これはどのレイヤーに属するか(グローバル、ロック、またはテンポラル)、そして観察可能な形式で書かれているか?
  • 検証不可能なものを検証可能なものに変換する。 「一貫性を保つ」は、目に見える最終状態になります。「緊張」は、目の動き、呼吸、手の動きになります。
  • 方言に依存しない方法: 用語と観察可能な説明を一緒に書く。用語を知っているモデルはショートカットを取り、知らないものは説明に従い、1つのプロンプトで両方をカバーします。
  • 環境をまたいで書き直さない。 純粋な言語レイヤーは一度だけ書き、モデル固有のバイアスは別のプロファイルテーブル(3番目のセクションの種類)に記録します。

このリポジトリには、5つのショットタイプ、4つの完全に実装されたケース、6つのモデルプロファイル、4つのデモ動画が含まれています。各動画は、それが示す特定のルールにバインドされており、ショーリールではありません。

また、それが行わないことについても明確です。必須のスロットはなく、例はルールではなく、すべてのルールには例外があります。 穴埋めテンプレートを探しているなら、これは向いていません。

仕上げ側:Atlas CloudでMiniMax H3を実行する

すべてのMiniMax H3呼び出しモード(テキストから動画、画像から動画、リファレンスから動画)がAtlas Cloudでライブになり、各モデルページにパラメータ、期間オプション、リクエスト例が用意されています。

Plain
1概要           https://www.atlascloud.ai/models/minimax-h3
2テキストから動画      https://www.atlascloud.ai/models/minimax/h3/text-to-video
3画像から動画     https://www.atlascloud.ai/models/minimax/h3/image-to-video
4リファレンスから動画 https://www.atlascloud.ai/models/minimax/h3/reference-to-video
5比較ツール    https://www.atlascloud.ai/model-explorer

Atlas Cloudは、これらの主流の動画モデルを1つのプールに集約しているため、単一のAPIでモデル文字列を変更するだけで、比較全体を実行できます。これが3番目のセクションの4モデルテストの実行方法ですが、当時はまだ独自のスクリプトを書いていましたが、今はModel Explorerで数クリックです。

したがって、パイプラインは実際には次のように接続されます:

段階場所目的
下書きModel Explorer、格安プリセット、1つのプロンプトを並列で方向性を高速にテストし、モデルプロファイルテーブルを構築する
最終化同じプール、ターゲットモデルに切り替えプロンプトは変更せず、モデル文字列のみ変更
出荷API呼び出し、独自のプロダクションフローへバッチ、オーケストレーション可能

3つの段階すべてで同じプロンプトと同じキーを使用します。 途中で何も書き換えられることはなく、環境も変更されません。これが2番目のセクションのポイントです。段階をまたいで渡す必要がある唯一の資産はプロンプトなので、途中で変形させないでください。パラメータ、期間オプション、APIの例はすべてMiniMax H3モデルページにあります。

最後に

オープンソース化から1週間で、コミュニティはすでにMiniMax H3をコンシューマー向けグラフィックスカード、ネイティブMacプログラム、自動化されたプロダクションフローに適合させました。その作業が、ローカル側を真に実用的なものにしたのです。

しかし、ローカルで実行することは、ローカルで納品することではありません。「ローカルでの下書き、クラウドでの仕上げ」は良い習慣です。なぜなら、2つの端を互いに競合させないからです。 これが1つのパイプラインであり、2つのステーションが2つの仕事をしていることを受け入れています。

そして、ラインが動くためには、途中で受け渡されるピースが信頼できるものでなければなりません。そのピースがプロンプトです。 したがって、あなたの時間を費やす価値があるのは、あなたがレンダリングしたどのフィルム自体でもありません。なぜあなたがそれをそのように書いたのか、その理由です。

MiniMax H3プロンプトFAQ

ローカルGPUなしでMiniMax H3を実行するには?

すべてのMiniMax H3モード(テキストから動画、画像から動画、リファレンスから動画)は、Atlas Cloudで実行できます。各モデルページにパラメータと期間オプションがあります。コミュニティビルドがセットアップされれば、ローカル推論は安価な480p下書きに役立ちますが、高解像度の最終版は依然としてクラウドでレンダリングされます。

MiniMax H3を他の動画モデルと公平に比較するには?

1つのプロンプトをそのまま、単一の実行環境で複数のモデルにわたって実行します。Model Explorerはこれを最大10モデルまで並列で行い、ゲートウェイの動作、デフォルトパラメータ、アセットエンコーディングを一定に保つため、見える違いはモデルの違いになります。

MiniMax H3のプロンプトは他のモデルに転用できますか?

それが、適切にプロンプトを書くことの要点です。純粋な言語レイヤーを観察可能で方言に依存しないように保ち、用語と説明を組み合わせ、モデル固有のタイミングバイアスを別のプロファイルテーブルに記録します。そうすれば、プロンプトは下書きモデルから最終モデルに変更されることなく移行できます。

既製のMiniMax H3プロンプトはどこにありますか?

awesome-minimax-h3-promptsライブラリには、16カテゴリ、52の公式ショーケースプロンプトがあり、それぞれ実際のプレビュー動画が付属しており、20言語に対応しています。自分のテーマに近いものを見つけ、プレビューを視聴し、そこから編集してください。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索