Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

MiniMax H3 ASMR動画: ガラスのザクロを切って、ステレオが本物かどうかを測定した

ほとんどのAI ASMRは、無音の動画にストックサウンドを貼り付けている。MiniMax H3 ASMR動画は、32kHzステレオを1パスでレンダリングする。私はプロンプトとコストを含めて、チャンネルを測定した。

ヘッドホンを着けてから、以下のクリップにスクロールしてください。このカテゴリでは、それが実際に重要です。

ルビーのガラスで彫られたザクロにナイフが降りてきます。殻が割れ、クリスタルのようなひび割れ、そして数十個のガラスの種が濡れたスレートの上に転がり落ちます。今年あなたがスクロールして通り過ぎたほとんどすべてのAI ASMRクリップと違う点はここです:誰もその音を追加していません。サウンドライブラリも、エディターも、タイムラインもありませんでした。画像と音声は、1回の生成、1回の呼び出しで出てきました。

この1年、AI ASMRは見た目は満足感があり、音は少し違和感がある状態でした。その理由は決してビジュアルではありませんでした。パイプラインの最後のステップでした。サイレントクリップに音声を貼り付けるのは、毎回手作業で行われていました。カテゴリはそのギャップの周りで急速に成長し、その縫い合わせを自動化するためだけの専用AI ASMRジェネレーターサイトの小さな業界が現れ、そのうちの1つはホームページで「バイノーラル3Dオーディオ」を宣伝していました。需要はずっと前に証明されていました。ただ、組み立てによって提供されていただけです。

そこで、私は適切にそれを実行しました。1つの再現可能なワークフロー、6つのクリップ、そしてこのカテゴリで誰もやらない部分:ffmpegで左右のチャンネルを分離し、測定しました。予想していたことの一部が間違っていることが判明し、それがこの記事で最も有用なものになりました。

主なポイント

  • H3は、24 fpsの画像と32 kHz AACステレオトラックを同じパスでレンダリングします。音声は生成され、後から吹き込まれるわけではありません。
  • ステレオは本物のステレオであり、ステレオの衣を着たデュアルモノではありません。しかし、パンをプロンプトで指示することはできません。 ハードな左から右へのスイープを依頼したところ、1.9 dBの差しかなく、これはほとんどありません。
  • ステレオの幅はコンテンツから来ており、あなたの言葉から来るわけではありません。方向性を全く指定しなかった雨のクリップは、本当に広いフィールドで返ってきました。
  • 最初のフレームを固定することでショットは解像度間で維持されますが、768Pと2Kは依然として異なるテイクです。 ドラフトはルックとサウンドスペックをプレビューしますが、正確な振り付けはプレビューしません。
  • 5秒の768Pクリップは**$0.50かかります。同じクリップの2Kは$0.70**かかります。この記事全体のコストは$4.27でした。

まず聴いてください:MiniMax H3 ASMRビデオ、1パスでカット

w7ZRR7bo3KI

5秒、2K、24 fps、32 kHzステレオ、1回の生成、$0.70。音声オン:刃が食い込むきしみ、ひび割れ、そして種。後から追加されたものはありません。minimax/h3/image-to-videoで生成。

1つのプロンプト。1つのモデル。1回の呼び出し。以下はすべて、そのクリップがどのように作られたか、そのコスト、そしてマーケティングストーリーのどの部分が波形との接触に耐えるかです。

AI ASMRが爆発的に広まった理由、そしてそのほとんどがヘッドホンテストに失敗する理由

このトレンドには誕生日があります。AI ASMRは2025年6月、Veo 3が登場した直後に広がり始め、フォーマットは数日で大流行しました。@asmraiworksの溶岩ムクバンは1週間で1100万回以上の再生回数を獲得し、ガラスを切るクリップは11日間で530万回再生されました(Know Your Meme、2025年)。ニュースルームはそれを好奇心として取り上げ、シュールなビジュアルと箸で食べられる溶岩が大部分を占めていました(The Express Tribune、2025年)。

その後、人々はヘッドホンを着け、ムードが変わりました。TechRadarのライターは、バイラルなものの山を見て、人工的な輝きを表現し、「人間の作ったASMRの特徴であるエラーや不正確さが欠けている」と述べました(TechRadar、2025年6月)。その記事で引用されたファンは、くすぐりトリガーは技術的に存在しているが、それでも同じではないと言いました。

これには機械的な理由があり、神秘的なものではありません。ASMRは、コンテンツ音である唯一のコンテンツカテゴリです。他のどこでも音声は付け合わせです。ここでは、それが製品です。そして、支配的なワークフローは次のとおりでした:

  1. 動画モデルでサイレントクリップを生成する、
  2. サウンドライブラリからひび割れ、ザクザク、雨のベッドを探す、
  3. エディターで音を画像に合わせる、
  4. 気にするなら手動でパンとミックスする(ボリュームではほとんど誰もしない)、
  5. エクスポートする。

ステップ3で死にます。缶詰のひび割れが2フレーム遅れて発火すると、理由を説明する前に偽物として読まれます。それを毎日投稿スケジュールで掛け算すると、エラーが蓄積されます。なぜなら、アライメントは毎回人間によってやり直されるからです。

そのギャップが、AI ASMRジェネレーターサイトの小さな業界全体が存在する理由です。少なくとも3つが積極的にマーケティングを行っており、そのうちの1つはバイノーラル3Dオーディオをヘッドラインフィーチャーとして掲げています。彼らは偽の問題を解決しているのではありません。彼らは実際の穴を埋めているのです:その下にある動画モデルは音を生成しません。

そのため、1つのリーダーボードの分割を見る価値があります。Artificial Analysisの動画編集ボードで、音声ありでスコア付けされたものでは、MiniMax H3が1126 Eloで#1に位置し、Gemini Omni Flashの1119、Dreamina Seedance 2.0の1027を約100ポイントリードしています(Artificial Analysis、2026年8月)。画像から動画へのボードでは、音声がスコアの一部ではないため、これらのモデルのいくつかは互いに数ポイント以内に収まっています。音がカウントされるときにギャップが開きます。ASMRにとって、音こそがすべてです。

MiniMax H3 ASMRビデオワークフロー、および各ステップのコスト

3つのエンドポイント、1つのブラウザタブ。この記事のすべてをAtlas Cloudで実行したため、以下のすべての数字はレートカードではなく、請求書から来ています。

この記事のジョブモデルレート
ショーケースの最初のフレームOpenAI GPT Image 2 (text-to-image)$0.009/画像から記載、高品質および2048x1152で$0.1745が請求
ドラフトとキーパーMiniMax H3 Image-to-Video768Pで$0.10/秒、2Kで$0.14/秒
実際の録音を入力するMiniMax H3 Reference-to-Video同じ2つのティア
3つのテンプレートMiniMax H3 Text-to-Video同じ2つのティア
古い方法、音声半分のみByteDance Seed Audio 1.0$0.143/分

リストには、3つのH3エンドポイントすべてに「$0.1/SECから」と表示されています。それが768Pの下限です。2Kは$0.14/秒で請求され、その数字は請求書以外のどこにも表示されないため、実際にリクエストするティアに基づいて計画してください。

表1:1パス対ステッチされたパイプライン。

 MiniMax H3、ネイティブ音声サイレントモデル+ポスト音声
完成したクリップまでのステップ14~5
関係するツール1動画モデル+サウンドライブラリ+エディター+エクスポート
画像と音声の同期方法同じ生成、同じタイムライン正しく見えるまでドラッグ
ミックスとパンを行う人誰もいない、モデルが与えるものをそのまま使うあなた、手動で、音ごとに
クリップあたりの人間の時間プロンプト後はほぼゼロ15~40分、正直に言って
5秒クリップあたりの計算コスト768Pで$0.50動画モデル+$0.143/分の音声生成

私は競合の動画プラットフォームの秒あたりのレートを意図的に引用していません。なぜなら、計算コストが違いの本拠地ではないからです。音声生成は1分あたり$0.143で、わずかな金額です。ステッチされたパイプラインの実際のコストは、クリップあたり20分の人間の注意であり、そのコストはスケールしても下がりません。むしろ倍増します。毎日投稿する顔のないアカウントは、まさにクリップあたり20分が静かにビジネスモデル全体を食いつぶす場所です。

正直なカウンターウェイト:手動ステッチはコントロールを買います。音をステレオフィールドのどこにでも配置し、フレームにトリミングできます。H3は同期を無料で提供しますが、以下の測定が示すように、そのコントロールは返してくれません。

表2:3つのH3エンドポイント、実際に重要なパラメータ。

 image-to-videotext-to-videoreference-to-video
主な入力画像(最初のフレーム)プロンプトのみrefers[]
解像度768P / 2K、デフォルト2K同じ同じ
長さ4~15の任意の整数秒、デフォルト8同じ同じ
比率最初のフレームによって決まる明示的に設定する必要があり、adaptiveは拒否される参照によって決まる
refersの制限画像と一緒に使用しない使用しない最大9画像、3動画、3音声
配信される16:9出力768Pで1344x768、2Kで2560x1440同じ同じ
オーディオトラックAACステレオ32 kHz、24 fps動画上同じ同じ

手に書き留めておく価値のある2つのパラメータの罠。パラメータはratioと呼ばれ、aspect_ratioではありません。間違ったキーはそれを未設定のままにし、text-to-videoがリクエストを拒否します。また、同じ呼び出しでimagerefersを一緒に使ってもエラーにはなりません。完了し、全額請求され、静かに2つの入力のうちの1つを捨てます。

MiniMax H3 ASMRビデオチュートリアル:ガラスのザクロを切る

ガラスの果物を切るフォーマットは誰もが認識するものなので、読者は自分が何を見ているかをすぐに理解できます。ただし、ガラスのリンゴやガラスのマンゴーは飽きるほど使われています。しかし、ザクロは1つの特定の理由でより優れています:殻が割れるとき、何百ものガラスの種がこぼれ出て転がるため、音に持続時間と構造があり、1つの中心的な衝撃ではありません。モデルが音声を偽造している場合、散乱がそれを示す場所です。

ステップ1:GPT Image 2でベースフレームを作成する

動画にお金を使う前に構図を固定します。設定:quality: highsize: 2048x1152(16:9)、output_format: png

plaintext
1厚い半透明のルビーレッドガラスから完全に彫られたザクロ全体の極端なクローズアップマクロ写真、濡れた黒いスレートのスラブの上に置かれている。ガラスの殻は厚さ8mmで、内部に気泡と欠けたファセットが見える;何百もの小さなガラスの種がガーネットの結晶のように内部で輝いている。磨かれた日本の三徳包丁がフレームの左端にあり、刃先がガラスの皮に触れている。右上からの1つのハードキーライトがスラブを横切って当たり、濡れた石の上に鋭い赤いコースティックを投げかけている。100mmマクロ、f/2.8、浅い被写界深度、暗くムーディーな背景。
2手、テキスト、透かし、ロゴはなし。

テキストプロンプトと生成画像を示すAI画像生成インターフェース

Atlas Cloud上のGPT Image 2プレイグラウンド、品質を高、サイズを16:9 2048x1152に設定、OUTPUTパネルにレンダリングされたガラスのザクロ

実際の実行。品質 high 、2048x1152、ページには$0.1745と表示され、それが後で請求書にも表示されました。

暗い石の上で半透明の赤いガラスのザクロを切るナイフの刃

生成されたベースフレーム:厚いルビーガラスから彫られたザクロが濡れた黒いスレートの上にあり、左端から三徳包丁が入る

H3に渡されたフレーム。openai/gpt-image-2/text-to-imageで生成。

ステップ2:MiniMax H3 ASMRビデオプロンプトの音声部分を書く

ほとんどの人は、ASMRプロンプトを「ASMR」という言葉を前に付けた画像説明として書き、モデルがローファイピアノでスコアする理由を不思議に思います。H3は、あなたが何かを与えれば、音声の指示を真剣に受け取ります。音声の部分を5つのスロットで構成します:

  1. 素材。 音を出しているもの。ガラス、ワックス、溶岩、ガラス上の水。厚さと濡れ具合を具体的に指定すると、音色が変わります。
  2. アクションとその時間的な形状。 「切る」だけでなく、「1回のゆっくりとした連続したストロークで押し下げる」。モデルはこれを使ってイベントを配置します。
  3. マイクの視点。close-micintimate、録音距離の手がかり。これにより、音がどれだけドライで近く感じられるかが設定され、よく機能します。
  4. 擬音語のシーケンス。 音のイベントを順番に書き出す:きしみ、次にひび割れ、次に数十の小さな衝撃、そして沈黙。このスロットが最も効果を発揮します。
  5. 否定語。no music, no voice, no narration, no room reverb, no ambience bed。これらがないと、H3は親切にスコアを追加します。なぜなら、トレーニングデータのほとんどの動画に音楽が含まれているからです。

また、スロット4にチャンネル方向を書き、ひび割れを左チャンネル、種を左から右に転がすように依頼しました。それが実際に何を生成したかについては、読み進めてください。

ステップ3:768Pドラフトを実行する

768Pでドラフトします。オーディオトラックは両方のティアで同じ仕様なので、ASMRでは聴覚的な判断であるクリエイティブな判断全体を安いレートで行うことができます。

minimax/h3/image-to-videoの設定:image = ステップ1の出力、resolution: 768Pduration: 5。比率は最初のフレームから決まるので、そのままにします。

plaintext
1三徳包丁が左から入り、1回のゆっくりとした連続したストロークでガラスのザクロを押し下げ、フレームを左から右に移動する。殻は明るいクリスタルのひび割れで割れ、小さなガラスの種のスプレーが濡れたスレートの上にこぼれ落ち、右端に向かって散乱する。カメラ固定、マクロ、ワンテイク、カットなし。
2
3オーディオ:ASMR、クローズマイク、親密、音楽なし、声なし、ナレーションなし、部屋の残響なし。
4刃が食い込むときの乾いた持続的なガラスのきしみ、次に左チャンネルにパンされた1つの鋭い高いひび割れ、続いて左チャンネルから右チャンネルへ転がる数十の小さなチリンチリンという種の衝撃音。最後に、かすかな刃と石のこすれる音、そして沈黙。アンビエンスベッド、ハム、バックグラウンドミュージックなし。

ガラスのザクロのビデオを示すAI動画生成インターフェース

Atlas Cloud上のMiniMax H3 image-to-videoプレイグラウンド、ベースフレームがロードされ、duration 5、OUTPUTパネルに完成したクリップ

image-to-videoの実行:最初のフレームがロードされ、duration 5、OUTPUTが完了。Resolutionセレクトがページデフォルトの2Kのままであることに注意。ドラフトの場合は768Pに切り替えます。以下のクリップはその解像度でレンダリングされました。

xkolGEKI7UI

768Pドラフト、$0.50。ヒーロークリップよりも柔らかい画像、同じオーディオ仕様。これがすべての決定が行われるテイクです。

ステップ4:ステレオを信頼する前に測定する

私の音の言葉をそのまま信じないでください。モデルの言葉も信じないでください。チャンネルを分離して見てください。これはローカルのffmpegで、API呼び出しもコストもありません:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

2つのASMRオーディオクリップにおけるステレオチャンネル分離の波形比較

ガラスのザクロのクリップと雨のクリップの4パネル波形分析。各クリップの左チャンネルと右チャンネル、およびその下のサイドチャンネル(左マイナス右)を同じゲインで表示

2つのクリップの左チャンネルと右チャンネル、およびその下のサイドチャンネル(左マイナス右)を同じゲインで表示。これが1つの画像にすべての議論です。

以下が返ってきたもので、その一部は予想と異なっていました。

ステレオは本物です。 私が生成したどのクリップでも、サイドチャンネルは空ではありません。ステレオのふりをしたデュアルモノファイルは、ここには何も表示されません。これにはコンテンツがあります。

しかし、パンをプロンプトで指示することはできません。 私は、大文字で、ひび割れを左チャンネルに、種を左から右に転がすように依頼しました。測定結果:チャンネル相関0.97、サイドチャンネルはミッドの17.7 dB下、任意の1/4秒ウィンドウでの最大の左右のレベル差は1.9 dB。それはパンではありません。それは、少し自然な幅を持つ中央寄りのイメージです。ナイフはフレームを横切って移動しますが、音はそのままです。

幅はコンテンツから来ており、あなたの言葉から来るわけではありません。 次のセクションの雨のクリップは、方向性を全く指定しなかったにもかかわらず、相関0.32、サイドチャンネルはミッドのわずか2.9 dB下で返ってきました。それは本当に広く、無相関のフィールドです。拡散したアンビエンスは自動的に幅を取得します。離散的な衝撃は、あなたが何を書いても中央付近に留まります。

したがって、このモデルに対する正直な主張は空間的なものではありません。それは時間的なものです。画像と一緒に生成され、それが属するフレームに着地する音を、無料で、永遠に、エディターなしで得ることができます。あなたのフォーマットが本当にハードパンを必要とする場合、あなたはまだポストでそれを自分で行う必要があり、チャンネル名をプロンプトに書くのをやめるべきです。なぜなら、それらは何もしていないからです。

次に、キーパーを再実行します:同じエンドポイント、同じ最初のフレーム、同じプロンプト、1つのフィールドをresolution: 2Kに変更します。ドラフトがプレビューであると仮定する前に知っておくべきもう1つのことがあります。

ガラスのザクロを切る2つのビデオ解像度の比較

同じタイムスタンプでの768Pと2Kの実行の5フレームの2行比較。フレーム0で同一で、約2.5秒から分岐

同じ最初のフレーム、同じプロンプト、両方のティア。フレーム0は完全に一致します。2.5秒までに、殻の割れ方が異なり、2つのクリップは異なるテイクになります。

最初のフレームを固定することで、構図、フレーミング、照明、色が両方のティアで保持されます。そのため、この目的には常にtext-to-videoではなくimage-to-videoを使用する必要があります。しかし、同じテイクが得られるわけではありません。2Kの実行はアクションを再ロールします。ドラフトはルックとサウンドのプレビューとして扱い、正確な振り付けのプレビューとしては扱わないでください。

ステップ5:MiniMax H3 ASMRビデオリファレンスとして実際の録音を追加する

実際に欲しい音がある場合は、それを渡します。reference-to-videoは最大9つの画像、3つの動画、3つのオーディオクリップを受け取り、音色と部屋のキャラクターをプロンプトから発明する代わりに、オーディオリファレンスから引き出します。私はWikimedia CommonsからのGravity Soundによるパブリックドメインに優しいガラス割れの録音(CC BY 4.0)を使用しました。3つのテイクを連結して4.5秒にしました。

3つのルール。最後の2つは、リクエストが拒否されたことで苦労して見つけました:

  • オーディオだけではダメです。 エンドポイントは明示しています:少なくとも1つの画像または動画が必要であり、オーディオだけでは許可されません。フレームとペアにしてください。
  • オーディオリファレンスは2~15秒でなければなりません。 最初の試行では1.49秒のクリップを使用し、audio duration 1486 ms, expected [2000, 15000] msと返ってきました。その範囲はモデルページにはありません。
  • ファイル形式がチェックされます。audio/mpegとして宣言されたbase64ペイロードは、audio format ".mpeg" not allowedで拒否されました。.wavペイロードは通過しました。拒否されたリクエストは請求されませんが、ラウンドトリップのコストがかかります。

設定:refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}]resolution: 768Pduration: 5

plaintext
1同じロックされたマクロショット:刃が左から右にガラスのザクロをスライスし、種が散乱する。リファレンスオーディオの音色、明るさ、部屋のキャラクター、同じ録音距離、同じドライさに合わせる。ASMRクローズマイク、音楽なし、声なし。

プロンプト入力と生成されたザクロのビデオを示すAI動画生成インターフェース

Atlas Cloud上のMiniMax H3 reference-to-videoプレイグラウンド、2つのリファレンス素材がロードされている。スロット1にオーディオファイル、スロット2にベースフレーム

リファレンスマテリアルにオーディオファイルと画像が一緒に含まれている。9個中2個使用。画像をドロップすると、リクエストはまったく実行されません。

mY1VrOfM3cM

リファレンスガイドのテイク、$0.50。同じショット、音色は実際の録音によって導かれ、プロンプトから発明されたものではない。オーディオリファレンス:Glass breaking by Gravity Sound、CC BY 4.0。

3つのMiniMax H3 ASMRビデオテンプレート:カット、咀嚼、雨

3つのフォーマットが、このカテゴリで最もパフォーマンスを発揮するもののほとんどをカバーしています。それぞれ、設定と生成されたクリップを含む、完全なコピー&ペースト可能なプロンプトです。以下には意図的にガラス、赤、スレートはありません。アカウントのすべてのクリップが同じに見える場合、アルゴリズムはそれらを同じクリップとして扱います。

表3:同じ5つのスロット、3つの異なるジョブ。

スロットテンプレート1、カットテンプレート2、咀嚼テンプレート3、雨
素材滴るハチミツ、熱い鋼の刃光る溶岩、石のボウル車の窓ガラス上の雨
アクションの形状刃が前から後ろに沈み、ハチミツが下に引っ張られる箸で持ち上げ、その後2回噛む被写体のアクションなし、水滴のみ
マイクの視点クローズマイク、非常にドライ、部屋なし非常に近い、親密ガラスの外側、車内でこもった
音のシーケンスワックスのひび割れ、ハチミツの伸び、皿に滴る溶岩のシューッという音、湿った咀嚼、ガラスのようなザクザク、息安定した雨のベッド、水滴の衝突、遠くのタイヤのヒス
否定語音楽なし、声なし、部屋の残響なし言葉なし、音楽なし、ナレーションなし音楽なし、雷なし、声なし、ワイパーなし

テンプレート1、カット。 ハチミツ、琥珀とゴールド、9:16、768P、6秒、ratio: "9:16"

plaintext
1極端なマクロ、ロックされたオーバーヘッドショット。淡いセラミックの皿の上の厚い金色のハチミツの塊、ハチミツはすでにその周りに溜まっている。熱い鋼の刃がワックスに降り、1回のゆっくりとした連続したプレスで前から後ろに沈む。切断面はたわみ、ハチミツの重い糸が伸びて皿に滴る。左からの暖かい琥珀色のキーライト、浅い被写界深度、ワンテイク、カットなし、フレーム内に手なし。
2
3オーディオ:ASMR、クローズマイク、非常にドライ、部屋の残響なし、音楽なし、声なし、ナレーションなし。刃の下でワックスが割れる柔らかいパチパチ音、次にハチミツが伸びる厚く低い引っ張り音、その後セラミックの皿に着地する2つの重い湿った滴り。他には何もない。

ZsVmf9AhPnw

テンプレート1、$0.60。ワックスのひび割れ、ハチミツの伸び、滴り。minimax/h3/text-to-videoで生成。

テンプレート2、咀嚼。 溶岩ムクバン、1週間で1100万回再生されたフォーマット、9:16、768P、8秒、ratio: "9:16"

plaintext
1縦型クローズアップ:黒い漆の箸が、暗い石のボウルから光るオレンジ色の溶岩の塊を持ち上げ、カメラに向かって運び、フレームの下部から外へ出る。溶岩は自発光し、その周りのすべてにオレンジ色の光を投げかけている。部屋の残りはほぼ真っ黒。表面から蒸気が立ち上る。カメラ固定、ワンテイク、カットなし。
2
3オーディオ:ASMR、非常に近いマイク、親密、言葉なし、音楽なし、ナレーションなし、部屋のトーンなし。溶岩が持ち上げられるときの低い溶けるシューッという音と泡立ち、次に柔らかい湿った咀嚼、次に2回目の噛みでのより明るいガラスのようなザクザク音、そしてゆっくりとした満足した息。言葉なし。

UJhEsTnKkZI

テンプレート2、$0.80。シューッ、咀嚼、ザクザク、息、そして一言もなし。minimax/h3/text-to-videoで生成。

テンプレート3、雨。 夜の車の窓、冷たい青とネオン、16:9、768P、10秒、ratio: "16:9"

これは、被写体のアクションがない3つのうちの唯一のものであり、否定語について最も教えてくれます。画面上で何も起こっていない場合、H3はあなたが明示的に禁止しない限り、音楽ベッドに手を伸ばします。また、これは、要求されずに、はるかに最も広いステレオフィールドで返ってきたクリップでもあります。睡眠向けコンテンツは長さを求めるため、これは有用な長さの範囲の上限近くで動作します。

plaintext
1夜の車の窓の内側を通したマクロショット、外側のガラスを激しい雨が流れている。個々の水滴が当たり、ためらい、そして下に筋を描き、合体する。ガラスの向こう側、焦点の合っていないネオンサインが冷たい青とマゼンタのボケに崩れる。ワイパーなし、人なし、車内の動きなし。カメラ固定、1回の連続テイク、浅い被写界深度、カットなし。
2
3オーディオ:ASMR、ガラスの外側にクローズマイク、車内で少しこもった。明確に分離された個々の水滴のガラスへの衝突音を持つ安定した均一な雨のベッド、加えて濡れた道路でのタイヤのかすかな遠くのヒス音。音楽なし、雷なし、声なし、ナレーションなし、ワイパー音なし。

bUKr5V6wbdM

テンプレート3、$1.00。純粋なアンビエンスの10秒、プロンプトが禁止したためサウンドトラックなし。minimax/h3/text-to-videoで生成。

MiniMax H3 ASMRビデオの実際のコスト

以下は、この記事のレシートであり、推定ではありません。

ラインアイテム請求額
GPT Image 2ベースフレーム、高品質、2048x11521$0.17
2Kキーパー、5秒、image-to-video1$0.70
768Pドラフト、5秒、image-to-video1$0.50
768P reference-to-video、5秒1$0.50
768Pのテンプレートクリップ、6秒+8秒+10秒3$2.40
拒否されたリファレンスリクエスト2$0.00
合計 $4.27

6つの公開可能なクリップと1つのベースフレーム。スケジュールに拡大する:768Pで1日1つの8秒の縦型クリップは$0.80なので、エディターで1分も費やす前に、毎日投稿する顔のないアカウントで月額約**$24**になります。

2つの請求に関する注意事項。GPT Image 2の表示価格$0.009はトークンティアの下限です。高品質の2048x1152レンダリングは$0.1745になり、そのほぼ20倍です。したがって、実際に使用するティアから予算を立ててください。また、H3のpriceフィールドは遅れてバックフィルされます。statuscompletedになるまでポーリングし、その時点ではまだundefinedであることがよくあります。実際の数字を得るには、しばらくしてから予測IDを再度ポーリングしてください。この2回目のポーリングが、推測ではなくこのようなレシートを作成する唯一の方法です。

ASMRオーディオと権利に関する正直な注意

他人のASMR録音をrefersオーディオファイルとしてアップロードしないでください。リファレンスは確かに出力に音色を移行させ、録音をモデルに通しても、その所有権は変わりません。ここで使用したリファレンスはCC BY 4.0であり、上記でクレジットされています。調達には約2分かかりました。

認識可能な実在の人物の声の周りにASMRを構築しないでください。この記事のすべてのテンプレートは意図的に声なしであり、これはジャンルの慣習であり、最も複雑でないパスでもあります。

APIを介してH3を呼び出すことは、オープンウェイトに付属するコミュニティライセンスの影響を受けません。そのライセンスはセルフホスティングをカバーし、現在EU、英国、韓国、米国を除外しており、これらの地域向けに正式なライセンスチャネルが開かれています。知っておく価値はありますが、エンドポイントを叩いているのであれば心配する必要はありません。

MiniMax H3 ASMRビデオ:よくある質問

MiniMax H3 ASMRビデオは独自の音を生成しますか、それとも後で追加しますか?

モデルが生成します。画像と音声は同じパスから出力されます:配信ファイルには24 fpsの動画と32 kHzのAACステレオトラックが含まれます。別のオーディオステップ、サウンドライブラリ、アライメント作業はなく、それがこのエンドポイントがASMRにとって特に興味深い理由のすべてです。

MiniMax H3 ASMRビデオを左から右にパンするようにできますか?

頼んでもできません。私は明示的なチャンネル方向をプロンプトに書き、結果を測定しました:チャンネル間の相関0.97、任意の1/4秒ウィンドウでの最大レベル差1.9 dB。これはまったくパンではありません。トラックは確かにステレオであり、雨のような拡散コンテンツは広いフィールドで返ってきますが、離散的な衝撃は言葉に関係なく中央に留まります。あなたのフォーマットがハードパンを必要とする場合、ポストで行ってください。

自分の録音をMiniMax H3 ASMRビデオリファレンスとしてアップロードできますか?

はい、reference-to-videoを通じて可能です。最大3つのオーディオリファレンスを、最大9つの画像と3つの動画と一緒に受け入れます。オーディオは単独では送信できないため、少なくとも1つの画像または動画とペアにしてください。また、オーディオは2秒から15秒の間である必要があり、フォーマットが検証されます:audio/mpegペイロードは拒否されましたが、.wavペイロードは機能しました。拒否されたリクエストは請求されません。

768P MiniMax H3 ASMRビデオの音声は2Kよりも劣りますか?

いいえ。両方のティアは同じAACステレオ32 kHz仕様を提供します。画像のみが変更され、それは大きく変わります:16:9は768Pで1344x768、2Kで2560x1440になります。ASMRのクリエイティブな判断は聴覚的な判断であるため、$0.10/秒でドラフトし、$0.14/秒でキーパーを再実行します。ただし、2Kの実行は新しいテイクであり、ドラフトのアップスケールではないことを覚えておいてください。

MiniMax H3 ASMRビデオの長さとアスペクト比はどうすればよいですか?

長さは4から15の任意の整数秒を受け入れます。カットや咀嚼のクリップは5~8秒で機能します。なぜなら、ペイオフは1つのイベントだからです。睡眠向けのアンビエンスは10秒以上を望みます。Shorts、Reels、TikTokの場合は9:16を使用し、text-to-videoではratioを明示的に設定する必要があり、adaptiveは拒否されることを覚えておいてください。image-to-videoでは、最初のフレームが形状を決定します。

1つのMiniMax H3 ASMRビデオのコストはいくらですか?

5秒のクリップは、768Pで$0.50、2Kで$0.70かかります。768Pの8秒の縦型クリップは$0.80です。それを1日1つ投稿すると、計算コストは月額約$24であり、これはステッチワークフローでクリップあたり20分かかるエディターと比較する価値のある数字です。

依頼していないのに、なぜMiniMax H3 ASMRビデオにバックグラウンドミュージックが入ってくるのですか?

それを禁止しなかったからです。モデルのトレーニングデータにあるほとんどの動画には音楽ベッドがあるため、特に画面上で何も起こっていない場合、デフォルトの動作は音楽を追加することです。プロンプトのオーディオ部分に否定語を明示的に入れてください:no music, no voice, no narration, no room reverb, no ambience bed。アンビエントテンプレートは、アクションのあるものよりもこれを必要とします。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索