MiniMax H3 Developer 提供開始 — 60%オフ、1秒あたりわずか$0.02から

Gemini Omni Flash 1.1 API:初回の本番実行前にテストすべき3つのビデオビルド

この記事では、Gemini Omni Flash 1.1 APIの最初の本番実行前にテストすべき3つのビデオビルドについて説明します。 メタタイトル:Gemini Omni Flash 1.1 API:最初の本番実行前にテストすべき3つのビデオビルド メタディスクリプション:Gemini Omni Flash 1.1 APIでビデオの作成、編集、拡張が可能です。

無音の固定カメラクリップの中で、大人が3回拍手をする。拍手のたびに変わるのは帽子だけだ。演技者、ジャケット、部屋、照明、タイミングはすべてそのまま保たれる。これこそ、開発者が gemini omni flash 1.1 api で検証している実際的な約束だ。

難しいのは、1回の動画リクエストを送ることではない。「この一点だけを変える」という指示を、適切な入力モード、十分な制約を含むプロンプト、そして反復の余地を残す予算に変換することだ。以下の3つのビルドは、その受け渡しに焦点を当てている。イベントのタイミングに合わせた帽子の編集、単一オブジェクトのマテリアル編集、テキストのみの物理シーケンスだ。

Gemini Omni 1.1 Flashは、Googleが提供する本番環境対応の動画生成アップデートだ。テキスト、画像、アップロード動画の入力をサポートし、Interactions APIは以前のインタラクションIDを通じて反復的な状態をサポートする。文書化された出力制御には、360p、720p、1080p、4Kに加え、16:9または9:16のフレーミングが含まれる(Google Gemini Omniドキュメント、2026年9月)。

重要なポイント

  • 安定したGoogleモデルID: gemini-omni-1.1-flash
  • プロンプトを書く前に入力ルートを選ぶ。
  • 参照編集のソースセグメントは10秒以下に保つ。
  • 重要なダイアログは、別のオーディオ承認タスクとして扱う。

Gemini Omni Flash 1.1 APIが注目される理由と、初回実行が失敗する理由

Omni 1.1は、生成と編集・継続の制御を組み合わせているため、注目を集めている。Googleによると、このアップデートは、シーンを10秒単位で最大40秒まで延長でき、最初と最後のフレーム間の補間、360pプレビューの作成、4Kへのアップスケールが可能だ(Google Omni 1.1発表、2026年8月)。これらの制御は、エディタ、クリエイティブSaaS、ショートフォームマーケティングツールを構築するプロダクトチームにとって重要だ。

初回の実行は、より単純な理由で失敗することが多い:

  • テキストから動画へのルートで、既存のパフォーマンスを保持するよう求められている。
  • 明確な参照や具体的な視覚的説明なしに、新しいオブジェクトを求める編集になっている。
  • 1つのプロンプトで、俳優、カメラ、衣装、設定、オブジェクトを一度に変えている。
  • 長いソースクリップが、編集をトリガーすべき正確なビートを隠している。

まず、何を不変に保つべきかを決める。帽子のケースでは、演技者、カメラ、部屋、ジャケット、影、拍手のタイミングが不変条件だ。帽子だけが変化する変数である。バブル彫刻のケースも同じ考え方で、作り手と窓からの光を固定し、1つのオブジェクトのマテリアルだけを変える。

視覚的な連続性と音声の連続性には、異なる受け入れチェックが必要だ。あるRedditユーザーは、編集後にトーキングヘッドクリップの音声と文脈が書き換えられた出力を報告している(コミュニティの報告、2026年7月)。その報告は逸話的なものだが、有用な制作上のルールを示している: ダイアログ、音楽、または法的承認が元のトラックに依存する場合は、元の音声を別途保持し、マスタリングする。映像が正しく見えるというだけの理由で、生成された視覚編集を承認してはならない。

Gemini Omni Flash 1.1 APIワークフロー: 適切な入力、モデル、コストを選ぶ

必要な情報をすでに含んでいる入力を選ぶ。Text-to-videoは、新しいシーン向けだ。Image-to-videoは、アートディレクションされた開始時のルック向けだ。Reference-to-videoは、厳密に範囲を限定した変更が必要なソースパフォーマンス向けだ。Atlas Cloudでは、チームは関連するDeveloperモデルルートを1つのブラウザタブで開き、入力モードを比較し、Atlas Cloudを通じて共通のプロトタイプワークフローを維持できる。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

      
ルート初回実行に持ち込むもの最適な用途よくある初回実行エラー記事のケース公開開始レート*
Text-to-Video Developerテキストプロンプト新しい連続シーン特定のソースパフォーマンスを再現しようとするルーブ・ゴールドバーグ$0.112/秒
Image-to-Video Developer参照画像1〜7枚定義されたルックや被写体を動かす一貫性のない参照画像を提供するオプションのバリエーション$0.112/秒
Reference-to-Video Developerソース動画1本と最大5枚の画像限定された詳細を編集しながらアクションを保持する10秒を超えるトリムを渡す帽子とバブル$0.120/秒

公開開始レートは、2026年9月1日時点のModels Allリストで確認したものだ。解像度、時間、チェックアウトの詳細は変更される可能性があるため、リリース予算を確定する前に関連するモデルページを確認してほしい。8秒の見積もりはレート×8であり、普遍的な価格保証ではない。

画像主導のバリエーションでは、Image-to-Video Developerルートが参照画像1〜7枚を受け付ける。reference-to-videoスキーマは、ソースクリップ1本と最大5枚の画像を受け付ける。トリムしたソースセグメントは10秒を超えてはならない。固定シードは、反復する価値のあるブランチを見つけた後にのみ使用する。

GoogleのSDKの便利な出力はoutput_videoだ。一方、生のRESTレスポンスでは、動画コンテンツがsteps配列の中に配置される。この違いを理解しておけば、よくある統合ミスを防げる。

plaintext
1import { GoogleGenAI } from '@google/genai';
2import fs from 'node:fs';
3
4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
5const interaction = await ai.interactions.create({
6  model: 'gemini-omni-1.1-flash',
7  input: 'A polished steel marble triggers a tabletop chain reaction.',
8  response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' }
9});
10
11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext
1{
2  "model": "gemini-omni-1.1-flash",
3  "input": "A polished steel marble triggers a tabletop chain reaction.",
4  "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" }
5}

ステップ1: Gemini Omni Flash 1.1 APIビデオ編集: 拍に合わせて帽子を変える

無音で権利処理済みの10秒のソースクリップを使用する。大人の演技者1名、固定16:9カメラ、3回のはっきりした拍手が含まれていること。ソースクリップ、その最初のフレーム、3つの明確な帽子の参照画像をアップロードする。このルートでは、Reference-to-Video Developerプレイグラウンドを使用する。

plaintext
1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.

ソースのトリムは0-10s、16:9、4Kを選ぶ。固定シードは、後で制御された再試行をするときだけ使用する。一度に1つの変数だけを変更する。帽子がずれる場合は、より強い参照を追加する前に、変更内容を簡素化する。

Gemini Omni Flash 帽子変更ケースのキーフレーム

ケース1の静止画。選択された鮮明なフレームには、3回目の拍手の後の最後の赤いキャップが写っている。演技者、部屋、カメラは安定したままだ。

Gemini Omni Flash 帽子変更のモーションケース

ケース1のモーションテスト。10秒のクリップ全体で、3回の離れた拍手が、1つの連続したスタジオショットの中でビーニー、つば広帽子、赤いキャップの状態をトリガーする。

ステップ2: Gemini Omni Flash 1.1 APIビデオ編集: 1つのオブジェクトを変形する

別の無音の10秒ソースを使用する。大人が窓のそばで小さな幾何学的な陶器の彫刻を回す。ソース動画とその最初のフレームをアップロードする。入力はシンプルに保ち、マテリアルの変形という1つのタスクに集中させる。

plaintext
1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.

ソースのトリムは0-10s、16:9、4K、そしてステップ1と同じ固定シードのワークフローを選ぶ。2秒時点の遷移と最後の1秒で、オブジェクトのエッジを確認する。これらの瞬間は、モデルが要求されたオブジェクト以上に変更したかどうかを明らかにする。

Gemini Omni Flash バブル彫刻ケースのキーフレーム

ケース2の静止画。バブルのクラスタが完全に形成されている一方で、彫刻を回すアーティストの手、作業台、窓からの光ははっきりと見える。

Gemini Omni Flash バブル彫刻のモーションケース

ケース2のモーションテスト。幾何学彫刻が要求された拍で半透明のバブルクラスタに変わり、その間カメラは日差しが差し込むスタジオを横にスライドしていく。

ステップ3: Gemini Omni Flash 1.1 API Text-to-Video: 連続した物理シーケンスをテストする

新しいシーンの場合は、テキストだけで始める。これにより、モデルのタイミング、オブジェクト間の関係、カメラの指示を切り分けて評価できる。8秒、16:9、4Kの実行には、Text-to-Video Developerモデルを使用する。シードの固定は、再訪する価値のある出力を得た後だけにする。

plaintext
1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.

1つの見栄えのするフレームではなく、実際の連鎖を検査する。マーブルが接触を逃した場合は、シーケンスを短くするか、依存関係を1つ取り除く。信頼できる5イベントの連鎖は、仕組みが読み取れない混雑したシーケンスよりも、製品デモとして強力だ。

Gemini Omni Flash ルーブ・ゴールドバーグケースのキーフレーム

ケース3の静止画。選択された終了フレームには、開いた紙の花と、完成したテーブルトップの連鎖が写っている。

Gemini Omni Flash text-to-video ルーブ・ゴールドバーグ連鎖反応GIF

ケース3のモーションテスト。マーブルがドミノを倒し始め、次にレバーとベルが作動し、最後の数秒で花が開く。カメラは単に押し込むのではなく、横に移動して各段階を映し出す。

Gemini Omni Flash 1.1 APIバリエーション: 延長、補間、安全な反復

延長と補間は、明確な最初のパスを避けるためではなく、特定の連続性の問題を解決するために使用する。Googleは、Omni 1.1で10秒単位の延長を累計40秒まで行えることと、開始/終了フレームの制御を説明している。また、自社のスループット比較では、360pのドラフトは標準の720pティアと比較して最大60%高速で、コストが3分の1になると報告している。これらはGoogleのテスト条件であり、プラットフォーム全体の速度保証ではない。

2パスの手順を採用する:

  1. その制御が実際に利用できる低解像度のドラフトで、モーションのロジックを検証する。
  2. 再試行ごとに1つの変数だけを変更する: 帽子、バブルのマテリアル、またはカメラのフレーズ1つ。
  3. アクションが正しく読めるようになって初めて、ターゲット解像度でリリース用アセットを生成する。

保存の制約を最初に書く: preserve the same performer, camera, room, and timing。次に、その1つの変形を指定する。連続ショットの場合は、one continuous shot, no cutsと明記する。最初から最後までの遷移では、大まかな文章から両方の端点を推測するようモデルに求めるのではなく、意図的な最初と最後のフレームを提供する。

Gemini Omni Flash 1.1 APIのコスト、権利、制作上のガードレール

作業の予算は、無制限の「もう一度生成」ボタンではなく、一連の判断として計画する。上記の公開開始レートでは、8秒のテキスト実行は約$0.896、8秒の参照編集は約$0.960だ。したがって、3回試行の予算は、ルーブ・ゴールドバーグケースでは約$2.688、参照編集ケースのいずれでも約$2.880となる。これは、より高い解像度のレートや異なる製品SKUが適用される前の金額だ。

内部計画では、APIの請求、製品ページのチェックアウト価格、コミュニティまたはアカウントの割り当てを分けて扱う。購入またはリリースの前に、選択したルートの現在の解像度と時間の価格を確認する。この記事は、開始レートの一覧を恒久的な4K見積もりに変えることを意図的にしていない。

アップロードする権利のある動画と参照画像のみを使用する。特定できる人物から許可を得て、プロンプトとソースの記録を保持し、視聴者がドキュメンタリー映像と誤認する可能性がある場合は、生成された素材にラベルを付ける。ダイアログ、音楽、商標、肖像は、それぞれ独自の承認プロセスでレビューする。これらのガードレールは、Gemini Omni Flash 1.1 APIプロンプトのpreserve句と同じくらい重要だ。

Gemini Omni Flash 1.1 APIに関するよくある質問

Gemini Omni Flash 1.1 APIの安定したモデルIDは何ですか?

Googleの現在の安定したモデルIDはgemini-omni-1.1-flashです。モデルのエイリアスやプレビューの利用可否は変更される可能性があるため、実装時には現在のモデルドキュメントを使用してください。

gemini-omni-flash-previewは廃止予定ですか?

プレビュー名は、別のリリーストラックとして扱ってください。本番環境に固定する前に、Googleのモデルドキュメントで現在の廃止予定の通知を確認し、必要な機能と一致する場合は安定したIDを使用してください。

Gemini Omni Flash 1.1は既存の動画を編集できますか?

はい。文書化されたワークフローでは、Files APIを通じて動画をアップロードし、編集指示を提供します。ソースセグメントは短く保ち、変更せずに維持する必要があるすべての要素を明記してください。

Gemini Omni Flash 1.1 APIの動画はどのくらいの長さにできますか?

標準の生成例は短いクリップを対象としていますが、Omni 1.1は10秒単位で累計40秒まで延長できます。現在文書化されているDeveloperルートでは、Atlasのreference-to-videoソースのトリムは10秒以下でなければなりません。

ダイアログと元のオーディオトラックを保持できますか?

視覚的な保存の指示を使用し、その後、音声を独立して検証してください。正確なダイアログや音楽が重要なクリップでは、生成された出力を自動的なオーディオマスターとして扱うのではなく、承認された元のトラックをポストプロダクションまで引き継いでください。

Gemini Omni Flash 1.1 APIのコストはいくらですか?

コストは、ルート、時間、解像度、請求対象によって異なります。Gemini Omni Flash 1.1 APIワークフローでは、秒数×現在表示されているルートレートを計算し、モーションが重要なショットには少なくとも3回の試行を確保してください。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索