
Grok Imagine Video は、開発者が xAI の動画ファミリーにアクセスし、クリップの作成、アニメーション化、拡張、編集を行えるようにします。プロンプトから 1~15 秒の動画を生成し、最大 7 枚の参照画像を使って人物、オブジェクト、スタイルを指定できます。また、480p または 720p で利用できます。Atlas Cloud は、透明性の高い従量課金制の料金体系と OpenAI 互換エンドポイントを通じて、これらの機能を一つにまとめます。今すぐ開発を始めましょう。
Grok Imagine Video は xAI が開発したモデルです。Atlas Cloud(運営:Atlas Cloud AI LLC)は本モデルへのアクセスを提供するものであり、その所有者ではありません。すべての商標は各所有者に帰属します。
ソースアセット、希望する変換内容、制作ワークフローに合ったGrok Imagine Videoエンドポイントを選択してください。
| モダリティ | 説明 |
|---|---|
| Grok Imagine Video T2V API (Text To Video) | 自然言語のプロンプトから、480pまたは720pで1~15秒の動画を生成します。ソースメディアを使わずにコンセプトの可視化やソーシャル向けクリップ、シーンを作成する用途に適しています。 |
| Grok Imagine Video I2V API (Image To Video) | 画像を入力すると、自然言語によるモーションプロンプトを適用し、480pまたは720pの動画を生成します。アートワーク、商品画像、キャラクターフレーム、キャンペーン用ビジュアルのアニメーション化に利用できます。 |
| Grok Imagine Video R2V API (Reference To Video) | 人物、オブジェクト、ビジュアルスタイルを表す1~7枚の参照画像で動画生成をガイドします。最大10秒、480pまたは720pの出力に対応し、参照画像に基づくクリエイティブ制作をサポートします。 |
| Grok Imagine Video Extend API (Video Extension) | 既存の2~15秒のMP4にプロンプトで指示した2~10秒の拡張を追加します。出力は入力形式に一致し、最大720pに制限されるため、完成済みのショットを延長する用途に適しています。 |
| Grok Imagine Video Edit API (Video Editing) | MP4と自然言語の指示を入力し、元の再生時間を維持したまま映像内容を変更します。出力は最大8.7秒に制限されており、短い映像のピンポイントな修正やプロンプトベースの変換に適しています。 |
Grok Imagine Videoは、テキスト、開始フレーム、最大7枚の参照画像から短いクリップを生成し、Atlas Cloudの統合従量課金APIを通じて既存のMP4映像を延長・編集できます。
自然言語のプロンプトを入力し、480pまたは720pで1〜15秒のクリップを生成します。16:9、1:1、9:16を含む7種類のアスペクト比に対応し、用途に合ったキャンバスに各ショットを収められます。被写体、アクション、カメラワーク、雰囲気をプロンプトで直接指定できます。ストーリー展開、キャンペーンのコンセプト、ソーシャル動画の柔軟な出発点として活用できます。
用意した開始フレーム画像から、480pまたは720pで1〜15秒の動画を生成します。画像が冒頭の構図を決め、自然言語のモーションプロンプトで動きやシーンの展開を指示します。異なる出力形状が必要な場合は、7種類のアスペクト比から選択できます。オープニングフレームを作り直さずに動きを加えたい商品ショット、イラスト調のシーン、アートディレクション重視のコンセプトに適したワークフローです。
人物、物体、ビジュアルスタイルを表す1〜7枚の参照画像で動画を誘導します。プロンプト内で個々の入力を指定し、7種類の対応アスペクト比にわたって480pまたは720p、最大10秒の動画を生成できます。参照画像は単なる開始フレームとしてではなくシーン全体の形成に使われるため、繰り返し登場するビジュアル要素をより細かく制御できます。キャラクター中心のシーン、商品のストーリーテリング、スタイルを重視したキャンペーンに活用できます。
既存の2〜15秒のMP4に、プロンプトで指示する2〜10秒の延長部分を追加します。Grok Imagine Videoは最終フレームから続きを生成し、最大720pまで入力解像度に合わせて、元のクリップと新しいセグメントをまとめて返します。次のアクション、演出、カメラワークを自然な言葉で説明できます。唐突な終わり方の映像も、まとまりのあるストーリー展開へと仕上げやすくなります。
MP4と自然言語の指示をGrok Imagine Videoに渡し、元の長さを維持したまま映像を変換します。入力は最大8.7秒まで対応し、料金は入力動画の長さに基づいて計算されます。クリップを一から作り直すことなく、映像の変更、雰囲気の転換、シーン単位の修正を指示できます。短いクリエイティブ案の作成や、生成後の調整を細かく制御したい場合に適しています。
テキストから動画、画像から動画、参照画像による生成、延長、編集を、1つの統合APIで切り替えて利用できます。利用可能なソース素材に合ったendpointを選び、非同期のpredictionフローで各ジョブを送信します。ワークフロー全体で認証と統合パターンを統一できます。従量課金で利用できるため、実験から再現性のある本番パイプラインまで柔軟に対応できます。開発者は統合作業の負担を抑えながら、より幅広い動画ツールを構築できます。
Grok Imagine Videoと2つの有力な代替モデルが、同一のプロンプトを動き、連続性、カメラ制御、ライティング、映像ストーリーテリングの観点からどのように解釈するかをご覧ください。
土砂降りの暴風雨が過ぎ去った直後、エメラルド色の峡谷を舞台にした、8〜10秒の超写実的なアウトドア・アドベンチャー映画。コバルトブルーの防水スーツとオレンジレッドのライフベストを身につけたカヤッカーが、最初のフレームから最後のフレームまで激しい急流を突き進む。パドルのブレードが流れに切り込み、鮮明な水しぶきがレンズを横切る中、カヤックの横を猛スピードで追走する超低水面のトラッキングショットで始める。カヤックは急な波頭を駆け上がって宙に放り出される。ウィップパンでカヤッカーの一人称POVへ移行し、倒木の下でボートが横向きにロールし、半透明の水のカーテンを突き抜け、濡れてぎざぎざした岩を間一髪でかわす。水しぶきや一時的な遮蔽の中でも、手、パドル、コバルト色の船首は物理的に一貫した状態を保つ。カヤッカーはパドルを流れに押し当て、峡谷の壁を使ってタイトなリバウンドターンで方向を切り替え、再び激流へ落下する。クライマックスでは、崖の頂上から急降下するドローンショットへ移行し、着水中のカヤッカーを高速で下降しながら旋回撮影する。船首が浮かぶ木箱に説得力のある衝撃でぶつかり、木箱を破壊する――そして突然の遊び心ある演出として、完全な状態のカラフルな紙提灯がつながったひもが中から飛び出し、ほどけて、冷たく流れる水面を暖かく照らしながら揺れ動く。その間もカヤックは前進を続ける。連続した解剖学的に正確な動き、リアルなカヤックの慣性、パドルの抵抗、衝突、乱流の流体力学、布の動き、水滴、レンズへの水しぶき、あらゆる遮蔽後も揺るがない被写体の同一性。スローモーション、空虚なエスタブリッシングショット、画面、インターフェース、ダッシュボード、プログレスバー、グラフ、キャプション、ロゴ、説明テキストへのカットは禁止。曇天の冷たいシアン系の昼光、雨で暗く濡れたエメラルド色の岩壁、鮮やかなオレンジレッドのライフベスト、暖かく多彩な提灯の光。速度を強調する映画的なワイドスクリーンの斜め構図、高コントラスト、自然なモーションブラー、没入感のあるフォトリアルなアクションスポーツ撮影。同期音声:轟音を立てる急流、鋭いパドルの衝撃音、木が割れる音、息を切らす呼吸音、船体に水がぶつかる音、そして提灯が飛び出す瞬間の明るくパーカッシブな音楽アクセント。16:9アスペクト比。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
土砂降りの雨が降り始める直前の屋外ナイトマーケットを舞台にした、8〜10秒の連続アクションによる映画的なシーケンス。目隠しをしたラーメン職人が、両手の間で銀白色の麺の帯を伸ばし続けながら、混雑した屋台の迷路を自信満々に駆け抜ける。完全に垂直な鳥瞰図から始め、上空からネオンに照らされた市場の迷路へ急速に降下する。最初の大粒の雨がひさしと濡れた舗道を打つ。宙を舞う麺の帯にロックオンし、輝く炭火の炉、驚く客、 sizzlingなグリル、風にあおられて開く傘のすぐ横を数センチの距離で追走する。途切れのない人間の動き、説得力のある伸縮性のある麺の物理挙動、複雑な前景の遮蔽、跳ねる雨、火花、濃密な蒸気を維持する。ウィップパンで、職人が歩みを止めずに低い木箱を飛び越える姿へ移行し、続いて職人が身体をひねり、正確な運動量で麺を後方へ放つ様子を、素早い360度オービットで撮影する。麺の帯はきれいな弧を描き、背後で激しく沸騰する銅鍋へ入る――勝利の瞬間、いたずら好きなオレンジ色のトラ猫が屋台の下から飛び出し、垂れ下がった麺の半分を口でくわえて走り去る。職人は気づかないまま走り続け、鮮明な視覚的オチを生み出す。ネオンノワール調のフォトリアリズム、雨で濡れた地面に広がるシアングリーンとマゼンタの反射、リズミカルな視覚アクセントとなる暖かな炉のオレンジ色の炎、触感の伝わる蒸気と雨、安定した振り付け、鮮明な映画的ディテール、エネルギッシュなリアルタイムのテンポ。スローモーション、空間やキャラクターの連続性を壊すカットは禁止。音声:高まる雷鳴、市場の話し声、力強い足音、傘が開く音、炭火が sizzlingする音、沸騰する湯の音、カメラの動きと同期する麺の風切り音。最後は明るくコミカルな猫の鳴き声と銅鍋に水が跳ねる音で締める。画面、ユーザーインターフェース、ダッシュボード、プログレスバー、グラフ、キャプション、字幕、ロゴ、ウォーターマーク、説明テキストは禁止。16:9アスペクト比。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video は、プロンプト、静止画、参照画像、既存の MP4 ファイルを、ソーシャル向けクリップ、プロダクトビジュアル、ブランドストーリー、長尺シーケンス、目的に応じた編集、クリエイターツールへとつなげる実用的な制作手段に変換します。
Grok Imagine Video は、自然言語のプロンプトを短い 480p または 720p のクリップに変換します。事前に素材映像を用意しなくても、ソーシャル向けティザー、キャンペーン案、迅速なビジュアル草稿を作成できます。
プロダクト画像を起点に、image to video エンドポイントがプロンプトで指定した動きを 480p または 720p で追加します。ブランドはカタログの静止画を、プロダクトの登場演出、ローンチ用アセット、マーケットプレイス向けビジュアルへと展開できます。
1〜7枚の画像を使って、reference to video は人、オブジェクト、スタイルを新しいクリップへと導きます。クリエイティブチームは、提供されたビジュアルを土台に、ブランドストーリー、キャラクター案、プロダクトシーンを開発できます。
既存の MP4 に、2〜10秒のプロンプト駆動型拡張を追加し、入力解像度を 720p まで維持します。承認済みの映像から、長尺ストーリーボードのビート、エピソード間のトランジション、後続シーケンスを作成できます。
自然言語の指示で MP4 を編集し、元の再生時間を維持しながら、出力を最大 8.7 秒に制限します。チームは、別のルック、ローカライズしたキャンペーンバリエーション、改訂版のビジュアル表現を作成できます。
生成、アニメーション、参照、拡張、編集に対応する Grok Imagine Video の5つのモードを中心に、プロンプト駆動型の動画ツールを構築できます。480p または 720p の出力を選択しながら、1つのファミリーでクリエイター向けワークフローを提供できます。
入力方法、クリップ長、最大解像度、標準価格の観点から、Grok Imagine VideoのワークフローとAtlas Cloudの主要な代替モデルを比較します。
| モデル | 入力ワークフロー | クリップまたはセグメントの長さ | 最大解像度 | 標準価格 |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | テキストプロンプト | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | 開始画像 + テキストプロンプト | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 参照画像1–7枚 + テキストプロンプト | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | 2–15sのMP4 + テキストプロンプト | 2–10sの延長 | 入力に準拠、最大720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + テキストによる指示 | 入力に準拠、最大8.7s | - | $0.07/input sec |
| MiniMax H3 Text-to-Video | テキストプロンプト | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | 開始画像 + テキスト、最後のフレームは任意 | 4–15s | ネイティブ4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 参照画像1–4枚 + テキストプロンプト | 1–16s | 1440p SR、ネイティブ最大1080p | $0.125/run |
| Wan-2.7 Video-edit | ソース動画 + テキスト、画像または音声は任意 | - | 1080p | $0.10/run |
数分で始められます — 以下の簡単なステップに従って、Atlas Cloud プラットフォームでモデルを統合・デプロイしましょう。
atlascloud.ai でサインアップし、認証を完了します。新規ユーザーには無料クレジットが付与され、プラットフォームの探索やモデルのテストに使用できます。
高度なGrok Imagine VideoモデルとAtlas CloudのGPU加速プラットフォームを組み合わせることで、比類のないパフォーマンス、スケーラビリティ、開発者エクスペリエンスを提供。
低レイテンシ:
リアルタイム推論のためのGPU最適化推論。
統合API:
1つの統合でGrok Imagine Video、GPT、Gemini、DeepSeekを実行。
透明な料金:
サーバーレスオプション付きの予測可能なtoken単位の課金。
開発者エクスペリエンス:
SDK、分析、ファインチューニングツール、テンプレート。
信頼性:
99.99%の稼働率、RBAC、コンプライアンス対応ロギング。
セキュリティとコンプライアンス:
SOC 2 Type II、HIPAA準拠、米国内のデータ主権。
Grok Imagine Videoは、短いクリップの作成、アニメーション化、延長、編集に対応するxAIの動画生成モデルファミリーです。Atlas Cloudでは、テキスト、画像、参照画像、延長、編集の各ワークフロー向けに個別のAPIエンドポイントを提供しています。
Grok Imagine Videoでは、テキストからクリップを生成したり、開始画像をアニメーション化したり、最大7枚の参照画像を使って人物、オブジェクト、スタイルを指定したりできます。専用のエンドポイントを使えば、既存のクリップを続けて生成したり、自然言語の指示でMP4を編集したりすることも可能です。
Atlas Cloud APIキーを作成し、/api/v1/model/generateVideoへ認証付きPOSTリクエストを送信します。使用するルートに必要なモデルID、プロンプト、および画像または動画入力を指定してください。レスポンスにはリクエストID、ステータス、出力フィールドが含まれます。
プロンプトからシーンを開始する場合はtext-to-videoを、提供した画像を開始フレームにする場合はimage-to-videoを選択してください。reference-to-videoでは複数の画像からより幅広い指示を与えられます。一方、extend-videoとedit-videoは既存のMP4ファイルを対象とします。
text-to-videoとimage-to-videoでは、480pまたは720pで1〜15秒のクリップを生成できます。reference-to-videoでは、同じ解像度で1〜10秒のクリップに対応しています。一般的なアスペクト比には16:9、9:16、1:1、4:3、3:4、3:2、2:3があります。延長および編集のルートには、それぞれ固有の入力制限があります。
はい。xAIのドキュメントでは、Grok Imagineの動画ワークフローの一部としてネイティブ音声生成が説明されており、音声と映像を同時に生成できます。Atlas Cloudが公開しているこれらのルートのスキーマには、個別の音声切り替え設定はありません。
reference-to-videoエンドポイントを通じて、1〜7個の公開HTTPS画像URLまたはbase64データURIを指定します。<IMAGE_0>のようなタグを使うと、個々の参照画像をプロンプトで説明する人物、オブジェクト、スタイルに関連付けられます。このルートでは、480pまたは720pで最大10秒のクリップを生成できます。
extend-videoでは、2〜15秒のMP4を使用し、プロンプトで指定したアクションを追加で2〜10秒生成するようリクエストします。特定の変更を加える場合は、edit-videoに8.7秒以内のMP4を渡します。編集後も動画の長さは維持されます。どちらのルートも出力解像度は720pが上限です。
Atlas Cloudの標準料金は、text-to-video、image-to-video、reference-to-videoが1秒あたり$0.05です。extend-videoとedit-videoの標準料金は1秒あたり$0.07です。編集では出力の長さが入力動画と同じになるため、入力動画の長さに基づいて課金されます。
まず、選択したエンドポイントが入力タイプに合っていること、必要なプロンプト、画像URL、動画URLがすべて指定されていることを確認してください。再送信する前に、ルートごとの長さ、解像度、アスペクト比、参照画像数、MP4の制限を確認します。リクエストが成功したもののシーンが正確でない場合は、被写体の動き、カメラワーク、テンポ、映像の細部を明確に指定してプロンプトを書き直してください。
Atlas Cloud を最大限に活用するためのガイド、チュートリアル、製品アップデート。