
xAIが開発したGrok Imagine Image 2.0は、高品質なテキストから画像への生成と、自然言語による編集機能を組み合わせ、参照画像を活用したワークフローを実現します。1Kまたは2Kの出力を生成し、プロンプトから完成したビジュアルへと仕上げたり、既存の画像を直接指示で調整したりできます。Atlas Cloudでは、対応するすべてのエンドポイントを1つのOpenAI互換APIキーで利用でき、透明性の高い従量課金制とシンプルな統合を提供します。今すぐ開発を始めましょう。
Grok Imagine Image 2.0 は xAI が開発したモデルです。Atlas Cloud(運営:Atlas Cloud AI LLC)は本モデルへのアクセスを提供するものであり、その所有者ではありません。すべての商標は各所有者に帰属します。
標準エンドポイントと開発者向けエンドポイントで、プロンプトベースの生成とリファレンス画像を使用した編集を比較できます。
| モダリティ | 説明 |
|---|---|
| Grok Imagine Image 2.0 Developer Edit API (Image Editing) | 自然言語による編集指示で、最大3枚のリファレンス画像を変換できます。1Kまたは2Kの解像度と、低または中の品質を選択でき、プロダクトのブラッシュアップ、クリエイティブなバリエーション作成、ビジュアルの反復的な更新に適しています。 |
| Grok Imagine Image 2.0 Developer Text-to-Image API | 自然言語のプロンプトから、1Kまたは2Kの解像度で洗練された画像を生成できます。14種類のアスペクト比と低または中の品質レベルに対応し、マーケティング用グラフィック、コンセプトアート、ソーシャルコンテンツ、その他の形式に合わせたアセットの作成に活用できます。 |
| Grok Imagine Image 2.0 Text-to-Image API | 自然言語のプロンプトから直接、1Kまたは2Kで洗練されたビジュアルを作成できます。14種類のアスペクト比と選択可能な低または中の品質レベルにより、キャンペーン、デザイン検討、イラスト、各プラットフォーム向けの画像に対応します。 |
| Grok Imagine Image 2.0 Edit API (Image Editing) | 最大3枚のリファレンス画像をアップロードし、希望する変更を自然言語で説明すると、編集済みの画像を取得できます。1Kおよび2Kの解像度と低または中の品質に対応し、アセットの修正、ビジュアルの調整、コンテンツの反復制作に適しています。 |
Grok Imagine Image 2.0は、詳細なプロンプトと最大3枚の参照画像から、柔軟な構図、選択可能な品質ティア、生成と編集に対応する1つのAtlas Cloud APIを使って、洗練された1Kまたは2Kのビジュアルを作成します。

Grok Imagine Image 2.0は、自然言語のプロンプトを1Kまたは2K解像度の洗練されたビジュアルに変換します。詳細な指示によって、1回のリクエストで被写体、環境、構図、スタイル、タイポグラフィを調整できます。14種類のアスペクト比から選択でき、正方形の商品アートから超ワイドなキャンペーン素材まで、さまざまな構図に対応します。この制御性は、デザインツール、コンテンツパイプライン、プロンプト駆動型のクリエイティブ製品を開発するデベロッパーに適しています。

タイポグラフィを構図の一部として設計できるため、情報量の多い複雑なビジュアルでも統一感を保ち、小さな文字も鮮明に表示できます。1つのプロンプトで、文言、階層、画像、レイアウトを指定できます。2Kでは、細かな文字や素材の質感をより精細に表現できます。ワイドなキャンペーングラフィック、商品パッケージのコンセプト、エディトリアルレイアウト、インフォグラフィック風のアセットに活用できます。

最大3枚の参照画像を、自然言語の指示によって1回のリクエストで編集できます。各ソースを<IMAGE_0>、<IMAGE_1>、<IMAGE_2>として指定し、組み合わせたり変更したりする要素を説明します。出力は1Kまたは2Kで、低品質または中品質としてレンダリングできます。元画像の特徴を保つ必要がある商品バリエーション、アートディレクション、合成コンセプトに適したワークフローです。

素早く試行する場合は低品質、モデルの最良の出力を得る場合は中品質を選択し、リクエストごとに1Kまたは2Kの解像度を指定できます。生成と編集のどちらでも、同じ品質および解像度の制御を利用できます。プロンプトに別案が必要な場合は、最大4つの出力を生成できます。この柔軟性により、モデルを切り替えたり統合を作り直したりせずに、ドラフトから最終成果物までのワークフローに対応できます。

Atlas Cloudでは、テキスト生成と画像編集を1つの画像生成エンドポイントとAPIキーで利用できます。標準の従量課金は出力画像1枚あたり$0.04からで、各ソース画像には$0.01が課金されます。画像URLを返すことも、アプリケーションで直接処理するためにBase64出力をリクエストすることもできます。明確なコストと少ない統合数を求める本番パイプラインにとって、実用的な基盤となります。
Grok Imagine Image 2.0とAtlas Cloudの2つの代替モデルが、同じプロンプトをエディトリアル写真と豊かな質感の静物写真でどのように解釈するかをご覧ください。
コバルトブルーの仕立ての良いスーツを着た若いファッションモデルが、陽光に照らされた地中海沿岸の駅を歩いている。出発する列車がばらばらの切符の半券を彼女の周囲に舞い上げ、彼女が風になびく髪を揺らしながらカメラの方を振り向く決定的瞬間を捉える。強いゴールデンアワーの斜め逆光が髪の輪郭に光るリムライトを生み、プラットフォーム全体に鋭い斜めの影を落とす。連続するアーチをフレーム・イン・フレームとして活用し、前景の荷物は柔らかくぼかし、列車へ向かって奥へ収束する強いリーディングラインを設ける。抑制の効いたブルーとアンバーの色調、自然な肌の質感、くっきりしたウール生地、風化した石、控えめなフィルムグレイン、エディトリアル・ファッション写真、85mmレンズ、舞い上がる紙にわずかなモーションブラー、横長16:9のアスペクト比、フルブリード

Generated with Grok Imagine Image 2.0 Developer Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Grok Imagine Image Quality Text-to-Image on Atlas Cloud
午後のキャンパス屋上でリハーサルを行う高校生の吹奏楽団を捉えた、率直な青春ドキュメンタリー写真。突然の強風が楽譜の束全体を空中へ吹き飛ばす、まさにコミカルな瞬間を捉える。何十枚もの折り目のついた白いページが、驚いて飛び立つ鳥の群れのように画面を横切る。1人の女子生徒はつま先立ちになり、風に制服のスカートと髪を激しくなびかせながら、必死に1枚のページをつかもうと手を伸ばしている。その隣では、頬を膨らませた男子生徒が、真剣に集中した表情で演奏を続けている。彼の金管楽器の磨かれたベルは、逃げていく楽譜を追って駆け回る他の生徒たちをはっきりと反射している。複数の若い音楽家たちは、驚き、笑い、ぎこちない動きの途中の身振りを自然に見せる。楽器には、指の位置、バルブ、管、空間的な位置関係を含む、信頼できる機械的な複雑さを保たせる。日本の露出オーバーなアナログフィルム写真、 spontanéousな決定的瞬間の物語性、ややローアングルの横位置スナップ。屋上の手すりと張り詰めた物干しロープが、2本の強い収束するリーディングラインを形成する。さらに、近景を横切る大きくぼけた楽譜が、重層的な奥行きと部分的な遮蔽を生み出す。真昼の硬い指向性のある日差しが、コンクリートの上にくっきりとグラフィカルな影を落とす。空は大胆に露出オーバーした淡い色調で、ハイライトは明るく描く。色は澄んだ空のブルー、学校制服のホワイト、温かみのある真鍮のゴールドの厳格な3色パレットに限定する。小さな汗の粒、リアルな肌の質感、しわの寄ったコットンの制服、紙の繊維と折り目、風化した屋上のコンクリート、控えめなフィルムグレイン、穏やかなレンズブルーム、舞うページや髪、伸ばした手に抑制の効いたモーションブラーを残す。エネルギッシュで、混沌としていて、面白く、若々しく、観察的で、完全に演出されていない雰囲気。自然な肌、明瞭な色分離、脂っぽい過剰レンダリングなし、HDRなし、プラスチックのような肌なし、濁った色なし、人工的な光彩なし、映画的で壮大なエフェクトなし。35mmフィルムカメラ、28mm広角レンズ、選択的なモーションブラーを伴う高速のスナップシャッター、ハイキー露出、横長のランドスケープ構図、横長16:9のアスペクト比、フルブリード。

Generated with Grok Imagine Image 2.0 Developer Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Grok Imagine Image Quality Text-to-Image on Atlas Cloud
キャンペーンの企画やプロダクトバリエーションから、エディトリアルアートやマルチフォーマット素材まで、Grok Imagine Image 2.0 は自然言語のプロンプトと最大3枚の参照画像から、14種類のアスペクト比に対応した高品質な1Kまたは2Kビジュアルを生成します。
自然言語のプロンプトから、1Kまたは2K解像度の洗練されたキャンペーンビジュアルを生成します。14種類のアスペクト比から選択でき、さまざまな掲載枠向けのバナー、ランディングページ用アート、ソーシャル向けクリエイティブを用意できます。
自然言語の指示と最大3枚の参照画像を使って商品画像を編集します。カラーバリエーションや季節感のある背景、マーケットプレイス向けの構成を作成でき、ECチームや自動化されたカタログワークフローに活用できます。
さまざまな画面形状に合わせたビジュアル素材を生成する際に、14種類のアスペクト比から選択できます。ソーシャルフィード、モバイルレイアウト、ディスプレイ広告枠、エディトリアル制作ワークフロー向けに、1Kのドラフトまたは2Kの納品用素材を作成できます。
text to image endpoint を通じて、文章で表現したコンセプトを洗練された1Kまたは2K画像に変換します。エディトリアルイラスト、提案用ビジュアル、ムードボード、プロダクトチームにおける初期段階のクリエイティブ検討をサポートします。
最大3枚の参照画像を入力し、必要な編集内容を自然言語で説明します。開発者は、クリエイター、マーチャンダイジングチーム、デザインレビュー、再利用可能なコンテンツパイプライン向けに、ガイド付き変換ツールを構築できます。
画像が検討段階から納品へ進むのに合わせて、低品質と中品質のティアを切り替えられます。どちらのティアでも1Kまたは2K出力と組み合わせることができ、プロトタイピング、レビューサイクル、実運用向け素材の作成に対応します。
Grok Imagine Image 2.0とAtlas Cloudの3つの代替モデルを、プロバイダー、最大解像度、アスペクト比の制御、標準的な画像1枚あたりの料金で比較します。
| モデル | プロバイダー | 最大解像度 | アスペクト比の制御 | 標準料金 |
|---|---|---|---|---|
| Grok Imagine Image 2.0 Developer Text-to-Image | xAI | 2K | 14個のプリセット | 画像1枚あたり$0.04 |
| Qwen Image 2.0 Text-to-image | Qwen | 2048 × 2048 | 7個のプリセットとカスタムサイズ | 画像1枚あたり$0.035 |
| Nano Banana 2 Lite Text-to-image | 1K | 14個のプリセット | 画像1枚あたり$0.04 | |
| MAI-Image-2.5-Flash Text-to-image | Microsoft | 各辺最大1360 px | カスタムサイズ | $0.03 per image |
数分で始められます — 以下の簡単なステップに従って、Atlas Cloud プラットフォームでモデルを統合・デプロイしましょう。
atlascloud.ai でサインアップし、認証を完了します。新規ユーザーには無料クレジットが付与され、プラットフォームの探索やモデルのテストに使用できます。
高度なGrok Imagine Image 2.0モデルとAtlas CloudのGPU加速プラットフォームを組み合わせることで、比類のないパフォーマンス、スケーラビリティ、開発者エクスペリエンスを提供。
低レイテンシ:
リアルタイム推論のためのGPU最適化推論。
統合API:
1つの統合でGrok Imagine Image 2.0、GPT、Gemini、DeepSeekを実行。
透明な料金:
サーバーレスオプション付きの予測可能なtoken単位の課金。
開発者エクスペリエンス:
SDK、分析、ファインチューニングツール、テンプレート。
信頼性:
99.99%の稼働率、RBAC、コンプライアンス対応ロギング。
セキュリティとコンプライアンス:
SOC 2 Type II、HIPAA準拠、米国内のデータ主権。
Grok Imagine Image 2.0は、自然言語によるビジュアルの生成・編集に対応したxAIの画像モデルです。Atlas Cloudでは、text to imageと編集用のエンドポイントを個別に提供しており、1Kまたは2Kの出力解像度と、lowまたはmediumの品質を選択できます。
テキストプロンプトから完成度の高いビジュアルを生成したり、自然言語による指示で既存の画像を変更したりできます。text to image生成では14種類のアスペクト比を利用でき、編集ワークフローでは最大3枚の参照画像を使用できます。
新しいビジュアルを生成する場合はtext to image endpointを、参照画像を使って作業する場合はedit endpointを選択します。対応するAtlas Cloudスキーマで定義された解像度、品質、アスペクト比の設定を指定し、プロンプトを送信してください。
どちらのワークフローも、1Kおよび2Kの解像度と、lowまたはmediumの品質レベルに対応しています。text to image endpointでは14種類のアスペクト比を利用でき、正方形、ポートレート、横長など、さまざまなレイアウトを生成できます。
edit endpointでは、1回のリクエストで最大3枚の参照画像を受け付けます。各参照画像の役割を説明し、どのビジュアル要素を変更し、どの要素を一貫して維持するかを明記してください。
Atlas Cloudでは、利用可能な生成・編集用エンドポイントの標準基本料金を、画像1枚あたり$0.04と案内しています。料金は従量課金制で、リクエスト数に応じて増減します。
出力をプロンプトだけで生成する場合は、text to image endpointを使用してください。参照画像を変換、組み合わせ、または調整する場合は、edit endpointを選択します。
いいえ。このファミリーページで扱っているエンドポイントは画像を生成します。動画生成には、これらの画像用ルートではなく、別のGrok Imagine動画モデルが必要です。
変更したい内容と、変更せずに維持すべき要素を、それぞれ明確な個別の指示として記述してください。複数画像を編集する場合は、各参照画像が何に寄与するかを説明し、複数の変換を組み合わせる前に、まず主要な変更を1つだけテストしてください。
Atlas Cloud を最大限に活用するためのガイド、チュートリアル、製品アップデート。