Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

GPT Image 2 vs Grok Imagine に同じ6つのプロンプトを与えた。返ってきたのはこれだ。

XAI Grok Imagine と GPT Image 2 を、解剖学、中国語テキスト、ローカル編集、マルチリファレンスフュージョンの各項目でベンチマークしました。シングルシード、チェリーピッキング無し。両方とも Atlas Cloud 経由。

GPT Image 2 vs Grok Imagine に同じ6つのプロンプトを与えた。返ってきたのはこれだ。

ウェブ上の「AI画像モデル比較」はどれも同じ罠に陥っている。プロンプトの選り好み、ベスト5選出、検証不能な主張。このベンチマークは「Tier A原則」に基づいて構築されている。モデルに中立なプロンプト、全モデルで同一の入力、シングルシードのデフォルト出力(選り好みなし)、1カテゴリにつき1文で説明できる評価基準。

フルベンチマークの6モデル:Grok、GPT Image 2、Nano Banana 2、Nano Banana Pro、Wan 2.7、Seedream 5.0。本記事では、デフォルト画像モデルを選ぶ開発者にとって最も商業的に重要な組み合わせであるGrokとGPT Image 2の直接比較に焦点を当てる。

Grok Imagine Image VS GPT-Image 2のテスト方法:6カテゴリ、1つのTier Aルール

各プロンプトは、単一の明確に定義された能力次元を狙う。合格/不合格の基準は、モデルを実行する前に、出力を見る前に定義した。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

カテゴリテストする主な次元1文で説明する合格/不合格
カテゴリ1 · 構成的意味論指示への整合性モデルは7つのオブジェクトを数え、正しく配置し、否定リストを守ったか?
カテゴリ2 · 写真的解剖学と光画質と物理5本の指は解剖学的に正しく、顔にコースティックな光の模様が現れているか?
カテゴリ3 · 多言語ポスター画像内テキストレンダリング中国語と英語の文字が、欠落や幻覚のグリフなしで正しくレンダリングされているか?
カテゴリ4 · 幾何変換(I2I)編集の制御性と同一性45°回転後も、同じ人物と認識でき、すべての衣装の詳細が維持されているか?
カテゴリ5 · ローカル編集と領域保存編集の精度正確に3つの編集が行われ、その他すべてがピクセルレベルで変更されていないか?
カテゴリ6 · マルチ参照融合画像間の一貫性3つの異なる参照からの同一性、スタイル、シーンが、単一の一貫した画像に統合されているか?

GPT Image 2とGrok Imagineを同じプロンプトで試してみませんか?Atlas Cloudのモデル比較では、同じプロンプトを1パスで並べて実行できます。生成前に価格が表示されるため、フレームごとに比較できます。

GPT Image 2 and Grok Imagine on the identical prompt in Atlas Cloud’s model comparison — same prompt, price shown before you generate. Captured live on the model-explorer

GPT Image 2とGrok Imagineを、Atlas Cloudのモデル比較で同一プロンプトで実行。生成前に価格が表示される。モデルエクスプローラーからのライブキャプチャ。

カテゴリ1 · 構成的意味論(T2I)

プロンプト

木製のダイニングテーブルを真上から見下ろしたフラットレイ写真。テーブル上には正確に7つの陶器製オブジェクトがある。中央に3つの同一の白いティーカップが正三角形に配置され、その右側に2つの黒いボウル、左端の黒いボウルの中に1つの赤いリンゴ、右端の黒いボウルの上に木製のスプーンが1つ置かれ、柄はフレームの左上隅を指している。コーヒーカップ、金属製のアイテム、皿、ガラス製品は禁止。左上からの柔らかな拡散窓光、午前中。現実的な写真、スタイリング小道具なし。

これは意図的に敵対的な設定である。カウント、空間言語(「〜の右側に」「左端の」)、否定節は、現在の拡散ベースのアーキテクチャすべてにとって既知の失敗モードである。

採点チェックリスト

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#基準チェック
1オブジェクト総数厳密に7つの陶器オブジェクト
23つの白いティーカップ正三角形の配置
32つの黒いボウルティーカップの右側に配置
4赤いリンゴ左端の黒いボウルの中
5木製スプーン右端のボウルの上に、柄が左上を指す
6否定の遵守コーヒーカップなし / 金属なし / 皿なし / ガラス製品なし
7光源左上からの柔らかな拡散光、影はすべて一貫
8写真スタイルスタイリングの決まり文句なし(ヤシの葉、キャンドルなど)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Grok Imagineのオブジェクト数:目に見えて5つのティーカップ(3つではない)、正三角形ではなく塊として配置。2つの黒いボウルは存在し、赤いリンゴはそのうちの1つに正しく入っている。木製スプーンは存在し、右端のボウルの上にあり、柄の方向はおおよそ左上 — この基準は合格。否定の遵守は良好:コーヒーカップ、金属、皿、ガラス製品なし。左上からの光源と一貫した影は合格。スタイリング小道具なし。

GPT Image 2は、空間要素に関する指示の追従においてより優れた能力を示したが、両モデルとも、すべての配置制約を同時に満たす完全な7オブジェクトのカウントを達成したわけではない。

カテゴリ2 · 写真的解剖学と光(T2I)

プロンプト

30代前半の東アジア人女性のクローズアップポートレート。彼女は右手に赤ワインの入ったハーフ満たされたクリスタルワイングラスを持ち、5本の指と親指がすべて見え、茎とボウルの一部に自然に巻き付いている。彼女はゴールデンアワーの間、西向きの高い窓のそばに座っている。午後遅くの太陽光がワインを通り抜け、彼女の左頬骨と顎のラインに温かみのある深紅のコースティックパターンを作り出している。彼女の左手は膝の上にある開いたハードカバーの本の上に置かれている。窓からのキャッチライトが両目に見える。肌は超詳細な毛穴、微細なピーチファズ、耳たぶと鼻筋の表面下散乱を示している。髪はバックライトが当たり、リムライトがある。85mmレンズ、f/2.0、浅い被写界深度、写真のようなリアリズム。

これは歴史的に、生成モデルにとって最も難しい単一画像テストである。

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#基準チェック
1手の解剖学5本の指と親指、茎とボウルへの自然なグリップ
2コースティック光ワインから頬骨に投影された温かみのある深紅のパターン
3キャッチライトの一貫性両目で同じ位置と形状
4表面下散乱(SSS)バックライト時に耳たぶと鼻筋に見える
5リムライトの物理方向が光源の位置と一致
6肌のリアリズム「AIのプラスチック感」過度なスムージングなし;毛穴とピーチファズが見える

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagineは、その主な優位性を強く発揮した。手の解剖学は正しく、指の数は正確で、グリップ姿勢は茎とボウルの両方の周りで自然で、手首の角度は物理的に妥当である。これだけで、多くのモデルが完全に失敗する基準をクリアしている。肌の質感は、本物の毛穴レベルの細部と、目に見える微細なピーチファズ、プラスチックのような過度なスムージングがないことを示し、鼻筋と頬骨の表面下散乱は、写真として現実的な温かみのある光透過性の品質を生み出している。髪のリムライトは、窓の光源の方向に一貫して追従している。

コースティック光の投影はGrokの最も弱い点だった。深紅の光のパターンが顔に現れたが、それは過度に大きく、劇的に様式化された赤いオーバーレイとしてレンダリングされ、むしろカラーグレード効果に似ており、太陽光がワインを通り抜ける物理的な結果として生じる、細かく柔らかなエッジの光のフィラメントには似ていなかった。コースティックの物理的妥当性は、精密さの基準を満たさなかった。

GPT Image 2はトレードオフを逆転させた。そのコースティック光のレンダリングは、はるかに物理的に正確であった。頬骨の温かみのある深紅のパターンは、より小さく、より拡散し、ワイングラスを通る光の角度の空間的幾何学に従っていた。これはGrokが見逃した細部である。しかし、GPT Image 2は他の部分で代償を払った。手の解剖学はやや自然さに欠け、茎の周りの指の角度にわずかな硬さが見られた。肌の質感は、AIポートレートによく見られる、より滑らかでやや平坦な品質に傾き、Grokと比較してSSSの温かみとリムライトの強度が弱かった。

カテゴリ3 · 多言語ポスター(T2I)

プロンプト

架空の映画祭のためのヴィンテージ1960年代スタイルの旅行ポスター。ミッドセンチュリーの商業デザインスタイルで描かれている。ポスター上部、大きな太字のセリフ体中国語文字で「时光电影节」(1行目)、その下に小さな中国語文字で「第七届 · 上海 · 1965年5月」(2行目)。中央:古い映写機の様式化されたイラストで、わずかに湾曲した映画スクリーンに光線を投射している。中央下部:背の高いシャンパンクーペグラスで、ガラスのボウルの曲線に沿って英語のテキスト「GRAND OPENING NIGHT」が楕円透視法に従って巻き付いている。右端、縦書きのテキストで「presented by 时代影业 · TIMES PICTURES」が上から下に読める。下部の帯:小さな英語のクレジットテキスト「music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU」が1行で。カラーパレット:クリーム色のオフホワイトの背景、深い深紅、マスタードイエローのアクセント。わずかな古紙の質感、微妙な粒子。

採点チェックリスト

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#基準チェック
1中国語の正確性欠落したストロークや幻覚の文字がないこと
2バイリンガルレイアウト中国語と英語が混在せず、それぞれ正しいゾーンに現れる
3ガラス上の曲線テキスト英語がシャンパンクーペの楕円透視に従う
4右端の縦書きテキスト上から下に読める
5タイポグラフィ階層見出しとその他の明確な区別
6スタイルと可読性1960年代の美観を維持しつつ、テキストの明瞭さを犠牲にしない

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagineは、強いミッドセンチュリーのイラスト風のエネルギーを持つ視覚的に印象的なポスターを生成した。しかし、最も重要なテキスト基準で不合格となった。見出しは「時光電影節」と繁体字中国語で読め、プロンプトで指定された簡体字の「时光电影节」ではない。これは文字セットの準拠違反であり、ローカリゼーションや出版のユースケースにとって重要な違いである。2行目の「第七屆 · 上海 · 1965年5月」も同様に繁体字を使用していた。構造面では、「GRAND OPENING NIGHT」がシャンパングラスに部分的に曲線に沿って現れたが、楕円透視の遵守はおおよそのものだった。右端の縦書きテキスト「TIMES PICTURES」は読めた。下部のクレジット行は存在し、読めた。カラーパレット(深紅、マスタード、クリーム)はよく実行された。全体的なレイアウトのエネルギーは高かったが、繁体字と簡体字の失敗は、指定されたプロンプトにとってハードな失格理由である。

GPT Image 2は文字セットテストをクリーンに通過した。見出し「时光电影节」とサブタイトル「第七届 · 上海 · 1965年5月」は、欠落したストロークや幻覚のグリフなしで、正しく簡体字中国語でレンダリングされている。これはGrokに対する直接的な準拠の勝利である。シャンパンクーペグラスは中央下部に見え、「GRAND OPENING NIGHT」がガラスの曲線に説得力を持って従っている。右端の縦書きテキスト「时代影业 · TIMES PICTURES」は上から下に読め、完全に判読可能で、中国語と英語の両方が混在エラーなく同じ縦列に正しく配置されている。下部のクレジット行「music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU」は存在し、1行として読める。見出し、サブタイトル、脚注の間のタイポグラフィ階層は明確に維持されている。古紙の質感とミッドセンチュリーのカラーパレットはよく実現されている。構図は、認識可能な上海のスカイラインのシルエットを中央のイラストとして統合しており、プロンプトでは指定されていなかったが、基準を破ることなく文脈上の信頼性を追加している。

カテゴリ4 · 幾何変換(I2I)

プロンプトは、モデルに被写体を正確に45°左に回転させ、同じカメラ位置を維持するよう指示した。参照画像は、複雑な重ね着の衣装を特徴としていた:長い茶色のオーバーコート、革のショルダーケープ、目に見えるグラデーション(濃い茶色→銀色→クリーム色)のあるファーストール、埋め込まれた肖像画のある丸い銅の胸バッジ、黒い革のガントレット、ツートンの革のブーツ。これらの詳細のいずれもプロンプトにリストされておらず、モデルは同一性の理解のみを通じてそれらを保持しなければならなかった。

7.png

これは意図的な能力ストレステストである。指示は、モデルにそれ自身の評価基準を与えないように、意図的に短くされた。

採点チェックリスト

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#基準チェック
1顔の同一性ArcFace類似度 ≥ 0.5(全身スケールでは緩和)
2ファーストールの露出以前は隠れていた右側の銀色部分
3胸バッジ円形の銅の輪郭 + 埋め込まれた肖像画 + 正しい楕円の透視圧縮
4コートの裾と内側の層回転後の自然なドレープの方向;内側のズボンの露出比率が妥当
5足のスタンス左足前
6ガントレットのボリューム回転後も手の位置 + ニットの質感が可視
7ブーツの色の境界茶色
8背景の一貫性純粋なグレーのスタジオ背景(DINO領域 ≥ 0.95)
9出力比率完全な9:16の全身フレームが維持され、ポートレートにクロップされていない
10視線方向回転に従う—カメラを向き続けない

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grokは、全身画像に適したArcFace 0.5のしきい値を超える顔の同一性を維持した。ファーストールの以前は隠れていた右側の部分が45°で部分的に見えるようになり、グラデーションの連続性は妥当だった。胸バッジの輪郭は保持されたが、埋め込まれた肖像画の詳細は圧縮された。ブーツの色の境界とガントレットの質感は保持された。

GPT Image 2は、全体的な衣装のレイヤーの一貫性でわずかに優れていたが、顔の同一性のドリフトがより大きかった。これは、ユースケースによっては意味のあるトレードオフである。

カテゴリ5 · ローカル編集と領域保存(I2I)

プロンプトは、リビングルームのシーンに正確に3つの編集を要求した。寝ている猫をソファから削除し(クッションを自然に復元)、熱いお茶のカップを氷入りのオレンジジュースのグラスに置き換え、コーヒーテーブルの上の真ん中の本の上に折りたたまれた黒縁の老眼鏡を追加する。指示は、他のもの(ソファの布地パターン、本の位置、ランプ、窓の景色、壁の色、床)を変更することを明示的に禁止した。

10.png

保存テストは編集テストと同じくらい重要である。ローカルな変更を行いながらシーン全体を再解釈するモデルは、商品写真のレタッチや反復的なシーン開発には使用できない。

採点チェックリスト

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#基準チェック
13つの編集すべて完了猫が削除された
2クッションの復元ソファに猫の形の跡や毛の残りがない
3OJの物理グラスの形状、氷の屈折、影の方向が元のカップの光と一致
4メガネの配置正しく真ん中の本の上(一番上や一番下ではない)
5ソファの布地特に編集されたゾーンのダイヤモンド織りパターンが無傷
6本は変更なし位置、表紙(赤)
7ランプは変更なし形状、点灯状態、位置が保持
8窓の景色は変更なし街の景色がぼやけたまま一貫
9壁と床は変更なしオフホワイトの壁と明るい木の床が変更されていない
10全体的な照明は保持単一の右後方光源の方向が変更されていない

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagineは、要求された3つの編集すべてを完了した。猫は削除され、ソファのクッションは目に見える跡や毛の残りなしにきれいに復元された。編集ゾーンの布地パターンはよく保持された。オレンジジュースのグラスは正しい位置に現れた。しかし、OJのグラスは、この光源の方向と一致しないハイライトパターンを示しており、シーン内の既存の照明に統合されるのではなく、独立した光モデルで合成されたように見える。グラスの底面は、濃い木のコーヒーテーブルの表面に対して十分な接触影がなく、微妙だが検出可能な浮遊効果を生み出している。

GPT Image 2も3つの編集すべてを完了し、全体的なシーンの保存でより優れた能力を示した。猫の削除は同様にきれいだった。オレンジジュースのグラスはよくレンダリングされ、正しい位置と、右側の窓の光源に関連する影の方向が一致していた。グラスの形状と液体の不透明度はGrokのバージョンよりも洗練されている。老眼鏡は本の山の上にはっきりと配置された。重要なことに、窓の景色は保存され、外の街はぼやけたまま参照と一致しており、Grokが失敗した点である。ソファの布地、ランプ、壁、床はすべて保持された。本は位置と色が一貫して見える。1つの注目すべき変更:シーン全体が元の画像よりもわずかに明るく、コントラストがシフトしているように見え、真のピクセルレベルの保存ではなく、何らかのグローバルな照明の再解釈を示唆している。これはマイナーだが検出可能なドリフトである。

カテゴリ6 · マルチ参照融合(I2I)

プロンプトは、3つの独立した参照を組み合わせた。ポートレートの同一性(ラテン系女性、琥珀色の目、濃い茶色のウェーブのかかった髪)、水彩画のイラストスタイル(日本の田園風景、目に見える筆致、温かみのあるおとぎ話のような雰囲気)、シーンレイアウト(ヨーロッパの石畳の町の広場、夕日、鋳鉄の街灯、石のアーチ道)。タスク:識別された人物がそのシーンに立っている、単一の一貫した水彩画を生成すること。フィルターをかけた写真ではなく、コラージュでもない。

13.png

14.png

15.png

3つの参照の分離は、このベンチマークで最も難しいテストである。ほとんどのモデルは、1つの参照に過重になるか、スタイルを通したレンダリングを達成できない。

採点チェックリスト

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#基準チェック
13方向の分離同一性
2完全なスタイル転送出力全体が水彩画 — 写真 + フィルターではない
3スタイル後の同一性保持琥珀色の目 + 顔の構造が水彩画処理を通して認識可能
4シーン構造の保存石畳、街灯、アーチ道のレイアウトが無傷
5自然な衣服の追加トラベルコートとサッチェル袋が構図を壊さずに追加
6光の方向の一貫性カメラ左からの夕日の輝きが石畳と人物に見える

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagineはコア基準を満たさなかった。出力は写実的であり、水彩画ではない。石畳の広場と人物は、軽い絵画的な質感のパスがあるだけで、完全な写真のシャープネスを保持している。参照2の特徴的な筆致、色のにじみ、手描きのエッジ品質はまったく存在しない。シーン構造、同一性、衣服、光の方向はすべて合格である。しかし、完全に異なる媒体をレンダリングすることは、部分的な減点ではなく、カテゴリレベルの失格である。

GPT Image 2は、フレーム全体にわたって真の水彩画レンダリングを達成した。建物、石畳、空、人物はすべて、参照2と一致する目に見える筆致と柔らかな色のにじみを帯びている。参照3からのシーン構造は無傷で、街灯は点灯し、石のアーチ道は中景に見える。同一性はスタイル変換を通して部分的に保持されている。ウェーブのかかった暗い髪と顔の構造は認識可能だが、細かい特徴は予想通り抽象化されている。コート、サッチェル袋、光の方向、視線はすべてプロンプトに従っている。これは、実際のタスクを完了した唯一の出力である。

Atlas CloudでGrok Imagine ImageとGPT Image 2モデルを試す

ベンチマークは再現可能である。Grok ImagineGPT Image 2はどちらも、現在Atlas Cloudで利用可能である。モデルごとの課金設定やウェイティングリストは不要。

Atlas Cloudを選ぶ理由

  • 1つのAPIキー、300以上のモデル。 モデルフィールドを変更するだけで、Grok、GPT Image 2、Flux、Wan、Seedream、その他プール内のすべてのモデルを切り替えられる。6モデルのベンチマークを実行する場合でも、プロダクションの画像パイプラインを構築する場合でも、同じキー、同じエンドポイント、同じ課金ダッシュボードが使用できる。
  • フルモーダルカバレッジ。 LLM、テキストから画像、画像から画像、テキストから動画、画像から動画—すべて1つのプラットフォームで。ワークフローがプロンプトの洗練に言語モデルを必要とし、生成に画像モデルを必要とする場合、両方が同じAPIに存在する。
  • コールドスタートなし、レート制限の驚きなし。 Atlas Cloudは、スループット向けに最適化された推論インフラストラクチャ上で動作する。1回の呼び出しでも1000回でも、一貫したレイテンシが得られる。
  • 比較ワークフロー向けに構築。 このベンチマークで実証された正確なユースケース—複数のモデルで同一のプロンプトを実行し、出力を比較すること—は、Atlas Cloudのアーキテクチャが設計されたものである。1つのキー、1つの請求書、完全なモデルの幅。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索