Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Nous avons donné les mêmes 6 prompts à GPT Image 2 et à Grok Imagine. Voici exactement ce qui en est ressorti.

XAI Grok Imagine vs GPT Image 2 benchmarkés sur l'anatomie, le texte chinois, les modifications locales et la fusion multi-références. Seed unique, sans cherry-picking. Les deux via Atlas Cloud.

Nous avons donné les mêmes 6 prompts à GPT Image 2 et à Grok Imagine. Voici exactement ce qui en est ressorti.

Nous avons passé les modèles Grok Imagine Image et GPT Image-2 à travers 6 prompts identiques et neutres, couvrant la sémantique compositionnelle, l'anatomie photoréaliste, le rendu de texte multilingue, la transformation géométrique, l'édition locale et la fusion multi-référence.

Les modèles Grok Imagine Image et GPT Image-2 sont tous deux disponibles via une seule clé API Atlas Cloud, ce qui permet de reproduire ce benchmark exact en quelques minutes.

Pourquoi ce benchmark de comparaison de modèles de génération d'images IA existe

Toute « comparaison de modèles d'images IA » que vous trouvez en ligne tombe dans le même piège : des prompts choisis arbitrairement, une sélection parmi les cinq meilleurs résultats, et des affirmations non testées. Ce benchmark a été construit autour des principes de niveau A : prompts neutres, entrées identiques pour tous les modèles, sortie unique par défaut (pas de sélection), et critères de notation pouvant être énoncés en une phrase par catégorie.

Les six modèles de la série complète de benchmarks : Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 et Seedream 5.0. Cet article se concentre sur le face-à-face Grok vs GPT Image 2, le duo le plus pertinent commercialement pour les développeurs qui choisissent un modèle d'image par défaut.

Comment nous avons testé Grok Imagine Image VS GPT-Image 2 : 6 catégories, une règle de niveau A

Chaque prompt cible une seule dimension de capacité clairement énoncée. Les critères de réussite/échec ont été définis avant de lancer les modèles, pas après avoir vu les résultats.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

Catégorie Dimension principale testée Critère de réussite/échec en une phrase 
Cat 1 · Sémantique compositionnelle Alignement des instructions Le modèle a-t-il compté 7 objets, les a-t-il placés correctement, et a-t-il respecté la liste de négation ? 
Cat 2 · Anatomie photoréaliste et lumière Qualité visuelle et physique Les 5 doigts sont-ils anatomiquement corrects, et des motifs de lumière caustique apparaissent-ils sur le visage ? 
Cat 3 · Affiche multilingue Rendu du texte dans l'image Les caractères chinois et anglais sont-ils correctement rendus, sans traits manquants ni glyphes hallucinés ? 
Cat 4 · Transformation géométrique (I2I) Contrôle d'édition + identité Après une rotation de 45°, la personne est-elle toujours reconnaissable avec tous les détails vestimentaires intacts ? 
Cat 5 · Édition locale et préservation de région Précision d'édition Exactement 3 modifications ont-elles été effectuées, tout le reste étant inchangé au niveau du pixel ? 
Cat 6 · Fusion multi-référence Cohérence inter-image L'identité, le style et la scène provenant de 3 références distinctes se fondent-ils en une seule image cohérente ?

Vous voulez soumettre vous-même GPT Image 2 et Grok Imagine au même prompt ? La comparaison de modèles d'Atlas Cloud les exécute côte à côte en un seul passage — même prompt, prix affiché avant génération — pour que vous puissiez les juger image par image.

GPT Image 2 et Grok Imagine sur le même prompt dans la comparaison de modèles d'Atlas Cloud — même prompt, prix affiché avant génération. Capturé en direct sur le model-explorer

GPT Image 2 et Grok Imagine sur le même prompt dans la comparaison de modèles d'Atlas Cloud — même prompt, prix affiché avant génération. Capturé en direct sur le model-explorer.

Cat 1 · Sémantique compositionnelle (T2I)

Prompt :

Photographie en plongée d'une table à manger en bois contenant exactement sept objets en céramique : trois tasses à thé blanches identiques disposées en triangle équilatéral au centre, deux bols noirs placés à droite des tasses, une pomme rouge à l'intérieur du bol noir le plus à gauche, et une cuillère en bois vide reposant sur le bol noir le plus à droite, le manche pointant vers le coin supérieur gauche du cadre. Pas de tasses à café, pas d'objets métalliques, pas d'assiettes, pas de verrerie. Lumière douce et diffuse venant d'une fenêtre en haut à gauche, milieu de matinée. Photographie réaliste, sans accessoires de style.

Ce prompt est délibérément adversarial. Le comptage, le langage spatial (« à droite de », « le plus à gauche ») et les clauses de négation sont des modes de défaillance connus pour toutes les architectures actuelles basées sur la diffusion.

Liste de vérification

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritèreVérification 
1Nombre total d'objetsStrictement 7 objets en céramique
2Trois tasses à thé blanchesDisposition en triangle équilatéral
3Deux bols noirsPositionnés à droite des tasses
4Pomme rougeÀ l'intérieur du bol noir le plus gauche
5Cuillère en boisReposant sur le bol le plus droit, manche pointant vers le haut à gauche
6Respect de la négationPas de tasses à café / pas de métal / pas d'assiettes / pas de verrerie
7Source lumineuseLumière douce et diffuse depuis le haut à gauche, toutes les ombres cohérentes
8Style photographiquePas de clichés de style (feuilles de palmier, bougies, etc.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Grok Imagine nombre d'objets : visiblement 5 tasses à thé (pas 3), disposées en groupe plutôt qu'en triangle équilatéral. Les deux bols noirs sont présents, avec la pomme rouge correctement à l'intérieur de l'un d'eux. La cuillère en bois est présente et repose sur le bol le plus à droite, le manche orienté approximativement vers le haut à gauche — ce critère est réussi. Le respect de la négation est propre : pas de tasses à café, pas de métal, pas d'assiettes, pas de verrerie. La source lumineuse venant du haut à gauche avec des ombres cohérentes est réussie. Pas d'accessoires de style présents.

GPT Image 2 a démontré une meilleure capacité à suivre les instructions sur les composantes spatiales, bien qu'aucun des deux modèles n'ait atteint un compte parfait de 7 objets avec toutes les contraintes de placement simultanément satisfaites.

Cat 2 · Anatomie photoréaliste et lumière (T2I)

Prompt :

Portrait en gros plan d'une femme est-asiatique d'une trentaine d'années tenant un verre à vin en cristal à moitié rempli de vin rouge dans sa main droite, les cinq doigts et le pouce entièrement visibles, enroulés naturellement autour de la tige et partiellement autour de la coupe. Elle est assise près d'une grande fenêtre orientée à l'ouest pendant l'heure dorée. La lumière du soleil de fin d'après-midi traverse le vin créant des motifs caustiques cramoisis chauds sur sa pommette gauche et sa mâchoire. Sa main gauche repose sur un livre à couverture rigide ouvert sur ses genoux. Des reflets de la fenêtre visibles dans les deux yeux. La peau montre des pores ultra-détaillés, un fin duvet, une diffusion sous-cutanée sur le lobe de l'oreille et l'arête du nez. Cheveux rétroéclairés avec une lumière de contour. Objectif 85 mm, f/2.0, faible profondeur de champ, réalisme photographique.

C'est historiquement le test le plus difficile en une seule image pour les modèles génératifs.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritèreVérification
1Anatomie de la main5 doigts + pouce, prise naturelle sur la tige et la coupe
2Lumière caustiqueMotifs cramoisis chauds projetés du vin sur la pommette
3Cohérence des refletsMême position et forme dans les deux yeux
4Diffusion sous-cutanée (SSS)Visible sur le lobe de l'oreille et l'arête du nez en rétroéclairage
5Physique de la lumière de contourLa direction correspond à la position de la source lumineuse
6Réalisme de la peauPas de lissage excessif « IA plastique » ; pores et duvet visibles

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine a bien réussi sur son avantage revendiqué. L'anatomie de la main était correcte — nombre de doigts exact, posture de préhension naturelle autour de la tige et de la coupe, angle du poignet physiquement plausible. Cela seul dépasse une barre que de nombreux modèles ne franchissent pas. La texture de la peau montrait un niveau de détail poreux authentique avec un fin duvet visible et sans lissage plastique, et la diffusion sous-cutanée sur l'arête du nez et les pommettes produisait une qualité chaude et perméable à la lumière qui semble photographiquement réelle. La lumière de contour sur les cheveux suivait cohéremment la direction de la source lumineuse (fenêtre).

La projection de la lumière caustique était le point le plus faible de Grok. Les motifs de lumière cramoisie apparaissaient sur le visage, mais étaient rendus comme une superposition rouge surdimensionnée et fortement stylisée — ressemblant plus à un effet de correction colorimétrique qu'aux filaments lumineux fins et aux bords doux qui résultent physiquement de la lumière du soleil traversant le vin. La plausibilité physique de la caustique n'a pas satisfait au niveau de précision requis.

GPT Image 2 a inversé le compromis. Son rendu de lumière caustique était nettement plus précis physiquement — les motifs cramoisis chauds sur la pommette étaient plus petits, plus diffus, et suivaient la géométrie spatiale de la lumière traversant un verre à vin sous le bon angle. C'est le détail que Grok a manqué. Cependant, GPT Image 2 a payé pour cela ailleurs : l'anatomie de la main était légèrement moins naturelle, avec des angles de doigts autour de la tige montrant une légère raideur. La texture de la peau penchait vers une qualité plus lisse et légèrement plus plate, courante dans les portraits IA, avec moins de chaleur SSS visible et une lumière de contour moins intense par rapport à Grok.

Cat 3 · Affiche multilingue (T2I)

Prompt :

Une affiche de voyage vintage style années 1960 pour un festival de cinéma fictif, illustrée dans le style du design commercial du milieu du siècle. En haut de l'affiche, grands caractères chinois en gras et à empattement lisant « 时光电影节 » (ligne 1), et en dessous en caractères chinois plus petits « 第七届 · 上海 · 1965年5月 » (ligne 2).

Au centre : une illustration stylisée d'un vieux projecteur de cinéma projetant un faisceau sur un écran de cinéma légèrement incurvé.

En bas au centre : un verre à champagne tall champagne coupe avec le texte anglais « GRAND OPENING NIGHT » épousant la courbure de la coupe du verre, suivant la perspective elliptique.

Sur le bord droit, texte vertical lisant « présenté par 时代影业 · TIMES PICTURES » s'étendant de haut en bas.

Bande inférieure : petits crédits en anglais « music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU » sur une seule ligne.

Palette de couleurs : fond blanc cassé crème, rouge cramoisi profond, accents jaune moutarde. Légère texture de papier vieilli, grain subtil.

Liste de vérification

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritèreVérification
1Précision du chinoisPas de traits manquants, pas de caractères hallucinés dans
2Disposition bilingueChinois et anglais non mélangés ; chacun apparaît dans la zone correcte
3Texte incurvé sur le verreL'anglais suit la perspective elliptique de la coupe à champagne
4Texte vertical sur le bord droitLisible de haut en bas
5Hiérarchie typographiqueDistinction claire entre le titre
6Style vs. lisibilitéEsthétique des années 1960 maintenue sans sacrifier la clarté du texte

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagine a produit une affiche visuellement frappante avec une forte énergie d'illustration du milieu du siècle. Cependant, il a échoué sur le critère de texte le plus critique : le titre se lit « 時光電影節 » en caractères chinois traditionnels, et non en chinois simplifié « 时光电影节 » comme spécifié dans le prompt. C'est un échec de conformité du jeu de caractères — une distinction importante pour tout cas d'utilisation de localisation ou de publication. La deuxième ligne « 第七屆 · 上海 · 1965年5月 » utilisait également des caractères traditionnels. Du côté structurel, « GRAND OPENING NIGHT » apparaissait sur le verre à champagne avec une courbe partielle, bien que l'adhérence à la perspective elliptique soit approximative. Le texte vertical sur le bord droit « TIMES PICTURES » était lisible. La ligne de crédits en bas était présente et lisible. La palette de couleurs — cramoisi, moutarde, crème — était bien exécutée. L'énergie globale de la mise en page était élevée, mais l'échec traditionnel vs simplifié est un disqualifiant dur pour le prompt énoncé.

GPT Image 2 a passé le test du jeu de caractères proprement : le titre « 时光电影节 » et le sous-titre « 第七届 · 上海 · 1965年5月 » sont correctement rendus en chinois simplifié sans traits manquants ni glyphes hallucinés — une victoire directe en conformité par rapport à Grok. Le verre à champagne coupe est visible en bas au centre avec « GRAND OPENING NIGHT » épousant la courbure du verre de manière convaincante. Le texte vertical sur le bord droit « 时代影业 · TIMES PICTURES » s'étend de haut en bas et est entièrement lisible, avec le chinois et l'anglais correctement placés dans la même colonne verticale sans erreurs de mélange. La ligne de crédits en bas — « music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU » — est présente et lisible sur une seule ligne. La hiérarchie typographique entre le titre, le sous-titre et la note de bas de page est clairement maintenue. La texture du papier vieilli et la palette de couleurs du milieu du siècle sont bien réalisées. La composition intègre une silhouette reconnaissable de la skyline de Shanghai comme illustration centrale, ce qui n'était pas spécifié dans le prompt mais ajoute une authenticité contextuelle sans casser aucun critère.

Cat 4 · Transformation géométrique (I2I)

Le prompt demandait au modèle de faire pivoter un sujet de lookbook de mode en pied exactement de 45° vers la gauche du sujet, en maintenant la même position de caméra. L'image de référence présentait une tenue complexe en couches : long manteau marron, cape en cuir sur l'épaule, étole en fourrure avec un dégradé visible (marron foncé → argent → crème), un badge de poitrine rond en cuivre avec un portrait incrusté, gantelets en cuir noir, et bottes en cuir bicolores. Aucun de ces détails n'était listé dans le prompt — le modèle devait les préserver par la seule compréhension de l'identité.

7.png

Il s'agit d'un test de stress de capacité délibéré. L'instruction était intentionnellement courte pour éviter de fournir au modèle sa propre grille d'évaluation.

Liste de vérification

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritèreVérification
1Identité facialeSimilarité ArcFace ≥ 0,5 (assoupli pour l'échelle du corps entier)
2Révélation de l'étole en fourrurePartie argentée droite précédemment cachée
3Badge de poitrineContour cuivre circulaire + portrait incrusté + compression de perspective elliptique correcte
4Ourlet du manteau et couches intérieuresDirection naturelle du drapé après rotation ; proportion de l'exposition du pantalon intérieur raisonnable
5Position des piedsGauche devant
6Volume des ganteletsPosition de la main + texture tricotée visible après rotation
7Limite de couleur des bottesMarron
8Cohérence de l'arrière-planFond de studio gris pur (région DINO ≥ 0,95)
9Ratio de sortieCadre complet du corps en 9:16 maintenu, non recadré en portrait
10Direction du regardSuit la rotation — ne continue pas à faire face à la caméra

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grok a maintenu l'identité faciale au-dessus du seuil ArcFace 0,5 approprié pour les images en pied. La section de l'étole en fourrure précédemment cachée du côté droit est devenue partiellement visible à 45°, avec une continuité de dégradé raisonnable. Le contour du badge de poitrine a été préservé, bien que le détail du portrait incrusté ait montré une compression. La limite de couleur des bottes et la texture des gantelets ont tenu.

GPT Image 2 a montré une cohérence légèrement meilleure dans l'ensemble des couches de vêtements, mais a introduit une plus grande dérive de l'identité faciale — un compromis significatif selon le cas d'utilisation.

Cat 5 · Édition locale et préservation de région (I2I)

Le prompt exigeait exactement trois modifications d'une scène de salon : enlever un chat endormi du canapé (et restaurer le coussin naturellement), remplacer une tasse de thé chaud par un verre de jus d'orange avec des glaçons, et ajouter des lunettes de lecture pliées à monture noire sur le livre du milieu sur la table basse. L'instruction interdisait explicitement de changer quoi que ce soit d'autre — motif du tissu du canapé, positions des livres, lampe, vue par la fenêtre, couleur du mur, sol.

10.png

Le test de préservation est aussi important que le test d'édition. Les modèles qui réinterprètent toute la scène tout en effectuant des modifications locales ne sont pas utilisables pour la retouche photographique de produits ou le développement itératif de scènes.

Liste de vérification

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritèreVérification
1Les 3 modifications effectuéesChat enlevé
2Restauration du coussinPas d'empreinte de chat ni de résidus de fourrure sur le canapé
3Physique du jus d'orangeGéométrie du verre, réfraction de la glace, et direction de l'ombre correspondent à la lumière de la tasse d'origine
4Placement des lunettesCorrectement sur le livre du milieu (pas en haut ou en bas)
5Tissu du canapéMotif de tissage en losange intact, en particulier dans la zone modifiée
6Livres inchangésPositions, couvertures (rouge
7Lampe inchangéeForme, état de l'éclairage et position préservés
8Vue par la fenêtre inchangéeVue de la ville reste floue et cohérente
9Mur et sol inchangésMur blanc cassé et sol en bois clair non modifiés
10Éclairage global préservéDirection de la source lumineuse unique arrière-droite inchangée

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagine a effectué les trois modifications requises. Le chat a été enlevé et le coussin du canapé restauré proprement sans marque visible ni résidu de fourrure — le motif du tissu dans la zone modifiée a bien tenu. Le verre de jus d'orange est apparu à la bonne position. Cependant, le verre de jus d'orange présente un motif de reflet qui ne s'aligne pas avec cette direction de source, donnant l'impression d'avoir été composité avec un modèle d'éclairage indépendant plutôt qu'intégré à l'éclairage existant de la scène. La base du verre montre également une ombre de contact insuffisante contre la surface sombre de la table basse en bois, créant un effet de flottement subtil mais détectable.

GPT Image 2 a également effectué les trois modifications, et a démontré une meilleure préservation globale de la scène. La suppression du chat était tout aussi propre. Le verre de jus d'orange était bien rendu avec un positionnement correct et une direction d'ombre correspondant à la source de lumière de la fenêtre de droite — la géométrie du verre et l'opacité du liquide semblent plus raffinées que la version de Grok. Les lunettes de lecture étaient placées visiblement sur la pile de livres. Crucialement, la vue par la fenêtre a été préservée — la ville à l'extérieur reste visible et floue, cohérente avec la référence, ce qui est l'endroit où Grok a échoué. Le tissu du canapé, la lampe, le mur et le sol ont tous tenu. Les livres semblent cohérents en position et en couleur. Le seul changement notable : la scène dans son ensemble semble légèrement plus lumineuse et avec un contraste plus prononcé que l'original, suggérant une certaine réinterprétation globale de l'éclairage plutôt qu'une véritable préservation au niveau du pixel — une dérive mineure mais détectable.

Cat 6 · Fusion multi-référence (I2I)

Le prompt combinait trois références indépendantes : une identité de portrait (femme latino-américaine, yeux ambre, cheveux ondulés brun foncé), un style d'illustration à l'aquarelle (paysage rural japonais, coups de pinceau visibles, atmosphère chaleureuse de conte de fées), et une disposition de scène (place de ville pavée européenne au coucher du soleil, lampadaire en fer forgé, arche en pierre). La tâche : produire une seule peinture à l'aquarelle cohérente de la personne identifiée debout dans la scène — pas une photo avec un filtre, pas un collage.

13.png

14.png

15.png

Le découplage à trois références est le test le plus difficile de ce benchmark. La plupart des modèles soit surpondèrent une référence, soit échouent à obtenir un rendu à travers le style.

Liste de vérification

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritèreVérification
1Découplage à trois voiesIdentité
2Transfert de style completLa sortie est entièrement à l'aquarelle — pas une photo + filtre
3Rétention de l'identité après styleYeux ambre + structure faciale reconnaissables à travers le traitement aquarelle
4Structure de la scène préservéePavés, lampadaire et arche de pierre intacts
5Ajout de vêtements naturelsManteau de voyage et sacoche ajoutés sans briser la composition
6Cohérence de la direction de la lumièreLueur du coucher de soleil depuis la gauche de la caméra visible sur les pavés et le personnage

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagine a échoué au critère central : la sortie est photoréaliste, pas une aquarelle. La place pavée et le personnage conservent toute la netteté photographique avec seulement une légère passe de texture picturale — aucun des coups de pinceau, des dégradés de couleur ou de la qualité des bords peints à la main de la référence 2 n'est présent. La structure de la scène, l'identité, les vêtements et la direction de la lumière sont tous réussis. Mais rendre le mauvais support en entier est une disqualification au niveau de la catégorie, pas une déduction partielle.

GPT Image 2 a obtenu un rendu aquarelle authentique sur l'ensemble du cadre — bâtiments, pavés, ciel et personnage portent tous des coups de pinceau visibles et des dégradés de couleur doux cohérents avec la référence 2. La structure de la scène de la référence 3 est intacte, le lampadaire est allumé, et l'arche en pierre est visible au second plan. L'identité est partiellement conservée à travers la transformation stylistique — les cheveux ondulés foncés et la structure faciale sont reconnaissables, bien que les traits fins soient abstraits comme prévu. Le manteau, la sacoche, la direction de la lumière et le regard suivent tous le prompt. C'est la seule sortie qui a accompli la tâche réelle.

Essayez les modèles Grok Imagine Image et GPT Image 2 via Atlas Cloud

Le benchmark est reproductible. Les modèles Grok Imagine et GPT Image 2 sont disponibles dès maintenant via Atlas Cloud — pas de configuration de facturation par modèle, pas de listes d'attente.

Pourquoi Atlas Cloud

  • Une clé API, 300+ modèles. Passez de Grok, GPT Image 2, Flux, Wan, Seedream et tous les autres modèles du pool en changeant un seul champ de modèle. La même clé, le même endpoint, le même tableau de bord de facturation — que vous exécutiez un benchmark de six modèles ou que vous construisiez un pipeline de production d'images.
  • Couverture multimodale complète. LLM, texte-à-image, image-à-image, texte-à-vidéo, image-à-vidéo — tout sous un même toit. Si votre workflow a besoin d'un modèle de langage pour le raffinement du prompt et d'un modèle d'image pour la génération, les deux vivent dans la même API.
  • Pas de démarrage à froid, pas de surprises de limite de débit. Atlas Cloud repose sur une infrastructure d'inférence optimisée spécialement conçue pour le débit. Vous obtenez une latence constante, que vous fassiez un appel ou mille.
  • Conçu pour les workflows de comparaison. Le cas d'utilisation exact que ce benchmark démontre — exécuter des prompts identiques sur plusieurs modèles et comparer les sorties — est ce pour quoi l'architecture d'Atlas Cloud est conçue. Une clé, une facture, une large gamme de modèles.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles