Wir haben Grok Imagine Image und GPT Image-2 mit 6 identischen, modellneutralen Prompts getestet, die die Bereiche kompositionelle Semantik, fotorealistische Anatomie, mehrsprachige Texterzeugung, geometrische Transformation, lokale Bearbeitung und Multi-Referenz-Fusion abdecken.
Sowohl das Grok Imagine Image als auch das GPT Image-2 Modell sind über einen einzigen Atlas Cloud API-Schlüssel verfügbar, sodass dieser exakte Benchmark in wenigen Minuten reproduzierbar ist.
Warum dieser AI-Bildmodell-Vergleichs-Benchmark existiert
Jeder „AI-Bildmodell-Vergleich", den man online findet, tappt in dieselbe Falle: handverlesene Prompts, Best-of-Five-Auswahl und unbelegte Behauptungen. Dieser Benchmark wurde nach Tier-A-Prinzipien erstellt: modellneutrale Prompts, identische Eingaben für alle Modelle, Standardausgabe mit einem Seed (kein Cherry-Picking) und Bewertungskriterien, die pro Kategorie in einem Satz formuliert werden können.
Die sechs Modelle im vollständigen Benchmark-Durchlauf: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 und Seedream 5.0. Dieser Artikel konzentriert sich auf das direkte Duell Grok vs. GPT Image 2, da dies für Entwickler, die ein Standard-Bildmodell wählen, kommerziell relevanteste Paarung ist.
Wie wir Grok Imagine Image vs. GPT-Image 2 getestet haben: 6 Kategorien, eine Tier-A-Regel
Jeder Prompt zielt auf eine einzige, klar definierte Fähigkeitsdimension ab. Die Bestehen/Nichtbestehen-Kriterien wurden vor der Modellausführung festgelegt, nicht nach dem Betrachten der Ergebnisse.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| Kategorie | Getestete Primärdimension | Bestehen/Nichtbestehen in einem Satz |
|---|---|---|
| Kat. 1 · Kompositionelle Semantik | Instruktionsalignment | Hat das Modell 7 Objekte gezählt, richtig platziert und die Negationsliste befolgt? |
| Kat. 2 · Fotorealistische Anatomie & Licht | Visuelle Qualität & Physik | Sind alle 5 Finger anatomisch korrekt, und erscheinen kaustische Lichtmuster im Gesicht? |
| Kat. 3 · Mehrsprachiges Poster | Texterzeugung im Bild | Sind chinesische und englische Zeichen korrekt dargestellt, ohne fehlende Striche oder halluzinierte Glyphen? |
| Kat. 4 · Geometrische Transformation (I2I) | Bearbeitungskontrolle + Identität | Ist die Person nach einer 45°-Drehung noch erkennbar dieselbe, mit allen Kleidungsdetails intakt? |
| Kat. 5 · Lokale Bearbeitung & Regionstreue | Bearbeitungspräzision | Wurden genau 3 Änderungen vorgenommen, während alles andere auf Pixelebene unverändert blieb? |
| Kat. 6 · Multi-Referenz-Fusion | Cross-Image-Konsistenz | Fügen sich Identität, Stil und Szene aus drei separaten Referenzen zu einem einzigen kohärenten Bild zusammen? |
Möchtest du GPT Image 2 und Grok Imagine selbst mit demselben Prompt testen? Der Modellvergleich von Atlas Cloud führt sie in einem Durchlauf nebeneinander aus – identischer Prompt, Preis vor der Generierung angezeigt –, sodass du sie Bild für Bild beurteilen kannst.

GPT Image 2 und Grok Imagine mit dem identischen Prompt im Modellvergleich von Atlas Cloud – gleicher Prompt, Preis vor der Generierung angezeigt. Live aufgenommen im Model-Explorer.
Kat. 1 · Kompositionelle Semantik (T2I)
Prompt:
Ein Overhead-Flachbild eines hölzernen Esstisches, der genau sieben Keramikgegenstände enthält: drei identische weiße Teetassen, die in der Mitte in einem gleichseitigen Dreieck angeordnet sind, zwei schwarze Schalen rechts von den Teetassen, ein roter Apfel, der in der linken schwarzen Schale liegt, und ein leerer Holzlöffel, der auf der rechten schwarzen Schale liegt, mit dem Stiel in Richtung der oberen linken Ecke des Bildes. Keine Kaffeetassen, keine Metallgegenstände, keine Teller, keine Gläser. Sanftes, diffuses Fensterlicht von oben links, Vormittag. Realistische Fotografie, keine Styling-Utensilien.
Dies ist bewusst adversarial. Zählen, räumliche Sprache („rechts von", „am weitesten links") und Negationsklauseln sind bekannte Schwachstellen aller aktuellen Diffusionsarchitekturen.
Bewertungscheckliste
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kriterium | Prüfung |
| 1 | Gesamtobjektanzahl | Streng 7 Keramikobjekte |
| 2 | Drei weiße Teetassen | Anordnung im gleichseitigen Dreieck |
| 3 | Zwei schwarze Schalen | Positioniert rechts von den Teetassen |
| 4 | Roter Apfel | In der linken schwarzen Schale |
| 5 | Holzlöffel | Auf der rechten Schale, Stiel zeigt nach oben links |
| 6 | Negationseinhaltung | Keine Kaffeetassen / kein Metall / keine Teller / keine Gläser |
| 7 | Lichtquelle | Sanftes, diffuses Licht von oben links, alle Schatten konsistent |
| 8 | Fotografiestil | Keine Styling-Klischees (Palmblätter, Kerzen etc.) |
Grok Imagine Image
GPT-Image 2
Anforderung: Erzeuge ein Overhead-Flachbild, das streng sieben Keramikgegenstände mit klaren räumlichen Beziehungen zeigt: drei weiße Teetassen in einem gleichseitigen Dreieck in der Mitte, zwei schwarze Schalen rechts von den Teetassen, ein roter Apfel in der linken schwarzen Schale, ein Holzlöffel auf der rechten schwarzen Schale, Stiel zeigt nach oben links. Negationsanweisung: Keine Kaffeetassen, keine Metallgegenstände, keine Teller, keine Gläser.
Grok Imagine Objektanzahl: sichtbar 5 Teetassen (nicht 3), in einer Gruppe angeordnet statt im gleichseitigen Dreieck. Die zwei schwarzen Schalen sind vorhanden, der rote Apfel korrekt in einer davon. Der Holzlöffel ist vorhanden und liegt auf der rechten Schale, Stielrichtung ungefähr nach oben links – dieses Kriterium ist bestanden. Negationseinhaltung ist sauber: keine Kaffeetassen, kein Metall, keine Teller, keine Gläser. Lichtquelle von oben links mit konsistenten Schatten ist bestanden. Keine Styling-Utensilien vorhanden.
GPT Image 2 zeigte eine stärkere Befolgung der räumlichen Anweisungen, obwohl keines der Modelle eine perfekte 7-Objekt-Anzahl mit allen Platzierungsbedingungen gleichzeitig erfüllte.
Kat. 2 · Fotorealistische Anatomie & Licht (T2I)
Prompt:
Nahaufnahme-Porträt einer ostasiatischen Frau Anfang dreißig, die ein halbvolles Kristallweinglas mit Rotwein in der rechten Hand hält, alle fünf Finger und der Daumen vollständig sichtbar, die natürlich um den Stiel und teilweise um die Kuppa greifen. Sie sitzt an einem hohen, nach Westen ausgerichteten Fenster während der goldenen Stunde. Spätnachmittagssonnenlicht fällt durch den Wein und erzeugt warme, karminrote Kaustikmuster auf ihrem linken Wangenknochen und Kieferlinie. Ihre linke Hand ruht auf einem aufgeschlagenen Hardcover-Buch auf ihrem Schoß. Fenster-Catchlights sind in beiden Augen sichtbar. Die Haut zeigt extrem detaillierte Poren, feinen Flaum, Subsurface-Scattering am Ohrläppchen und Nasenrücken. Das Haar wird von hinten mit Randlicht beleuchtet. 85-mm-Objektiv, f/2.0, geringe Schärfentiefe, fotografischer Realismus.
Dies ist historisch der schwierigste Einzelbildtest für generative Modelle.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kriterium | Prüfung |
|---|---|---|
| 1 | Handanatomie | Alle 5 Finger + Daumen, natürlicher Griff an Stiel und Kuppa |
| 2 | Kaustisches Licht | Warme karminrote Muster durch Wein auf Wangenknochen projiziert |
| 3 | Catchlight-Konsistenz | Gleiche Position und Form in beiden Augen |
| 4 | Subsurface Scattering (SSS) | Sichtbar an Ohrläppchen und Nasenrücken bei Gegenlicht |
| 5 | Randlicht-Physik | Richtung stimmt mit Lichtquellenposition überein |
| 6 | Hautrealismus | Kein „AI-plastisches" Überschmieren; Poren und Flaum sichtbar |
Grok Imagine Image
GPT-Image 2
Grok Imagine lieferte in seinem Hauptvorteil stark ab. Die Handanatomie war korrekt – Fingeranzahl genau, Griffhaltung natürlich um Stiel und Kuppa, Handgelenkwinkel physikalisch plausibel. Das allein übertrifft bereits eine Hürde, an der viele Modelle scheitern. Die Hauttextur zeigte echte Porendetails mit sichtbarem feinem Flaum und ohne plastisches Überschmieren, und das Subsurface-Scattering auf Nasenrücken und Wangenknochen erzeugte eine warme, lichtdurchlässige Qualität, die fotografisch real wirkt. Das Randlicht im Haar folgte kohärent der Fensterrichtung.
Die Kaustikprojektion war Groks schwächster Punkt. Die karminroten Lichtmuster erschienen im Gesicht, wurden jedoch als überdimensionierte, dramatisch stilisierte rote Überlagerung dargestellt – eher wie ein Farbkorrektureffekt als die feinen, weichkantigen Lichtfilamente, die physikalisch durch Sonnenlicht durch Wein entstehen. Die physikalische Plausibilität der Kaustik erfüllte den Präzisionsstandard nicht.
GPT Image 2 kehrte den Kompromiss um. Seine Kaustikdarstellung war deutlich physikalisch genauer – die warmen karminroten Muster auf dem Wangenknochen waren kleiner, diffuser und folgten der räumlichen Geometrie von Licht, das im richtigen Winkel durch ein Weinglas fällt. Dies ist das Detail, das Grok verpasste. Allerdings zahlte GPT Image 2 woanders dafür: Die Handanatomie war etwas weniger natürlich, mit Fingerwinkeln um den Stiel, die eine leichte Steifheit zeigten. Die Hauttextur neigte zur glatteren, etwas flacheren Qualität, die bei AI-Porträts üblich ist, mit weniger sichtbarer SSS-Wärme und schwächerer Randlichtintensität im Vergleich zu Grok.
Kat. 3 · Mehrsprachiges Poster (T2I)
Prompt:
Ein Vintage-Reiseplakat im Stil der 1960er-Jahre für ein fiktives Filmfestival, illustriert im Stil des kommerziellen Designs der Jahrhundertmitte. Oben auf dem Plakat, große, fette Serifen-Schriftzeichen in Chinesisch: „时光电影节" (Zeile 1), darunter in kleineren chinesischen Schriftzeichen „第七届 · 上海 · 1965年5月" (Zeile 2).
Mitte: eine stilisierte Illustration eines alten Filmprojektors, der einen Strahl auf eine leicht gebogene Kinoleinwand wirft.
Untere Mitte: ein hohes Champagner-Coupe-Glas mit dem englischen Text „GRAND OPENING NIGHT", der entlang der Wölbung der Glaskuppa dem elliptischen Perspektive folgt.
Rechter Rand, vertikaler Text: „presented by 时代影业 · TIMES PICTURES" von oben nach unten verlaufend.
Unterer Streifen: kleiner englischer Credit-Text „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" in einer Zeile.
Farbpalette: cremefarbener Hintergrund, tiefes Karminrot, Senfgelb als Akzente. Leichte Altpapierstruktur, dezentes Korn.
Bewertungscheckliste
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kriterium | Prüfung |
|---|---|---|
| 1 | Chinesische Genauigkeit | Keine fehlenden Striche, keine halluzinierten Zeichen |
| 2 | Zweisprachiges Layout | Chinesisch und Englisch nicht vermischt; jedes in korrekter Zone |
| 3 | Gebogener Text auf Glas | Englisch folgt der elliptischen Perspektive des Champagner-Coupes |
| 4 | Vertikaler Text am rechten Rand | Lesbar von oben nach unten |
| 5 | Typografische Hierarchie | Klare Unterscheidung zwischen Überschrift und Untertitel |
| 6 | Stil vs. Lesbarkeit | 1960er-Ästhetik beibehalten, ohne die Textklarheit zu opfern |
Grok Imagine Image
GPT-Image 2
Grok Imagine erzeugte ein visuell ansprechendes Poster mit starker Mid-Century-Illustrationsenergie. Es scheiterte jedoch am wichtigsten Textkriterium: Die Überschrift lautet „時光電影節" in traditionellem Chinesisch, nicht im im Prompt angegebenen vereinfachten „时光电影节". Dies ist ein Fehler in der Zeichensatzkonformität – eine bedeutende Unterscheidung für jeden Lokalisierungs- oder Publikationsanwendungsfall. Die zweite Zeile „第七屆 · 上海 · 1965年5月" verwendete ebenfalls traditionelle Zeichen. Auf der strukturellen Seite erschien „GRAND OPENING NIGHT" auf dem Champagnerglas mit teilweiser Kurvenanpassung, wobei die elliptische Perspektive jedoch nur annähernd eingehalten wurde. Der vertikale rechte Randtext „TIMES PICTURES" war lesbar. Die untere Credit-Zeile war vorhanden und lesbar. Die Farbpalette – Karminrot, Senf, Creme – war gut umgesetzt. Die Gesamtlayout-Energie war hoch, aber das Versagen bei traditionell vs. vereinfacht ist ein hartes Ausschlusskriterium für den angegebenen Prompt.
GPT Image 2 bestand den Zeichensatztest sauber: Überschrift „时光电影节" und Untertitel „第七届 · 上海 · 1965年5月" sind korrekt in vereinfachtem Chinesisch ohne fehlende Striche oder halluzinierte Glyphen dargestellt – ein direkter Compliance-Vorteil gegenüber Grok. Das Champagner-Coupe-Glas ist in der unteren Mitte sichtbar, mit „GRAND OPENING NIGHT", das überzeugend der Glaswölbung folgt. Der vertikale rechte Randtext „时代影业 · TIMES PICTURES" verläuft von oben nach unten und ist vollständig lesbar, wobei sowohl Chinesisch als auch Englisch korrekt in derselben vertikalen Spalte ohne Vermischungsfehler platziert sind. Die untere Credit-Zeile – „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" – ist vorhanden und als einzelne Zeile lesbar. Die typografische Hierarchie zwischen Überschrift, Untertitel und Fußnote ist klar eingehalten. Die Altpapierstruktur und die Mid-Century-Farbpalette sind gut umgesetzt. Die Komposition integriert eine erkennbare Silhouette der Shanghai-Skyline als zentrale Illustration, die nicht im Prompt angegeben war, aber dem Ganzen kontextuelle Authentizität verleiht, ohne Kriterien zu verletzen.
Kat. 4 · Geometrische Transformation (I2I)
Der Prompt wies das Modell an, eine Person aus einem Mode-Lookbook in Ganzkörperansicht genau 45° nach links zu drehen, wobei die Kameraposition gleich bleiben sollte. Das Referenzbild zeigte ein komplexes, mehrschichtiges Outfit: langer brauner Mantel, Lederschultercape, Pelzstola mit sichtbarem Farbverlauf (dunkelbraun → silber → creme), eine runde kupferne Brustplakette mit eingelassenem Porträt, schwarze Lederstulpenhandschuhe und zweifarbige Lederstiefel. Keines dieser Details wurde im Prompt aufgeführt – das Modell musste sie durch reines Identitätsverständnis bewahren.

Dies ist ein bewusster Belastungstest der Fähigkeiten. Die Anweisung wurde absichtlich kurz gehalten, um dem Modell nicht seinen eigenen Bewertungsrahmen zu liefern.
Bewertungscheckliste
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kriterium | Prüfung |
|---|---|---|
| 1 | Gesichtsidentität | ArcFace-Ähnlichkeit ≥ 0,5 (für Ganzkörpermaßstab gelockert) |
| 2 | Pelzstola-Enthüllung | Zuvor verborgene rechte silberne Seite teilweise sichtbar |
| 3 | Brustplakette | Runder Kupferumriss + eingelassenes Porträt + korrekte Ellipsenkompression in Perspektive |
| 4 | Mantelsaum & Innenschichten | Natürlicher Fallrichtung nach Drehung; Verhältnis der freiliegenden Innenhose angemessen |
| 5 | Fußstellung | Links vorne |
| 6 | Stulpenvolumen | Handposition + Stricktextur nach Drehung sichtbar |
| 7 | Stiefelfarbgrenze | Braun/schwarz korrekt |
| 8 | Hintergrundkonsistenz | Reiner grauer Studiohintergrund (DINO-Region ≥ 0,95) |
| 9 | Ausgabeformat | Volles 9:16-Körperformat beibehalten, nicht auf Porträt beschnitten |
| 10 | Blickrichtung | Folgt der Drehung – schaut nicht weiterhin in die Kamera |
Grok Imagine Image
GPT-Image 2
Grok bewahrte die Gesichtsidentität oberhalb der ArcFace-0,5-Schwelle, die für Ganzkörperbilder angemessen ist. Der zuvor verborgene rechte Teil der Pelzstola wurde bei 45° teilweise sichtbar, mit vernünftiger Farbverlaufskontinuität. Der Umriss der Brustplakette blieb erhalten, obwohl das eingelassene Porträtdetails Kompression zeigte. Die Stiefelfarbgrenze und die Stulpentextur blieben stabil.
GPT Image 2 zeigte eine etwas stärkere Gesamtkohärenz der Kleidungsschichten, führte aber eine stärkere Abweichung der Gesichtsidentität ein – ein bedeutender Kompromiss je nach Anwendungsfall.
Kat. 5 · Lokale Bearbeitung & Regionstreue (I2I)
Der Prompt erforderte genau drei Änderungen an einer Wohnzimmerszene: Entfernen einer schlafenden Katze vom Sofa (und natürliche Wiederherstellung des Kissens), Ersetzen einer Tasse heißen Tees durch ein Glas Orangensaft mit Eis, und Hinzufügen einer zusammengeklappten schwarzgerahmten Lesebrille auf das mittlere Buch auf dem Couchtisch. Die Anweisung verbot ausdrücklich jede andere Änderung – Sofastoffmuster, Buchpositionen, Lampe, Fensteransicht, Wandfarbe, Boden.

Der Bewahrungstest ist genauso wichtig wie der Bearbeitungstest. Modelle, die die gesamte Szene neu interpretieren, während sie lokale Änderungen vornehmen, sind für die Retusche von Produktfotografie oder die iterative Szenenentwicklung unbrauchbar.
Bewertungscheckliste
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kriterium | Prüfung |
|---|---|---|
| 1 | Alle 3 Änderungen durchgeführt | Katze entfernt |
| 2 | Kissenwiederherstellung | Keine katzenförmige Einbuchtung oder Fellreste auf dem Sofa |
| 3 | OJ-Physik | Glasgeometrie, Eisbrechung und Schattenrichtung passen zum ursprünglichen Licht |
| 4 | Brillenplatzierung | Korrekt auf dem mittleren Buch (nicht oben oder unten) |
| 5 | Sofastoff | Diamantwebmuster intakt, besonders im bearbeiteten Bereich |
| 6 | Bücher unverändert | Positionen, Cover (rot, blau, gelb) und Stapelung unverändert |
| 7 | Lampe unverändert | Form, Leuchtstatus und Position beibehalten |
| 8 | Fensteransicht unverändert | Stadtansicht bleibt unscharf und konsistent |
| 9 | Wand & Boden unverändert | Cremeweiße Wand und heller Holzboden unverändert |
| 10 | Gesamtbeleuchtung beibehalten | Einzelne rechte hintere Lichtquellenrichtung unverändert |
Grok Imagine Image
GPT-Image 2
Grok Imagine führte alle drei erforderlichen Änderungen durch. Die Katze wurde entfernt und das Sofakissen sauber wiederhergestellt, ohne sichtbare Einbuchtung oder Fellreste – das Stoffmuster im bearbeiteten Bereich hielt gut. Das Orangensaftglas erschien an der richtigen Position. Das OJ-Glas zeigt jedoch ein Glanzlichtmuster, das nicht mit dieser Quellenrichtung übereinstimmt, als ob es mit einem unabhängigen Lichtmodell zusammengesetzt und nicht in die vorhandene Beleuchtung der Szene integriert worden wäre. Der Boden des Glases zeigt auch unzureichenden Kontaktschatten auf der dunklen Holzoberfläche des Couchtisches, was einen subtilen, aber erkennbaren Schwebe-Effekt erzeugt.
GPT Image 2 führte ebenfalls alle drei Änderungen durch und zeigte eine insgesamt stärkere Szenenbewahrung. Die Katzenentfernung war ebenso sauber. Das Orangensaftglas war gut dargestellt mit korrekter Positionierung und passender Schattenrichtung relativ zur rechten Fensterlichtquelle – die Glasgeometrie und Flüssigkeitsopazität wirkten raffinierter als bei Groks Version. Die Lesebrille war sichtbar auf dem Bücherstapel platziert. Entscheidend: Die Fensteransicht blieb erhalten – die Stadt draußen ist sichtbar und unscharf, konsistent mit der Referenz, woran Grok scheiterte. Sofastoff, Lampe, Wand und Boden blieben alle erhalten. Die Bücher erscheinen in Position und Farbe konsistent. Eine bemerkenswerte Änderung: Die Szene wirkt insgesamt etwas heller und kontrastreicher als das Original, was auf eine leichte globale Licht-Neuinterpretation hindeutet und nicht auf eine echte Pixelerhaltung – eine geringfügige, aber erkennbare Abweichung.
Kat. 6 · Multi-Referenz-Fusion (I2I)
Der Prompt kombinierte drei unabhängige Referenzen: eine Porträtidentität (Latinx-Frau, bernsteinfarbene Augen, tiefbraunes welliges Haar), einen Aquarellillustrationsstil (japanische ländliche Landschaft, sichtbare Pinselstriche, warme Märchenatmosphäre) und ein Szenen-Layout (europäischer Kopfsteinpflaster-Stadtplatz bei Sonnenuntergang, gusseiserne Laterne, Steinbogen). Die Aufgabe: ein einziges kohärentes Aquarellbild der identifizierten Person zu erstellen, die in der Szene steht – kein Foto mit Filter, keine Collage.



Die Entkopplung von drei Referenzen ist der schwierigste Test in diesem Benchmark. Die meisten Modelle gewichten entweder eine Referenz übermäßig oder schaffen es nicht, eine stildurchgängige Darstellung zu erreichen.
Bewertungscheckliste
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kriterium | Prüfung |
|---|---|---|
| 1 | Dreifache Entkopplung | Identität, Stil und Szene getrennt erkennbar |
| 2 | Vollständige Stilübertragung | Ausgabe ist durchgehend Aquarell – nicht Foto + Filter |
| 3 | Identitätserhaltung nach Stil | Bernsteinfarbene Augen + Gesichtsstruktur durch Aquarell-Behandlung erkennbar |
| 4 | Szenenstruktur bewahrt | Kopfsteinpflaster, Laterne und Bogenlayout intakt |
| 5 | Natürliche Kleidungsergänzung | Reisejacke und Umhängetasche hinzugefügt, ohne Komposition zu brechen |
| 6 | Lichtrichtungskonsistenz | Sonnenuntergangsglühen von links vorne auf Kopfsteinpflaster und Figur sichtbar |
Grok Imagine Image
GPT-Image 2
Grok Imagine scheiterte am Kernkriterium: Die Ausgabe ist fotorealistisch, kein Aquarell. Der Kopfsteinpflasterplatz und die Figur behalten volle fotografische Schärfe mit nur einer leichten malerischen Textur – keiner der bestimmenden Pinselstriche, Farbverläufe oder handgemalten Kantenqualitäten von Ref 2 ist vorhanden. Szenenstruktur, Identität, Kleidung und Lichtrichtung bestehen alle. Aber die Wiedergabe des falschen Mediums ist eine kategorieübergreifende Disqualifikation, kein Teilabzug.
GPT Image 2 erzielte eine echte Aquarelldarstellung über das gesamte Bild – Gebäude, Kopfsteinpflaster, Himmel und Figur tragen sichtbare Pinselarbeit und weiche Farbverläufe, die mit Ref 2 übereinstimmen. Die Szenenstruktur von Ref 3 ist intakt, die Laterne leuchtet und der Steinbogen ist im Mittelgrund sichtbar. Die Identität bleibt durch die Stiltransformation teilweise erhalten – welliges dunkles Haar und Gesichtsstruktur sind erkennbar, obwohl feine Merkmale erwartungsgemäß abstrahiert sind. Jacke, Umhängetasche, Lichtrichtung und Blick folgen dem Prompt. Dies ist die einzige Ausgabe, die die eigentliche Aufgabe erfüllte.
Teste Grok Imagine Image und GPT Image 2 Modelle über Atlas Cloud
Der Benchmark ist reproduzierbar. Sowohl Grok Imagine als auch GPT Image 2 sind jetzt über Atlas Cloud verfügbar – kein Modell-für-Modell-Abrechnungssetup, keine Wartelisten.
Warum Atlas Cloud
- Ein API-Schlüssel, über 300 Modelle. Wechsle zwischen Grok, GPT Image 2, Flux, Wan, Seedream und jedem anderen Modell im Pool, indem du ein einziges Modellfeld änderst. Derselbe Schlüssel, derselbe Endpunkt, dasselbe Abrechnungs-Dashboard – ob du einen Sechs-Modell-Benchmark durchführst oder eine Produktionsbild-Pipeline baust.
- Volle Modalitätsabdeckung. LLMs, Text-zu-Bild, Bild-zu-Bild, Text-zu-Video, Bild-zu-Video – alles unter einem Dach. Wenn dein Workflow ein Sprachmodell zur Prompt-Verfeinerung und ein Bildmodell zur Generierung benötigt, beide leben in derselben API.
- Keine Cold Starts, keine Rate-Limit-Überraschungen. Atlas Cloud läuft auf optimierter Inferenzinfrastruktur, die für Durchsatz ausgelegt ist. Du erhältst konsistente Latenzzeiten, egal ob du einen Aufruf oder tausend tätigst.
- Entwickelt für Vergleichs-Workflows. Der genaue Anwendungsfall, den dieser Benchmark demonstriert – identische Prompts über mehrere Modelle ausführen und Ausgaben vergleichen – ist das, wofür die Architektur von Atlas Cloud entwickelt wurde. Ein Schlüssel, eine Rechnung, volle Modellbreite.







