Seedance 2.5 ist jetzt live — Zuerst auf Atlas Cloud

Wir haben GPT Image 2 und Grok Imagine die gleichen 6 Prompts gegeben. Hier ist genau das, was zurückkam.

XAI Grok Imagine vs GPT Image 2 benchmarkt auf Anatomie, chinesischen Text, lokale Bearbeitungen und Multi-Referenz-Fusion. Einzelner Seed, kein Cherry-Picking. Beide über Atlas Cloud.

Wir haben GPT Image 2 und Grok Imagine die gleichen 6 Prompts gegeben. Hier ist genau das, was zurückkam.

Wir haben Grok Imagine Image und GPT Image-2 mit 6 identischen, modellneutralen Prompts getestet, die die Bereiche kompositionelle Semantik, fotorealistische Anatomie, mehrsprachige Texterzeugung, geometrische Transformation, lokale Bearbeitung und Multi-Referenz-Fusion abdecken.

Sowohl das Grok Imagine Image als auch das GPT Image-2 Modell sind über einen einzigen Atlas Cloud API-Schlüssel verfügbar, sodass dieser exakte Benchmark in wenigen Minuten reproduzierbar ist.

Warum dieser AI-Bildmodell-Vergleichs-Benchmark existiert

Jeder „AI-Bildmodell-Vergleich", den man online findet, tappt in dieselbe Falle: handverlesene Prompts, Best-of-Five-Auswahl und unbelegte Behauptungen. Dieser Benchmark wurde nach Tier-A-Prinzipien erstellt: modellneutrale Prompts, identische Eingaben für alle Modelle, Standardausgabe mit einem Seed (kein Cherry-Picking) und Bewertungskriterien, die pro Kategorie in einem Satz formuliert werden können.

Die sechs Modelle im vollständigen Benchmark-Durchlauf: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 und Seedream 5.0. Dieser Artikel konzentriert sich auf das direkte Duell Grok vs. GPT Image 2, da dies für Entwickler, die ein Standard-Bildmodell wählen, kommerziell relevanteste Paarung ist.

Wie wir Grok Imagine Image vs. GPT-Image 2 getestet haben: 6 Kategorien, eine Tier-A-Regel

Jeder Prompt zielt auf eine einzige, klar definierte Fähigkeitsdimension ab. Die Bestehen/Nichtbestehen-Kriterien wurden vor der Modellausführung festgelegt, nicht nach dem Betrachten der Ergebnisse.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

Kategorie Getestete Primärdimension Bestehen/Nichtbestehen in einem Satz 
Kat. 1 · Kompositionelle SemantikInstruktionsalignmentHat das Modell 7 Objekte gezählt, richtig platziert und die Negationsliste befolgt?
Kat. 2 · Fotorealistische Anatomie & LichtVisuelle Qualität & PhysikSind alle 5 Finger anatomisch korrekt, und erscheinen kaustische Lichtmuster im Gesicht?
Kat. 3 · Mehrsprachiges PosterTexterzeugung im BildSind chinesische und englische Zeichen korrekt dargestellt, ohne fehlende Striche oder halluzinierte Glyphen?
Kat. 4 · Geometrische Transformation (I2I)Bearbeitungskontrolle + IdentitätIst die Person nach einer 45°-Drehung noch erkennbar dieselbe, mit allen Kleidungsdetails intakt?
Kat. 5 · Lokale Bearbeitung & RegionstreueBearbeitungspräzisionWurden genau 3 Änderungen vorgenommen, während alles andere auf Pixelebene unverändert blieb?
Kat. 6 · Multi-Referenz-FusionCross-Image-KonsistenzFügen sich Identität, Stil und Szene aus drei separaten Referenzen zu einem einzigen kohärenten Bild zusammen?

Möchtest du GPT Image 2 und Grok Imagine selbst mit demselben Prompt testen? Der Modellvergleich von Atlas Cloud führt sie in einem Durchlauf nebeneinander aus – identischer Prompt, Preis vor der Generierung angezeigt –, sodass du sie Bild für Bild beurteilen kannst.

GPT Image 2 und Grok Imagine mit dem identischen Prompt im Modellvergleich von Atlas Cloud – gleicher Prompt, Preis vor der Generierung angezeigt. Live aufgenommen im Model-Explorer

GPT Image 2 und Grok Imagine mit dem identischen Prompt im Modellvergleich von Atlas Cloud – gleicher Prompt, Preis vor der Generierung angezeigt. Live aufgenommen im Model-Explorer.

Kat. 1 · Kompositionelle Semantik (T2I)

Prompt:

Ein Overhead-Flachbild eines hölzernen Esstisches, der genau sieben Keramikgegenstände enthält: drei identische weiße Teetassen, die in der Mitte in einem gleichseitigen Dreieck angeordnet sind, zwei schwarze Schalen rechts von den Teetassen, ein roter Apfel, der in der linken schwarzen Schale liegt, und ein leerer Holzlöffel, der auf der rechten schwarzen Schale liegt, mit dem Stiel in Richtung der oberen linken Ecke des Bildes. Keine Kaffeetassen, keine Metallgegenstände, keine Teller, keine Gläser. Sanftes, diffuses Fensterlicht von oben links, Vormittag. Realistische Fotografie, keine Styling-Utensilien.

Dies ist bewusst adversarial. Zählen, räumliche Sprache („rechts von", „am weitesten links") und Negationsklauseln sind bekannte Schwachstellen aller aktuellen Diffusionsarchitekturen.

Bewertungscheckliste

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriteriumPrüfung 
1GesamtobjektanzahlStreng 7 Keramikobjekte
2Drei weiße TeetassenAnordnung im gleichseitigen Dreieck
3Zwei schwarze SchalenPositioniert rechts von den Teetassen
4Roter ApfelIn der linken schwarzen Schale
5HolzlöffelAuf der rechten Schale, Stiel zeigt nach oben links
6NegationseinhaltungKeine Kaffeetassen / kein Metall / keine Teller / keine Gläser
7LichtquelleSanftes, diffuses Licht von oben links, alle Schatten konsistent
8FotografiestilKeine Styling-Klischees (Palmblätter, Kerzen etc.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Anforderung: Erzeuge ein Overhead-Flachbild, das streng sieben Keramikgegenstände mit klaren räumlichen Beziehungen zeigt: drei weiße Teetassen in einem gleichseitigen Dreieck in der Mitte, zwei schwarze Schalen rechts von den Teetassen, ein roter Apfel in der linken schwarzen Schale, ein Holzlöffel auf der rechten schwarzen Schale, Stiel zeigt nach oben links. Negationsanweisung: Keine Kaffeetassen, keine Metallgegenstände, keine Teller, keine Gläser.

Grok Imagine Objektanzahl: sichtbar 5 Teetassen (nicht 3), in einer Gruppe angeordnet statt im gleichseitigen Dreieck. Die zwei schwarzen Schalen sind vorhanden, der rote Apfel korrekt in einer davon. Der Holzlöffel ist vorhanden und liegt auf der rechten Schale, Stielrichtung ungefähr nach oben links – dieses Kriterium ist bestanden. Negationseinhaltung ist sauber: keine Kaffeetassen, kein Metall, keine Teller, keine Gläser. Lichtquelle von oben links mit konsistenten Schatten ist bestanden. Keine Styling-Utensilien vorhanden.

GPT Image 2 zeigte eine stärkere Befolgung der räumlichen Anweisungen, obwohl keines der Modelle eine perfekte 7-Objekt-Anzahl mit allen Platzierungsbedingungen gleichzeitig erfüllte.

Kat. 2 · Fotorealistische Anatomie & Licht (T2I)

Prompt:

Nahaufnahme-Porträt einer ostasiatischen Frau Anfang dreißig, die ein halbvolles Kristallweinglas mit Rotwein in der rechten Hand hält, alle fünf Finger und der Daumen vollständig sichtbar, die natürlich um den Stiel und teilweise um die Kuppa greifen. Sie sitzt an einem hohen, nach Westen ausgerichteten Fenster während der goldenen Stunde. Spätnachmittagssonnenlicht fällt durch den Wein und erzeugt warme, karminrote Kaustikmuster auf ihrem linken Wangenknochen und Kieferlinie. Ihre linke Hand ruht auf einem aufgeschlagenen Hardcover-Buch auf ihrem Schoß. Fenster-Catchlights sind in beiden Augen sichtbar. Die Haut zeigt extrem detaillierte Poren, feinen Flaum, Subsurface-Scattering am Ohrläppchen und Nasenrücken. Das Haar wird von hinten mit Randlicht beleuchtet. 85-mm-Objektiv, f/2.0, geringe Schärfentiefe, fotografischer Realismus.

Dies ist historisch der schwierigste Einzelbildtest für generative Modelle.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriteriumPrüfung
1HandanatomieAlle 5 Finger + Daumen, natürlicher Griff an Stiel und Kuppa
2Kaustisches LichtWarme karminrote Muster durch Wein auf Wangenknochen projiziert
3Catchlight-KonsistenzGleiche Position und Form in beiden Augen
4Subsurface Scattering (SSS)Sichtbar an Ohrläppchen und Nasenrücken bei Gegenlicht
5Randlicht-PhysikRichtung stimmt mit Lichtquellenposition überein
6HautrealismusKein „AI-plastisches" Überschmieren; Poren und Flaum sichtbar

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine lieferte in seinem Hauptvorteil stark ab. Die Handanatomie war korrekt – Fingeranzahl genau, Griffhaltung natürlich um Stiel und Kuppa, Handgelenkwinkel physikalisch plausibel. Das allein übertrifft bereits eine Hürde, an der viele Modelle scheitern. Die Hauttextur zeigte echte Porendetails mit sichtbarem feinem Flaum und ohne plastisches Überschmieren, und das Subsurface-Scattering auf Nasenrücken und Wangenknochen erzeugte eine warme, lichtdurchlässige Qualität, die fotografisch real wirkt. Das Randlicht im Haar folgte kohärent der Fensterrichtung.

Die Kaustikprojektion war Groks schwächster Punkt. Die karminroten Lichtmuster erschienen im Gesicht, wurden jedoch als überdimensionierte, dramatisch stilisierte rote Überlagerung dargestellt – eher wie ein Farbkorrektureffekt als die feinen, weichkantigen Lichtfilamente, die physikalisch durch Sonnenlicht durch Wein entstehen. Die physikalische Plausibilität der Kaustik erfüllte den Präzisionsstandard nicht.

GPT Image 2 kehrte den Kompromiss um. Seine Kaustikdarstellung war deutlich physikalisch genauer – die warmen karminroten Muster auf dem Wangenknochen waren kleiner, diffuser und folgten der räumlichen Geometrie von Licht, das im richtigen Winkel durch ein Weinglas fällt. Dies ist das Detail, das Grok verpasste. Allerdings zahlte GPT Image 2 woanders dafür: Die Handanatomie war etwas weniger natürlich, mit Fingerwinkeln um den Stiel, die eine leichte Steifheit zeigten. Die Hauttextur neigte zur glatteren, etwas flacheren Qualität, die bei AI-Porträts üblich ist, mit weniger sichtbarer SSS-Wärme und schwächerer Randlichtintensität im Vergleich zu Grok.

Kat. 3 · Mehrsprachiges Poster (T2I)

Prompt:

Ein Vintage-Reiseplakat im Stil der 1960er-Jahre für ein fiktives Filmfestival, illustriert im Stil des kommerziellen Designs der Jahrhundertmitte. Oben auf dem Plakat, große, fette Serifen-Schriftzeichen in Chinesisch: „时光电影节" (Zeile 1), darunter in kleineren chinesischen Schriftzeichen „第七届 · 上海 · 1965年5月" (Zeile 2).

Mitte: eine stilisierte Illustration eines alten Filmprojektors, der einen Strahl auf eine leicht gebogene Kinoleinwand wirft.

Untere Mitte: ein hohes Champagner-Coupe-Glas mit dem englischen Text „GRAND OPENING NIGHT", der entlang der Wölbung der Glaskuppa dem elliptischen Perspektive folgt.

Rechter Rand, vertikaler Text: „presented by 时代影业 · TIMES PICTURES" von oben nach unten verlaufend.

Unterer Streifen: kleiner englischer Credit-Text „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" in einer Zeile.

Farbpalette: cremefarbener Hintergrund, tiefes Karminrot, Senfgelb als Akzente. Leichte Altpapierstruktur, dezentes Korn.

Bewertungscheckliste

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriteriumPrüfung
1Chinesische GenauigkeitKeine fehlenden Striche, keine halluzinierten Zeichen
2Zweisprachiges LayoutChinesisch und Englisch nicht vermischt; jedes in korrekter Zone
3Gebogener Text auf GlasEnglisch folgt der elliptischen Perspektive des Champagner-Coupes
4Vertikaler Text am rechten RandLesbar von oben nach unten
5Typografische HierarchieKlare Unterscheidung zwischen Überschrift und Untertitel
6Stil vs. Lesbarkeit1960er-Ästhetik beibehalten, ohne die Textklarheit zu opfern

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagine erzeugte ein visuell ansprechendes Poster mit starker Mid-Century-Illustrationsenergie. Es scheiterte jedoch am wichtigsten Textkriterium: Die Überschrift lautet „時光電影節" in traditionellem Chinesisch, nicht im im Prompt angegebenen vereinfachten „时光电影节". Dies ist ein Fehler in der Zeichensatzkonformität – eine bedeutende Unterscheidung für jeden Lokalisierungs- oder Publikationsanwendungsfall. Die zweite Zeile „第七屆 · 上海 · 1965年5月" verwendete ebenfalls traditionelle Zeichen. Auf der strukturellen Seite erschien „GRAND OPENING NIGHT" auf dem Champagnerglas mit teilweiser Kurvenanpassung, wobei die elliptische Perspektive jedoch nur annähernd eingehalten wurde. Der vertikale rechte Randtext „TIMES PICTURES" war lesbar. Die untere Credit-Zeile war vorhanden und lesbar. Die Farbpalette – Karminrot, Senf, Creme – war gut umgesetzt. Die Gesamtlayout-Energie war hoch, aber das Versagen bei traditionell vs. vereinfacht ist ein hartes Ausschlusskriterium für den angegebenen Prompt.

GPT Image 2 bestand den Zeichensatztest sauber: Überschrift „时光电影节" und Untertitel „第七届 · 上海 · 1965年5月" sind korrekt in vereinfachtem Chinesisch ohne fehlende Striche oder halluzinierte Glyphen dargestellt – ein direkter Compliance-Vorteil gegenüber Grok. Das Champagner-Coupe-Glas ist in der unteren Mitte sichtbar, mit „GRAND OPENING NIGHT", das überzeugend der Glaswölbung folgt. Der vertikale rechte Randtext „时代影业 · TIMES PICTURES" verläuft von oben nach unten und ist vollständig lesbar, wobei sowohl Chinesisch als auch Englisch korrekt in derselben vertikalen Spalte ohne Vermischungsfehler platziert sind. Die untere Credit-Zeile – „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" – ist vorhanden und als einzelne Zeile lesbar. Die typografische Hierarchie zwischen Überschrift, Untertitel und Fußnote ist klar eingehalten. Die Altpapierstruktur und die Mid-Century-Farbpalette sind gut umgesetzt. Die Komposition integriert eine erkennbare Silhouette der Shanghai-Skyline als zentrale Illustration, die nicht im Prompt angegeben war, aber dem Ganzen kontextuelle Authentizität verleiht, ohne Kriterien zu verletzen.

Kat. 4 · Geometrische Transformation (I2I)

Der Prompt wies das Modell an, eine Person aus einem Mode-Lookbook in Ganzkörperansicht genau 45° nach links zu drehen, wobei die Kameraposition gleich bleiben sollte. Das Referenzbild zeigte ein komplexes, mehrschichtiges Outfit: langer brauner Mantel, Lederschultercape, Pelzstola mit sichtbarem Farbverlauf (dunkelbraun → silber → creme), eine runde kupferne Brustplakette mit eingelassenem Porträt, schwarze Lederstulpenhandschuhe und zweifarbige Lederstiefel. Keines dieser Details wurde im Prompt aufgeführt – das Modell musste sie durch reines Identitätsverständnis bewahren.

7.png

Dies ist ein bewusster Belastungstest der Fähigkeiten. Die Anweisung wurde absichtlich kurz gehalten, um dem Modell nicht seinen eigenen Bewertungsrahmen zu liefern.

Bewertungscheckliste

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriteriumPrüfung
1GesichtsidentitätArcFace-Ähnlichkeit ≥ 0,5 (für Ganzkörpermaßstab gelockert)
2Pelzstola-EnthüllungZuvor verborgene rechte silberne Seite teilweise sichtbar
3BrustplaketteRunder Kupferumriss + eingelassenes Porträt + korrekte Ellipsenkompression in Perspektive
4Mantelsaum & InnenschichtenNatürlicher Fallrichtung nach Drehung; Verhältnis der freiliegenden Innenhose angemessen
5FußstellungLinks vorne
6StulpenvolumenHandposition + Stricktextur nach Drehung sichtbar
7StiefelfarbgrenzeBraun/schwarz korrekt
8HintergrundkonsistenzReiner grauer Studiohintergrund (DINO-Region ≥ 0,95)
9AusgabeformatVolles 9:16-Körperformat beibehalten, nicht auf Porträt beschnitten
10BlickrichtungFolgt der Drehung – schaut nicht weiterhin in die Kamera

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grok bewahrte die Gesichtsidentität oberhalb der ArcFace-0,5-Schwelle, die für Ganzkörperbilder angemessen ist. Der zuvor verborgene rechte Teil der Pelzstola wurde bei 45° teilweise sichtbar, mit vernünftiger Farbverlaufskontinuität. Der Umriss der Brustplakette blieb erhalten, obwohl das eingelassene Porträtdetails Kompression zeigte. Die Stiefelfarbgrenze und die Stulpentextur blieben stabil.

GPT Image 2 zeigte eine etwas stärkere Gesamtkohärenz der Kleidungsschichten, führte aber eine stärkere Abweichung der Gesichtsidentität ein – ein bedeutender Kompromiss je nach Anwendungsfall.

Kat. 5 · Lokale Bearbeitung & Regionstreue (I2I)

Der Prompt erforderte genau drei Änderungen an einer Wohnzimmerszene: Entfernen einer schlafenden Katze vom Sofa (und natürliche Wiederherstellung des Kissens), Ersetzen einer Tasse heißen Tees durch ein Glas Orangensaft mit Eis, und Hinzufügen einer zusammengeklappten schwarzgerahmten Lesebrille auf das mittlere Buch auf dem Couchtisch. Die Anweisung verbot ausdrücklich jede andere Änderung – Sofastoffmuster, Buchpositionen, Lampe, Fensteransicht, Wandfarbe, Boden.

10.png

Der Bewahrungstest ist genauso wichtig wie der Bearbeitungstest. Modelle, die die gesamte Szene neu interpretieren, während sie lokale Änderungen vornehmen, sind für die Retusche von Produktfotografie oder die iterative Szenenentwicklung unbrauchbar.

Bewertungscheckliste

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriteriumPrüfung
1Alle 3 Änderungen durchgeführtKatze entfernt
2KissenwiederherstellungKeine katzenförmige Einbuchtung oder Fellreste auf dem Sofa
3OJ-PhysikGlasgeometrie, Eisbrechung und Schattenrichtung passen zum ursprünglichen Licht
4BrillenplatzierungKorrekt auf dem mittleren Buch (nicht oben oder unten)
5SofastoffDiamantwebmuster intakt, besonders im bearbeiteten Bereich
6Bücher unverändertPositionen, Cover (rot, blau, gelb) und Stapelung unverändert
7Lampe unverändertForm, Leuchtstatus und Position beibehalten
8Fensteransicht unverändertStadtansicht bleibt unscharf und konsistent
9Wand & Boden unverändertCremeweiße Wand und heller Holzboden unverändert
10Gesamtbeleuchtung beibehaltenEinzelne rechte hintere Lichtquellenrichtung unverändert

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagine führte alle drei erforderlichen Änderungen durch. Die Katze wurde entfernt und das Sofakissen sauber wiederhergestellt, ohne sichtbare Einbuchtung oder Fellreste – das Stoffmuster im bearbeiteten Bereich hielt gut. Das Orangensaftglas erschien an der richtigen Position. Das OJ-Glas zeigt jedoch ein Glanzlichtmuster, das nicht mit dieser Quellenrichtung übereinstimmt, als ob es mit einem unabhängigen Lichtmodell zusammengesetzt und nicht in die vorhandene Beleuchtung der Szene integriert worden wäre. Der Boden des Glases zeigt auch unzureichenden Kontaktschatten auf der dunklen Holzoberfläche des Couchtisches, was einen subtilen, aber erkennbaren Schwebe-Effekt erzeugt.

GPT Image 2 führte ebenfalls alle drei Änderungen durch und zeigte eine insgesamt stärkere Szenenbewahrung. Die Katzenentfernung war ebenso sauber. Das Orangensaftglas war gut dargestellt mit korrekter Positionierung und passender Schattenrichtung relativ zur rechten Fensterlichtquelle – die Glasgeometrie und Flüssigkeitsopazität wirkten raffinierter als bei Groks Version. Die Lesebrille war sichtbar auf dem Bücherstapel platziert. Entscheidend: Die Fensteransicht blieb erhalten – die Stadt draußen ist sichtbar und unscharf, konsistent mit der Referenz, woran Grok scheiterte. Sofastoff, Lampe, Wand und Boden blieben alle erhalten. Die Bücher erscheinen in Position und Farbe konsistent. Eine bemerkenswerte Änderung: Die Szene wirkt insgesamt etwas heller und kontrastreicher als das Original, was auf eine leichte globale Licht-Neuinterpretation hindeutet und nicht auf eine echte Pixelerhaltung – eine geringfügige, aber erkennbare Abweichung.

Kat. 6 · Multi-Referenz-Fusion (I2I)

Der Prompt kombinierte drei unabhängige Referenzen: eine Porträtidentität (Latinx-Frau, bernsteinfarbene Augen, tiefbraunes welliges Haar), einen Aquarellillustrationsstil (japanische ländliche Landschaft, sichtbare Pinselstriche, warme Märchenatmosphäre) und ein Szenen-Layout (europäischer Kopfsteinpflaster-Stadtplatz bei Sonnenuntergang, gusseiserne Laterne, Steinbogen). Die Aufgabe: ein einziges kohärentes Aquarellbild der identifizierten Person zu erstellen, die in der Szene steht – kein Foto mit Filter, keine Collage.

13.png

14.png

15.png

Die Entkopplung von drei Referenzen ist der schwierigste Test in diesem Benchmark. Die meisten Modelle gewichten entweder eine Referenz übermäßig oder schaffen es nicht, eine stildurchgängige Darstellung zu erreichen.

Bewertungscheckliste

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriteriumPrüfung
1Dreifache EntkopplungIdentität, Stil und Szene getrennt erkennbar
2Vollständige StilübertragungAusgabe ist durchgehend Aquarell – nicht Foto + Filter
3Identitätserhaltung nach StilBernsteinfarbene Augen + Gesichtsstruktur durch Aquarell-Behandlung erkennbar
4Szenenstruktur bewahrtKopfsteinpflaster, Laterne und Bogenlayout intakt
5Natürliche KleidungsergänzungReisejacke und Umhängetasche hinzugefügt, ohne Komposition zu brechen
6LichtrichtungskonsistenzSonnenuntergangsglühen von links vorne auf Kopfsteinpflaster und Figur sichtbar

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagine scheiterte am Kernkriterium: Die Ausgabe ist fotorealistisch, kein Aquarell. Der Kopfsteinpflasterplatz und die Figur behalten volle fotografische Schärfe mit nur einer leichten malerischen Textur – keiner der bestimmenden Pinselstriche, Farbverläufe oder handgemalten Kantenqualitäten von Ref 2 ist vorhanden. Szenenstruktur, Identität, Kleidung und Lichtrichtung bestehen alle. Aber die Wiedergabe des falschen Mediums ist eine kategorieübergreifende Disqualifikation, kein Teilabzug.

GPT Image 2 erzielte eine echte Aquarelldarstellung über das gesamte Bild – Gebäude, Kopfsteinpflaster, Himmel und Figur tragen sichtbare Pinselarbeit und weiche Farbverläufe, die mit Ref 2 übereinstimmen. Die Szenenstruktur von Ref 3 ist intakt, die Laterne leuchtet und der Steinbogen ist im Mittelgrund sichtbar. Die Identität bleibt durch die Stiltransformation teilweise erhalten – welliges dunkles Haar und Gesichtsstruktur sind erkennbar, obwohl feine Merkmale erwartungsgemäß abstrahiert sind. Jacke, Umhängetasche, Lichtrichtung und Blick folgen dem Prompt. Dies ist die einzige Ausgabe, die die eigentliche Aufgabe erfüllte.

Teste Grok Imagine Image und GPT Image 2 Modelle über Atlas Cloud

Der Benchmark ist reproduzierbar. Sowohl Grok Imagine als auch GPT Image 2 sind jetzt über Atlas Cloud verfügbar – kein Modell-für-Modell-Abrechnungssetup, keine Wartelisten.

Warum Atlas Cloud

  • Ein API-Schlüssel, über 300 Modelle. Wechsle zwischen Grok, GPT Image 2, Flux, Wan, Seedream und jedem anderen Modell im Pool, indem du ein einziges Modellfeld änderst. Derselbe Schlüssel, derselbe Endpunkt, dasselbe Abrechnungs-Dashboard – ob du einen Sechs-Modell-Benchmark durchführst oder eine Produktionsbild-Pipeline baust.
  • Volle Modalitätsabdeckung. LLMs, Text-zu-Bild, Bild-zu-Bild, Text-zu-Video, Bild-zu-Video – alles unter einem Dach. Wenn dein Workflow ein Sprachmodell zur Prompt-Verfeinerung und ein Bildmodell zur Generierung benötigt, beide leben in derselben API.
  • Keine Cold Starts, keine Rate-Limit-Überraschungen. Atlas Cloud läuft auf optimierter Inferenzinfrastruktur, die für Durchsatz ausgelegt ist. Du erhältst konsistente Latenzzeiten, egal ob du einen Aufruf oder tausend tätigst.
  • Entwickelt für Vergleichs-Workflows. Der genaue Anwendungsfall, den dieser Benchmark demonstriert – identische Prompts über mehrere Modelle ausführen und Ausgaben vergleichen – ist das, wofür die Architektur von Atlas Cloud entwickelt wurde. Ein Schlüssel, eine Rechnung, volle Modellbreite.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden