Przetestowaliśmy modele Grok Imagine Image i GPT Image-2 na 6 identycznych, neutralnych wobec modeli promptach, obejmujących semantykę kompozycyjną, fotorealistyczną anatomię, renderowanie tekstu wielojęzycznego, transformację geometryczną, edycję lokalną i fuzję wielu referencji.
Zarówno model Grok Imagine Image, jak i GPT Image-2 są dostępne za pomocą jednego klucza API Atlas Cloud, co pozwala na odtworzenie tego benchmarku w kilka minut.
Dlaczego powstał ten benchmark porównania modeli AI do generowania obrazów
Każde „porównanie modeli AI do generowania obrazów", które znajdziesz w sieci, wpada w tę samą pułapkę: starannie wybrane prompty, selekcja najlepszego z pięciu wyników i niepotwierdzone twierdzenia. Ten benchmark został zbudowany w oparciu o zasady Tier A: neutralne wobec modeli prompty, identyczne dane wejściowe dla wszystkich modeli, domyślny output przy pojedynczym ziarnie (bez cherry-pickingu) oraz kryteria oceny, które można opisać jednym zdaniem na kategorię.
Sześć modeli biorących udział w pełnym benchmarku: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 i Seedream 5.0. Ten artykuł skupia się na bezpośrednim porównaniu Grok vs GPT Image 2, jako najbardziej komercyjnie istotnej parze dla programistów wybierających domyślny model generowania obrazów.
Jak testowaliśmy Grok Imagine Image vs GPT-Image 2: 6 kategorii, jedna zasada Tier A
Każdy prompt celuje w jeden, jasno określony wymiar możliwości. Kryteria zaliczenia/niezaliczenia zostały zdefiniowane przed uruchomieniem modeli, a nie po obejrzeniu wyników.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| Kategoria | Testowany główny wymiar | Jednozdaniowe kryterium zaliczenia/niezaliczenia |
|---|---|---|
| Kat 1 · Semantyka kompozycyjna | Dopasowanie do instrukcji | Czy model policzył 7 obiektów, umieścił je poprawnie i przestrzegał listy negacji? |
| Kat 2 · Fotorealistyczna anatomia i światło | Jakość wizualna i fizyka | Czy wszystkie 5 palców jest anatomicznie poprawnych, a na twarzy pojawiają się kaustyczne wzory świetlne? |
| Kat 3 · Wielojęzyczny plakat | Renderowanie tekstu w obrazie | Czy znaki chińskie i angielskie są poprawnie wyrenderowane, bez brakujących kresek ani halucynacyjnych glifów? |
| Kat 4 · Transformacja geometryczna (I2I) | Sterowalność edycji + tożsamość | Czy po obrocie o 45° osoba jest nadal rozpoznawalna, a wszystkie szczegóły ubioru zachowane? |
| Kat 5 · Edycja lokalna i zachowanie regionu | Precyzja edycji | Czy wykonano dokładnie 3 edycje, a reszta pozostała niezmieniona na poziomie pikseli? |
| Kat 6 · Fuzja wielu referencji | Spójność między obrazami | Czy tożsamość, styl i scena z 3 oddzielnych referencji łączą się w jeden spójny obraz? |
Chcesz samodzielnie porównać GPT Image 2 i Grok Imagine na tym samym prompcie? Porównanie modeli Atlas Cloud uruchamia je obok siebie w jednym przejściu — identyczny prompt, cena wyświetlona przed generowaniem — abyś mógł ocenić je klatka po klatce.

GPT Image 2 i Grok Imagine na identycznym prompcie w porównaniu modeli Atlas Cloud — ten sam prompt, cena pokazana przed generowaniem. Zarejestrowane na żywo w model-explorer.
Kat 1 · Semantyka kompozycyjna (T2I)
Prompt:
Zdjęcie z góry (flat-lay) drewnianego stołu jadalnego zawierającego dokładnie siedem ceramicznych przedmiotów: trzy identyczne białe filiżanki do herbaty ułożone w trójkąt równoboczny na środku, dwie czarne miski umieszczone po prawej stronie filiżanek, jedno czerwone jabłko leżące w lewej czarnej misce oraz jedną pustą drewnianą łyżkę spoczywającą na prawej czarnej misce z uchwytem skierowanym w lewy górny róg kadru. Brak kubków do kawy, metalowych przedmiotów, talerzy, szklanych naczyń. Miękkie, rozproszone światło okienne z lewego górnego rogu, późny poranek. Realistyczne zdjęcie, bez elementów stylizacyjnych.
To celowo trudny test. Liczenie, język przestrzenny („po prawej stronie", „lewa") i klauzule negacji są znanymi słabościami wszystkich obecnych architektur opartych na dyfuzji.
Lista kontrolna oceny
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kryterium | Sprawdzenie |
| 1 | Liczba obiektów | Ściśle 7 ceramicznych obiektów |
| 2 | Trzy białe filiżanki | Ułożenie w trójkąt równoboczny |
| 3 | Dwie czarne miski | Umieszczone po prawej stronie filiżanek |
| 4 | Czerwone jabłko | Wewnątrz lewej czarnej miski |
| 5 | Drewniana łyżka | Spoczywająca na prawej misce, uchwyt skierowany w lewy górny róg |
| 6 | Zgodność z negacją | Brak kubków do kawy / metalu / talerzy / szklanych naczyń |
| 7 | Źródło światła | Miękkie światło rozproszone z lewego górnego rogu, wszystkie cienie spójne |
| 8 | Styl fotograficzny | Brak stylizacyjnych sztamp (liście palmowe, świece itp.) |
Grok Imagine Image
GPT-Image 2
Prompt wymaga wygenerowania zdjęcia z góry, ze ściśle siedmioma ceramicznymi naczyniami i określonymi relacjami przestrzennymi: trzy białe filiżanki ułożone w trójkąt równoboczny na środku, dwie czarne miski po prawej stronie filiżanek, czerwone jabłko w lewej misce, drewniana łyżka na prawej misce z uchwytem w lewym górnym rogu. Instrukcje negatywne: brak kubków do kawy, metalowych przedmiotów, talerzy, szklanych naczyń.
Grok Imagine – liczba obiektów: widocznie 5 filiżanek (zamiast 3), ułożonych w skupisku, a nie w trójkącie równobocznym. Dwie czarne miski są obecne, czerwone jabłko prawidłowo w jednej z nich. Drewniana łyżka jest obecna i spoczywa na prawej misce, kierunek uchwytu mniej więcej w lewy górny róg – to kryterium jest spełnione. Zgodność z negacją jest czysta: brak kubków do kawy, metalu, talerzy, szklanych naczyń. Źródło światła z lewego górnego rogu z spójnymi cieniami – zaliczone. Brak elementów stylizacyjnych.
GPT Image 2 wykazał się silniejszym przestrzeganiem instrukcji w zakresie komponentów przestrzennych, choć żaden model nie osiągnął idealnej liczby 7 obiektów przy jednoczesnym spełnieniu wszystkich ograniczeń dotyczących rozmieszczenia.
Kat 2 · Fotorealistyczna anatomia i światło (T2I)
Prompt:
Zbliżenie portretowe kobiety z Azji Wschodniej około trzydziestki, trzymającej w prawej dłoni do połowy wypełniony kryształowy kieliszek do wina z czerwonym winem, wszystkie pięć palców i kciuk w pełni widoczne, naturalnie owijające się wokół nóżki i częściowo wokół czaszy. Siedzi przy wysokim oknie wychodzącym na zachód w godzinie złotej. Późnopopołudniowe światło słoneczne przecina wino, tworząc ciepłe, karmazynowe wzory kaustyczne na lewym policzku i linii żuchwy. Lewa dłoń spoczywa na otwartej twardej książce na kolanach. W obu oczach widoczne odbicia okna. Skóra wykazuje bardzo szczegółowe pory, delikatny meszek, podpowierzchniowe rozpraszanie na płatku ucha i grzbiecie nosa. Włosy podświetlone od tyłu światłem konturowym. Obiektyw 85 mm, f/2.0, mała głębia ostrości, fotorealizm.
To historycznie najtrudniejszy test pojedynczego obrazu dla modeli generatywnych.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kryterium | Sprawdzenie |
|---|---|---|
| 1 | Anatomia dłoni | Wszystkie 5 palców + kciuk, naturalny chwyt za nóżkę i czaszę |
| 2 | Światło kaustyczne | Ciepłe, karmazynowe wzory z wina rzutowane na kość policzkową |
| 3 | Spójność odbić w oczach | Ta sama pozycja i kształt w obu oczach |
| 4 | Podpowierzchniowe rozpraszanie (SSS) | Widoczne na płatku ucha i grzbiecie nosa przy podświetleniu od tyłu |
| 5 | Fizyka światła konturowego | Kierunek zgodny z pozycją źródła światła |
| 6 | Realizm skóry | Brak „sztucznego" wygładzenia; widoczne pory i meszek |
Grok Imagine Image
GPT-Image 2
Grok Imagine mocno zademonstrował swoją główną przewagę. Anatomia dłoni była poprawna – liczba palców zgodna, postawa chwytu naturalna wokół nóżki i czaszy, kąt nadgarstka fizycznie możliwy. To samo w sobie przekracza poprzeczkę, którą wiele modeli zawala. Tekstura skóry ukazywała rzeczywisty poziom szczegółowości porów z widocznym delikatnym meszkiem i bez sztucznego wygładzenia, a podpowierzchniowe rozpraszanie na grzbiecie nosa i kościach policzkowych dawało ciepłą, przepuszczającą światło jakość, która wygląda fotorealistycznie. Światło konturowe na włosach było spójne z kierunkiem źródła okiennego.
Rzutowanie światła kaustycznego było najsłabszym punktem Groka. Karmazynowe wzory świetlne pojawiły się na twarzy, ale były wyrenderowane jako przesadnie duża, dramatycznie stylizowana czerwona nakładka – bardziej przypominająca efekt korekcji kolorów niż drobne, miękkie włókna światła, które fizycznie powstają, gdy światło słoneczne przechodzi przez wino. Fizyczna wiarygodność kaustyki nie spełniła precyzyjnego standardu.
GPT Image 2 odwrócił ten kompromis. Jego renderowanie światła kaustycznego było zauważalnie bardziej fizycznie poprawne – ciepłe karmazynowe wzory na kości policzkowej były mniejsze, bardziej rozproszone i zgodne z geometrią przestrzenną światła przechodzącego przez kieliszek pod odpowiednim kątem. To jest szczegół, który Grok pominął. Jednak GPT Image 2 zapłacił za to gdzie indziej: anatomia dłoni była nieco mniej naturalna, z kątami palców wokół nóżki wykazującymi lekką sztywność. Tekstura skóry skłaniała się ku gładszej, nieco bardziej płaskiej jakości typowej dla AI portretów, z mniej widocznym ciepłem SSS i słabszym światłem konturowym w porównaniu z Grokiem.
Kat 3 · Wielojęzyczny plakat (T2I)
Prompt:
Wintage'owy plakat podróżniczy w stylu lat 60. dla fikcyjnego festiwalu filmowego, ilustrowany w stylu komercyjnym z połowy wieku. Na górze plakatu, duże pogrubione szeryfowe chińskie znaki: „时光电影节" (linia 1), a poniżej mniejsze chińskie znaki: „第七届 · 上海 · 1965年5月" (linia 2). Na środku: stylizowana ilustracja starego projektora filmowego rzucającego wiązkę na lekko zakrzywiony ekran kinowy. Niżej na środku: wysoki kieliszek coupe do szampana z angielskim tekstem „GRAND OPENING NIGHT" owijającym się wzdłuż krzywizny czaszy, zgodnie z eliptyczną perspektywą. Na prawej krawędzi, pionowy tekst: „presented by 时代影业 · TIMES PICTURES" biegnący od góry do dołu. Na dole pasek z małym angielskim tekstem: „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" w jednej linii. Paleta kolorów: kremowo-białe tło, głęboka karmazynowa czerwień, akcenty musztardowego żółtego. Lekka tekstura postarzanego papieru, subtelne ziarno.
Lista kontrolna oceny
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kryterium | Sprawdzenie |
|---|---|---|
| 1 | Poprawność chińskich znaków | Brak brakujących kresek, brak halucynacyjnych znaków w |
| 2 | Układ dwujęzyczny | Chiński i angielski nie są wymieszane; każdy pojawia się w poprawnej strefie |
| 3 | Zakrzywiony tekst na szkle | Angielski podąża za eliptyczną perspektywą kieliszka coupe |
| 4 | Pionowy tekst na prawej krawędzi | Czytelny od góry do dołu |
| 5 | Hierarchia typograficzna | Wyraźne rozróżnienie między nagłówkiem |
| 6 | Styl a czytelność | Estetyka lat 60. zachowana bez poświęcania czytelności tekstu |
Grok Imagine Image
GPT-Image 2
Grok Imagine wygenerował wizualnie uderzający plakat z silną energią ilustracji z połowy wieku. Jednak nie spełnił najważniejszego kryterium tekstowego: nagłówek zawiera znaki w tradycyjnym chińskim „時光電影節", a nie w uproszczonym „时光电影节" określonym w prompcie. Jest to naruszenie zgodności zestawu znaków – znaczące rozróżnienie dla każdego przypadku użycia związanego z lokalizacją lub publikacją. Drugi wiersz „第七屆 · 上海 · 1965年5月" również używał znaków tradycyjnych. Stroną strukturalną, „GRAND OPENING NIGHT" pojawiło się na kieliszku z częściowym podążaniem za krzywizną, choć zgodność z perspektywą eliptyczną była przybliżona. Pionowy tekst na prawej krawędzi „TIMES PICTURES" był czytelny. Dolny wiersz z napisami był obecny i czytelny. Paleta kolorów – karmazyn, musztarda, krem – była dobrze zrealizowana. Ogólny układ energetyczny był wysoki, ale porażka w zakresie tradycyjnego vs uproszczonego chińskiego jest twardym dyskwalifikatorem dla określonego promptu.
GPT Image 2 przeszedł test zestawu znaków czysto: nagłówek „时光电影节" i podtytuł „第七届 · 上海 · 1965年5月" są poprawnie wyrenderowane w uproszczonym chińskim bez brakujących kresek ani halucynacyjnych glifów – bezpośrednia przewaga nad Grokiem. Kieliszek coupe do szampana jest widoczny w dolnej środkowej części z tekstem „GRAND OPENING NIGHT" przekonująco podążającym za krzywizną szkła. Pionowy tekst na prawej krawędzi „时代影业 · TIMES PICTURES" biegnie od góry do dołu i jest w pełni czytelny, z obiema wersjami językowymi prawidłowo umieszczonymi w tej samej pionowej kolumnie bez błędów mieszania. Dolny wiersz napisów – „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" – jest obecny i czytelny jako jedna linia. Hierarchia typograficzna między nagłówkiem, podtytułem i przypisem jest wyraźnie zachowana. Tekstura postarzanego papieru i paleta kolorów z połowy wieku są dobrze zrealizowane. Kompozycja integruje rozpoznawalną sylwetkę panoramy Szanghaju jako centralną ilustrację, co nie było określone w prompcie, ale dodaje kontekstowej autentyczności bez łamania żadnego kryterium.
Kat 4 · Transformacja geometryczna (I2I)
Prompt nakazał modelowi obrócenie obiektu z pełnopostaciowego lookbooka modowego dokładnie o 45° w lewo, przy zachowaniu tej samej pozycji kamery. Obraz referencyjny przedstawiał złożony, warstwowy strój: długi brązowy płaszcz, skórzana peleryna na ramiona, futrzana etola z widocznym gradientem (ciemny brąz → srebro → krem), okrągła miedziana odznaka na piersi z wbudowanym portretem, czarne skórzane rękawice i dwukolorowe skórzane buty. Żaden z tych szczegółów nie został wymieniony w prompcie – model musiał je zachować dzięki samemu rozumieniu tożsamości.

To celowy test wytrzymałościowy możliwości. Instrukcja była celowo krótka, aby nie podawać modelowi własnej rubryki oceny.
Lista kontrolna oceny
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kryterium | Sprawdzenie |
|---|---|---|
| 1 | Tożsamość twarzy | Podobieństwo ArcFace ≥ 0,5 (złagodzone dla skali pełnej sylwetki) |
| 2 | Odsłonięcie futrzanej etoli | Wcześniej ukryta prawa srebrna część |
| 3 | Odznaka na piersi | Okrągły miedziany kontur + wbudowany portret + poprawna kompresja eliptycznej perspektywy |
| 4 | Dół płaszcza i warstwy wewnętrzne | Naturalny kierunek fałd po obrocie; proporcja odsłoniętych spodni rozsądna |
| 5 | Pozycja stóp | Lewa z przodu |
| 6 | Objętość rękawic | Pozycja dłoni + tekstura dzianiny widoczna po obrocie |
| 7 | Granica koloru butów | Brązowa |
| 8 | Spójność tła | Czyste szare tło studyjne (region DINO ≥ 0,95) |
| 9 | Proporcje wyjścia | Zachowana pełna sylwetka w formacie 9:16, nie przycięta do portretu |
| 10 | Kierunek spojrzenia | Podąża za obrotem – nie kontynuuje patrzenia w kamerę |
Grok Imagine Image
GPT-Image 2
Grok utrzymał tożsamość twarzy powyżej progu ArcFace 0,5 odpowiedniego dla obrazów pełnopostaciowych. Wcześniej ukryta prawa strona futrzanej etoli stała się częściowo widoczna przy 45°, z rozsądną ciągłością gradientu. Kontur odznaki na piersi został zachowany, choć szczegóły wbudowanego portretu wykazały kompresję. Granica koloru butów i tekstura rękawic utrzymały się.
GPT Image 2 wykazał nieco silniejszą ogólną spójność warstw odzieży, ale wprowadził większe przesunięcie tożsamości twarzy – znaczący kompromis w zależności od przypadku użycia.
Kat 5 · Edycja lokalna i zachowanie regionu (I2I)
Prompt wymagał dokładnie trzech edycji w scenie salonu: usunięcie śpiącego kota z sofy (i naturalne odtworzenie poduszki), zastąpienie filiżanki gorącej herbaty szklanką soku pomarańczowego z lodem oraz dodanie złożonych okularów do czytania w czarnej oprawce na środkowej książce na stoliku kawowym. Instrukcja wyraźnie zabraniała zmiany czegokolwiek innego – wzoru tkaniny sofy, pozycji książek, lampy, widoku z okna, koloru ściany, podłogi.

Test zachowania jest równie ważny jak test edycji. Modele, które reinterpretują całą scenę podczas wprowadzania lokalnych zmian, nie nadają się do retuszu zdjęć produktowych ani iteracyjnego tworzenia scen.
Lista kontrolna oceny
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kryterium | Sprawdzenie |
|---|---|---|
| 1 | Wszystkie 3 edycje wykonane | Kot usunięty |
| 2 | Odtworzenie poduszki | Brak wgniecenia w kształcie kota ani resztek futra na sofie |
| 3 | Fizyka soku | Geometria szkła, refrakcja lodu i kierunek cienia zgodne z oryginalnym światłem filiżanki |
| 4 | Umieszczenie okularów | Prawidłowo na środkowej książce (nie na górnej ani dolnej) |
| 5 | Tkanina sofy | Wzór diamentowego splotu nienaruszony, szczególnie w edytowanym obszarze |
| 6 | Książki niezmienione | Pozycje, okładki (czerwona |
| 7 | Lampa niezmieniona | Kształt, stan świecenia i pozycja zachowane |
| 8 | Widok z okna niezmieniony | Widok miasta pozostaje rozmyty i spójny |
| 9 | Ściana i podłoga niezmienione | Ściana w kolorze złamanej bieli i jasna drewniana podłoga niezmienione |
| 10 | Ogólne oświetlenie zachowane | Kierunek pojedynczego, tylnego prawego źródła światła niezmieniony |
Grok Imagine Image
GPT-Image 2
Grok Imagine wykonał wszystkie trzy wymagane edycje. Kot został usunięty, a poduszka sofy czysto odtworzona bez widocznego wgniecenia ani resztek futra – wzór tkaniny w edytowanym obszarze dobrze się utrzymał. Szklanka soku pomarańczowego pojawiła się we właściwym miejscu. Jednak szklanka soku wykazuje wzór odblasku, który nie jest zgodny z tym kierunkiem źródła światła, wyglądając, jakby była skomponowana z niezależnym modelem oświetlenia, a nie zintegrowana z istniejącym oświetleniem sceny. Podstawa szklanki ma również niewystarczający cień kontaktowy z ciemną drewnianą powierzchnią stolika kawowego, tworząc subtelny, ale wykrywalny efekt unoszenia się.
GPT Image 2 również wykonał wszystkie trzy edycje i wykazał się silniejszym ogólnym zachowaniem sceny. Usunięcie kota było równie czyste. Szklanka soku pomarańczowego była dobrze wyrenderowana z prawidłowym pozycjonowaniem i zgodnym kierunkiem cienia w stosunku do prawego okiennego źródła światła – geometria szkła i nieprzezroczystość cieczy wydają się bardziej dopracowane niż w wersji Groka. Okulary do czytania zostały widocznie umieszczone na stosie książek. Kluczowe znaczenie ma fakt, że widok z okna został zachowany – miasto na zewnątrz pozostaje widoczne i rozmyte, zgodne z referencją, gdzie Grok zawiódł. Tkanina sofy, lampa, ściana i podłoga – wszystko utrzymane. Książki wydają się spójne pod względem pozycji i koloru. Jedna zauważalna zmiana: scena ogólnie wydaje się nieco jaśniejsza i bardziej kontrastowa niż oryginał, co sugeruje pewną globalną reinterpretację oświetlenia, a nie prawdziwe zachowanie na poziomie pikseli – niewielkie, ale wykrywalne przesunięcie.
Kat 6 · Fuzja wielu referencji (I2I)
Prompt łączył trzy niezależne referencje: tożsamość portretową (kobieta latynoska, bursztynowe oczy, głębokie brązowe falujące włosy), styl ilustracji akwarelowej (japoński wiejski krajobraz, widoczne pociągnięcia pędzla, ciepła baśniowa atmosfera) oraz układ sceny (europejski brukowany rynek o zachodzie słońca, żeliwna latarnia, kamienny łuk). Zadanie: wyprodukowanie jednego spójnego akwarelowego obrazu przedstawiającego zidentyfikowaną osobę stojącą w tej scenie – nie zdjęcie z filtrem, nie kolaż.



Rozdzielenie trzech referencji to najtrudniejszy test w tym benchmarku. Większość modeli albo zbyt mocno waży jedną referencję, albo nie osiąga renderowania przez styl.
Lista kontrolna oceny
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Kryterium | Sprawdzenie |
|---|---|---|
| 1 | Rozdzielenie trzech referencji | Tożsamość |
| 2 | Pełna transfer stylu | Wynik w całości akwarelowy – nie zdjęcie + filtr |
| 3 | Zachowanie tożsamości po stylizacji | Bursztynowe oczy + struktura twarzy rozpoznawalne przez akwarelowe przetworzenie |
| 4 | Struktura sceny zachowana | Bruk, latarnia i układ łuku nienaruszone |
| 5 | Naturalne dodanie ubioru | Podróżny płaszcz i torba dodane bez łamania kompozycji |
| 6 | Spójność kierunku światła | Blask zachodu słońca z lewej strony kamery widoczny na bruku i postaci |
Grok Imagine Image
GPT-Image 2
Grok Imagine nie spełnił podstawowego kryterium: wynik jest fotorealistyczny, a nie akwarelowy. Brukowany plac i postać zachowują pełną fotograficzną ostrość z tylko lekką teksturą malarską – brak definiujących pociągnięć pędzla, krwawienia kolorów czy ręcznie malowanej jakości krawędzi z referencji 2. Struktura sceny, tożsamość, ubiór i kierunek światła – wszystko zaliczone. Ale renderowanie w zupełnie innym medium jest dyskwalifikacją na poziomie kategorii, a nie częściową utratą punktów.
GPT Image 2 osiągnął autentyczne akwarelowe renderowanie na całym kadrze – budynki, bruk, niebo i postać niosą widoczne pociągnięcia pędzla i miękkie krwawienie kolorów zgodne z referencją 2. Struktura sceny z referencji 3 jest nienaruszona, latarnia jest zapalona, a kamienny łuk widoczny w średnim planie. Tożsamość jest częściowo zachowana przez transformację stylu – falujące ciemne włosy i struktura twarzy są rozpoznawalne, choć drobne rysy są zgodnie z oczekiwaniami wyabstrahowane. Płaszcz, torba, kierunek światła i spojrzenie – wszystko zgodne z promptem. Jest to jedyny wynik, który wykonał rzeczywiste zadanie.
Wypróbuj modele Grok Imagine Image i GPT Image 2 przez Atlas Cloud
Benchmark jest odtwarzalny. Zarówno Grok Imagine, jak i GPT Image 2 są dostępne teraz przez Atlas Cloud – bez konfiguracji rozliczeń per model, bez list oczekujących.
Dlaczego Atlas Cloud
- Jeden klucz API, 300+ modeli. Przełączaj się między Grok, GPT Image 2, Flux, Wan, Seedream i każdym innym modelem w puli, zmieniając jedno pole modelu. Ten sam klucz, ten sam endpoint, ten sam panel rozliczeniowy – niezależnie od tego, czy uruchamiasz benchmark sześciu modeli, czy budujesz produkcyjny pipeline obrazów.
- Pełne pokrycie modalności. LLM, tekst-obraz, obraz-obraz, tekst-wideo, obraz-wideo – wszystko pod jednym dachem. Jeśli Twój workflow potrzebuje modelu językowego do udoskonalania promptu i modelu obrazu do generowania, oba działają w tym samym API.
- Brak zimnych startów, brak niespodzianek z limitem szybkości. Atlas Cloud działa na zoptymalizowanej infrastrukturze inferencyjnej zaprojektowanej z myślą o przepustowości. Otrzymujesz spójne opóźnienia niezależnie od tego, czy wykonujesz jedno wywołanie, czy tysiąc.
- Zbudowany dla workflowów porównawczych. Dokładnie ten przypadek użycia, który demonstruje ten benchmark – uruchamianie identycznych promptów na wielu modelach i porównywanie wyników – jest tym, do czego zaprojektowana jest architektura Atlas Cloud. Jeden klucz, jeden rachunek, pełna szerokość modeli.







