Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

Daliśmy GPT Image 2 i Grok Imagine te same 6 promptów. Oto dokładnie, co otrzymaliśmy.

XAI Grok Imagine vs GPT Image 2 przetestowane pod kątem anatomii, tekstu chińskiego, miejscowych edycji i fuzji wieloreferencyjnej. Pojedyncze ziarno, bez wybierania najlepszych wyników. Oba przez Atlas Cloud.

Daliśmy GPT Image 2 i Grok Imagine te same 6 promptów. Oto dokładnie, co otrzymaliśmy.

Przetestowaliśmy modele Grok Imagine Image i GPT Image-2 na 6 identycznych, neutralnych wobec modeli promptach, obejmujących semantykę kompozycyjną, fotorealistyczną anatomię, renderowanie tekstu wielojęzycznego, transformację geometryczną, edycję lokalną i fuzję wielu referencji.

Zarówno model Grok Imagine Image, jak i GPT Image-2 są dostępne za pomocą jednego klucza API Atlas Cloud, co pozwala na odtworzenie tego benchmarku w kilka minut.

Dlaczego powstał ten benchmark porównania modeli AI do generowania obrazów

Każde „porównanie modeli AI do generowania obrazów", które znajdziesz w sieci, wpada w tę samą pułapkę: starannie wybrane prompty, selekcja najlepszego z pięciu wyników i niepotwierdzone twierdzenia. Ten benchmark został zbudowany w oparciu o zasady Tier A: neutralne wobec modeli prompty, identyczne dane wejściowe dla wszystkich modeli, domyślny output przy pojedynczym ziarnie (bez cherry-pickingu) oraz kryteria oceny, które można opisać jednym zdaniem na kategorię.

Sześć modeli biorących udział w pełnym benchmarku: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 i Seedream 5.0. Ten artykuł skupia się na bezpośrednim porównaniu Grok vs GPT Image 2, jako najbardziej komercyjnie istotnej parze dla programistów wybierających domyślny model generowania obrazów.

Jak testowaliśmy Grok Imagine Image vs GPT-Image 2: 6 kategorii, jedna zasada Tier A

Każdy prompt celuje w jeden, jasno określony wymiar możliwości. Kryteria zaliczenia/niezaliczenia zostały zdefiniowane przed uruchomieniem modeli, a nie po obejrzeniu wyników.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

KategoriaTestowany główny wymiarJednozdaniowe kryterium zaliczenia/niezaliczenia
Kat 1 · Semantyka kompozycyjnaDopasowanie do instrukcjiCzy model policzył 7 obiektów, umieścił je poprawnie i przestrzegał listy negacji?
Kat 2 · Fotorealistyczna anatomia i światłoJakość wizualna i fizykaCzy wszystkie 5 palców jest anatomicznie poprawnych, a na twarzy pojawiają się kaustyczne wzory świetlne?
Kat 3 · Wielojęzyczny plakatRenderowanie tekstu w obrazieCzy znaki chińskie i angielskie są poprawnie wyrenderowane, bez brakujących kresek ani halucynacyjnych glifów?
Kat 4 · Transformacja geometryczna (I2I)Sterowalność edycji + tożsamośćCzy po obrocie o 45° osoba jest nadal rozpoznawalna, a wszystkie szczegóły ubioru zachowane?
Kat 5 · Edycja lokalna i zachowanie regionuPrecyzja edycjiCzy wykonano dokładnie 3 edycje, a reszta pozostała niezmieniona na poziomie pikseli?
Kat 6 · Fuzja wielu referencjiSpójność między obrazamiCzy tożsamość, styl i scena z 3 oddzielnych referencji łączą się w jeden spójny obraz?

Chcesz samodzielnie porównać GPT Image 2 i Grok Imagine na tym samym prompcie? Porównanie modeli Atlas Cloud uruchamia je obok siebie w jednym przejściu — identyczny prompt, cena wyświetlona przed generowaniem — abyś mógł ocenić je klatka po klatce.

GPT Image 2 i Grok Imagine na identycznym prompcie w porównaniu modeli Atlas Cloud — ten sam prompt, cena pokazana przed generowaniem. Zarejestrowane na żywo w model-explorer

GPT Image 2 i Grok Imagine na identycznym prompcie w porównaniu modeli Atlas Cloud — ten sam prompt, cena pokazana przed generowaniem. Zarejestrowane na żywo w model-explorer.

Kat 1 · Semantyka kompozycyjna (T2I)

Prompt:

Zdjęcie z góry (flat-lay) drewnianego stołu jadalnego zawierającego dokładnie siedem ceramicznych przedmiotów: trzy identyczne białe filiżanki do herbaty ułożone w trójkąt równoboczny na środku, dwie czarne miski umieszczone po prawej stronie filiżanek, jedno czerwone jabłko leżące w lewej czarnej misce oraz jedną pustą drewnianą łyżkę spoczywającą na prawej czarnej misce z uchwytem skierowanym w lewy górny róg kadru. Brak kubków do kawy, metalowych przedmiotów, talerzy, szklanych naczyń. Miękkie, rozproszone światło okienne z lewego górnego rogu, późny poranek. Realistyczne zdjęcie, bez elementów stylizacyjnych.

To celowo trudny test. Liczenie, język przestrzenny („po prawej stronie", „lewa") i klauzule negacji są znanymi słabościami wszystkich obecnych architektur opartych na dyfuzji.

Lista kontrolna oceny

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KryteriumSprawdzenie
1Liczba obiektówŚciśle 7 ceramicznych obiektów
2Trzy białe filiżankiUłożenie w trójkąt równoboczny
3Dwie czarne miskiUmieszczone po prawej stronie filiżanek
4Czerwone jabłkoWewnątrz lewej czarnej miski
5Drewniana łyżkaSpoczywająca na prawej misce, uchwyt skierowany w lewy górny róg
6Zgodność z negacjąBrak kubków do kawy / metalu / talerzy / szklanych naczyń
7Źródło światłaMiękkie światło rozproszone z lewego górnego rogu, wszystkie cienie spójne
8Styl fotograficznyBrak stylizacyjnych sztamp (liście palmowe, świece itp.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Prompt wymaga wygenerowania zdjęcia z góry, ze ściśle siedmioma ceramicznymi naczyniami i określonymi relacjami przestrzennymi: trzy białe filiżanki ułożone w trójkąt równoboczny na środku, dwie czarne miski po prawej stronie filiżanek, czerwone jabłko w lewej misce, drewniana łyżka na prawej misce z uchwytem w lewym górnym rogu. Instrukcje negatywne: brak kubków do kawy, metalowych przedmiotów, talerzy, szklanych naczyń.

Grok Imagine – liczba obiektów: widocznie 5 filiżanek (zamiast 3), ułożonych w skupisku, a nie w trójkącie równobocznym. Dwie czarne miski są obecne, czerwone jabłko prawidłowo w jednej z nich. Drewniana łyżka jest obecna i spoczywa na prawej misce, kierunek uchwytu mniej więcej w lewy górny róg – to kryterium jest spełnione. Zgodność z negacją jest czysta: brak kubków do kawy, metalu, talerzy, szklanych naczyń. Źródło światła z lewego górnego rogu z spójnymi cieniami – zaliczone. Brak elementów stylizacyjnych.

GPT Image 2 wykazał się silniejszym przestrzeganiem instrukcji w zakresie komponentów przestrzennych, choć żaden model nie osiągnął idealnej liczby 7 obiektów przy jednoczesnym spełnieniu wszystkich ograniczeń dotyczących rozmieszczenia.

Kat 2 · Fotorealistyczna anatomia i światło (T2I)

Prompt:

Zbliżenie portretowe kobiety z Azji Wschodniej około trzydziestki, trzymającej w prawej dłoni do połowy wypełniony kryształowy kieliszek do wina z czerwonym winem, wszystkie pięć palców i kciuk w pełni widoczne, naturalnie owijające się wokół nóżki i częściowo wokół czaszy. Siedzi przy wysokim oknie wychodzącym na zachód w godzinie złotej. Późnopopołudniowe światło słoneczne przecina wino, tworząc ciepłe, karmazynowe wzory kaustyczne na lewym policzku i linii żuchwy. Lewa dłoń spoczywa na otwartej twardej książce na kolanach. W obu oczach widoczne odbicia okna. Skóra wykazuje bardzo szczegółowe pory, delikatny meszek, podpowierzchniowe rozpraszanie na płatku ucha i grzbiecie nosa. Włosy podświetlone od tyłu światłem konturowym. Obiektyw 85 mm, f/2.0, mała głębia ostrości, fotorealizm.

To historycznie najtrudniejszy test pojedynczego obrazu dla modeli generatywnych.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KryteriumSprawdzenie
1Anatomia dłoniWszystkie 5 palców + kciuk, naturalny chwyt za nóżkę i czaszę
2Światło kaustyczneCiepłe, karmazynowe wzory z wina rzutowane na kość policzkową
3Spójność odbić w oczachTa sama pozycja i kształt w obu oczach
4Podpowierzchniowe rozpraszanie (SSS)Widoczne na płatku ucha i grzbiecie nosa przy podświetleniu od tyłu
5Fizyka światła konturowegoKierunek zgodny z pozycją źródła światła
6Realizm skóryBrak „sztucznego" wygładzenia; widoczne pory i meszek

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine mocno zademonstrował swoją główną przewagę. Anatomia dłoni była poprawna – liczba palców zgodna, postawa chwytu naturalna wokół nóżki i czaszy, kąt nadgarstka fizycznie możliwy. To samo w sobie przekracza poprzeczkę, którą wiele modeli zawala. Tekstura skóry ukazywała rzeczywisty poziom szczegółowości porów z widocznym delikatnym meszkiem i bez sztucznego wygładzenia, a podpowierzchniowe rozpraszanie na grzbiecie nosa i kościach policzkowych dawało ciepłą, przepuszczającą światło jakość, która wygląda fotorealistycznie. Światło konturowe na włosach było spójne z kierunkiem źródła okiennego.

Rzutowanie światła kaustycznego było najsłabszym punktem Groka. Karmazynowe wzory świetlne pojawiły się na twarzy, ale były wyrenderowane jako przesadnie duża, dramatycznie stylizowana czerwona nakładka – bardziej przypominająca efekt korekcji kolorów niż drobne, miękkie włókna światła, które fizycznie powstają, gdy światło słoneczne przechodzi przez wino. Fizyczna wiarygodność kaustyki nie spełniła precyzyjnego standardu.

GPT Image 2 odwrócił ten kompromis. Jego renderowanie światła kaustycznego było zauważalnie bardziej fizycznie poprawne – ciepłe karmazynowe wzory na kości policzkowej były mniejsze, bardziej rozproszone i zgodne z geometrią przestrzenną światła przechodzącego przez kieliszek pod odpowiednim kątem. To jest szczegół, który Grok pominął. Jednak GPT Image 2 zapłacił za to gdzie indziej: anatomia dłoni była nieco mniej naturalna, z kątami palców wokół nóżki wykazującymi lekką sztywność. Tekstura skóry skłaniała się ku gładszej, nieco bardziej płaskiej jakości typowej dla AI portretów, z mniej widocznym ciepłem SSS i słabszym światłem konturowym w porównaniu z Grokiem.

Kat 3 · Wielojęzyczny plakat (T2I)

Prompt:

Wintage'owy plakat podróżniczy w stylu lat 60. dla fikcyjnego festiwalu filmowego, ilustrowany w stylu komercyjnym z połowy wieku. Na górze plakatu, duże pogrubione szeryfowe chińskie znaki: „时光电影节" (linia 1), a poniżej mniejsze chińskie znaki: „第七届 · 上海 · 1965年5月" (linia 2). Na środku: stylizowana ilustracja starego projektora filmowego rzucającego wiązkę na lekko zakrzywiony ekran kinowy. Niżej na środku: wysoki kieliszek coupe do szampana z angielskim tekstem „GRAND OPENING NIGHT" owijającym się wzdłuż krzywizny czaszy, zgodnie z eliptyczną perspektywą. Na prawej krawędzi, pionowy tekst: „presented by 时代影业 · TIMES PICTURES" biegnący od góry do dołu. Na dole pasek z małym angielskim tekstem: „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" w jednej linii. Paleta kolorów: kremowo-białe tło, głęboka karmazynowa czerwień, akcenty musztardowego żółtego. Lekka tekstura postarzanego papieru, subtelne ziarno.

Lista kontrolna oceny

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KryteriumSprawdzenie
1Poprawność chińskich znakówBrak brakujących kresek, brak halucynacyjnych znaków w
2Układ dwujęzycznyChiński i angielski nie są wymieszane; każdy pojawia się w poprawnej strefie
3Zakrzywiony tekst na szkleAngielski podąża za eliptyczną perspektywą kieliszka coupe
4Pionowy tekst na prawej krawędziCzytelny od góry do dołu
5Hierarchia typograficznaWyraźne rozróżnienie między nagłówkiem
6Styl a czytelnośćEstetyka lat 60. zachowana bez poświęcania czytelności tekstu

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagine wygenerował wizualnie uderzający plakat z silną energią ilustracji z połowy wieku. Jednak nie spełnił najważniejszego kryterium tekstowego: nagłówek zawiera znaki w tradycyjnym chińskim „時光電影節", a nie w uproszczonym „时光电影节" określonym w prompcie. Jest to naruszenie zgodności zestawu znaków – znaczące rozróżnienie dla każdego przypadku użycia związanego z lokalizacją lub publikacją. Drugi wiersz „第七屆 · 上海 · 1965年5月" również używał znaków tradycyjnych. Stroną strukturalną, „GRAND OPENING NIGHT" pojawiło się na kieliszku z częściowym podążaniem za krzywizną, choć zgodność z perspektywą eliptyczną była przybliżona. Pionowy tekst na prawej krawędzi „TIMES PICTURES" był czytelny. Dolny wiersz z napisami był obecny i czytelny. Paleta kolorów – karmazyn, musztarda, krem – była dobrze zrealizowana. Ogólny układ energetyczny był wysoki, ale porażka w zakresie tradycyjnego vs uproszczonego chińskiego jest twardym dyskwalifikatorem dla określonego promptu.

GPT Image 2 przeszedł test zestawu znaków czysto: nagłówek „时光电影节" i podtytuł „第七届 · 上海 · 1965年5月" są poprawnie wyrenderowane w uproszczonym chińskim bez brakujących kresek ani halucynacyjnych glifów – bezpośrednia przewaga nad Grokiem. Kieliszek coupe do szampana jest widoczny w dolnej środkowej części z tekstem „GRAND OPENING NIGHT" przekonująco podążającym za krzywizną szkła. Pionowy tekst na prawej krawędzi „时代影业 · TIMES PICTURES" biegnie od góry do dołu i jest w pełni czytelny, z obiema wersjami językowymi prawidłowo umieszczonymi w tej samej pionowej kolumnie bez błędów mieszania. Dolny wiersz napisów – „music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" – jest obecny i czytelny jako jedna linia. Hierarchia typograficzna między nagłówkiem, podtytułem i przypisem jest wyraźnie zachowana. Tekstura postarzanego papieru i paleta kolorów z połowy wieku są dobrze zrealizowane. Kompozycja integruje rozpoznawalną sylwetkę panoramy Szanghaju jako centralną ilustrację, co nie było określone w prompcie, ale dodaje kontekstowej autentyczności bez łamania żadnego kryterium.

Kat 4 · Transformacja geometryczna (I2I)

Prompt nakazał modelowi obrócenie obiektu z pełnopostaciowego lookbooka modowego dokładnie o 45° w lewo, przy zachowaniu tej samej pozycji kamery. Obraz referencyjny przedstawiał złożony, warstwowy strój: długi brązowy płaszcz, skórzana peleryna na ramiona, futrzana etola z widocznym gradientem (ciemny brąz → srebro → krem), okrągła miedziana odznaka na piersi z wbudowanym portretem, czarne skórzane rękawice i dwukolorowe skórzane buty. Żaden z tych szczegółów nie został wymieniony w prompcie – model musiał je zachować dzięki samemu rozumieniu tożsamości.

7.png

To celowy test wytrzymałościowy możliwości. Instrukcja była celowo krótka, aby nie podawać modelowi własnej rubryki oceny.

Lista kontrolna oceny

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KryteriumSprawdzenie
1Tożsamość twarzyPodobieństwo ArcFace ≥ 0,5 (złagodzone dla skali pełnej sylwetki)
2Odsłonięcie futrzanej etoliWcześniej ukryta prawa srebrna część
3Odznaka na piersiOkrągły miedziany kontur + wbudowany portret + poprawna kompresja eliptycznej perspektywy
4Dół płaszcza i warstwy wewnętrzneNaturalny kierunek fałd po obrocie; proporcja odsłoniętych spodni rozsądna
5Pozycja stópLewa z przodu
6Objętość rękawicPozycja dłoni + tekstura dzianiny widoczna po obrocie
7Granica koloru butówBrązowa
8Spójność tłaCzyste szare tło studyjne (region DINO ≥ 0,95)
9Proporcje wyjściaZachowana pełna sylwetka w formacie 9:16, nie przycięta do portretu
10Kierunek spojrzeniaPodąża za obrotem – nie kontynuuje patrzenia w kamerę

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grok utrzymał tożsamość twarzy powyżej progu ArcFace 0,5 odpowiedniego dla obrazów pełnopostaciowych. Wcześniej ukryta prawa strona futrzanej etoli stała się częściowo widoczna przy 45°, z rozsądną ciągłością gradientu. Kontur odznaki na piersi został zachowany, choć szczegóły wbudowanego portretu wykazały kompresję. Granica koloru butów i tekstura rękawic utrzymały się.

GPT Image 2 wykazał nieco silniejszą ogólną spójność warstw odzieży, ale wprowadził większe przesunięcie tożsamości twarzy – znaczący kompromis w zależności od przypadku użycia.

Kat 5 · Edycja lokalna i zachowanie regionu (I2I)

Prompt wymagał dokładnie trzech edycji w scenie salonu: usunięcie śpiącego kota z sofy (i naturalne odtworzenie poduszki), zastąpienie filiżanki gorącej herbaty szklanką soku pomarańczowego z lodem oraz dodanie złożonych okularów do czytania w czarnej oprawce na środkowej książce na stoliku kawowym. Instrukcja wyraźnie zabraniała zmiany czegokolwiek innego – wzoru tkaniny sofy, pozycji książek, lampy, widoku z okna, koloru ściany, podłogi.

10.png

Test zachowania jest równie ważny jak test edycji. Modele, które reinterpretują całą scenę podczas wprowadzania lokalnych zmian, nie nadają się do retuszu zdjęć produktowych ani iteracyjnego tworzenia scen.

Lista kontrolna oceny

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KryteriumSprawdzenie
1Wszystkie 3 edycje wykonaneKot usunięty
2Odtworzenie poduszkiBrak wgniecenia w kształcie kota ani resztek futra na sofie
3Fizyka sokuGeometria szkła, refrakcja lodu i kierunek cienia zgodne z oryginalnym światłem filiżanki
4Umieszczenie okularówPrawidłowo na środkowej książce (nie na górnej ani dolnej)
5Tkanina sofyWzór diamentowego splotu nienaruszony, szczególnie w edytowanym obszarze
6Książki niezmienionePozycje, okładki (czerwona
7Lampa niezmienionaKształt, stan świecenia i pozycja zachowane
8Widok z okna niezmienionyWidok miasta pozostaje rozmyty i spójny
9Ściana i podłoga niezmienioneŚciana w kolorze złamanej bieli i jasna drewniana podłoga niezmienione
10Ogólne oświetlenie zachowaneKierunek pojedynczego, tylnego prawego źródła światła niezmieniony

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagine wykonał wszystkie trzy wymagane edycje. Kot został usunięty, a poduszka sofy czysto odtworzona bez widocznego wgniecenia ani resztek futra – wzór tkaniny w edytowanym obszarze dobrze się utrzymał. Szklanka soku pomarańczowego pojawiła się we właściwym miejscu. Jednak szklanka soku wykazuje wzór odblasku, który nie jest zgodny z tym kierunkiem źródła światła, wyglądając, jakby była skomponowana z niezależnym modelem oświetlenia, a nie zintegrowana z istniejącym oświetleniem sceny. Podstawa szklanki ma również niewystarczający cień kontaktowy z ciemną drewnianą powierzchnią stolika kawowego, tworząc subtelny, ale wykrywalny efekt unoszenia się.

GPT Image 2 również wykonał wszystkie trzy edycje i wykazał się silniejszym ogólnym zachowaniem sceny. Usunięcie kota było równie czyste. Szklanka soku pomarańczowego była dobrze wyrenderowana z prawidłowym pozycjonowaniem i zgodnym kierunkiem cienia w stosunku do prawego okiennego źródła światła – geometria szkła i nieprzezroczystość cieczy wydają się bardziej dopracowane niż w wersji Groka. Okulary do czytania zostały widocznie umieszczone na stosie książek. Kluczowe znaczenie ma fakt, że widok z okna został zachowany – miasto na zewnątrz pozostaje widoczne i rozmyte, zgodne z referencją, gdzie Grok zawiódł. Tkanina sofy, lampa, ściana i podłoga – wszystko utrzymane. Książki wydają się spójne pod względem pozycji i koloru. Jedna zauważalna zmiana: scena ogólnie wydaje się nieco jaśniejsza i bardziej kontrastowa niż oryginał, co sugeruje pewną globalną reinterpretację oświetlenia, a nie prawdziwe zachowanie na poziomie pikseli – niewielkie, ale wykrywalne przesunięcie.

Kat 6 · Fuzja wielu referencji (I2I)

Prompt łączył trzy niezależne referencje: tożsamość portretową (kobieta latynoska, bursztynowe oczy, głębokie brązowe falujące włosy), styl ilustracji akwarelowej (japoński wiejski krajobraz, widoczne pociągnięcia pędzla, ciepła baśniowa atmosfera) oraz układ sceny (europejski brukowany rynek o zachodzie słońca, żeliwna latarnia, kamienny łuk). Zadanie: wyprodukowanie jednego spójnego akwarelowego obrazu przedstawiającego zidentyfikowaną osobę stojącą w tej scenie – nie zdjęcie z filtrem, nie kolaż.

13.png

14.png

15.png

Rozdzielenie trzech referencji to najtrudniejszy test w tym benchmarku. Większość modeli albo zbyt mocno waży jedną referencję, albo nie osiąga renderowania przez styl.

Lista kontrolna oceny

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KryteriumSprawdzenie
1Rozdzielenie trzech referencjiTożsamość
2Pełna transfer styluWynik w całości akwarelowy – nie zdjęcie + filtr
3Zachowanie tożsamości po stylizacjiBursztynowe oczy + struktura twarzy rozpoznawalne przez akwarelowe przetworzenie
4Struktura sceny zachowanaBruk, latarnia i układ łuku nienaruszone
5Naturalne dodanie ubioruPodróżny płaszcz i torba dodane bez łamania kompozycji
6Spójność kierunku światłaBlask zachodu słońca z lewej strony kamery widoczny na bruku i postaci

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagine nie spełnił podstawowego kryterium: wynik jest fotorealistyczny, a nie akwarelowy. Brukowany plac i postać zachowują pełną fotograficzną ostrość z tylko lekką teksturą malarską – brak definiujących pociągnięć pędzla, krwawienia kolorów czy ręcznie malowanej jakości krawędzi z referencji 2. Struktura sceny, tożsamość, ubiór i kierunek światła – wszystko zaliczone. Ale renderowanie w zupełnie innym medium jest dyskwalifikacją na poziomie kategorii, a nie częściową utratą punktów.

GPT Image 2 osiągnął autentyczne akwarelowe renderowanie na całym kadrze – budynki, bruk, niebo i postać niosą widoczne pociągnięcia pędzla i miękkie krwawienie kolorów zgodne z referencją 2. Struktura sceny z referencji 3 jest nienaruszona, latarnia jest zapalona, a kamienny łuk widoczny w średnim planie. Tożsamość jest częściowo zachowana przez transformację stylu – falujące ciemne włosy i struktura twarzy są rozpoznawalne, choć drobne rysy są zgodnie z oczekiwaniami wyabstrahowane. Płaszcz, torba, kierunek światła i spojrzenie – wszystko zgodne z promptem. Jest to jedyny wynik, który wykonał rzeczywiste zadanie.

Wypróbuj modele Grok Imagine Image i GPT Image 2 przez Atlas Cloud

Benchmark jest odtwarzalny. Zarówno Grok Imagine, jak i GPT Image 2 są dostępne teraz przez Atlas Cloud – bez konfiguracji rozliczeń per model, bez list oczekujących.

Dlaczego Atlas Cloud

  • Jeden klucz API, 300+ modeli. Przełączaj się między Grok, GPT Image 2, Flux, Wan, Seedream i każdym innym modelem w puli, zmieniając jedno pole modelu. Ten sam klucz, ten sam endpoint, ten sam panel rozliczeniowy – niezależnie od tego, czy uruchamiasz benchmark sześciu modeli, czy budujesz produkcyjny pipeline obrazów.
  • Pełne pokrycie modalności. LLM, tekst-obraz, obraz-obraz, tekst-wideo, obraz-wideo – wszystko pod jednym dachem. Jeśli Twój workflow potrzebuje modelu językowego do udoskonalania promptu i modelu obrazu do generowania, oba działają w tym samym API.
  • Brak zimnych startów, brak niespodzianek z limitem szybkości. Atlas Cloud działa na zoptymalizowanej infrastrukturze inferencyjnej zaprojektowanej z myślą o przepustowości. Otrzymujesz spójne opóźnienia niezależnie od tego, czy wykonujesz jedno wywołanie, czy tysiąc.
  • Zbudowany dla workflowów porównawczych. Dokładnie ten przypadek użycia, który demonstruje ten benchmark – uruchamianie identycznych promptów na wielu modelach i porównywanie wyników – jest tym, do czego zaprojektowana jest architektura Atlas Cloud. Jeden klucz, jeden rachunek, pełna szerokość modeli.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele