Dünya çapında en düşük fiyatlarla Seedance 2.0 Mini & Fast API — resmi fiyat üzerinden %68'e varan indirim

GPT Image 2 ve Grok Imagine'e aynı 6 İstemi Verdik. İşte Tam Olarak Ne Geldi.

XAI Grok Imagine ve GPT Image 2, anatomi, Çince metin, yerel düzenlemeler ve çoklu referans füzyonu üzerinde kıyaslandı. Tek seed, seçme yok. Her ikisi de Atlas Cloud üzerinden.

GPT Image 2 ve Grok Imagine'e aynı 6 İstemi Verdik. İşte Tam Olarak Ne Geldi.

We ran Grok Imagine Image ve GPT Image-2 modellerini 6 özdeş, modelden bağımsız yönlendirme üzerinde test ettik: kompozisyonel anlambilim, fotogerçekçi anatomi, çok dilli metin oluşturma, geometrik dönüşüm, yerel düzenleme ve çoklu referans birleştirme.

Hem Grok Imagine Image hem de GPT Image-2 modeli, tek bir Atlas Cloud API anahtarıyla kullanılabilir; bu da bu kıyaslamanın dakikalar içinde tekrarlanabilir olmasını sağlar.

Bu Yapay Zeka Görüntü Modeli Karşılaştırması Neden Var?

İnternette bulduğunuz her "yapay zeka görüntü modeli karşılaştırması" aynı tuzağa düşer: seçilmiş yönlendirmeler, en iyi beş çıktı arasından seçim ve test edilmemiş iddialar. Bu kıyaslama Tier A ilkeleri etrafında inşa edildi: modelden bağımsız yönlendirmeler, tüm modellerde aynı girdiler, tek tohumlu varsayılan çıktı (seçmece yok) ve her kategori için tek cümleyle ifade edilebilen puanlama kriterleri.

Tam kıyaslama çalışmasındaki altı model: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 ve Seedream 5.0. Bu makale, varsayılan bir görüntü modeli seçen geliştiriciler için en ticari olarak anlamlı eşleşme olan Grok vs GPT Image 2 karşılaştırmasına odaklanıyor.

Grok Imagine Image VS GPT-Image 2'yi Nasıl Test Ettik: 6 Kategori, Tek Bir Tier A Kuralı

Her yönlendirme, tek bir net şekilde belirtilmiş yetenek boyutunu hedefler. Geçti/kaldı kriterleri, çıktıları görmeden önce, modelleri çalıştırmadan önce tanımlandı.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

Kategori Test Edilen Birincil Boyut Tek Cümleyle Geçti/Kaldı 
Kat 1 · Kompozisyonel Anlambilim Talimat uyumu Model 7 nesneyi saydı mı, doğru yerlere yerleştirdi mi ve olumsuzlama listesine uydu mu? 
Kat 2 · Fotogerçekçi Anatomi ve Işık Görsel kalite ve fizik 5 parmağın tümü anatomik olarak doğru mu ve yüzde kostik ışık desenleri görünüyor mu? 
Kat 3 · Çok Dilli Poster Görüntü içi metin oluşturma Çince ve İngilizce karakterler eksik kontur veya hayal edilmiş glif olmadan doğru şekilde oluşturulmuş mu? 
Kat 4 · Geometrik Dönüşüm (I2I) Düzenleme kontrol edilebilirliği + kimlik 45° döndürmeden sonra, aynı kişi olduğu hala tanınabilir mi ve tüm giysi detayları bozulmamış mı? 
Kat 5 · Yerel Düzenleme ve Bölge Koruma Düzenleme hassasiyeti Tam olarak 3 düzenleme yapıldı mı ve diğer her şey piksel seviyesinde değişmeden kaldı mı? 
Kat 6 · Çoklu Referans Birleştirme Görüntüler arası tutarlılık 3 farklı referanstaki kimlik, stil ve sahne tek bir tutarlı görüntüde birleşiyor mu?

GPT Image 2 ve Grok Imagine'ı aynı yönlendirmeyle kendiniz test etmek ister misiniz? Atlas Cloud'un model karşılaştırması, bunları tek bir geçişte yan yana çalıştırır — aynı yönlendirme, oluşturmadan önce gösterilen fiyat — böylece onları kare kare değerlendirebilirsiniz.

GPT Image 2 ve Grok Imagine, Atlas Cloud'ın model karşılaştırmasında aynı yönlendirmeyle — aynı yönlendirme, oluşturmadan önce gösterilen fiyat. Model-keşif aracında canlı olarak yakalanmıştır.

GPT Image 2 ve Grok Imagine, Atlas Cloud'ın model karşılaştırmasında aynı yönlendirmeyle — aynı yönlendirme, oluşturmadan önce gösterilen fiyat. Model-keşif aracında canlı olarak yakalanmıştır.

Kat 1 · Kompozisyonel Anlambilim (T2I)

Yönlendirme:

Tam olarak yedi seramik nesne içeren bir ahşap yemek masasının tepeden çekilmiş bir fotoğrafı: merkezde eşkenar üçgen şeklinde düzenlenmiş üç özdeş beyaz çay fincanı, çay fincanlarının sağına yerleştirilmiş iki siyah kase, en soldaki siyah kasenin içinde bir kırmızı elma ve en sağdaki siyah kasenin üzerinde sapı çerçevenin sol üst köşesine doğru bakan boş bir tahta kaşık. Kahve fincanı yok, metal eşya yok, tabak yok, bardak yok. Sol üstten gelen yumuşak dağınık pencere ışığı, öğleden önce. Gerçekçi fotoğrafçılık, stil propu yok.

Bu kasıtlı olarak zorlayıcıdır. Sayma, uzamsal dil ("sağında", "en soldaki") ve olumsuzlama cümleleri, mevcut tüm difüzyon tabanlı mimariler için bilinen başarısızlık modlarıdır.

Puanlama Kontrol Listesi

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriterKontrol 
1Toplam nesne sayısıKesinlikle 7 seramik nesne
2Üç beyaz çay fincanıEşkenar üçgen düzenlemesi
3İki siyah kaseÇay fincanlarının sağında konumlandırılmış
4Kırmızı elmaEn soldaki siyah kasenin içinde
5Tahta kaşıkEn sağdaki kaseye dayanmış, sap sol üstü gösteriyor
6Olumsuzlama uyumuKahve fincanı yok / metal yok / tabak yok / bardak yok
7Işık kaynağıSol üstten yumuşak dağınık ışık, tüm gölgeler tutarlı
8Fotoğrafçılık tarzıStil klişeleri yok (palmiye yaprakları, mumlar vb.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Yönlendirme, tepeden çekilmiş bir fotoğraf talep ediyor; kesinlikle yedi seramik kap, net uzamsal ilişkiler: merkezde eşkenar üçgen şeklinde üç beyaz çay fincanı, çay fincanlarının sağında iki siyah kase, en soldaki siyah kasenin içinde kırmızı bir elma, en sağdaki siyah kasenin üzerinde sapı sol üstü gösteren tahta bir kaşık. Olumsuzlama talimatları: kahve fincanı, metal eşya, tabak, bardak olmamalı.

Grok Imagine nesne sayısı: gözle görülür şekilde 5 çay fincanı (3 değil), eşkenar üçgen yerine bir küme halinde düzenlenmiş. İki siyah kase mevcut, kırmızı elma bunlardan birinin içinde doğru şekilde. Tahta kaşık mevcut ve en sağdaki kasenin üzerinde, sap yönü yaklaşık olarak sol üst — bu kriter geçiyor. Olumsuzlama uyumu temiz: kahve fincanı yok, metal yok, tabak yok, bardak yok. Sol üstten ışık kaynağı ve tutarlı gölgeler geçiyor. Stil propu yok.

GPT Image 2, uzamsal bileşenlerde talimat takibinde daha güçlü olduğunu gösterdi, ancak hiçbir model tüm yerleştirme kısıtlamalarını aynı anda karşılayarak mükemmel bir 7 nesne sayımı elde edemedi.

Kat 2 · Fotogerçekçi Anatomi ve Işık (T2I)

Yönlendirme:

Otuzlu yaşlarının başında, sağ elinde yarısı dolu kristal bir kırmızı şarap kadehi tutan, beş parmağı ve başparmağı tamamen görünen, sapı ve kısmen kaseyi doğal bir şekilde kavrayan Doğu Asyalı bir kadının yakın çekim portresi. Altın saatte, batıya bakan uzun bir pencerenin yanında oturuyor. Öğleden sonra geç saatlerde güneş ışığı şarabın içinden geçerek sol elmacık kemiği ve çene hattında sıcak kırmızı kostik desenler oluşturuyor. Sol eli kucağındaki açık bir ciltli kitabın üzerinde duruyor. Her iki gözde pencereden yansıyan ışık parlamaları görülüyor. Cilt, ultra detaylı gözenekler, ince şeftali tüyleri, kulak memesi ve burun köprüsünde yüzey altı saçılımı gösteriyor. Saçlar arkadan aydınlatılmış, kenar ışığı var. 85mm lens, f/2.0, sığ alan derinliği, fotoğrafik gerçekçilik.

Bu, tarihsel olarak üretken modeller için en zor tek görüntü testidir.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriterKontrol
1El anatomisi5 parmak + başparmak, sap ve kase üzerinde doğal kavrama
2Kostik ışıkŞaraptan elmacık kemiğine yansıyan sıcak kırmızı desenler
3Işık parlaması tutarlılığıHer iki gözde aynı konum ve şekil
4Yüzey altı saçılımı (SSS)Arkadan aydınlatıldığında kulak memesi ve burun köprüsünde görünür
5Kenar ışığı fiziğiYön, ışık kaynağı konumuyla eşleşiyor
6Cilt gerçekçiliği"Yapay zeka plastikliği" aşırı yumuşatması yok; gözenekler ve şeftali tüyleri görünür

 

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine, başlıca avantajını güçlü bir şekilde ortaya koydu. El anatomisi doğruydu — parmak sayısı doğru, kavrama duruşu hem sap hem de kase çevresinde doğal, bilek açısı fiziksel olarak makul. Bu tek başına birçok modelin başarısız olduğu bir çıtayı aşıyor. Cilt dokusu, gerçek gözenek seviyesinde detay, görünür ince şeftali tüyleri ve plastik aşırı yumuşatma olmamasıyla kaliteliydi; burun köprüsü ve elmacık kemiklerindeki yüzey altı saçılımı, sıcak, ışık geçirgen bir kalite üreterek fotoğrafik olarak gerçek okunuyordu. Saçtaki kenar ışığı, pencere kaynağı yönüyle tutarlıydı.

Kostik ışık yansıması Grok'un en zayıf noktasıydı. Yüzde kırmızı ışık desenleri görünüyordu, ancak aşırı büyük, dramatik bir şekilde stilize edilmiş kırmızı bir katman olarak oluşturulmuştu — daha çok bir renk derecelendirme efekti gibiydi, güneş ışığının şaraptan geçmesiyle fiziksel olarak oluşan ince, yumuşak kenarlı ışık filamentleri gibi değil. Kostik ışığın fiziksel olabilirliği hassasiyet standardını karşılamadı.

GPT Image 2 bu dengeyi tersine çevirdi. Kostik ışık oluşturması belirgin şekilde daha fiziksel olarak doğruydu — elmacık kemiğindeki sıcak kırmızı desenler daha küçük, daha dağınıktı ve doğru açıda bir şarap kadehinden geçen ışığın uzamsal geometrisini takip ediyordu. Bu, Grok'un kaçırdığı detaydı. Ancak GPT Image 2 bunun bedelini başka yerlerde ödedi: el anatomisi biraz daha az doğaldı, sap etrafındaki parmak açıları hafif sertlik gösteriyordu. Cilt dokusu, yapay zeka portrelerinde yaygın olan daha pürüzsüz, biraz daha düz kaliteye yakındı; daha az görünür SSS sıcaklığı ve Grok'a kıyasla daha zayıf kenar ışığı yoğunluğu vardı.

Kat 3 · Çok Dilli Poster (T2I)

Yönlendirme:

Kurgusal bir film festivali için 1960'lar tarzı vintage bir seyahat posteri, yüzyıl ortası ticari tasarımı tarzında resimlenmiş. Posterin üst kısmı, büyük, kalın serifli Çince karakterler: "时光电影节" (satır 1), altında daha küçük Çince karakterlerle "第七届 · 上海 · 1965年5月" (satır 2).

Merkez: hafif kavisli bir sinema perdesine ışın gönderen eski bir film projektörünün stilize edilmiş illüstrasyonu.

Alt orta: "GRAND OPENING NIGHT" İngilizce metninin, kase eğrisi boyunca eliptik perspektifi takip ederek sarıldığı uzun bir şampanya kupa bardağı.

Sağ kenar, dikey metin: "presented by 时代影业 · TIMES PICTURES", yukarıdan aşağıya doğru.

Alt şerit: küçük İngilizce jenerik metni: "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU", tek satırda.

Renk paleti: krem ofis beyazı arka plan, koyu kırmızı, hardal sarısı vurgular. Hafif yaşlanmış kağıt dokusu, ince gren.

Puanlama Kontrol Listesi

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriterKontrol
1Çince doğruluğu"时光电影节" ve "第七届 · 上海 · 1965年5月" karakterlerinde eksik kontur veya hayal edilmiş karakter yok
2İki dilli düzenÇince ve İngilizce karışmamış; her biri doğru bölgede görünüyor
3Bardak üzerinde kavisli metinİngilizce, şampanya kupa bardağının eliptik perspektifini takip ediyor
4Dikey sağ kenar metniYukarıdan aşağıya okunabilir
5Tipografik hiyerarşiBaşlık, alt başlık ve dipnot arasında net ayrım
6Stil ve okunabilirlik1960'lar estetiği korunmuş, metin netliğinden ödün verilmemiş

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagine, güçlü bir yüzyıl ortası illüstrasyon enerjisine sahip görsel olarak çarpıcı bir poster üretti. Ancak en kritik metin kriterinde başarısız oldu: başlık, yönlendirmede belirtilen Basitleştirilmiş "时光电影节" değil, Geleneksel Çince "時光電影節" olarak okunuyor. Bu, karakter seti uyumluluğu başarısızlığıdır — herhangi bir yerelleştirme veya yayın kullanım durumu için anlamlı bir fark. İkinci satır "第七屆 · 上海 · 1965年5月" da benzer şekilde Geleneksel karakterler kullanmış. Yapısal tarafta, "GRAND OPENING NIGHT" şampanya bardağında kısmi eğri takibiyle görünüyor, ancak eliptik perspektif uyumu yaklaşıktı. Dikey sağ kenar metni "TIMES PICTURES" okunabilirdi. Alt jenerik satırı mevcuttu ve okunabilirdi. Renk paleti — kırmızı, hardal, krem — iyi uygulanmıştı. Genel düzen enerjisi yüksekti, ancak Geleneksel vs. Basitleştirilmiş başarısızlığı, belirtilen yönlendirme için sert bir diskalifiye edicidir.

GPT Image 2, karakter seti testini temiz bir şekilde geçti: başlık "时光电影节" ve alt başlık "第七届 · 上海 · 1965年5月", Basitleştirilmiş Çince ile doğru bir şekilde oluşturulmuş, eksik kontur veya hayal edilmiş glif yok — Grok'a karşı doğrudan bir uyum kazancı. Şampanya kupa bardağı, alt orta kısımda "GRAND OPENING NIGHT" metni bardak eğrisini ikna edici bir şekilde takip ederek görünüyor. Dikey sağ kenar metni "时代影业 · TIMES PICTURES" yukarıdan aşağıya doğru uzanıyor ve tamamen okunabilir, hem Çince hem de İngilizce karışma hatası olmadan aynı dikey sütuna doğru şekilde yerleştirilmiş. Alt jenerik satırı — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — mevcut ve tek satır olarak okunabilir. Başlık, alt başlık ve dipnot arasındaki tipografik hiyerarşi net bir şekilde korunmuş. Yaşlanmış kağıt dokusu ve yüzyıl ortası renk paleti iyi gerçekleştirilmiş. Kompozisyon, merkez illüstrasyon olarak tanınabilir bir Şanghay silüeti içeriyor — bu yönlendirmede belirtilmemiş olsa da, hiçbir kriteri ihlal etmeden bağlamsal özgünlük katıyor.

Kat 4 · Geometrik Dönüşüm (I2I)

Yönlendirme, modele tam boy bir moda lookbook öznesini tam olarak 45° kendi soluna döndürmesini, aynı kamera konumunu korumasını talimatını verdi. Referans görüntü karmaşık katmanlı bir kıyafet içeriyordu: uzun kahverengi palto, deri omuz pelerini, görünür bir degradeye sahip kürk şal (koyu kahverengi → gümüş → krem), gömülü bir portre içeren yuvarlak bakır göğüs rozeti, siyah deri eldivenler ve iki tonlu deri botlar. Bu detayların hiçbiri yönlendirmede listelenmemişti — model bunları yalnızca kimlik anlayışıyla korumak zorundaydı.

7.png

Bu, kasıtlı bir yetenek stres testidir. Talimat, modele kendi değerlendirme kriterlerini beslememek için kasıtlı olarak kısa tutuldu.

Puanlama Kontrol Listesi

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriterKontrol
1Yüz kimliğiArcFace benzerliği ≥ 0.5 (tam boy ölçeği için gevşetilmiş)
2Kürk şalın açığa çıkmasıDaha önce gizli olan sağ taraf gümüş kısmı görünür
3Göğüs rozetiDairesel bakır çerçeve + gömülü portre + doğru perspektif elips sıkıştırması
4Palto etek ve iç katmanlarDöndürme sonrası doğal dökülme yönü; iç pantolon maruziyet oranı makul
5Ayak duruşuSol ön
6Eldiven hacmiDöndürme sonrası görünür el pozisyonu + örgü dokusu
7Bot renk sınırıKahverengi
8Arka plan tutarlılığıSaf gri stüdyo arka planı (DINO bölgesi ≥ 0.95)
9Çıktı oranıTam 9:16 vücut çerçevesi korunmuş, portreye kırpılmamış
10Bakış yönüDöndürmeyi takip ediyor — kameraya bakmaya devam etmiyor

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grok, tam boy görüntüler için uygun olan ArcFace 0.5 eşiğinin üzerinde yüz kimliğini korudu. Kürk şalın daha önce gizli olan sağ taraf kısmı 45°'de kısmen görünür hale geldi, makul bir degrade sürekliliği ile. Göğüs rozeti çerçevesi korundu, ancak gömülü portre detayı sıkıştırma gösterdi. Bot renk sınırı ve eldiven dokusu dayandı.

GPT Image 2, genel giysi katmanı tutarlılığında biraz daha güçlüydü, ancak daha fazla yüz kimliği kayması getirdi — kullanım durumuna bağlı olarak anlamlı bir ödünleşim.

Kat 5 · Yerel Düzenleme ve Bölge Koruma (I2I)

Yönlendirme, bir oturma odası sahnesinde tam olarak üç düzenleme yapılmasını gerektiriyordu: kanepede uyuyan bir kediyi kaldır (ve yastığı doğal bir şekilde eski haline getir), bir bardak sıcak çayı buzlu bir bardak portakal suyuyla değiştir ve sehpanın üzerindeki ortadaki kitabın üstüne katlanmış siyah çerçeveli okuma gözlükleri ekle. Talimat, başka hiçbir şeyi değiştirmemeyi açıkça yasaklıyordu — kanepe kumaş deseni, kitap konumları, lamba, pencere manzarası, duvar rengi, zemin.

10.png

Koruma testi, düzenleme testi kadar önemlidir. Yerel değişiklikler yaparken tüm sahneyi yeniden yorumlayan modeller, ürün fotoğrafçılığı rötuşu veya yinelemeli sahne geliştirme için kullanılamaz.

Puanlama Kontrol Listesi

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;} 

#KriterKontrol
13 düzenlemenin tümü tamamlandıKedi kaldırıldı
2Yastık onarımıKanepede kedi şeklinde iz veya tüy kalıntısı yok
3Portakal suyu fiziğiBardak geometrisi, buz kırılması ve gölge yönü orijinal bardağın ışığıyla eşleşiyor
4Gözlük yerleşimiDoğru şekilde ortadaki kitabın üzerinde (üst veya alt değil)
5Kanepe kumaşıElmas örgü deseni, özellikle düzenlenen bölgede bozulmamış
6Kitaplar değişmemişKonumlar, kapaklar (kırmızı
7Lamba değişmemişŞekil, parlaklık durumu ve konum korunmuş
8Pencere manzarası değişmemişŞehir manzarası bulanık ve tutarlı kalıyor
9Duvar ve zemin değişmemişKrem beyaz duvar ve açık ahşap zemin değişmemiş
10Genel aydınlatma korunmuşTek sağ arka ışık kaynağı yönü değişmemiş

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagine, gerekli üç düzenlemeyi de tamamladı. Kedi kaldırıldı ve kanepe yastığı temiz bir şekilde eski haline getirildi, görünür bir iz veya tüy kalıntısı yok — düzenlenen bölgedeki kumaş deseni iyi dayandı. Portakal suyu bardağı doğru konumda göründü. Ancak portakal suyu bardağı, bu kaynak yönüyle uyumlu olmayan bir vurgu deseni sergiliyor; sanki sahnenin mevcut aydınlatmasına entegre edilmekten ziyade bağımsız bir ışık modeliyle birleştirilmiş gibi görünüyor. Bardak tabanı ayrıca koyu ahşap sehpa yüzeyine karşı yetersiz temas gölgesi gösteriyor ve ince ama algılanabilir bir yüzer etki yaratıyor.

GPT Image 2 de üç düzenlemeyi tamamladı ve genel olarak daha güçlü bir sahne koruması gösterdi. Kedi kaldırma işlemi eşit derecede temizdi. Portakal suyu bardağı iyi oluşturulmuş, doğru konumlandırma ve sağ taraftaki pencere ışık kaynağına göre eşleşen gölge yönü ile — bardak geometrisi ve sıvı opaklığı Grok'un versiyonundan daha rafine okunuyor. Okuma gözlükleri kitap yığınının üzerinde görünür şekilde yerleştirilmişti. Kritik olarak, pencere manzarası korunmuştu — dışarıdaki şehir bulanık ve tutarlı bir şekilde görünür durumda, bu Grok'un başarısız olduğu yerdi. Kanepe kumaşı, lamba, duvar ve zeminin tümü dayandı. Kitaplar konum ve renk olarak tutarlı görünüyor. Göze çarpan bir değişiklik: sahne genel olarak orijinaline göre biraz daha parlak ve daha kontrast kaydırılmış görünüyor; bu, gerçek piksel seviyesinde korumadan ziyade bir miktar küresel aydınlatma yeniden yorumlaması olduğunu gösteriyor — küçük ama algılanabilir bir kayma.

Kat 6 · Çoklu Referans Birleştirme (I2I)

Yönlendirme, üç bağımsız referansı birleştirdi: bir portre kimliği (Latin kadın, kehribar gözler, koyu kahverengi dalgalı saç), bir suluboya illüstrasyon stili (Japon kırsal manzarası, görünür fırça darbeleri, sıcak masal atmosferi) ve bir sahne düzeni (gün batımında Avrupa arnavut kaldırımlı kasaba meydanı, dökme demir fener, taş kemer). Görev: belirlenen kişinin sahnede durduğu tek bir tutarlı suluboya resmi üretmek — filtreli bir fotoğraf değil, bir kolaj değil.

13.png

14.png

15.png

Üç referans ayrıştırması, bu kıyaslamadaki en zor testtir. Çoğu model ya bir referansı aşırı ağırlıklandırır ya da stil aracılığıyla oluşturmayı başaramaz.

Puanlama Kontrol Listesi

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#KriterKontrol
1Üç yönlü ayrıştırmaKimlik
2Tam stil aktarımıÇıktı tamamen suluboya — fotoğraf + filtre değil
3Stil sonrası kimlik korunumuKehribar gözler + yüz yapısı suluboya işlemiyle tanınabilir
4Sahne yapısı korunmuşArnavut kaldırımları, fener ve kemer düzeni bozulmamış
5Doğal kıyafet eklemesiSeyahat ceketi ve çanta kompozisyonu bozmadan eklenmiş
6Işık yönü tutarlılığıKamera solundan gelen gün batımı ışığı arnavut kaldırımlarında ve figürde görünür

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagine, temel kriterde başarısız oldu: çıktı fotogerçekçi, suluboya değil. Arnavut kaldırımlı meydan ve figür, yalnızca hafif bir resimsel doku geçişiyle tam fotoğrafik keskinliği koruyor — Ref 2'nin tanımlayıcı fırça darbeleri, renk dağılması veya elle boyanmış kenar kalitesinin hiçbiri mevcut değil. Sahne yapısı, kimlik, kıyafet ve ışık yönü geçiyor. Ancak tamamen yanlış ortamı oluşturmak, kısmi bir kesinti değil, kategori seviyesinde diskalifiyedir.

GPT Image 2, tüm çerçeve boyunca gerçek suluboya oluşturma elde etti — binalar, arnavut kaldırımları, gökyüzü ve figürün tümü, Ref 2 ile tutarlı görünür fırça darbeleri ve yumuşak renk dağılması taşıyor. Ref 3'ten sahne yapısı bozulmamış, fener yanıyor ve taş kemer orta planda görünüyor. Kimlik, stil dönüşümü yoluyla kısmen korunmuş — dalgalı koyu saç ve yüz yapısı tanınabilir, ancak ince özelliklerin beklenen şekilde soyutlandığı görülüyor. Ceket, çanta, ışık yönü ve bakış yönlendirmeyi takip ediyor. Bu, asıl görevi tamamlayan tek çıktıdır.

Grok Imagine Image ve GPT Image 2 Modellerini Atlas Cloud ile Deneyin

Kıyaslama tekrarlanabilir. Hem Grok Imagine hem de GPT Image 2 şu anda Atlas Cloud üzerinden kullanılabilir — model başına fatura kurulumu yok, bekleme listesi yok.

Neden Atlas Cloud?

  • Tek API anahtarı, 300'den fazla model. Tek bir model alanını değiştirerek Grok, GPT Image 2, Flux, Wan, Seedream ve havuzdaki diğer tüm modeller arasında geçiş yapın. İster altı modelli bir kıyaslama çalıştırın, ister bir üretim görüntü hattı oluşturun; aynı anahtar, aynı uç nokta, aynı fatura panosu.
  • Tam modalite kapsamı. LLM'ler, metinden görüntüye, görüntüden görüntüye, metinden videoya, görüntüden videoya — hepsi tek bir çatı altında. İş akışınız yönlendirme iyileştirme için bir dil modeli ve üretim için bir görüntü modeli gerektiriyorsa, her ikisi de aynı API'de yaşar.
  • Soğuk başlangıç yok, hız sınırı sürprizi yok. Atlas Cloud, verimlilik için özel olarak oluşturulmuş optimize edilmiş çıkarım altyapısı üzerinde çalışır. İster bir ister bin çağrı yapın, tutarlı gecikme süresi alırsınız.
  • Karşılaştırma iş akışları için üretilmiştir. Bu kıyaslamanın gösterdiği tam kullanım durumu — birden çok modelde aynı yönlendirmeleri çalıştırmak ve çıktıları karşılaştırmak — Atlas Cloud'un mimarisinin tasarlandığı şeydir. Tek anahtar, tek fatura, tam model genişliği.

En Yeni Modeller

Tüm Medya Yapay Zekâsı için Tek API.

Tüm modelleri keşfet