Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

Demos os Mesmos 6 Prompts ao GPT Image 2 vs Grok Imagine. Veja exatamente o que veio de volta.

XAI Grok Imagine vs GPT Image 2 avaliados em anatomia, texto em chinês, edições locais e fusão multi-referência. Single-seed, sem cherry-picking. Ambos via Atlas Cloud.

Demos os Mesmos 6 Prompts ao GPT Image 2 vs Grok Imagine. Veja exatamente o que veio de volta.

Executamos os modelos Grok Imagine Image e GPT Image-2 com 6 prompts idênticos e neutros entre modelos, abrangendo semântica composicional, anatomia fotorrealista, renderização de texto multilíngue, transformação geométrica, edição local e fusão de múltiplas referências.

Os modelos Grok Imagine Image e GPT Image-2 estão disponíveis por meio de uma única chave API do Atlas Cloud, tornando este benchmark exato reproduzível em minutos.

Por que este benchmark de comparação de modelos de imagem por IA existe

Toda "comparação de modelos de imagem por IA" que você encontra online cai na mesma armadilha: prompts escolhidos a dedo, seleção de melhor de cinco saídas e alegações não testadas. Este benchmark foi construído com base nos princípios Tier A: prompts neutros entre modelos, entradas idênticas para todos os modelos, saída padrão com semente única (sem seleção a dedo) e critérios de pontuação que podem ser declarados em uma frase por categoria.

Os seis modelos no benchmark completo: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 e Seedream 5.0. Este artigo foca no confronto direto entre Grok e GPT Image 2, por ser a combinação mais relevante comercialmente para desenvolvedores que escolhem um modelo de imagem padrão.

Como testamos Grok Imagine Image vs GPT-Image 2: 6 categorias, uma regra Tier A

Cada prompt tem como alvo uma única dimensão de capacidade claramente declarada. Os critérios de aprovação/reprovação foram definidos antes de executar os modelos, não depois de ver os resultados.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

CategoriaDimensão primária testadaPass/Fail em uma frase
Cat 1 · Semântica ComposicionalAlinhamento de instruçãoO modelo contou 7 objetos, colocou-os corretamente e obedeceu à lista de negação?
Cat 2 · Anatomia e Luz FotorrealistasQualidade visual e físicaTodos os 5 dedos estão anatomicamente corretos e padrões de luz cáustica aparecem no rosto?
Cat 3 · Pôster MultilíngueRenderização de texto em imagemOs caracteres em chinês e inglês estão corretamente renderizados, sem traços faltando ou glifos alucinados?
Cat 4 · Transformação Geométrica (I2I)Controlabilidade de edição + identidadeApós uma rotação de 45°, ainda é reconhecível como a mesma pessoa, com todos os detalhes da roupa intactos?
Cat 5 · Edição Local e Preservação de RegiãoPrecisão de ediçãoForam feitas exatamente 3 edições, com tudo o mais inalterado em nível de pixel?
Cat 6 · Fusão de Múltiplas ReferênciasConsistência entre imagensIdentidade, estilo e cena de 3 referências separadas se fundem em uma única imagem coerente?

Quer colocar o GPT Image 2 e o Grok Imagine no mesmo prompt você mesmo? A comparação de modelos do Atlas Cloud os executa lado a lado em uma única passagem — mesmo prompt, preço mostrado antes de gerar — para que você possa julgá-los quadro a quadro.

GPT Image 2 e Grok Imagine no mesmo prompt na comparação de modelos do Atlas Cloud — mesmo prompt, preço mostrado antes de gerar. Capturado ao vivo no model-explorer

GPT Image 2 e Grok Imagine no mesmo prompt na comparação de modelos do Atlas Cloud — mesmo prompt, preço mostrado antes de gerar. Capturado ao vivo no model-explorer.

Cat 1 · Semântica Composicional (T2I)

Prompt:

Uma fotografia aérea em plano geral de uma mesa de jantar de madeira contendo exatamente sete objetos de cerâmica: três xícaras de chá brancas idênticas dispostas em um triângulo equilátero no centro, duas tigelas pretas colocadas à direita das xícaras, uma maçã vermelha dentro da tigela preta mais à esquerda e uma colher de madeira vazia descansando sobre a tigela preta mais à direita, com o cabo apontando para o canto superior esquerdo do quadro. Sem xícaras de café, sem itens de metal, sem pratos, sem copos. Luz de janela suave e difusa vindo do canto superior esquerdo, meio da manhã. Fotografia realista, sem adereços de estilo.

Isso é deliberadamente adversarial. Contagem, linguagem espacial ("à direita de", "mais à esquerda") e cláusulas de negação são modos de falha conhecidos para todas as arquiteturas atuais baseadas em difusão.

Lista de verificação de pontuação

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritérioVerificação
1Contagem total de objetosEstritamente 7 objetos de cerâmica
2Três xícaras de chá brancasDisposição em triângulo equilátero
3Duas tigelas pretasPosicionadas à direita das xícaras
4Maçã vermelhaDentro da tigela preta mais à esquerda
5Colher de madeiraDescansando na tigela mais à direita, cabo apontando para o canto superior esquerdo
6Conformidade com negaçãoSem xícaras de café / sem metal / sem pratos / sem copos
7Fonte de luzLuz suave e difusa do canto superior esquerdo, todas as sombras consistentes
8Estilo fotográficoSem clichês de estilo (folhas de palmeira, velas, etc.)

1.PNGGrok Imagine Image

2.PNGGPT-Image 2

Solicitação para gerar uma foto aérea em plano geral, contendo estritamente sete objetos de cerâmica, com relações espaciais claras: três xícaras de chá brancas dispostas em triângulo equilátero no centro, duas tigelas pretas à direita das xícaras, uma maçã vermelha dentro da tigela preta mais à esquerda, uma colher de madeira descansando sobre a tigela preta mais à direita com o cabo apontando para o canto superior esquerdo. Instrução de negação: não deve conter xícaras de café, utensílios de metal, pratos, copos.

Grok Imagine contagem de objetos: visivelmente 5 xícaras (não 3), dispostas em um aglomerado em vez de um triângulo equilátero. As duas tigelas pretas estão presentes, com a maçã vermelha corretamente dentro de uma delas. A colher de madeira está presente e descansando na tigela mais à direita, direção do cabo aproximadamente para o canto superior esquerdo — este critério passa. A conformidade com a negação está limpa: sem xícaras de café, sem metal, sem pratos, sem copos. Fonte de luz do canto superior esquerdo com sombras consistentes passa. Nenhum adereço de estilo presente.

GPT Image 2 demonstrou maior capacidade de seguir instruções nos componentes espaciais, embora nenhum modelo tenha alcançado uma contagem perfeita de 7 objetos com todas as restrições de posicionamento satisfeitas simultaneamente.

Cat 2 · Anatomia e Luz Fotorrealistas (T2I)

Prompt:

Retrato close-up de uma mulher do Leste Asiático no início dos trinta anos segurando uma taça de cristal meio cheia de vinho tinto na mão direita, todos os cinco dedos e o polegar totalmente visíveis, envolvendo naturalmente a haste e parcialmente o bojo. Ela está sentada perto de uma janela alta voltada para oeste durante a hora dourada. A luz do sol do final da tarde atravessa o vinho, criando padrões cáusticos carmesim quentes em sua bochecha esquerda e linha da mandíbula. A mão esquerda descansa sobre um livro de capa dura aberto no colo. Brilhos de luz da janela visíveis em ambos os olhos. A pele mostra poros ultra detalhados, penugem fina, dispersão subsuperficial no lóbulo da orelha e na ponte do nariz. Cabelo iluminado por trás com luz de borda. Lente 85mm, f/2.0, profundidade de campo rasa, realismo fotográfico.

Este é historicamente o teste de imagem única mais difícil para modelos generativos.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritérioVerificação
1Anatomia da mãoTodos os 5 dedos + polegar, pegada natural na haste e no bojo
2Luz cáusticaPadrões carmesim quentes do vinho projetados na bochecha
3Consistência do brilhoMesma posição e forma em ambos os olhos
4Dispersão subsuperficial (SSS)Visível no lóbulo da orelha e na ponte do nariz quando iluminado por trás
5Física da luz de bordaDireção corresponde à posição da fonte de luz
6Realismo da peleSem suavização excessiva "plástica de IA"; poros e penugem visíveis

3.PNGGrok Imagine Image

4.PNGGPT-Image 2

Grok Imagine entregou fortemente em sua vantagem principal. A anatomia da mão estava correta — contagem de dedos precisa, postura de pegada natural ao redor da haste e do bojo, ângulo do pulso fisicamente plausível. Isso por si só ultrapassa um nível que muitos modelos falham completamente. A textura da pele mostrou detalhes genuínos de poros com penugem fina visível e sem suavização plástica excessiva, e a dispersão subsuperficial na ponte do nariz e nas bochechas produziu uma qualidade quente e permeável à luz que parece fotograficamente real. A luz de borda no cabelo seguiu a direção da fonte da janela de forma coerente.

A projeção de luz cáustica foi o ponto mais fraco do Grok. Os padrões de luz carmesim apareceram no rosto, mas foram renderizados como uma sobreposição vermelha excessivamente grande e dramaticamente estilizada — mais parecendo um efeito de correção de cor do que os filamentos de luz finos e de borda suave que resultam fisicamente da luz solar passando pelo vinho. A plausibilidade física do cáustico falhou no padrão de precisão.

O GPT Image 2 inverteu a troca. Sua renderização de luz cáustica foi notavelmente mais precisa fisicamente — os padrões carmesim quentes na bochecha eram menores, mais difusos e seguiam a geometria espacial da luz passando por uma taça de vinho no ângulo correto. Este é o detalhe que Grok perdeu. No entanto, o GPT Image 2 pagou por isso em outros lugares: a anatomia da mão foi ligeiramente menos natural, com ângulos dos dedos ao redor da haste mostrando rigidez leve. A textura da pele tendeu à qualidade mais suave e ligeiramente plana comum em retratos de IA, com menos calor SSS visível e intensidade de luz de borda mais fraca em comparação com Grok.

Cat 3 · Pôster Multilíngue (T2I)

Prompt:

Um pôster de viagem vintage no estilo dos anos 1960 para um festival de cinema fictício, ilustrado no estilo do design comercial de meados do século. No topo do pôster, caracteres chineses grandes e em negrito com serifa lendo "时光电影节" (linha 1), e abaixo, em caracteres chineses menores, "第七届 · 上海 · 1965年5月" (linha 2).

Centro: uma ilustração estilizada de um projetor de cinema antigo projetando um feixe em uma tela de cinema ligeiramente curva.

Centro inferior: uma taça alta de champanhe coupé com o texto em inglês "GRAND OPENING NIGHT" envolvendo a curvatura do bojo da taça, seguindo a perspectiva elíptica.

Borda direita, texto vertical lendo "presented by 时代影业 · TIMES PICTURES" de cima para baixo.

Faixa inferior: pequenos créditos em inglês "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" em uma única linha.

Paleta de cores: fundo creme off-white, vermelho carmesim profundo, acentos em amarelo mostarda. Textura de papel envelhecido sutil, granulação leve.

Lista de verificação de pontuação

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritérioVerificação
1Precisão do chinêsSem traços faltando, sem caracteres alucinados em
2Layout bilíngueChinês e inglês não misturados; cada um aparece na zona correta
3Texto curvo no vidroO inglês segue a perspectiva elíptica da taça de champanhe coupé
4Texto vertical na borda direitaLegível de cima para baixo
5Hierarquia tipográficaDistinção clara entre título
6Estilo vs. legibilidadeEstética dos anos 1960 mantida sem sacrificar a clareza do texto

5.pngGrok Imagine Image

6.pngGPT-Image 2

Grok Imagine produziu um pôster visualmente impressionante com forte energia de ilustração de meados do século. No entanto, falhou no critério de texto mais crítico: o título lê "時光電影節" em Chinês Tradicional, não o "时光电影节" em Chinês Simplificado especificado no prompt. Esta é uma falha de conformidade de conjunto de caracteres — uma distinção significativa para qualquer caso de uso de localização ou publicação. A segunda linha "第七屆 · 上海 · 1965年5月" também usou caracteres Tradicionais. No lado estrutural, "GRAND OPENING NIGHT" apareceu na taça de champanhe com curva parcial, embora a adesão à perspectiva elíptica tenha sido aproximada. O texto vertical na borda direita "TIMES PICTURES" estava legível. A linha de créditos inferior estava presente e legível. A paleta de cores — carmesim, mostarda, creme — foi bem executada. A energia geral do layout era alta, mas a falha de Tradicional vs. Simplificado é um desqualificador duro para o prompt declarado.

O GPT Image 2 passou no teste de conjunto de caracteres limpo: o título "时光电影节" e o subtítulo "第七届 · 上海 · 1965年5月" estão corretamente renderizados em Chinês Simplificado sem traços faltando ou glifos alucinados — uma vitória direta de conformidade sobre Grok. A taça de champanhe coupé está visível no centro inferior com "GRAND OPENING NIGHT" seguindo a curvatura da taça de forma convincente. O texto vertical na borda direita "时代影业 · TIMES PICTURES" vai de cima para baixo e é totalmente legível, com chinês e inglês corretamente colocados na mesma coluna vertical sem erros de mistura. A linha de créditos inferior — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — está presente e legível como uma única linha. A hierarquia tipográfica entre título, subtítulo e nota de rodapé é claramente mantida. A textura de papel envelhecido e a paleta de cores de meados do século são bem realizadas. A composição integra uma silhueta reconhecível do horizonte de Xangai como ilustração central, o que não foi especificado no prompt, mas adiciona autenticidade contextual sem quebrar nenhum critério.

Cat 4 · Transformação Geométrica (I2I)

O prompt instruiu o modelo a girar um modelo de lookbook de moda de corpo inteiro exatamente 45° para a esquerda do sujeito, mantendo a mesma posição da câmera. A imagem de referência apresentava uma roupa complexa em camadas: sobretudo longo marrom, capa de ombro de couro, estola de pele com um gradiente visível (marrom escuro → prata → creme), um emblema redondo de cobre no peito com um retrato embutido, luvas de couro preto e botas de couro de dois tons. Nenhum desses detalhes foi listado no prompt — o modelo teve que preservá-los através da compreensão da identidade sozinho.

7.png

Este é um teste de estresse de capacidade deliberado. A instrução foi intencionalmente curta para evitar alimentar o modelo com sua própria rubrica de avaliação.

Lista de verificação de pontuação

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritérioVerificação
1Identidade facialSimilaridade ArcFace ≥ 0,5 (relaxado para escala de corpo inteiro)
2Revelação da estola de peleLado direito prateado previamente oculto
3Emblema no peitoContorno circular de cobre + retrato embutido + compressão de perspectiva elíptica correta
4Borda do casaco e camadas internasDireção do drapeado natural após a rotação; proporção de exposição da calça interna razoável
5Postura dos pésEsquerdo na frente
6Volume das luvasPosição da mão + textura de malha visível pós-rotação
7Limite de cor da botaMarrom
8Consistência do fundoFundo de estúdio cinza puro (região DINO ≥ 0,95)
9Proporção da saídaMoldura de corpo inteiro 9:16 mantida, não cortada para retrato
10Direção do olharSegue a rotação — não continua a olhar para a câmera

8.pngGrok Imagine Image

9.jpgGPT-Image 2

Grok manteve a identidade facial acima do limite ArcFace de 0,5 apropriado para imagens de corpo inteiro. A seção do lado direito previamente oculta da estola de pele tornou-se parcialmente visível a 45°, com continuidade de gradiente razoável. O contorno do emblema no peito foi preservado, embora o detalhe do retrato embutido tenha mostrado compressão. O limite de cor da bota e a textura da luva se mantiveram.

O GPT Image 2 mostrou coerência ligeiramente mais forte nas camadas de roupa em geral, mas introduziu mais deriva de identidade facial — uma troca significativa dependendo do caso de uso.

Cat 5 · Edição Local e Preservação de Região (I2I)

O prompt exigiu exatamente três edições em uma cena de sala de estar: remover um gato dormindo do sofá (e restaurar a almofada naturalmente), substituir uma xícara de chá quente por um copo de suco de laranja com gelo e adicionar óculos de leitura dobrados com armação preta em cima do livro do meio na mesa de centro. A instrução proibiu explicitamente mudar qualquer outra coisa — padrão do tecido do sofá, posições dos livros, abajur, vista da janela, cor da parede, chão.

10.png

O teste de preservação é tão importante quanto o teste de edição. Modelos que reinterpretam toda a cena ao fazer alterações locais não são utilizáveis para retoque de fotografia de produto ou desenvolvimento iterativo de cena.

Lista de verificação de pontuação

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritérioVerificação
1Todas as 3 edições concluídasGato removido
2Restauração da almofadaSem marca de gato ou resíduo de pelo no sofá
3Física do suco de laranjaGeometria do copo, refração do gelo e direção da sombra correspondem à luz do copo original
4Posicionamento dos óculosCorretamente no livro do meio (não no superior ou inferior)
5Tecido do sofáPadrão de trama de losangos intacto, especialmente na zona editada
6Livros inalteradosPosições, capas (vermelho
7Abajur inalteradoForma, estado de brilho e posição preservados
8Vista da janela inalteradaVista da cidade permanece desfocada e consistente
9Parede e chão inalteradosParede off-white e chão de madeira clara inalterados
10Iluminação geral preservadaDireção da fonte de luz única traseira direita inalterada

11.pngGrok Imagine Image

12.pngGPT-Image 2

Grok Imagine concluiu todas as três edições necessárias. O gato foi removido e a almofada do sofá restaurada limpa, sem marcas visíveis ou resíduos de pelo — o padrão do tecido na zona editada se manteve bem. O copo de suco de laranja apareceu na posição correta. No entanto, o copo de suco exibe um padrão de destaque que não se alinha com esta direção de fonte, parecendo ter sido composto com um modelo de luz independente em vez de integrado à iluminação existente da cena. A base do copo também mostra sombra de contato insuficiente contra a superfície da mesa de centro de madeira escura, criando um efeito de flutuação sutil, mas detectável.

O GPT Image 2 também concluiu todas as três edições e demonstrou preservação geral mais forte da cena. A remoção do gato foi igualmente limpa. O copo de suco de laranja foi bem renderizado com posicionamento correto e direção de sombra correspondente à fonte de luz da janela direita — a geometria do copo e a opacidade do líquido parecem mais refinadas que a versão do Grok. Os óculos de leitura foram colocados visivelmente na pilha de livros. Crucialmente, a vista da janela foi preservada — a cidade do lado de fora permanece visível e desfocada, consistente com a referência, que é onde Grok falhou. Tecido do sofá, abajur, parede e chão se mantiveram. Os livros parecem consistentes em posição e cor. A única mudança notável: a cena geral parece ligeiramente mais brilhante e com contraste alterado em comparação com o original, sugerindo alguma reinterpretação global da iluminação em vez de preservação verdadeira em nível de pixel — uma deriva menor, mas detectável.

Cat 6 · Fusão de Múltiplas Referências (I2I)

O prompt combinou três referências independentes: uma identidade de retrato (mulher latina, olhos âmbar, cabelo ondulado castanho escuro), um estilo de ilustração em aquarela (paisagem rural japonesa, pinceladas visíveis, atmosfera quente de conto de fadas) e um layout de cena (praça de cidade europeia com paralelepípedos ao pôr do sol, poste de ferro fundido, arco de pedra). A tarefa: produzir uma única pintura em aquarela coerente da pessoa identificada em pé na cena — não uma foto com filtro, não uma colagem.

13.png

14.png

15.png

A separação de três referências é o teste mais difícil neste benchmark. A maioria dos modelos ou superestima uma referência ou falha em alcançar a renderização através do estilo.

Lista de verificação de pontuação

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

#CritérioVerificação
1Separação triplaIdentidade
2Transferência completa de estiloA saída é aquarela em toda a extensão — não foto + filtro
3Retenção de identidade pós-estiloOlhos âmbar + estrutura facial reconhecível através do tratamento em aquarela
4Estrutura da cena preservadaParalelepípedos, poste e layout do arco intactos
5Adição natural de roupasCasaco de viagem e bolsa transversal adicionados sem quebrar a composição
6Consistência da direção da luzBrilho do pôr do sol vindo da esquerda da câmera visível nos paralelepípedos e na figura

16.pngGrok Imagine Image

17.pngGPT-Image 2

Grok Imagine falhou no critério central: a saída é fotorrealista, não aquarela. A praça de paralelepípedos e a figura mantêm nitidez fotográfica total com apenas uma leve passagem de textura pictórica — nenhuma das pinceladas definidoras, sangria de cor ou qualidade de borda pintada à mão da Ref 2 está presente. Estrutura da cena, identidade, roupas e direção da luz passam todos. Mas renderizar o meio errado completamente é uma desqualificação em nível de categoria, não uma dedução parcial.

O GPT Image 2 alcançou renderização em aquarela genuína em todo o quadro — edifícios, paralelepípedos, céu e figura carregam pinceladas visíveis e sangria de cor suave consistentes com a Ref 2. A estrutura da cena da Ref 3 está intacta, o poste está aceso e o arco de pedra é visível no meio-termo. A identidade é parcialmente retida através da transformação de estilo — cabelo escuro ondulado e estrutura facial são reconhecíveis, embora características finas sejam abstratas conforme esperado. Casaco, bolsa transversal, direção da luz e olhar seguem o prompt. Esta é a única saída que completou a tarefa real.

Experimente os modelos Grok Imagine Image e GPT Image 2 via Atlas Cloud

O benchmark é reproduzível. Tanto o Grok Imagine quanto o GPT Image 2 estão disponíveis agora através do Atlas Cloud — sem configuração de faturamento por modelo, sem listas de espera.

Por que Atlas Cloud

  • Uma chave de API, mais de 300 modelos. Alterne entre Grok, GPT Image 2, Flux, Wan, Seedream e todos os outros modelos no pool alterando um único campo de modelo. A mesma chave, o mesmo endpoint, o mesmo painel de faturamento — seja para executar um benchmark de seis modelos ou construir um pipeline de produção de imagens.
  • Cobertura total de modalidades. LLMs, texto para imagem, imagem para imagem, texto para vídeo, imagem para vídeo — tudo sob o mesmo teto. Se seu fluxo de trabalho precisa de um modelo de linguagem para refinamento de prompt e um modelo de imagem para geração, ambos vivem na mesma API.
  • Sem cold starts, sem surpresas de limite de taxa. O Atlas Cloud é executado em infraestrutura de inferência otimizada construída especificamente para throughput. Você obtém latência consistente, seja fazendo uma chamada ou mil.
  • Construído para fluxos de trabalho de comparação. O caso de uso exato que este benchmark demonstra — executar prompts idênticos em vários modelos e comparar saídas — é para o que a arquitetura do Atlas Cloud foi projetada. Uma chave, uma fatura, amplitude total de modelos.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos