Executamos os modelos Grok Imagine Image e GPT Image-2 com 6 prompts idênticos e neutros entre modelos, abrangendo semântica composicional, anatomia fotorrealista, renderização de texto multilíngue, transformação geométrica, edição local e fusão de múltiplas referências.
Os modelos Grok Imagine Image e GPT Image-2 estão disponíveis por meio de uma única chave API do Atlas Cloud, tornando este benchmark exato reproduzível em minutos.
Por que este benchmark de comparação de modelos de imagem por IA existe
Toda "comparação de modelos de imagem por IA" que você encontra online cai na mesma armadilha: prompts escolhidos a dedo, seleção de melhor de cinco saídas e alegações não testadas. Este benchmark foi construído com base nos princípios Tier A: prompts neutros entre modelos, entradas idênticas para todos os modelos, saída padrão com semente única (sem seleção a dedo) e critérios de pontuação que podem ser declarados em uma frase por categoria.
Os seis modelos no benchmark completo: Grok, GPT Image 2, Nano Banana 2, Nano Banana Pro, Wan 2.7 e Seedream 5.0. Este artigo foca no confronto direto entre Grok e GPT Image 2, por ser a combinação mais relevante comercialmente para desenvolvedores que escolhem um modelo de imagem padrão.
Como testamos Grok Imagine Image vs GPT-Image 2: 6 categorias, uma regra Tier A
Cada prompt tem como alvo uma única dimensão de capacidade claramente declarada. Os critérios de aprovação/reprovação foram definidos antes de executar os modelos, não depois de ver os resultados.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| Categoria | Dimensão primária testada | Pass/Fail em uma frase |
|---|---|---|
| Cat 1 · Semântica Composicional | Alinhamento de instrução | O modelo contou 7 objetos, colocou-os corretamente e obedeceu à lista de negação? |
| Cat 2 · Anatomia e Luz Fotorrealistas | Qualidade visual e física | Todos os 5 dedos estão anatomicamente corretos e padrões de luz cáustica aparecem no rosto? |
| Cat 3 · Pôster Multilíngue | Renderização de texto em imagem | Os caracteres em chinês e inglês estão corretamente renderizados, sem traços faltando ou glifos alucinados? |
| Cat 4 · Transformação Geométrica (I2I) | Controlabilidade de edição + identidade | Após uma rotação de 45°, ainda é reconhecível como a mesma pessoa, com todos os detalhes da roupa intactos? |
| Cat 5 · Edição Local e Preservação de Região | Precisão de edição | Foram feitas exatamente 3 edições, com tudo o mais inalterado em nível de pixel? |
| Cat 6 · Fusão de Múltiplas Referências | Consistência entre imagens | Identidade, estilo e cena de 3 referências separadas se fundem em uma única imagem coerente? |
Quer colocar o GPT Image 2 e o Grok Imagine no mesmo prompt você mesmo? A comparação de modelos do Atlas Cloud os executa lado a lado em uma única passagem — mesmo prompt, preço mostrado antes de gerar — para que você possa julgá-los quadro a quadro.

GPT Image 2 e Grok Imagine no mesmo prompt na comparação de modelos do Atlas Cloud — mesmo prompt, preço mostrado antes de gerar. Capturado ao vivo no model-explorer.
Cat 1 · Semântica Composicional (T2I)
Prompt:
Uma fotografia aérea em plano geral de uma mesa de jantar de madeira contendo exatamente sete objetos de cerâmica: três xícaras de chá brancas idênticas dispostas em um triângulo equilátero no centro, duas tigelas pretas colocadas à direita das xícaras, uma maçã vermelha dentro da tigela preta mais à esquerda e uma colher de madeira vazia descansando sobre a tigela preta mais à direita, com o cabo apontando para o canto superior esquerdo do quadro. Sem xícaras de café, sem itens de metal, sem pratos, sem copos. Luz de janela suave e difusa vindo do canto superior esquerdo, meio da manhã. Fotografia realista, sem adereços de estilo.
Isso é deliberadamente adversarial. Contagem, linguagem espacial ("à direita de", "mais à esquerda") e cláusulas de negação são modos de falha conhecidos para todas as arquiteturas atuais baseadas em difusão.
Lista de verificação de pontuação
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Critério | Verificação |
| 1 | Contagem total de objetos | Estritamente 7 objetos de cerâmica |
| 2 | Três xícaras de chá brancas | Disposição em triângulo equilátero |
| 3 | Duas tigelas pretas | Posicionadas à direita das xícaras |
| 4 | Maçã vermelha | Dentro da tigela preta mais à esquerda |
| 5 | Colher de madeira | Descansando na tigela mais à direita, cabo apontando para o canto superior esquerdo |
| 6 | Conformidade com negação | Sem xícaras de café / sem metal / sem pratos / sem copos |
| 7 | Fonte de luz | Luz suave e difusa do canto superior esquerdo, todas as sombras consistentes |
| 8 | Estilo fotográfico | Sem clichês de estilo (folhas de palmeira, velas, etc.) |
Grok Imagine Image
GPT-Image 2
Solicitação para gerar uma foto aérea em plano geral, contendo estritamente sete objetos de cerâmica, com relações espaciais claras: três xícaras de chá brancas dispostas em triângulo equilátero no centro, duas tigelas pretas à direita das xícaras, uma maçã vermelha dentro da tigela preta mais à esquerda, uma colher de madeira descansando sobre a tigela preta mais à direita com o cabo apontando para o canto superior esquerdo. Instrução de negação: não deve conter xícaras de café, utensílios de metal, pratos, copos.
Grok Imagine contagem de objetos: visivelmente 5 xícaras (não 3), dispostas em um aglomerado em vez de um triângulo equilátero. As duas tigelas pretas estão presentes, com a maçã vermelha corretamente dentro de uma delas. A colher de madeira está presente e descansando na tigela mais à direita, direção do cabo aproximadamente para o canto superior esquerdo — este critério passa. A conformidade com a negação está limpa: sem xícaras de café, sem metal, sem pratos, sem copos. Fonte de luz do canto superior esquerdo com sombras consistentes passa. Nenhum adereço de estilo presente.
GPT Image 2 demonstrou maior capacidade de seguir instruções nos componentes espaciais, embora nenhum modelo tenha alcançado uma contagem perfeita de 7 objetos com todas as restrições de posicionamento satisfeitas simultaneamente.
Cat 2 · Anatomia e Luz Fotorrealistas (T2I)
Prompt:
Retrato close-up de uma mulher do Leste Asiático no início dos trinta anos segurando uma taça de cristal meio cheia de vinho tinto na mão direita, todos os cinco dedos e o polegar totalmente visíveis, envolvendo naturalmente a haste e parcialmente o bojo. Ela está sentada perto de uma janela alta voltada para oeste durante a hora dourada. A luz do sol do final da tarde atravessa o vinho, criando padrões cáusticos carmesim quentes em sua bochecha esquerda e linha da mandíbula. A mão esquerda descansa sobre um livro de capa dura aberto no colo. Brilhos de luz da janela visíveis em ambos os olhos. A pele mostra poros ultra detalhados, penugem fina, dispersão subsuperficial no lóbulo da orelha e na ponte do nariz. Cabelo iluminado por trás com luz de borda. Lente 85mm, f/2.0, profundidade de campo rasa, realismo fotográfico.
Este é historicamente o teste de imagem única mais difícil para modelos generativos.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Critério | Verificação |
|---|---|---|
| 1 | Anatomia da mão | Todos os 5 dedos + polegar, pegada natural na haste e no bojo |
| 2 | Luz cáustica | Padrões carmesim quentes do vinho projetados na bochecha |
| 3 | Consistência do brilho | Mesma posição e forma em ambos os olhos |
| 4 | Dispersão subsuperficial (SSS) | Visível no lóbulo da orelha e na ponte do nariz quando iluminado por trás |
| 5 | Física da luz de borda | Direção corresponde à posição da fonte de luz |
| 6 | Realismo da pele | Sem suavização excessiva "plástica de IA"; poros e penugem visíveis |
Grok Imagine Image
GPT-Image 2
Grok Imagine entregou fortemente em sua vantagem principal. A anatomia da mão estava correta — contagem de dedos precisa, postura de pegada natural ao redor da haste e do bojo, ângulo do pulso fisicamente plausível. Isso por si só ultrapassa um nível que muitos modelos falham completamente. A textura da pele mostrou detalhes genuínos de poros com penugem fina visível e sem suavização plástica excessiva, e a dispersão subsuperficial na ponte do nariz e nas bochechas produziu uma qualidade quente e permeável à luz que parece fotograficamente real. A luz de borda no cabelo seguiu a direção da fonte da janela de forma coerente.
A projeção de luz cáustica foi o ponto mais fraco do Grok. Os padrões de luz carmesim apareceram no rosto, mas foram renderizados como uma sobreposição vermelha excessivamente grande e dramaticamente estilizada — mais parecendo um efeito de correção de cor do que os filamentos de luz finos e de borda suave que resultam fisicamente da luz solar passando pelo vinho. A plausibilidade física do cáustico falhou no padrão de precisão.
O GPT Image 2 inverteu a troca. Sua renderização de luz cáustica foi notavelmente mais precisa fisicamente — os padrões carmesim quentes na bochecha eram menores, mais difusos e seguiam a geometria espacial da luz passando por uma taça de vinho no ângulo correto. Este é o detalhe que Grok perdeu. No entanto, o GPT Image 2 pagou por isso em outros lugares: a anatomia da mão foi ligeiramente menos natural, com ângulos dos dedos ao redor da haste mostrando rigidez leve. A textura da pele tendeu à qualidade mais suave e ligeiramente plana comum em retratos de IA, com menos calor SSS visível e intensidade de luz de borda mais fraca em comparação com Grok.
Cat 3 · Pôster Multilíngue (T2I)
Prompt:
Um pôster de viagem vintage no estilo dos anos 1960 para um festival de cinema fictício, ilustrado no estilo do design comercial de meados do século. No topo do pôster, caracteres chineses grandes e em negrito com serifa lendo "时光电影节" (linha 1), e abaixo, em caracteres chineses menores, "第七届 · 上海 · 1965年5月" (linha 2).
Centro: uma ilustração estilizada de um projetor de cinema antigo projetando um feixe em uma tela de cinema ligeiramente curva.
Centro inferior: uma taça alta de champanhe coupé com o texto em inglês "GRAND OPENING NIGHT" envolvendo a curvatura do bojo da taça, seguindo a perspectiva elíptica.
Borda direita, texto vertical lendo "presented by 时代影业 · TIMES PICTURES" de cima para baixo.
Faixa inferior: pequenos créditos em inglês "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" em uma única linha.
Paleta de cores: fundo creme off-white, vermelho carmesim profundo, acentos em amarelo mostarda. Textura de papel envelhecido sutil, granulação leve.
Lista de verificação de pontuação
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Critério | Verificação |
|---|---|---|
| 1 | Precisão do chinês | Sem traços faltando, sem caracteres alucinados em |
| 2 | Layout bilíngue | Chinês e inglês não misturados; cada um aparece na zona correta |
| 3 | Texto curvo no vidro | O inglês segue a perspectiva elíptica da taça de champanhe coupé |
| 4 | Texto vertical na borda direita | Legível de cima para baixo |
| 5 | Hierarquia tipográfica | Distinção clara entre título |
| 6 | Estilo vs. legibilidade | Estética dos anos 1960 mantida sem sacrificar a clareza do texto |
Grok Imagine Image
GPT-Image 2
Grok Imagine produziu um pôster visualmente impressionante com forte energia de ilustração de meados do século. No entanto, falhou no critério de texto mais crítico: o título lê "時光電影節" em Chinês Tradicional, não o "时光电影节" em Chinês Simplificado especificado no prompt. Esta é uma falha de conformidade de conjunto de caracteres — uma distinção significativa para qualquer caso de uso de localização ou publicação. A segunda linha "第七屆 · 上海 · 1965年5月" também usou caracteres Tradicionais. No lado estrutural, "GRAND OPENING NIGHT" apareceu na taça de champanhe com curva parcial, embora a adesão à perspectiva elíptica tenha sido aproximada. O texto vertical na borda direita "TIMES PICTURES" estava legível. A linha de créditos inferior estava presente e legível. A paleta de cores — carmesim, mostarda, creme — foi bem executada. A energia geral do layout era alta, mas a falha de Tradicional vs. Simplificado é um desqualificador duro para o prompt declarado.
O GPT Image 2 passou no teste de conjunto de caracteres limpo: o título "时光电影节" e o subtítulo "第七届 · 上海 · 1965年5月" estão corretamente renderizados em Chinês Simplificado sem traços faltando ou glifos alucinados — uma vitória direta de conformidade sobre Grok. A taça de champanhe coupé está visível no centro inferior com "GRAND OPENING NIGHT" seguindo a curvatura da taça de forma convincente. O texto vertical na borda direita "时代影业 · TIMES PICTURES" vai de cima para baixo e é totalmente legível, com chinês e inglês corretamente colocados na mesma coluna vertical sem erros de mistura. A linha de créditos inferior — "music · HUANG ZHAN / cinematography · GU CHANGWEI / poster design · ZHANG GUANGYU" — está presente e legível como uma única linha. A hierarquia tipográfica entre título, subtítulo e nota de rodapé é claramente mantida. A textura de papel envelhecido e a paleta de cores de meados do século são bem realizadas. A composição integra uma silhueta reconhecível do horizonte de Xangai como ilustração central, o que não foi especificado no prompt, mas adiciona autenticidade contextual sem quebrar nenhum critério.
Cat 4 · Transformação Geométrica (I2I)
O prompt instruiu o modelo a girar um modelo de lookbook de moda de corpo inteiro exatamente 45° para a esquerda do sujeito, mantendo a mesma posição da câmera. A imagem de referência apresentava uma roupa complexa em camadas: sobretudo longo marrom, capa de ombro de couro, estola de pele com um gradiente visível (marrom escuro → prata → creme), um emblema redondo de cobre no peito com um retrato embutido, luvas de couro preto e botas de couro de dois tons. Nenhum desses detalhes foi listado no prompt — o modelo teve que preservá-los através da compreensão da identidade sozinho.

Este é um teste de estresse de capacidade deliberado. A instrução foi intencionalmente curta para evitar alimentar o modelo com sua própria rubrica de avaliação.
Lista de verificação de pontuação
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Critério | Verificação |
|---|---|---|
| 1 | Identidade facial | Similaridade ArcFace ≥ 0,5 (relaxado para escala de corpo inteiro) |
| 2 | Revelação da estola de pele | Lado direito prateado previamente oculto |
| 3 | Emblema no peito | Contorno circular de cobre + retrato embutido + compressão de perspectiva elíptica correta |
| 4 | Borda do casaco e camadas internas | Direção do drapeado natural após a rotação; proporção de exposição da calça interna razoável |
| 5 | Postura dos pés | Esquerdo na frente |
| 6 | Volume das luvas | Posição da mão + textura de malha visível pós-rotação |
| 7 | Limite de cor da bota | Marrom |
| 8 | Consistência do fundo | Fundo de estúdio cinza puro (região DINO ≥ 0,95) |
| 9 | Proporção da saída | Moldura de corpo inteiro 9:16 mantida, não cortada para retrato |
| 10 | Direção do olhar | Segue a rotação — não continua a olhar para a câmera |
Grok Imagine Image
GPT-Image 2
Grok manteve a identidade facial acima do limite ArcFace de 0,5 apropriado para imagens de corpo inteiro. A seção do lado direito previamente oculta da estola de pele tornou-se parcialmente visível a 45°, com continuidade de gradiente razoável. O contorno do emblema no peito foi preservado, embora o detalhe do retrato embutido tenha mostrado compressão. O limite de cor da bota e a textura da luva se mantiveram.
O GPT Image 2 mostrou coerência ligeiramente mais forte nas camadas de roupa em geral, mas introduziu mais deriva de identidade facial — uma troca significativa dependendo do caso de uso.
Cat 5 · Edição Local e Preservação de Região (I2I)
O prompt exigiu exatamente três edições em uma cena de sala de estar: remover um gato dormindo do sofá (e restaurar a almofada naturalmente), substituir uma xícara de chá quente por um copo de suco de laranja com gelo e adicionar óculos de leitura dobrados com armação preta em cima do livro do meio na mesa de centro. A instrução proibiu explicitamente mudar qualquer outra coisa — padrão do tecido do sofá, posições dos livros, abajur, vista da janela, cor da parede, chão.

O teste de preservação é tão importante quanto o teste de edição. Modelos que reinterpretam toda a cena ao fazer alterações locais não são utilizáveis para retoque de fotografia de produto ou desenvolvimento iterativo de cena.
Lista de verificação de pontuação
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Critério | Verificação |
|---|---|---|
| 1 | Todas as 3 edições concluídas | Gato removido |
| 2 | Restauração da almofada | Sem marca de gato ou resíduo de pelo no sofá |
| 3 | Física do suco de laranja | Geometria do copo, refração do gelo e direção da sombra correspondem à luz do copo original |
| 4 | Posicionamento dos óculos | Corretamente no livro do meio (não no superior ou inferior) |
| 5 | Tecido do sofá | Padrão de trama de losangos intacto, especialmente na zona editada |
| 6 | Livros inalterados | Posições, capas (vermelho |
| 7 | Abajur inalterado | Forma, estado de brilho e posição preservados |
| 8 | Vista da janela inalterada | Vista da cidade permanece desfocada e consistente |
| 9 | Parede e chão inalterados | Parede off-white e chão de madeira clara inalterados |
| 10 | Iluminação geral preservada | Direção da fonte de luz única traseira direita inalterada |
Grok Imagine Image
GPT-Image 2
Grok Imagine concluiu todas as três edições necessárias. O gato foi removido e a almofada do sofá restaurada limpa, sem marcas visíveis ou resíduos de pelo — o padrão do tecido na zona editada se manteve bem. O copo de suco de laranja apareceu na posição correta. No entanto, o copo de suco exibe um padrão de destaque que não se alinha com esta direção de fonte, parecendo ter sido composto com um modelo de luz independente em vez de integrado à iluminação existente da cena. A base do copo também mostra sombra de contato insuficiente contra a superfície da mesa de centro de madeira escura, criando um efeito de flutuação sutil, mas detectável.
O GPT Image 2 também concluiu todas as três edições e demonstrou preservação geral mais forte da cena. A remoção do gato foi igualmente limpa. O copo de suco de laranja foi bem renderizado com posicionamento correto e direção de sombra correspondente à fonte de luz da janela direita — a geometria do copo e a opacidade do líquido parecem mais refinadas que a versão do Grok. Os óculos de leitura foram colocados visivelmente na pilha de livros. Crucialmente, a vista da janela foi preservada — a cidade do lado de fora permanece visível e desfocada, consistente com a referência, que é onde Grok falhou. Tecido do sofá, abajur, parede e chão se mantiveram. Os livros parecem consistentes em posição e cor. A única mudança notável: a cena geral parece ligeiramente mais brilhante e com contraste alterado em comparação com o original, sugerindo alguma reinterpretação global da iluminação em vez de preservação verdadeira em nível de pixel — uma deriva menor, mas detectável.
Cat 6 · Fusão de Múltiplas Referências (I2I)
O prompt combinou três referências independentes: uma identidade de retrato (mulher latina, olhos âmbar, cabelo ondulado castanho escuro), um estilo de ilustração em aquarela (paisagem rural japonesa, pinceladas visíveis, atmosfera quente de conto de fadas) e um layout de cena (praça de cidade europeia com paralelepípedos ao pôr do sol, poste de ferro fundido, arco de pedra). A tarefa: produzir uma única pintura em aquarela coerente da pessoa identificada em pé na cena — não uma foto com filtro, não uma colagem.



A separação de três referências é o teste mais difícil neste benchmark. A maioria dos modelos ou superestima uma referência ou falha em alcançar a renderização através do estilo.
Lista de verificação de pontuação
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| # | Critério | Verificação |
|---|---|---|
| 1 | Separação tripla | Identidade |
| 2 | Transferência completa de estilo | A saída é aquarela em toda a extensão — não foto + filtro |
| 3 | Retenção de identidade pós-estilo | Olhos âmbar + estrutura facial reconhecível através do tratamento em aquarela |
| 4 | Estrutura da cena preservada | Paralelepípedos, poste e layout do arco intactos |
| 5 | Adição natural de roupas | Casaco de viagem e bolsa transversal adicionados sem quebrar a composição |
| 6 | Consistência da direção da luz | Brilho do pôr do sol vindo da esquerda da câmera visível nos paralelepípedos e na figura |
Grok Imagine Image
GPT-Image 2
Grok Imagine falhou no critério central: a saída é fotorrealista, não aquarela. A praça de paralelepípedos e a figura mantêm nitidez fotográfica total com apenas uma leve passagem de textura pictórica — nenhuma das pinceladas definidoras, sangria de cor ou qualidade de borda pintada à mão da Ref 2 está presente. Estrutura da cena, identidade, roupas e direção da luz passam todos. Mas renderizar o meio errado completamente é uma desqualificação em nível de categoria, não uma dedução parcial.
O GPT Image 2 alcançou renderização em aquarela genuína em todo o quadro — edifícios, paralelepípedos, céu e figura carregam pinceladas visíveis e sangria de cor suave consistentes com a Ref 2. A estrutura da cena da Ref 3 está intacta, o poste está aceso e o arco de pedra é visível no meio-termo. A identidade é parcialmente retida através da transformação de estilo — cabelo escuro ondulado e estrutura facial são reconhecíveis, embora características finas sejam abstratas conforme esperado. Casaco, bolsa transversal, direção da luz e olhar seguem o prompt. Esta é a única saída que completou a tarefa real.
Experimente os modelos Grok Imagine Image e GPT Image 2 via Atlas Cloud
O benchmark é reproduzível. Tanto o Grok Imagine quanto o GPT Image 2 estão disponíveis agora através do Atlas Cloud — sem configuração de faturamento por modelo, sem listas de espera.
Por que Atlas Cloud
- Uma chave de API, mais de 300 modelos. Alterne entre Grok, GPT Image 2, Flux, Wan, Seedream e todos os outros modelos no pool alterando um único campo de modelo. A mesma chave, o mesmo endpoint, o mesmo painel de faturamento — seja para executar um benchmark de seis modelos ou construir um pipeline de produção de imagens.
- Cobertura total de modalidades. LLMs, texto para imagem, imagem para imagem, texto para vídeo, imagem para vídeo — tudo sob o mesmo teto. Se seu fluxo de trabalho precisa de um modelo de linguagem para refinamento de prompt e um modelo de imagem para geração, ambos vivem na mesma API.
- Sem cold starts, sem surpresas de limite de taxa. O Atlas Cloud é executado em infraestrutura de inferência otimizada construída especificamente para throughput. Você obtém latência consistente, seja fazendo uma chamada ou mil.
- Construído para fluxos de trabalho de comparação. O caso de uso exato que este benchmark demonstra — executar prompts idênticos em vários modelos e comparar saídas — é para o que a arquitetura do Atlas Cloud foi projetada. Uma chave, uma fatura, amplitude total de modelos.







