


A API MAI Image 2.5 disponibiliza a família de geração e edição de imagens fotorrealistas da Microsoft por meio de um único endpoint, abrangendo texto-para-imagem e edição nas variantes standard e Flash. Além de texto fiável dentro da imagem, produz retratos naturais e aplica raciocínio visual para manter a disposição da cena coerente. A Atlas Cloud oferece preços com pagamento conforme o uso a partir de $0.03 por imagem, acesso Day-0 e uma chave compatível com OpenAI.
O Atlas Cloud oferece os modelos criativos mais avançados e inovadores do setor.
Quatro endpoints abrangem geração de texto para imagem e edição de imagens, cada um oferecido em um nível padrão e um nível Flash, com preços transparentes por chamada.
| Modalidade | Descrição |
|---|---|
| MAI Image 2.5 API (Text to Image) | Transforme prompts em linguagem natural em imagens de alta qualidade e visualmente ricas com o principal modelo de texto para imagem da Microsoft. Ele é voltado para visuais de marketing, fotografia para e-commerce e trabalhos de design comercial que precisam de output pronto para produção. Preço de $0.05 por imagem. |
| MAI Image 2.5 Flash (Text to Image) | Quando a capacidade de processamento e o orçamento são tão importantes quanto a fidelidade, a variante Flash gera imagens na mesma arquitetura baseada em difusão, a um custo mais baixo de $0.03 por imagem. Ela se adapta a pipelines de geração em alto volume e de prototipagem rápida que precisam de qualidade consistente sem aumentar os gastos. |
| MAI Image 2.5 Edit API (Image Editing) | Forneça uma imagem existente juntamente com uma instrução em linguagem natural para aplicar edições precisas e controláveis, em vez de regenerar tudo do zero. O endpoint lida com remoção de objetos, substituição de elementos e ajustes localizados, mantendo intacta a composição ao redor, com cobrança de $0.058 por edição. |
| MAI Image 2.5 Flash Edit (Image Editing) | Equipes que executam pipelines de refinamento de alto throughput obtêm a mesma capacidade de edição orientada por instruções do modelo Edit padrão, a um custo reduzido de $0.038 por edição. Isso torna viáveis a limpeza em massa de catálogos e as atualizações de assets em grandes lotes, mantendo baixo o gasto por operação. |
A combinação de modelos avançados com a plataforma acelerada por GPU do Atlas Cloud oferece velocidade, escalabilidade e controle criativo incomparáveis para geração de imagens e vídeos.

O MAI-Image-2.5 gera retratos expressivos e de aparência natural com estrutura facial, iluminação e textura de pele precisas a partir de prompts de texto. O modelo renderiza uma estética com qualidade de cinema, com iluminação consistente que corresponde à cena descrita. Foi concebido para campanhas editoriais, de branding e comerciais onde as imagens centradas em seres humanos precisam ter um aspecto finalizado sem pós-processamento.

O MAI-Image-2.5 oferece confiabilidade aprimorada para a geração de texto em imagens, lidando com rótulos de produtos, sinalização, manchetes e textos de marca com espaçamento correto e legibilidade. Isso resolve um ponto fraco consistente na maioria dos modelos de geração de imagens e o torna prático para mockups de embalagens e ativos de publicidade onde texto legível é necessário na saída. É a escolha certa para fluxos de trabalho de design onde a precisão do texto na imagem é inegociável.

O endpoint MAI-Image-2.5 Edit realiza modificações direcionadas em regiões específicas da imagem: remoção de elementos indesejados, substituição ou recoloração de objetos, atualização de texto em sinalizações existentes, preenchimento de áreas ausentes e limpeza de defeitos visuais como desfoque e ruído. As edições mantêm a coerência e a composição em todo o processo, deixando as regiões não tocadas visualmente intactas. É a ferramenta ideal para o refinamento de produtos, limpeza de catálogos e atualizações de ativos de marketing.

O MAI-Image-2.5 foi desenvolvido especificamente para aplicações de design comercial e profissional, suportando a criação de branding, mockups de produtos e conteúdo pronto para campanhas a partir de prompts de texto. O modelo mantém a integridade do layout e da composição tanto durante a geração quanto na edição, produzindo ativos prontos para uso em publicidade e campanhas de produtos. É a solução padrão para equipes de design que produzem recursos visuais comerciais em larga escala.

O MAI-Image-2.5 aplica raciocínio visual para entender relações espaciais, posicionamento de objetos e coerência de iluminação em toda a imagem. Isso o torna confiável para gerar cenas onde múltiplos elementos precisam coexistir naturalmente, e para tarefas de edição onde uma modificação precisa respeitar o contexto ao redor. É adequado para a visualização de produtos no cenário e qualquer fluxo de trabalho onde a precisão contextual na saída seja importante.
O mesmo prompt, gerado pelo Mai Image 2.5 e por outros modelos de imagem líderes: anúncio de produto e lifestyle cinematográfico
Fotografia editorial macro de natureza-morta: uma fileira de antigos frascos artesanais de boticário e perfume em vidro colorido, de alturas irregulares — baixos, altos, bulbosos — sobre um peitoril de janela em reboco de cal desgastado, com o vidro fosco marcado por minúsculas bolhas de ar presas. O momento decisivo: uma mão humana nua inclina um frasco âmbar e um fio fino e límpido de líquido transparente fica suspenso no ar, capturado e iluminado no meio da queda, com a tensão superficial e a borda em gotículas extremamente nítidas. Ao fundo, os outros frascos refratam o sol baixo da hora dourada numa dispersão de caústicas sobrepostas em tons de joias — âmbar, verde-garrafa profundo, rosa — que avançam lentamente pelo reboco cinzento, áspero e calcificado. Um contraluz lateral baixo de hora dourada atravessa o vidro em rasante, projetando caústicas direcionais e focadas e uma luz de recorte brilhante ao longo da silhueta de cada frasco. Composição construída sobre a repetição gráfica da fileira de frascos, contrastada com uma ampla área de parede cinzenta neutra como espaço negativo, profundidade de campo rasa comprimindo a fileira, com a mão que verte e o fio de água cintilante como ponto focal nítido. Paleta limitada em tons de gemas — âmbar, verde-escuro e rosa — em contraste com a parede cinzenta discreta; contida, nunca espalhafatosa. Detalhe macro hiper-realista: grão do vidro fosco, bolhas, textura calcária da parede, a pele tensa do líquido, partículas de pó ténues a flutuar no feixe de luz. Silencioso, com um toque de magia. Captado com lente macro de 100mm, luz natural de janela, acabamento de fotografia editorial de produto. Proporção 16:9.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Banca de noodles de rua à noite, no instante decisivo em que um mestre de lamian puxa uma única bola de massa e a transforma num leque de dezenas de fios de noodles perfeitamente paralelos, finos como cabelo, suspensos no ar, abrindo-se para fora como um leque de mão enquanto uma explosão de farinha solta e vapor ascendente irrompe no mesmo instante — isto é ação capturada em movimento, não uma pose. O rosto dele está preso em concentração total, músculos tensos com força controlada, sobrancelhas franzidas, uma gota de suor na têmpora; atrás dele, observadores desfocados e fora de foco prendem a respiração em antecipação. Fotografia documental de rua realista, linguagem de teleobjetiva. Iluminado pela única lâmpada quente de tungsténio da banca como um contraluz lateral duro que recorta cada fio translúcido de noodle com bordas brilhantes, apanha o pó de farinha no ar como faíscas flutuantes e torna luminoso o vapor branco que se expande; o néon azul frio da rua noturna ao fundo dissolve-se em orbes suaves de bokeh. A compressão de profundidade em múltiplas camadas da teleobjetiva achata as mãos do mestre, o rosto concentrado e a cascata de noodles num único plano, com os fios paralelos densos a funcionar tanto como elemento gráfico repetitivo quanto como linhas-guia naturais que conduzem o olhar pelo enquadramento. Equilíbrio de cor frio-quente — brilho âmbar de tungsténio no primeiro plano contra o azul frio profundo da noite — contido e nunca berrante. Textura tátil rica: partículas de farinha ásperas, brilho subtil do glúten, tábua de corte de madeira gasta e encharcada de óleo, suor na pele e um leve desfoque de movimento nos fios em voo e no pó à deriva. Grão fino de filme, profundidade de campo rasa, sem renderização excessiva, sem pele plastificada, tonalidade natural e honesta. Captado com teleobjetiva de 135mm, abertura ampla, sensação de reportagem espontânea. Proporção 16:9.

Mai Image 2.5

Flux.2

Qwen Image 2.0
De catálogos de e-commerce e criativos publicitários a embalagens, imagens de porta-voz e visualização de produtos em contexto, a MAI Image 2.5 API apoia o trabalho de design comercial que as equipas entregam todos os dias.
Gere fotografias de produto em fundos variados a partir de uma única referência; depois, altere cores e elimine defeitos em toda uma gama de SKU através do endpoint Edit. Um conjunto completo de variantes custa menos do que uma única nova sessão em estúdio.
As equipas de marketing de performance produzem variações para banners, redes sociais e display com sobreposições de texto precisas e layouts consistentes com a marca. Como a variante Flash corre a $0.03 por imagem, testar dezenas de conceitos antes de escalar os vencedores continua a ser barato.
Os mockups de embalagens incluem tipografia legível integrada diretamente na arte de caixas, garrafas e sinalética de prateleira, em vez de ser colocada manualmente. Quando o texto muda, o endpoint Edit revê nomes, preços ou copy sazonal sem reconstruir o layout.
Um rosto reconhecível, o guarda-roupa e a identidade geral mantêm-se estáveis em diferentes poses e layouts ao longo de edições sucessivas. Isto garante que personagens recorrentes de campanhas e séries contínuas para redes sociais mantêm uma aparência coerente onde quer que apareçam.
Reflexos, objetos indesejados e desfocagem de movimento são removidos de forma limpa, enquanto o inpainting preenche regiões em falta e a composição envolvente permanece intacta. A $0.058 por edição, limpar milhares de fotografias antigas torna-se uma tarefa de lote rotineira.
O modelo raciocina sobre iluminação, escala e relações espaciais para inserir produtos em cenas de lifestyle com sombras e perspetiva credíveis. As equipas de conceito e prototipagem pré-visualizam ideias de encenação muito antes de reservar uma sessão fotográfica física.
Compare a API MAI Image 2.5 frente a frente com os principais modelos de texto para imagem da Google, ByteDance e Alibaba em termos de fornecedor, preço, resolução e renderização de texto.
| Modelo | Fornecedor | Preço inicial (por imagem) | Resolução máxima | Renderização de texto na imagem | Camada rápida otimizada para custo |
|---|---|---|---|---|---|
| MAI-Image-2.5 (Texto para imagem) | Microsoft | $0.05 | Até ~1 MP (máx. de 1360 px por lado) | √ | √ |
| MAI-Image-2.5 Flash (Texto para imagem) | Microsoft | $0.03 | Até ~1 MP (máx. de 1360 px por lado) | √ | √ |
| Nano Banana 2 (Texto para imagem) | $0.08 | Até 4K | √ | √ | |
| Seedream v4.5 | ByteDance | $0.04 | Até 2048×2048 | √ | - |
| Qwen Image 2.0 (Texto para imagem) | Alibaba | $0.035 | Até 2048×2048 | √ | - |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de MAI Image 2.5 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar MAI Image 2.5, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
A MAI Image 2.5 API dá aos programadores acesso programático ao MAI-Image-2.5 da Microsoft, um modelo de geração e edição de imagens fotorrealistas criado para trabalho de design comercial. Abrange tanto a geração de texto para imagem como a edição de imagens baseada em instruções, cada uma disponível numa variante standard e numa variante Flash. Na Atlas Cloud, acede aos quatro endpoints com uma única chave compatível com OpenAI e preços de pagamento conforme o uso a partir de $0.03 por imagem.
Ambas as variantes partilham a mesma arquitetura de difusão, fotorrealismo e qualidade de renderização de texto. Flash é a opção otimizada para custos, a $0.03 por imagem na geração e $0.038 por edição, enquanto o modelo standard custa $0.05 por imagem e $0.058 por edição. Use Flash para geração em grande volume e prototipagem rápida, e mantenha o modelo standard para trabalhos em que a fidelidade máxima é o mais importante.
Na Atlas Cloud, os preços são de pagamento conforme o uso, sem subscrição. A geração standard de texto para imagem custa $0.05 por imagem e a edição standard custa $0.058 por edição, enquanto as variantes Flash descem para $0.03 por imagem e $0.038 por edição. A cobrança é feita por chamada bem-sucedida, por isso um lote de variações custa apenas a tarifa fixa por imagem multiplicada pelo número de resultados.
Registe-se na Atlas Cloud, crie uma única chave de API e aponte o seu cliente existente compatível com OpenAI para o endpoint MAI-Image-2.5. Envie um prompt de texto para geração, ou uma imagem acompanhada de uma instrução para edição, e a resposta devolve URLs para as imagens finalizadas. O acesso no dia 0 significa que o modelo fica disponível assim que é lançado, sem lista de espera. Comece a desenvolver hoje.
Define as dimensões de saída com um parâmetro size no formato largura por altura, com predefinição de 1024 por 1024. Cada lado pode variar entre 768 e 1360 píxeis, até um limite total de aproximadamente um megapixel, abrangendo enquadramentos quadrados, verticais e horizontais. As variantes de geração standard e Flash partilham os mesmos limites de resolução.
O endpoint Edit recebe uma única imagem de origem, fornecida como URL ou base64 em JPEG ou PNG, juntamente com uma instrução em linguagem natural. Realiza alterações direcionadas, como remover objetos, substituir elementos, mudar cores, atualizar texto em sinalética e corrigir defeitos, preservando intactas as regiões não afetadas. Como o modelo raciocina sobre a estrutura da cena e a iluminação, as edições mantêm-se coerentes com a composição envolvente.
A renderização de texto é uma das maiores evoluções do modelo, e a Microsoft relata que o maior salto de qualidade em relação à geração anterior ocorreu exatamente nesta categoria. O modelo produz de forma fiável rótulos de produtos, sinalética, títulos e textos de marca com espaçamento correto e boa legibilidade. Essa fiabilidade torna-o prático para maquetes de embalagens e materiais publicitários em que texto legível dentro da imagem é indispensável.
Nos rankings públicos da Arena, o MAI-Image-2.5 foi lançado em 2.º lugar para edição de imagens e em 3.º lugar para geração de texto para imagem. Os seus pontos fortes estão em retratos fotorrealistas, renderização de texto de nível comercial e edição consistente com a identidade, mais do que em resultados estilizados ou artísticos. Para equipas que produzem visuais prontos para marca, esse posicionamento torna-o uma alternativa forte aos geradores de uso geral.
A Microsoft criou e ajustou o MAI-Image-2.5 especificamente para trabalho de design comercial e profissional, incluindo embalagens, maquetes de produtos, sinalética e visuais centrados na marca. O modelo destina-se a uso em produção em fluxos de trabalho de publicidade, e-commerce e marketing. Para conhecer os direitos de uso exatos aplicáveis à sua conta, consulte os termos atuais da Atlas Cloud antes de publicar os recursos gerados.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.