Seedance 2.5 já está disponível — Primeiro na Atlas Cloud
Hero background 1Hero background 2Hero background 3

MAI Image 2.5 API for Accurate In-image Text

A API MAI Image 2.5 disponibiliza a família de geração e edição de imagens fotorrealistas da Microsoft por meio de um único endpoint, abrangendo texto-para-imagem e edição nas variantes standard e Flash. Além de texto fiável dentro da imagem, produz retratos naturais e aplica raciocínio visual para manter a disposição da cena coerente. A Atlas Cloud oferece preços com pagamento conforme o uso a partir de $0.03 por imagem, acesso Day-0 e uma chave compatível com OpenAI.

Explorar Modelos Líderes

O Atlas Cloud oferece os modelos criativos mais avançados e inovadores do setor.

Compare todos os endpoints da MAI Image 2.5 API por modalidade e preço

Quatro endpoints abrangem geração de texto para imagem e edição de imagens, cada um oferecido em um nível padrão e um nível Flash, com preços transparentes por chamada.

ModalidadeDescrição
MAI Image 2.5 API (Text to Image)Transforme prompts em linguagem natural em imagens de alta qualidade e visualmente ricas com o principal modelo de texto para imagem da Microsoft. Ele é voltado para visuais de marketing, fotografia para e-commerce e trabalhos de design comercial que precisam de output pronto para produção. Preço de $0.05 por imagem.
MAI Image 2.5 Flash (Text to Image)Quando a capacidade de processamento e o orçamento são tão importantes quanto a fidelidade, a variante Flash gera imagens na mesma arquitetura baseada em difusão, a um custo mais baixo de $0.03 por imagem. Ela se adapta a pipelines de geração em alto volume e de prototipagem rápida que precisam de qualidade consistente sem aumentar os gastos.
MAI Image 2.5 Edit API (Image Editing)Forneça uma imagem existente juntamente com uma instrução em linguagem natural para aplicar edições precisas e controláveis, em vez de regenerar tudo do zero. O endpoint lida com remoção de objetos, substituição de elementos e ajustes localizados, mantendo intacta a composição ao redor, com cobrança de $0.058 por edição.
MAI Image 2.5 Flash Edit (Image Editing)Equipes que executam pipelines de refinamento de alto throughput obtêm a mesma capacidade de edição orientada por instruções do modelo Edit padrão, a um custo reduzido de $0.038 por edição. Isso torna viáveis a limpeza em massa de catálogos e as atualizações de assets em grandes lotes, mantendo baixo o gasto por operação.

Novos recursos dos modelos MAI-Image-2.5 + Demonstração

A combinação de modelos avançados com a plataforma acelerada por GPU do Atlas Cloud oferece velocidade, escalabilidade e controle criativo incomparáveis para geração de imagens e vídeos.

Geração de retratos fotorrealistas

Geração de retratos fotorrealistas

O MAI-Image-2.5 gera retratos expressivos e de aparência natural com estrutura facial, iluminação e textura de pele precisas a partir de prompts de texto. O modelo renderiza uma estética com qualidade de cinema, com iluminação consistente que corresponde à cena descrita. Foi concebido para campanhas editoriais, de branding e comerciais onde as imagens centradas em seres humanos precisam ter um aspecto finalizado sem pós-processamento.

Renderização de texto em imagem

Renderização de texto em imagem

O MAI-Image-2.5 oferece confiabilidade aprimorada para a geração de texto em imagens, lidando com rótulos de produtos, sinalização, manchetes e textos de marca com espaçamento correto e legibilidade. Isso resolve um ponto fraco consistente na maioria dos modelos de geração de imagens e o torna prático para mockups de embalagens e ativos de publicidade onde texto legível é necessário na saída. É a escolha certa para fluxos de trabalho de design onde a precisão do texto na imagem é inegociável.

Edição Cirúrgica de Objetos

Edição Cirúrgica de Objetos

O endpoint MAI-Image-2.5 Edit realiza modificações direcionadas em regiões específicas da imagem: remoção de elementos indesejados, substituição ou recoloração de objetos, atualização de texto em sinalizações existentes, preenchimento de áreas ausentes e limpeza de defeitos visuais como desfoque e ruído. As edições mantêm a coerência e a composição em todo o processo, deixando as regiões não tocadas visualmente intactas. É a ferramenta ideal para o refinamento de produtos, limpeza de catálogos e atualizações de ativos de marketing.

Ativos de Marca e Design Comercial

Ativos de Marca e Design Comercial

O MAI-Image-2.5 foi desenvolvido especificamente para aplicações de design comercial e profissional, suportando a criação de branding, mockups de produtos e conteúdo pronto para campanhas a partir de prompts de texto. O modelo mantém a integridade do layout e da composição tanto durante a geração quanto na edição, produzindo ativos prontos para uso em publicidade e campanhas de produtos. É a solução padrão para equipes de design que produzem recursos visuais comerciais em larga escala.

Raciocínio Visual através de Objetos e Cenas

Raciocínio Visual através de Objetos e Cenas

O MAI-Image-2.5 aplica raciocínio visual para entender relações espaciais, posicionamento de objetos e coerência de iluminação em toda a imagem. Isso o torna confiável para gerar cenas onde múltiplos elementos precisam coexistir naturalmente, e para tarefas de edição onde uma modificação precisa respeitar o contexto ao redor. É adequado para a visualização de produtos no cenário e qualquer fluxo de trabalho onde a precisão contextual na saída seja importante.

Mai Image 2.5 vs outros modelos — Um único prompt

O mesmo prompt, gerado pelo Mai Image 2.5 e por outros modelos de imagem líderes: anúncio de produto e lifestyle cinematográfico

Prompt

Fotografia editorial macro de natureza-morta: uma fileira de antigos frascos artesanais de boticário e perfume em vidro colorido, de alturas irregulares — baixos, altos, bulbosos — sobre um peitoril de janela em reboco de cal desgastado, com o vidro fosco marcado por minúsculas bolhas de ar presas. O momento decisivo: uma mão humana nua inclina um frasco âmbar e um fio fino e límpido de líquido transparente fica suspenso no ar, capturado e iluminado no meio da queda, com a tensão superficial e a borda em gotículas extremamente nítidas. Ao fundo, os outros frascos refratam o sol baixo da hora dourada numa dispersão de caústicas sobrepostas em tons de joias — âmbar, verde-garrafa profundo, rosa — que avançam lentamente pelo reboco cinzento, áspero e calcificado. Um contraluz lateral baixo de hora dourada atravessa o vidro em rasante, projetando caústicas direcionais e focadas e uma luz de recorte brilhante ao longo da silhueta de cada frasco. Composição construída sobre a repetição gráfica da fileira de frascos, contrastada com uma ampla área de parede cinzenta neutra como espaço negativo, profundidade de campo rasa comprimindo a fileira, com a mão que verte e o fio de água cintilante como ponto focal nítido. Paleta limitada em tons de gemas — âmbar, verde-escuro e rosa — em contraste com a parede cinzenta discreta; contida, nunca espalhafatosa. Detalhe macro hiper-realista: grão do vidro fosco, bolhas, textura calcária da parede, a pele tensa do líquido, partículas de pó ténues a flutuar no feixe de luz. Silencioso, com um toque de magia. Captado com lente macro de 100mm, luz natural de janela, acabamento de fotografia editorial de produto. Proporção 16:9.

Mai Image 2.5

Mai Image 2.5

Flux.2

Flux.2

Qwen Image 2.0

Qwen Image 2.0

Prompt

Banca de noodles de rua à noite, no instante decisivo em que um mestre de lamian puxa uma única bola de massa e a transforma num leque de dezenas de fios de noodles perfeitamente paralelos, finos como cabelo, suspensos no ar, abrindo-se para fora como um leque de mão enquanto uma explosão de farinha solta e vapor ascendente irrompe no mesmo instante — isto é ação capturada em movimento, não uma pose. O rosto dele está preso em concentração total, músculos tensos com força controlada, sobrancelhas franzidas, uma gota de suor na têmpora; atrás dele, observadores desfocados e fora de foco prendem a respiração em antecipação. Fotografia documental de rua realista, linguagem de teleobjetiva. Iluminado pela única lâmpada quente de tungsténio da banca como um contraluz lateral duro que recorta cada fio translúcido de noodle com bordas brilhantes, apanha o pó de farinha no ar como faíscas flutuantes e torna luminoso o vapor branco que se expande; o néon azul frio da rua noturna ao fundo dissolve-se em orbes suaves de bokeh. A compressão de profundidade em múltiplas camadas da teleobjetiva achata as mãos do mestre, o rosto concentrado e a cascata de noodles num único plano, com os fios paralelos densos a funcionar tanto como elemento gráfico repetitivo quanto como linhas-guia naturais que conduzem o olhar pelo enquadramento. Equilíbrio de cor frio-quente — brilho âmbar de tungsténio no primeiro plano contra o azul frio profundo da noite — contido e nunca berrante. Textura tátil rica: partículas de farinha ásperas, brilho subtil do glúten, tábua de corte de madeira gasta e encharcada de óleo, suor na pele e um leve desfoque de movimento nos fios em voo e no pó à deriva. Grão fino de filme, profundidade de campo rasa, sem renderização excessiva, sem pele plastificada, tonalidade natural e honesta. Captado com teleobjetiva de 135mm, abertura ampla, sensação de reportagem espontânea. Proporção 16:9.

Mai Image 2.5

Mai Image 2.5

Flux.2

Flux.2

Qwen Image 2.0

Qwen Image 2.0

Onde as equipas de design põem a MAI Image 2.5 API a trabalhar

De catálogos de e-commerce e criativos publicitários a embalagens, imagens de porta-voz e visualização de produtos em contexto, a MAI Image 2.5 API apoia o trabalho de design comercial que as equipas entregam todos os dias.

Fotografia de catálogo de e-commerce em escala

Gere fotografias de produto em fundos variados a partir de uma única referência; depois, altere cores e elimine defeitos em toda uma gama de SKU através do endpoint Edit. Um conjunto completo de variantes custa menos do que uma única nova sessão em estúdio.

Criativos publicitários e testes A/B com a MAI Image 2.5 API

As equipas de marketing de performance produzem variações para banners, redes sociais e display com sobreposições de texto precisas e layouts consistentes com a marca. Como a variante Flash corre a $0.03 por imagem, testar dezenas de conceitos antes de escalar os vencedores continua a ser barato.

Produção de embalagens e rótulos

Os mockups de embalagens incluem tipografia legível integrada diretamente na arte de caixas, garrafas e sinalética de prateleira, em vez de ser colocada manualmente. Quando o texto muda, o endpoint Edit revê nomes, preços ou copy sazonal sem reconstruir o layout.

Imagens consistentes de porta-voz da marca

Um rosto reconhecível, o guarda-roupa e a identidade geral mantêm-se estáveis em diferentes poses e layouts ao longo de edições sucessivas. Isto garante que personagens recorrentes de campanhas e séries contínuas para redes sociais mantêm uma aparência coerente onde quer que apareçam.

Retoque e limpeza de catálogos com a MAI Image 2.5 API

Reflexos, objetos indesejados e desfocagem de movimento são removidos de forma limpa, enquanto o inpainting preenche regiões em falta e a composição envolvente permanece intacta. A $0.058 por edição, limpar milhares de fotografias antigas torna-se uma tarefa de lote rotineira.

Visualização de produtos em contexto com a MAI Image 2.5 API

O modelo raciocina sobre iluminação, escala e relações espaciais para inserir produtos em cenas de lifestyle com sombras e perspetiva credíveis. As equipas de conceito e prototipagem pré-visualizam ideias de encenação muito antes de reservar uma sessão fotográfica física.

Como a API MAI Image 2.5 se compara a modelos de imagem concorrentes

Compare a API MAI Image 2.5 frente a frente com os principais modelos de texto para imagem da Google, ByteDance e Alibaba em termos de fornecedor, preço, resolução e renderização de texto.

ModeloFornecedorPreço inicial (por imagem)Resolução máximaRenderização de texto na imagemCamada rápida otimizada para custo
MAI-Image-2.5 (Texto para imagem)Microsoft$0.05Até ~1 MP (máx. de 1360 px por lado)
MAI-Image-2.5 Flash (Texto para imagem)Microsoft$0.03Até ~1 MP (máx. de 1360 px por lado)
Nano Banana 2 (Texto para imagem)Google$0.08Até 4K
Seedream v4.5ByteDance$0.04Até 2048×2048-
Qwen Image 2.0 (Texto para imagem)Alibaba$0.035Até 2048×2048-

Como Usar MAI Image 2.5 no Atlas Cloud

Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.

Crie uma Conta no Atlas Cloud

Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.

Por Que Usar MAI Image 2.5 no Atlas Cloud

Combine modelos avançados de MAI Image 2.5 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.

Desempenho e Flexibilidade

Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.

API Unificada:
Uma única integração para acessar MAI Image 2.5, GPT, Gemini e DeepSeek.

Preços Transparentes:
Faturamento por Token, suporta modo Serverless.

Empresa e Escala

Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.

Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.

Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.

MAI Image 2.5 API: perguntas que os programadores fazem antes de começar a desenvolver

A MAI Image 2.5 API dá aos programadores acesso programático ao MAI-Image-2.5 da Microsoft, um modelo de geração e edição de imagens fotorrealistas criado para trabalho de design comercial. Abrange tanto a geração de texto para imagem como a edição de imagens baseada em instruções, cada uma disponível numa variante standard e numa variante Flash. Na Atlas Cloud, acede aos quatro endpoints com uma única chave compatível com OpenAI e preços de pagamento conforme o uso a partir de $0.03 por imagem.

Ambas as variantes partilham a mesma arquitetura de difusão, fotorrealismo e qualidade de renderização de texto. Flash é a opção otimizada para custos, a $0.03 por imagem na geração e $0.038 por edição, enquanto o modelo standard custa $0.05 por imagem e $0.058 por edição. Use Flash para geração em grande volume e prototipagem rápida, e mantenha o modelo standard para trabalhos em que a fidelidade máxima é o mais importante.

Na Atlas Cloud, os preços são de pagamento conforme o uso, sem subscrição. A geração standard de texto para imagem custa $0.05 por imagem e a edição standard custa $0.058 por edição, enquanto as variantes Flash descem para $0.03 por imagem e $0.038 por edição. A cobrança é feita por chamada bem-sucedida, por isso um lote de variações custa apenas a tarifa fixa por imagem multiplicada pelo número de resultados.

Registe-se na Atlas Cloud, crie uma única chave de API e aponte o seu cliente existente compatível com OpenAI para o endpoint MAI-Image-2.5. Envie um prompt de texto para geração, ou uma imagem acompanhada de uma instrução para edição, e a resposta devolve URLs para as imagens finalizadas. O acesso no dia 0 significa que o modelo fica disponível assim que é lançado, sem lista de espera. Comece a desenvolver hoje.

Define as dimensões de saída com um parâmetro size no formato largura por altura, com predefinição de 1024 por 1024. Cada lado pode variar entre 768 e 1360 píxeis, até um limite total de aproximadamente um megapixel, abrangendo enquadramentos quadrados, verticais e horizontais. As variantes de geração standard e Flash partilham os mesmos limites de resolução.

O endpoint Edit recebe uma única imagem de origem, fornecida como URL ou base64 em JPEG ou PNG, juntamente com uma instrução em linguagem natural. Realiza alterações direcionadas, como remover objetos, substituir elementos, mudar cores, atualizar texto em sinalética e corrigir defeitos, preservando intactas as regiões não afetadas. Como o modelo raciocina sobre a estrutura da cena e a iluminação, as edições mantêm-se coerentes com a composição envolvente.

A renderização de texto é uma das maiores evoluções do modelo, e a Microsoft relata que o maior salto de qualidade em relação à geração anterior ocorreu exatamente nesta categoria. O modelo produz de forma fiável rótulos de produtos, sinalética, títulos e textos de marca com espaçamento correto e boa legibilidade. Essa fiabilidade torna-o prático para maquetes de embalagens e materiais publicitários em que texto legível dentro da imagem é indispensável.

Nos rankings públicos da Arena, o MAI-Image-2.5 foi lançado em 2.º lugar para edição de imagens e em 3.º lugar para geração de texto para imagem. Os seus pontos fortes estão em retratos fotorrealistas, renderização de texto de nível comercial e edição consistente com a identidade, mais do que em resultados estilizados ou artísticos. Para equipas que produzem visuais prontos para marca, esse posicionamento torna-o uma alternativa forte aos geradores de uso geral.

A Microsoft criou e ajustou o MAI-Image-2.5 especificamente para trabalho de design comercial e profissional, incluindo embalagens, maquetes de produtos, sinalética e visuais centrados na marca. O modelo destina-se a uso em produção em fluxos de trabalho de publicidade, e-commerce e marketing. Para conhecer os direitos de uso exatos aplicáveis à sua conta, consulte os termos atuais da Atlas Cloud antes de publicar os recursos gerados.

Explorar Mais Séries

Seedance 2.5

A API do Seedance 2.5 fornece o mais recente modelo de geração de vídeo da ByteDance, o sucessor do Seedance 2.0 construído em uma arquitetura multimodal unificada. Ele renderiza até 30 segundos de filmagem em uma única passagem, mantém os sujeitos consistentes sob uma física realista e desenha texto e legendas multilíngues diretamente no quadro. A Atlas Cloud traz acesso Day-0 nos mesmos endpoints unificados que já atendem ao Seedance 2.0 e 1.5. Comece a construir hoje.

Ver Série

MiniMax H3

A MiniMax H3 API disponibiliza o modelo de vídeo multimodal de uso geral da MiniMax, que processa texto, imagens, vídeo e áudio como um único contexto, em vez de uma tarefa de cada vez. Os clipes têm de 5 a 15 segundos a 24 FPS, em proporções de 21:9 a 9:16, e um único prompt pode trocar personagens, substituir fundos, reescrever diálogos ou clonar uma voz a partir de um clipe de referência. A Atlas Cloud disponibiliza tudo isto através de um único endpoint compatível com OpenAI. Comece a criar hoje mesmo.

Ver Série

Seedream 5.0 Pro

A API do Seedream 5.0 Pro fornece aos desenvolvedores o modelo de edição de imagens controlável da ByteDance no Atlas Cloud. Ela posiciona as edições com precisão usando âncoras e coordenadas, separa as imagens em camadas editáveis, funde múltiplas referências e combina cores e materiais exatos, com texto multilíngue em 2K e 3K. No Atlas Cloud, você pode acessá-lo por meio de uma única chave!

Ver Série

Seedance 2.0

A API do Seedance 2.0 oferece acesso de produção ao modelo de vídeo multimodal da ByteDance — entradas quadrimodais (texto, imagem, vídeo, áudio) e um sistema "Universal Reference" líder do setor que fixa a composição, o movimento da câmera e as ações dos personagens entre as cenas. Integre um controle de nível de diretor com uma única chamada de API, uma taxa fixa de $0,09/s, chave instantânea e sem lista de espera — respaldado por tempo de atividade e conformidade de nível corporativo. O Seedance 2.0 Native 4K já está no ar!

Ver Série

GPT Image 2

A API do GPT Image 2 dá aos desenvolvedores acesso ao mais recente modelo de imagem da OpenAI, o sucessor do GPT Image 1.5. Ele gera e edita imagens com renderização de texto precisa em caracteres latinos e CJK, além de uma forte composição para pôsteres, mockups e infográficos. Na Atlas Cloud, você o acessa através de uma API unificada junto a mais de 300 modelos, com créditos gratuitos, 99,99% de tempo de atividade e sem a necessidade de verificação de organização da OpenAI.

Ver Série

Gemini Omni Flash

A Gemini Omni API traz para o seu stack o modelo multimodal de geração e edição de vídeo do Google DeepMind, apresentado no Google I/O 2026. O Gemini Omni funde o motor de raciocínio do Gemini com mídia generativa, aceitando qualquer combinação de texto, imagens, vídeo e áudio para produzir resultados consistentes e fundamentados em conhecimento. Refine os resultados por meio de conversas naturais — troque objetos, reescreva cenas e mude estilos, enquanto a física, os personagens e a continuidade permanecem intactos. A Atlas Cloud oferece toda a linha Gemini Omni Flash — texto para vídeo, imagem para vídeo com até 7 imagens de referência e referência para vídeo — por meio de uma única API unificada, com preços transparentes por segundo a partir de $0.112 e sem assinatura. Comece a construir hoje mesmo.

Ver Série

Grok Imagine

A Grok Imagine API oferece aos desenvolvedores a geração de imagens, vídeos e áudio da xAI em um único pacote. Ela produz imagens de até 2K com renderização de texto multilíngue, além de vídeos de até 15 segundos com áudio nativo sincronizado e edição baseada em referências. Na Atlas Cloud, uma única chave executa todos os modos do Grok Imagine, permitindo que você alterne entre imagem, vídeo e áudio sem configurações separadas, a partir de US$ 0,02 por imagem e US$ 0,05 por segundo.

Ver Série

Google

Os modelos criativos mais poderosos do Google estão todos disponíveis na Atlas Cloud. O Veo 3.1 oferece geração de vídeo cinematográfico, o Nano Banana 2 impulsiona a criação de imagens de alta fidelidade e o Gemini traz inteligência multimodal para cada fluxo de trabalho. Acesse o pacote completo de modelos do Google por meio de uma única API key com disponibilidade Day-0 e preços de pagamento conforme o uso (pay-as-you-go).

Ver Série

Seedance 2.0 Mini

O Seedance 2.0 Mini leva a geração de vídeo multimodal da ByteDance para fluxos de trabalho onde a velocidade e o custo são essenciais. Ele oferece os principais recursos do Seedance 2.0 com menor impacto — geração mais rápida, menor custo por vídeo e a mesma integração de API que você já usa. Para equipes que executam pipelines de alto volume ou prototipagem em escala, o Mini é a opção padrão prática.

Ver Série

ByteDance

Da geração de vídeo cinematográfico à criação de imagens de alta fidelidade, os modelos mais poderosos da ByteDance estão disponíveis no Atlas Cloud. Execute o Seedance e o Seedream em grande escala com os preços de inferência mais baixos e zero custos indiretos de infraestrutura.

Ver Série

Alibaba

O Atlas Cloud reúne toda a linha de modelos da Alibaba sob uma única API: Qwen para tarefas de linguagem e imagem, e Wan para geração de vídeo em até 1080p. Acesse cada modelo no formato pré-pago (pay-as-you-go) sem necessidade de assinaturas. A API da Alibaba está disponível por meio de uma única URL base usando seu cliente compatível com OpenAI existente.

Ver Série

OpenAI

O Atlas Cloud oferece acesso a toda a linha da API da OpenAI, desde o GPT Image 2 para geração de imagens até o Sora 2 para vídeo. Todos os modelos estão disponíveis na modalidade de pagamento conforme o uso, sem compromisso mensal. Integre-se trocando apenas uma URL base usando a API compatível com a OpenAI.

Ver Série

Uma API para toda a IA de mídia.

Explorar Todos os Modelos