Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud
Hero background 1Hero background 2Hero background 3

MAI Image 2.5 API for Accurate In-image Text

L’API MAI Image 2.5 donne accès à la famille de génération et d’édition d’images photoréalistes de Microsoft via un endpoint unique, couvrant le text-to-image et l’édition dans des variantes standard et Flash. En plus d’un texte fiable intégré aux images, elle produit des portraits naturels et applique un raisonnement visuel pour préserver la cohérence de la mise en scène. Atlas Cloud propose une tarification à l’usage à partir de 0,03 $ par image, un accès Day-0 et une clé compatible OpenAI.

Explorez les Modèles Leaders

Atlas Cloud vous offre les derniers modèles créatifs de pointe de l'industrie.

Comparez chaque endpoint de l’API MAI Image 2.5 par modalité et par prix

Quatre endpoints couvrent la génération texte-vers-image et l’édition d’images, chacun proposé en offre standard et Flash avec une tarification transparente par appel.

ModalitéDescription
MAI Image 2.5 API (texte vers image)Transformez des prompts en langage naturel en images de haute qualité, visuellement riches, avec le modèle texte-vers-image phare de Microsoft. Il vise les visuels marketing, la photographie e-commerce et les travaux de design commercial nécessitant des sorties prêtes pour la production. Tarif : $0.05 par image.
MAI Image 2.5 Flash (texte vers image)Lorsque le débit et le budget comptent autant que la fidélité, la variante Flash génère des images sur la même architecture basée sur la diffusion, à un coût réduit de $0.03 par image. Elle convient aux pipelines de génération à grand volume et de prototypage rapide qui exigent une qualité constante sans faire gonfler les dépenses.
MAI Image 2.5 Edit API (édition d’images)Fournissez une image existante avec une instruction en langage naturel afin d’appliquer des modifications précises et contrôlables, au lieu de tout régénérer à partir de zéro. L’endpoint gère la suppression d’objets, le remplacement d’éléments et les ajustements localisés tout en préservant la composition environnante, facturé $0.058 par modification.
MAI Image 2.5 Flash Edit (édition d’images)Les équipes qui exécutent des pipelines de retouche à haut débit bénéficient de la même capacité d’édition pilotée par instructions que le modèle Edit standard, à un coût réduit de $0.038 par modification. Cela rend le nettoyage de catalogues en masse et les mises à jour d’assets par grands lots réalisables, tout en maintenant un faible coût par opération.

Nouvelles fonctionnalités des modèles MAI-Image-2.5 + Démonstration

La combinaison de modèles avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre une vitesse, une évolutivité et un contrôle créatif inégalés pour la génération d'images et de vidéos.

Génération de portraits photoréalistes

Génération de portraits photoréalistes

MAI-Image-2.5 génère des portraits expressifs et naturels avec une structure faciale, un éclairage et une texture de peau précis à partir de prompts textuels. Le modèle offre une esthétique de qualité cinématographique avec un éclairage cohérent qui correspond à la scène décrite. Il est conçu pour les campagnes éditoriales, de marque et commerciales où l'imagerie centrée sur l'humain doit paraître achevée sans post-traitement.

Rendu de texte dans l'image

Rendu de texte dans l'image

MAI-Image-2.5 offre une fiabilité améliorée pour la génération de texto dans les images, traitant les étiquettes de produits, la signalétique, les gros titres et les textes de marque avec un espacement et une lisibilité corrects. Cela résout un point faible constant dans la plupart des modèles de génération d'images et le rend pratique pour les maquettes d'emballage et les actifs publicitaires où un texte lisible est requis dans le résultat. C'est le bon choix pour les flux de travail de conception où la précision du texte dans l'image est non négociable.

Édition Chirurgicale d'Objets

Édition Chirurgicale d'Objets

Le endpoint MAI-Image-2.5 Edit effectue des modifications ciblées sur des régions d'image spécifiques : suppression d'éléments indésirables, remplacement ou recoloration d'objets, mise à jour de texte sur des panneaux existants, remplissage de zones manquantes et nettoyage de défauts visuels tels que le flou et le bruit. Les retouches maintiennent la cohérence et la composition tout au long de l'opération, laissant les régions non touchées visuellement intactes. C'est l'outil de référence pour le raffinement de produits, le nettoyage de catalogues et les mises à jour de ressources marketing.

Actifs de Marque et Design Commercial

Actifs de Marque et Design Commercial

MAI-Image-2.5 est spécialement conçu pour les applications de conception commerciale et professionnelle, prenant en charge le branding, les maquettes de produits et le contenu prêt pour les campagnes à partir de requêtes textuelles. Le modèle maintient l'intégrité de la mise en page et de la composition aussi bien lors de la génération que de l'édition, produisant des ressources prêtes à être utilisées dans les campagnes publicitaires et de produits. Il s'agit de la solution standard pour les équipes de conception produisant des visuels commerciaux à grande échelle.

Raisonnement visuel à travers les objets et les scènes

Raisonnement visuel à travers les objets et les scènes

MAI-Image-2.5 applique le raisonnement visuel pour comprendre les relations spatiales, le placement des objets et la cohérence de l'éclairage sur l'ensemble de l'image. Cela le rend fiable pour générer des scènes où de multiples éléments doivent coexister de manière naturelle, et pour les tâches d'édition où une modification doit respecter le contexte environnant. Il est adapté pour la visualisation de produits en situation et pour tout flux de travail où la précision contextuelle du résultat est importante.

Mai Image 2.5 vs autres modèles - Un seul prompt

Le même prompt, généré par Mai Image 2.5 et d’autres modèles d’image de premier plan : publicité produit et lifestyle cinématographique

Prompt

Photographie éditoriale macro de nature morte : une rangée de vieux flacons d’apothicaire et de parfum en vitrail faits main, de hauteurs irrégulières — trapus, hauts, bulbeux — posés sur un rebord de fenêtre en enduit à la chaux patiné, leur verre dépoli strié de minuscules bulles d’air emprisonnées. L’instant décisif : une main humaine nue incline un flacon ambré, et un fin fil net de liquide transparent reste suspendu en plein air, saisi et éclairé au milieu de sa chute, avec une tension de surface et un bord perlé d’une netteté extrême. Derrière, les autres flacons diffractent un soleil bas de golden hour en un éparpillement de caustiques superposées aux couleurs de joyaux — ambre, vert bouteille profond, rose — qui rampent lentement sur l’enduit gris grossier et calcifié. Une lumière naturelle de fenêtre en contre-jour latéral bas de golden hour traverse le verre, projetant des caustiques directionnelles et focalisées, ainsi qu’un liseré lumineux le long de la silhouette de chaque flacon. Composition construite sur la répétition graphique de la rangée de flacons, placée face à une vaste étendue de mur gris neutre servant d’espace négatif, avec une faible profondeur de champ qui comprime la rangée ; la main qui verse et le fil d’eau scintillant constituent le point focal net. Palette limitée aux tons de gemmes — ambre, vert foncé et rose — dialoguant avec le mur gris assourdi : sobre, jamais tapageuse. Détail macro hyperréaliste : grain du verre dépoli, bulles, texture crayeuse du mur, peau tendue du liquide, légères particules de poussière dérivant dans le faisceau. Calme, avec une pointe de magie. Prise de vue avec un objectif macro 100mm, lumière naturelle de fenêtre, rendu éditorial de photographie produit. Rapport d’aspect 16:9.

Mai Image 2.5

Mai Image 2.5

Flux.2

Flux.2

Qwen Image 2.0

Qwen Image 2.0

Prompt

Stand de nouilles de rue tard dans la nuit, l’instant décisif d’une fraction de seconde où un maître du lamian étire une seule boule de pâte en un éventail de dizaines de brins de nouilles parfaitement parallèles, fins comme des cheveux, suspendus en plein air ; les brins s’évasent vers l’extérieur comme un éventail tenu à la main qui se déploie, tandis qu’une explosion de farine libre et de vapeur montante surgit au même instant — c’est une action saisie en mouvement, pas une pose. Son visage est figé dans une concentration totale, les muscles tendus par une force maîtrisée, les sourcils froncés, une goutte de sueur à la tempe ; derrière lui, des spectateurs flous, hors foyer, retiennent leur souffle dans l’attente. Photographie documentaire de rue réaliste, langage visuel d’un téléobjectif. Éclairé par l’unique ampoule tungstène chaude du stand, utilisée comme contre-jour latéral dur, qui souligne chaque brin de nouille translucide d’un contour lumineux, attrape la poussière de farine en suspension comme des étincelles flottantes et rend lumineuse la vapeur blanche qui se déploie ; le néon bleu froid de la rue nocturne à l’arrière-plan se fond en doux disques de bokeh. La compression de profondeur multicouche du téléobjectif aplatit les mains du maître, son visage concentré et la cascade de nouilles sur un même plan, les brins parallèles denses servant à la fois d’élément graphique répétitif et de lignes directrices naturelles guidant le regard à travers le cadre. Équilibre de couleurs froid-chaud — lueur ambrée tungstène au premier plan contre le bleu froid profond de la nuit — sobre, jamais criard. Texture tactile riche : particules de farine granuleuses, léger brillant du gluten, planche à découper en bois usée et imbibée d’huile, sueur sur la peau, et subtil flou de mouvement sur les brins projetés et la poudre qui dérive. Grain fin de film, faible profondeur de champ, pas de rendu excessif, pas de peau plastique, tonalité naturelle et sincère. Prise de vue au téléobjectif 135mm, grande ouverture, sensation de reportage pris sur le vif. Rapport d’aspect 16:9.

Mai Image 2.5

Mai Image 2.5

Flux.2

Flux.2

Qwen Image 2.0

Qwen Image 2.0

Là où les équipes design exploitent la MAI Image 2.5 API

Des catalogues e-commerce et créations publicitaires au packaging, aux visuels de porte-parole et à la visualisation de produits en situation, la MAI Image 2.5 API accompagne les travaux de design commercial que les équipes livrent au quotidien.

Photographie de catalogue e-commerce à grande échelle

Générez des visuels produit sur des arrière-plans variés à partir d’une seule référence, puis modifiez les couleurs et corrigez les défauts sur toute une gamme de SKU via l’endpoint Edit. Un ensemble complet de variantes coûte moins cher qu’une seule nouvelle séance photo en studio.

Création publicitaire et tests A/B avec la MAI Image 2.5 API

Les spécialistes du marketing à la performance produisent des variantes de bannières, de contenus sociaux et de display avec des surimpressions de texte précises et des mises en page conformes à la marque. Comme la variante Flash fonctionne à $0.03 par image, tester des dizaines de concepts avant de déployer les gagnants reste économique.

Production de packagings et d’étiquettes

Les maquettes de packaging intègrent une typographie lisible directement dans les visuels de boîtes, de bouteilles et de signalétique en rayon, au lieu d’être ajoutée manuellement. Lorsque le libellé change, l’endpoint Edit met à jour les noms, les prix ou les textes saisonniers sans reconstruire la mise en page.

Visuels cohérents de porte-parole de marque

Un visage reconnaissable, une tenue et une identité globale restent stables d’une pose et d’une mise en page à l’autre au fil des modifications successives. Les personnages récurrents de campagne et les séries sociales au long cours conservent ainsi une apparence cohérente partout où ils apparaissent.

Retouche et nettoyage de catalogues avec la MAI Image 2.5 API

Les reflets, objets indésirables et flous de mouvement sont supprimés proprement, tandis que l’inpainting comble les zones manquantes sans altérer la composition environnante. À $0.058 par modification, nettoyer des milliers d’anciennes photos devient une tâche de traitement par lots routinière.

Visualisation de produits en situation avec la MAI Image 2.5 API

Le modèle raisonne sur l’éclairage, l’échelle et les relations spatiales afin de placer les produits dans des scènes lifestyle avec des ombres et une perspective crédibles. Les équipes concept et prototypage peuvent prévisualiser des idées de mise en scène bien avant de réserver une séance photo physique.

Comment l’API MAI Image 2.5 se compare aux modèles d’image concurrents

Comparez l’API MAI Image 2.5 face aux principaux modèles de génération d’images à partir de texte de Google, ByteDance et Alibaba, selon le fournisseur, le prix, la résolution et le rendu du texte.

ModèleFournisseurPrix de départ (par image)Résolution max.Rendu du texte dans l’imageNiveau rapide optimisé pour les coûts
MAI-Image-2.5 (texte vers image)Microsoft$0.05Jusqu’à ~1 MP (1360 px max par côté)
MAI-Image-2.5 Flash (texte vers image)Microsoft$0.03Jusqu’à ~1 MP (1360 px max par côté)
Nano Banana 2 (texte vers image)Google$0.08Jusqu’à 4K
Seedream v4.5ByteDance$0.04Jusqu’à 2048×2048-
Qwen Image 2.0 (texte vers image)Alibaba$0.035Jusqu’à 2048×2048-

Comment utiliser MAI Image 2.5 sur Atlas Cloud

Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.

Créer un compte Atlas Cloud

Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.

Pourquoi Utiliser MAI Image 2.5 sur Atlas Cloud

Combiner les modèles MAI Image 2.5 avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.

Performance et Flexibilité

Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.

API Unifiée :
Exécutez MAI Image 2.5, GPT, Gemini et DeepSeek avec une seule intégration.

Tarification Transparente :
Facturation prévisible par token avec options serverless.

Entreprise et Échelle

Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.

Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.

Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.

API MAI Image 2.5 : les questions que se posent les développeurs avant de créer

L’API MAI Image 2.5 donne aux développeurs un accès programmatique à MAI-Image-2.5 de Microsoft, un modèle photoréaliste de génération et de retouche d’images conçu pour les travaux de design commercial. Elle couvre à la fois la génération texte-vers-image et la retouche d’images basée sur des instructions, chacune proposée en version standard et en variante Flash. Sur Atlas Cloud, vous accédez aux quatre endpoints avec une seule clé compatible OpenAI, selon une tarification à l’usage à partir de $0.03 par image.

Les deux variantes partagent la même architecture de diffusion, le même photoréalisme et la même qualité de rendu du texte. Flash est l’option optimisée pour les coûts, à $0.03 par image pour la génération et $0.038 par retouche, tandis que le modèle standard coûte $0.05 par image et $0.058 par retouche. Utilisez Flash pour la génération à grand volume et le prototypage rapide, et réservez le modèle standard aux travaux où la fidélité maximale est primordiale.

La tarification sur Atlas Cloud est à l’usage, sans abonnement. La génération texte-vers-image standard coûte $0.05 par image et la retouche standard $0.058 par retouche, tandis que les variantes Flash descendent à $0.03 par image et $0.038 par retouche. Vous êtes facturé par appel réussi : un lot de variantes ne coûte donc que le tarif fixe par image multiplié par le nombre de sorties.

Inscrivez-vous sur Atlas Cloud, créez une clé API, puis pointez votre client existant compatible OpenAI vers l’endpoint MAI-Image-2.5. Envoyez un prompt texte pour la génération, ou une image accompagnée d’une instruction pour la retouche, et la réponse renvoie des URL vers les images finalisées. L’accès Day-0 signifie que le modèle est disponible dès sa sortie, sans liste d’attente. Commencez à développer dès aujourd’hui.

Vous définissez les dimensions de sortie avec un paramètre size au format largeur par hauteur, avec une valeur par défaut de 1024 par 1024. Chaque côté peut aller de 768 à 1360 pixels, dans la limite d’environ un mégapixel au total, ce qui couvre les cadrages carrés, portrait et paysage. Les variantes de génération standard et Flash partagent les mêmes limites de résolution.

L’endpoint Edit prend une seule image source, fournie sous forme d’URL ou en base64 au format JPEG ou PNG, avec une instruction en langage naturel. Il effectue des modifications ciblées, comme supprimer des objets, remplacer des éléments, recolorer, mettre à jour du texte sur une signalétique et corriger des défauts, tout en laissant intactes les zones non concernées. Comme le modèle raisonne sur la structure de la scène et l’éclairage, les retouches restent cohérentes avec la composition environnante.

Le rendu du texte est l’une des plus grandes avancées du modèle, et Microsoft indique que c’est précisément dans cette catégorie que le gain de qualité par rapport à la génération précédente est le plus important. Il produit de manière fiable des étiquettes de produits, de la signalétique, des titres et des textes de marque avec un espacement correct et une bonne lisibilité. Cette fiabilité le rend pratique pour les maquettes d’emballages et les assets publicitaires où un texte lisible dans l’image est indispensable.

Dans les classements publics Arena, MAI-Image-2.5 a été lancé à la 2e place pour la retouche d’images et à la 3e place pour la génération texte-vers-image. Ses points forts résident dans les portraits photoréalistes, le rendu de texte de qualité commerciale et la retouche cohérente avec l’identité, plutôt que dans les sorties stylisées ou artistiques. Pour les équipes qui produisent des visuels prêts pour une marque, ce positionnement en fait une alternative solide aux générateurs généralistes.

Microsoft a conçu et ajusté MAI-Image-2.5 spécifiquement pour les travaux de design commerciaux et professionnels, notamment les emballages, les maquettes de produits, la signalétique et les visuels centrés sur la marque. Le modèle est destiné à un usage en production dans les workflows de publicité, d’e-commerce et de marketing. Pour connaître les droits d’utilisation exacts applicables à votre compte, consultez les conditions Atlas Cloud en vigueur avant de publier des assets générés.

Explorer Plus de Familles

Seedance 2.5

L'API Seedance 2.5 est désormais disponible sur Atlas Cloud ! Elle offre aux développeurs le tout dernier modèle vidéo de ByteDance. Il génère jusqu'à 30 secondes de vidéo native en un seul passage à partir de texte, d'une seule image ou de jusqu'à 50 références multimodales, avec un son synchronisé et du texte multilingue dans le cadre. Sur Atlas Cloud, vous y accédez via une clé unique, la cohérence du sujet et la physique améliorée maintenant la fluidité des plans longs.

Voir la Famille

MiniMax H3

L’API MiniMax H3 donne accès au modèle vidéo multimodal généraliste de MiniMax, qui traite le texte, les images, la vidéo et l’audio comme un seul contexte plutôt que comme des tâches séparées. Les clips durent de 5 à 15 secondes à 24 FPS, dans des formats allant de 21:9 à 9:16, et une seule invite peut remplacer des personnages, changer des arrière-plans, réécrire des dialogues ou cloner une voix à partir d’un clip de référence. Atlas Cloud fournit le tout via un endpoint unique compatible OpenAI. Commencez à développer dès aujourd’hui.

Voir la Famille

Seedream 5.0 Pro

L'API Seedream 5.0 Pro offre aux développeurs le modèle d'édition d'images contrôlable de ByteDance sur Atlas Cloud. Elle positionne les modifications avec précision à l'aide d'ancrages et de coordonnées, sépare les images en calques modifiables, fusionne de multiples références et fait correspondre les couleurs et matériaux exacts, avec du texte multilingue en 2K et 3K. Sur Atlas Cloud, vous y accédez via une seule clé !

Voir la Famille

Seedance 2.0

L'API Seedance 2.0 vous donne un accès en production au modèle vidéo multimodal de ByteDance — des entrées quadrimodales (texte, image, vidéo, audio) et un système « Universal Reference » leader du secteur qui verrouille la composition, les mouvements de caméra et les actions des personnages à travers les plans. Intégrez un contrôle de niveau réalisateur avec un seul appel d'API, un tarif fixe de 0,09 $/s, une clé instantanée et aucune liste d'attente — le tout soutenu par une disponibilité et une conformité de niveau entreprise. Seedance 2.0 Native 4K est désormais disponible !

Voir la Famille

GPT Image 2

L'API GPT Image 2 offre aux développeurs un accès au dernier modèle d'image d'OpenAI, le successeur de GPT Image 1.5. Elle génère et modifie des images avec un rendu de texte précis pour les caractères latins et CJK, ainsi qu'une composition solide pour les affiches, les maquettes et les infographies. Sur Atlas Cloud, vous y accédez via une API unifiée aux côtés de plus de 300 modèles, avec des crédits gratuits, une disponibilité de 99,99 % et sans aucune vérification d'organisation OpenAI requise.

Voir la Famille

Gemini Omni Flash

La Gemini Omni API apporte à votre stack le modèle multimodal de génération et d'édition vidéo de Google DeepMind, présenté à Google I/O 2026. Gemini Omni fusionne le moteur de raisonnement de Gemini avec les médias génératifs : il accepte n'importe quelle combinaison de texte, d'images, de vidéo et d'audio pour produire des résultats cohérents et ancrés dans la connaissance. Affinez vos résultats par simple conversation — remplacez des objets, réécrivez des scènes, changez de style — tandis que la physique, les personnages et la continuité restent intacts. Atlas Cloud propose toute la gamme Gemini Omni Flash — texte vers vidéo, image vers vidéo avec jusqu'à 7 images de référence, et référence vers vidéo — via une API unifiée, avec une tarification transparente à la seconde à partir de $0.112 et sans abonnement. Commencez à développer dès aujourd'hui.

Voir la Famille

Grok Imagine

L'API Grok Imagine couvre les modèles d'image, vidéo et parole d'xAI, de Image 2.0 à Video 1.5 et xAI TTS v1. Générez des images statiques en 1K ou 2K selon 14 rapports d'aspect, créez une vidéo de 15 secondes en 1080p, guidez les plans avec jusqu'à 7 images de référence, ou narrez-les dans 20 langues. Atlas Cloud exécute chaque mode sur un seul point de terminaison, avec un tarif à l'utilisation à partir de $0.02 par image et $0.05 par seconde. Commencez à créer aujourd'hui.

Voir la Famille

Google

Les modèles créatifs les plus puissants de Google sont tous disponibles sur Atlas Cloud. Veo 3.1 offre une génération de vidéos cinématographiques, Nano Banana 2 permet de créer des images haute fidélité, et Gemini apporte une intelligence multimodale à chaque flux de travail. Accédez à la suite complète de modèles Google via une seule API key avec une disponibilité Day-0 et une tarification à l'usage (pay-as-you-go).

Voir la Famille

Seedance 2.0 Mini

Seedance 2.0 Mini apporte la génération de vidéos multimodale de ByteDance aux flux de travail où la vitesse et les coûts sont primordiaux. Il offre les capacités de base de Seedance 2.0 avec une empreinte plus légère — une génération plus rapide, un coût par vidéo réduit et la même intégration API que celle que vous utilisez déjà. Pour les équipes qui gèrent des pipelines à haut volume ou du prototypage à grande échelle, Mini est le choix par défaut pratique.

Voir la Famille

ByteDance

De la génération de vidéos cinématiques à la création d'images haute fidélité, les modèles les plus puissants de ByteDance sont disponibles sur Atlas Cloud. Exécutez Seedance et Seedream à grande échelle avec les prix d'inférence les plus bas et aucune surcharge d'infrastructure.

Voir la Famille

Alibaba

Atlas Cloud rassemble l'ensemble de la gamme de modèles d'Alibaba sous une seule API : Qwen pour les tâches linguistiques et d'imagerie, et Wan pour la génération de vidéos jusqu'en 1080p. Accédez à chaque modèle avec une tarification à l'usage (pay-as-you-go) sans abonnement. L'API Alibaba est disponible via une URL de base unique en utilisant votre client existant compatible avec OpenAI.

Voir la Famille

OpenAI

Atlas Cloud vous donne accès à l'ensemble de la gamme de l'API OpenAI, de GPT Image 2 pour la génération d'images à Sora 2 pour la vidéo. Chaque modèle est disponible en paiement à l'usage sans engagement mensuel. Intégrez-le en remplaçant simplement l'URL de base à l'aide de l'API compatible OpenAI.

Voir la Famille

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles