


L’API MAI Image 2.5 donne accès à la famille de génération et d’édition d’images photoréalistes de Microsoft via un endpoint unique, couvrant le text-to-image et l’édition dans des variantes standard et Flash. En plus d’un texte fiable intégré aux images, elle produit des portraits naturels et applique un raisonnement visuel pour préserver la cohérence de la mise en scène. Atlas Cloud propose une tarification à l’usage à partir de 0,03 $ par image, un accès Day-0 et une clé compatible OpenAI.
Atlas Cloud vous offre les derniers modèles créatifs de pointe de l'industrie.
Quatre endpoints couvrent la génération texte-vers-image et l’édition d’images, chacun proposé en offre standard et Flash avec une tarification transparente par appel.
| Modalité | Description |
|---|---|
| MAI Image 2.5 API (texte vers image) | Transformez des prompts en langage naturel en images de haute qualité, visuellement riches, avec le modèle texte-vers-image phare de Microsoft. Il vise les visuels marketing, la photographie e-commerce et les travaux de design commercial nécessitant des sorties prêtes pour la production. Tarif : $0.05 par image. |
| MAI Image 2.5 Flash (texte vers image) | Lorsque le débit et le budget comptent autant que la fidélité, la variante Flash génère des images sur la même architecture basée sur la diffusion, à un coût réduit de $0.03 par image. Elle convient aux pipelines de génération à grand volume et de prototypage rapide qui exigent une qualité constante sans faire gonfler les dépenses. |
| MAI Image 2.5 Edit API (édition d’images) | Fournissez une image existante avec une instruction en langage naturel afin d’appliquer des modifications précises et contrôlables, au lieu de tout régénérer à partir de zéro. L’endpoint gère la suppression d’objets, le remplacement d’éléments et les ajustements localisés tout en préservant la composition environnante, facturé $0.058 par modification. |
| MAI Image 2.5 Flash Edit (édition d’images) | Les équipes qui exécutent des pipelines de retouche à haut débit bénéficient de la même capacité d’édition pilotée par instructions que le modèle Edit standard, à un coût réduit de $0.038 par modification. Cela rend le nettoyage de catalogues en masse et les mises à jour d’assets par grands lots réalisables, tout en maintenant un faible coût par opération. |
La combinaison de modèles avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre une vitesse, une évolutivité et un contrôle créatif inégalés pour la génération d'images et de vidéos.

MAI-Image-2.5 génère des portraits expressifs et naturels avec une structure faciale, un éclairage et une texture de peau précis à partir de prompts textuels. Le modèle offre une esthétique de qualité cinématographique avec un éclairage cohérent qui correspond à la scène décrite. Il est conçu pour les campagnes éditoriales, de marque et commerciales où l'imagerie centrée sur l'humain doit paraître achevée sans post-traitement.

MAI-Image-2.5 offre une fiabilité améliorée pour la génération de texto dans les images, traitant les étiquettes de produits, la signalétique, les gros titres et les textes de marque avec un espacement et une lisibilité corrects. Cela résout un point faible constant dans la plupart des modèles de génération d'images et le rend pratique pour les maquettes d'emballage et les actifs publicitaires où un texte lisible est requis dans le résultat. C'est le bon choix pour les flux de travail de conception où la précision du texte dans l'image est non négociable.

Le endpoint MAI-Image-2.5 Edit effectue des modifications ciblées sur des régions d'image spécifiques : suppression d'éléments indésirables, remplacement ou recoloration d'objets, mise à jour de texte sur des panneaux existants, remplissage de zones manquantes et nettoyage de défauts visuels tels que le flou et le bruit. Les retouches maintiennent la cohérence et la composition tout au long de l'opération, laissant les régions non touchées visuellement intactes. C'est l'outil de référence pour le raffinement de produits, le nettoyage de catalogues et les mises à jour de ressources marketing.

MAI-Image-2.5 est spécialement conçu pour les applications de conception commerciale et professionnelle, prenant en charge le branding, les maquettes de produits et le contenu prêt pour les campagnes à partir de requêtes textuelles. Le modèle maintient l'intégrité de la mise en page et de la composition aussi bien lors de la génération que de l'édition, produisant des ressources prêtes à être utilisées dans les campagnes publicitaires et de produits. Il s'agit de la solution standard pour les équipes de conception produisant des visuels commerciaux à grande échelle.

MAI-Image-2.5 applique le raisonnement visuel pour comprendre les relations spatiales, le placement des objets et la cohérence de l'éclairage sur l'ensemble de l'image. Cela le rend fiable pour générer des scènes où de multiples éléments doivent coexister de manière naturelle, et pour les tâches d'édition où une modification doit respecter le contexte environnant. Il est adapté pour la visualisation de produits en situation et pour tout flux de travail où la précision contextuelle du résultat est importante.
Le même prompt, généré par Mai Image 2.5 et d’autres modèles d’image de premier plan : publicité produit et lifestyle cinématographique
Photographie éditoriale macro de nature morte : une rangée de vieux flacons d’apothicaire et de parfum en vitrail faits main, de hauteurs irrégulières — trapus, hauts, bulbeux — posés sur un rebord de fenêtre en enduit à la chaux patiné, leur verre dépoli strié de minuscules bulles d’air emprisonnées. L’instant décisif : une main humaine nue incline un flacon ambré, et un fin fil net de liquide transparent reste suspendu en plein air, saisi et éclairé au milieu de sa chute, avec une tension de surface et un bord perlé d’une netteté extrême. Derrière, les autres flacons diffractent un soleil bas de golden hour en un éparpillement de caustiques superposées aux couleurs de joyaux — ambre, vert bouteille profond, rose — qui rampent lentement sur l’enduit gris grossier et calcifié. Une lumière naturelle de fenêtre en contre-jour latéral bas de golden hour traverse le verre, projetant des caustiques directionnelles et focalisées, ainsi qu’un liseré lumineux le long de la silhouette de chaque flacon. Composition construite sur la répétition graphique de la rangée de flacons, placée face à une vaste étendue de mur gris neutre servant d’espace négatif, avec une faible profondeur de champ qui comprime la rangée ; la main qui verse et le fil d’eau scintillant constituent le point focal net. Palette limitée aux tons de gemmes — ambre, vert foncé et rose — dialoguant avec le mur gris assourdi : sobre, jamais tapageuse. Détail macro hyperréaliste : grain du verre dépoli, bulles, texture crayeuse du mur, peau tendue du liquide, légères particules de poussière dérivant dans le faisceau. Calme, avec une pointe de magie. Prise de vue avec un objectif macro 100mm, lumière naturelle de fenêtre, rendu éditorial de photographie produit. Rapport d’aspect 16:9.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Stand de nouilles de rue tard dans la nuit, l’instant décisif d’une fraction de seconde où un maître du lamian étire une seule boule de pâte en un éventail de dizaines de brins de nouilles parfaitement parallèles, fins comme des cheveux, suspendus en plein air ; les brins s’évasent vers l’extérieur comme un éventail tenu à la main qui se déploie, tandis qu’une explosion de farine libre et de vapeur montante surgit au même instant — c’est une action saisie en mouvement, pas une pose. Son visage est figé dans une concentration totale, les muscles tendus par une force maîtrisée, les sourcils froncés, une goutte de sueur à la tempe ; derrière lui, des spectateurs flous, hors foyer, retiennent leur souffle dans l’attente. Photographie documentaire de rue réaliste, langage visuel d’un téléobjectif. Éclairé par l’unique ampoule tungstène chaude du stand, utilisée comme contre-jour latéral dur, qui souligne chaque brin de nouille translucide d’un contour lumineux, attrape la poussière de farine en suspension comme des étincelles flottantes et rend lumineuse la vapeur blanche qui se déploie ; le néon bleu froid de la rue nocturne à l’arrière-plan se fond en doux disques de bokeh. La compression de profondeur multicouche du téléobjectif aplatit les mains du maître, son visage concentré et la cascade de nouilles sur un même plan, les brins parallèles denses servant à la fois d’élément graphique répétitif et de lignes directrices naturelles guidant le regard à travers le cadre. Équilibre de couleurs froid-chaud — lueur ambrée tungstène au premier plan contre le bleu froid profond de la nuit — sobre, jamais criard. Texture tactile riche : particules de farine granuleuses, léger brillant du gluten, planche à découper en bois usée et imbibée d’huile, sueur sur la peau, et subtil flou de mouvement sur les brins projetés et la poudre qui dérive. Grain fin de film, faible profondeur de champ, pas de rendu excessif, pas de peau plastique, tonalité naturelle et sincère. Prise de vue au téléobjectif 135mm, grande ouverture, sensation de reportage pris sur le vif. Rapport d’aspect 16:9.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Des catalogues e-commerce et créations publicitaires au packaging, aux visuels de porte-parole et à la visualisation de produits en situation, la MAI Image 2.5 API accompagne les travaux de design commercial que les équipes livrent au quotidien.
Générez des visuels produit sur des arrière-plans variés à partir d’une seule référence, puis modifiez les couleurs et corrigez les défauts sur toute une gamme de SKU via l’endpoint Edit. Un ensemble complet de variantes coûte moins cher qu’une seule nouvelle séance photo en studio.
Les spécialistes du marketing à la performance produisent des variantes de bannières, de contenus sociaux et de display avec des surimpressions de texte précises et des mises en page conformes à la marque. Comme la variante Flash fonctionne à $0.03 par image, tester des dizaines de concepts avant de déployer les gagnants reste économique.
Les maquettes de packaging intègrent une typographie lisible directement dans les visuels de boîtes, de bouteilles et de signalétique en rayon, au lieu d’être ajoutée manuellement. Lorsque le libellé change, l’endpoint Edit met à jour les noms, les prix ou les textes saisonniers sans reconstruire la mise en page.
Un visage reconnaissable, une tenue et une identité globale restent stables d’une pose et d’une mise en page à l’autre au fil des modifications successives. Les personnages récurrents de campagne et les séries sociales au long cours conservent ainsi une apparence cohérente partout où ils apparaissent.
Les reflets, objets indésirables et flous de mouvement sont supprimés proprement, tandis que l’inpainting comble les zones manquantes sans altérer la composition environnante. À $0.058 par modification, nettoyer des milliers d’anciennes photos devient une tâche de traitement par lots routinière.
Le modèle raisonne sur l’éclairage, l’échelle et les relations spatiales afin de placer les produits dans des scènes lifestyle avec des ombres et une perspective crédibles. Les équipes concept et prototypage peuvent prévisualiser des idées de mise en scène bien avant de réserver une séance photo physique.
Comparez l’API MAI Image 2.5 face aux principaux modèles de génération d’images à partir de texte de Google, ByteDance et Alibaba, selon le fournisseur, le prix, la résolution et le rendu du texte.
| Modèle | Fournisseur | Prix de départ (par image) | Résolution max. | Rendu du texte dans l’image | Niveau rapide optimisé pour les coûts |
|---|---|---|---|---|---|
| MAI-Image-2.5 (texte vers image) | Microsoft | $0.05 | Jusqu’à ~1 MP (1360 px max par côté) | √ | √ |
| MAI-Image-2.5 Flash (texte vers image) | Microsoft | $0.03 | Jusqu’à ~1 MP (1360 px max par côté) | √ | √ |
| Nano Banana 2 (texte vers image) | $0.08 | Jusqu’à 4K | √ | √ | |
| Seedream v4.5 | ByteDance | $0.04 | Jusqu’à 2048×2048 | √ | - |
| Qwen Image 2.0 (texte vers image) | Alibaba | $0.035 | Jusqu’à 2048×2048 | √ | - |
Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.
Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.
Combiner les modèles MAI Image 2.5 avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.
Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.
API Unifiée :
Exécutez MAI Image 2.5, GPT, Gemini et DeepSeek avec une seule intégration.
Tarification Transparente :
Facturation prévisible par token avec options serverless.
Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.
Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.
Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.
L’API MAI Image 2.5 donne aux développeurs un accès programmatique à MAI-Image-2.5 de Microsoft, un modèle photoréaliste de génération et de retouche d’images conçu pour les travaux de design commercial. Elle couvre à la fois la génération texte-vers-image et la retouche d’images basée sur des instructions, chacune proposée en version standard et en variante Flash. Sur Atlas Cloud, vous accédez aux quatre endpoints avec une seule clé compatible OpenAI, selon une tarification à l’usage à partir de $0.03 par image.
Les deux variantes partagent la même architecture de diffusion, le même photoréalisme et la même qualité de rendu du texte. Flash est l’option optimisée pour les coûts, à $0.03 par image pour la génération et $0.038 par retouche, tandis que le modèle standard coûte $0.05 par image et $0.058 par retouche. Utilisez Flash pour la génération à grand volume et le prototypage rapide, et réservez le modèle standard aux travaux où la fidélité maximale est primordiale.
La tarification sur Atlas Cloud est à l’usage, sans abonnement. La génération texte-vers-image standard coûte $0.05 par image et la retouche standard $0.058 par retouche, tandis que les variantes Flash descendent à $0.03 par image et $0.038 par retouche. Vous êtes facturé par appel réussi : un lot de variantes ne coûte donc que le tarif fixe par image multiplié par le nombre de sorties.
Inscrivez-vous sur Atlas Cloud, créez une clé API, puis pointez votre client existant compatible OpenAI vers l’endpoint MAI-Image-2.5. Envoyez un prompt texte pour la génération, ou une image accompagnée d’une instruction pour la retouche, et la réponse renvoie des URL vers les images finalisées. L’accès Day-0 signifie que le modèle est disponible dès sa sortie, sans liste d’attente. Commencez à développer dès aujourd’hui.
Vous définissez les dimensions de sortie avec un paramètre size au format largeur par hauteur, avec une valeur par défaut de 1024 par 1024. Chaque côté peut aller de 768 à 1360 pixels, dans la limite d’environ un mégapixel au total, ce qui couvre les cadrages carrés, portrait et paysage. Les variantes de génération standard et Flash partagent les mêmes limites de résolution.
L’endpoint Edit prend une seule image source, fournie sous forme d’URL ou en base64 au format JPEG ou PNG, avec une instruction en langage naturel. Il effectue des modifications ciblées, comme supprimer des objets, remplacer des éléments, recolorer, mettre à jour du texte sur une signalétique et corriger des défauts, tout en laissant intactes les zones non concernées. Comme le modèle raisonne sur la structure de la scène et l’éclairage, les retouches restent cohérentes avec la composition environnante.
Le rendu du texte est l’une des plus grandes avancées du modèle, et Microsoft indique que c’est précisément dans cette catégorie que le gain de qualité par rapport à la génération précédente est le plus important. Il produit de manière fiable des étiquettes de produits, de la signalétique, des titres et des textes de marque avec un espacement correct et une bonne lisibilité. Cette fiabilité le rend pratique pour les maquettes d’emballages et les assets publicitaires où un texte lisible dans l’image est indispensable.
Dans les classements publics Arena, MAI-Image-2.5 a été lancé à la 2e place pour la retouche d’images et à la 3e place pour la génération texte-vers-image. Ses points forts résident dans les portraits photoréalistes, le rendu de texte de qualité commerciale et la retouche cohérente avec l’identité, plutôt que dans les sorties stylisées ou artistiques. Pour les équipes qui produisent des visuels prêts pour une marque, ce positionnement en fait une alternative solide aux générateurs généralistes.
Microsoft a conçu et ajusté MAI-Image-2.5 spécifiquement pour les travaux de design commerciaux et professionnels, notamment les emballages, les maquettes de produits, la signalétique et les visuels centrés sur la marque. Le modèle est destiné à un usage en production dans les workflows de publicité, d’e-commerce et de marketing. Pour connaître les droits d’utilisation exacts applicables à votre compte, consultez les conditions Atlas Cloud en vigueur avant de publier des assets générés.
Guides, tutoriels et actualités produit pour tirer le meilleur d'Atlas Cloud.