


MAI Image 2.5 API levererar Microsofts familj för fotorealistisk bildgenerering och bildredigering via en enda endpoint, med text-to-image och redigering i standard- och Flash-varianter. Utöver tillförlitlig text i bilder skapar den naturliga porträtt och använder visuellt resonemang för att hålla scenlayouten sammanhängande. Atlas Cloud erbjuder prissättning där du betalar per användning från $0.03 per bild, Day-0-åtkomst och en OpenAI-kompatibel nyckel.
Atlas Cloud förser dig med de senaste branschledande kreativa modellerna.
Fyra slutpunkter omfattar text-till-bild-generering och bildredigering, där varje erbjuds i en standardnivå och en Flash-nivå med transparent prissättning per anrop.
| Modalitet | Beskrivning |
|---|---|
| MAI Image 2.5 API (text till bild) | Omvandla prompter på naturligt språk till högkvalitativa, visuellt rika bilder med Microsofts flaggskeppsmodell för text-till-bild. Den är avsedd för marknadsföringsbilder, e-handelsfotografi och kommersiellt designarbete som kräver produktionsklara resultat. Priset är $0.05 per bild. |
| MAI Image 2.5 Flash (text till bild) | När genomströmning och budget är lika viktiga som återgivningskvalitet genererar Flash-varianten bilder med samma diffusionsbaserade arkitektur till en lägre kostnad på $0.03 per bild. Den passar pipelines för generering i hög volym och snabb prototypframtagning som behöver jämn kvalitet utan att kostnaderna skenar. |
| MAI Image 2.5 Edit API (bildredigering) | Mata in en befintlig bild tillsammans med en instruktion på naturligt språk för att göra precisa, kontrollerbara redigeringar i stället för att generera om från början. Slutpunkten hanterar borttagning av objekt, ersättning av element och lokala justeringar samtidigt som den omgivande kompositionen bevaras, och debiteras med $0.058 per redigering. |
| MAI Image 2.5 Flash Edit (bildredigering) | Team som kör förfiningspipelines med hög genomströmning får samma instruktionsstyrda redigeringsfunktion som standardmodellen Edit, till en lägre kostnad på $0.038 per redigering. Det gör massrensning av kataloger och uppdateringar av stora batcher med resurser praktiskt genomförbara samtidigt som kostnaden per åtgärd hålls låg. |
Kombinationen av avancerade modeller med Atlas Clouds GPU-accelererade plattform ger oöverträffad hastighet, skalbarhet och kreativ kontroll för bild- och videogenerering.

MAI-Image-2.5 genererar uttrycksfulla, naturliga porträtt med exakt ansiktsstruktur, belysning och hudtextur från textprompter. Modellen renderar en filmisk estetik med konsekvent belysning som matchar den beskrivna scenen. Den är designad för redaktionella, varumärkesbyggande och kommersiella kampanjer där människocentrerade bilder måste se färdiga ut utan efterbearbetning.

MAI-Image-2.5 erbjuder förbättrad tillförlitlighet för textgenerering i bilder och hanterar produktetiketter, skyltar, rubriker och varumärkestexter med korrekta avstånd och läsbarhet. Detta åtgärdar en genomgående svag punkt i de flesta bildgenereringsmodeller och gör det praktiskt för förpackningsmockups och reklammaterial där läsbar text krävs i resultatet. Det är rätt val för designarbetsflöden där textprecision i bilder är en oumbärlig faktor.

MAI-Image-2.5 Edit-ändpunkten utför riktade ändringar i specifika bildregioner: tar bort oönskade element, ersätter eller färgar om objekt, uppdaterar text på befintliga skyltar, fyller i saknade områden och rensar upp visuella defekter som oskärpa och brus. Redigeringarna bibehåller koherens och komposition rakt igenom, och lämnar orörda regioner visuellt intakta. Det är det givna verktyget för produktförfining, katalogrensning och uppdateringar av marknadsföringstillgångar.

MAI-Image-2.5 är byggd specifikt för kommersiella och professionella designapplikationer och stöder varumärkesprofilering, produktmockups och kampanjklart innehåll från textprompter. Modellen bibehåller layoutens och kompositionens integritet under både generering och redigering, vilket producerar tillgångar som är redo att användas i reklam- och produktkampanjer. Det är standardlösningen för designteam som producerar kommersiella visuella element i stor skala.

MAI-Image-2.5 tillämpar visuellt resonemang för att förstå rumsliga relationer, objektplacering och belysningskoherens över hela bilden. Detta gör den pålitlig för att generera scener där flera element måste existera naturligt tillsammans, och för redigeringsuppgifter där en modifiering måste respektera den omgivande kontexten. Den är väl lämpad för visualisering av produkter i scener och alla arbetsflöden där kontextuell noggrannhet i utdata är avgörande.
Samma prompt, genererad av Mai Image 2.5 och andra ledande bildmodeller: produktannons och filmisk lifestyle-annons
Redaktionellt makrofotografi av ett stilleben: en rad gamla handgjorda apotekar- och parfymflaskor i färgat glas med ojämna höjder — knubbiga, höga, rundbukiga — står på en vittrad fönsterbräda av kalkputs, deras frostade glas strimmigt av små instängda luftbubblor. Det avgörande ögonblicket: en bar människohand lutar en bärnstensfärgad flaska och en tunn, ren tråd av klar vätska hänger svävande i luften, fångad och belyst mitt i fallet, med sylvass ytspänning och pärlande kant. Bakom den bryter de andra flaskorna den låga gyllene timmens sol till ett myller av överlappande juvelfärgade kaustiska ljusmönster — bärnsten, djupt flaskgrönt, rosenrosa — som långsamt kryper över den grova, förkalkade grå putsen. Lågt sidligt motljus i golden hour stryker genom glaset, kastar riktade, fokuserade kaustiska ljusmönster och ger en glödande kantljuslinje längs varje flaskas silhuett. Komposition byggd på den grafiska upprepningen i flaskraden mot en stor yta neutralgrå vägg som negativ yta, med kort skärpedjup som komprimerar raden, där den hällande handen och den glimmande vattentråden är den skarpa fokuspunkten. Begränsad juvelfärgad palett av bärnsten, mörkgrönt och rosenrosa i spel mot den dämpade grå väggen — återhållet, aldrig skrikigt. Hyperrealistiska makrodetaljer: frostat glasgryn, bubblor, kritig väggstruktur, vätskans spända hinna, svaga dammkorn som driver i ljusstrålen. Stillsamt, med ett spår av magi. Fotograferat med 100mm macro lens, naturligt fönsterljus, redaktionell produktfotografisk finish. 16:9 aspect ratio.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Nudelkiosk på gatan sent på kvällen, den avgörande bråkdelen av en sekund när en lamian-mästare drar en enda degboll till en solfjäder av dussintals perfekt parallella, hårtunna nudelsträngar som hänger i luften, strängarna fläktar utåt som en solfjäder som öppnas i handen samtidigt som ett moln av löst mjöl och stigande ånga exploderar i exakt samma ögonblick — detta är action fångad i rörelse, inte en pose. Hans ansikte är låst i total koncentration, musklerna spända av kontrollerad kraft, ögonbrynen rynkade, en svettdroppe vid tinningen; bakom honom håller suddiga, oskarpa åskådare andan i förväntan. Realistisk gatufotografi i dokumentär stil, teleobjektivets bildspråk. Belyst av kioskens enda varma tungsten bulb som ett hårt sidligt motljus som kantljussätter varje genomskinlig nudelsträng med glödande kanter, fångar mjöldammet i luften som svävande gnistor och gör den böljande vita ångan lysande; det kalla blå neonljuset från nattgatan bakom smälter samman till mjuka bokeh-klot. Teleobjektivets flerskiktade djupkompression plattar ut mästarens händer, hans fokuserade ansikte och kaskaden av nudlar till ett enda plan, där de täta parallella strängarna fungerar både som ett upprepat grafiskt element och naturliga ledande linjer som drar blicken genom bilden. Kall–varm färgbalans — förgrundens bärnstensfärgade tungsten glow mot nattens djupa kalla blå — återhållen och aldrig gräll. Rik taktil textur: gryniga mjölpartiklar, svag glans av gluten, den oljedränkta slitna skärbrädan i trä, svett på hud och en subtil rörelseoskärpa i de flygande strängarna och det drivande pulvret. Fint filmkorn, kort skärpedjup, ingen överrendering, ingen plastig hud, ärlig naturlig tonalitet. Fotograferat med 135mm telephoto, stor bländaröppning, spontan reportagekänsla. 16:9 aspect ratio.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Från e-handelskataloger och annonsmaterial till förpackningar, talespersonsbilder och visualisering av produkter i miljö stöder MAI Image 2.5 API det kommersiella designarbete som team levererar varje dag.
Generera produktbilder med varierade bakgrunder från en enda referens, och färga sedan om och åtgärda defekter över ett helt SKU-sortiment via Edit endpoint. En komplett uppsättning varianter kostar mindre än en enda ny studiofotografering.
Performance marketers tar fram variationer för banners, sociala medier och displayannonser med korrekta textöverlägg och layouter som följer varumärket. Eftersom Flash-varianten körs för $0.03 per bild är det fortsatt billigt att testa dussintals koncept innan vinnarna skalas upp.
Förpackningsmockuper har läsbar typografi inbakad direkt i artwork för lådor, flaskor och hyllskyltar, i stället för att placeras för hand. När formuleringar ändras uppdaterar Edit endpoint namn, priser eller säsongstexter utan att layouten behöver byggas om.
Ett igenkännbart ansikte, klädsel och övergripande identitet förblir stabila över poser och layouter genom successiva redigeringar. Det gör att återkommande kampanjkaraktärer och löpande sociala serier ser sammanhängande ut var de än visas.
Reflektioner, störande objekt och rörelseoskärpa tas bort rent, medan inpainting fyller saknade områden och den omgivande kompositionen förblir intakt. För $0.058 per redigering blir rensning av tusentals äldre foton ett rutinmässigt batchjobb.
Modellen resonerar kring ljussättning, skala och rumsliga relationer för att placera produkter i livsstilsmiljöer med trovärdiga skuggor och perspektiv. Koncept- och prototypteam kan förhandsgranska iscensättningsidéer långt innan en fysisk fotografering bokas.
Jämför MAI Image 2.5 API sida vid sida med ledande text-till-bildmodeller från Google, ByteDance och Alibaba utifrån leverantör, pris, upplösning och textrendering.
| Modell | Leverantör | Startpris (per bild) | Maximal upplösning | Textrendering i bilden | Kostnadsoptimerad snabbnivå |
|---|---|---|---|---|---|
| MAI-Image-2.5 (Text to Image) | Microsoft | $0.05 | Upp till ~1 MP (max 1360 px per sida) | √ | √ |
| MAI-Image-2.5 Flash (Text to Image) | Microsoft | $0.03 | Upp till ~1 MP (max 1360 px per sida) | √ | √ |
| Nano Banana 2 (Text-to-Image) | $0.08 | Upp till 4K | √ | √ | |
| Seedream v4.5 | ByteDance | $0.04 | Upp till 2048×2048 | √ | - |
| Qwen Image 2.0 (Text-to-image) | Alibaba | $0.035 | Upp till 2048×2048 | √ | - |
Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.
Registrera dig på atlascloud.ai och slutför verifieringen. Nya användare får gratis krediter för att utforska plattformen och testa modeller.
Att kombinera de avancerade MAI Image 2.5-modellerna med Atlas Clouds GPU-accelererade plattform ger oöverträffad prestanda, skalbarhet och utvecklarupplevelse.
Låg Latens:
GPU-optimerad inferens för realtidsresonemang.
Enhetligt API:
Kör MAI Image 2.5, GPT, Gemini och DeepSeek med en integration.
Transparent Prissättning:
Förutsägbar fakturering per token med serverlösa alternativ.
Utvecklarupplevelse:
SDK:er, analys, finjusteringsverktyg och mallar.
Tillförlitlighet:
99.99% drifttid, RBAC och efterlevnadsredo loggning.
Säkerhet & Efterlevnad:
SOC 2 Type II, HIPAA-anpassning, datasuveränitet i USA.
MAI Image 2.5 API ger utvecklare programmatisk åtkomst till Microsofts MAI-Image-2.5, en fotorealistisk modell för bildgenerering och bildredigering byggd för kommersiellt designarbete. Den omfattar både text-till-bild-generering och instruktionsbaserad bildredigering, där båda erbjuds i en standardvariant och en Flash-variant. På Atlas Cloud når du alla fyra endpoints via en OpenAI-kompatibel nyckel med pay-as-you-go-prissättning från $0.03 per bild.
Båda varianterna delar samma diffusionsarkitektur, fotorealism och kvalitet för textrendering. Flash är det kostnadsoptimerade alternativet för $0.03 per bild vid generering och $0.038 per redigering, medan standardmodellen kostar $0.05 per bild och $0.058 per redigering. Använd Flash för generering i stora volymer och snabb prototypframtagning, och välj standardmodellen för arbete där maximal detaljtrohet är viktigast.
Prissättningen på Atlas Cloud är pay-as-you-go utan abonnemang. Standard text-till-bild kostar $0.05 per bild och standardredigering kostar $0.058 per redigering, medan Flash-varianterna går ned till $0.03 per bild och $0.038 per redigering. Du debiteras per lyckat anrop, så en batch med variationer kostar bara den fasta avgiften per bild multiplicerad med antalet utdata.
Registrera dig på Atlas Cloud, skapa en API-nyckel och peka din befintliga OpenAI-kompatibla klient mot MAI-Image-2.5-endpointen. Skicka en textprompt för generering, eller en bild plus en instruktion för redigering, så returnerar svaret URL:er till de färdiga bilderna. Day-0-åtkomst innebär att modellen är tillgänglig i samma ögonblick som den lanseras, utan väntelista. Börja bygga i dag.
Du anger utdatadimensioner med en size-parameter i formatet bredd gånger höjd, med standardvärdet 1024 gånger 1024. Varje sida kan vara från 768 till 1360 pixlar upp till ett tak på ungefär en megapixel totalt, vilket täcker kvadratisk, stående och liggande inramning. Standard- och Flash-varianterna för generering har samma upplösningsgränser.
Edit-endpointen tar en enda källbild, angiven som en URL eller base64 i JPEG eller PNG, tillsammans med en instruktion på naturligt språk. Den utför riktade ändringar som att ta bort objekt, ersätta element, färga om, uppdatera text på skyltar och rensa upp defekter, samtidigt som orörda områden lämnas intakta. Eftersom modellen resonerar kring scenstruktur och ljussättning förblir redigeringarna koherenta med den omgivande kompositionen.
Textrendering är en av modellens största förbättringar, och Microsoft rapporterar sitt största kvalitetslyft jämfört med föregående generation just i den här kategorin. Den producerar tillförlitligt produktetiketter, skyltar, rubriker och varumärkesanpassad copy med korrekt mellanrum och läsbarhet. Den tillförlitligheten gör den praktisk för förpackningsmockups och annonsmaterial där läsbar text i bilden är ett absolut krav.
På de offentliga Arena-topplistorna lanserades MAI-Image-2.5 som No. 2 för bildredigering och No. 3 för text-till-bild-generering. Dess styrkor ligger i fotorealistiska porträtt, textrendering av kommersiell kvalitet och identitetskonsekvent redigering snarare än stiliserade eller konstnärliga resultat. För team som producerar varumärkesklara visuella tillgångar gör den positioneringen modellen till ett starkt alternativ till generella generatorer.
Microsoft har byggt och finjusterat MAI-Image-2.5 specifikt för kommersiellt och professionellt designarbete, inklusive förpackningar, produktmockups, skyltar och varumärkesdrivna visuella uttryck. Modellen är avsedd för produktionsanvändning i arbetsflöden för annonsering, e-handel och marknadsföring. För de exakta användningsrättigheter som gäller för ditt konto bör du granska de aktuella villkoren för Atlas Cloud innan du publicerar genererade tillgångar.
Guider, handledningar och produktnyheter som hjälper dig att få ut mesta möjliga av Atlas Cloud.