


MAI Image 2.5 API 透過單一端點提供微軟的寫實影像生成與編輯系列,涵蓋文字轉影像與編輯功能,並提供標準與 Flash 版本。除了可靠的圖像內文字呈現外,它也能生成自然的人像,並運用視覺推理維持場景版面的連貫性。Atlas Cloud 提供隨用隨付定價,每張影像 $0.03 起、Day-0 存取,以及一組與 OpenAI 相容的金鑰。
Atlas Cloud 為您提供最新的行業領先創意模型。
四個端點涵蓋文字轉圖片生成與圖片編輯,每個端點都提供標準版與 Flash 方案,並採用透明的按次呼叫計價。
| 模態 | 說明 |
|---|---|
| MAI Image 2.5 API(文字轉圖片) | 使用 Microsoft 旗艦文字轉圖片模型,將自然語言提示轉換為高品質、視覺豐富的圖片。它適用於需要可直接投入製作的行銷視覺、電商商品攝影與商業設計工作。價格為每張圖片 $0.05。 |
| MAI Image 2.5 Flash(文字轉圖片) | 當吞吐量與預算和畫質同樣重要時,Flash 變體會在相同的 diffusion-based 架構上生成圖片,成本較低,每張圖片 $0.03。它適合需要穩定品質、又不想提高支出的高量生成與快速原型製作流程。 |
| MAI Image 2.5 Edit API(圖片編輯) | 提供既有圖片搭配自然語言指令,即可套用精準且可控的編輯,而不必從頭重新生成。此端點可處理物件移除、元素替換與局部調整,同時保持周圍構圖完整,費用為每次編輯 $0.058。 |
| MAI Image 2.5 Flash Edit(圖片編輯) | 執行高吞吐量修整流程的團隊,可用較低成本取得與標準 Edit 模型相同的指令驅動編輯能力,費用為每次編輯 $0.038。這讓大量型錄清理與大批次素材更新更具可行性,同時維持較低的單次操作支出。 |
將先進模型與 Atlas Cloud 的 GPU 加速平台相結合,為圖像和影片生成提供無與倫比的速度、可擴展性和創意控制。

MAI-Image-2.5根據文字提示產生富有表現力且自然逼真的肖像,具備準確的面部結構、光照和皮膚紋理。該模型呈現電影級的美學效果,並帶有與描述場景相符的一致光照。它專為編輯、品牌推廣和商業活動設計,在這些場景中,以人為本的圖像無需後製處理即可呈現出成品效果。

MAI-Image-2.5 為圖像內的文字生成提供了更高的可靠性,能夠以正確的間距和清晰度處理產品標籤、招牌、標題和品牌文案。這解決了大多數圖像生成模型中普遍存在的弱點,使其能夠實際應用於需要在輸出中包含可讀文字的包裝樣機和廣告素材。對於圖像內文字準確性絕對必要的設計工作流程而言,它是理想的選擇。

MAI-Image-2.5 Edit 端點對特定圖像區域執行定向修改:移除不需要的元素、替換物件或重新著色、更新現有標誌上的文字、填充缺失區域,以及清理模糊和雜訊等視覺缺陷。編輯過程始終保持連貫性和構圖,使未觸及的區域在視覺上保持完整。它是產品最佳化、目錄清理和行銷資產更新的首選工具。

MAI-Image-2.5 專為商業和專業設計應用而建構,支援透過文字提示生成品牌設計、產品原型以及可直接用於行銷活動的內容。該模型在生成和編輯過程中均能保持版面和構圖的完整性,從而產出可直接用於廣告和產品行銷活動的資產。它是設計團隊大規模製作商業視覺效果的標準解決方案。

MAI-Image-2.5應用視覺推理來理解整個影像中的空間關係、物件位置和光影一致性。這使其在生成多個元素需要自然共存的場景時非常可靠,並且在需要修改且必須遵循周圍環境的編輯任務中表現出色。它適用於產品場景視覺化,以及任何對輸出環境準確性要求較高的工作流程。
相同提示詞,由 Mai Image 2.5 與其他領先圖像模型生成:產品與電影感生活風格廣告
編輯風格微距靜物攝影:一排老舊手工彩繪玻璃藥劑與香水瓶,高低不一——矮胖、高挑、圓鼓——立在風化的石灰灰泥窗台上,磨砂玻璃表面布滿細小被困住的氣泡條紋。決定性瞬間:一隻裸露的人手傾斜一只琥珀色瓶子,一道纖細乾淨的透明液體細線懸停在半空中,在墜落途中被捕捉並被光照亮,其表面張力與凝珠邊緣銳利清晰。後方其他瓶子將低垂的黃金時刻陽光折射成一片交疊的寶石色焦散光——琥珀、深瓶綠、玫瑰粉——緩慢爬過粗糙、鈣化的灰色灰泥表面。低角度黃金時刻側逆光穿透玻璃,投射出具方向性的聚焦焦散光,並沿著每只瓶子的輪廓勾出發光的邊緣光。構圖建立在瓶陣的圖形化重複之上,對照大片中性灰牆作為留白,淺景深壓縮整排瓶子,倒液的手與閃光的水線作為銳利焦點。受限的寶石色調色盤,以琥珀、深綠與玫瑰粉對比低調灰牆——克制,絕不俗豔。超寫實微距細節:磨砂玻璃顆粒、氣泡、粉筆感牆面紋理、液體繃緊的表皮、光束中輕微漂浮的塵埃。安靜,帶一絲魔幻氣息。使用 100mm macro lens 拍攝,自然窗光,編輯風格產品攝影質感。16:9 aspect ratio。

Mai Image 2.5

Flux.2

Qwen Image 2.0
深夜街頭麵攤,決定性的剎那:一位拉麵師傅將一團麵糰拉成數十條完全平行、髮絲般細的麵條扇面,懸在半空中,麵條如同展開的手持摺扇向外散開,同一瞬間鬆散麵粉爆散、蒸氣升騰炸開——這是動作在運動中被捕捉,而不是擺拍。他的臉完全專注,肌肉因受控的力量而繃緊,眉頭緊鎖,太陽穴上有一滴汗珠;身後失焦模糊的圍觀者屏息期待。寫實街頭紀實攝影,telephoto lens 語彙。由攤位唯一一顆暖色 tungsten bulb 照亮,形成強烈側逆光,為每一條半透明麵條勾出發光邊緣,捕捉空中麵粉塵如漂浮火花,並讓翻湧的白色蒸氣變得發亮;身後夜街的冷藍霓虹融化成柔和的散景光球。telephoto 多層次景深壓縮,將師傅的雙手、專注的臉與瀑布般的麵條壓進同一平面,密集平行的麵條既是重複的圖形元素,也成為引導視線穿越畫面的自然導引線。冷暖色彩平衡——前景琥珀色 tungsten 光暈對比夜晚深冷藍——克制而絕不刺眼。豐富可觸的質感:粗礫的麵粉顆粒、麵筋微微的光澤、吸滿油漬且磨損的木砧板、皮膚上的汗,以及飛舞麵條與飄散粉末上細微的動態模糊。細緻 film grain、淺景深、不過度渲染、沒有塑膠感皮膚,真實自然的色調。使用 135mm telephoto 拍攝,大光圈,帶有 candid reportage feel。16:9 aspect ratio。

Mai Image 2.5

Flux.2

Qwen Image 2.0
從電子商務型錄與廣告創意,到包裝、代言人圖像,以及產品情境視覺化,MAI Image 2.5 API 支援團隊每天交付的商業設計工作。
以一張參考圖生成不同背景的產品照片,接著透過 Edit endpoint 在完整 SKU 範圍內重新上色並清除瑕疵。一整組變體的成本低於一次棚拍重拍。
成效行銷人員可製作橫幅、社群與多媒體廣告變體,並具備準確的文字疊加與符合品牌一致性的版面配置。由於 Flash variant 每張圖片僅需 $0.03,在擴大投放勝出版本前測試數十個概念,成本仍然低廉。
包裝 mockup 可將清晰可讀的字體直接融入盒身、瓶身與貨架標示的視覺稿中,而不必手動放置。當文案需要變更時,Edit endpoint 可修改名稱、價格或季節性文案,無需重建版面。
透過連續編輯,可讓可辨識的臉孔、服裝與整體身分在不同姿勢與版面中保持穩定。這能讓反覆出現的活動角色與持續經營的社群系列,無論出現在哪裡都維持一致觀感。
反光、雜物與動態模糊都能乾淨移除,同時 inpainting 會補齊缺失區域,並保持周圍構圖完整。每次編輯僅需 $0.058,清理數千張舊照片也能成為例行批次作業。
模型能推理光線、比例與空間關係,將產品放入生活情境中,呈現可信的陰影與透視。概念與原型團隊可在預訂實體拍攝之前,先預覽場景陳列想法。
從提供者、價格、解析度與文字渲染等面向,將 MAI Image 2.5 API 與 Google、ByteDance 和 Alibaba 的領先文字轉圖片模型進行正面比較。
| 模型 | 提供者 | 起始價格(每張圖片) | 最高解析度 | 圖片內文字渲染 | 成本最佳化快速層級 |
|---|---|---|---|---|---|
| MAI-Image-2.5(文字轉圖片) | Microsoft | $0.05 | 最高約 1 MP(每邊最高 1360 px) | √ | √ |
| MAI-Image-2.5 Flash(文字轉圖片) | Microsoft | $0.03 | 最高約 1 MP(每邊最高 1360 px) | √ | √ |
| Nano Banana 2(文字轉圖片) | $0.08 | 最高 4K | √ | √ | |
| Seedream v4.5 | ByteDance | $0.04 | 最高 2048×2048 | √ | - |
| Qwen Image 2.0(文字轉圖片) | Alibaba | $0.035 | 最高 2048×2048 | √ | - |
幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。
在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。
將先進的 MAI Image 2.5 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。
低延遲:
GPU 最佳化推理,實現即時回應。
統一 API:
一次整合,暢用 MAI Image 2.5、GPT、Gemini 和 DeepSeek。
透明定價:
按 Token 計費,支援 Serverless 模式。
開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。
可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。
安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。
MAI Image 2.5 API 讓開發者能以程式化方式存取 Microsoft 的 MAI-Image-2.5,這是一款為商業設計工作打造的寫實影像生成與編輯模型。它涵蓋 text-to-image 生成與基於指令的影像編輯,兩者皆提供標準版與 Flash 版本。在 Atlas Cloud 上,你可以透過一組 OpenAI-compatible key 存取全部四個 endpoints,並採用隨用隨付定價,每張影像 $0.03 起。
兩個版本共用相同的 diffusion architecture、寫實品質與文字渲染能力。Flash 是成本最佳化選項,生成每張影像 $0.03、每次編輯 $0.038;標準模型則是每張影像 $0.05、每次編輯 $0.058。高量生成與快速原型製作適合使用 Flash;若工作最重視最高保真度,則建議保留使用標準模型。
Atlas Cloud 採隨用隨付定價,無需訂閱。標準 text-to-image 每張影像 $0.05,標準編輯每次 $0.058;Flash 版本則降至每張影像 $0.03、每次編輯 $0.038。你只會為成功的呼叫付費,因此一批變體的成本就是固定的每張影像費用乘以輸出數量。
在 Atlas Cloud 註冊、建立一組 API key,並將你現有的 OpenAI-compatible client 指向 MAI-Image-2.5 endpoint。若要生成,送出文字提示;若要編輯,送出影像加上一段指令;回應會傳回完成影像的 URL。Day-0 access 代表模型一推出即可使用,無需候補名單。今天就開始建置。
你可以用 size 參數以寬度乘以高度的格式設定輸出尺寸,預設為 1024 by 1024。每一邊可介於 768 到 1360 pixels,總量上限約為 one megapixel,可涵蓋正方形、人像直式與風景橫式構圖。標準版與 Flash 生成版本共用相同的解析度限制。
Edit endpoint 會接收單一來源影像,可用 URL 或 base64 提供,格式為 JPEG 或 PNG,並搭配一段自然語言指令。它能執行移除物件、替換元素、重新上色、更新招牌中的文字,以及清理瑕疵等局部修改,同時保持未觸及區域不變。由於模型能推理場景結構與光照,編輯結果會與周圍構圖保持一致。
文字渲染是這個模型最大的進步之一,Microsoft 表示相較上一代,這正是品質提升幅度最大的類別。它能可靠產生產品標籤、招牌、標題與品牌文案,並具備正確間距與可讀性。這種可靠度讓它適合用於包裝 mockup 與廣告素材,尤其是影像內文字必須清晰可讀的情境。
在公開的 Arena 排行榜上,MAI-Image-2.5 發布時於影像編輯排名 No. 2、text-to-image 生成排名 No. 3。它的強項在於寫實肖像、商業級文字渲染,以及保持身分一致的編輯,而非風格化或藝術化輸出。對於需要產出可直接用於品牌的視覺素材團隊而言,這樣的定位使它成為通用生成器的強力替代方案。
Microsoft 專為商業與專業設計工作打造並調校 MAI-Image-2.5,包括包裝、產品 mockup、招牌與以品牌為核心的視覺素材。此模型旨在用於廣告、電子商務與行銷流程中的正式製作。關於適用於你帳戶的確切使用權利,請在發布生成素材前查閱最新的 Atlas Cloud 條款。
指南、教學與產品動態,助你充分發揮 Atlas Cloud 的價值。