Seedance 2.5 現已上線 — 首發於 Atlas Cloud
Hero background 1Hero background 2Hero background 3

MAI Image 2.5 API for Accurate In-image Text

MAI Image 2.5 API 透過單一端點提供微軟的寫實影像生成與編輯系列,涵蓋文字轉影像與編輯功能,並提供標準與 Flash 版本。除了可靠的圖像內文字呈現外,它也能生成自然的人像,並運用視覺推理維持場景版面的連貫性。Atlas Cloud 提供隨用隨付定價,每張影像 $0.03 起、Day-0 存取,以及一組與 OpenAI 相容的金鑰。

探索領先模型

Atlas Cloud 為您提供最新的行業領先創意模型。

依模態與價格比較每個 MAI Image 2.5 API 端點

四個端點涵蓋文字轉圖片生成與圖片編輯,每個端點都提供標準版與 Flash 方案,並採用透明的按次呼叫計價。

模態說明
MAI Image 2.5 API(文字轉圖片)使用 Microsoft 旗艦文字轉圖片模型,將自然語言提示轉換為高品質、視覺豐富的圖片。它適用於需要可直接投入製作的行銷視覺、電商商品攝影與商業設計工作。價格為每張圖片 $0.05。
MAI Image 2.5 Flash(文字轉圖片)當吞吐量與預算和畫質同樣重要時,Flash 變體會在相同的 diffusion-based 架構上生成圖片,成本較低,每張圖片 $0.03。它適合需要穩定品質、又不想提高支出的高量生成與快速原型製作流程。
MAI Image 2.5 Edit API(圖片編輯)提供既有圖片搭配自然語言指令,即可套用精準且可控的編輯,而不必從頭重新生成。此端點可處理物件移除、元素替換與局部調整,同時保持周圍構圖完整,費用為每次編輯 $0.058。
MAI Image 2.5 Flash Edit(圖片編輯)執行高吞吐量修整流程的團隊,可用較低成本取得與標準 Edit 模型相同的指令驅動編輯能力,費用為每次編輯 $0.038。這讓大量型錄清理與大批次素材更新更具可行性,同時維持較低的單次操作支出。

MAI-Image-2.5 模型的新功能 + 展示

將先進模型與 Atlas Cloud 的 GPU 加速平台相結合,為圖像和影片生成提供無與倫比的速度、可擴展性和創意控制。

照片級寫實人像生成

照片級寫實人像生成

MAI-Image-2.5根據文字提示產生富有表現力且自然逼真的肖像,具備準確的面部結構、光照和皮膚紋理。該模型呈現電影級的美學效果,並帶有與描述場景相符的一致光照。它專為編輯、品牌推廣和商業活動設計,在這些場景中,以人為本的圖像無需後製處理即可呈現出成品效果。

圖像內文字渲染

圖像內文字渲染

MAI-Image-2.5 為圖像內的文字生成提供了更高的可靠性,能夠以正確的間距和清晰度處理產品標籤、招牌、標題和品牌文案。這解決了大多數圖像生成模型中普遍存在的弱點,使其能夠實際應用於需要在輸出中包含可讀文字的包裝樣機和廣告素材。對於圖像內文字準確性絕對必要的設計工作流程而言,它是理想的選擇。

精準物件編輯

精準物件編輯

MAI-Image-2.5 Edit 端點對特定圖像區域執行定向修改:移除不需要的元素、替換物件或重新著色、更新現有標誌上的文字、填充缺失區域,以及清理模糊和雜訊等視覺缺陷。編輯過程始終保持連貫性和構圖,使未觸及的區域在視覺上保持完整。它是產品最佳化、目錄清理和行銷資產更新的首選工具。

品牌資產與商業設計

品牌資產與商業設計

MAI-Image-2.5 專為商業和專業設計應用而建構,支援透過文字提示生成品牌設計、產品原型以及可直接用於行銷活動的內容。該模型在生成和編輯過程中均能保持版面和構圖的完整性,從而產出可直接用於廣告和產品行銷活動的資產。它是設計團隊大規模製作商業視覺效果的標準解決方案。

跨物體與場景的視覺推理

跨物體與場景的視覺推理

MAI-Image-2.5應用視覺推理來理解整個影像中的空間關係、物件位置和光影一致性。這使其在生成多個元素需要自然共存的場景時非常可靠,並且在需要修改且必須遵循周圍環境的編輯任務中表現出色。它適用於產品場景視覺化,以及任何對輸出環境準確性要求較高的工作流程。

Mai Image 2.5 與其他模型比較 - 同一提示詞

相同提示詞,由 Mai Image 2.5 與其他領先圖像模型生成:產品與電影感生活風格廣告

提示詞

編輯風格微距靜物攝影:一排老舊手工彩繪玻璃藥劑與香水瓶,高低不一——矮胖、高挑、圓鼓——立在風化的石灰灰泥窗台上,磨砂玻璃表面布滿細小被困住的氣泡條紋。決定性瞬間:一隻裸露的人手傾斜一只琥珀色瓶子,一道纖細乾淨的透明液體細線懸停在半空中,在墜落途中被捕捉並被光照亮,其表面張力與凝珠邊緣銳利清晰。後方其他瓶子將低垂的黃金時刻陽光折射成一片交疊的寶石色焦散光——琥珀、深瓶綠、玫瑰粉——緩慢爬過粗糙、鈣化的灰色灰泥表面。低角度黃金時刻側逆光穿透玻璃,投射出具方向性的聚焦焦散光,並沿著每只瓶子的輪廓勾出發光的邊緣光。構圖建立在瓶陣的圖形化重複之上,對照大片中性灰牆作為留白,淺景深壓縮整排瓶子,倒液的手與閃光的水線作為銳利焦點。受限的寶石色調色盤,以琥珀、深綠與玫瑰粉對比低調灰牆——克制,絕不俗豔。超寫實微距細節:磨砂玻璃顆粒、氣泡、粉筆感牆面紋理、液體繃緊的表皮、光束中輕微漂浮的塵埃。安靜,帶一絲魔幻氣息。使用 100mm macro lens 拍攝,自然窗光,編輯風格產品攝影質感。16:9 aspect ratio。

Mai Image 2.5

Mai Image 2.5

Flux.2

Flux.2

Qwen Image 2.0

Qwen Image 2.0

提示詞

深夜街頭麵攤,決定性的剎那:一位拉麵師傅將一團麵糰拉成數十條完全平行、髮絲般細的麵條扇面,懸在半空中,麵條如同展開的手持摺扇向外散開,同一瞬間鬆散麵粉爆散、蒸氣升騰炸開——這是動作在運動中被捕捉,而不是擺拍。他的臉完全專注,肌肉因受控的力量而繃緊,眉頭緊鎖,太陽穴上有一滴汗珠;身後失焦模糊的圍觀者屏息期待。寫實街頭紀實攝影,telephoto lens 語彙。由攤位唯一一顆暖色 tungsten bulb 照亮,形成強烈側逆光,為每一條半透明麵條勾出發光邊緣,捕捉空中麵粉塵如漂浮火花,並讓翻湧的白色蒸氣變得發亮;身後夜街的冷藍霓虹融化成柔和的散景光球。telephoto 多層次景深壓縮,將師傅的雙手、專注的臉與瀑布般的麵條壓進同一平面,密集平行的麵條既是重複的圖形元素,也成為引導視線穿越畫面的自然導引線。冷暖色彩平衡——前景琥珀色 tungsten 光暈對比夜晚深冷藍——克制而絕不刺眼。豐富可觸的質感:粗礫的麵粉顆粒、麵筋微微的光澤、吸滿油漬且磨損的木砧板、皮膚上的汗,以及飛舞麵條與飄散粉末上細微的動態模糊。細緻 film grain、淺景深、不過度渲染、沒有塑膠感皮膚,真實自然的色調。使用 135mm telephoto 拍攝,大光圈,帶有 candid reportage feel。16:9 aspect ratio。

Mai Image 2.5

Mai Image 2.5

Flux.2

Flux.2

Qwen Image 2.0

Qwen Image 2.0

設計團隊如何運用 MAI Image 2.5 API

從電子商務型錄與廣告創意,到包裝、代言人圖像,以及產品情境視覺化,MAI Image 2.5 API 支援團隊每天交付的商業設計工作。

大規模電子商務型錄攝影

以一張參考圖生成不同背景的產品照片,接著透過 Edit endpoint 在完整 SKU 範圍內重新上色並清除瑕疵。一整組變體的成本低於一次棚拍重拍。

使用 MAI Image 2.5 API 製作廣告創意與 A/B 測試

成效行銷人員可製作橫幅、社群與多媒體廣告變體,並具備準確的文字疊加與符合品牌一致性的版面配置。由於 Flash variant 每張圖片僅需 $0.03,在擴大投放勝出版本前測試數十個概念,成本仍然低廉。

包裝與標籤製作

包裝 mockup 可將清晰可讀的字體直接融入盒身、瓶身與貨架標示的視覺稿中,而不必手動放置。當文案需要變更時,Edit endpoint 可修改名稱、價格或季節性文案,無需重建版面。

一致的品牌代言人圖像

透過連續編輯,可讓可辨識的臉孔、服裝與整體身分在不同姿勢與版面中保持穩定。這能讓反覆出現的活動角色與持續經營的社群系列,無論出現在哪裡都維持一致觀感。

使用 MAI Image 2.5 API 進行型錄修圖與清理

反光、雜物與動態模糊都能乾淨移除,同時 inpainting 會補齊缺失區域,並保持周圍構圖完整。每次編輯僅需 $0.058,清理數千張舊照片也能成為例行批次作業。

使用 MAI Image 2.5 API 進行產品情境視覺化

模型能推理光線、比例與空間關係,將產品放入生活情境中,呈現可信的陰影與透視。概念與原型團隊可在預訂實體拍攝之前,先預覽場景陳列想法。

MAI Image 2.5 API 與競品圖片模型的比較

從提供者、價格、解析度與文字渲染等面向,將 MAI Image 2.5 API 與 Google、ByteDance 和 Alibaba 的領先文字轉圖片模型進行正面比較。

模型提供者起始價格(每張圖片)最高解析度圖片內文字渲染成本最佳化快速層級
MAI-Image-2.5(文字轉圖片)Microsoft$0.05最高約 1 MP(每邊最高 1360 px)
MAI-Image-2.5 Flash(文字轉圖片)Microsoft$0.03最高約 1 MP(每邊最高 1360 px)
Nano Banana 2(文字轉圖片)Google$0.08最高 4K
Seedream v4.5ByteDance$0.04最高 2048×2048-
Qwen Image 2.0(文字轉圖片)Alibaba$0.035最高 2048×2048-

如何在 Atlas Cloud 上使用 MAI Image 2.5

幾分鐘即可上手 — 按照以下簡單步驟,透過 Atlas Cloud 平台整合和部署模型。

建立 Atlas Cloud 帳戶

在 atlascloud.ai 註冊並完成驗證。新用戶可獲得免費額度,用於探索平台和測試模型。

為何在 Atlas Cloud 使用 MAI Image 2.5

將先進的 MAI Image 2.5 模型與 Atlas Cloud 的 GPU 加速平台相結合,提供無與倫比的效能、可擴展性和開發體驗。

效能與靈活性

低延遲:
GPU 最佳化推理,實現即時回應。

統一 API:
一次整合,暢用 MAI Image 2.5、GPT、Gemini 和 DeepSeek。

透明定價:
按 Token 計費,支援 Serverless 模式。

企業與規模

開發者體驗:
SDK、資料分析、微調工具和模板一應俱全。

可靠性:
99.99% 可用性、RBAC 權限控制、合規日誌。

安全與合規:
SOC 2 Type II 認證、HIPAA 合規、美國資料主權。

MAI Image 2.5 API:開發者在開始建置前常問的問題

MAI Image 2.5 API 讓開發者能以程式化方式存取 Microsoft 的 MAI-Image-2.5,這是一款為商業設計工作打造的寫實影像生成與編輯模型。它涵蓋 text-to-image 生成與基於指令的影像編輯,兩者皆提供標準版與 Flash 版本。在 Atlas Cloud 上,你可以透過一組 OpenAI-compatible key 存取全部四個 endpoints,並採用隨用隨付定價,每張影像 $0.03 起。

兩個版本共用相同的 diffusion architecture、寫實品質與文字渲染能力。Flash 是成本最佳化選項,生成每張影像 $0.03、每次編輯 $0.038;標準模型則是每張影像 $0.05、每次編輯 $0.058。高量生成與快速原型製作適合使用 Flash;若工作最重視最高保真度,則建議保留使用標準模型。

Atlas Cloud 採隨用隨付定價,無需訂閱。標準 text-to-image 每張影像 $0.05,標準編輯每次 $0.058;Flash 版本則降至每張影像 $0.03、每次編輯 $0.038。你只會為成功的呼叫付費,因此一批變體的成本就是固定的每張影像費用乘以輸出數量。

在 Atlas Cloud 註冊、建立一組 API key,並將你現有的 OpenAI-compatible client 指向 MAI-Image-2.5 endpoint。若要生成,送出文字提示;若要編輯,送出影像加上一段指令;回應會傳回完成影像的 URL。Day-0 access 代表模型一推出即可使用,無需候補名單。今天就開始建置。

你可以用 size 參數以寬度乘以高度的格式設定輸出尺寸,預設為 1024 by 1024。每一邊可介於 768 到 1360 pixels,總量上限約為 one megapixel,可涵蓋正方形、人像直式與風景橫式構圖。標準版與 Flash 生成版本共用相同的解析度限制。

Edit endpoint 會接收單一來源影像,可用 URL 或 base64 提供,格式為 JPEG 或 PNG,並搭配一段自然語言指令。它能執行移除物件、替換元素、重新上色、更新招牌中的文字,以及清理瑕疵等局部修改,同時保持未觸及區域不變。由於模型能推理場景結構與光照,編輯結果會與周圍構圖保持一致。

文字渲染是這個模型最大的進步之一,Microsoft 表示相較上一代,這正是品質提升幅度最大的類別。它能可靠產生產品標籤、招牌、標題與品牌文案,並具備正確間距與可讀性。這種可靠度讓它適合用於包裝 mockup 與廣告素材,尤其是影像內文字必須清晰可讀的情境。

在公開的 Arena 排行榜上,MAI-Image-2.5 發布時於影像編輯排名 No. 2、text-to-image 生成排名 No. 3。它的強項在於寫實肖像、商業級文字渲染,以及保持身分一致的編輯,而非風格化或藝術化輸出。對於需要產出可直接用於品牌的視覺素材團隊而言,這樣的定位使它成為通用生成器的強力替代方案。

Microsoft 專為商業與專業設計工作打造並調校 MAI-Image-2.5,包括包裝、產品 mockup、招牌與以品牌為核心的視覺素材。此模型旨在用於廣告、電子商務與行銷流程中的正式製作。關於適用於你帳戶的確切使用權利,請在發布生成素材前查閱最新的 Atlas Cloud 條款。

探索更多系列

Seedance 2.5

Seedance 2.5 API 提供了 ByteDance 最新的影片生成模型,這是基於統一多模態架構構建的 Seedance 2.0 的繼任者。它能夠一次性渲染長達30秒的影片片段,在逼真的物理法則下保持主體一致性,並直接在畫面中繪製文本和多語言字幕。Atlas Cloud 在已經提供 Seedance 2.0 和 1.5 服務的相同統一端點上帶來了零日(Day-0)存取權限。今天就開始構建吧。

檢視系列

MiniMax H3

MiniMax H3 API 開放 MiniMax 的通用多模態影片模型,可將文字、圖片、影片與音訊作為同一個脈絡來理解,而不是一次只處理一項任務。片段長度為 5 到 15 秒、24 FPS,支援從 21:9 到 9:16 的各種長寬比;只需一個 prompt,就能替換角色、更換背景、改寫對白,或從參考片段複製聲音。Atlas Cloud 透過單一 OpenAI-compatible endpoint 提供所有功能。立即開始建置。

檢視系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 為開發者在 Atlas Cloud 上提供了字節跳動的可控圖像編輯模型。它透過錨點和座標精確定位編輯,將圖像分離為可編輯圖層,融合多個參考,並精準匹配顏色和材質,支援 2K 和 3K 解析度的多語言文本。在 Atlas Cloud 上,您只需一個金鑰即可存取!

檢視系列

Seedance 2.0

Seedance 2.0 API 為您提供 ByteDance 多模態影片模型的生產級存取權限——支援四模態輸入(文字、影像、影片、音訊),以及業界領先的「Universal Reference」(通用參考)系統,可在不同鏡頭間鎖定構圖、運鏡與角色動作。只需一次 API 呼叫即可整合導演級控制,固定費率為 $0.09/秒,即時取得金鑰,無需排隊——由企業級正常運行時間與合規性提供保障。Seedance 2.0 原生 4K 現已上線!

檢視系列

GPT Image 2

GPT Image 2 API 為開發者提供了訪問 OpenAI 最新圖像模型的途徑,它是 GPT Image 1.5 的繼任者。該模型可生成和編輯圖像,能夠在拉丁和 CJK 文字上實現準確的文本渲染,並在海報、樣機和資訊圖表方面具備強大的排版能力。在 Atlas Cloud 上,您可以透過一個統一的 API 與 300 多個模型一起訪問它,並享受免費額度、99.99% 的正常運行時間,且無需 OpenAI 組織驗證。

檢視系列

Gemini Omni Flash

Gemini Omni API 將 Google DeepMind 於 Google I/O 2026 發表的多模態影片生成與編輯模型帶進你的技術棧。Gemini Omni 將 Gemini 的推理引擎與生成式媒體融合,可接受文字、圖片、影片與音訊的任意組合輸入,產生一致且以知識為根據的輸出。透過自然對話持續打磨成果:替換物件、改寫場景、切換風格,同時維持物理規律、角色與畫面連貫性不變。Atlas Cloud 透過單一整合 API 提供完整的 Gemini Omni Flash 系列——文字生成影片、支援最多 7 張參考圖片的圖片生成影片,以及參考圖生成影片——採每秒計費、價格透明,$0.112 起,無需訂閱。立即開始打造。

檢視系列

Grok Imagine

Grok Imagine API 為開發者提供 xAI 的圖像、影片和音訊生成一站式套件。它可以生成解析度高達 2K 且支援多語言文本渲染的圖像,以及長達 15 秒且帶有原生同步音訊和基於參考圖像編輯功能的影片。在 Atlas Cloud 上,只需一個金鑰即可執行每個 Grok Imagine 模式,因此您可以在圖像、影片和音訊之間無縫切換,無需單獨設定,每張圖像 0.02 美元起,每秒 0.05 美元起。

檢視系列

Google

Google最強大的創意模型現已在Atlas Cloud上全面可用。Veo 3.1提供電影等級的影片生成,Nano Banana 2支援高保真圖像建立,而Gemini為每個工作流程帶來多模態智慧。透過單一API key即可存取完整的Google模型套件,提供Day-0可用性和隨用隨付(pay-as-you-go)定價。

檢視系列

Seedance 2.0 Mini

Seedance 2.0 Mini 將 ByteDance 的多模態影片生成技術引入到對速度和成本要求極高的工作流程中。它以更輕量的佔用空間提供 Seedance 2.0 的核心能力——更快的生成速度、更低的單支影片成本,並且使用您現有的同款 API 整合。對於運行高吞吐量流水線或進行大規模原型設計的團隊來說,Mini 是最實用的預設選擇。

檢視系列

ByteDance

從電影級影片生成到高保真影像建立,ByteDance 最強大的模型現已在 Atlas Cloud 上線。以最低的推論定價和零基礎設施開銷,大規模執行 Seedance 和 Seedream。

檢視系列

Alibaba

Atlas Cloud 將 Alibaba 的全系模型陣容整合至同一個 API 中:Qwen 適用於語言和圖像任務,Wan 適用於高達 1080p 的影片生成。所有模型均採用按需付費模式,無需訂閱。您可以使用現有的 OpenAI 兼容客戶端,透過單一的 base URL 存取 Alibaba API。

檢視系列

OpenAI

Atlas Cloud 為您提供存取完整 OpenAI API 產品線的權限,從用於圖像生成的 GPT Image 2 到用於影片的 Sora 2。每個模型均採用按需付費模式,無月度消費限制。使用相容 OpenAI 的 API,只需簡單替換基礎 URL 即可輕鬆接入。

檢視系列

一個 API,暢享全模態 AI。

探索全部模型