


MAI Image 2.5 API 通过单一端点提供 Microsoft 的照片级真实感图像生成与编辑系列,涵盖标准版和 Flash 变体的文本生成图像与图像编辑。它不仅能可靠地生成图中文字,还能生成自然的人像,并运用视觉推理保持场景布局连贯。Atlas Cloud 提供按需付费定价,每张图像低至 $0.03,支持 Day-0 访问,并使用一个 OpenAI-compatible key。
Atlas Cloud 为您提供最新的行业领先创意模型。
四个端点覆盖文本到图像生成和图像编辑,每个端点都提供标准版和 Flash 层级,并采用透明的按调用计费。
| 模态 | 描述 |
|---|---|
| MAI Image 2.5 API (Text to Image) | 使用 Microsoft 的旗舰文本到图像模型,将自然语言提示词转化为高质量、视觉表现丰富的图像。它面向营销视觉、电商摄影以及需要可直接投入生产的输出的商业设计工作。价格为每张图像 $0.05。 |
| MAI Image 2.5 Flash (Text to Image) | 当吞吐量和预算与保真度同样重要时,Flash 变体基于相同的扩散架构以更低成本生成图像,价格为每张图像 $0.03。它适合需要稳定质量且不推高开支的大批量生成和快速原型流水线。 |
| MAI Image 2.5 Edit API (Image Editing) | 将现有图像与自然语言指令一起输入,即可应用精确、可控的编辑,而无需从头重新生成。该端点可处理对象移除、元素替换和局部调整,同时保持周围构图不变,按每次编辑 $0.058 计费。 |
| MAI Image 2.5 Flash Edit (Image Editing) | 运行高吞吐量精修流水线的团队,可以以每次编辑 $0.038 的更低成本获得与标准 Edit 模型相同的指令驱动编辑能力。这让批量目录清理和大批量素材更新变得可行,同时保持较低的单次操作开支。 |
将先进模型与 Atlas Cloud 的 GPU 加速平台相结合,为图像和视频生成提供无与伦比的速度、可扩展性和创意控制。

MAI-Image-2.5根据文本提示生成富有表现力且自然逼真的肖像,具有准确的面部结构、光照和皮肤纹理。该模型呈现电影级的美学效果,并带有与描述场景相匹配的一致光照。它专为编辑、品牌推广和商业活动设计,在这些场景中,以人为本的图像无需后期处理即可呈现出成品效果。

MAI-Image-2.5 为图像内的文本生成提供了更高的可靠性,能够以正确的间距和清晰度处理产品标签、标牌、标题和品牌文案。这解决了大多数图像生成模型中普遍存在的弱点,使其能够实际应用于需要在输出中包含可读文本的包装样机和广告素材。对于图像内文本准确性至关重要的设计工作流而言,它是理想的选择。

MAI-Image-2.5 Edit 端点对特定图像区域执行定向修改:移除不需要的元素、替换对象或重新着色、更新现有标志上的文本、填充缺失区域,以及清理模糊和噪点等视觉缺陷。编辑过程始终保持连贯性和构图,使未触及的区域在视觉上保持完整。它是产品优化、目录清理和营销资产更新的首选工具。

MAI-Image-2.5 专为商业和专业设计应用而构建,支持通过文本提示生成品牌设计、产品原型以及可直接用于营销活动的内容。该模型在生成和编辑过程中均能保持布局和构图的完整性,从而产出可直接用于广告和产品营销活动的资产。它是设计团队大规模制作商业视觉效果的标准解决方案。

MAI-Image-2.5应用视觉推理来理解整个图像中的空间关系、对象位置和光影一致性。这使其在生成多个元素需要自然共存的场景时非常可靠,并且在需要修改且必须遵循周围环境的编辑任务中表现出色。它适用于产品场景可视化,以及任何对输出环境准确性要求较高的工作流。
相同提示词,由 Mai Image 2.5 与其他领先图像模型生成:产品与电影感生活方式广告
编辑风格微距静物摄影:一排高低不一的老式手工彩色玻璃药剂瓶和香水瓶——矮胖的、高挑的、圆鼓鼓的——立在风化的石灰灰泥窗台上,磨砂玻璃中布满细小的困气气泡纹理。决定性瞬间:一只裸露的人手倾斜一只琥珀色瓶子,一缕纤细干净的透明液体悬停在半空中,被定格并照亮在下落途中,其表面张力与凝珠边缘锐利如刀。背景中,其他瓶子将低垂的黄金时刻阳光折射成一片重叠的宝石色焦散光斑——琥珀色、深瓶绿、玫瑰粉——在粗糙、钙化的灰色灰泥上缓慢爬行。低角度黄金时刻侧逆光穿透玻璃,投下具有方向性的聚焦焦散,并沿每个瓶子的轮廓勾出发光的轮廓光。构图建立在瓶阵的图形化重复之上,并以大面积中性灰墙作为留白,浅景深压缩整排瓶子,倒液的手与闪光的水线作为清晰焦点。有限的宝石色调色板:琥珀色、深绿色与玫瑰粉,与柔和的灰墙形成对比——克制,绝不艳俗。超写实微距细节:磨砂玻璃颗粒、气泡、粉笔般的墙面纹理、绷紧的液体表皮、光束中隐约漂浮的尘埃。安静,并带有一丝魔法感。使用 100mm macro lens 拍摄,自然窗光,编辑级产品摄影质感。16:9 aspect ratio。

Mai Image 2.5

Flux.2

Qwen Image 2.0
深夜街头面摊,决定性的瞬间:一位拉面师傅将一团面胚拉成几十根完全平行、发丝般细的面条扇面,悬停在半空中;面条像一把正在展开的手持折扇向外散开,同时松散面粉与升腾蒸汽在同一刹那爆开——这是运动中的动作定格,而不是摆拍。他的脸上充满高度专注,肌肉因受控的力量而绷紧,眉头紧锁,太阳穴有一颗汗珠;身后虚化失焦的围观者屏息以待。写实街头纪实摄影,telephoto lens 语言。由摊位唯一一盏温暖的 tungsten bulb 照明,形成硬朗侧逆光,为每一根半透明面条勾出发光边缘,将空中的面粉尘捕捉成漂浮的火花,并让翻涌的白色蒸汽发亮;身后夜街的冷蓝霓虹融化成柔和的散景光球。Telephoto 多层景深压缩将师傅的双手、专注的面孔和瀑布般的面条压到同一平面,密集平行的面条既是重复的图形元素,也是自然的引导线,牵引视线穿过画面。冷暖色彩平衡——前景琥珀色 tungsten glow 对比夜色中深沉的冷蓝——克制,绝不刺眼。丰富的触感纹理:粗粝的面粉颗粒、面筋的微弱光泽、浸满油渍且磨旧的木质案板、皮肤上的汗水,以及飞舞面条和漂浮粉尘上的轻微运动模糊。细腻胶片颗粒,浅景深,不过度渲染,无塑料感皮肤,真实自然的色调。使用 135mm telephoto 拍摄,大光圈,抓拍报道感。16:9 aspect ratio。

Mai Image 2.5

Flux.2

Qwen Image 2.0
从电商目录和广告创意,到包装、代言人图像以及产品场景化可视化,MAI Image 2.5 API 支持团队每天交付的商业设计工作。
基于一张参考图,在多种背景下生成产品图,然后通过 Edit endpoint 对整个 SKU 系列进行重新配色并清理瑕疵。完成一整套变体的成本低于一次影棚重拍。
效果营销人员可以制作横幅、社交媒体和展示广告变体,包含准确的文字叠加和符合品牌一致性的版式。由于 Flash 变体的运行成本为每张图 $0.03,在放大优胜方案之前测试数十个创意也能保持低成本。
包装模型图可以将清晰可读的排版直接融入盒子、瓶身和货架标识设计中,而无需手动放置。文案变更时,Edit endpoint 可在不重建版式的情况下修改名称、价格或季节性文案。
通过连续编辑,可让可识别的面孔、服装和整体身份在不同姿势与版式中保持稳定。这能让反复出现的营销角色和持续运营的社交系列无论在哪里呈现都保持一致观感。
反光、杂物和运动模糊都能被干净去除,同时图像修复可填补缺失区域,并保持周围构图完整。以每次编辑 $0.058 的成本,清理数千张旧照片可以成为常规批处理任务。
该模型能够理解光照、尺度和空间关系,将产品放入生活方式场景中,并呈现可信的阴影与透视。概念和原型团队可以在预订实体拍摄之前,提前预览布景想法。
将 MAI Image 2.5 API 与来自 Google、ByteDance 和 Alibaba 的领先文本生成图像模型进行逐项对比,涵盖提供商、价格、分辨率和文字渲染。
| 模型 | 提供商 | 起始价格(每张图像) | 最高分辨率 | 图像内文字渲染 | 成本优化的快速档位 |
|---|---|---|---|---|---|
| MAI-Image-2.5(文本生成图像) | Microsoft | $0.05 | 最高约 1 MP(每边最大 1360 px) | √ | √ |
| MAI-Image-2.5 Flash(文本生成图像) | Microsoft | $0.03 | 最高约 1 MP(每边最大 1360 px) | √ | √ |
| Nano Banana 2(文本生成图像) | $0.08 | 最高 4K | √ | √ | |
| Seedream v4.5 | ByteDance | $0.04 | 最高 2048×2048 | √ | - |
| Qwen Image 2.0(文本生成图像) | Alibaba | $0.035 | 最高 2048×2048 | √ | - |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 MAI Image 2.5 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 MAI Image 2.5、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
MAI Image 2.5 API 让开发者能够以编程方式访问 Microsoft 的 MAI-Image-2.5。这是一款面向商业设计工作的写实图像生成与编辑模型。它同时支持文本生成图像和基于指令的图像编辑,每种能力都提供标准版和 Flash 变体。在 Atlas Cloud 上,你可以通过一个 OpenAI-compatible key 访问全部四个 endpoints,并按量付费,价格从每张图像 $0.03 起。
两个变体采用相同的 diffusion architecture,并具备同样的写实能力和文本渲染质量。Flash 是成本优化选项,生成价格为每张图像 $0.03,编辑价格为每次 $0.038;标准模型为每张图像 $0.05、每次编辑 $0.058。高频生成和快速原型制作适合使用 Flash;而在最看重最高保真度的场景中,建议保留使用标准模型。
Atlas Cloud 采用按量付费,无需订阅。标准文本生成图像为每张图像 $0.05,标准编辑为每次 $0.058;Flash 变体则降至每张图像 $0.03、每次编辑 $0.038。费用按成功调用计费,因此一批变体只需按固定的单张图像费用乘以输出数量计算。
在 Atlas Cloud 注册,创建一个 API key,然后将你现有的 OpenAI-compatible client 指向 MAI-Image-2.5 endpoint。发送文本提示词即可生成图像,或提交一张图像加上一条编辑指令进行编辑,响应会返回成品图像的 URL。Day-0 access 意味着模型一发布即可使用,无需等待名单。现在就可以开始构建。
你可以通过 size 参数设置输出尺寸,格式为宽度乘高度,默认值为 1024 by 1024。每条边的范围可从 768 到 1360 pixels,总像素上限约为一百万像素,可覆盖方图、竖图和横图构图。标准版和 Flash 生成变体共享相同的分辨率限制。
Edit endpoint 接收一张源图像,可通过 URL 或 JPEG/PNG 格式的 base64 提供,并同时接收一条自然语言指令。它可以执行有针对性的修改,例如移除物体、替换元素、重新上色、更新标牌中的文字以及清理瑕疵,同时保持未涉及区域不变。由于模型能够理解场景结构和光照,编辑结果会与周围构图保持一致。
文本渲染是该模型最大的提升之一,Microsoft 表示,相比上一代模型,它在这一类别上的质量提升最大。它能够可靠生成产品标签、标牌、标题和品牌文案,并保持正确的间距和可读性。这种可靠性使其适用于包装样机和广告素材等对图中文字可读性有硬性要求的场景。
在公开的 Arena 排行榜上,MAI-Image-2.5 发布时位列图像编辑第 2、文本生成图像第 3。它的优势在于写实人像、商业级文本渲染,以及身份一致的编辑,而不是风格化或艺术化输出。对于需要产出可直接用于品牌场景视觉素材的团队而言,这一定位使它成为通用生成器之外的有力替代方案。
Microsoft 专门为商业和专业设计工作构建并调优了 MAI-Image-2.5,适用场景包括包装、产品样机、标牌和品牌导向视觉素材。该模型面向广告、电商和营销流程中的生产级使用。关于适用于你账户的具体使用权利,请在发布生成资产前查看最新的 Atlas Cloud 条款。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。