


La API MAI Image 2.5 ofrece la familia de generación y edición de imágenes fotorrealistas de Microsoft a través de un único endpoint, abarcando texto a imagen y edición en variantes estándar y Flash. Además de generar texto fiable dentro de las imágenes, produce retratos naturales y aplica razonamiento visual para mantener coherente la disposición de la escena. Atlas Cloud ofrece precios de pago por uso desde $0.03 por imagen, acceso Day-0 y una clave compatible con OpenAI.
Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.
Cuatro endpoints abarcan la generación de texto a imagen y la edición de imágenes, cada uno ofrecido en un nivel estándar y un nivel Flash con precios transparentes por llamada.
| Modalidad | Descripción |
|---|---|
| MAI Image 2.5 API (Texto a imagen) | Convierte prompts en lenguaje natural en imágenes de alta calidad y gran riqueza visual con el modelo insignia de texto a imagen de Microsoft. Está orientado a piezas visuales de marketing, fotografía de e-commerce y trabajos de diseño comercial que necesitan resultados listos para producción. Su precio es de $0.05 por imagen. |
| MAI Image 2.5 Flash (Texto a imagen) | Cuando el throughput y el presupuesto importan tanto como la fidelidad, la variante Flash genera imágenes con la misma arquitectura basada en difusión a un costo menor de $0.03 por imagen. Encaja en pipelines de generación de alto volumen y prototipado rápido que necesitan calidad constante sin disparar el gasto. |
| MAI Image 2.5 Edit API (Edición de imágenes) | Envía una imagen existente junto con una instrucción en lenguaje natural para aplicar ediciones precisas y controlables en lugar de regenerarla desde cero. El endpoint permite eliminar objetos, sustituir elementos y realizar ajustes localizados manteniendo intacta la composición circundante, con una facturación de $0.058 por edición. |
| MAI Image 2.5 Flash Edit (Edición de imágenes) | Los equipos que ejecutan pipelines de refinamiento de alto throughput obtienen la misma capacidad de edición guiada por instrucciones que el modelo Edit estándar a un costo reducido de $0.038 por edición. Esto hace viable la limpieza masiva de catálogos y las actualizaciones de assets en grandes lotes, manteniendo bajo el gasto por operación. |
La combinación de modelos avanzados con la plataforma acelerada por GPU de Atlas Cloud ofrece velocidad, escalabilidad y control creativo inigualables para la generación de imágenes y videos.

MAI-Image-2.5 genera retratos expresivos y de aspecto natural con estructura facial, iluminación y textura de la piel precisas a partir de prompts de texto. El modelo renderiza una estética de calidad cinematográfica con una iluminación coherente que coincide con la escena descrita. Está diseñado para campañas editoriales, de creación de marca y comerciales donde las imágenes centradas en humanos deben lucir terminadas sin procesamiento posterior.

MAI-Image-2.5 ofrece una fiabilidad mejorada para la generación de texto dentro de las imágenes, manejando etiquetas de productos, letreros, titulares y textos de marca con un espaciado correcto y legibilidad. Esto aborda un punto débil constante en la mayoría de los modelos de generación de imágenes y lo hace práctico para maquetas de empaques y activos publicitarios donde se requiere texto legible en el resultado. Es la elección correcta para los flujos de trabajo de diseño donde la precisión del texto en la imagen es innegociable.

El endpoint MAI-Image-2.5 Edit realiza modificaciones específicas en regiones de imagen concretas: eliminar elementos no deseados, reemplazar o recolorear objetos, actualizar texto en letreros existentes, rellenar áreas faltantes y limpiar defectos visuales como el desenfoque y el ruido. Las ediciones mantienen la coherencia y la composición en todo momento, dejando las regiones no tocadas visualmente intactas. Es la herramienta de referencia para el refinamiento de productos, la limpieza de catálogos y las actualizaciones de activos de marketing.

MAI-Image-2.5 está diseñado específicamente para aplicaciones de diseño comercial y profesional, permitiendo la creación de contenido de marca, maquetas de productos y material listo para campañas a partir de indicaciones de texto. El modelo mantiene la integridad del diseño y la composición tanto durante la generación como en la edición, produciendo recursos listos para su uso en publicidad y campañas de productos. Es la solución estándar para los equipos de diseño que producen elementos visuales comerciales a gran escala.

MAI-Image-2.5 aplica el razonamiento visual para comprender las relaciones espaciales, la ubicación de los objetos y la coherencia de la iluminación en toda la imagen. Esto lo hace confiable para generar escenas donde múltiples elementos deben coexistir naturalmente, y para tareas de edición donde una modificación debe respetar el contexto circundante. Es adecuado para la visualización de productos en escena y para cualquier flujo de trabajo donde la precisión contextual en el resultado sea fundamental.
El mismo prompt, generado por Mai Image 2.5 y otros modelos de imagen líderes: anuncio de producto y estilo de vida cinematográfico
Fotografía editorial macro de naturaleza muerta: una fila de antiguos frascos de botica y perfume de vidrio coloreado, hechos a mano y de alturas irregulares — bajos, altos, bulbosos — sobre un alféizar envejecido de yeso de cal, con el vidrio esmerilado surcado por diminutas burbujas de aire atrapadas. El instante decisivo: una mano humana desnuda inclina un frasco ámbar y un hilo fino y limpio de líquido transparente queda suspendido en el aire, capturado e iluminado en plena caída, con su tensión superficial y su borde perlado nítidos como una cuchilla. Detrás, los demás frascos refractan un sol bajo de hora dorada en una dispersión de cáusticas superpuestas de colores joya — ámbar, verde botella profundo, rosa — que se deslizan lentamente sobre el yeso gris, áspero y calcificado. Una luz lateral a contraluz, baja, de hora dorada atraviesa el vidrio de forma rasante, proyectando cáusticas direccionales y enfocadas y una luz de contorno brillante a lo largo de la silueta de cada frasco. Composición construida sobre la repetición gráfica de la fila de frascos contra una amplia extensión de pared gris neutra como espacio negativo, con poca profundidad de campo que comprime la fila, y la mano que vierte y el hilo de agua reluciente como punto focal nítido. Paleta limitada de tonos gema — ámbar, verde oscuro y rosa — en contraste con la pared gris apagada: contenida, nunca llamativa. Detalle macro hiperrealista: grano del vidrio esmerilado, burbujas, textura calcárea de la pared, la piel tensa del líquido, tenues motas de polvo flotando en el haz de luz. Sereno, con un toque de magia. Tomada con objetivo macro de 100mm, luz natural de ventana, acabado de fotografía de producto editorial. Relación de aspecto 16:9.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Puesto callejero nocturno de fideos, la fracción de segundo decisiva en la que un maestro de lamian estira una única bola de masa hasta convertirla en un abanico de docenas de hebras de fideos perfectamente paralelas, finísimas como cabellos, suspendidas en el aire; las hebras se abren hacia fuera como un abanico de mano desplegándose, mientras una explosión de harina suelta y vapor ascendente estalla en el mismo instante: es acción capturada en movimiento, no una pose. Su rostro está fijado en una concentración total, los músculos tensos por una fuerza controlada, el ceño fruncido, una gota de sudor en la sien; detrás de él, espectadores desenfocados contienen la respiración con expectación. Fotografía documental callejera realista, lenguaje de teleobjetivo. Iluminado por la única bombilla cálida de tungsteno del puesto, una contraluz lateral dura que perfila cada hebra translúcida de fideo con bordes brillantes, atrapa el polvo de harina suspendido en el aire como chispas flotantes y vuelve luminoso el vapor blanco ondulante; el neón azul frío de la calle nocturna del fondo se funde en suaves orbes de bokeh. La compresión de profundidad multicapa del teleobjetivo aplana las manos del maestro, su rostro concentrado y la cascada de fideos en un único plano, con las densas hebras paralelas actuando tanto como elemento gráfico repetitivo como líneas guía naturales que conducen la mirada a través del encuadre. Equilibrio cromático frío-cálido — resplandor ámbar de tungsteno en primer plano frente al azul frío profundo de la noche — sobrio y nunca estridente. Rica textura táctil: partículas granulosas de harina, leve brillo del gluten, tabla de cortar de madera desgastada e impregnada de aceite, sudor sobre la piel y un sutil desenfoque de movimiento en las hebras voladoras y el polvo a la deriva. Grano fino de película, poca profundidad de campo, sin sobrerenderizado, sin piel plástica, tonalidad natural y honesta. Tomada con teleobjetivo de 135mm, apertura amplia, sensación de reportaje espontáneo. Relación de aspecto 16:9.

Mai Image 2.5

Flux.2

Qwen Image 2.0
Desde catálogos de e-commerce y piezas publicitarias hasta packaging, imágenes de portavoces y visualización de productos en escena, la MAI Image 2.5 API respalda el trabajo de diseño comercial que los equipos entregan a diario.
Genera fotos de producto sobre fondos variados a partir de una sola referencia; después, cambia colores y corrige defectos en toda una gama de SKU mediante el Edit endpoint. Un conjunto completo de variantes cuesta menos que repetir una sesión de estudio.
Los especialistas en marketing de rendimiento producen variaciones para banners, redes sociales y display con superposiciones de texto precisas y composiciones coherentes con la marca. Como la variante Flash funciona a $0.03 por imagen, probar decenas de conceptos antes de escalar los ganadores sigue siendo económico.
Los mockups de packaging incorporan tipografía legible directamente en el arte de cajas, botellas y señalización de estantería, en lugar de colocarla a mano. Cuando cambia el texto, el Edit endpoint actualiza nombres, precios o copies de temporada sin reconstruir el diseño.
Un rostro reconocible, el vestuario y la identidad general se mantienen estables en distintas poses y composiciones a lo largo de ediciones sucesivas. Esto hace que los personajes recurrentes de campaña y las series continuas en redes se vean coherentes dondequiera que aparezcan.
Reflejos, objetos fuera de lugar y desenfoque por movimiento se eliminan limpiamente, mientras que el inpainting rellena las zonas faltantes y la composición circundante permanece intacta. A $0.058 por edición, limpiar miles de fotos antiguas se convierte en un trabajo por lotes rutinario.
El modelo razona sobre iluminación, escala y relaciones espaciales para colocar productos en escenas de estilo de vida con sombras y perspectiva creíbles. Los equipos de concepto y prototipado previsualizan ideas de ambientación mucho antes de reservar una sesión fotográfica física.
Compara la API MAI Image 2.5 frente a frente con los principales modelos de texto a imagen de Google, ByteDance y Alibaba en cuanto a proveedor, precio, resolución y renderizado de texto.
| Modelo | Proveedor | Precio inicial (por imagen) | Resolución máxima | Renderizado de texto dentro de la imagen | Nivel rápido optimizado para costos |
|---|---|---|---|---|---|
| MAI-Image-2.5 (Texto a imagen) | Microsoft | $0.05 | Hasta ~1 MP (1360 px máx. por lado) | √ | √ |
| MAI-Image-2.5 Flash (Texto a imagen) | Microsoft | $0.03 | Hasta ~1 MP (1360 px máx. por lado) | √ | √ |
| Nano Banana 2 (Texto a imagen) | $0.08 | Hasta 4K | √ | √ | |
| Seedream v4.5 | ByteDance | $0.04 | Hasta 2048×2048 | √ | - |
| Qwen Image 2.0 (Texto a imagen) | Alibaba | $0.035 | Hasta 2048×2048 | √ | - |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de MAI Image 2.5 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a MAI Image 2.5, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
La MAI Image 2.5 API ofrece a los desarrolladores acceso programático a MAI-Image-2.5 de Microsoft, un modelo fotorrealista de generación y edición de imágenes creado para trabajos de diseño comercial. Cubre tanto la generación de texto a imagen como la edición de imágenes basada en instrucciones, cada una disponible en una variante estándar y una variante Flash. En Atlas Cloud accedes a los cuatro endpoints con una única clave compatible con OpenAI y precios de pago por uso desde $0.03 por imagen.
Ambas variantes comparten la misma arquitectura de difusión, fotorrealismo y calidad de renderizado de texto. Flash es la opción optimizada en costos, a $0.03 por imagen para generación y $0.038 por edición, mientras que el modelo estándar cuesta $0.05 por imagen y $0.058 por edición. Usa Flash para generación de alto volumen y prototipado rápido, y reserva el modelo estándar para trabajos donde la máxima fidelidad sea lo más importante.
Los precios en Atlas Cloud son de pago por uso, sin suscripción. La generación estándar de texto a imagen cuesta $0.05 por imagen y la edición estándar cuesta $0.058 por edición, mientras que las variantes Flash bajan a $0.03 por imagen y $0.038 por edición. Se te cobra por cada llamada correcta, así que un lote de variaciones solo cuesta la tarifa fija por imagen multiplicada por el número de resultados.
Regístrate en Atlas Cloud, crea una única clave de API y apunta tu cliente existente compatible con OpenAI al endpoint MAI-Image-2.5. Envía un prompt de texto para generación, o una imagen junto con una instrucción para edición, y la respuesta devuelve URLs a las imágenes finales. El acceso desde el día 0 significa que el modelo está disponible en cuanto se lanza, sin lista de espera. Empieza a crear hoy.
Defines las dimensiones de salida con un parámetro size en formato ancho por alto, con 1024 por 1024 como valor predeterminado. Cada lado puede ir de 768 a 1360 píxeles, hasta un límite de aproximadamente un megapíxel en total, lo que cubre encuadres cuadrados, verticales y horizontales. Las variantes de generación estándar y Flash comparten los mismos límites de resolución.
El endpoint Edit recibe una única imagen de origen, proporcionada como URL o base64 en JPEG o PNG, junto con una instrucción en lenguaje natural. Realiza cambios dirigidos, como eliminar objetos, reemplazar elementos, cambiar colores, actualizar texto en señalética y corregir defectos, mientras mantiene intactas las regiones que no deben modificarse. Como el modelo razona sobre la estructura de la escena y la iluminación, las ediciones se mantienen coherentes con la composición circundante.
El renderizado de texto es una de las mayores mejoras del modelo, y Microsoft informa que su mayor salto de calidad frente a la generación anterior se dio precisamente en esta categoría. Produce de forma fiable etiquetas de producto, señalética, titulares y textos de marca con espaciado correcto y buena legibilidad. Esa fiabilidad lo hace práctico para maquetas de packaging y recursos publicitarios donde el texto legible dentro de la imagen no es negociable.
En los rankings públicos de Arena, MAI-Image-2.5 se lanzó en el puesto No. 2 para edición de imágenes y No. 3 para generación de texto a imagen. Sus puntos fuertes están en los retratos fotorrealistas, el renderizado de texto con calidad comercial y la edición consistente con la identidad, más que en resultados estilizados o artísticos. Para equipos que producen visuales listos para marca, ese posicionamiento lo convierte en una alternativa sólida a los generadores de propósito general.
Microsoft creó y ajustó MAI-Image-2.5 específicamente para trabajos de diseño comercial y profesional, incluidos packaging, maquetas de producto, señalética y visuales centrados en la marca. El modelo está pensado para uso en producción en flujos de trabajo de publicidad, e-commerce y marketing. Para conocer los derechos de uso exactos que se aplican a tu cuenta, revisa los términos vigentes de Atlas Cloud antes de publicar recursos generados.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.