Una lámina de 16 poses necesita una verificación de reproducción: ¿la mano se desplaza de forma natural?, ¿los pies mantienen el contacto?, ¿el fotograma final se reconecta con el primero?
Estos Resultados de la prueba de animación estática de GPT Image 2.5 están a la espera del benchmark descrito a continuación. El entorno de generación actualmente muestra una página de acceso. No se han medido hallazgos de calidad de animación, conteos de aprobación ni un modelo ganador. Este borrador conserva el experimento completo y las instrucciones de reproducción; no es un informe de resultados finalizado.
Aquí, animación estática significa generar una lámina de fotogramas fijos consecutivos, extraer sus celdas y reproducir esas celdas en orden.
Es nuestro término de trabajo, no un nombre de función oficial verificado. Una imagen fija de estilo animación es una sola imagen; una lámina de fotogramas secuenciales contiene múltiples imágenes; la generación de video nativo produce movimiento mediante un flujo de trabajo diferente.
La comparación planificada abarca cinco tareas, dos modelos y tres solicitudes independientes por combinación. El ensamblado del GIF ocurre localmente después de la generación de imágenes. Se mide cuánto movimiento sobrevive sin fotogramas nuevos ni reparaciones ocultas.
Conclusiones clave
- No se han completado solicitudes del benchmark; las mediciones no disponibles no deben leerse como fallos del modelo.
- Evalúa las transiciones consecutivas, los puntos de contacto y las costuras de bucle por separado de la apariencia del personaje.
- Presupuesta la extracción y la inspección junto con la generación, y mantén la reproducción en bruto distinta de las reparaciones.
Qué probamos y cómo lo calificamos
El benchmark está especificado para GPT Image 2.5 Sunburst Text-to-Image y GPT Image 2.5 Flare Text-to-Image. La generación debe ejecutarse en el entorno de prueba Atlas Cloud con sesión iniciada. Sus tiempos de espera, cuando son medibles, describen ese entorno y esa sesión, no un compromiso de servicio de producción.
| Control | Configuración preregistrada |
| Entrada | Mismo prompt de texto para cada tarea emparejada; sin imágenes de referencia |
| Salida de imagen | PNG, 2048×1152, quality=max, n=1 |
| Fondo | Opaco para saludar, verter, rotar, pedalear; transparente para caminar |
| Repeticiones | Tres solicitudes independientes por tarea y modelo; 30 solicitudes en total |
| Diseño | Cuatro columnas, cuatro filas; tamaño objetivo de celda 512×288 |
| Extracción | De izquierda a derecha y luego de arriba abajo; conservar los 16 recortes nominales |
| Reproducción | Objetivo de 125 ms por fotograma, 8 fps, aproximadamente dos segundos |
| Procesamiento | Sin interpolación, reordenamiento, estabilización ni fotogramas fallidos eliminados |
Una lámina de 2048×1152 proporciona 512×288 píxeles por celda igual. Ampliar el GIF no puede recuperar detalles ausentes en esas celdas. Las 480 celdas objetivo pertenecen a 30 solicitudes, por lo que son observaciones correlacionadas, no 480 ensayos independientes.
Para cada lámina, inspecciona el diseño, la identidad, las 15 transiciones adyacentes y las relaciones físicas específicas de la tarea. Las tareas de bucle añaden la transición 16→1. Una lámina en bruto calificada debe cumplir todas las comprobaciones aplicables; los conteos a nivel de fotograma permanecen separados. Registra los detalles ambiguos u ocluidos como no resueltos en lugar de otorgar una aprobación sin respaldo.
La ejecución alterna Sunburst y Flare, manteniendo cada solicitud separada. Muestra la primera solicitud completada en cada grupo, conservando los fallos de solicitudes anteriores. Una imagen completada con movimiento incorrecto permanece en el conjunto de datos. Tres repeticiones no pueden establecer una tasa de éxito general.
Un experimento publicado anteriormente generó diez cuadrículas de keyframes y documentó límites de paneles desiguales. Sus storyboards y configuraciones difieren de los nuestros, por lo que sus resultados solo aportan contexto. (Genflick, septiembre de 2026.)
Resultados de la prueba de animación estática de GPT Image 2.5: Transformación de oruga a mariposa
Una secuencia de transformación comprueba si el modelo puede mantener estable un pequeño mundo mientras el sujeto cambia de estado. La oruga de plastilina comienza debajo de la misma rama doblada, se cuelga, forma un capullo y emerge como mariposa. La cámara permanece fija a la altura de la mesa, lo que da a la rama, al borde de la mesa y al fondo un papel claro como puntos de referencia.
La primera inspección sigue a la oruga desde su pose curvada bajo la rama hasta su pose colgante. Su cuerpo debe moverse en pequeños pasos mientras la horquilla de la rama, la base y el punto de fijación permanecen en el mismo lugar. Una oruga reconocible en fotogramas aislados no demuestra que haya seguido una ruta continua hacia el capullo.
La parte media de la secuencia es donde el escenario debe permanecer especialmente estable. El capullo puede cambiar de forma a medida que avanza la acción, pero la rama no debe alargarse, desplazarse ni adquirir una nueva textura. Observa la línea del horizonte y la base de la rama además del sujeto, porque la deriva del fondo puede hacer que un cambio real de pose parezca un movimiento de cámara.
Los fotogramas finales presentan a la mariposa. Comprueba si emerge del capullo en un lugar legible y si su escala sigue siendo plausible en relación con la rama. La transformación es más clara cuando el espectador puede comparar un escenario preservado con un sujeto que avanza, en lugar de intentar inferir un cambio a través de escenas reconstruidas.
Evidencia actual: Este caso proporciona un ejemplo visual claro de una transformación corta y unidireccional. No aporta una puntuación de benchmark calificada, un conteo de aprobaciones ni una comparación entre modelos.

Inspecciona la rama, la mesa y la cámara fija por separado del cambio de oruga a mariposa.
Esta secuencia debe reproducirse hacia adelante. Invertirla convertiría a la mariposa terminada de nuevo en capullo y debilitaría la acción deseada. Un flujo de trabajo de producción debe conservar cada imagen fija subyacente para que cualquier salto pueda localizarse y corregirse en el estado responsable.
Resultados de la prueba de animación estática de GPT Image 2.5: Comparación de continuidad del ADN
Una doble hélice de ADN en rotación es una prueba compacta de continuidad estructural. La acción puede ser simple, pero el objeto tiene características repetidas que hacen fácil detectar la deriva: dos rieles exteriores, peldaños espaciados uniformemente, una punta inferior y una sombra suave debajo del objeto. Esos anclajes deben conservar sus relaciones a medida que avanza la secuencia.
La presentación lado a lado facilita la revisión de las transiciones adyacentes. Comienza con la silueta: se espera un cambio de orientación, pero un cambio repentino en la altura, el ancho o el giro de la hélice no forma parte de una rotación controlada. Luego sigue los peldaños y la punta inferior para ver si el objeto sigue siendo una estructura coherente.
La iluminación y el encuadre importan aquí tanto como la geometría. Si la sombra cambia de dirección o la hélice se desliza lateralmente, el espectador no puede saber si el movimiento aparente provino de la rotación del objeto, de la deriva de la cámara o de una escena reconstruida. Un fondo estable es útil precisamente porque elimina esa ambigüedad.
Este tipo de ejemplo debe juzgarse fotograma a fotograma, no seleccionando la imagen fija más fuerte. Una última imagen atractiva puede ocultar una transición rota en el medio. Registra el primer par que introduzca un cambio de forma, posición o iluminación que no siga el movimiento previsto.
Evidencia actual: Este caso muestra cómo se puede inspeccionar una secuencia corta de objetos para verificar la continuidad de forma, posición, iluminación y encuadre. No es una puntuación general de rendimiento ni una afirmación de clasificación de modelos.

Sigue los rieles exteriores, los peldaños, la punta inferior, el encuadre y la sombra en los fotogramas vecinos.
La secuencia puede repetirse solo si su pose final se reconecta limpiamente con su primera pose. Si el estado final tiene una orientación diferente, preséntala como una secuencia hacia adelante en lugar de ocultar un reinicio con un efecto ping-pong.
Resultados de la prueba de animación estática de GPT Image 2.5: Secuencia de floración de peonía
Una floración de peonía pone a prueba el cambio controlado en todo un objeto. La flor comienza como un capullo cerrado, se abre a través de varios estados de pétalos y termina en plena floración. El cambio previsto es considerable, por lo que los elementos que deben permanecer fijos deben declararse claramente: tallo, unión de hojas, cámara, fondo e iluminación.
Comienza siguiendo el tallo desde la línea del suelo hasta la cabeza de la flor. Debe permanecer erguido y conservar el mismo grosor a medida que se abren los pétalos. Las hojas deben permanecer conectadas en los mismos nudos; una hoja que se desplaza a otra posición del tallo indica un objeto reconstruido, no una floración continua.
A continuación, inspecciona los pétalos. Su apertura debe progresar hacia afuera desde el capullo, no saltar directamente de cerrado a completamente abierto. La flor puede hacerse más grande, pero su centro debe permanecer alineado con el tallo. Un cambio repentino en el color de los pétalos, la textura de los bordes o la dirección de la iluminación debe anotarse en las transiciones.
El fondo oscuro y el punto de vista fijo hacen legible este cambio unidireccional. También crean un contraste útil con la propia flor: los pétalos pueden evolucionar, mientras que el mundo circundante no debería. Esa distinción es la base para revisar revelaciones de productos, reacciones de personajes y otros cambios progresivos de estado.
Evidencia actual: Este caso demuestra una acción de apertura clara y unidireccional con anclajes de escena estables. No establece un resultado de benchmark calificado ni un resultado fiable para otro prompt.

Comprueba la progresión de los pétalos mientras el tallo, la unión de hojas, el fondo, la cámara y la iluminación permanecen estables.
Esta secuencia debe reproducirse una vez. Un bucle de ping-pong haría que la flor se cerrara de nuevo y añadiría movimiento que no forma parte de la floración prevista. Mantén las imágenes fijas en bruto junto al GIF final para que un revisor pueda aislar cualquier paso roto sin confundirlo con artefactos de compresión.
Pruebas repetidas independientes en otros lugares también han evaluado por separado el seguimiento del prompt y la consistencia, con resultados dependientes de la tarea. Sus rúbricas no proporcionan puntuaciones de animación para este artículo. (PromptFrenzy, consultado en septiembre de 2026.)
Reproduce el flujo de trabajo y calcula el costo real
- Abre el modelo y confirma la configuración.
Usa el playground de Sunburst para la primera solicitud y el playground de Flare para su solicitud emparejada. Selecciona max quality, 2048×1152, PNG y una imagen. Configura opaco para A, B, C y E; transparente para D.
La guía oficial de imágenes documenta max quality, dimensiones personalizadas y PNG o WebP para transparencia. Estos controles de salida no garantizan una lámina de fotogramas dividida uniformemente. (OpenAI, consultado en septiembre de 2026.)
Verifica los valores seleccionados después de salir de cada control. Conserva la cita y la configuración real de la solicitud. Las capturas de pantalla completadas a continuación están reservadas para resultados reales; una imagen de muestra de la página de un modelo no puede establecer que se ejecutó un experimento.
- Usa estos prompts sin reescribirlos entre modelos.
Prompt A: Saludo
plaintext1Create one 2048x1152 image containing exactly 16 consecutive animation frames arranged in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, or text. 2 3Show the same adult office worker seated at a plain wooden desk in every frame. They have short dark hair, a teal long-sleeved shirt, and no accessories. Use natural window light, a plain light-gray wall, and a locked eye-level medium camera shot. Keep the face, clothing, desk, background, lighting, and camera identical. 4 5Animate one greeting: frames 1-4 gradually raise the right hand from the desk; frames 5-10 show one small side-to-side wave; frames 11-15 gradually lower the hand; frame 16 returns to the resting pose. Keep the left hand on the desk. Preserve five fingers and the same sleeve length. The transition from frame 16 to frame 1 should be continuous. Advance the action by small readable increments.
Prompt B: Verter café
plaintext1Create one 2048x1152 image containing exactly 16 consecutive animation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, or text. 2 3Use a locked side-view close-up of a clear glass cup on a wooden kitchen counter. One adult hand holds a small stainless-steel coffee pot above and to the left of the cup. Use soft daylight and keep the camera, counter, cup, hand, and pot design unchanged. 4 5Frames 1-3 show the pot tilting toward the empty cup. Frames 4-11 show a continuous narrow stream of black coffee entering the cup while its liquid level rises progressively. Frames 12-14 show the pot returning upright and the stream stopping. Frames 15-16 show the cup half full and the upright pot held still. Keep the stream connected to the spout while pouring. Do not spill or change the cup shape. This is a one-way action, not a loop. The coffee must remain in the cup at the end.
Prompt C: Rotación de producto
plaintext1Create one 2048x1152 image containing exactly 16 consecutive product-rotation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, logos, or text. 2 3Show one unbranded white low-top canvas sneaker with six pairs of eyelets, white laces, a thin navy stripe around the rubber sole, and a small red fabric tab centered on the heel. Place it on a neutral light-gray seamless surface. 4 5Keep the camera locked at product height with a slight downward view. Rotate only the shoe around a fixed vertical axis. Frame 1 is the front view. Each following frame advances the rotation by 22.5 degrees in the same direction. Frame 16 is at 337.5 degrees so the next frame can return smoothly to frame 1. Keep the shoe scale, rotation center, materials, eyelets, sole stripe, heel tab, and lighting consistent. Reveal physically plausible side, rear, and opposite-side views.
Prompt D: Ciclo de caminata
plaintext1Create one 2048x1152 transparent PNG containing exactly 16 consecutive animation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, ground line, captions, numbers, or text. 2 3Show one full-body adult pedestrian in a clean, flat 2D game-prototype style, facing right in strict side view. The pedestrian has short black hair, a mustard jacket, navy trousers, and white shoes. Keep the character centered at the same horizontal position and the feet on the same baseline in every cell. Preserve the same character scale, clothing shapes, and colors. 4 5Create one complete in-place walking cycle. Frame 1 has the left foot forward at contact; frame 5 is a passing pose; frame 9 has the right foot forward at contact; frame 13 is the opposite passing pose. Fill all intervening frames with progressive motion. Frame 16 should lead naturally into frame 1 without repeating it. Keep the arms swinging opposite the legs and preserve left-right limb identity throughout.
Prompt E: Pedaleo
plaintext1Create one 2048x1152 image containing exactly 16 consecutive animation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, or text. 2 3Show a full-body adult cyclist on a plain stationary exercise bicycle in strict side view. The cyclist wears a blue short-sleeved shirt, black shorts, and white shoes. Use a light-gray studio background and a locked camera. Keep the bicycle frame, saddle, handlebars, rider identity, clothing, and lighting unchanged. 4 5Animate exactly one complete crank revolution. Start with the visible near-side pedal at the top. Advance the crank by 22.5 degrees per frame in one consistent direction. Keep the opposite pedal 180 degrees away. Each shoe must remain attached to its own pedal, with the knees and hips moving plausibly. Keep both hands on the handlebars. Frame 16 should connect naturally to frame 1. Do not swap the legs, detach the feet, or deform the bicycle.
- Extrae e inspecciona los archivos originales.
Guarda el PNG descargado, no la miniatura de la página. Usa el script local proporcionado:
plaintext1python slice-grid.py sheet.png --rows 4 --cols 4 --out frames --fps 8
Añade --once para el café. El script guarda PNG numerados, un GIF y un registro JSON de recortes. Comprueba las dimensiones reales y los valores alfa del registro, luego inspecciona cada recorte para detectar fragmentos de paneles vecinos. La división automática no valida los límites ilustrados.
El GIF almacena retrasos en centésimas de segundo, por lo que no puede codificar exactamente 125 ms en un solo retraso de fotograma. El asistente alterna 120 ms y 130 ms, manteniendo un total de dos segundos para 16 fotogramas. El registro revela esta cuantización; la secuencia PNG sigue disponible para una reproducción exacta de 8 fps en otro lugar.
- Separa el trabajo de corrección de la secuencia en bruto.
| Problema | Cómo identificarlo | Qué puede abordar el procesamiento local |
| Límites de panel desiguales | La imagen vecina entra en un recorte nominal | Recortes manuales separados, si existe contenido intacto |
| Deriva de anclaje o escala | Los puntos fijos de la escena se mueven entre celdas | Alineación medida en una versión de reparación etiquetada |
| Cambio de identidad o geometría | La ropa, las extremidades o la estructura del objeto cambian | El recorte no puede restaurar la estructura faltante |
| Fase de acción incorrecta | El orden de las poses se salta, invierte o repite | Los cambios de tiempo no pueden inventar movimiento ausente |
| Contradicción física | El líquido desaparece o los pies se separan | Requiere corrección de contenido más allá de la extracción en bruto |
Registra los minutos activos de recorte, temporización y reparaciones por separado. Conserva ambas versiones y describe cada operación. Una animación reparada puede ser adecuada para un proyecto, mientras que la lámina en bruto aún falla el benchmark.
- Calcula el costo a partir del uso medido.
Según la verificación del 15 de septiembre de 2026, el directorio de modelos mostró precios iniciales redondeados cercanos a $0.004 y $0.003 por imagen, con una etiqueta de 20% de descuento para ambos modelos. Estos son precios iniciales de catálogo. El ajuste max seleccionado necesita su propia cotización, y la liquidación basada en tokens puede diferir.
| Campo de costo | Sunburst | Flare |
| Configuración planificada | max, 2048×1152, PNG | max, 2048×1152, PNG |
| Cotización exacta de la configuración seleccionada | No medido | No medido |
| Total real facturado | No medido | No medido |
| Solicitudes base confirmadas enviadas | 0 | 0 |
| Láminas calificadas | No medido | No medido |
| Costo real de generación por lámina calificada | N/A | N/A |
| Trabajo de recorte / temporización / reparación | No medido | No medido |
Divide el costo real de generación facturado entre las láminas calificadas solo cuando ambas cantidades existan. Si ninguna lámina califica, indica N/A. Mantén la mano de obra por separado o aplica tu propia tarifa por hora explícitamente. Una multiplicación del precio inicial no puede establecer el costo de una animación utilizable.
Ejecuta el mismo prompt con tu propio sujeto después de comprobar una secuencia en bruto completa. Los Resultados finales de la prueba de animación estática de GPT Image 2.5 deben respaldar esa decisión con evidencia descargada; este borrador bloqueado por acceso aún no establece un resultado.
Preguntas frecuentes
¿Puede GPT Image 2.5 generar un GIF animado directamente?
Este flujo de trabajo solicita una lámina de fotogramas PNG y ensambla un GIF localmente. La configuración de salida de imagen no debe describirse como generación nativa de animación o video. Cada resultado de movimiento mostrado debe identificar su lámina de origen y su procesamiento, incluido el orden de reproducción y los retrasos.
¿Qué significa “animación estática” en esta prueba?
Significa generar fotogramas estáticos consecutivos dentro de una imagen, extraerlos y mostrarlos secuencialmente. Lo usamos como una descripción operativa. No nombra una característica oficial verificada del modelo, y una sola imagen de estilo animación no cumple la definición.
¿Es Flare o Sunburst mejor para fotogramas de animación consistentes?
La comparación no está resuelta porque no se han completado solicitudes base. Una vez disponibles, los resultados deben informarse tarea por tarea en las tres solicitudes. La identidad dentro de la lámina, la calidad de las transiciones y la coherencia física requieren inspección por separado; un solo ejemplo seleccionado no puede establecer un ganador general.
¿Por qué mi hoja de sprites se ve consistente pero tiembla al reproducirse?
Revisa los límites de los paneles, los anclajes del personaje, el cambio de escala, las fases de acción y las duraciones de los fotogramas. Imágenes fijas de aspecto similar pueden ocupar posiciones diferentes dentro de sus celdas. Conserva los recortes iguales originales mientras pruebas correcciones, para que puedas determinar si la alineación ayuda o si el movimiento fuente en sí necesita revisión.
¿Mejora GPT Image 2.5 a GPT Image 2 en este flujo de trabajo?
Este benchmark no incluye un control concurrente de GPT Image 2. Por lo tanto, no puede establecer un porcentaje de mejora, una ventaja de velocidad sobre ese modelo ni un costo menor de animación utilizable. Los experimentos externos usan diferentes prompts y configuraciones; proporcionan contexto en lugar de un grupo de control faltante.
¿Cuánto cuesta crear una animación utilizable?
Usa los cargos reales de cada solicitud enviada, incluidos los fallos facturados, más el trabajo necesario para inspeccionar y reparar la salida. Divide los cargos de generación entre el número que cumpla tu estándar de aceptación. Las cotizaciones de configuración exacta, la liquidación y los resultados utilizables no se miden aquí, por lo que ningún costo numérico por animación es defendible todavía.






