Observé tres tableros de Artificial Analysis durante diez minutos tratando de averiguar quién ganó realmente.
Texto a video: Gemini Omni Flash por 5 puntos. Imagen a video: Gemini por 2 puntos. Edición de video: MiniMax H3 por 9 puntos.
Luego miré la columna del intervalo de confianza. Más o menos 7. Más o menos 9. Más o menos 10.
Tres tableros, tres brechas, todas dentro de su propio margen de error. En votación ciega, estos dos modelos son el mismo modelo.
Así que cerré los tableros y abrí los menús desplegables. Esa brecha no son 5 puntos. Esa brecha es un nivel de resolución completo.
Conclusiones clave
- Las tres brechas de Artificial Analysis (+5, +2, +9, captura tomada el 6 de agosto de 2026) caen dentro de los intervalos de confianza de ±7 a ±10. En calidad bruta es un empate, no una victoria.
- H3 ofrece 2K, hasta 15 segundos y seis relaciones de aspecto. La API de Gemini Omni Flash tiene un tope de 720p, 10 segundos y dos relaciones de aspecto. Son valores de enumeración, no opiniones.
- H3 acepta audio como entrada. Gemini no. Gemini tiene
seedythinking_level. H3 no tiene ninguno. - Gemini tiene un endpoint dedicado
video-editque modifica tu clip original. La ruta de revisión de H3 esreference-to-video, que regenera usando tu clip como referencia. No son la misma operación, y la segunda ronda lo demuestra. - Solo uno de los dos tiene pesos descargables, y no es el de Google.

Ronda uno de la prueba MiniMax H3 vs Gemini Omni Flash, ambos modelos animando el mismo primer fotograma, mostrados lado a lado
Ronda uno: mismo primer fotograma, mismo prompt, misma duración. Izquierda MiniMax H3 a 2K, derecha Gemini Omni Flash a 720p. Mostrado aquí como un GIF silencioso; ambos archivos entregados incluyen audio nativo y ambos están incrustados como video reproducible más abajo. Este es el problema. Ambos son buenos.
Por qué se está interpretando mal la brecha en el tablero de MiniMax H3 vs Gemini Omni Flash
Casi todos los artículos sobre MiniMax H3 vs Gemini Omni Flash que encontrarás citan un tablero y un precio. Ambos hábitos llevan a la respuesta incorrecta.
Aquí están los tres tableros de Artificial Analysis, con la columna que todos omiten.
Tabla A: MiniMax H3 vs Gemini Omni Flash en tres tableros de Artificial Analysis (con audio), captura del 6 de agosto de 2026
| Tablero | Gemini Omni Flash | MiniMax H3 | Brecha | ¿Dentro de los márgenes de error? |
|---|---|---|---|---|
| Texto a video | 1,243 (#1) ±7, 11,842 votos | 1,238 (#2) ±9, 6,830 votos | Gemini +5 | Sí |
| Imagen a video | 1,191 (#2) ±9, 6,506 votos | 1,189 (#3) ±10, 5,545 votos | Gemini +2 | Sí |
| Edición de video | 1,123 (#2) ±5, 11,706 votos | 1,132 (#1) ±6, 9,128 votos | H3 +9 | Sí, por poco |
MiniMax H3 es uno de más de 30 modelos de video que puedes ejecutar lado a lado con el mismo prompt en la comparación de modelos de Atlas Cloud — con el costo por segundo mostrado antes de generar.
Puntuaciones Elo de la Video Arena de Artificial Analysis (Artificial Analysis, agosto de 2026). El líder de imagen a video es Dreamina Seedance 2.0 720p con 1,197, así que ninguno de estos dos ostenta esa corona. Son puntuaciones móviles de votación popular y cambian, que es exactamente por qué una brecha de 5 puntos no es un veredicto.
Una ventaja de 5 puntos con un intervalo de ±9 significa que el ranking podría cambiar la próxima semana solo por ruido en los votos. Eso no es "Gemini es mejor en texto a video". Es un cara o cruz con un marcador adjunto.
Tres cosas más que la gente entiende mal:
La columna de dólar por minuto no es lo que pagas. Artificial Analysis indica $6.00/min para Gemini y $7.80/min para H3. Esa columna normaliza al costo de un minuto de 1080p en configuraciones predeterminadas. Gemini Omni Flash no puede producir 1080p en absoluto. Así que el número es una estimación del modelo, no una factura. Compara entregables finales, no segundos.
Un tablero no es el modelo. H3 ocupa el segundo, tercer y primer lugar en los tres tableros. Gemini ocupa el primero, segundo y segundo. Cita solo uno y puedes probar lo que ya creías.
"Omni" no significa "se come cualquier cosa". Es un buen nombre y engañoso. Uno de estos dos acepta archivos de audio como entrada. No es el que tiene "omni" en el nombre.
La ficha técnica de MiniMax H3 vs Gemini Omni Flash que nadie imprime
Si las puntuaciones Elo no pueden separarlos, las tablas de restricciones pueden. Extraje los esquemas de entrada en vivo de ambos modelos en lugar de confiar en cualquier publicación de lanzamiento, y las diferencias no son sutiles.
Tabla B: Restricciones estrictas de MiniMax H3 vs Gemini Omni Flash, leídas de los esquemas de API en vivo el 6 de agosto de 2026
| Restricción | MiniMax H3 | Gemini Omni Flash |
|---|---|---|
| Resolución | 768P o 2K | 720p, y ese es el único valor en la enumeración |
| Duración | 4 a 15 segundos | 3 a 10 segundos |
| Relaciones de aspecto | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Solo 16:9 y 9:16 |
| Ruta de revisión | reference-to-video (regenera con referencias) | Endpoint dedicado video-edit (modifica tu origen) |
| Control del último fotograma | end_image compatible | No disponible |
| Límites de referencia | ≤9 imágenes, ≤3 videos, ≤3 audios, 12 archivos en total | 1 a 10 imágenes |
| Entrada de audio | Sí | No |
| Reproducibilidad de semilla | No | Sí |
| thinking_level | No | Sí (predeterminado / alto / bajo) |
| Pesos abiertos | Sí, en Hugging Face | No |
Lee esa tabla honestamente y Gemini gana tres filas de forma contundente. Las semillas reproducibles importan si estás construyendo un pipeline que tiene que renderizar el mismo fotograma dos veces. Un endpoint real video-edit es una herramienta genuinamente diferente de la regeneración condicionada por referencia. Y thinking_level te da un dial de calidad que H3 simplemente no expone.
H3 gana cinco filas, y son las filas que deciden si puedes entregar el archivo que el cliente pidió.
Ejecuté todo lo siguiente en Atlas Cloud porque ambos modelos se encuentran detrás del mismo endpoint /api/v1/model/generateVideo allí, lo que significó un bucle de sondeo y un encabezado de autenticación para toda la prueba. Cambiar de modelo fue un cambio en la cadena model. Ese detalle es la razón completa por la que "usa ambos" es una respuesta realista en lugar de una salida fácil.
Tabla C: lo que cuesta cada endpoint en esta prueba, verificado con la lista de precios en vivo del 6 de agosto de 2026
| Endpoint | Precio | Clip de 10 segundos de esta prueba |
|---|---|---|
| openai/gpt-image-2/text-to-image | $0.009 / imagen | $0.01 |
| minimax/h3/image-to-video | $0.14 / s | $1.40 |
| minimax/h3/reference-to-video | $0.14 / s | $1.40 |
| google/gemini-omni-flash/image-to-video | $0.13 / s | $1.30 |
| google/gemini-omni-flash/video-edit | $0.14 / s | $1.40 |
| google/gemini-omni-flash/text-to-video | $0.125 / s | no usado |
| minimax/h3/text-to-video | $0.14 / s | no usado |
Ninguno de los modelos tiene descuento este mes. Gemini también expone un nivel de desarrollador más barato ($0.112/s para texto a video e imagen a video, $0.12/s para referencia a video); H3 no tiene un nivel equivalente.
La línea de pesos abiertos que Gemini Omni Flash no puede cruzar. Los pesos de H3 están publicados en Hugging Face (MiniMax, agosto de 2026): un Transformer Omni denso de 33B de flujo único, más el codificador de texto Qwen3-VL-32B, un VAE visual y un VAE de audio. Dos advertencias importan más que el tamaño de descarga. Primero, lo que alojas tú mismo se ejecuta en un lado corto de 768 píxeles; la etapa de preprocesamiento Context-IR y el módulo Regenerate-2K no están en la versión, y la salida 2K proviene de esos dos. Segundo, la licencia comunitaria actualmente no cubre la UE, el Reino Unido, Corea del Sur ni los Estados Unidos, y hay un formulario de solicitud separado para esos territorios. Léelo antes de construir un producto sobre él. Gemini Omni Flash no tiene una conversación equivalente, porque no hay ningún archivo para descargar.
Esa posición de pesos abiertos, combinada con precios agresivos, es toda la historia estratégica del lanzamiento (South China Morning Post, agosto de 2026).
Realiza tú mismo la prueba de revisión MiniMax H3 vs Gemini Omni Flash
Aquí está la parte que nadie ha ejecutado. Todos comparan la primera generación. Nadie compara la segunda.
El trabajo real no es un solo prompt. El trabajo real es un clip que ya te gusta, más un cliente que responde "me encanta, ¿puede el letrero decir 24H y su delantal ser rojo?". Esa única oración es donde estos dos modelos dejan de ser intercambiables, y resulta ser exactamente la tarea que mide el tablero de edición de video.
La escena es deliberadamente cruel: un puesto de fideos empapado por la lluvia de noche, la vendedora hablando directamente a la lente, un letrero pintado a mano con palabras legibles detrás de ella, vapor del caldo, lluvia en el toldo. Un fotograma que exige sincronización de labios, estabilidad de texto en pantalla, movimiento fluido y audio ambiental en capas, todo a la vez.
Ambos modelos reciben el mismo primer fotograma, el mismo prompt y la misma nota de revisión. Cada ejecución a continuación es de 10 segundos, que es el techo de Gemini Omni Flash y está dentro del límite de H3.
Paso 1: Fijar el primer fotograma con GPT Image 2
Ambos modelos deben comenzar desde la misma imagen, de lo contrario la primera ronda mide la suerte en la composición y no el modelo. Abre el playground de GPT Image 2, establece la calidad en alta y la relación en 16:9, y pega esto:
Plain1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

Playground de GPT Image 2 en Atlas Cloud con el prompt del puesto de fideos a la izquierda y el primer fotograma generado en el panel de salida
GPT Image 2 en Atlas Cloud: el prompt a la izquierda, el primer fotograma compartido en OUTPUT. Costo de este paso, $0.009.

El primer fotograma generado: una mujer con delantal índigo detrás de un mostrador de fideos humeante por la noche bajo la lluvia, con un letrero pintado a mano que dice OPEN LATE brillando detrás de ella
La única entrada que recibieron ambos modelos. Observa las dos cosas que la revisión va a modificar: el letrero "OPEN LATE" y el delantal índigo. Generado con openai/gpt-image-2/text-to-image.
Paso 2: Ronda uno en MiniMax H3
Ve al playground de MiniMax H3, selecciona la tarea image-to-video, sube el fotograma del Paso 1, y establece resolution en 2K, duration en 10, ratio en adaptive (el enum de imagen a video solo ofrece adaptive). Prompt:
Plain1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

Playground de MiniMax H3 imagen a video en Atlas Cloud con resolución 2K seleccionada y el clip terminado reproduciéndose en el panel de salida
MiniMax H3 imagen a video en Atlas Cloud: 2K seleccionado, el clip terminado en OUTPUT. Esta captura se ejecutó con el valor predeterminado de 8 segundos del playground y costó $1.12; la versión de 10 segundos utilizada para la comparación está incrustada a continuación y costó $1.40.
MiniMax H3, ronda uno, 2K, 10 segundos. Activa el sonido: el diálogo, la lluvia y el caldo se generan en la misma pasada, no se superponen después.
Paso 3: Ronda uno en Gemini Omni Flash, mismo fotograma, mismas palabras
Abre el playground de Gemini Omni Flash, selecciona image-to-video, sube el mismo fotograma del Paso 1, y pega el prompt del Paso 2 sin cambiar un carácter. Configuración: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.
Dos cosas a tener en cuenta mientras estás en ese formulario, porque son el artículo en miniatura. El menú desplegable de resolution contiene exactamente una opción. El campo duration se detiene en 10. No elegí 720p por encima de algo mejor; no hay nada más que elegir.
Una nota sobre lo que falta aquí: no pude capturar una captura de pantalla del playground con la ejecución completada para ninguno de los pasos de Gemini. El entorno de prueba en el que tomo capturas devolvió 403 PERMISSION_DENIED del lado de Google en los tres intentos, así que las únicas capturas de Gemini que tengo muestran un panel OUTPUT fallido y no voy a disfrazar una como una ejecución exitosa. Los clips a continuación son reales, generados a través de la API de producción con la configuración indicada. Los dos pasos de H3 sí se capturaron limpiamente y esas capturas de pantalla son genuinas.
Gemini Omni Flash, ronda uno, 720p, 10 segundos, entradas idénticas. Reproduce esto justo después del clip de H3 de arriba y juzga el audio por ti mismo.
Paso 4: Ronda dos, enviar la revisión a Gemini Omni Flash
Esta es la ronda que importa. Cambia a la tarea video-edit en la misma página del modelo Gemini, sube el clip que el propio Gemini produjo en el Paso 3 como entrada video, establece resolution 720p y thinking_level high (una instrucción de edición en dos partes es exactamente el caso complejo para el que está diseñado ese dial). Pega esta nota exactamente como la enviaría un cliente:
Plain1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.
Gemini Omni Flash después de la nota de revisión. Observa el letrero, luego el delantal, y luego comprueba si se movió algo más.
Paso 5: Ronda dos, enviar la revisión idéntica a MiniMax H3
Aquí está la diferencia estructural honesta, y deberías saberlo antes de leer el resultado. H3 no tiene un endpoint video-edit. Su ruta de revisión es reference-to-video: le pasas el clip original como referencia y genera un nuevo video condicionado a esa referencia. No está editando tu archivo. Está creando uno nuevo que se supone debe parecerse al tuyo.
En la página de MiniMax H3, selecciona la tarea reference-to-video, agrega el clip que H3 produjo en el Paso 2 a refers como referencia de video, luego establece resolution 2K, duration 10, ratio adaptive. Pega el prompt del Paso 4 sin ninguna edición.
Este paso tampoco tiene captura de pantalla del playground, por una razón diferente y más aburrida: el navegador headless con el que capturo falló tres veces en el cargador de referencias al cargar una referencia de video. La ejecución en sí se realizó a través de la API sin problemas.
MiniMax H3 después de la nota de revisión idéntica, a través de reference-to-video a 2K.

Lado a lado de la ronda dos: el resultado de Gemini Omni Flash con video-edit junto al resultado de MiniMax H3 con reference-to-video, ambos a partir de la misma nota de revisión
Ronda dos lado a lado, GIF silencioso. Izquierda Gemini Omni Flash mediante video-edit, derecha MiniMax H3 mediante reference-to-video. Ambos tenían la misma oración para trabajar.
Lo que realmente sucedió en la ronda dos. Esperaba que H3 perdiera esta. La regeneración condicionada por referencia es un instrumento más burdo que un endpoint de edición real, y "regenera todo el clip y espera que aterrice en el mismo lugar" es exactamente cómo obtienes una cara diferente, una cámara que se desplaza y un cliente preguntando qué pasó con la toma.
Eso no es lo que regresó. Ambos modelos hicieron el trabajo, y ambos lo hicieron limpiamente.
El video-edit de Gemini se comportó exactamente como se anuncia. El letrero dice OPEN 24H con la misma letra pintada a mano, el mismo brillo ámbar y el mismo desgaste en la lata. El delantal es carmesí profundo. Todo lo demás está intacto: misma cara, misma expresión, mismo ángulo del cucharón, misma forma del vapor, misma lluvia, mismas luces traseras al fondo. Se lee como el archivo original con dos correcciones de píxeles, porque es esencialmente lo que es.
El reference-to-video de H3 produjo los mismos dos cambios y mantuvo la toma mucho mejor de lo que sugiere la arquitectura. Letrero cambiado, delantal cambiado, y en los 10 segundos completos, el encuadre, el vertido del caldo del cucharón, la columna de vapor y su rostro se mantuvieron fieles al clip de la ronda uno. Si hay desviación aquí, no pude encontrarla revisando fotograma por fotograma.
Así que la ronda dos es un tercer empate estadístico, y no voy a fingir lo contrario para hacer una historia más ordenada. Lo que separa las dos salidas no es la calidad de la edición. Es que H3 devolvió 2560x1440 con una pista estéreo de 32 kHz y Gemini devolvió 1280x720. Misma instrucción, mismo éxito, entregable diferente.
Una advertencia honesta sobre el método: esta es una sola revisión en una sola toma, no un estudio controlado. Un cambio de dos partes en un letrero y una prenda es una edición bastante amigable. Los casos más difíciles (eliminar un objeto que la cámara pasa, cambiar algo que el sujeto oculta, cuatro rondas de notas apiladas una sobre otra) son donde un endpoint de edición dedicado debería tomar la delantera, y donde la regeneración debería empezar a tambalearse. Ejecuta la tuya antes de decidir.
Tres divisiones más de MiniMax H3 vs Gemini Omni Flash que vale la pena probar
La ronda dos es la división que cambia una entrega. Tres más valen veinte minutos de tu propio crédito.
Aliméntalo con un archivo de audio. El reference-to-video de H3 acepta hasta tres clips de audio de 2 a 15 segundos cada uno, siempre que al menos una referencia de imagen o video los acompañe. Eso significa que puedes darle una grabación de voz real y hacer que el personaje la interprete. Gemini Omni Flash no tiene un campo de entrada de audio en ninguno de sus cuatro endpoints, por lo que esta comparación no se puede ejecutar en absoluto. Eso no es una pérdida de puntuación para Google; es una capacidad que simplemente no existe.
Pide 21:9. El enum de relación de reference-to-video de H3 contiene 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16. El enum de aspect_ratio de Gemini contiene 16:9 y 9:16. Si tu entregable es una secuencia de título panorámica o un corte social 1:1, uno de estos dos modelos no está en la conversación.
Fija una semilla y vuelve a ejecutar. Esta va en la dirección opuesta. Gemini expone seed; H3 no lo expone en ningún endpoint. Si estás construyendo un pipeline donde la misma solicitud debe devolver los mismos fotogramas el martes que devolvió el lunes, Gemini te da un mango y H3 no te da nada. Para pruebas de regresión, variantes de copia A/B, o cualquier granja de renderizado automatizada, esa es una ventaja real y pertenece al lado de Google en el libro mayor.
Lo que realmente cuesta una prueba de MiniMax H3 vs Gemini Omni Flash
Todo el experimento anterior, cuatro generaciones de video y una imagen, ascendió a aproximadamente $5.51. Un primer fotograma a $0.009, dos clips de ronda uno de 10 segundos a $1.40 y $1.30, dos clips de ronda dos de 10 segundos a $1.40 cada uno.
Por segundo, Gemini es más barato: $0.125 a $0.14 frente a $0.14 fijo para H3, aproximadamente un 7 a 11 por ciento menos dependiendo del endpoint. Ese número es cierto y también es casi inútil por sí solo.
He aquí por qué. Supón que el entregable es un opener cinematográfico de 15 segundos en 21:9 a 2K. H3 lo renderiza como un solo clip. Gemini no puede renderizarlo en absoluto: ni la resolución, ni la duración, ni la relación de aspecto. Tendrías que unir un clip de 10 segundos y uno de 5 segundos en 16:9, recortar para fingir la pantalla ancha y enviar 720p. El precio por segundo de algo que no puedes entregar no es un ahorro.
Dale la vuelta. Supón que el entregable es un corte social 16:9 que pasará por cuatro rondas de notas del cliente y debe volver byte-idéntico cuando el equipo legal pida renderizarlo de nuevo en tres semanas. El video-edit más seed de Gemini está construido exactamente para ese bucle, y cuesta menos por segundo mientras lo hace.
Tabla D: qué trabajo de MiniMax H3 vs Gemini Omni Flash va a dónde
| El trabajo que tienes delante | Envíalo a |
|---|---|
| Entrega en 2K | MiniMax H3 |
| Una sola toma de más de 10 segundos | MiniMax H3 |
| Encuadre 21:9, 4:3, 1:1 o 3:4 | MiniMax H3 |
| Introducir una pista de audio real | MiniMax H3 |
| Autoalojamiento en tus propias GPU | MiniMax H3 |
| Aterrizar en un fotograma final específico | MiniMax H3 |
| Revisiones conversacionales de múltiples rondas | Gemini Omni Flash |
| Preservar las partes no tocadas de un clip | Gemini Omni Flash |
| Renderizados reproducibles mediante semilla | Gemini Omni Flash |
| Formato corto 16:9 simple a la tarifa por segundo más baja | Gemini Omni Flash |
La conclusión de este artículo es esa tabla, no una puntuación. Si un punto de referencia no puede separar dos modelos por más de su propio margen de error, el punto de referencia te ha dicho todo lo que sabe, y la ficha técnica toma el control desde allí.
Para una visión más amplia de dónde se sitúa H3 frente al resto del campo, el desglose de alternativas a MiniMax H3 cubre los modelos que lo superan en los tableros que no lidera.
Preguntas frecuentes
¿Es MiniMax H3 mejor que Gemini Omni Flash?
La votación ciega no puede separarlos. En tres tableros de Artificial Analysis, las brechas son de 5, 2 y 9 puntos Elo, y cada una se encuentra dentro de un intervalo de confianza de ±7 a ±10. Elige por especificaciones, no por rango. El límite de resolución, el tope de duración y la lista de relaciones de aspecto cambiarán tu entregable; 5 puntos Elo no lo harán.
¿Cuál es más barato, MiniMax H3 o Gemini Omni Flash?
Por segundo, Gemini. En Atlas Cloud cuesta $0.125 a $0.14 por segundo frente a los $0.14 fijos de H3, con un nivel de desarrollador a $0.112 por segundo que H3 no tiene equivalente. Pero Gemini está limitado a 720p, 10 segundos y dos relaciones de aspecto, por lo que para muchos entregables no estás comparando el mismo producto. Ponle precio al corte finalizado, no al segundo.
¿Puede Gemini Omni Flash generar video en 1080p, 2K o 15 segundos?
No. Su parámetro de API resolution tiene un valor legal, 720p, y duration acepta de 3 a 10 segundos. MiniMax H3 ofrece 768P o 2K y de 4 a 15 segundos. Son restricciones de enumeración leídas del esquema en vivo el 6 de agosto de 2026, no una opinión editorial, y Google podría levantarlas más adelante.
¿Puedo autoalojar Gemini Omni Flash como puedo autoalojar MiniMax H3?
No. Los pesos de H3 están en Hugging Face y se ejecutan localmente con un lado corto de 768 píxeles. La etapa Context-IR y el módulo Regenerate-2K que producen la salida 2K no están en la versión y permanecen en el lado de la API. También verifica la licencia: actualmente no cubre la UE, el Reino Unido, Corea del Sur ni los EE. UU. sin una solicitud por separado.
¿Tengo que elegir solo uno?
No, y la tabla de división por trabajo de arriba es la mejor respuesta. Ambos modelos se encuentran detrás del mismo endpoint generateVideo en Atlas Cloud, por lo que ejecutar ambos significa un bucle de sondeo y una cadena model diferente, no dos integraciones. Enrutar por entregable supera a apostar por un tablero que se mueve cada semana.






