MiniMax H3 vs Gemini Omni Flash: Google gana el tablero por 5 puntos. Luego el cliente pide un cambio.

MiniMax H3 vs Gemini Omni Flash en tres tablas de clasificación, y las tres diferencias están dentro del margen de error. Así que ejecuté una prueba en ambos y luego envié la misma nota de revisión de vuelta.

Miré tres tableros de posiciones de Artificial Analysis durante diez minutos intentando averiguar quién ganó realmente.

Texto a video: Gemini Omni Flash por 5 puntos. Imagen a video: Gemini por 2 puntos. Edición de video: MiniMax H3 por 9 puntos.

Luego miré la columna del intervalo de confianza. Más o menos 7. Más o menos 9. Más o menos 10.

Tres tableros, tres diferencias, todas dentro de su propia barra de error. En votación ciega, estos dos modelos son el mismo modelo.

Así que cerré los tableros y abrí los menús desplegables. Esa diferencia no son 5 puntos. Esa diferencia es un nivel de resolución entero.

Conclusiones clave

  • Las tres diferencias de Artificial Analysis (+5, +2, +9, instantánea tomada el 6 de agosto de 2026) caen dentro de los intervalos de confianza de ±7 a ±10. En calidad bruta es un empate, no una victoria.
  • H3 ofrece 2K, hasta 15 segundos y seis relaciones de aspecto. La API de Gemini Omni Flash tiene un límite de 720p, 10 segundos y dos relaciones de aspecto. Son valores de enumeración, no opiniones.
  • H3 acepta audio como entrada. Gemini no. Gemini tiene seed y thinking_level. H3 no tiene ninguno.
  • Gemini tiene un endpoint dedicado video-edit que muta el clip de origen. El camino de revisión de H3 es reference-to-video, que regenera usando tu clip como referencia. No son la misma operación, y la segunda ronda lo demuestra.
  • Solo uno de los dos tiene pesos descargables, y no es el de Google.

Comparación lado a lado de una escena de puesto de comida nocturna en diferentes resoluciones

Primera ronda de la prueba MiniMax H3 vs Gemini Omni Flash, ambos modelos animando el mismo primer fotograma, mostrados lado a lado

Ronda uno: mismo primer fotograma, mismo prompt, misma duración. Izquierda: MiniMax H3 en 2K, derecha: Gemini Omni Flash en 720p. Se muestra aquí como un GIF silencioso; ambos archivos entregados llevan audio nativo y ambos están incrustados como video reproducible más abajo. Este es el problema. Ambos son buenos.


Por qué se está leyendo mal la diferencia en el tablero de posiciones entre MiniMax H3 y Gemini Omni Flash

Casi todas las publicaciones sobre MiniMax H3 vs Gemini Omni Flash que encontrarás citan un tablero de posiciones y un precio. Ambos hábitos producen la respuesta incorrecta.

Aquí están los tres tableros de Artificial Analysis, con la columna que todos omiten.

Tabla A: MiniMax H3 vs Gemini Omni Flash en tres tableros de posiciones de Artificial Analysis (con audio), instantánea del 6 de agosto de 2026

Tablero de posicionesGemini Omni FlashMiniMax H3Diferencia¿Dentro de las barras de error?
Texto a video1,243 (#1) ±7, 11,842 votos1,238 (#2) ±9, 6,830 votosGemini +5
Imagen a video1,191 (#2) ±9, 6,506 votos1,189 (#3) ±10, 5,545 votosGemini +2
Edición de video1,123 (#2) ±5, 11,706 votos1,132 (#1) ±6, 9,128 votosH3 +9Sí, por poco

Puntuaciones Elo del Video Arena de Artificial Analysis (Artificial Analysis, agosto de 2026). El liderato de imagen a video lo tiene Dreamina Seedance 2.0 720p con 1,197, así que ninguno de estos dos ostenta esa corona. Son puntuaciones de votación colectiva en movimiento, y por eso una diferencia de 5 puntos no es un veredicto.

Una ventaja de 5 puntos con un intervalo de ±9 significa que la clasificación podría cambiar la próxima semana solo por el ruido de los votos. Eso no es "Gemini es mejor en texto a video". Es una moneda al aire con un marcador adjunto.

Tres cosas más que la gente interpreta mal:

La columna de dólar por minuto no es lo que pagas. Artificial Analysis lista $6.00/min para Gemini y $7.80/min para H3. Esa columna normaliza el costo de un minuto de video 1080p en configuración predeterminada. Gemini Omni Flash no puede producir 1080p en absoluto. Así que el número es una estimación del modelo, no una factura. Compara entregables terminados, no segundos.

Un tablero no es el modelo. H3 ocupa el segundo, tercer y primer lugar en los tres tableros. Gemini ocupa el primero, segundo y segundo. Cita solo uno y puedes probar lo que ya creías.

"Omni" no significa "se come cualquier cosa". Es un buen nombre y engañoso. Uno de los dos acepta archivos de audio como entrada. No es el que tiene "omni" en el nombre.

La hoja de especificaciones de MiniMax H3 vs Gemini Omni Flash que nadie imprime

Si las puntuaciones Elo no pueden separarlos, las tablas de restricciones pueden hacerlo. Extraje los esquemas de entrada en vivo de ambos modelos en lugar de confiar en cualquier publicación de lanzamiento, y las diferencias no son sutiles.

Tabla B: Restricciones estrictas de MiniMax H3 vs Gemini Omni Flash, leídas de los esquemas de API en vivo el 6 de agosto de 2026

RestricciónMiniMax H3Gemini Omni Flash
Resolución768P o 2K720p, y ese es el único valor en la enumeración
Duración4 a 15 segundos3 a 10 segundos
Relaciones de aspecto21:9, 16:9, 4:3, 1:1, 3:4, 9:16Solo 16:9 y 9:16
Camino de revisiónreference-to-video (regenera con referencias)Endpoint dedicado video-edit (muta tu fuente)
Control del último fotogramaend_image compatibleNo disponible
Límites de referencia≤9 imágenes, ≤3 videos, ≤3 audios, 12 archivos en total1 a 10 imágenes
Entrada de audioNo
Reproducibilidad de seedNo
thinking_levelNoSí (predeterminado / alto / bajo)
Pesos abiertosSí, en Hugging FaceNo

Lee esa tabla honestamente y Gemini gana tres filas de forma clara. Las semillas reproducibles importan si estás construyendo un pipeline que debe renderizar el mismo fotograma dos veces. Un endpoint real video-edit es una herramienta genuinamente diferente de la regeneración condicionada por referencia. Y thinking_level te da un dial de calidad que H3 simplemente no expone.

H3 gana cinco filas, y son las filas que deciden si puedes entregar el archivo que el cliente pidió.

Ejecuté todo lo siguiente en Atlas Cloud porque ambos modelos están detrás del mismo endpoint /api/v1/model/generateVideo allí, lo que significó un bucle de sondeo y un encabezado de autenticación para toda la prueba. Cambiar de modelo era una modificación en la cadena model. Ese detalle es la razón por la que "usar ambos" es una respuesta realista y no una salida fácil.

Tabla C: lo que cuesta cada endpoint en esta prueba, verificado contra la lista de precios en vivo del 6 de agosto de 2026

EndpointPrecioClip de 10 segundos de esta prueba
openai/gpt-image-2/text-to-image$0.009 / imagen$0.01
minimax/h3/image-to-video$0.14 / s$1.40
minimax/h3/reference-to-video$0.14 / s$1.40
google/gemini-omni-flash/image-to-video$0.13 / s$1.30
google/gemini-omni-flash/video-edit$0.14 / s$1.40
google/gemini-omni-flash/text-to-video$0.125 / sno usado
minimax/h3/text-to-video$0.14 / sno usado

Ninguno de los modelos tiene descuento este mes. Gemini también expone un nivel de desarrollador más barato ($0.112/s para texto a video e imagen a video, $0.12/s para referencia a video); H3 no tiene un nivel equivalente.

La línea de pesos abiertos que Gemini Omni Flash no puede cruzar. Los pesos de H3 están publicados en Hugging Face (MiniMax, agosto de 2026): un Transformer Omni denso de flujo único de 33B, más el codificador de texto Qwen3-VL-32B, un VAE visual y un VAE de audio. Dos advertencias importan más que el tamaño de descarga. Primero, lo que autoalojas se ejecuta en un lado corto de 768 píxeles; la etapa de preprocesamiento Context-IR y el módulo Regenerate-2K no están en la versión, y la salida 2K proviene de esos dos. Segundo, la licencia comunitaria actualmente no cubre la UE, el Reino Unido, Corea del Sur o los Estados Unidos, y hay un formulario de solicitud separado para esos territorios. Léelo antes de construir un producto sobre él. Gemini Omni Flash no tiene una conversación equivalente, porque no hay ningún archivo para descargar.

Esa posición de pesos abiertos, junto con un precio agresivo, es toda la historia estratégica del lanzamiento (South China Morning Post, agosto de 2026).

Realiza tú mismo la prueba de revisión de MiniMax H3 vs Gemini Omni Flash

Aquí está la parte que nadie ha ejecutado. Todo el mundo compara la primera generación. Nadie compara la segunda.

El trabajo real no es un solo prompt. El trabajo real es un clip que ya te gusta, más un cliente que responde "me encanta, ¿puede el letrero decir 24H y puede su delantal ser rojo?". Esa única frase es donde estos dos modelos dejan de ser intercambiables, y resulta ser exactamente la tarea que mide el tablero de edición de video.

La escena es deliberadamente cruel: un puesto de fideos empapado por la lluvia por la noche, el vendedor hablando directamente a la cámara, un letrero pintado a mano con palabras legibles detrás, vapor saliendo del caldo, lluvia en el toldo. Un fotograma que estresa la sincronización de labios, la estabilidad del texto en pantalla, el movimiento fluido y el audio ambiental en capas todo a la vez.

Ambos modelos reciben el mismo primer fotograma, el mismo prompt y la misma nota de revisión. Cada ejecución a continuación es de 10 segundos, que es el límite de Gemini Omni Flash y está bien dentro del de H3.

Paso 1: Bloquear el primer fotograma con GPT Image 2

Ambos modelos deben comenzar desde la misma imagen, de lo contrario, la primera ronda mide la suerte de la composición en lugar del modelo. Abre el playground de GPT Image 2, establece la calidad en alta y la relación en 16:9, y pega esto:

Plain
1Escena fotorrealista de puesto de comida callejera nocturna bajo lluvia intensa, tomada con un objetivo de 35 mm a f/2.0. Una mujer de casi cuarenta años con un delantal de lona añil está detrás de un mostrador humeante de fideos, mirando directamente a la lente, a media frase. Detrás de ella, un letrero de hojalata pintado a mano con luz cálida ámbar que dice "OPEN LATE" en mayúsculas limpias y sans-serif en negrita. La lluvia corre a través de la luz de la farola de sodio, el vapor se eleva de la olla de caldo, el asfalto mojado refleja neones rojos y verdes del otro lado de la calle. Profundidad de campo reducida, solo iluminación práctica, ligera neblina de lente, textura de piel natural, sin texto en ningún otro lugar del encuadre. 16:9.

Interfaz de generador de imágenes por IA mostrando un prompt y la imagen generada

Playground de GPT Image 2 en Atlas Cloud con el prompt del puesto de fideos a la izquierda y el primer fotograma generado en el panel de salida

GPT Image 2 en Atlas Cloud: el prompt a la izquierda, el primer fotograma compartido en OUTPUT. Coste de este paso, $0.009.

Una mujer está en un puesto de comida callejera humeante por la noche

El primer fotograma generado: una mujer con delantal añil detrás de un mostrador de fideos humeante por la noche bajo la lluvia, con un letrero pintado a mano que dice OPEN LATE brillando detrás de ella

La única entrada que recibieron ambos modelos. Nótese las dos cosas que la revisión modificará: el letrero "OPEN LATE" y el delantal añil. Generado con openai/gpt-image-2/text-to-image.

Paso 2: Primera ronda en MiniMax H3

Ve al playground de MiniMax H3, selecciona la tarea image-to-video, sube el fotograma del Paso 1, y establece resolution en 2K, duration en 10, ratio en adaptive (la enumeración de image-to-video solo ofrece adaptive). Prompt:

Plain
1La vendedora mira a la lente y dice, con voz cálida y cansada: "El caldo lleva desde las cuatro de la mañana. Siéntate, todavía está lloviendo". Levanta el cucharón mientras habla. El vapor se enrosca a través del encuadre. La lluvia sigue cayendo sobre el toldo detrás de ella. La cámara se mantiene quieta, sin avance ni paneo. Audio ambiente: lluvia sobre lona, caldo hirviendo a fuego lento, tráfico distante, su voz cercana y seca.

Interfaz de generación de video por IA mostrando entrada de texto prompt y salida de video

Playground de MiniMax H3 image-to-video en Atlas Cloud con resolución 2K seleccionada y el clip terminado reproduciéndose en el panel de salida

MiniMax H3 image-to-video en Atlas Cloud: 2K seleccionado, el clip terminado en OUTPUT. Esta captura se ejecutó con el valor predeterminado de 8 segundos del playground y costó $1.12; la versión de 10 segundos utilizada para la comparación está incrustada abajo y costó $1.40.

MiniMax H3, primera ronda, 2K, 10 segundos. Sonido activado: el diálogo, la lluvia y el caldo se generan en la misma pasada, no se superponen después.

Paso 3: Primera ronda en Gemini Omni Flash, mismo fotograma, mismas palabras

Abre el playground de Gemini Omni Flash, selecciona image-to-video, sube el mismo fotograma del Paso 1, y pega el prompt del Paso 2 sin cambiar un carácter. Configuración: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level predeterminado, seed -1.

Dos cosas a tener en cuenta mientras estás en ese formulario, porque son el artículo en miniatura. El menú desplegable resolution contiene exactamente una opción. El campo duration se detiene en 10. No elegí 720p sobre algo mejor; no hay nada más que elegir.

Una nota sobre lo que falta aquí: no pude capturar una captura de pantalla del playground con la ejecución completada para ninguno de los pasos de Gemini. El entorno de staging donde tomo capturas de pantalla devolvió 403 PERMISSION_DENIED del lado de Google en los tres intentos, por lo que las únicas capturas de Gemini que tengo muestran un panel de OUTPUT fallido y no voy a disfrazar una como una ejecución exitosa. Los clips de abajo son reales, generados a través de la API de producción con la configuración indicada anteriormente. Los dos pasos de H3 se capturaron limpiamente y esas capturas de pantalla son genuinas.

Gemini Omni Flash, primera ronda, 720p, 10 segundos, entradas idénticas. Reproduce esto justo después del clip de H3 de arriba y juzga el audio por ti mismo.

Paso 4: Segunda ronda, enviar la revisión a Gemini Omni Flash

Esta es la ronda que importa. Cambia a la tarea video-edit en la misma página del modelo Gemini, sube el clip que el propio Gemini produjo en el Paso 3 como entrada video, establece resolution 720p y thinking_level alto (una instrucción de edición en dos partes es exactamente el caso complejo para el que está diseñado ese dial). Pega esta nota exactamente como la enviaría un cliente:

Plain
1Mantén esta misma toma: misma posición de cámara, misma mujer, misma cara, misma lluvia, misma iluminación, mismo audio. Cambia el letrero pintado a mano para que diga "OPEN 24H" en lugar de "OPEN LATE", en el mismo estilo pintado y el mismo resplandor ámbar. Cambia su delantal de azul añil a carmesí intenso. No cambies nada más en el encuadre.

Gemini Omni Flash después de la nota de revisión. Observa el letrero, luego el delantal, y luego comprueba si se movió algo más.

Paso 5: Segunda ronda, enviar la revisión idéntica a MiniMax H3

Aquí está la diferencia estructural honesta, y debes conocerla antes de leer el resultado. H3 no tiene un endpoint video-edit. Su camino de revisión es reference-to-video: le entregas el clip original como referencia y genera un nuevo video condicionado a esa referencia. No está editando tu archivo. Está haciendo uno nuevo que se supone que se parece al tuyo.

En la página de MiniMax H3, selecciona la tarea reference-to-video, agrega el clip que H3 produjo en el Paso 2 a refers como referencia de video, luego establece resolution 2K, duration 10, ratio adaptive. Pega el prompt del Paso 4 sin ninguna edición.

Este paso tampoco tiene captura de pantalla del playground, por una razón diferente y más aburrida: el navegador sin cabeza con el que capturo se bloqueó tres veces en el cargador de referencias al cargar una referencia de video. La ejecución en sí se realizó a través de la API sin problemas.

MiniMax H3 después de la nota de revisión idéntica, a través de reference-to-video en 2K.

Comparación de una mujer cocinando en un puesto de comida nocturna bajo la lluvia

Lado a lado de la segunda ronda: el resultado de video-edit de Gemini Omni Flash junto al resultado de reference-to-video de MiniMax H3, ambos a partir de la misma nota de revisión

Segunda ronda lado a lado, GIF silencioso. Izquierda: Gemini Omni Flash mediante video-edit, derecha: MiniMax H3 mediante reference-to-video. Ambos partieron de la misma frase.

Lo que realmente sucedió en la segunda ronda. Esperaba que H3 perdiera esta. La regeneración condicionada por referencia es un instrumento más contundente que un endpoint de edición real, y "regenera todo el clip y espera que aterrice en el mismo lugar" es exactamente como se obtiene una cara diferente, una cámara a la deriva y un cliente preguntando qué pasó con la toma.

Eso no es lo que regresó. Ambos modelos hicieron el trabajo, y ambos lo hicieron limpiamente.

El video-edit de Gemini se comportó exactamente como se anunciaba. El letrero dice OPEN 24H en la misma letra pintada a mano, con el mismo resplandor ámbar y el mismo desgaste en la hojalata. El delantal es carmesí intenso. Todo lo demás está intacto: misma cara, misma expresión, mismo ángulo del cucharón, misma forma del vapor, misma lluvia, mismas luces traseras al fondo. Se lee como el archivo original con dos correcciones de píxeles de profundidad, porque esencialmente es eso.

El reference-to-video de H3 produjo los mismos dos cambios y mantuvo la toma mucho mejor de lo que sugiere la arquitectura. Letrero cambiado, delantal cambiado, y a lo largo de los 10 segundos, el encuadre, el vertido del caldo del cucharón, la pluma de vapor y su rostro se mantuvieron en modelo con respecto al clip de la primera ronda. Si hay deriva aquí, no pude encontrarla al avanzar fotograma a fotograma.

Por lo tanto, la segunda ronda es un tercer empate estadístico, y no voy a fingir lo contrario para hacer una historia más ordenada. Lo que separa las dos salidas no es la calidad de la edición. Es que H3 devolvió 2560x1440 con una pista estéreo de 32 kHz y Gemini devolvió 1280x720. Misma instrucción, mismo éxito, entregable diferente.

Una advertencia honesta sobre el método: esta es una sola revisión en una sola toma, no un estudio controlado. Un cambio de dos partes en un letrero y una prenda es una edición bastante amigable. Los casos más difíciles (eliminar un objeto que la cámara pasa, cambiar algo que el sujeto ocluye, cuatro rondas de notas apiladas una sobre otra) son donde un endpoint de edición dedicado debería tomar la delantera, y donde la regeneración debería comenzar a tambalearse. Ejecuta la tuya antes de decidir.

Tres divisiones más de MiniMax H3 vs Gemini Omni Flash que vale la pena probar

La segunda ronda es la división que cambia una entrega. Tres más merecen veinte minutos de tu propio crédito.

Aliméntalo con un archivo de audio. El reference-to-video de H3 acepta hasta tres clips de audio de 2 a 15 segundos cada uno, siempre que venga al menos una referencia de imagen o video. Eso significa que puedes entregarle una grabación de voz real y hacer que el personaje la interprete. Gemini Omni Flash no tiene un campo de entrada de audio en ninguno de sus cuatro endpoints, por lo que esta comparación no se puede ejecutar en absoluto. No es una pérdida de puntuación para Google; es una capacidad que simplemente está ausente.

Pide 21:9. La enumeración de ratio de reference-to-video de H3 contiene 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16. La enumeración de aspect_ratio de Gemini contiene 16:9 y 9:16. Si tu entregable es una secuencia de título panorámica o un corte social 1:1, uno de estos dos modelos no está en la conversación.

Fija una semilla y vuelve a ejecutar. Esta va en la otra dirección. Gemini expone seed; H3 no lo expone en ningún endpoint. Si estás construyendo un pipeline donde la misma solicitud debe devolver los mismos fotogramas el martes que devolvió el lunes, Gemini te da un mango y H3 no te da nada. Para pruebas de regresión, variantes de copia A/B o cualquier granja de renderizado automatizada, esa es una ventaja real y pertenece al lado de Google en el libro mayor.

Lo que realmente cuesta una prueba de MiniMax H3 vs Gemini Omni Flash

Todo el experimento anterior, cuatro generaciones de video y una imagen, ascendió a aproximadamente $5.51. Un primer fotograma a $0.009, dos clips de primera ronda de 10 segundos a $1.40 y $1.30, dos clips de segunda ronda de 10 segundos a $1.40 cada uno.

Por segundo, Gemini es más barato: $0.125 a $0.14 contra un fijo de $0.14 para H3, aproximadamente un 7 a 11 por ciento menos dependiendo del endpoint. Ese número es cierto y también es casi inútil por sí solo.

He aquí por qué. Supongamos que el entregable es una apertura cinematográfica de 15 segundos en 21:9 a 2K. H3 lo renderiza como un solo clip. Gemini no puede renderizarlo en absoluto: ni la resolución, ni la duración, ni la relación de aspecto. Tendrías que unir un clip de 10 segundos y uno de 5 segundos en 16:9, recortar para fingir la pantalla ancha y enviar 720p. El precio por segundo de algo que no puedes entregar no es un ahorro.

Dale la vuelta. Supongamos que el entregable es un corte social 16:9 que pasará por cuatro rondas de notas del cliente y tiene que volver idéntico byte a byte cuando el equipo legal pida re-renderizarlo en tres semanas. El video-edit más seed de Gemini está construido exactamente para ese bucle, y cuesta menos por segundo mientras lo hace.

Tabla D: qué trabajo de MiniMax H3 vs Gemini Omni Flash va a dónde

El trabajo que tienes delanteEnviarlo a
Entrega en 2KMiniMax H3
Una sola toma de más de 10 segundosMiniMax H3
Encuadre 21:9, 4:3, 1:1 o 3:4MiniMax H3
Alimentar una pista de audio realMiniMax H3
Autoalojamiento en tus propias GPUsMiniMax H3
Aterrizar en un último fotograma específicoMiniMax H3
Revisiones conversacionales de múltiples rondasGemini Omni Flash
Preservar las partes no tocadas de un clipGemini Omni Flash
Renderizados reproducibles mediante semillaGemini Omni Flash
Formato corto 16:9 simple a la tarifa por segundo más bajaGemini Omni Flash

La conclusión de este artículo es esa tabla, no una puntuación. Si un punto de referencia no puede separar dos modelos por más de su propia barra de error, el punto de referencia te ha dicho todo lo que sabe, y la hoja de especificaciones toma el relevo desde allí.

Para una visión más amplia de dónde se sitúa H3 frente al resto del campo, el desglose de alternativas a MiniMax H3 cubre los modelos que lo superan en los tableros que no lidera.

Preguntas frecuentes

¿Es MiniMax H3 mejor que Gemini Omni Flash?

La votación ciega no puede separarlos. En tres tableros de posiciones de Artificial Analysis, las diferencias son de 5, 2 y 9 puntos Elo, y cada una se encuentra dentro de un intervalo de confianza de ±7 a ±10. Elige según las especificaciones, no por el rango. El límite de resolución, el tope de duración y la lista de relaciones de aspecto cambiarán tu entregable; 5 puntos Elo no lo harán.

¿Cuál es más barato, MiniMax H3 o Gemini Omni Flash?

Por segundo, Gemini. En Atlas Cloud cuesta de $0.125 a $0.14 por segundo frente a los $0.14 fijos de H3, con un nivel de desarrollador a $0.112 por segundo del cual H3 no tiene equivalente. Pero Gemini tiene un límite de 720p, 10 segundos y dos relaciones de aspecto, por lo que para muchos entregables no estás comparando el mismo producto. Pon precio al corte final, no al segundo.

¿Puede Gemini Omni Flash generar video 1080p, 2K o de 15 segundos?

No. Su parámetro resolution de la API tiene un valor legal, 720p, y duration acepta de 3 a 10 segundos. MiniMax H3 ofrece 768P o 2K y de 4 a 15 segundos. Estas son restricciones de enumeración leídas del esquema en vivo el 6 de agosto de 2026, no una opinión editorial, y Google puede levantarlas más adelante.

¿Puedo autoalojar Gemini Omni Flash de la misma manera que puedo autoalojar MiniMax H3?

No. Los pesos de H3 están en Hugging Face y se ejecutan localmente con un lado corto de 768 píxeles. La etapa Context-IR y el módulo Regenerate-2K que producen la salida 2K no están en la versión y permanecen del lado de la API. También verifica la licencia: actualmente no cubre la UE, el Reino Unido, Corea del Sur o los EE. UU. sin una solicitud separada.

¿Tengo que elegir solo uno?

No, y la tabla de división por trabajo anterior es la mejor respuesta. Ambos modelos están detrás del mismo endpoint generateVideo en Atlas Cloud, por lo que ejecutar ambos significa un bucle de sondeo y una cadena model diferente, no dos integraciones. Enrutar según el entregable supera a apostar por un tablero de posiciones que se mueve cada semana.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos