MiniMax H3 2K vs 768P: Ejecuté el mismo prompt dos veces y obtuve dos películas diferentes

Medido el 2026-08-05: MiniMax H3 2K vs 768P devuelve 1344x768 vs 2560x1440 a $0.40 vs $0.56\. Por qué el borrador barato no es una vista previa de tu final, y la solución.

Dos fotos impresas de botellas de cold brew sobre una mesa de madera

Dos impresiones de la misma toma de botella de cold brew sobre una barra de café, una suave y otra nítida, con un recibo entre ellas

Dos impresiones de la misma toma, una suave y otra nítida. En MiniMax H3, esa brecha no es un control deslizante de calidad. Generado con openai/gpt-image-2/text-to-image.

Envié el mismo prompt dos veces. Lo único que cambié fue un menú desplegable: 768P, luego 2K.

La primera ejecución costó $0.40 y regresó en 130 segundos. La segunda costó $0.56 y tomó 181 segundos. Luego puse los dos fotogramas lado a lado y algo no cuadraba. La botella seguía ahí. La etiqueta seguía ahí, con su letra pequeña y todo. Pero la barra había cambiado de madera cálida a piedra pálida, había aparecido un estante en el fondo detrás del barista, la condensación en el vidrio se había multiplicado de repente y la luz había cambiado de color.

No había ahorrado dinero en un borrador. Había disparado dos películas diferentes.

Esto no es un error. Es lo que realmente significa "2K" en H3, y una vez que lo entiendes, el consejo estándar que todos dan —borrador barato y final caro— se desmorona en silencio. A continuación, todos los números de esa prueba, más el único cambio que hace que el borrador barato funcione.

Conclusiones clave (todas las cifras medidas en Atlas Cloud, 2026-08-05)

  • 768P entregó 1344x768, 2K entregó 2560x1440 en una solicitud 16:9. Eso es 3.6 veces los píxeles y 3.6 veces la tasa de bits de video.
  • La facturación fue $0.40 vs $0.56 para un clip de 4 segundos, es decir, $0.10/s vs $0.14/s. 768P es un 29% más barato por segundo, no la mitad del precio.
  • 768P regresó un 28% más rápido en el par texto-a-video (130s vs 181s) y un 17% más rápido en el par imagen-a-video (194s vs 234s).
  • Texto-a-video a 768P y 2K con el mismo prompt produjeron dos tomas diferentes, no dos calidades de una misma toma. Un borrador en 768P no previsualiza tu final en 2K.
  • Bloquea el primer fotograma con imagen-a-video y la deriva se detiene. Mismo escenario, mismo encuadre, misma posición de la etiqueta, y 2K gasta sus píxeles extra exactamente donde MiniMax dice: en la letra pequeña.
  • 768P no está restringido. Ambos niveles están activos en el enumerado de resolución y seleccionables en el menú desplegable a partir del 2026-08-05, sin importar lo que aún digan los resúmenes antiguos.

MiniMax H3 2K vs 768P: ¿Sigue 768P en beta cerrada?

No, y vale la pena aclararlo de una vez porque se sigue repitiendo en muchos resúmenes de precios escritos en los días posteriores al lanzamiento.

Hoy extraje el esquema de entrada en vivo para los tres endpoints de H3. El campo resolution indica enum: ["768P", "2K"] con default: "2K" tanto en texto-a-video, imagen-a-video como referencia-a-video, y duration recorre cada segundo completo de 4 a 15 en los tres. Sin bandera, sin puerta, sin formulario de ventas. Luego envié un trabajo en 768P a dos endpoints diferentes y ambos se completaron y facturaron a la tarifa más baja. Si una página te dice que contactes con ventas para 768P, esa página describe la primera semana del lanzamiento, no esta semana.

MiniMax H3 2K vs 768P, mismo prompt, lado a lado

Izquierda es 768P. Derecha es 2K. Mismo prompt, misma duration=4, misma ratio=16:9, enviados consecutivamente a minimax/h3/text-to-video.

Comparación lado a lado de resolución de imagen mostrando una botella de cold brew

MiniMax H3 2K vs 768P en pantalla dividida desde el mismo prompt de texto-a-video, con resolución, precio y tiempo real incrustados

Mismo prompt, dos ejecuciones. Izquierda: 768P, 1344x768, $0.40, 130s. Derecha: 2K, 2560x1440, $0.56, 181s. Mostrado como GIF silencioso; ambos archivos entregados llevan audio estéreo de 32 kHz. Medido en Atlas Cloud, 2026-08-05.

Mira lo que realmente difiere. No es nitidez. Es la película. Diferente material de la barra, diferente decoración de fondo, diferente cantidad de condensación, diferente altura de cámara, diferente temperatura de color, y la etiqueta se sitúa en un punto diferente de la botella. Nada en el prompt pedía que nada de eso cambiara.

Ahora la parte que todo el mundo asume que va al revés. Aquí está el área de la etiqueta de ambas tomas, recortada de los archivos nativos y ampliada al mismo ancho, de modo que el recorte de 768P está más aumentado que el de 2K.

Comparación de resolución 768p y 2K en una etiqueta de cold brew

Comparación de recorte de etiqueta entre las tomas MiniMax H3 768P y 2K, ambas mostrando la línea de ingredientes pequeños legible

La línea pequeña "single origin ethiopia guji / 250ml / roasted 04.08.2026" sobrevive a 768P. Es más suave y el espaciado de letras titubea, pero nada es ilegible. El verdadero costo de 768P aquí no fue el texto borroso, sino una composición diferente.

Por lo tanto, el encuadre honesto de MiniMax H3 2K vs 768P no es "nítido versus borroso". Es "esta toma versus una toma diferente, más un pase de detalle encima".

La ficha técnica de MiniMax H3 2K vs 768P, medida

Todo en esta tabla proviene de ffmpeg -i en los archivos entregados y del campo price en la predicción finalizada, no de una página de documentación.

Medido en el archivo entregado768P2KProporción
Resolución entregada (solicitud 16:9)1344x7682560x14403.6x píxeles
Tasa de bits de video998 kb/s3,624 kb/s3.6x
Tamaño de archivo, clip de 4.46s620 KB2.00 MB3.3x
Fotogramas por segundo24 fps24 fpsigual
Pista de audioAAC estéreo, 32,000 Hz, 131 kb/sAAC estéreo, 32,000 Hz, 127 kb/sigual
Duración del contenedor para duration=44.46s4.46sigual
Desde envío hasta completado, tiempo real130s181s1.39x
Facturado realmente$0.40$0.561.4x
Tarifa efectiva$0.10/s$0.14/s29% más barato

Dos notas al pie que me costaron dinero aprender. Primero, ambos niveles entregaron 4.46 segundos para una solicitud duration=4 y ambos facturaron 4 segundos, por lo que obtienes los 0.46s extra gratis, pero no puedes planificar un corte alrededor de ellos. Segundo, el audio es idéntico en todos los niveles. Si tu clip se basa en diálogo o sincronización musical, 2K no te compra nada en lo que realmente importa.

Por qué MiniMax H3 2K vs 768P confunde a todos

Porque 2K en H3 no es un paso de escalado. Es una segunda generación.

MiniMax describe el mecanismo directamente: "Para la salida 2K de H3, en lugar de usar un módulo de superresolución dedicado convencional, hacemos que el modelo base H3 regenere su propia salida de baja resolución en contexto." También explican por qué lo construyeron así: el enfoque en contexto "le permite recurrir nuevamente al contexto multimodal original para producir una salida de alta resolución, recuperando detalles que la superresolución tradicional solo puede 'adivinar' y a menudo no puede restaurar, como texto pequeño y detalles finos" (MiniMax, julio 2026).

Vuelve a leer eso con mentalidad de producción. El pase 2K vuelve a tu contexto original y genera de nuevo. Cuando tu contexto no es más que un prompt de texto, "generar de nuevo" significa "tirar los dados otra vez". Eso es exactamente lo que muestran mis dos tomas. Al modelo nunca se le pidió que reprodujera la versión 768P, porque nunca vio la versión 768P.

Tres formas en que esto afecta en la práctica:

  1. Haces borradores baratos a 768P en texto-a-video, eliges un ganador, luego lo vuelves a ejecutar a 2K. Obtienes un extraño de vuelta. El prompt se respeta, la película es nueva. Esa es la prueba al principio de esta página.
  2. Presupuestes como si un 29% más barato por segundo significara un 29% más barato. No es así, porque los finales son la parte cara de cualquier lote real, y un solo re-rodaje fallido en 2K borra el ahorro de varios borradores.
  3. Asumes que la ruta de actualización barata está ahí en algún lugar. Hoy revisé el catálogo completo en Atlas Cloud: 452 modelos, tres endpoints de H3, y ningún endpoint de regeneración de H3 entre ellos. Donde solo se exponen los tres endpoints de generación, "mejorar este clip a 2K" significa volver a generarlo o ejecutar un escalador separado sobre él. Ambas opciones cuestan dinero, y no compran lo mismo.

Vale la pena decir por qué siquiera vale la pena diseñar alrededor de este modelo en lugar de cambiarlo. La oferta principal en el lanzamiento fue video "a resolución de hasta 2K, en clips de hasta 15 segundos, con audio estéreo nativo" (DataNorth AI, agosto 2026), y las puntuaciones lo respaldaban: H3 se sitúa actualmente en la cima del tablero Elo de edición de video de Artificial Analysis con 1,130, por delante de Gemini Omni Flash con 1,122 y 93 puntos por encima de Dreamina Seedance 2.0 720p con 1,037 (Artificial Analysis, agosto 2026). La calidad merece un flujo de trabajo. El flujo de trabajo solo tiene que respetar cómo se produce 2K.

Los cuatro modelos detrás de esta prueba MiniMax H3 2K vs 768P, en una pestaña

Toda la prueba son cuatro modelos, una clave API, una factura. La ejecuté en Atlas Cloud porque cambiar entre un modelo de imagen, dos endpoints de H3 y un escalador de otro modo significa tres cuentas y tres facturas que conciliar a fin de mes.

Trabajo en esta pruebaModeloPrecio a agosto de 2026Lo que realmente pagué
Bloquear el primer fotogramaopenai/gpt-image-2/text-to-imagedesde $0.009/imagen (niveles de token por encima)$0.1745 por una 2048x1152 en calidad alta
Borrador y final, fotograma bloqueadominimax/h3/image-to-video$0.14/s a 2K, $0.10/s a 768P$0.40 y $0.56 por 4s cada uno
Par de control sin bloqueominimax/h3/text-to-videolos mismos dos niveles$0.40 y $0.56 por 4s cada uno
Mantener la toma, subir los píxelesatlascloud/video-upscaler$0.018/s a 1080p, $0.024/s a 2K, mínimo 5s$0.12 por el clip de 4.46s

Dos notas antes de que copies los números. Los endpoints de H3 publican una única tarifa principal de $0.14/s, que es el nivel 2K; la tarifa 768P aparece en la factura, no en la lista, así que mídela una vez tú mismo. Y ninguno de estos cuatro modelos tiene descuento ahora mismo. Si quieres recortar el paso de bloqueo de fotograma, openai/gpt-image-2-developer/text-to-image tiene un 50% de descuento ($0.004 desde $0.009) a agosto de 2026, y es la misma familia haciendo el mismo trabajo.

Cómo ejecutar la prueba MiniMax H3 2K vs 768P tú mismo

Cinco pasos, $2.21 de crédito y unos 15 minutos de tiempo total. Cada prompt a continuación es la cadena exacta que envié.

Tres notas de parámetros primero, porque cada una puede costarte silenciosamente una ejecución:

  • En texto-a-video, el campo es ratio, no aspect_ratio, su valor predeterminado es 1:1, y su enumerado no tiene opción adaptive. Pasa 16:9 tú mismo o obtienes un clip cuadrado. En imagen-a-video, el enumerado es solo adaptive, porque tu primer fotograma decide la forma.
  • Envía siempre duration explícitamente en lugar de confiar en el valor predeterminado documentado de 8. Lo que se te factura sigue lo que se entrega, no lo que asumiste.
  • Cada trabajo de H3 supera un tiempo de espera en línea normal, así que envíalo de forma asíncrona y consulta. El campo price también se completa tarde: cuando status cambia a completed a menudo aún está vacío, y tienes que consultar el id de predicción una vez más para obtener el número real. Sin esa segunda consulta, no puedes construir una tabla de costos honesta.

Paso 1: Bloquear el fotograma con GPT Image 2

Este es el paso que convierte un borrador en una vista previa en lugar de un billete de lotería. Genera la composición finalizada como una imagen fija, y se convierte en la parte inamovible de ambas ejecuciones de video.

text
1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9.
2

Configuración: calidad high, tamaño 2048x1152. No economices aquí. Cada detalle que quieras que el pase 2K proteja debe existir primero en este fotograma.

Una botella de café cold brew Northbound sobre una barra de café

El primer fotograma bloqueado generado con GPT Image 2 a 2048x1152, mostrando la botella de cold brew y su letra pequeña legible

Generado con openai/gpt-image-2/text-to-image, calidad alta, 2048x1152. Facturado $0.1745, de vuelta en 146s.

Captura de pantalla de una interfaz de generador de imágenes AI con pasos numerados

Área de juegos de GPT Image 2 en Atlas Cloud con el prompt del fotograma completado y la botella generada en el panel de salida

GPT Image 2 en Atlas Cloud: calidad ajustada a alta, 16:9, el fotograma bloqueado renderizado a la derecha.

Paso 2: Hacer un borrador a 768P

El mismo endpoint que usarás para el final. Solo la resolución difiere entre este paso y el paso 4.

text
1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake.
2

Configuración en minimax/h3/image-to-video: primer fotograma = tu salida del paso 1, resolution=768P, duration=4, ratio=adaptive.

Una botella de café cold brew Northbound sobre una barra de café

El clip borrador MiniMax H3 768P, un lento dolly-in macro sobre la botella de cold brew

El borrador 768P: 1344x768, facturado $0.40, de vuelta en 194s. Mostrado como GIF silencioso; el archivo en sí lleva estéreo de 32 kHz. Observa las cuatro gruesas marcas de goteo manchadas en la etiqueta.

Interfaz de generador de video AI con prompt y video de cold brew generado

Área de juegos de MiniMax H3 imagen-a-video en Atlas Cloud con el fotograma bloqueado subido, el prompt escrito y un clip terminado en el panel de salida

El formulario de imagen-a-video con el fotograma bloqueado cargado. Resolución y Duración son los únicos dos campos que separan este paso del paso 4, y ambos niveles están en la misma lista sin nada que restrinja ninguno. Esta captura se dejó en los valores predeterminados de 2K y 8 segundos, por eso el botón Ejecutar cotiza $1.12; cambia Resolución a 768P y Duración a 4 y esa cotización baja a $0.40.

Paso 3: Juzgar el borrador MiniMax H3 2K vs 768P en lo correcto

El borrador es un ensayo, no una prueba. De mis dos pares, esto es lo que te dice de manera confiable y lo que no.

Confía en él para: redacción del prompt, si el movimiento se lee en absoluto, la cantidad de movimiento de cámara, el ritmo a lo largo de los cuatro segundos y la base de audio. Todo eso se transfirió limpiamente.

No confíes en él para: textura superficial fina, el tipo de letra más pequeño en tu producto, o cualquier artefacto que invente. En mi borrador 768P, la etiqueta adquirió cuatro gruesas gotas marrones que la ejecución 2K no produjo, y la pequeña línea de ingredientes colapsó en una mancha. Si hubiera rechazado ese borrador por verse sucio, habría rechazado un prompt que funcionaba.

Esa es la verdadera división del trabajo. 768P responde "¿es esta la toma correcta?", 2K responde "¿es esto entregable?".

Paso 4: Cambiar un campo y finalizar a 2K

Mismo endpoint, mismo primer fotograma, misma cadena de prompt. Cambia resolution a 2K y nada más.

Una botella de café cold brew Northbound sobre una barra de café

El clip final MiniMax H3 2K desde el mismo primer fotograma bloqueado, con etiqueta limpia y letra pequeña legible

El final 2K: 2560x1440, facturado $0.56, de vuelta en 234s. Misma losa, misma máquina de espresso, misma planta, mismo barista, misma posición de etiqueta que el borrador.

Aquí está la respuesta a la pregunta que todo este artículo fue construido para probar, y fue en la dirección correcta. Con el primer fotograma bloqueado, la deriva se detuvo. El escenario, el encuadre, la altura de la cámara y la posición de la tipografía se mantuvieron entre el borrador 768P y el final 2K. Las diferencias se limitaron al detalle: el pase 2K limpió las marcas de goteo manchadas hasta convertirlas en un fino reguero, resolvió el grano del papel y convirtió la pequeña línea de ingredientes de ruido en palabras. Eso es exactamente el comportamiento que MiniMax afirma para la regeneración en contexto, y es la primera vez en esta prueba que 2K se veía como un nivel de calidad en lugar de un re-rodaje.

Para contrastar, el grupo de control. Esta es la ejecución de texto-a-video en bruto a 2K, la que produjo el extraño al principio de esta página. Mismo contenido de prompt, sin primer fotograma, por lo que nada fija la composición.

11 palabras

Área de juegos de MiniMax H3 texto-a-video a 2K con el clip de control terminado en el panel de salida

MiniMax H3 texto-a-video en Atlas Cloud: sin primer fotograma, Resolución 2K, Relación de aspecto 16:9, y el clip terminado en el panel de salida. No había nada malo en esta generación. Simplemente no es la misma película que produjo la ejecución 768P.

Paso 5: O saltarse el re-rodaje MiniMax H3 2K vs 768P y escalar en su lugar

A veces la toma 768P ya es la correcta. La actuación funcionó, el timing es correcto, y no quieres una regeneración que podría resultar diferente. Entonces no la vuelvas a generar. Pasa el archivo exacto a través de un escalador de video.

Configuración en atlascloud/video-upscaler: video = la URL de tu salida 768P, target_resolution=2k. Los límites de entrada a 2K son 23 segundos y 690 fotogramas, y los fps de entrada deben ser 30 o menos, por lo que los clips de 24 fps de H3 pasan cómodamente.

Botella de café cold brew Northbound sobre una barra de café

La toma 768P pasada por el escalador de video de Atlas Cloud a 2K, el mismo metraje a mayor resolución

La toma escalada: 2540x1452, facturado $0.12, de vuelta en 40s. Mismas cuatro gotas, mismo todo. Esta es la misma película, no una nueva.

Interfaz de generador de video AI mostrando video de entrada y salida completada

Área de juegos de escalador de video de Atlas Cloud con el clip 768P cargado y el resultado 2K en el panel de salida

El escalador de video en Atlas Cloud con el clip H3 768P cargado y el resultado escalado reproduciéndose a la derecha. Esta captura se ejecutó con el valor predeterminado de 1080p, que el botón Ejecutar cotiza a $0.09 para cualquier cosa por debajo del mínimo de 5 segundos. Cambia Resolución objetivo a 2k y estás en el nivel de $0.024/s, que son los $0.12 que me facturaron en mi propia ejecución.

Y aquí está el veredicto que nadie debería saltarse, los tres recortes de etiqueta del mismo fotograma bloqueado a la misma ampliación.

Comparación de tres paneles de etiquetas de botella de cold brew a diferentes resoluciones

Comparación de recorte de etiqueta a tres bandas: 768P nativo, ese clip escalado a 2K, y 2K nativo, mostrando que solo 2K nativo recupera la letra pequeña

768P nativo, el mismo clip escalado y 2K nativo. El escalador afina el grano del papel y el título grande de manera hermosa, y mantiene la toma exacta. Lo que no puede hacer es devolver la línea pequeña, porque esa información nunca estuvo en el archivo 768P. El pase de regeneración puede hacerlo, porque vuelve al contexto en lugar de a los píxeles.

Por lo tanto, las dos rutas no son competidoras. Responden a diferentes preguntas. Escalar preserva una actuación. La regeneración recupera detalle. Elige según lo que tu clip no pueda permitirse perder.

Variaciones que vale la pena probar en MiniMax H3 2K vs 768P

  • Vertical. Mis pruebas 16:9 devolvieron 1344x768, por lo que el lado corto es lo que fija el nivel. Una solicitud 9:16 debería aterrizar en 768x1344 con la misma lógica, pero mídela una vez antes de construir un lote vertical basado en suposiciones. En imagen-a-video, estableces la forma a través del primer fotograma en lugar de luchar contra el enumerado adaptive.
  • Cabezas parlantes. Aquí es donde omitiría el borrador por completo e iría directamente a 2K. Los rostros, dientes y líneas de los ojos son precisamente la clase de detalle pequeño para la que existe el pase de regeneración, y un borrador 768P te informará mal sobre los tres.
  • Clips largos. A 15 segundos, la diferencia se amplía a $1.50 frente a $2.10, y el tiempo real se extiende con ella. Planifica la cola, no solo el presupuesto.
  • Texto de producto y trabajo multilingüe. El tipo de letra estable dentro del fotograma de H3 y su audio nativo multilingüe son las razones por las que la gente lo elige para envases comerciales en primer lugar. Ambos sobreviven a 768P, lo que hace que 768P sea un nivel de entrega realmente útil para recortes sociales, no solo una sala de ensayos.

Lo que realmente cuesta MiniMax H3 2K vs 768P por clip utilizable

Primero, las tres rutas a un entregable 2K, por clip de 8 segundos, a las tarifas que realmente me cobraron.

Ruta a un clip 2KTarifas utilizadasCosto para un clip de 8sMantiene la misma tomaRecupera texto pequeño
Directo a 2K$0.14/s$1.12n/a
Borrador 768P, luego re-rodaje 2K con fotograma bloqueado$0.10/s luego $0.14/s$0.80 + $1.12 = $1.92Sí, si el primer fotograma está bloqueado
Final 768P, luego escalar a 2K$0.10/s luego $0.024/s$0.80 + $0.192 = $0.99Sí, exactamenteNo

Ahora el número que decide tu mes. Toma una mezcla realista: diez borradores de 4 segundos para encontrar la toma, luego dos clips finales de 8 segundos.

Lote de 10 borradores + 2 finalesBorradoresFinalesBloqueo de fotogramaTotal
Todo a 2K10 x 4s x $0.14 = $5.602 x 8s x $0.14 = $2.24ninguno$7.84
Borradores 768P, finales 2K, fotograma bloqueado10 x 4s x $0.10 = $4.00$2.24$0.17$6.41 (18% menos)
Borradores 768P, finales 768P, escalados$4.002 x ($0.80 + $0.192) = $1.98$0.17$6.15 (22% menos)

Lee la fila del medio con honestidad. El ahorro por segundo es del 29%, pero el ahorro por lote es del 18%, porque tus finales siguen siendo finales. El ahorro solo crece hacia el 29% a medida que los borradores dominan: con veinte borradores de 8 segundos en lugar de diez cortos, la ruta dos aterriza aproximadamente un 25% por debajo de todo 2K. Y cada centavo depende del fotograma bloqueado, porque sin él, esos diez borradores baratos son diez películas que no vas a enviar.

El segundo dividendo es el tiempo, y podría importar más. En el par texto-a-video, 768P regresó un 28% más rápido, y en ambos pares nunca tomó más tiempo. En clips de 4 segundos a esos tiempos reales, eso es aproximadamente 27 borradores en una hora en lugar de 20. Cuando todavía estás buscando el prompt correcto, siete intentos extra importan más que los $1.60 que ahorraste.

Una nota legal si planeabas evitar todo esto alojándolo tú mismo. Los pesos abiertos en Hugging Face son H3-Base, que genera a 768 en el lado corto. El pase 2K vive en el lado de la API, por lo que los pesos abiertos te dan el nivel de borrador y no el nivel final. La licencia comunitaria también incluye territorios excluidos que cubren la UE, el Reino Unido, Corea y los EE. UU., con un canal de autorización separado abierto, así que lee la licencia antes de construir un pipeline comercial sobre una copia local. Para una visión más amplia de lo que los pesos liberados hacen y no incluyen, consulta nuestra reseña de MiniMax H3 y el catálogo completo de modelos si quieres comparar precios de H3 con el resto del campo de video actual.

Preguntas frecuentes

En MiniMax H3 2K vs 768P, ¿es 768P realmente más barato por clip?

Sí. Me facturaron $0.40 por un clip de 4 segundos en 768P y $0.56 por la misma solicitud en 2K, es decir, $0.10/s frente a $0.14/s, un ahorro del 29% por segundo. El problema es que el ahorro solo cuenta si la ejecución barata te enseña algo sobre la cara, lo que requiere bloquear el primer fotograma. Un borrador de texto-a-video sin formato a 768P es una película separada, y el dinero gastado en él no es dinero ahorrado.

En MiniMax H3 2K vs 768P, ¿es 2K solo un escalado de la salida 768P?

No. MiniMax hace que el modelo base regenere su propia salida de baja resolución en contexto en lugar de ejecutar un módulo de superresolución dedicado, por lo que 2K puede restaurar texto pequeño y detalles finos de superficie que un escalador solo puede aproximar. Mi recorte de etiqueta a tres bandas muestra exactamente eso: el clip 768P escalado afiló el grano del papel pero dejó la pequeña línea de ingredientes como ruido ilegible, mientras que la ejecución nativa 2K la convirtió de nuevo en palabras.

¿Se parecerá mi borrador MiniMax H3 768P a mi final 2K?

Solo si bloqueas el primer fotograma. En texto-a-video sin formato, los dos niveles me dieron diferente decoración del escenario, diferente altura de cámara, diferente condensación y diferente posición de la etiqueta a partir del mismo prompt. En imagen-a-video con un primer fotograma fijo, la composición, el encuadre y la tipografía se mantuvieron entre niveles y los únicos cambios fueron en detalle y textura.

¿Todavía necesito contactar con ventas para MiniMax H3 768P?

No, a partir del 2026-08-05. El esquema en vivo en los tres endpoints de H3 lista resolution como enum: ["768P", "2K"], el área de juegos muestra ambos en un menú desplegable, y mis trabajos 768P se completaron y facturaron a la tarifa más baja en dos endpoints diferentes. La línea de beta cerrada proviene de cobertura escrita en los primeros días después del lanzamiento.

En MiniMax H3 2K vs 768P, ¿cuánto más lento es 2K?

En mis pares de 4 segundos, de 1.2x a 1.4x más lento: 181s frente a 130s en texto-a-video y 234s frente a 194s en imagen-a-video, medido desde el envío hasta la finalización. Arquitectónicamente, 2K es un segundo pase de generación sobre el mismo contexto, así que espera que la diferencia absoluta se amplíe en clips más largos en lugar de mantenerse plana.

¿Puedo mejorar un clip 768P a 2K sin volver a generarlo?

Puedes aumentar la resolución sin tocar la toma ejecutándola a través de un escalador de video, lo que me costó $0.12 por un clip de 4.46 segundos en el nivel 2K ($0.024/s con un mínimo de 5 segundos) y regresó en 40 segundos. Eso preserva la actuación fotograma a fotograma. Lo que no hará es recuperar detalles que nunca se capturaron, por lo que si el objetivo de ir a 2K es tener texto pequeño legible, necesitas el pase de regeneración, no el escalador.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos