
Dos impresiones de la misma toma de una botella de cold brew sobre una barra de café, una suave y otra nítida, con un ticket entre ellas
Dos impresiones de la misma toma, una suave y otra nítida. En MiniMax H3 esa diferencia no es un control de calidad. Generado con openai/gpt-image-2/text-to-image.
Envié el mismo prompt dos veces. Lo único que cambié fue un desplegable: 768P, luego 2K.
La primera ejecución costó $0.40 y tardó 130 segundos. La segunda costó $0.56 y tardó 181 segundos. Luego coloqué los dos fotogramas lado a lado y algo no encajaba. La botella seguía ahí. La etiqueta seguía ahí, con la letra pequeña y todo. Pero la barra había cambiado de madera cálida a piedra pálida, había aparecido una estantería al fondo detrás del barista, la condensación en el vaso se había extendido de repente por todas partes y la luz había cambiado de color.
No había ahorrado dinero en un borrador. Había rodado dos películas diferentes.
Esto no es un error. Es lo que realmente significa "2K" en H3, y una vez que lo entiendes, el consejo estándar que todos dan —primero barato, luego caro— se desmorona en silencio. A continuación, todos los números de esa prueba, más el único cambio que hace que el borrado barato funcione.
Conclusiones clave (todas las cifras medidas en Atlas Cloud, 2026-08-05)
- 768P entregó 1344x768, 2K entregó 2560x1440 en una solicitud 16:9. Esto es 3,6 veces los píxeles y 3,6 veces la tasa de bits de video.
- La facturación fue $0.40 vs $0.56 para un clip de 4 segundos, es decir, $0.10/s vs $0.14/s. 768P es un 29% más barato por segundo, no la mitad del precio.
- 768P regresó un 28% más rápido en el par texto-a-video (130s vs 181s) y un 17% más rápido en el par imagen-a-video (194s vs 234s).
- Texto-a-video en 768P y 2K con el mismo prompt produjo dos tomas diferentes, no dos calidades de una misma toma. Un borrador simple de 768P no previsualiza tu final en 2K.
- Bloquea el primer fotograma con imagen-a-video y la deriva se detiene. Mismo decorado, mismo encuadre, misma posición de la etiqueta, y 2K gasta sus píxeles extra exactamente donde MiniMax dice que lo hace: en la letra pequeña.
- 768P no está restringido. Ambos niveles están activos en la enumeración de resolución y seleccionables en el desplegable a fecha de 2026-08-05, independientemente de lo que sigan diciendo los resúmenes antiguos.
MiniMax H3 2K vs 768P: ¿Sigue 768P en beta cerrada?
No, y vale la pena aclararlo rápido porque aún se repite en muchos análisis de precios escritos en los días posteriores al lanzamiento.
Hoy he extraído el esquema de entrada en vivo de los tres endpoints de H3. El campo resolution dice enum: ["768P", "2K"] con default: "2K" tanto en texto-a-video, imagen-a-video como referencia-a-video, y duration recorre cada segundo completo de 4 a 15 en los tres. Sin bandera, sin puerta, sin formulario de ventas. Luego envié un trabajo en 768P a dos endpoints diferentes y ambos se completaron y facturaron a la tarifa más baja. Si una página te dice que contactes con ventas para 768P, esa página describe la primera semana del lanzamiento, no esta semana.
MiniMax H3 2K vs 768P, mismo prompt, lado a lado
Izquierda: 768P. Derecha: 2K. Mismo prompt, mismo duration=4, mismo ratio=16:9, enviados consecutivamente a minimax/h3/text-to-video.

MiniMax H3 2K vs 768P en pantalla dividida a partir del mismo prompt de texto-a-video, con resolución, precio y tiempo de ejecución grabados
Mismo prompt, dos ejecuciones. Izquierda: 768P, 1344x768, $0.40, 130s. Derecha: 2K, 2560x1440, $0.56, 181s. Mostrado como GIF silencioso; ambos archivos entregados llevan audio estéreo de 32 kHz. Medido en Atlas Cloud, 2026-08-05.
Observa lo que realmente difiere. No es la nitidez. Es la película. Diferente material de la barra, diferente vestimenta de fondo, diferente cantidad de condensación, diferente altura de la cámara, diferente temperatura de color, y la etiqueta se sitúa en un punto diferente de la botella. Nada en el prompt pedía que nada de eso cambiara.
Ahora la parte que todo el mundo asume que va en sentido contrario. Aquí está el área de la etiqueta de ambas tomas, recortada de los archivos nativos y ampliada al mismo ancho, de modo que el recorte de 768P está más magnificado que el de 2K.

Comparación de recorte de etiqueta entre las tomas MiniMax H3 768P y 2K, ambas mostrando la línea de ingredientes pequeña como legible
La línea pequeña "single origin ethiopia guji / 250ml / roasted 04.08.2026" sobrevive en 768P. Es más suave y el espaciado de letras fluctúa, pero nada es ilegible. El verdadero costo de 768P aquí no fue el texto borroso, sino una composición diferente.
Así que el planteamiento honesto de MiniMax H3 2K vs 768P no es "nítido versus borroso". Es "esta toma versus una toma diferente, más un pase de detalle encima".
La ficha técnica de MiniMax H3 2K vs 768P, medida
Todo en esta tabla salió de ffmpeg -i en los archivos entregados y del campo price en la predicción finalizada, no de una página de documentación.
| Medido en el archivo entregado | 768P | 2K | Proporción |
|---|---|---|---|
| Resolución entregada (solicitud 16:9) | 1344x768 | 2560x1440 | 3.6x píxeles |
| Tasa de bits de video | 998 kb/s | 3,624 kb/s | 3.6x |
| Tamaño de archivo, clip de 4.46s | 620 KB | 2.00 MB | 3.3x |
| Fotogramas por segundo | 24 fps | 24 fps | igual |
| Pista de audio | AAC estéreo, 32,000 Hz, 131 kb/s | AAC estéreo, 32,000 Hz, 127 kb/s | igual |
| Duración del contenedor para duration=4 | 4.46s | 4.46s | igual |
| Enviado a completado, tiempo real | 130s | 181s | 1.39x |
| Facturado realmente | $0.40 | $0.56 | 1.4x |
| Tarifa efectiva | $0.10/s | $0.14/s | 29% más barato |
¿Quieres comparar MiniMax H3 con otros modelos de video con el mismo prompt? La comparación de modelos de Atlas Cloud los ejecuta lado a lado con resolución y costo por segundo mostrados antes de generar.
Dos notas al pie que me costaron dinero aprender. Primero, ambos niveles entregaron 4.46 segundos para una solicitud duration=4 y ambos facturaron 4 segundos, así que obtienes los 0.46s extra gratis pero no puedes planificar un corte alrededor de eso. Segundo, el audio es idéntico en todos los niveles. Si tu clip se basa en diálogo o una sincronización musical, 2K no te compra nada en lo que importa.
Por qué MiniMax H3 2K vs 768P confunde a todos
Porque 2K en H3 no es un paso de escalado. Es una segunda generación.
MiniMax describe el mecanismo directamente: "Para la salida 2K de H3, en lugar de usar un módulo de superresolución dedicado convencional, hacemos que el modelo base H3 regenere su propia salida de baja resolución en contexto". Explican por qué lo construyeron así: el enfoque en contexto "le permite recurrir al contexto multimodal original nuevamente para producir salida de alta resolución, recuperando detalles que la superresolución tradicional solo puede 'adivinar' y a menudo no puede restaurar, como texto pequeño y detalles finos" (MiniMax, julio 2026).
Vuelve a leerlo con mentalidad de producción. El pase 2K vuelve a tu contexto original y genera de nuevo. Cuando tu contexto no es más que un prompt de texto, "generar de nuevo" significa "tirar los dados de nuevo". Eso es exactamente lo que muestran mis dos tomas. Nunca se le pidió al modelo que reprodujera la versión 768P, porque nunca vio la versión 768P.
Tres formas en que esto afecta en la práctica:
- Haces borradores baratos en 768P con texto-a-video, eliges un ganador, luego lo vuelves a ejecutar en 2K. Obtienes un desconocido. El prompt se respeta, la película es nueva. Eso es la prueba al principio de esta página.
- Presupuestas como si un 29% más barato por segundo significara un 29% más barato. No es así, porque los finales son la parte cara de cualquier lote real, y un solo reroll 2K desperdiciado elimina el ahorro de varios borradores.
- Asumes que la ruta de actualización barata está ahí en algún lado. Revisé el catálogo completo en Atlas Cloud hoy: 452 modelos, tres endpoints H3, y ningún endpoint de regeneración H3 entre ellos. Donde solo se exponen los tres endpoints de generación, "mejorar este clip a 2K" significa volver a generarlo o ejecutar un escalador separado sobre él. Ambos cuestan dinero, y no compran lo mismo.
Vale la pena decir por qué vale la pena diseñar alrededor de este modelo en lugar de cambiar. La oferta principal en el lanzamiento fue video "a hasta 2K de resolución, en clips de hasta 15 segundos, con audio estéreo nativo" (DataNorth AI, agosto 2026), y las puntuaciones lo respaldaban: H3 se encuentra actualmente en la cima del tablero Elo de edición de video de Artificial Analysis con 1,130, por delante de Gemini Omni Flash con 1,122 y 93 puntos por delante de Dreamina Seedance 2.0 720p con 1,037 (Artificial Analysis, agosto 2026). La calidad vale un flujo de trabajo. El flujo de trabajo solo tiene que respetar cómo se produce 2K.
Los cuatro modelos detrás de esta prueba MiniMax H3 2K vs 768P, en una pestaña
Toda la prueba son cuatro modelos, una clave API, una factura. La ejecuté en Atlas Cloud porque cambiar entre un modelo de imagen, dos endpoints H3 y un escalador de lo contrario significa tres cuentas y tres facturas que conciliar al final del mes.
| Trabajo en esta prueba | Modelo | Precio a agosto de 2026 | Lo que realmente pagué |
|---|---|---|---|
| Bloquear el primer fotograma | openai/gpt-image-2/text-to-image | desde $0.009/imagen (niveles de token superiores) | $0.1745 por una 2048x1152 en calidad alta |
| Borrador y final, fotograma bloqueado | minimax/h3/image-to-video | $0.14/s en 2K, $0.10/s en 768P | $0.40 y $0.56 por 4s cada uno |
| Par de control sin fotograma | minimax/h3/text-to-video | mismos dos niveles | $0.40 y $0.56 por 4s cada uno |
| Conservar la toma, aumentar los píxeles | atlascloud/video-upscaler | $0.018/s a 1080p, $0.024/s a 2K, mínimo 5s | $0.12 por el clip de 4.46s |
Dos notas antes de que copies los números. Los endpoints H3 publican una tarifa única de $0.14/s, que es el nivel 2K; la tarifa 768P aparece en la factura, no en el listado, así que mídela una vez tú mismo. Y ninguno de estos cuatro modelos tiene descuento ahora mismo. Si quieres recortar el paso de bloqueo de fotograma, openai/gpt-image-2-developer/text-to-image está al 50% de descuento ($0.004 desde $0.009) a agosto de 2026, y es la misma familia haciendo el mismo trabajo.
Cómo ejecutar la prueba MiniMax H3 2K vs 768P tú mismo
Cinco pasos, $2.21 de crédito, y unos 15 minutos de tiempo total. Cada prompt a continuación es la cadena exacta que envié.
Tres notas de parámetros primero, porque cada uno puede costarte silenciosamente una ejecución:
- En texto-a-video el campo es
ratio, noaspect_ratio, su valor predeterminado es1:1, y su enumeración no tiene opciónadaptive. Pasa16:9tú mismo o obtendrás un clip cuadrado. En imagen-a-video la enumeración es soloadaptive, porque tu primer fotograma decide la forma. - Siempre envía
durationexplícitamente en lugar de confiar en el valor predeterminado documentado de 8. Lo que se te factura sigue lo que se entrega, no lo que asumiste. - Todo trabajo H3 supera un tiempo de espera normal en línea, así que envía de forma asíncrona y consulta. El campo
pricetambién se completa tarde: cuandostatuscambia acompleteda menudo está vacío, y tienes que consultar el id de predicción una vez más para obtener el número real. Sin esa segunda consulta no puedes construir una tabla de costos honesta.
Paso 1: Bloquear el fotograma con GPT Image 2
Este es el paso que convierte un borrador en una vista previa en lugar de un billete de lotería. Genera la composición finalizada como una imagen fija, y se convierte en la parte inamovible de ambas ejecuciones de video.
text1Fotografía macro de producto de una botella de café cold brew negra mate sobre una losa de pizarra mojada, luz de ventana matinal que la cruza desde la derecha. Una etiqueta de papel crema envuelve la botella, nítidamente legible: título en mayúsculas negrita "NORTHBOUND COLD BREW" en una línea, y directamente debajo en tipo pequeño "single origin ethiopia guji / 250ml / roasted 04.08.2026". Gotas de condensación en el vidrio, una máquina de espresso y un barista con camisa de mezclilla suavemente desenfocados al fondo. Cinematográfico, profundidad de campo reducida, tono cálido neutro, fotorrealista, 16:9. 2
Ajustes: calidad alta, tamaño 2048x1152. No escatimes aquí. Cada detalle que quieras que el pase 2K proteja debe existir primero en este fotograma.

El primer fotograma bloqueado generado con GPT Image 2 a 2048x1152, mostrando la botella de cold brew y su letra pequeña legible
Generado con openai/gpt-image-2/text-to-image, calidad alta, 2048x1152. Facturado $0.1745, de vuelta en 146s.

Playground de GPT Image 2 en Atlas Cloud con el prompt del fotograma completado y la botella generada en el panel de salida
GPT Image 2 en Atlas Cloud: calidad configurada en alta, 16:9, el fotograma bloqueado renderizado a la derecha.
Paso 2: Hacer el borrador en 768P
El mismo endpoint que usarás para el final. Solo la resolución difiere entre este paso y el paso 4.
text1Slow macro dolly-in hacia la botella. Las gotas de condensación se deslizan por el vidrio. La etiqueta permanece perfectamente quieta y legible. En el fondo suave, el barista limpia la barra una vez. Ambiente natural de cafetería, un leve silbido de máquina de espresso. Sin movimiento de cámara. 2
Ajustes en minimax/h3/image-to-video: primer fotograma = tu salida del paso 1, resolution=768P, duration=4, ratio=adaptive.

El clip de borrador MiniMax H3 768P, un slow macro dolly-in hacia la botella de cold brew
El borrador 768P: 1344x768, facturado $0.40, de vuelta en 194s. Mostrado como GIF silencioso; el archivo en sí lleva audio estéreo de 32 kHz. Observa las cuatro gruesas rayas de goteo que se extienden por la etiqueta.

Playground de MiniMax H3 imagen-a-video en Atlas Cloud con el fotograma bloqueado subido, el prompt escrito y un clip finalizado en el panel de salida
El formulario de imagen-a-video con el fotograma bloqueado cargado. Resolución y Duración son los únicos dos campos que separan este paso del paso 4, y ambos niveles están en la misma lista sin nada que restrinja ninguno. Esta captura se dejó en los valores predeterminados 2K y 8 segundos, por lo que el botón Ejecutar cotiza $1.12; cambia Resolución a 768P y Duración a 4 y esa cotización baja a $0.40.
Paso 3: Juzgar el borrador MiniMax H3 2K vs 768P en lo correcto
El borrador es un ensayo, no una prueba. De mis dos pares, esto es lo que te dice de manera confiable y lo que no.
Confía en él para: redacción del prompt, si el movimiento se lee en absoluto, la cantidad de movimiento de cámara, el ritmo a lo largo de los cuatro segundos y la base de audio. Todo eso se transfirió limpiamente.
No confíes en él para: textura superficial fina, el tipo más pequeño de tu producto, o cualquier artefacto que invente. En mi borrador 768P la etiqueta adquirió cuatro gruesas gotas marrones que la ejecución 2K no produjo, y la pequeña línea de ingredientes se colapsó en borrón. Si hubiera rechazado ese borrador por parecer sucio, habría rechazado un prompt que funcionaba.
Esa es la verdadera división del trabajo. 768P responde "¿es esta la toma correcta?", 2K responde "¿es esto entregable?".
Paso 4: Cambiar un campo y finalizar en 2K
Mismo endpoint, mismo primer fotograma, misma cadena de prompt. Cambia resolution a 2K y nada más.

El clip final MiniMax H3 2K a partir del mismo primer fotograma bloqueado, con una etiqueta limpia y letra pequeña legible
El final 2K: 2560x1440, facturado $0.56, de vuelta en 234s. Misma losa, misma máquina de espresso, misma planta, mismo barista, misma posición de la etiqueta que el borrador.
Aquí está la respuesta a la pregunta para la que se construyó todo este artículo, y fue en el buen sentido. Con el primer fotograma bloqueado, la deriva se detuvo. El decorado, el encuadre, la altura de la cámara y la posición de la tipografía se mantuvieron entre el borrador 768P y el final 2K. Las diferencias se limitaron al detalle: el pase 2K limpió las gotas manchadas hasta dejarlas en un solo hilo fino, resolvió el grano del papel y convirtió la pequeña línea de ingredientes de ruido en palabras. Eso es exactamente el comportamiento que MiniMax afirma para la regeneración en contexto, y es la primera vez en esta prueba que 2K pareció un nivel de calidad en lugar de un reroll.
Para contrastar, el grupo de control. Esta es la ejecución de texto-a-video simple en 2K, la que produjo el desconocido al principio de esta página. Mismo contenido de prompt, sin primer fotograma, así que nada fija la composición.

Playground de MiniMax H3 texto-a-video en 2K con el clip de control finalizado en el panel de salida
MiniMax H3 texto-a-video en Atlas Cloud: sin primer fotograma, Resolución 2K, Relación de aspecto 16:9, y el clip finalizado en el panel de salida. No había nada malo en esta generación. Simplemente no es la misma película que produjo la ejecución 768P.
Paso 5: O saltar el reroll MiniMax H3 2K vs 768P y escalar en su lugar
A veces la toma 768P ya es la indicada. La actuación funcionó, el tiempo es correcto, y no quieres una regeneración que podría aterrizar de manera diferente. Entonces no la vuelvas a generar. Pasa el archivo exacto a través de un escalador de video.
Ajustes en atlascloud/video-upscaler: video = tu URL de salida 768P, target_resolution=2k. El límite de entrada en 2K es de 23 segundos y 690 fotogramas, y los fps de entrada deben ser 30 o menos, por lo que los clips de 24 fps de H3 pasan cómodamente.

La toma 768P pasada a través del escalador de video de Atlas Cloud a 2K, mismo metraje a mayor resolución
La toma escalada: 2540x1452, facturado $0.12, de vuelta en 40s. Mismas cuatro gotas, mismo todo. Esta es la misma película, no una nueva.

Playground del escalador de video de Atlas Cloud con el clip 768P cargado y el resultado 2K en el panel de salida
El escalador de video en Atlas Cloud con el clip H3 768P cargado y el resultado escalado reproduciéndose a la derecha. Esta captura se ejecutó con el valor predeterminado 1080p, que el botón Ejecutar cotiza en $0.09 para cualquier valor por debajo del mínimo de 5 segundos. Cambia Resolución objetivo a 2k y estás en el nivel de $0.024/s, que son los $0.12 que se me facturaron por mi propia ejecución.
Y aquí está el veredicto que nadie debería saltarse, los tres recortes de etiqueta del mismo fotograma bloqueado a la misma magnificación.

Comparación de recorte de etiqueta a tres bandas: 768P nativo, ese clip escalado a 2K, y 2K nativo, mostrando que solo el 2K nativo recupera la letra pequeña
768P nativo, el mismo clip escalado, y 2K nativo. El escalador agudiza el grano del papel y el título grande de manera hermosa, y conserva la toma exacta. Lo que no puede hacer es volver a poner la línea pequeña, porque esa información nunca estuvo en el archivo 768P. El pase de regeneración puede hacerlo, porque vuelve al contexto en lugar de a los píxeles.
Así que las dos rutas no son competidoras. Responden a preguntas diferentes. El escalado preserva una actuación. La regeneración recupera detalle. Elige según lo que tu clip no pueda permitirse perder.
Variaciones que vale la pena probar en MiniMax H3 2K vs 768P
- Vertical. Mis pruebas 16:9 devolvieron 1344x768, por lo que el lado corto es lo que fija el nivel. Una solicitud 9:16 debería dar 768x1344 con la misma lógica, pero mídela una vez antes de construir un lote vertical basado en la suposición. En imagen-a-video estableces la forma a través del primer fotograma en lugar de pelear con la enumeración
adaptive. - Cabezas parlantes. Aquí es donde omitiría el borrado por completo e iría directamente a 2K. Los rostros, los dientes y las líneas de los ojos son precisamente la clase de detalle pequeño para la que existe el pase de regeneración, y un borrador 768P te informará mal sobre los tres.
- Clips largos. A 15 segundos la brecha se amplía a $1.50 frente a $2.10, y el tiempo de ejecución se alarga con ella. Planifica la cola, no solo el presupuesto.
- Texto de producto y trabajo multilingüe. El tipo de letra estable dentro del fotograma de H3 y su audio multilingüe nativo son las razones por las que la gente lo elige para empaques comerciales en primer lugar. Ambos sobreviven en 768P, lo que convierte a 768P en un nivel de entrega genuinamente utilizable para recortes sociales, no solo una sala de ensayos.
Lo que realmente cuesta MiniMax H3 2K vs 768P por clip utilizable
Primero, las tres rutas a un entregable 2K, por clip de 8 segundos, a las tarifas que realmente me cobraron.
| Ruta a un clip 2K | Tarifas utilizadas | Costo para un clip de 8s | Conserva la misma toma | Recupera texto pequeño |
|---|---|---|---|---|
| Directo a 2K | $0.14/s | $1.12 | n/a | Sí |
| Borrador 768P, luego reroll 2K con fotograma bloqueado | $0.10/s luego $0.14/s | $0.80 + $1.12 = $1.92 | Sí, si el primer fotograma está bloqueado | Sí |
| Final 768P, luego escalado a 2K | $0.10/s luego $0.024/s | $0.80 + $0.192 = $0.99 | Sí, exactamente | No |
Ahora el número que decide tu mes. Toma una mezcla realista: diez rollos de borrador de 4 segundos para encontrar la toma, luego dos clips finales de 8 segundos.
| Lote de 10 borradores + 2 finales | Borradores | Finales | Bloqueo de fotograma | Total |
|---|---|---|---|---|
| Todo en 2K | 10 x 4s x $0.14 = $5.60 | 2 x 8s x $0.14 = $2.24 | ninguno | $7.84 |
| Borradores 768P, finales 2K, fotograma bloqueado | 10 x 4s x $0.10 = $4.00 | $2.24 | $0.17 | $6.41 (18% menos) |
| Borradores 768P, finales 768P, escalados | $4.00 | 2 x ($0.80 + $0.192) = $1.98 | $0.17 | $6.15 (22% menos) |
Lee la fila del medio con honestidad. El ahorro por segundo es del 29%, pero el ahorro por lote es del 18%, porque tus finales siguen siendo finales. El ahorro solo crece hacia el 29% a medida que el borrado domina: con veinte rollos de borrador de 8 segundos en lugar de diez cortos, la ruta dos aterriza aproximadamente un 25% por debajo de todo 2K. Y cada centavo de eso depende del fotograma bloqueado, porque sin él esos diez rollos baratos son diez películas que no vas a enviar.
El segundo dividendo es el tiempo, y podría importar más. En el par texto-a-video, 768P regresó un 28% más rápido, y en ambos pares nunca tomó más tiempo. En clips de 4 segundos con esos tiempos de ejecución, eso es aproximadamente 27 rollos de borrador en una hora en lugar de 20. Cuando todavía estás buscando el prompt correcto, siete intentos extra importan más que los $1.60 que ahorraste.
Una nota legal si planeabas evitar todo esto alojando tú mismo. Los pesos abiertos en Hugging Face son H3-Base, que genera en el lado corto de 768. El pase 2K reside en el lado de la API, por lo que los pesos abiertos te dan el nivel de borrador y no el nivel de final. La licencia comunitaria también incluye territorios excluidos que cubren la UE, el Reino Unido, Corea y los EE. UU., con un canal de autorización separado abierto, así que lee la licencia antes de construir un pipeline comercial en un checkout local. Para una visión más amplia de lo que los pesos publicados incluyen y no incluyen, consulta nuestra revisión de MiniMax H3, y el catálogo completo de modelos si quieres comparar precios de H3 con el resto del campo de video actual.
Preguntas frecuentes
En MiniMax H3 2K vs 768P, ¿es 768P realmente más barato por clip?
Sí. Me facturaron $0.40 por un clip de 4 segundos en 768P y $0.56 por la misma solicitud en 2K, es decir, $0.10/s frente a $0.14/s, un ahorro del 29% por segundo. El problema es que el ahorro solo cuenta si la ejecución barata te enseña algo sobre la cara, lo que requiere bloquear el primer fotograma. Un borrador de texto-a-video simple en 768P es una película separada, y el dinero gastado en él no es dinero ahorrado.
En MiniMax H3 2K vs 768P, ¿es 2K solo un escalado de la salida 768P?
No. MiniMax hace que el modelo base regenere su propia salida de baja resolución en contexto en lugar de ejecutar un módulo de superresolución dedicado, por lo que 2K puede restaurar texto pequeño y detalles superficiales finos que un escalador solo puede aproximar. Mi recorte de etiqueta a tres bandas muestra exactamente eso: el clip 768P escalado agudizó el grano del papel pero dejó la pequeña línea de ingredientes como ruido ilegible, mientras que la ejecución nativa 2K la convirtió nuevamente en palabras.
¿Mi borrador MiniMax H3 768P se verá como mi final 2K?
Solo si bloqueas el primer fotograma. En texto-a-video simple, los dos niveles me dieron diferente decorado, diferente altura de cámara, diferente condensación y una posición diferente de la etiqueta a partir del mismo prompt. En imagen-a-video con un primer fotograma fijo, la composición, el encuadre y la tipografía se mantuvieron entre niveles y los únicos cambios fueron en detalle y textura.
¿Todavía necesito contactar con ventas para MiniMax H3 768P?
No, a fecha de 2026-08-05. El esquema en vivo en los tres endpoints H3 enumera resolution como enum: ["768P", "2K"], el playground muestra ambos en un desplegable, y mis trabajos 768P se completaron y facturaron a la tarifa más baja en dos endpoints diferentes. La línea de beta cerrada proviene de cobertura escrita en los primeros días después del lanzamiento.
En MiniMax H3 2K vs 768P, ¿cuánto más lento es 2K?
En mis pares de 4 segundos, de 1.2 a 1.4 veces más lento: 181s frente a 130s en texto-a-video y 234s frente a 194s en imagen-a-video, medido desde el envío hasta la finalización. Arquitectónicamente, 2K es un segundo pase de generación sobre el mismo contexto, así que espera que la brecha absoluta se amplíe en clips más largos en lugar de mantenerse plana.
¿Puedo mejorar un clip 768P a 2K sin volver a generarlo?
Puedes aumentar la resolución sin tocar la toma ejecutándola a través de un escalador de video, lo que me costó $0.12 por un clip de 4.46 segundos en el nivel 2K ($0.024/s con un mínimo de 5 segundos) y regresó en 40 segundos. Eso preserva la actuación fotograma por fotograma. Lo que no hará es recuperar detalles que nunca se capturaron, así que si el objetivo de ir a 2K es tener tipo pequeño legible, necesitas el pase de regeneración, no el escalador.






