
Tres cámaras de cine apiñadas alrededor de un pequeño mostrador de ramen de medianoche, vapor elevándose bajo la lámpara de calor
Un set, un número de escena en la claqueta, tres cámaras diferentes apuntando a ello. Ese es todo el método de este artículo. Generado con openai/gpt-image-2/text-to-image.
Cuatro días después de que MiniMax H3 empezara a encabezar las tablas de clasificación, las búsquedas de sus alternativas aumentaron. Eso no es una contradicción.
Dos tipos de personas lo están escribiendo. Un grupo está molesto: la cola de renderizado es larga, la factura llegó más alta de lo que presupuestaban y hay un plazo el martes. El otro grupo no está molesto en absoluto. Les gusta H3. Solo recuerdan que el modelo al que se comprometieron en febrero fue reemplazado en marzo, y otra vez en abril, y otra vez en junio. No están buscando un reemplazo. Están buscando una salida que no cueste una semana de ingeniería.
Fui a buscar la respuesta de la forma habitual, leyendo tablas de clasificación. Las tablas se negaron a cooperar. A fecha de 4 de agosto de 2026 hay tres para video, y coronan tres modelos diferentes. Así que dejé de leer y empecé a ejecutar: un breve, sin editar, de 5 segundos, directo a los tres números 1 actuales.
Conclusiones clave
- No existe una única mejor alternativa a MiniMax H3, porque hay tres números 1. Al 4 de agosto de 2026: H3 lidera en edición de video con audio (1.130 Elo), Gemini Omni Flash lidera en texto a video con audio (1.245), Seedance 2.0 720p lidera en imagen a video con audio (1.196).
- ¿Necesitas máxima imagen y sin sonido? Gemini Omni Flash. También encabeza la tabla de texto a video sin audio con 1.324 Elo, y factura menos por segundo que H3.
- ¿Animar una imagen fija? Seedance 2.0 lidera esa tabla. Pero su tarifa a 720p resulta más alta por segundo que la tasa de 2K de H3, así que verifica "cambiarse al más barato" antes de comprometerte.
- El texto dentro del cuadro es la prueba que realmente los separa. En mi breve idéntico, H3 y Gemini Omni Flash mantuvieron limpia la tarjeta de título; Seedance 2.0 revolvió las letras durante un fotograma antes de resolverlo. Las columnas de Elo no pueden decirte eso.
- El suelo presupuestario es real, no imaginario: Veo 3.1 Lite aún mantiene una escena unida. Baja más en las tablas públicas (LTX-2.3 Fast a $2.40/min, Elo 980) y lo que compras son repeticiones, no ahorros.
- Cambiarse debería costar casi nada. Detrás de una API con una clave y un cuerpo JSON, migrar es una cadena. Eso, no el precio, es lo que la gente que busca este término realmente necesita.

El mismo breve de 5 segundos de ramen, palabra por palabra, en los tres líderes actuales de la tabla de clasificación. Izquierda: MiniMax H3 a 2K. Centro: Gemini Omni Flash a 720p. Derecha: Seedance 2.0 a 720p. El clip completo de cada modelo está más abajo. Observa el último segundo, donde aparece la tarjeta de título.
Por qué las alternativas a MiniMax H3 rompieron todas las listas en una semana
Aquí está el problema con la pregunta. El video no es una sola tarea, y Artificial Analysis no lo puntúa como una sola. Ejecuta tres arenas separadas, y el día que las leí, cada una tenía un ganador diferente.
| Tabla de clasificación (con audio) | #1 | #2 | #3 | Posición de H3 | Precio API listado del líder |
|---|---|---|---|---|---|
| Edición de video | MiniMax H3, 1.130 | Gemini Omni Flash, 1.122 | HappyHorse-1.0, 1.096 | 1º | $7.80 / min |
| Texto a video | Gemini Omni Flash, 1.245 | MiniMax H3, 1.234 | Seedance 2.0 720p, 1.221 | 2º, a 11 | $6.00 / min |
| Imagen a video | Seedance 2.0 720p, 1.196 | Gemini Omni Flash, 1.193 | MiniMax H3, 1.187 | 3º, a 9 | $9.07 / min |
Puntuaciones leídas el 4 de agosto de 2026 de la Tabla de clasificación de edición de video de Artificial Analysis, la Tabla de clasificación de texto a video y la Tabla de clasificación de imagen a video (Artificial Analysis, agosto de 2026). Las tres son votos ciegos colectivos, por lo que los números fluctúan con el volumen de votos. El precio listado es el costo de un minuto de 1080p en la API del propio creador con configuraciones predeterminadas, que no es lo que pagas por clip finalizado en un endpoint dado. Trata las diferencias por debajo de unos 15 puntos como un empate, no como un veredicto.
Mira la tercera fila de nuevo. Primero, segundo y tercero están separados por 9 puntos en un intervalo de confianza del 95% de aproximadamente más o menos 9. Eso es un triple empate que se imprime como una clasificación.
Y esta rotación no es nueva. En los últimos seis meses, el primer puesto ha cambiado de manos aproximadamente cada cuatro a ocho semanas: Kling 3.0, luego Veo 3.1, luego Seedance 2.0, luego Gemini Omni Flash, luego Wan 2.7, luego Seedance 2.5, ahora H3. Nadie leyendo esto está eligiendo un modelo para los próximos dos años. Están eligiendo uno para las próximas seis semanas y calculando en silencio el costo de cambiar de opinión.
Entonces Elo no puede resolverlo. Pero una cosa sí puede, en unos cinco segundos de ver: ¿tu toma tiene texto?
La tipografía que sobrevive al movimiento es el fallo más común en esta categoría. Las letras se tambalean, los bordes se emborronan, una serifa crece una extremidad en el fotograma 40. También es binaria de una manera que la calidad de imagen no lo es: o la palabra está escrita correctamente en cada fotograma o la toma está muerta. Los propios reels de muestra de H3 se apoyan precisamente en eso, lo que te dice dónde cree que está su foso. Estos tres clips son la salida oficial de H3 de MiniMax, no la mía, y establecen el listón que una alternativa debe superar.

Una secuencia de título noir completa: tarjeta tras tarjeta de tipografía latina y japonesa, créditos, transiciones de panel. Cada letra mantiene su forma durante toda la duración. Este es el trabajo que decide si puedes cambiar.

Tipo cinético de moda. Las palabras se sitúan detrás y alrededor del sujeto en lugar de flotar encima, que es la diferencia entre diseñado y pegado.

Un menú de juego y un panel de equipo. Las etiquetas se mantienen en su lugar, el resaltado cae en la fila que debe caer, luego la cámara se va a la calle. Los elementos de la interfaz se quedan donde fueron colocados.
La lista corta de alternativas a MiniMax H3, enrutada por el trabajo que grabas
Deja de clasificar modelos. Clasifica colas. Aquí está la tabla de enrutamiento que realmente uso, con la tarifa por segundo que factura cada endpoint en Atlas Cloud, leída el mismo día que las tablas de clasificación.
| La toma que estás haciendo | Enrutarla a | Por qué | Tarifa |
|---|---|---|---|
| Máxima imagen, sin sonido necesario | Gemini Omni Flash Texto a Video | #1 en la tabla de texto a video sin audio con 1.324 Elo, y #1 con audio también | $0.125 / s, mínimo de 3s |
| Animar un fotograma fijo | Seedance 2.0 Imagen a Video | #1 imagen a video con audio, 1.196 | token facturado, aprox. $0.2419 / s a 720p |
| Editar metraje que ya grabaste | MiniMax H3 Texto a Video es la familia, la edición es su tabla | #1 edición de video con audio, 1.130 | $0.14 / s a 2K |
| El mismo trabajo cuando H3 está ocupado | Gemini Omni Flash Edición de Video | 1.122, ocho puntos detrás. El respaldo más similar que existe | $0.14 / s |
| Texto en pantalla como un título diseñado | MiniMax H3, con Gemini Omni Flash como una segunda opción real | Ambos mantuvieron el tipo en mi breve; H3 lo trató como tarjeta de título, Omni Flash como superposición | $0.14 / s y $0.125 / s |
| Fijar un look en 9 imágenes y 3 clips | MiniMax H3 Referencia a Video | Acepta hasta 9 imágenes, 3 videos, 3 audios en una sola llamada | $0.14 / s |
| Borradores por lotes antes de comprometerte | Seedance 2.0 Mini | Suficientemente barato para quemar en diez tomas, tiene niveles de superresolución 1440p | $0.056 / s |
| Más barato que aún mantiene una escena | Veo 3.1 Lite | 1.089 Elo con audio a un precio de lista de $4.80/min | $0.05 / s |
| Gama media con descuento este mes | Kling V3.0 Turbo | 15% de descuento a agosto de 2026, era $0.112 | $0.095 / s |
| Hermano de pesos abiertos al mismo precio | HappyHorse-1.1 y Wan 2.7 | 1.147 y 1.158 en texto a video, ambos en las tablas | $0.14 / s y $0.10 / s |
| Quieres alojarlo tú mismo | Pesos de MiniMax H3 | El único modelo de pesos abiertos entre los tres primeros de cualquiera de las tres tablas | gratis localmente, con salvedades abajo |

Un paso de restaurante en hora punta, tres tickets sujetos a un rail y tres cuencos terminados esperando bajo la lámpara de calor
Tres tickets, tres cuencos, una mano buscando el correcto. Enrutamiento, no clasificación. Generado con openai/gpt-image-2/text-to-image.
Aquí está la parte que realmente importa, y no es la columna de precio. Cambiar de proveedor de video de la forma normal significa un nuevo registro, una nueva entidad de facturación, un nuevo esquema de autenticación, una nueva forma de sondeo, un nuevo conjunto de cadenas de error y una nueva factura que conciliar. Presupuesta una semana y una mala tarde. Detrás de una única API con una clave y un cuerpo JSON, la misma migración es una cadena:
python1MODELS = { 2 "baseline": "minimax/h3/text-to-video", 3 "max_picture": "google/gemini-omni-flash/text-to-video", 4 "from_still": "bytedance/seedance-2.0/image-to-video", 5 "drafts": "bytedance/seedance-2.0-mini/text-to-video", 6} 7# mismo endpoint, misma clave, mismo bucle de sondeo. Cambia el valor, no el pipeline. 8
Esa es la respuesta honesta a la segunda intención de búsqueda. Si no estás enfadado con H3 y solo quieres un respaldo, lo que hay que comprar no es un modelo diferente. Es la propiedad de que cambiar de modelo es un diff de una línea.
Una advertencia sobre el fondo del mercado. Veo 3.1 Lite a $0.05 por segundo es un suelo real, y aún compone una escena visible. Por debajo de eso, el precipicio de calidad es pronunciado y medible: en la tabla pública de texto a video, LTX-2.3 Fast aparece a $2.40 por minuto y puntúa 980 Elo, unos 265 puntos por debajo de Gemini Omni Flash. Con esa diferencia, no estás comprando un modelo barato, estás comprando intentos extra.
Paso 1: Establecer la línea base de MiniMax H3 que toda alternativa debe superar
Un breve, cuatro problemas difíciles apilados en 5 segundos: tipografía en movimiento, una línea hablada que debe coincidir con una boca, física de líquido y vapor, y sonido generado en la misma pasada. Tres de esos cuatro son exactamente donde las tres tablas de clasificación difieren.
Pega esto textualmente. No lo mejor para ninguno de los tres modelos. Si reescribes el prompt entre ejecuciones, ya no estás comparando modelos, estás comparando tus propias ediciones.
text1Un chef de ramen golpea un cuenco terminado sobre un paso de acero en una cocina de medianoche abarrotada, el vapor estalla hacia arriba. 2 3Toma 1: plano bajo en movimiento mientras el cuenco golpea el acero, el caldo tiembla en el borde, el vapor atrapa la lámpara de calor superior. 4Toma 2: plano lateral de seguimiento mientras se limpia las manos en el delantal, mira directamente al objetivo y dice: "Doce horas. Un cuenco". 5Toma 3: inclinación rápida hacia arriba mientras una tarjeta de título cinética barre el encuadre, tipo blanco condensado que dice "MIDNIGHT BROTH / NO. 07", las letras encajan en su posición un pulso después de que el cucharón golpee la olla. 6 7Energía de cámara en mano, lámpara de calor de tungsteno contra luz de ventana azul fría, acero cepillado mojado, vapor volumétrico, profundidad de campo reducida, grano de 35 mm. 8 9Audio: golpe de cuenco sobre acero, chapoteo de caldo, zumbido de extractor, su línea clara por encima, un golpe de cucharón de madera cuando aparece el título. 10
Configuraciones en el endpoint MiniMax H3 Text-to-Video:
- Resolución:
2K. La página del modelo documenta un nivel 768P a $0.10 por segundo, pero el playground expone solo 2K, así que planifica alrededor de $0.14 por segundo y verifica tu propia factura. - Relación de aspecto:
16:9. Este campo es obligatorio para ejecuciones solo de texto y rechazaadaptive. Déjalo sin configurar y la solicitud da 400. - Duración:
5, escrito explícitamente. No lo dejes en blanco. El esquema documenta un valor predeterminado de 8, pero una duración omitida ha devuelto un archivo de 5 segundos facturado como 5 segundos, así que indica lo que quieres.
Costo de esta ejecución: 5 x $0.14 = $0.70. Eso es exactamente lo que facturó el trabajo terminado.

Playground de MiniMax H3 Text-to-Video en Atlas Cloud con el breve de ramen completado y el clip 2K terminado en el panel de SALIDA
MiniMax H3 Text-to-Video: breve a la izquierda, Resolución 2K, Relación de aspecto 16:9, clip terminado reproduciéndose a la derecha. El control deslizante de Duración aún está en el valor predeterminado de 8 en esta captura, por lo que el botón Ejecutar cotiza $1.12; arrastra a 5 y la cotización cambia.

La línea base: MiniMax H3, 2560x1440, 24 fps, estéreo de 32 kHz generado en la misma pasada.
Lo que realmente hizo con 5 segundos: tres tomas distintas, en orden. El cuenco aterriza, el chef habla a la cámara, luego la tarjeta de título. "MIDNIGHT BROTH" aparece como una tarjeta real con una línea más pequeña "NO. 07" debajo, jerarquía correcta, bordes limpios, sin bamboleo mientras el encuadre se mueve. Este es el listón.
Paso 2: Ejecutar el mismo breve en la alternativa más fuerte a MiniMax H3
Gemini Omni Flash es el que vence a H3 directamente en texto a video, con audio (1.245 a 1.234) y sin él (1.324 a 1.306). También factura menos por segundo. Sobre el papel, este es el cambio.
Mismas palabras. Sin añadidos, sin "cinematográfico, 8k, obra maestra".
text1Un chef de ramen golpea un cuenco terminado sobre un paso de acero en una cocina de medianoche abarrotada, el vapor estalla hacia arriba. 2 3Toma 1: plano bajo en movimiento mientras el cuenco golpea el acero, el caldo tiembla en el borde, el vapor atrapa la lámpara de calor superior. 4Toma 2: plano lateral de seguimiento mientras se limpia las manos en el delantal, mira directamente al objetivo y dice: "Doce horas. Un cuenco". 5Toma 3: inclinación rápida hacia arriba mientras una tarjeta de título cinética barre el encuadre, tipo blanco condensado que dice "MIDNIGHT BROTH / NO. 07", las letras encajan en su posición un pulso después de que el cucharón golpee la olla. 6 7Energía de cámara en mano, lámpara de calor de tungsteno contra luz de ventana azul fría, acero cepillado mojado, vapor volumétrico, profundidad de campo reducida, grano de 35 mm. 8 9Audio: golpe de cuenco sobre acero, chapoteo de caldo, zumbido de extractor, su línea clara por encima, un golpe de cucharón de madera cuando aparece el título. 10
Configuraciones en el endpoint Gemini Omni Flash Text-to-Video:
- Duración:
5. El rango es de 3 a 10, y la facturación tiene un mínimo de 3 segundos. - Relación de aspecto:
16:9. La única otra opción es9:16. - Resolución:
720p. Esa es toda la enumeración en este endpoint, por lo que no hay una configuración superior a la que recurrir. - Nivel de pensamiento:
default. Ajústalo ahighsolo si un prompt complejo vuelve confuso; intercambia latencia por calidad. - Semilla: déjala en blanco para una semilla aleatoria, o fija un número entero si quieres iterar sobre una toma.
Costo de esta ejecución: max(3, 5) x $0.125 = $0.625, facturado al céntimo. Eso es un 11% por debajo de la línea base de H3.

Playground de Gemini Omni Flash Text-to-Video en Atlas Cloud ejecutando el mismo breve de ramen a 720p con el resultado en SALIDA
Gemini Omni Flash Text-to-Video: breve idéntico, Duración 5, 720p, Nivel de pensamiento en default, Ejecutar cotizando $0.625.

Gemini Omni Flash en los mismos 5 segundos, 1280x720, estéreo de 48 kHz.
También superó la prueba de tipo, que fue la sorpresa genuina. "MIDNIGHT BROTH / NO. 07" se renderiza nítido y se mantiene nítido. Donde difiere es en la dirección: trata las palabras como una superposición que vive a lo largo de varias tomas en lugar de una tarjeta de título que llega en un tiempo, y gasta más de los 5 segundos cortando de lo que lo hace H3. Más barato, más nítido en palabras de lo esperado, más flexible en la lista de tomas. Si tu trabajo es empaquetado donde el título es un momento diseñado, esa diferencia importa. Si es para redes sociales donde las palabras solo deben ser legibles, no importa.
Paso 3: Probar el líder de imagen a video como alternativa a MiniMax H3
Seedance 2.0 posee la tabla de imagen a video, lo que la convierte en la alternativa más recomendada en toda esta categoría. Su endpoint de texto a video ejecuta la misma familia de modelos, por lo que es el tercer asiento justo para un breve idéntico.
text1Un chef de ramen golpea un cuenco terminado sobre un paso de acero en una cocina de medianoche abarrotada, el vapor estalla hacia arriba. 2 3Toma 1: plano bajo en movimiento mientras el cuenco golpea el acero, el caldo tiembla en el borde, el vapor atrapa la lámpara de calor superior. 4Toma 2: plano lateral de seguimiento mientras se limpia las manos en el delantal, mira directamente al objetivo y dice: "Doce horas. Un cuenco". 5Toma 3: inclinación rápida hacia arriba mientras una tarjeta de título cinética barre el encuadre, tipo blanco condensado que dice "MIDNIGHT BROTH / NO. 07", las letras encajan en su posición un pulso después de que el cucharón golpee la olla. 6 7Energía de cámara en mano, lámpara de calor de tungsteno contra luz de ventana azul fría, acero cepillado mojado, vapor volumétrico, profundidad de campo reducida, grano de 35 mm. 8 9Audio: golpe de cuenco sobre acero, chapoteo de caldo, zumbido de extractor, su línea clara por encima, un golpe de cucharón de madera cuando aparece el título. 10
Configuraciones en el endpoint Seedance 2.0 Text-to-Video:
- Duración: cámbiala de
Autoa5. Dejarla en Auto entrega la duración al modelo, y dado que este endpoint factura por píxeles x segundos, también entrega tu factura. - Resolución:
720p. - Relación de aspecto:
16:9, noAuto, para que coincida con las otras dos ejecuciones. - Generar audio: activado. El breve pide sonido, y este es el interruptor que lo produce.
- Modo de tasa de bits:
standard. Marca de agua: desactivada.
Ahora el número que rompe la premisa de todo este término de búsqueda. Seedance 2.0 no factura una tarifa plana por segundo. La página del modelo lo indica claramente: "Por cada segundo de video 720p que generes, se te cobrará $0.2419/segundo. Tu solicitud te costará $0.0112 por cada 1000 tokens. El número de tokens viene dado por (altura del video de salida x ancho del video de salida x (duración de entrada + duración de salida) x 24) / 1024." Mi ejecución de 5 segundos a 720p facturó $1.21968. Eso es más que la línea base de H3 a 2K, en el endpoint que se dice a la mayoría de la gente que use para ahorrar. La propia columna de precio de la tabla de clasificación está de acuerdo, listando Seedance 2.0 720p a $9.07 por minuto frente a los $7.80 de H3.

Playground de Seedance 2.0 Text-to-Video en Atlas Cloud con Duración configurada en 5, Generar audio activado, y el clip terminado en SALIDA
Seedance 2.0 Text-to-Video: mismo breve, Duración 5, 720p, 16:9, Generar audio activado, Marca de agua desactivada. La fórmula de tokens está impresa debajo del panel de SALIDA, que es donde vive el número real.

Seedance 2.0 en los mismos 5 segundos, 1280x720, estéreo de 44.1 kHz.
Y aquí es donde apareció la línea divisoria. La imagen es hermosa, el vapor es el mejor de los tres, y luego llega la tarjeta de título y las letras se revuelven. Avanza fotograma a fotograma en el último segundo: un fotograma se lee como glifos rotos, aproximadamente "MC. VNNUT10", antes de que el siguiente fotograma se resuelva en "MIDNIGHT BROTH / NO. 07". Congela en el fotograma equivocado y tienes una toma inservible. También pasó la mayor parte de sus 5 segundos en el chef parado en lugar de ejecutar las tres tomas que pedía el breve.
Tres ejecuciones, un conjunto de palabras, $2.54 en total. Dos modelos mantuvieron el tipo, uno lo rompió, y esa respuesta habría sido invisible en cualquiera de las tres columnas de Elo.
Tres variaciones que vale la pena ejecutar antes de decidir nada. Cambia la Relación de aspecto a 9:16 y vuelve a ejecutar el mismo breve: el trabajo vertical de póster con tipo es donde el nivel barato se desmorona más rápido, y es una forma rápida de encontrar tu propio piso. Segundo, haz borradores en Seedance 2.0 Mini a $0.056 por segundo hasta que el bloqueo esté bien, luego gasta la tarifa buena solo en la toma que conserves. Tercero, si el aspecto importa más que las palabras, muévete a un endpoint de referencia a video y aliéntalo con imágenes fijas en lugar de adjetivos; H3 acepta hasta 9 imágenes, 3 videos y 3 clips de audio en una sola llamada, y Gemini Omni Flash acepta hasta 10 imágenes de referencia en su propio endpoint de referencia.

Vertical, en forma de póster, impulsado por tipo, de las propias muestras de H3 de MiniMax. Este es el nivel donde "alternativa más barata" deja de ser una frase que puedas terminar.
Lo que realmente cuestan las alternativas a MiniMax H3 por clip terminado
Los precios por minuto de las tablas de clasificación son la tarifa de lista propia del creador a 1080p. Lo que pagas es la tarifa del endpoint multiplicada por los segundos que pediste. Aquí está el mismo clip de 5 segundos en la lista corta, con tarifas leídas el 4 de agosto de 2026.
| Endpoint | Tarifa | Un clip de 5 segundos | Audio nativo |
|---|---|---|---|
| MiniMax H3 Text-to-Video, 2K | $0.14 / s | $0.70 | sí, estéreo |
| Gemini Omni Flash Text-to-Video, 720p | $0.125 / s, mínimo 3s | $0.625 | sí |
| Gemini Omni Flash Video Edit | $0.14 / s | $0.70 | sí |
| Seedance 2.0 Text-to-Video, 720p | token facturado, $0.2419 / s | $1.22, facturado | sí, conmutable |
| Seedance 2.0 Fast | $0.09 / s | $0.45 | sí |
| Seedance 2.0 Mini | $0.056 / s | $0.28 | sí |
| Wan 2.7 Text-to-Video | $0.10 / s | $0.50 | sí |
| Kling V3.0 Turbo, 15% descuento | $0.095 / s | $0.475 | sí |
| HappyHorse-1.1 Text-to-Video | $0.14 / s | $0.70 | sí |
| Veo 3.1 Lite Text-to-Video | $0.05 / s | $0.25 | sí |
Ahora multiplica cada fila por la columna que nadie imprime: intentos por toma utilizable. Un clip de $0.25 que re-ejecutas cuatro veces cuesta $1.00 y una hora de tu noche. El clip de $0.70 que acierta en el segundo intento cuesta $1.40 y ya estás editando. El único número que importa es el costo por toma válida, y no puedes leerlo en una tabla de clasificación. Solo puedes obtenerlo ejecutando tu propio breve dos veces en dos endpoints, que es para lo que sirven los Pasos 1 a 3.
Dos detalles de facturación que vale la pena conocer antes de armar un presupuesto. En Seedance 2.0, una entrada de video reduce la tasa de tokens de $0.0112 a $0.00688 por cada 1000 tokens, lo que equivale aproximadamente a $0.1486 por segundo a 720p, por lo que editar metraje existente es materialmente más barato allí que generar desde cero. Y en cualquier endpoint, sondea el trabajo terminado y luego vuelve a verificar el id de predicción después. El campo de precio a menudo todavía está vacío en el momento en que un trabajo cambia a completado.
La otra forma de responder "¿cuánto cuesta una alternativa?" es dejar de pagar por segundo. H3 es el único modelo de pesos abiertos entre los tres primeros de cualquiera de estas tablas, y los pesos están disponibles. Ese camino es real, y tiene una forma específica.
| Autoalojamiento de H3 | API |
|---|---|
| 768px de borde corto, limitado a 768x1344 | 2K |
| Conjunto de archivos mínimo de una sola tarea alrededor de 42.5 GB; aprox. 498.6 GB para el repo completo | nada que descargar |
| Las tarjetas de consumo lo ejecutan con mucha descarga, con tiempos de renderizado en otra liga | segundos de cola |
| Solo modelo base; la pasada de 2K es una etapa separada | 2K sale de la misma llamada |
| Licencia comunitaria, efectiva el 2 de agosto de 2026 | términos comerciales de tu proveedor |
| Tu interfaz debe mostrar "MiniMax H3" | no es tu problema |
Repo y licencia: MiniMaxAI/MiniMax-H3 en Hugging Face (Hugging Face, agosto de 2026). El lienzo nativo de 768px y la integración ComfyUI desde el día cero están documentados en las propias notas de lanzamiento de ComfyUI.
Lee la licencia antes de planificar un despliegue en ella. La licencia comunitaria efectiva el 2 de agosto de 2026 enumera Territorios Excluidos en la sección I.5: la UE, el Reino Unido, la República de Corea y los Estados Unidos. La sección V.4 extiende esa restricción a las salidas, no solo a los pesos. Más de $20M en ingresos anuales requieren autorización escrita de MiniMax. La sección IV.2 requiere que muestres "MiniMax H3" en tu interfaz, y la sección V.3 prohíbe usar las salidas para entrenar modelos competidores. El repo también incluye un archivo de preguntas y respuestas que describe el alcance del territorio como aún no cubierto en lugar de excluido permanentemente, con una ruta de solicitud. Por separado, y esto se aplica a todos los modelos en este artículo: ninguna licencia de modelo te otorga derechos sobre la cara de alguien, la marca registrada de alguien o la canción de alguien. Esa autorización siempre es tuya.
Preguntas frecuentes
¿Cuál es la mejor alternativa a MiniMax H3 en este momento?
Depende del trabajo, porque tres modelos diferentes ocupan tres puestos #1. Máxima imagen sin sonido: Gemini Omni Flash, 1.324 Elo en la tabla de texto a video sin audio. Animar una imagen fija: Seedance 2.0 720p, 1.196 en imagen a video. Editar metraje que ya tienes: el propio H3 sigue siendo #1 con 1.130, y el respaldo más cercano es Gemini Omni Flash Video Edit, ocho puntos detrás. Todos leídos el 4 de agosto de 2026.
¿Hay una alternativa más barata a MiniMax H3 que aún genere audio nativo?
Sí, pero verifica el endpoint en lugar del titular. Gemini Omni Flash text-to-video a $0.125 por segundo realmente subcotiza los $0.14 de H3, con audio en la misma pasada. Seedance 2.0 no: su facturación de tokens a 720p equivale aproximadamente a $0.2419 por segundo, más alto que H3 a 2K. Si necesitas más barato que ambos y puedes aceptar una bajada de calidad, Seedance 2.0 Mini a $0.056 y Veo 3.1 Lite a $0.05 aún producen sonido.
¿Qué alternativa a MiniMax H3 es mejor para imagen a video?
Seedance 2.0 720p lidera con 1.196, luego Gemini Omni Flash con 1.193, luego H3 con 1.187. Nueve puntos con intervalos de confianza de aproximadamente más o menos 9 es un empate, así que elige por comportamiento en lugar de rango: ejecuta tu propio fotograma fuente en los dos primeros y mira cuál respeta tu primer fotograma en lugar de redibujarlo. Itera primero en Seedance 2.0 Mini, luego gasta la tarifa real en la toma que conserves.
¿Las alternativas a MiniMax H3 renderizan texto en pantalla de manera confiable?
Algunas sí. En el breve idéntico anterior, H3 y Gemini Omni Flash ambos renderizaron "MIDNIGHT BROTH / NO. 07" limpiamente y lo mantuvieron limpio durante el movimiento. Seedance 2.0 produjo un fotograma de glifos revueltos antes de resolverlo, lo que es suficiente para matar una toma. Pruébalo tú mismo con la Toma 3 del breve y avanza fotograma a fotograma: ¿el tipo mantiene su peso? ¿Los bordes sobreviven a la transición? ¿Se deforma una letra cuando la cámara se mueve? Ese único cheque te dice más sobre si puedes cambiar que cualquier columna de Elo, porque para empaquetado, animación de UI y trabajo de videos musicales, es aprobado o reprobado, no mejor o peor.
¿Puedo autoalojar MiniMax H3 en lugar de cambiar a una alternativa?
Técnicamente sí, y es el único modelo entre los tres primeros de estas tablas que puedes hacerlo. Tres cosas que verificar primero. La inferencia local es un borde corto de 768px, no 2K, porque la pasada de 2K es una etapa separada. El conjunto de archivos mínimo de una sola tarea es de alrededor de 42.5 GB, con aproximadamente 498.6 GB para todo el repo. Y la licencia comunitaria actualmente excluye la UE, el Reino Unido, la República de Corea y los Estados Unidos, con una ruta de solicitud documentada en lugar de una barrera permanente.
¿Qué tan difícil es cambiar entre MiniMax H3 y una alternativa?
Depende completamente de cómo integraste. Cuentas separadas significan registros separados, entidades de facturación, esquemas de autenticación, formas de sondeo y manejo de errores por proveedor, y eso es una semana de trabajo que resentirás. Detrás de una API es una cadena de id de modelo y nada más se mueve, por lo que vale la pena echar un vistazo a la lista completa de modelos antes de que la necesites. Conecta el respaldo mientras las cosas están tranquilas. El objetivo de un segundo modelo es que ya funcione el día que el primero no lo hace.






