Seedance 2.5 ya está disponible — Primero en Atlas Cloud

Pesos de código abierto de MiniMax H3: No necesitas una supercomputadora. Puede que necesites un abogado.

Los pesos de código abierto de MiniMax H3 ya están disponibles: 33B parámetros, una descarga mínima de 42.5 GB, dos puntos de control y una licencia cuya cláusula territorial excluye a EE. UU., la UE, el Reino Unido y Corea.

Laptop mostrando código junto a una PC encendida en un escritorio

Un escritorio a las 3 a.m. con una caja de PC abierta, un disco externo y un monitor mostrando una descarga grande en progreso.

Los pesos ya están publicados. Así que respondo las dos preguntas que más respuestas recibieron bajo el anuncio de MiniMax, antes que nada.

No, no necesitas una supercomputadora. Elige los archivos correctos y la descarga es de 42.5 GB, no 123.6 GB. El modelo tiene 33B parámetros, y aproximadamente 13B de esos están en ramas de modulación AdaLN que la inferencia ni siquiera necesita cargar.

Luego abrí el archivo LICENSE. En la línea 10, antes de llegar a la cláusula de ingresos de $20M, hay una lista de países. Mi país está en ella. Probablemente el tuyo también.

Conclusiones clave

  • Los pesos open source de MiniMax H3 están disponibles en Hugging Face como MiniMaxAI/MiniMax-H3, además de un espejo reempaquetado para ComfyUI en Comfy-Org/MiniMax-H3. ComfyUI incluyó soporte nativo el mismo día.
  • No es un solo archivo. Hay dos checkpoints específicos por tarea, fl2va (impulsado por texto e imagen) y ref2va (impulsado por referencia), de 21 GB cada uno en su forma más pequeña. Solo descargas el que necesites para tu trabajo.
  • Transformador denso de flujo único de 33B. La combinación funcional más pequeña es de 42.5 GB, un 66% menos que los 123.6 GB en precisión completa. ComfyUI dice que una tarjeta de 12 GB con descarga dinámica puede ejecutarlo.
  • La generación local es nativamente 768px en el lado corto, no 2K. La resolución 2K se obtiene con un segundo paso de regeneración en contexto.
  • El uso comercial es gratuito, pero debes mostrar "MiniMax H3" en tu interfaz de usuario, y por encima de $20M de ingresos anuales necesitas autorización escrita por separado. Además, el Territorio Aplicable de la licencia excluye la UE, el Reino Unido, Corea del Sur y Estados Unidos. Una API alojada es una relación legal diferente.

Un personaje, ambos checkpoints, una misma 3 a.m. El lado izquierdo es lo que hace fl2va. El lado derecho es lo que hace ref2va. La misma persona, la misma habitación, la misma noche, dos trabajos completamente diferentes, y el zumbido del ventilador que escuchas se genera en el mismo paso que la imagen.

Comparación lado a lado de un hombre trabajando en un escritorio con dos monitores

Izquierda: imagen a video, el trabajo que hace el checkpoint fl2va. Derecha: referencia a video, el trabajo que hace ref2va. Ambos renderizados en MiniMax H3 con audio estéreo nativo. Activa el sonido.

Lo primero que le pedí a este modelo que generara fue un ser humano esperando a que este modelo terminara de descargarse. Me pareció apropiado.

Pesos Open Source de MiniMax H3, Evaluados: Dos Checkpoints y un Piso de 42.5 GB

He aquí por qué este lanzamiento causó revuelo. Artificial Analysis colocó a H3 en el #1 en Edición de Video y entre los tres primeros tanto en texto a video como en imagen a video, y dijo que liberar los pesos "lo convertiría en el modelo de pesos abiertos líder por mucho" (Artificial Analysis, julio de 2026). Eso es un modelo de video de nivel fronterizo con un botón de descarga.

La otra cara honesta: la misma ejecución de referencia muestra a H3 por detrás de Google Gemini Omni Flash en texto a video, y detrás tanto de Seedance 2.0 como de Gemini Omni Flash en imagen a video (South China Morning Post, julio de 2026). Es #1 en edición, no #1 en todo.

Ahora la parte que casi nadie revisó antes de ejecutar git clone.

El conteo de parámetros que nadie puso en un titular. La ficha del modelo describe a H3-Omni-Transformer como "un transformador denso de flujo único de 33B parámetros, con aproximadamente 13B parámetros en ramas relacionadas con AdaLN", y añade que, dado que esas salidas de modulación se pueden precomputar y almacenar en caché, "estos parámetros no necesitan cargarse para una implementación solo de inferencia". De ahí provienen los checkpoints podados. Alrededor del 40% del modelo se convierte en una tabla de búsqueda cuando solo haces inferencia.

Donde la mayoría quema 80 GB por nada. El repositorio oficial MiniMaxAI/MiniMax-H3 tiene 498 GB si descargas todo. El espejo de ComfyUI tiene 343 GB. Ambos contienen todas las variantes de precisión de ambos checkpoints. Necesitas cuatro archivos, no cuatrocientos.

ArchivoTamañoQué esPara qué lo necesitas
minimax_h3_fl2va_pruned_int8_convrot.safetensors20.97 GBCheckpoint fl2va, podado + int8Texto a video, imagen a video
minimax_h3_fl2va_int8_convrot.safetensors34.04 GBfl2va, int8, sin podarLo mismo, mayor fidelidad
minimax_h3_fl2va_bf16.safetensors66.28 GBfl2va, precisión completaAjuste fino, investigación
minimax_h3_ref2va_pruned_int8_convrot.safetensors20.97 GBCheckpoint ref2va, podado + int8Solo referencia a video
minimax_h3_ref2va_int8_convrot.safetensors34.04 GBref2va, int8, sin podarLo mismo, mayor fidelidad
minimax_h3_ref2va_bf16.safetensors66.28 GBref2va, precisión completaAjuste fino, investigación
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.69 GBCodificador de texto, AWQ de 4 bitsCada flujo de trabajo
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27.14 GBCodificador de texto, int8Cada flujo de trabajo
qwen3vl_32b_minimax_h3_bf16.safetensors51.51 GBCodificador de texto, precisión completaCada flujo de trabajo
minimax_h3_video_vae_fp16.safetensors5.21 GBVAE de videoCada flujo de trabajo
minimax_h3_audio_vae_fp32.safetensors0.61 GBVAE de audioCada flujo de trabajo (esto es el sonido)
Conjunto funcional más pequeño, una tarea42.5 GBfl2va podado + codificador nvfp4 + ambos VAELa descarga realista
Ambos checkpoints, el más pequeño63.4 GBAñadir ref2va podadoSi quieres los tres modos
Una tarea en bf16 completo123.6 GBTodo en bf16Solo para equipos de investigación

Tamaños de archivo leídos directamente del índice del repositorio Comfy-Org/MiniMax-H3, agosto de 2026.

El propio encuadre de ComfyUI del mismo número: "huella de memoria total reducida en un 66%, de 123.6 GB en precisión completa a 42.5 GB", que es lo que "permite que un modelo de video 2K de última generación se ejecute localmente en una GPU como la RTX 3060" (ComfyUI, agosto de 2026). Toma la cifra de 12 GB como su afirmación con descarga dinámica, no como un punto de referencia. No lo he ejecutado en una 3060, y la descarga dinámica compra VRAM con RAM del sistema y tiempo de reloj.

Una cosa que "ejecútalo localmente" significa en silencio: 768px. El lienzo nativo de H3 es un lado corto de 768px, con un límite de 768x1344, según el tutorial de H3 de ComfyUI. La duración se ajusta a una cuadrícula de 17 fotogramas por bloque a 24fps. Los clips 2K del marketing provienen de H3-Regenerate-2K, un segundo paso que alimenta el resultado de 768p más el contexto original de vuelta al modelo. La ficha del modelo es explícita en que el sistema completo consta de tres módulos: H3-Context-IR, H3-Base y H3-Regenerate-2K. ComfyUI local te da H3-Base.

Y la palabra "abierto" cumple tres funciones distintas aquí. Descargable, sí. Utilizable comercialmente, condicionalmente. Ejecutable donde vives, eso depende de dónde vivas. El hilo de Reddit que llama a esto "en realidad un modelo de código cerrado" está equivocado en el primer punto y señala algo real en los otros dos. La Sección 7 tiene el texto de la cláusula.

Pesos Open Source de MiniMax H3 Local vs. una API Alojada: Elige Tu Camino

Todo lo que está debajo de esta línea, la demostración completa de cuatro pasos, se ejecuta en una pestaña del navegador en Atlas Cloud, que sirve los tres endpoints de H3 más el modelo de imagen que usé para el fotograma base. Eso no es lo mismo que ejecutar los pesos, y la diferencia importa más de lo habitual con este modelo.

Pesos localesAPI alojada
Costo inicialDescarga de 42.5 GB, una GPU de 12 GB+, una instalación de ComfyUIUna clave de API
Tiempo hasta el primer clipUna noche, optimistamenteUnos dos minutos
Costo por clip de 5 sTiempo de GPU y electricidad$0.70 a $0.14/segundo
Resolución nativa768px lado corto, 2K mediante un paso de regeneración2K directo, es el único valor de enumeración
Ajuste fino, LoRA, modificaciónSí, ese es el objetivoNo
Los datos nunca salen de tu redNo
Exposición a la licenciaAceptas la Licencia Comunitaria y su cláusula de territorioEres cliente de un servicio alojado
Si estás en la UE, RU, Corea o EE. UU.Sección 7No afectado por la licencia de pesos

Regla general: por debajo de unos 100 clips al mes, o si necesitas 2K directamente, o si te encuentras en un Territorio Excluido, la API alojada gana en todos los aspectos. Por encima de eso, o si planeas entrenar sobre el checkpoint, o si el material no puede salir de tu edificio, los 42.5 GB valen la noche.

Precios verificados desde las páginas de modelos en vivo, agosto de 2026. Todos los endpoints de H3 facturan por segundo de salida, sin descuento activo.

ModeloLo que hace aquíPrecioDescuento
MiniMax H3 imagen a videoPaso 2, el trabajo de fl2va$0.14 / seg a 2KNinguno
MiniMax H3 referencia a videoPaso 3, el trabajo de ref2va$0.14 / seg a 2KNinguno
MiniMax H3 texto a videoPaso 4, la línea base sin referencia$0.14 / seg a 2KNinguno
GPT Image 2 texto a imagenPaso 1, el fotograma base$0.009 / imagen listado; la ejecución de alta calidad 16:9 que usé cotiza $0.1745Ninguno
Seedance 2.0 / Wan 2.7 / Kling v3.0 TurboPuntos de referencia por segundo$0.112 / $0.10 / $0.095 por seg15% de descuento en Kling

Una inconsistencia que vale la pena conocer antes de escribir código: el archivo README de H3 aún documenta un nivel de 768p a $0.10/seg y una duración de 5 o 10 segundos. El esquema en vivo no está de acuerdo. resolution tiene exactamente un valor permitido, 2K, y duration acepta cualquier entero de 5 a 15. Escribe contra el esquema. Hay una simetría interesante en esa brecha: el nivel de 768p está desactivado en el lado alojado, y 768p es precisamente el lienzo nativo que obtienes cuando ejecutas los pesos tú mismo.

Paso 1: Generar el Fotograma Base con GPT Image 2

Todo en esta demostración comienza a partir de una sola imagen fija. La escena es deliberadamente evidente: un desarrollador a las 3 a.m. viendo la descarga de un checkpoint de 21 GB.

Modelo: openai/gpt-image-2/text-to-image. Configuración: calidad high, relación 16:9.

plaintext
1Un plano general fotorrealista de una oficina en casa desordenada a las 3 a.m., iluminada solo por dos monitores y el resplandor RGB de una caja de PC abierta sobre el escritorio. Un desarrollador cansado con una sudadera gris está sentado holgadamente en una silla de malla, con la barbilla apoyada en la mano, mirando fijamente el monitor izquierdo. El monitor izquierdo muestra una terminal oscura con una sola barra de progreso de descarga visible en aproximadamente el 78 por ciento. El monitor derecho muestra un explorador de archivos. Una taza de café fría a medio llenar, un teclado mecánico y un pequeño ventilador de escritorio están sobre el escritorio. La lluvia corre por la ventana detrás de él. Profundidad de campo reducida, 35 mm, luz cálida del monitor contrastada con la luz fría de la ventana, grano de sensor visible. Sin superposiciones de texto, sin marcas de agua.
2

No le pidas al modelo de imagen que renderice los nombres de archivo safetensors reales. Las cadenas largas con guiones bajos salen mal. Mantén los nombres de archivo en tus leyendas.

Captura de pantalla de la interfaz del generador de texto a imagen de Atlas Cloud con salida

Espacio de trabajo de GPT Image 2 en Atlas Cloud con el prompt de las 3 a.m. escrito y el fotograma base terminado en el panel de salida.

GPT Image 2 en Atlas Cloud: calidad alta, 16:9, el fotograma base renderizado a la derecha. El nivel de alta calidad cotiza $0.1745 para esta ejecución, muy por encima del piso de lista de $0.009, así que presupuesta por nivel.

Hombre con sudadera mirando dos monitores de computadora por la noche

El fotograma base generado: un desarrollador cansado a las 3 a.m. viendo una barra de descarga en el monitor izquierdo.

La salida del Paso 1. Este único fotograma alimenta los Pasos 2 y 3.

Paso 2: Imagen a Video, el Trabajo que Hace el Checkpoint fl2va

Este es el endpoint que corresponde a minimax_h3_fl2va_pruned_int8_convrot.safetensors. Un primer fotograma de entrada, movimiento y sonido de salida. Localmente, este es el archivo que cargarías; alojado, es una llamada API.

Modelo: minimax/h3/image-to-video. Configuración: image = el fotograma del Paso 1 pasado como una URL de datos, resolution: 2K, duration: 5, ratio: 16:9.

plaintext
1El desarrollador permanece quieto, solo respirando y parpadeando, con los ojos fijos en el monitor izquierdo. La barra de progreso en el monitor izquierdo avanza lentamente. Los ventiladores de la caja se aceleran y su resplandor RGB se vuelve más intenso. Un momento antes del final, exhala y sus hombros se relajan. Cámara fija, sin movimiento de cámara, sin zoom, sin cortes. Audio: un zumbido grave de ventilador de caja que sube de tono, lluvia leve contra la ventana, un suave timbre de dos notas cerca del final.
2

Pasa la imagen como una URL de datos en base64 en lugar de una URL de almacenamiento recién generada. Una URL de objeto nueva puede fallar en la verificación de descarga ascendente. También ten en cuenta que H3 obedece "cámara fija", lo cual no es universalmente cierto en los modelos de video de esta clase.

Captura de pantalla de la interfaz del generador de imagen a video de MiniMax

Espacio de trabajo de MiniMax H3 imagen a video en Atlas Cloud con el fotograma base cargado y un clip 2K completado en el panel de salida.

MiniMax H3 imagen a video: fotograma base cargado, 2K, ejecución completada. Esta captura usó el valor predeterminado del endpoint de 8 segundos, por eso la cotización es de $1.12. Mi clip incrustado a continuación es la versión de 5 segundos a $0.70.

Hombre cansado esperando una barra de carga de computadora por la noche

El trabajo de fl2va: un fotograma de entrada, cinco segundos de movimiento más zumbido de ventilador estéreo de salida.

Paso 3: Referencia a Video, el Trabajo que Hace el Checkpoint ref2va

Checkpoint diferente, archivo diferente, tarea diferente. ref2va no extiende un primer fotograma. Toma material de referencia y construye una nueva toma que mantiene la identidad y los objetos consistentes. Por eso el repositorio incluye dos archivos de 21 GB en lugar de uno.

Le di dos referencias: el fotograma del Paso 1 para la persona y la habitación, y una toma macro de una tarjeta gráfica para el hardware.

Modelo: minimax/h3/reference-to-video. Configuración: refers = ambas imágenes, resolution: 2K, duration: 8, ratio: 16:9.

plaintext
1El mismo hombre, la misma sudadera gris, la misma cara, en la misma oficina en casa oscura. Nueva toma: un plano medio corto desde un lado mientras se reclina en la silla y exhala profundamente, la comisura de su boca se levanta ligeramente. La tarjeta gráfica de la segunda imagen de referencia es visible sobre su hombro, sus ventiladores reduciendo la velocidad, el RGB estabilizándose en un color constante. Mantén su identidad, sudadera, cabello y la iluminación de la habitación consistentes con las imágenes de referencia. Cámara fija. Audio: zumbido de ventilador disminuyendo, una pulsación de tecla, lluvia continuando.
2

refers acepta un arreglo mixto de imágenes, videos y audio, al menos una imagen o video. El audio solo es rechazado. Este endpoint también acepta duraciones hasta 15 segundos.

Una trampa específica en este endpoint: establece ratio explícitamente. Dejarlo en adaptive devolvió 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', cuatro veces seguidas, incluso desde el espacio de trabajo con ambas referencias claramente adjuntas. Con ratio: "16:9" en la llamada API, funcionó a la primera. Esta es también la razón por la que la captura de pantalla a continuación es la imagen de referencia en lugar de una captura del espacio de trabajo: no pude sacar el control de Relación de Aspecto del espacio de trabajo de adaptive, así que el clip que ves aquí provino de la API con la configuración anterior, no de una ejecución en el espacio de trabajo.

Una tarjeta gráfica de tres ventiladores montada verticalmente dentro de una caja de computadora

La segunda imagen de referencia: una toma macro de una tarjeta gráfica de tres ventiladores dentro de una caja de PC abierta por la noche.

Imagen de referencia 2, generada en el mismo lote que el fotograma base, pasada junto con el fotograma del Paso 1.

Hombre escribiendo en un escritorio con dos monitores por la noche

El trabajo de ref2va: una toma nueva, no una continuación. El mismo hombre, la misma sudadera, la misma habitación, y la tarjeta gráfica de la referencia 2 ahora en el cuadro con sus ventiladores reduciendo la velocidad. Nótese que interpretó "plano medio corto" de manera laxa y se mantuvo bastante amplio.

Paso 4: Texto a Video, la Línea Base de los Pesos Open Source de MiniMax H3

La misma escena, descrita en palabras, sin ninguna referencia. Este paso existe para mostrar lo que realmente hacen los dos checkpoints.

Modelo: minimax/h3/text-to-video. Configuración: ratio es obligatorio aquí y no puede ser adaptive, así que 16:9. resolution: 2K, duration: 5.

plaintext
1Un desarrollador cansado con una sudadera gris a las 3 a.m. en una oficina en casa desordenada, iluminada por dos monitores y el resplandor RGB de una caja de PC abierta, viendo una barra de progreso de descarga que avanza lentamente en la pantalla izquierda. Lluvia en la ventana detrás de él. Toma fija de 35 mm, profundidad de campo reducida, luz cálida del monitor contra luz fría de la ventana, grano de película. Audio: zumbido creciente de ventilador de caja, lluvia leve, un suave timbre de finalización al final.
2

Interfaz de IA de texto a video mostrando prompt y salida de video generada

Espacio de trabajo de MiniMax H3 texto a video en Atlas Cloud con el prompt escrito y un clip completado en el panel de salida.

MiniMax H3 texto a video: sin material de referencia, 2K, Relación de Aspecto configurada en 16:9 porque adaptive es rechazado aquí, ejecución completada. El mismo prompt, y ya una cara diferente a la del Paso 2.

Hombre con sudadera gris mirando una pantalla de computadora por la noche

Las mismas palabras, humano diferente. Buena habitación, persona equivocada. Esa brecha es todo el argumento de que fl2va y ref2va existan como checkpoints separados.

Una nota operativa si automatizas los tres: la concurrencia ascendente es aproximadamente una tarea. Los trabajos superpuestos devuelven 429 rate limit exceeded (task concurrency). Ejecútalos en serie. Un clip 2K de 5 segundos tomó unos dos minutos cada vez.

Lo que Cuestan los Pesos Open Source de MiniMax H3, y lo que Realmente Dice la Licencia

La pregunta del costo tiene dos monedas. Alojado, un clip 2K de 5 segundos cuesta $0.70 y uno de 15 segundos $2.10, por segundo, sin niveles, sin descuento. Local, la moneda son gigabytes y horas: 42.5 GB de descarga, una tarjeta que pueda soportarlo, y un lienzo de 768px a menos que también ejecutes el paso de regeneración. En algún punto por encima de unos cientos de clips al mes, la aritmética cambia. Por debajo de eso, generalmente no.

Luego está la tercera moneda, que es el tiempo de revisión legal. Leí todo el LICENSE. Esto es lo que contiene.

Un portátil abierto y una pila de papeles iluminados por una lámpara de escritorio

Una lámpara de escritorio iluminando un portátil que muestra un documento de texto denso, junto a una impresión resaltada, gafas de lectura y un vaso de agua.

La parte de un lanzamiento de pesos abiertos que nadie captura para el hilo de lanzamiento.

CláusulaSecciónLo que diceLo que significa para ti
Territorio AplicableI.3, I.5Mundial, "excluyendo los Territorios Excluidos", definidos como "la Unión Europea, el Reino Unido, la República de Corea y los Estados Unidos de América"La licencia comunitaria no te otorga derechos donde vive la mayoría de los lectores de este artículo
Prohibición de uso territorialV.4No puedes "usar, reproducir, modificar, distribuir o mostrar las Obras MiniMax H3 o cualquiera de sus Salidas o resultados fuera del Territorio Aplicable"Alcanza las Salidas, no solo los pesos
Canal de licencia separadoIIMiniMax "evaluará continuamente las leyes aplicables" e invita a las partes en regiones excluidas a contactarlos para obtener una licenciaEs "todavía no", no "nunca". El repositorio incluye un formulario de solicitud
AtribuciónIV.2Debes "mostrar de manera prominente 'MiniMax H3' en la interfaz de usuario" de cualquier producto comercial que lo utiliceUn cambio en la interfaz, no una nota al pie
Umbral de ingresosIV.1Por encima de $20 millones de ingresos anuales necesitas autorización escrita previa de [email protected]El uso comercial gratuito tiene un techo
Sin lavado de modeloV.3No puedes usar H3 o sus Salidas "para mejorar cualquier otro modelo de inteligencia artificial"Descarta la destilación en tu propio modelo
RedistribuciónIII.1, III.4Entrega el acuerdo con él, incluye un archivo NOTICE, marca los archivos modificadosEstándar, pero también vincula a los usuarios posteriores
Codificador de textoNota adicionalEl codificador es Qwen3-VL-32B bajo Apache 2.0Un componente de la pila es genuinamente abierto según OSI
Ley aplicableIXLey de la RAE de Hong Kong, jurisdicción exclusiva de Hong KongVale la pena una línea en tu registro de riesgos

La fecha de vigencia del acuerdo es el 2 de agosto de 2026 (Hugging Face, agosto de 2026).

La mayoría de la cobertura del lanzamiento se centró en "pesos abiertos" y se detuvo ahí. Para crédito de MiniMax, no lo ocultaron: el repositorio incluye su propio docs/QA-about-License.md explicando que los modelos de video enfrentan un panorama regulatorio que se mueve más rápido que los modelos de texto, nombrando la Ley de IA de la UE, las reglas del Reino Unido y Corea del Sur, y el litigio de derechos de autor en curso en EE. UU. sobre video generativo, y declarando claramente que "la limitación actual significa 'todavía no', no 'nunca'". El mismo documento confirma la división que importa operativamente: la API se mantiene disponible globalmente porque MiniMax controla la infraestructura de servicio, mientras que los pesos abiertos dejan ese control atrás.

Por lo tanto, si estás en San Francisco, Berlín, Londres o Seúl, la lectura práctica no es "nunca puedes tocar H3". Es "esta licencia en particular no es el instrumento que te permite ejecutar estos pesos en tu propia máquina". Solicita la licencia separada, o usa un endpoint alojado, donde eres cliente de un servicio en lugar de licenciatario de los pesos.

No soy abogado y esto no es un consejo legal. El texto de la cláusula anterior está citado para que tu asesor legal real pueda leer el original en unos diez minutos.

Pesos Open Source de MiniMax H3: Preguntas Frecuentes

¿Los pesos open source de MiniMax H3 están realmente disponibles y dónde los descargo?

Sí, desde principios de agosto de 2026. Dos lugares. MiniMaxAI/MiniMax-H3 es el repositorio oficial, alrededor de 498 GB, que contiene el pipeline en formato diffusers, ambos transformadores, el codificador de texto, ambos VAE, documentos y scripts reproducibles. Comfy-Org/MiniMax-H3 es la compilación reempaquetada para ComfyUI, alrededor de 343 GB en total, con los checkpoints cuantizados de un solo archivo que la mayoría de la gente realmente quiere. Si estás ejecutando ComfyUI, usa el segundo y descarga cuatro archivos.

¿Cuántos parámetros tiene MiniMax H3 y necesito una supercomputadora?

33B, en un transformador denso de flujo único. Alrededor de 13B de eso está en ramas relacionadas con AdaLN cuyas salidas se pueden precomputar y almacenar en caché, por lo que las implementaciones solo de inferencia no necesitan cargarlas. De ahí provienen los checkpoints "podados". No necesitas una supercomputadora. Una descarga de 42.5 GB y una GPU de consumo seria.

¿Puedo ejecutar los pesos open source de MiniMax H3 en 12 GB o 16 GB de VRAM?

El equipo de ComfyUI dice que una tarjeta de 12 GB puede hacerlo con descarga dinámica, usando el checkpoint fl2va int8 podado más el codificador de texto nvfp4 AWQ. Esa es su afirmación, no un punto de referencia que yo haya ejecutado. Dos advertencias: la descarga dinámica intercambia VRAM por RAM del sistema, así que presupuesta 64 GB de RAM y espera tiempos de renderizado largos, y tu lienzo local es de 768px en el lado corto, no 2K.

¿Los pesos open source de MiniMax H3 son realmente de código abierto, o solo pesos abiertos?

Pesos abiertos, precisamente. Los pesos son descargables y modificables, lo que es más de lo que cualquier modelo de video fronterizo ofrecía hace un año. Pero la licencia no está aprobada por OSI, la receta de entrenamiento y los datos no se publican, el uso comercial conlleva condiciones de atribución e ingresos, y la cláusula de territorio restringe dónde se aplica la concesión. El único componente genuinamente abierto es el codificador Qwen3-VL-32B bajo Apache 2.0. Tres capas separadas, y "abierto" solo describe claramente la primera.

¿Puedo usar los pesos open source de MiniMax H3 comercialmente y qué significa la línea de $20M?

Sí, con dos condiciones. Debes mostrar de manera prominente "MiniMax H3" en la interfaz de usuario del producto comercial (Sección IV.2). Y si tus productos y servicios comerciales generan más de $20 millones en ingresos anuales, necesitas autorización escrita previa por separado de MiniMax antes de usarlo, solicitada en [email protected] (Sección IV.1). El umbral está en tus ingresos, no en tu uso de H3.

¿Por qué la licencia de MiniMax H3 excluye EE. UU. y la UE, y cuáles son mis opciones?

Según las propias preguntas frecuentes de la licencia de MiniMax, porque la generación de video se encuentra en un entorno regulatorio que se mueve más rápido que el texto, específicamente la Ley de IA de la UE, las reglas en evolución del Reino Unido y Corea del Sur, y el litigio activo de derechos de autor en EE. UU. sobre video generativo. Una vez que los pesos son públicos, no pueden hacer cumplir salvaguardas posteriores, así que delimitaron la concesión en lugar de retrasar el lanzamiento. Opciones en una región excluida: solicita una licencia separada a través del formulario en el repositorio, o usa una API alojada, que es una relación legal diferente y permanece disponible globalmente. Pide a tu asesor legal que confirme cuál se ajusta antes de implementar.


Verificado el 3 de agosto de 2026. Tres cosas en la lista de seguimiento: cuantificaciones GGUF comunitarias y de bits más bajos (ninguna existe para H3 aún), cualquier cambio en la lista de Territorios Excluidos, y si el nivel alojado de 768p que el README aún documenta regresa alguna vez.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos