MiniMax lanzó H3 el viernes. En menos de veinticuatro horas, Seedance 2.5 estaba en manos de la gente, y la línea de tiempo colapsó en una sola conversación: treinta segundos, 4K nativo, cincuenta entradas de referencia. La publicación de lanzamiento de H3 quedó debajo, en silencio, con casi nadie ejecutando una prueba real.
Entiendo por qué. Treinta segundos es un número excelente. Encaja en un titular.
Pero si realmente produces dramas cortos verticales, sabes que lo que arruina tu noche no es el segundo treinta. Es el plano 4. La mandíbula del protagonista masculino se desplaza medio centímetro, su corbata pierde un pliegue, y el espectador desliza el dedo antes de que el gancho aterrice. Nadie abandona porque un clip durara quince segundos en lugar de treinta. Abandonan porque el tipo del primer plano no es el tipo del plano general.
Así que me salté el duelo de especificaciones. Construí una hoja de referencia de personaje, un tablero de localización de seis paneles, escribí un prompt de drama corto gótico de quince segundos y envié el paquete idéntico a ambos lados. Luego me quedé mirando la cara.
Conclusiones clave
- Ambos son reales, pero no igualmente accesibles. Los tres endpoints de H3 (texto, imagen y referencia a video) están activos y se pueden llamar ahora mismo. La API de Seedance 2.5 está disponible en ByteDance, pero en la plataforma multimodelo donde ejecuté todo sigue siendo una página del Día 0, por lo que el lado de Seedance en mi cara a cara es Seedance 2.0 Referencia a Video. Lo señalo en todas partes donde sea relevante.
- Las especificaciones se dividen claramente. Seedance 2.5 = hasta 30 segundos en una generación, 4K nativo, hasta 50 referencias multimodales, edición a nivel de región. H3 = 5 a 15 segundos, 2K nativo a 24 fps, 9 imágenes + 3 videos + 3 clips de audio (12 archivos como máximo), audio estéreo en cada salida, edición de instrucciones para todo el clip.
- La estabilidad del personaje es un problema de empaquetado, no de generación del modelo. Con una hoja de referencia compuesta y un tablero de iluminación, ambos modelos mantuvieron la misma cara y el mismo vestuario. Ningún número de generación salvó o arruinó el plano; el paquete lo hizo.
- El modelo que nadie probó ya está clasificado en tercer lugar. En el arena de imagen a video de Artificial Analysis, H3 se sitúa con 1185 Elo, detrás de Seedance 2.0 con 1196. Seedance 2.5 aún no aparece en el tablero.
- Ambos generan su propio audio. H3 también acepta hasta tres referencias de audio para asignar una voz a un personaje, lo que elimina toda una etapa de TTS y sincronización en un pipeline de drama corto.
- Pregunta por píxeles por fotograma, no por segundos. Mismo paquete de referencia, misma duración: la referencia a video de H3 devuelve 1440p, la de Seedance 2.0 devuelve 720p. Eso replantea toda la cuestión del costo.
Los números emparejados de Seedance 2.5 aún no están disponibles. Los agregaré el día que se abra el endpoint donde pruebo.
El resultado de Seedance 2.5 vs MiniMax H3, antes de cualquier teoría
Antes de cualquier teoría, aquí está lo que produce el flujo de trabajo. Estos son cuatro planos extraídos de un clip vertical terminado de 15 segundos y dispuestos en mosaico. Es la ejecución de referencia de H3 de MiniMax, construida exactamente a partir de la hoja de personaje y el tablero de localización que verás en el Paso 1 y el Paso 2, en 1440x2560 nativo. Mis propias ejecuciones del mismo paquete aparecen más adelante, en el tutorial, con el estado del playground visible.
XSnfiquLLMk
Ella llega a la puerta tallada, que es el panel 4 del tablero de localización, luego el enfrentamiento en el pasillo, luego un primer plano cerrado de él, luego el plano de los dos. La línea del cabello de él se separa de la misma manera en el perfil y en el primer plano. La corona trenzada medio recogida de ella sobrevive a un primer plano de rostro completo, que es exactamente donde la mayoría de los modelos reconstruyen silenciosamente una cara. El corpiño de encaje crema mantiene el mismo escote y puño de manga desde el primer fotograma hasta el último.
Esa es toda la prueba. No treinta segundos. Cuatro planos y una mandíbula.
Por qué Seedance 2.5 vs MiniMax H3 se lanzaron la misma semana, y por qué la mayoría de las pruebas de personajes son inútiles
MiniMax lanzó H3 el 30 de julio, un modelo de video multimodal de propósito general que lee texto, imágenes, video y audio como un solo contexto y devuelve clips de 5 a 15 segundos en hasta 2K con sonido estéreo nativo. También puede editar material existente y transferir movimiento de un clip a otro, y MiniMax dijo que los pesos seguirían en días (Reuters, julio de 2026).
Seedance 2.5 aterrizó en la misma ventana con un número más llamativo: 30 segundos en una sola generación, 4K nativo y hasta 50 entradas de referencia multimodales en un solo trabajo (The Next Web, julio de 2026). Su API ya está en manos de los desarrolladores, con edición localizada que redibuja parte de un fotograma mientras deja intactos el rendimiento, la iluminación y el comportamiento de la cámara, referencia a video que acepta placas de croma o maquetas 3D en blanco, once idiomas y un modo de video largo experimental que alcanza los 180 segundos (CineD, julio de 2026).
9HprrI3lQK4
La brecha de atención es la parte interesante. Casi todas las publicaciones que pude encontrar eran un clip de 2.5. Mientras tanto, los números del arena público dicen otra cosa: en el tablero de imagen a video de Artificial Analysis, Seedance 2.0 a 720p lidera con 1196 Elo, Gemini Omni Flash le sigue con 1195, y MiniMax H3 ya es tercero con 1185, cuatro días después de su lanzamiento. Seedance 2.5 aún no tiene calificación allí (Artificial Analysis, julio de 2026). El modelo con menos ruido es el que tiene la mayor relación de puntuación a atención.
Ahora la parte que realmente decide tu resultado, porque tiene casi nada que ver con qué logotipo elijas.
La mayoría de las pruebas de consistencia de personajes fallan antes de que el modelo siquiera participe. Cuatro modos de fallo, y los cuatro son tuyos para solucionar:
| Modo de fallo | Lo que ves en la salida | La solución |
|---|---|---|
| Referencias multivista enviadas como archivos separados | La cara de cada plano es "casi correcta" y ninguna coincide | Compón las vistas en una sola imagen, luego asigna roles en el prompt ("el hombre a la IZQUIERDA", "la mujer a la DERECHA") |
| Reescribir la descripción del personaje por plano | El vestuario y los accesorios se desvían de un plano a otro | Escribe el bloque de identidad una vez y reutilízalo textualmente; solo cambian la cámara y la acción por plano |
| Dejar que la iluminación se mueva con la escena | La cara se reconstruye estructuralmente con la nueva luz | Construye un tablero de localización separado que fije la dirección de la luz, la niebla y el reflejo del suelo, y úsalo como referencia |
| Tratar la duración máxima como una métrica de calidad | Una deriva dentro de 30 segundos arruina los 30 | Corta a la granularidad que puedas re-rodar, luego habla de longitud |
La primera fila es la que la gente se equivoca más. Envía seis imágenes de una sola vista y el modelo las trata como seis personas candidatas y las promedia. Envía un compuesto limpio y las trata como una persona vista desde tres lados. Mismos píxeles, resultado completamente diferente.
2jp1CC7nfUM
Ficha técnica de Seedance 2.5 vs MiniMax H3, y lo que realmente puedes usar hoy
Separa la capacidad de la disponibilidad y la tensión se vuelve clara. En capacidad bruta, Seedance 2.5 lidera en duración, techo de resolución, cantidad de referencias y granularidad de edición. En disponibilidad, H3 es el que tiene tres endpoints activos en una plataforma de modelo de propósito general esta semana. Si estás haciendo comparación de modelos de video IA para la planificación de 2026, esa segunda columna importa tanto como la primera.
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 Ref-to-Video (lo que ejecuté) | |
|---|---|---|---|
| Duración máxima, una generación | 5 a 15 s | hasta 30 s, sin unión (modo beta hasta 180 s, experimental) | menú de clips cortos, ver página del modelo |
| Resolución | 2K nativo, 1440p lado corto en 16:9 a 9:16; se menciona un nivel de 768p próximo | 4K nativo, color de 10 bits | hasta 720p en este endpoint |
| Velocidad de fotogramas | 24 fps | no publicado por separado | no publicado por separado |
| Entradas de referencia | 9 imágenes + 3 videos + 3 audio, 12 archivos en total | hasta 50 referencias multimodales | 9 imágenes + 3 videos + 3 audio |
| Audio nativo | sí, cada salida, estéreo | sí, más 11 idiomas de subtítulos y voz | sí |
| Granularidad de edición | ediciones de instrucciones para todo el clip (cambiar personaje, fondo, iluminación, diálogo) | ediciones a nivel de región que redibujan parte de un fotograma | ediciones de instrucciones para todo el clip |
| Límite de prompt | 7000 caracteres | no publicado | no publicado |
| Pesos abiertos | anunciado para días después del lanzamiento | no anunciado | no anunciado |
| Elo I2V de Artificial Analysis, 31 jul 2026 | 1185 (3.º) | aún no calificado | 1196 (1.º, entrada Dreamina 720p) |
| Disponible en la plataforma que probé | sí, 3 endpoints | aún no, página del Día 0 | sí |
Divulgación completa sobre la configuración de prueba. Seedance 2.5 no estaba abierto en mi plataforma cuando ejecuté esto, por lo que el lado de Seedance es Seedance 2.0 Reference-to-Video, el miembro actualmente en envío de la misma familia con el mismo sistema de referencia cuadrimodal. Donde 2.5 cambiaría la respuesta, lo digo. La página de Seedance 2.5 es un aviso del Día 0 por ahora.
Todo lo siguiente se ejecuta en una pestaña del navegador, con una clave, tres modelos en total:
| Paso | Modelo | Lo que produce | Ajustes clave | Lo que determina el costo |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 Text-to-Image | la hoja de referencia del personaje | calidad alta, 16:9 | por imagen, pago por uso, tarifa actual en la página del modelo |
| 2 | mismo modelo, segunda ejecución | el tablero de localización e iluminación de seis paneles | calidad alta, 16:9 | por imagen, pago por uso |
| 3 | MiniMax H3 Reference-to-Video | el clip 9:16 con audio nativo | 9:16, 2K, duración 5 para prueba y 15 para el corte real | segundos x resolución, facturado por segundo |
| 4 | Seedance 2.0 Reference-to-Video | la ejecución de control, entradas idénticas | 9:16, resolución máxima disponible, misma duración | segundos x resolución, facturado por segundo |
| 5 | H3 Reference-to-Video, clip como entrada | un plano fijo sin re-rodar todo | misma resolución, duración corta | segundos x resolución, facturado por segundo |
H3 también tiene entradas de texto a video e imagen a video si quieres una línea base de texto puro o control de primer y último fotograma.
Una cosa más que vale la pena saber antes de planificar un lote: texto en pantalla. Esta secuencia de título de 15 segundos de H3 mantiene créditos en inglés a través de ocho cortes duros sin una sola falta de ortografía, que es una de las cosas más difíciles de mantener estable en video generado.
hwooYYPRW5o
El flujo de trabajo de drama corto de Seedance 2.5 vs MiniMax H3, paso a paso
Cinco pasos. Copia los prompts exactamente como están escritos, incluidas las partes feas. No los limpié para el artículo y no deberías limpiarlos para el modelo.
Paso 1: Construye la hoja de personaje con GPT Image 2
Haz el paquete de referencia antes de hacer cualquier video. Una imagen, dos personajes, tres vistas cada uno, fondo blanco puro sin costuras, iluminación de estudio uniforme. Eso elimina toda ambigüedad excepto la que te importa: ¿cómo es esta persona?
plaintext1Una hoja de referencia de personaje de cuerpo completo sobre un fondo blanco puro sin costuras, dos personajes lado a lado, seis figuras en total, iluminación de estudio neutra y uniforme, sin sombras en el suelo, sin texto, sin etiquetas, sin marca de agua. 2 3MITAD IZQUIERDA, protagonista masculino, tres vistas en fila: frente, perfil derecho, espalda. Finales de los 20, tez pálida, cabello oscuro ondulado de longitud media, mandíbula marcada. Viste un abrigo de terciopelo negro hasta el suelo con bordados sutiles tono sobre tono en las solapas y puños, un chaleco de brocado negro, una corbata de seda negra, pantalones negros rectos, zapatos de piel negra pulidos. Brazos relajados a los lados, expresión neutra. 4 5MITAD DERECHA, protagonista femenina, tres vistas en fila: frente, perfil derecho, espalda. Principios de los 20, tez clara, cabello largo ondulado castaño claro con una corona trenzada medio recogida. Viste un vestido victoriano de encaje crema de algodón, mangas largas con puños de encaje, corpiño ajustado con botones pequeños, falda completa hasta el tobillo, zapatos de tacón bajo con correa al tobillo color crema. Brazos relajados a los lados, expresión neutra. 6 7Realismo fotográfico, escala consistente entre las seis figuras, pies alineados en la misma línea base, enfoque nítido de borde a borde.
Ajustes: modelo OpenAI GPT Image 2 Text-to-Image, Calidad alta, Relación de aspecto 16:9, todo lo demás por defecto.
GPT Image 2 Text-to-Image en Atlas Cloud, ejecución completada: el prompt de referencia a la izquierda, seis figuras en una hoja blanca en el panel OUTPUT.
Esta es la forma objetivo. Seis figuras, una línea base, nada en el fondo que discutir:
El paquete de referencia que impulsó el clip de demostración: protagonista masculino en terciopelo negro, protagonista femenina en encaje victoriano crema, tres vistas cada uno, un archivo.
Mi propia ejecución de GPT Image 2 del prompt del Paso 1, para comparación con la referencia anterior.
Paso 2: Fija la localización con un tablero de escena de seis paneles
Sujetaste la cara. La luz aún te traicionará. La segunda imagen de referencia fija seis posiciones de cámara, la dirección de la luz de luna, cuánta niebla hay en el aire y qué tan húmedo se lee el suelo. Le estás diciendo al modelo que esta película tiene exactamente una configuración de iluminación.
plaintext1Un tablero de localización cinematográfica de seis paneles, 2 filas por 3 columnas, finos separadores negros entre paneles, cada panel subtitulado en letras mayúsculas blancas pequeñas y elegantes con espaciado en la parte inferior de ese panel. Tema: el interior de un castillo gótico abandonado por la noche. Luz de luna azul fría, niebla baja a la deriva, suelo de piedra reflectante mojado, vidrieras altas, candelabros de hierro con pequeñas llamas cálidas, negros profundamente desaturados, cortinas de terciopelo pesadas. Sin personas en ningún panel. 2 3Panel 1, subtítulo "VISTA GENERAL AMPLIA - PASILLO": un pasillo largo con columnas que se aleja hacia una vidriera iluminada. 4Panel 2, subtítulo "ÁNGULO BAJO - LUZ DE LUNA CRUZANDO EL SUELO": cámara baja, un haz de luz de luna que barre losas mojadas. 5Panel 3, subtítulo "COMPOSICIÓN DE PUERTA Y ESCALERA": una puerta arqueada que enmarca una escalera de piedra curva. 6Panel 4, subtítulo "DETALLE CERCANO - PUERTA TALLADA": plano cerrado de una puerta de madera tallada pesada con un tirador de hierro. 7Panel 5, subtítulo "VISTA JUNTO A LA VENTANA - NIEBLA Y CORTINAS": ventana alta, niebla entrando, borde de cortina en primer plano. 8Panel 6, subtítulo "FOTOGRAMA FINAL DE CARTEL - SALÓN VACÍO": salón vacío simétrico, alfombra de pasillo estampada que lleva a la ventana. 9 10Fotográfico, cinematográfico, grano de película, gradación de color consistente en los seis paneles.
Ajustes: mismo modelo, Calidad alta, Relación de aspecto 16:9.
El tablero de localización que impulsó el clip de demostración: seis interiores de castillo gótico, una gradación de color, subtítulos legibles.
Mi propia ejecución de GPT Image 2 del prompt del tablero del Paso 2.
Paso 3: Genera el plano con MiniMax H3 referencia a video
Dos imágenes de referencia más un prompt que lleva las posiciones de cámara y la dirección de audio. El sonido se produce en la misma pasada, por lo que no hay un paso separado de voz o música. Mantén la duración corta mientras ajustas, luego auméntala a 15 para el corte real.
plaintext1La imagen de referencia 1 es la hoja de personaje: el hombre a la IZQUIERDA es el protagonista masculino, la mujer a la DERECHA es la protagonista femenina. Mantén ambas identidades exactamente como se muestran: su mandíbula, cabello oscuro ondulado, abrigo de terciopelo negro, chaleco de brocado negro y corbata de seda negra; su cabello castaño claro medio recogido con trenza y vestido de encaje victoriano crema. La imagen de referencia 2 es el tablero de localización e iluminación: iguala su luz de luna azul fría, niebla a la deriva, suelo de piedra reflectante mojado y tonos negros desaturados. 2 39:16 vertical, aspecto de drama corto de acción real premium, profundidad de campo reducida, contraste cinematográfico, sin subtítulos, sin texto en pantalla, sin marca de agua. 4 5Plano 1: Plano medio cerrado, cámara acercándose lentamente. La protagonista femenina está de pie en el pasillo iluminado por la luna, respirando superficialmente, con los ojos fijos en algo fuera del encuadre a la derecha. La niebla se mueve a su alrededor a la altura de la rodilla. 6Plano 2: Corte brusco. Plano por encima del hombro desde detrás de ella, el protagonista masculino sale del arco oscuro hacia la luz de la luna, el abrigo atrapando la luz, expresión fría y curiosa. 7Plano 3: Primer plano cerrado de su rostro, medio iluminado por la ventana, luego un primer plano equivalente del de ella mientras se niega a apartar la mirada. 8 9Audio: zumbido grave sostenido, eco de piedra distante, su respiración irregular, una pisada pesada cuando él entra en la luz, un solo crescendo suave de cuerdas en el último corte.
Ajustes: modelo MiniMax H3 Reference-to-Video, Resolución 2K, Duración 8 (el valor predeterminado del control deslizante; aumenta a 15 para el corte real), Relación de aspecto adaptativa, y ambos archivos en Materiales de Referencia. El panel los cuenta como 2 de 9, por lo que tienes suficiente espacio para agregar placas de vestuario o utilería más tarde.
Vale la pena señalar lo que sucedió con la relación. Dejé Relación de aspecto en adaptativa y solo escribí "9:16 vertical" dentro del prompt. H3 devolvió vertical de todos modos, por lo que leyó el encuadre del texto en lugar de necesitar el campo de formulario.
MiniMax H3 Reference-to-Video en Atlas Cloud, ejecución completada: ambos archivos de referencia cargados como 2 de 9, resolución 2K, y el clip vertical generado reproduciéndose en el panel OUTPUT.
El primer fotograma es la protagonista femenina con el corpiño de encaje crema, de pie en el pasillo del panel 1 del tablero, con niebla a la altura de la rodilla y la luz de la luna golpeando el suelo mojado exactamente donde el tablero la colocó. Ambas imágenes de referencia aterrizaron.
Paso 4: Ejecuta el control de Seedance 2.5 vs MiniMax H3 con el paquete idéntico
No cambies ni una palabra. Las mismas dos imágenes de referencia, el mismo prompt, modelo diferente. Dejé la duración predeterminada de cada página sola en lugar de forzar una coincidencia, y digo lo que devolvió cada uno a continuación. Reformular un prompt "para" el otro modelo es exactamente cómo las comparaciones comienzan a mentir.
plaintext1Mismo prompt que el Paso 3, textualmente. No lo reformules para el otro modelo.
Ajustes: modelo Seedance 2.0 Reference-to-Video, Resolución 720p, mismas dos imágenes de referencia en Imágenes de Referencia (de nuevo 2 de 9, con ranuras separadas para hasta 3 videos de referencia y 3 archivos de audio de referencia). Duración dejada en el valor predeterminado de la página, que devolvió un clip de 10 segundos.
Seedance 2.0 Reference-to-Video en Atlas Cloud, ejecución completada con el paquete de referencia y prompt idénticos del Paso 3, y un resultado de 10 segundos en el panel OUTPUT.
Esto es lo que mostraron los dos paneles OUTPUT, y lo informo de manera plana en lugar de elegir un ganador.
Ambas ejecuciones mantuvieron el personaje. Mismo vestido de encaje crema con el mismo escote y puños, mismo cabello castaño claro, mismo pasillo de niebla y luz de luna extraído del tablero. Ninguno inventó una mujer diferente. El paquete de referencia hizo ese trabajo en ambos lados, que es el hallazgo que más me importa.
Las diferencias fueron sobre la forma, no la cara. Este endpoint de Seedance entregó 720p; H3 entregó 2K con entradas idénticas. Y el encuadre se dividió: H3 leyó "9:16 vertical" directamente del texto del prompt y devolvió vertical, mientras que la ejecución de Seedance devolvió 16:9 porque esa página lleva su propio control de relación de aspecto y el texto del prompt solo no lo anuló. Si estás cortando para TikTok, esa diferencia te costará una ejecución la primera vez que olvides el campo de formulario. Seedance 2.5 probablemente cambiaría la mitad de la resolución de esto y agregaría re-rodados a nivel de región, y no voy a pretender que medí eso.
Paso 5: Arregla un plano sin re-rodar todo el clip
El costo real de un drama corto no es la generación uno. Es la revisión siete. H3 acepta un clip existente como entrada y edita según las instrucciones, manteniendo lo que no mencionaste. La propuesta de Seedance 2.5 aquí es más fina: redibujar una región del fotograma y dejar el rendimiento, la iluminación y la cámara intactos.
plaintext1Usando el clip proporcionado: mantén los dos personajes, su vestuario, los movimientos de cámara y el ritmo de corte exactamente como están. Cambia solo el entorno, reemplaza el pasillo de piedra iluminado por la luna por el salón de baile del mismo castillo, ventanas altas arqueadas, una lámpara de araña encendida y luz de velas cálida, y vuelve a iluminar a ambos personajes para que su luz clave provenga de la lámpara de araña en el lado izquierdo del encuadre en lugar de la ventana. Reescribe su única línea hablada a "Nunca estuviste dormido, ¿verdad?". Mantén el tiempo de su actuación en los mismos compases.
Ajustes: MiniMax H3 Reference-to-Video con el clip del Paso 3 como entrada de referencia, Duración 5, Resolución 2K.
zAxBQmHOR5I
Más allá de la prueba de Seedance 2.5 vs MiniMax H3: Cuatro formas de potenciar un paquete de referencia
Mismo personaje, siguiente episodio. Guarda la hoja del Paso 1 como un activo y cambia solo la lista de planos y el bloque de historia en el prompt. La identidad proviene de un archivo, no de tu memoria de cómo lo redactaste el martes pasado.
oH2bSNhK0mY
Fija también la voz. H3 toma hasta tres referencias de audio, de 2 a 15 segundos cada una, y deben acompañar a una entrada de imagen o video. Dale una muestra de voz y el personaje hablará con ese timbre, por lo que no tendrás que volver a asignar un actor de voz entre episodios.
plQ9q6xxoVE
Bloquea la cámara antes de pagar por el render. La referencia a video de Seedance 2.5 acepta maquetas 3D en blanco y placas de croma, por lo que puedes fijar el encuadre en geometría gris y solo luego comprometerte con un aspecto final. Este ejemplo se ejecutó en Seedance 2.1, un miembro anterior de la familia, pero la forma del flujo de trabajo es la misma.
6RKQROBa9a0
Localiza un corte maestro en lugar de volver a rodarlo. El reemplazo a nivel de región intercambia una cara, un producto o un idioma hablado mientras la cámara, el tiempo y la duración de los labios permanecen iguales. Aquí, un corte de belleza maestro se vuelve a asignar y a expresar para español, coreano e hindi, manteniendo la habitación, el encuadre y la duración de los labios.
IcR9nWHqLnU
Y porque alguien preguntará cómo se ve la transferencia de movimiento cuando dejas de ser sensato: tres hombres con trajes, reemplazados por tres capibaras fotorrealistas, siguiendo la trayectoria de movimiento del clip original compás por compás hasta que se apilan en una pirámide.
pzG58od4W1c
También está la versión simple de todo esto, la que nadie publica: un póster estático se convierte en un póster en movimiento, y el diseño sobrevive.
El póster fuente estático. Alimentarlo a referencia a video con "mantén el encuadre, la paleta y el diseño, anima el texto" y obtienes una versión animada del mismo diseño.
¿Cuánto cuesta realmente un cortometraje de Seedance 2.5 vs MiniMax H3?
Sin números aquí, porque los números se mueven y la estructura no. Ambas familias facturan por segundo, pago por uso, sin asiento ni suscripción. Eso deja tres variables: segundos, nivel de resolución y re-rodados.
La tercera es toda la factura. Un clip de 15 segundos que acierta al primer intento es un cargo. El mismo clip en el séptimo intento son siete. Por lo tanto, la medida para ahorrar dinero no es elegir el modelo más barato por segundo, sino hacer bien el paquete de referencia antes de generar nada. Esas dos llamadas de imagen en el Paso 1 y el Paso 2 son la línea más barata de todo el pipeline y la que decide cuántas llamadas de video haces. El mayor retorno de inversión en toda la cadena, por mucho.
Luego corrige el instinto por segundo. Mismo paquete de referencia, misma duración: la referencia a video de H3 devuelve 1440p, este endpoint de referencia a video de Seedance devuelve 720p. Por segundo es la unidad incorrecta. Píxeles por fotograma, y si luego tienes que pagar por una pasada de escalado separada, es la correcta.
El audio también pertenece a la aritmética. Ambos lados producen sonido sincronizado nativo en la misma pasada. Si tu pipeline actual es modelo de video más TTS más un editor alineando pistas, lo que ahorras son dos llamadas API y la tarde de una persona, y ese ahorro no aparece en ninguna lista de precios.
Cuál para qué trabajo:
| Trabajo | Elige | Por qué | Advertencia |
|---|---|---|---|
| Drama corto vertical, 9:16, TikTok o ReelShort | MiniMax H3 | 1440p vertical con estéreo nativo, disponible ahora, 15 s es un gancho completo | cortas a 15 s, así que planifica los compases en consecuencia |
| Película de marca continua de 30 segundos | Seedance 2.5 | una sola generación, sin unión, 4K nativo | verifica la disponibilidad en tu plataforma primero |
| Arreglar un plano dentro de un corte aprobado | Seedance 2.5 | redibujo a nivel de región deja el resto intacto | la edición de clip completo de H3 te lleva la mayor parte hoy |
| Cortes de productos y comercio electrónico | cualquiera | ambos mantienen bien el texto en pantalla y las marcas | verifica el texto en la resolución que entregues |
| Demos de juegos o interfaces | MiniMax H3 | la estabilidad de UI y tipografía a 2K es fuerte | límite de 15 s para una sola pasada |
| Versiones multilingües de un maestro | Seedance 2.5 | reemplazo de región más voz multilingüe | la calidad de localización aún necesita una verificación nativa |
| Envío esta noche | MiniMax H3 | tres endpoints activos, más todo Seedance 2.0 | el acceso a Seedance 2.5 varía según la plataforma |
Antes de enviar. MiniMax dijo que los pesos de H3 seguirían en días después del lanzamiento, y los pesos abiertos no son lo mismo que una licencia comercial, así que lee los términos antes de autoalojar. La marca de agua y la política de uso comercial también difieren entre aplicaciones de consumo y acceso API en ambos lados, y no pude confirmar ninguna de una página de términos primaria mientras escribía esto, así que verifica los términos del proveedor en lugar de tomar mi palabra. Y nada en ninguna licencia de modelo cubre la imagen o la marca registrada. Si una persona real, una marca real o la propiedad intelectual de otra persona está en tu paquete de referencia, esa es una cuestión legal separada y los términos del modelo no la responderán.
Todos los modelos en las tablas anteriores se ejecutan con la misma clave, y las páginas de modelo llevan las tarifas actuales más código de copiar y pegar, incluidas las promociones que puedan estar vigentes en la línea Seedance esta semana.
Preguntas frecuentes
¿Es Seedance 2.5 mejor que MiniMax H3 para la consistencia de personajes?
En teoría debería serlo, con hasta 50 referencias multimodales contra los 12 archivos de H3, más re-rodados a nivel de región. Pero a fecha del 31 de julio de 2026 no hay una prueba pública emparejada a la que pueda señalar, y Seedance 2.5 aún no tiene calificación en el arena. En las ejecuciones que pude hacer realmente, la variable que decidió la estabilidad de identidad fue la estructura del paquete de referencia, no la generación del modelo: con una hoja de referencia compuesta y un tablero de iluminación, ambos lados mantuvieron el personaje. Haz bien el paquete antes de perder tiempo comparando modelos.
¿Puedo usar Seedance 2.5 ahora mismo o tengo que esperar?
Su API está activa en ByteDance. La disponibilidad en plataformas de modelos de terceros es desigual, y en la que probé sigue siendo un aviso del Día 0. Si necesitas resultados esta noche, las opciones disponibles son los tres endpoints de MiniMax H3 y toda la línea de Seedance 2.0 en envío.
¿MiniMax H3 realmente hace video de 30 segundos?
No. La especificación es de 5 a 15 segundos por generación a 24 fps. Cualquier cosa más larga es extensión o unión, que es algo diferente con diferente riesgo de deriva. La generación única de 30 segundos pertenece a Seedance 2.5. No dejes que las dos afirmaciones se mezclen.
¿Ambos modelos generan audio y puedo mantener una voz a lo largo de los episodios?
Ambos producen audio sincronizado nativo en la misma pasada, y H3 emite estéreo en cada resultado. Para una voz persistente, H3 acepta hasta tres referencias de audio de 2 a 15 segundos cada una, que deben enviarse junto con una entrada de imagen o video, no por sí solas.
¿Cuántas imágenes de referencia debería enviar realmente?
Menos de las que crees, mejor estructuradas de lo que crees. Un compuesto bien hecho generalmente supera a seis recortes sueltos, porque los archivos separados invitan al modelo a promediarlos en una persona que no existe. Dale dos trabajos claros, identidad e iluminación, y no incluyas muestras de estilo que compitan entre sí.
¿Qué modelo debería usar para dramas cortos verticales estilo TikTok o ReelShort?
En envío esta semana, en 9:16, en alta resolución con sonido ya mezclado: MiniMax H3. Planeando una escena continua de 30 segundos donde esperes re-rodar regiones individuales en lugar de clips completos: construye para Seedance 2.5 y verifica cuándo tu plataforma lo abre.






