Meta Title: MiniMax H3 estilo Ghibli en 2026: 3 pasos, sonido incluido
Meta Description: Un fotograma clave pintado, una renderización de 15 segundos con MiniMax H3, y el viento y las cigarras llegan en el mismo archivo. Prompts reales, ajustes reales, capturas de pantalla operadas.
MiniMax H3 estilo Ghibli: 3 pasos para un plano dibujado a mano de 15 segundos que realmente respira
Has visto la versión que no funciona. Alguien mete un retrato pintado en una herramienta de video, espera, y obtiene tres segundos de bamboleo de Live Photo: el pelo tiembla, las nubes congeladas, sin sonido, en bucle.
El cine dibujado a mano nunca se movió así. Y nunca fue tan silencioso.
Así que esto es lo que hicimos nosotros. Un fotograma clave pintado, una renderización MiniMax H3 estilo Ghibli de 15 segundos, y la hierba se ondula, un tranvía cruza un viaducto, las cigarras cantan de fondo, y cuatro notas de piano se resuelven. Todo salido de un solo trabajo, en un solo archivo, con audio estéreo incorporado.
A continuación: primero el plano terminado, luego los prompts exactos, los ajustes que realmente funcionan, capturas de pantalla reales del playground operadas, y un desglose línea por línea.
Conclusiones clave
- Un trabajo de 15 segundos en 2K entrega 2560x1440, 24fps, AAC estéreo 32kHz, sin marca de agua.
- El aspecto dibujado a mano es un problema de cadencia, no de paleta. Pide "a dos" (on twos), no suavidad.
- El viento, las cigarras y el piano salen de la misma renderización. No hay una segunda pasada de composición musical.
- 3 pasos: pintar un fotograma clave, animarlo, igualar el segundo plano con referencia a video.
- Mantén los nombres de estudio y director fuera del prompt. Describe la técnica en su lugar.
Aquí está el plano terminado, antes de cualquier teoría.
Activa el sonido. Un solo trabajo continuo de imagen a video de 15 segundos en MiniMax H3, 2K, sin cortes, sin postproducción: la ráfaga de hierba, la campana del tranvía, el murmullo de las cigarras y el piano llegaron todos dentro de este único mp4.
¿No puedes reproducir el video donde estás leyendo? Aquí están los cuatro momentos clave, extraídos directamente del archivo de arriba.

Cuatro fotogramas de la renderización MiniMax H3 estilo Ghibli de la ladera en los segundos 0, 5, 10 y 15, mostrando la primera ráfaga de hierba, el tranvía cruzando el viaducto, la segunda ráfaga y el último momento sostenido.
La misma renderización muestreada en los segundos 0, 5, 10 y 15. Observa la última tarjeta: nada nuevo entra en el encuadre, a propósito.
Por qué la mayoría de los intentos de MiniMax H3 estilo Ghibli parecen un filtro
Veredicto primero: el aspecto de filtro casi nunca es el color. Es el ritmo, el sonido y la duración.
Aquí está la evidencia. Las películas de celdas pintadas no se animan a 24 dibujos únicos por segundo. Analizando uno de los ciclos de carrera de Miyazaki, Animation Obsessive lo llama "una carrera dibujada 'a dos'" con "12 dibujos por segundo", donde "cada dibujo permanece en pantalla durante dos fotogramas". (Animation Obsessive, marzo de 2023)
Ahora piensa en lo que hace un modelo de video por defecto. Interpola. Suavemente. Sedosamente. A velocidad de fotogramas completa.
Esa es toda la pista. Tu paleta estaba bien. Tu movimiento era demasiado bueno.
La pregunta es: ¿puede el modelo mantener una capa dibujada durante 15 segundos completos sin que se derrita? Sí, y esto es lo que parece.

Pez dorado dibujado a mano y algas animadas sobre una encimera de cocina real iluminada por el sol, de una renderización de 15 segundos de MiniMax H3.
Ejemplo de renderización MiniMax H3: un pez dorado delineado a crayón y trazos de algas verdes dibujados sobre metraje real de cocina, mantenidos durante los 15.08 segundos completos sin que el trazo se emborrone. Se muestra aquí como un GIF silencioso; el archivo entregado lleva video de 24 fps y audio estéreo de 32kHz.
Segunda causa de muerte: promesas de estilo mixtas. Escribir "acuarela anime fotorrealista" le da al modelo la tarea de satisfacer tres contratos a la vez, y el resultado es la papilla que la gente llama "slop de IA". Comprométete con un solo medio y se mantiene.

Zorro de plastilina en medio de un salto sobre roca agrietada junto a una fisura de lava brillante, textura de huella dactilar de plastilina visible, de una renderización de MiniMax H3.
Mismo principio, medio diferente: una sola promesa de estilo ("plastilina stop-motion") produce textura real de huella dactilar y peso de stop-motion durante 10 segundos. GIF silencioso; el archivo fuente es 2560x1440 con audio estéreo.
Y la tercera y cuarta: silencio, y sin espacio para respirar. Aproximadamente la mitad de lo que la gente entiende por este estilo es diseño de sonido, viento y un piano escaso. Y las pausas necesitan segundos reales. Un clip de 5 segundos físicamente no puede contener tres segundos de que no pase nada.
Aquí está la tabla de diagnóstico a la que volvemos una y otra vez.
| Síntoma en tu salida | Causa real | Añade esto al prompt |
|---|---|---|
| Movimiento sedoso, deslizante, "demasiado suave" | El modelo interpola a velocidad completa | dibujado a dos, dibujos mantenidos, ligera vibración de línea entre fotogramas, sin movimiento sedoso interpolado |
| Los contornos se derriten o se arrastran | Promesas de estilo en competencia | Nombra solo un medio: rellenos de color plano, contornos entintados a mano, fondo de acuarela pintado a mano |
| La cara o la ropa cambian a mitad del plano | Demasiada acción en una toma demasiado larga | Una acción por ráfaga; sin nuevos personajes, sin cambio de vestuario |
| Niebla fotográfica, bokeh, destello de lente | Filtraciones de prioridades fotográficas | sin profundidad de campo fotográfica, sin bokeh, sin destello de lente, sin render 3D |
| Salida completamente silenciosa | Sin cláusula de audio escrita | Escribe un párrafo de Audio: explícito con capas y tiempos |
| El final se siente apresurado | Sin un momento sostenido | Desde el segundo doce al quince no se mueve nada excepto la hierba: mantén la quietud, no añadas nueva acción |
El endpoint que uses importa tanto como el prompt. Hay tres, y hacen trabajos diferentes.
| Endpoint | Qué controla | Relación de aspecto | Úsalo para |
|---|---|---|---|
| minimax/h3/text-to-video | Solo prompt, sin bloqueo de fotograma | Relación explícita requerida, adaptativa rechazada | Explorar un aspecto antes de tener arte |
| minimax/h3/image-to-video | El primer fotograma fija composición, paleta, grano de papel | La enumeración es solo adaptativa; tu fotograma decide la forma | El paso principal de animar una pintura |
| minimax/h3/reference-to-video | Múltiples referencias etiquetadas guían el estilo en un nuevo plano | Se aceptan las 7 relaciones, pasa 16:9 explícitamente | Plano dos, plano tres, igualar una serie |
Una trampa que vale la pena anotarte en la mano: enviar image y refers en la misma llamada no da error. El trabajo se completa, se factura en su totalidad y descarta silenciosamente una de las dos entradas. Lo medimos en ambos endpoints, y la dirección en la que se descarta varía. Elige un endpoint por llamada.
El flujo de trabajo MiniMax H3 estilo Ghibli: tres modelos, una pestaña
Esta sección te da toda la cadena y lo que cuesta cada eslabón. Funciona de principio a fin en una pestaña del navegador en Atlas Cloud, que es donde se operaron todas las capturas de pantalla siguientes, para que nunca exportes un archivo solo para volver a subirlo a otro lado.
Por qué esto importa para este trabajo en particular: el modelo de pintura y el modelo de video tienen que estar de acuerdo en el fotograma. Mantenerlos en la misma plataforma significa que el fotograma clave que generas ya es un archivo que el siguiente playground puede tomar como su primer fotograma, y el paso de referencia a video puede alcanzar tanto el fotograma clave como un fotograma fijo extraído de tu clip terminado.
| Trabajo en esta cadena | Modelo / endpoint | Resolución | Precio (verificado el 21 de agosto de 2026) |
|---|---|---|---|
| Pintar el fotograma clave | openai/gpt-image-2/text-to-image | 2048x1152, calidad alta | $0.1745 por imagen (la cifra de lista de $0.009 es un mínimo de nivel de token) |
| Animar el fotograma clave | minimax/h3/image-to-video | 2K | $0.14/s, por lo tanto $2.10 a 15s |
| Hacer un borrador barato primero | mismo endpoint | 768P | $0.10/s, por lo tanto $0.80 a 8s |
| Igualar el plano dos | minimax/h3/reference-to-video | 2K | $0.14/s, las referencias se facturan a $0 |
| Repintar una foto como arte | google/nano-banana-2/edit | nivel 2k | $0.12 (la lista dice $0.08; el nivel lo cambia) |
| Pista musical adicional opcional | minimax/music-2.6 | n/a | $0.15 fijo por pista |
Un hábito que ahorra discusiones con tu propia hoja de cálculo: la cifra principal en la página de un modelo es un mínimo, no tu factura. Las páginas de H3 enumeran $0.10 por segundo, que es el nivel 768P; 2K cuesta $0.14. GPT Image 2 enumera $0.009, que es un mínimo de nivel de token, y la calidad high a 2048x1152 realmente cotiza $0.1745. Lee el botón Ejecutar, cada vez, porque es el número que te cobrarán.
No hay ningún descuento activo en los endpoints de H3 a partir de agosto de 2026. Solo las variantes -developer de los modelos de imagen tienen descuento, lo cual es útil saber para borradores e irrelevante para la entrega.
Empecemos.
Paso 1: Pintar el fotograma clave
El fotograma hace el trabajo pesado. Todo lo que el paso de video no puede inventar (composición, paleta, calidad de línea, grano de papel) ya tiene que estar en este PNG.
Abre el playground de GPT Image 2 text-to-image y pega esto textualmente.
Plain1Fondo de animación 2D pintado a mano al estilo de la animación japonesa de celdas de los años 90: una amplia ladera de verano al atardecer. Hierba alta y verde llena los dos tercios inferiores, pintada en gouache suave con textura de pincel visible y bordes de las briznas entintados a mano. Una niña de unos diez años está de pie en la distancia media, vista desde atrás, con un impermeable amarillo liso y una mochila roja, una mano sujetando un sombrero de paja. Más allá de la colina, un tranvía de un solo vagón cruza un valle verde sobre un viaducto de piedra bajo; montañas azules lejanas se desvanecen en un cielo crema pálido con imponentes cúmulos pintados como formas planas y superpuestas. Luz cálida de las 4 de la tarde, sombras ambientales suaves, sin contraste duro, paleta limitada de verde hierba, crema, azul cielo y un acento amarillo. Calidad de línea de animación de celda: contornos limpios y seguros, rellenos de color plano, fondo de acuarela pintado a mano, sutil grano de papel. Sin texto, sin logotipos, sin marca de agua, sin fotorrealismo, sin render 3D, sin destello de lente, sin edificios modernos.
Ajustes: quality high, tamaño 2048x1152 (16:9), una imagen. No bajes a medium aquí. El grano de papel y los bordes entintados son exactamente el detalle que un nivel inferior suaviza, y esas dos cosas son las que venden todo el plano más tarde.
Observa lo que no dice el prompt. Sin nombre de estudio, sin nombre de director. Cada instrucción estilística es una descripción de la técnica: gouache, bordes entintados a mano, rellenos de color plano, calidad de línea de animación de celda. Eso no es remilgo, es un mejor prompt, porque "animación de celda con rellenos planos y grano de papel visible" es una instrucción específica y un nombre de estudio es una vaga.
Aquí está la ejecución.

Playground de GPT Image 2 en Atlas Cloud con el prompt de la ladera pintada a mano cargado con calidad alta y 16:9, y el fotograma clave estilo Ghibli terminado renderizado en el panel de salida.
GPT Image 2 con calidad high , 2048x1152, ejecutado en Atlas Cloud. Observa el botón Ejecutar: $0.1745, no los $0.009 de la página de precios.
Y el fotograma clave por sí solo, porque vas a alimentar este mismo archivo al siguiente paso:

Fotograma clave de la ladera de verano pintada a mano: una niña con impermeable amarillo vista desde atrás en la hierba alta, un tranvía de un solo vagón sobre un viaducto de piedra más allá del valle, nubes cumulus planas y superpuestas.
Generado con openai/gpt-image-2/text-to-image . Este PNG es el primer fotograma del plano terminado al principio del artículo.
Paso 2: Animarlo en movimiento estilo MiniMax H3 Ghibli
Ahora la parte interesante. Este prompt es más largo de lo que la mayoría de la gente escribe, y eso es deliberado: estás escribiendo una hoja de tiempos, no una atmósfera.
Cuatro cosas que especifica que un prompt típico no: cuándo comienza cada ráfaga, cuándo entra y sale el tranvía, que la cadencia es a dos, y un párrafo de audio completo con tiempos de entrada por capa.
Carga tu PNG del Paso 1 en la página de imagen a video de MiniMax H3 y pega esto.
Plain1Anima esta pintura como un único plano continuo dibujado a mano, 15 segundos, sin cortes. 2Cámara: un zoom in muy lento, apenas perceptible, más un suave desplazamiento a la derecha de aproximadamente el cinco por ciento del ancho del fotograma. Sin encuadre de zoom, sin movimiento de cámara al hombro. 3Movimiento: el viento mueve la hierba alta en dos largas olas viajeras, una que comienza en el segundo dos y otra en el segundo nueve, doblando las briznas en la misma dirección cada vez. El borde del impermeable y el cabello de la niña se levantan con cada ráfaga; el ala de su sombrero de paja se flexiona. Las nubes se desplazan casi imperceptiblemente. En el segundo siete, un tranvía de un solo vagón cruza el viaducto de izquierda a derecha y sale del encuadre en el segundo once. Del segundo doce al quince no se mueve nada excepto la hierba y una sombra de nube que cruza la colina: mantén la quietud, no añadas nueva acción. 4Cadencia de animación: dibujado a dos, dibujos mantenidos, ligera vibración de línea entre fotogramas. Sin movimiento sedoso interpolado, sin morphing, sin bordes que se derritan. Mantén los rellenos de color plano y la textura de papel pintado. No añadas profundidad de campo fotográfica, bokeh ni destello de lente. 5Audio: cigarras continuas de verano a un nivel medio constante; susurro de hierba superpuesto que aumenta con cada ráfaga; una campana de tranvía lejana en el segundo siete con un leve rumor de ruedas que se desvanece hacia el segundo once; y una línea de piano solo escasa de cuatro notas que entra en el segundo tres y se resuelve en el segundo trece. Sin voz, sin narración, sin diálogo, sin texto en pantalla, sin música más allá de esa línea de piano.
Ajustes: image = tu PNG del Paso 1, resolution 2K, duration 15, la relación se queda adaptive. Esto último no es pereza. La enumeración en este endpoint contiene solo adaptive, y el fotograma subido decide la forma de salida, así que un fotograma clave 16:9 te da un clip 16:9.
Ahora lee el botón Ejecutar antes de hacer clic, porque aquí es exactamente donde perdimos una toma.
En 2K y 15 segundos, la cotización debería decir $2.10. La nuestra decía $1.12. El control deslizante de duración nunca tomó nuestro 15, el trabajo se ejecutó con el valor predeterminado de 8 segundos, y todos los demás campos del formulario todavía se veían perfectamente correctos. Aquí está esa ejecución, con la trampa justo en el encuadre.

Playground de MiniMax H3 image-to-video en Atlas Cloud con el fotograma clave pintado cargado, resolución 2K, y el clip de la ladera estilo Ghibli terminado reproduciéndose en el panel de salida.
El prompt pide 15 segundos. El reproductor muestra 0:08. El botón Ejecutar muestra $1.12. La resolución 2K se comprometió, la duración no. Lee el precio, nunca el control deslizante.
Arrégialo de una de dos maneras: arrastra el control deslizante y confirma que la cotización cambie a $2.10 antes de enviar, o envía el trabajo a través de la API donde duration: 15 es solo un campo que no puede fallar silenciosamente. El clip al principio de este artículo es la segunda ruta, mismo endpoint y mismo prompt, resolution: 2K, duration: 15.
Entregado de esa manera: un contenedor de 15.08 segundos, 2560x1440, 24fps, H.264 con audio estéreo AAC a 32kHz, sin marca de agua en ninguna parte. La versión accidental de 8 segundos volvió exactamente a 8.00 segundos con geometría idéntica. Presupuesta de 5 a 10 minutos de tiempo real; los trabajos de 8 segundos en 2K aterrizan entre 310 y 400 segundos en nuestras ejecuciones, y un trabajo en 2K con tres referencias tardó 557 segundos.
Paso 3: Igualar un segundo plano con referencia a video
Un plano es una demostración. Dos planos que pertenecen al mismo mundo es una secuencia, y aquí es donde la mayoría de los experimentos de estilo Ghibli de la gente se desmoronan: la cara del personaje se desvía, la paleta se calienta, el grano de papel desaparece.
La solución no es un mejor prompt. Es un endpoint diferente. Referencia a video toma material de referencia etiquetado y traslada su apariencia a una nueva configuración de cámara.
Aliméntalo con tu fotograma clave del Paso 1 como referencia. Ese solo fotograma lleva la paleta, la calidad de línea y el grano de papel, y en este plano mantuvo la apariencia por sí solo, como muestra el resultado a continuación. Si tu propia ejecución se desvía una vez que comienza el movimiento, añade un fotograma fijo exportado cerca del final de tu clip del Paso 2 como segunda referencia, que lleva lo que el modelo hizo con el trazo una vez que comenzó a moverse. Luego pega esto en el endpoint de referencia a video.
Plain1Iguala exactamente el aspecto pintado, la paleta, la calidad de línea y el grano de papel de las imágenes de referencia, luego filma un plano diferente en el mismo mundo: una cámara baja a la altura de la hierba en la misma ladera, mirando hacia arriba a la misma niña del impermeable amarillo mientras se agacha para tocar un tallo alto, luego se levanta y mira hacia el valle. 2Un solo plano continuo. Dibujado a dos, dibujos mantenidos, rellenos de color plano, fondo de acuarela pintado a mano. Sin fotorrealismo, sin nuevos personajes, sin cambio de vestuario, sin texto, sin marca de agua. 3Cámara: estática durante los primeros cuatro segundos, luego un lento tilt up siguiéndola mientras se levanta, terminando en su perfil contra el cielo crema. 4Audio: el mismo murmullo de cigarras de verano y susurro de hierba que la referencia; un suave movimiento de tela al levantarse; el mismo piano solo escaso que continúa sin reiniciarse. Sin diálogo, sin narración.
Ajustes: refers = tu fotograma clave, resolution 2K, ratio adaptive (el fotograma de referencia establece la forma de salida), y elige tu duración. Nuestra ejecución volvió a 8 segundos en 2K, cotizada a $1.12 con la referencia facturada a $0. Tres notas de ejecuciones reales:
- Los archivos de referencia son gratuitos. Diez imágenes de referencia facturan exactamente lo mismo que una a la misma longitud y resolución.
- Si pasas una URL de datos, declara su
typeexplícitamente. El endpoint infiere el tipo de la extensión del archivo, y una URL de datos no tiene ninguna. - Nunca entregues un
.mp4al cargador de esta página en una captura automatizada. Hace que todas las subidas fallen silenciosamente y desactiva el botón Ejecutar.

Playground de MiniMax H3 reference-to-video en Atlas Cloud con el fotograma clave Ghibli cargado como referencia y el prompt del plano igualado en su lugar a 2K.
MiniMax H3 reference-to-video: el fotograma clave en la ranura de Material de Referencia, el prompt del plano igualado cargado, 2K. El material de referencia se factura a $0, por lo que la cotización de $1.12 es solo la renderización. El resultado está justo debajo.

Segundo plano igualado en el mismo mundo MiniMax H3 estilo Ghibli: cámara baja a la altura de la hierba mirando hacia arriba a la niña del impermeable amarillo.
El segundo plano entregado. Misma paleta, mismo grosor de línea, mismo grano de papel, nueva cámara. GIF silencioso; el mp4 fuente lleva audio estéreo.
Esa es la cadena completa: pintar, animar, igualar. Tres ejecuciones, una pestaña.
Tres variaciones que vale la pena probar a continuación, una vez que la cadena funcione:
- Tu propia foto, repintada. Envía un paisaje o foto callejera que poseas a través de
google/nano-banana-2/editcon: "Repinta esta fotografía como un fondo de animación 2D pintado a mano: textura de gouache y acuarela, contornos limpios entintados a mano, rellenos de color plano, paleta limitada de verde, crema y azul cielo, sutil grano de papel. Mantén exactamente la misma composición, ángulo de cámara y línea de horizonte. Elimina todo texto, letreros y logotipos. Sin fotorrealismo, sin render 3D." Luego anima el resultado. Recorta el fotograma pintado a 9:16 primero si quieres vertical, porque el fotograma decide la forma, no un campo de relación. - Mismo fotograma, clima diferente. Antepón al prompt del Paso 2
Repinta la iluminación como atardecer con lluvia ligera: la paleta cambia a azul pizarra, crema mojado y un brillo cálido de ventana;y cambia la capa de audio por lluvia ligera constante más un trueno lejano en el segundo ocho. No se necesita un nuevo fotograma clave. - Haz un borrador a 768P primero. Más barato por segundo, útil para hacer el bloqueo. Una regla estricta asociada, en la siguiente sección.
Lo que cuesta una secuencia MiniMax H3 estilo Ghibli
Avance: una secuencia publicable de dos planos de 30 segundos cuesta alrededor de $4.40, y la ruta del borrador barato tiene un inconveniente que cuesta más de lo que ahorra.
Aquí está la factura, construida a partir de las tarifas por segundo verificadas en las páginas de los modelos y confirmadas contra registros de trabajos reales.
| Elemento de línea | Endpoint | Cantidad | Costo |
|---|---|---|---|
| Fotograma clave pintado | gpt-image-2, calidad alta, 2048x1152 | 1 imagen | $0.17 |
| Plano uno | h3/image-to-video, 2K | 15s a $0.14/s | $2.10 |
| Plano dos | h3/reference-to-video, 2K | 15s a $0.14/s | $2.10 |
| Fotogramas fijos de referencia para plano dos | h3/reference-to-video | 2 archivos | $0.00 |
| Total de la secuencia | 30s terminados, 2K, con audio | $4.37 | |
| Una repetición de cualquier plano | h3, 2K | 15s | +$2.10 |
| Pista musical dedicada opcional | minimax/music-2.6 | 1 pista | +$0.15 |
| Borrador opcional a 768P primero | h3, 768P | 8s a $0.10/s | +$0.80 |
Ahora el inconveniente. Hacer un borrador a 768P para ahorrar dinero funciona para la composición y el bloqueo, y no funciona como la gente supone.
Dos cosas que medimos. Primero, una repetición de un prompt de texto a video simple en un nivel de resolución diferente no vuelve más nítida, vuelve como una película diferente: diferente decorado, diferente altura de cámara, diferentes accesorios. Bloquear el primer fotograma a través de imagen a video es lo que confina la diferencia al detalle. Segundo, y este nos sorprendió: con el mismo primer fotograma bloqueado y el mismo prompt, las pistas de audio de los dos niveles no están relacionadas. La correlación de forma de onda entre ellas midió 0.0053, que es ruido estadístico.
Traducción: un borrador a 768P previsualiza tu composición y tus golpes de acción. Nunca es la mezcla que envías.
Homenaje, derechos de autor y lo que puedes publicar
Versión corta, y no es un consejo legal: un estilo visual en sí mismo generalmente no está protegido por derechos de autor, pero los datos de entrenamiento y los resultados son una cuestión viva y controvertida, y los términos de la plataforma son un asunto aparte.
Esa controversia no es hipotética. El 27 de octubre de 2025, la Asociación de Distribución de Contenidos en el Extranjero de Japón (CODA), un organismo de titulares de derechos que abarca el anime, el cine, los videojuegos y la edición, presentó una solicitud por escrito pidiendo que "el contenido de sus miembros no se utilice para el aprendizaje automático sin su permiso", y señaló que "bajo el sistema de derechos de autor de Japón, generalmente se requiere permiso previo para el uso de obras protegidas por derechos de autor, y no existe un sistema que permita evitar la responsabilidad por infracción a través de objeciones posteriores" (CODA, octubre de 2025).
Tres hábitos prácticos que mantienen limpia tu salida:
- Describe la técnica, nunca el estudio. Nuestros prompts anteriores nombran gouache, a dos, rellenos planos y grano de papel, y en ningún lugar nombran una empresa o un director.
- No pongas personajes reconocibles, logotipos o tarjetas de título en el encuadre. Nuestra ladera no tiene ningún IP de personaje.
- Verifica los términos que se aplican a tu cuenta antes de monetizar, y verifica los términos de la plataforma en la que publicas por separado.
Construye un mundo que comparta una técnica con películas que amas. No construyas una imitación de una específica.
Preguntas frecuentes
¿Puede MiniMax H3 hacer el estilo Ghibli, y debo escribir "Studio Ghibli" en el prompt?
Sí a lo primero, y no haríamos lo segundo. Todos los resultados de este artículo provinieron de vocabulario técnico en su lugar: animación de celda 2D pintada a mano, gouache con textura de pincel visible, contornos entintados a mano, rellenos de color plano, a dos, dibujos mantenidos, sutil grano de papel. Esas seis frases transmiten el aspecto, son más específicas que un nombre de estudio y mantienen más simple la cuestión de la publicación.
¿MiniMax H3 genera el viento y el piano por sí mismo, o añado el sonido después?
Por sí mismo, en el mismo trabajo. MiniMax describe H3 como "generación de video con sonido estéreo nativo, hasta 15 segundos a resolución 2K" (MiniMax, julio de 2026), y nuestros archivos entregados llevan AAC estéreo a 32kHz. Escribe un párrafo Audio: dedicado nombrando cada capa y cuándo entra. Si quieres una pista compuesta completa en lugar de un fragmento, genérala por separado en minimax/music-2.6 por $0.15 y mézclala.
¿Cuánto puede durar un plano, y realmente aguanta 15 segundos?
La duración acepta cada segundo entero de 4 a 15 en los tres endpoints, y nuestra solicitud de 15 segundos entregó un contenedor de 15.08 segundos. Aguanta. La razón para querer 15 en lugar de 8 no es la escala épica, es lo contrario: es la única manera de permitirse tres segundos en los que no pasa nada, que es exactamente el golpe sobre el que se construye este estilo.
¿Cómo mantengo el mismo personaje, paleta y grano de papel en dos planos?
Usa referencia a video con dos referencias: el fotograma clave original más un fotograma fijo de tu primer clip terminado, y escribe "iguala exactamente el aspecto pintado, la paleta, la calidad de línea y el grano de papel de las imágenes de referencia" como la primera cláusula. Cuidado con un fallo silencioso: mezclar image y refers en una sola llamada se completa y factura en su totalidad mientras descarta una de las entradas, sin ningún campo de advertencia en la respuesta.
¿Debería hacer un borrador a 768P y repetir a 2K para ahorrar dinero?
Haz un borrador a 768P para la composición, sí. Pero bloquea el primer fotograma a través de imagen a video, o una repetición devolverá una película diferente. Y trata el audio del borrador como desechable: mismo fotograma, mismo prompt, nivel diferente, y las dos pistas de audio midieron una correlación de forma de onda de 0.0053 entre sí. La mezcla se regenera, no se amplía.
¿Es seguro publicar o monetizar un video MiniMax H3 estilo Ghibli?
Depende de lo que haya en el encuadre y de lo que digan los términos de tu cuenta, y esto no es un consejo legal. Los prompts descriptivos de estilo sin IP de personajes, sin logotipos y sin nombre de estudio en el encuadre son la versión conservadora, y esa es la versión que demuestra este artículo. Verifica los términos aplicables antes del uso comercial.
Una última cosa que vale la pena repetir, porque es la parte que la gente se salta. La razón por la que un plano minimax h3 estilo ghibli funciona no es la paleta verde. Es que el movimiento es deliberadamente peor de lo que el modelo puede hacer, y que los últimos tres segundos pueden estar vacíos. Escribe la hoja de tiempos. Escribe el sonido. Luego déjalo quieto.






