Seedance 2.5 è ora live — In anteprima su Atlas Cloud

Il flusso di lavoro MiniMax H3 da copiare una settimana dopo l'open source (più 52 prompt ufficiali)

Una settimana dopo che MiniMax H3 è stato reso open source, il flusso di lavoro da copiare è la bozza locale, la rifinitura cloud. L'unico elemento che attraversa entrambe le estremità è il prompt, più 52 prompt ufficiali.

MiniMax ha pubblicato un riepilogo della community sulla prima settimana di H3 come modello open. Vengono menzionati quasi 300 modelli derivati, una varietà di build quantizzate, un motore di inferenza nativo per Mac e pipeline di produzione guidate da agenti. Vale tutto la pena di dare un'occhiata.

Ma la cosa più importante da estrarre è una frase verso la fine della prima sezione, che descrive come lavora effettivamente un creatore di animazioni. Nelle parole ufficiali:

Genera video a 480p su una RTX 3060 per iterare, usando l'hardware locale per anteprime, selezione e tentativi, e solo quando una versione lo soddisfa passa al cloud per renderizzare il finale a risoluzione più alta e finire con la super risoluzione.

Il resoconto ufficiale dà un nome a questa abitudine: bozza locale, finalizzazione su cloud.

Queste tre parole sono la stessa conclusione a cui siamo arrivati più e più volte durante mesi di lavoro sul confronto dei modelli. Questo articolo è un tentativo di dirlo correttamente: perché la suddivisione regge, e una volta che regge, cosa devi effettivamente tenere.

Punti chiave

  • MiniMax H3 locale finalmente funziona su hardware consumer, ma il locale è l'estremità a bassa risoluzione. Il finale 2K è un passaggio separato, non un render più grande.
  • L'unica cosa che deve passare dalla bozza al finale è il prompt, quindi l'intero flusso di lavoro dipende dal fatto che il prompt sopravviva al viaggio.
  • Esegui un unico prompt verbatim di MiniMax H3 su più modelli contemporaneamente per verificare lo stato del prompt, non per classificare i modelli.
  • Un vincolo può essere soddisfatto alla lettera e mancare comunque il punto. Blocca la proprietà che porta il concetto, non l'effetto collaterale.
  • I due asset che vale la pena conservare sono una libreria di prompt categorizzati e la logica decisionale dietro ogni prompt.

Perché "bozza locale, finalizzazione su cloud" funziona solo per MiniMax H3 ora

La suddivisione dipende da una cosa: l'estremità locale è diventata improvvisamente potente.

In una singola settimana open-source la community si è mossa velocemente sull'efficienza dell'inferenza. Il team di ComfyUI ha tagliato i pesi di modulazione che costituivano circa il quaranta percento del conteggio dei parametri, li ha scambiati con tabelle precalcolate, ha aggiunto la quantizzazione INT8 e kernel personalizzati, e ha portato la combinazione di modelli più piccoli da 123,6 GB a 42,5 GB di memoria. Aggiungi lo scaricamento dinamico e una scheda grafica consumer può eseguire l'inferenza locale.

Separatamente, il creatore di Redis antirez ha scritto da zero un motore di inferenza nativo per Apple Silicon in C e Metal. Legge direttamente i pesi safetensors e impacchetta gli encoder di testo e visione, il DiT e i VAE di visione e audio in un unico programma Mac nativo, senza dipendenza da Python o PyTorch.

Il team di ricerca di NVIDIA ha completato un primo passaggio di ottimizzazione dell'inferenza entro 4,5 ore dal giorno del lancio e ha riportato un'accelerazione end-to-end di 3,95x rispetto a Diffusers su una configurazione a otto schede.

Metti tutto insieme e il risultato è chiaro: le esecuzioni locali ora, ma ciò che renderizzano è a bassa risoluzione.

Quindi la suddivisione del creatore segue naturalmente. La bassa risoluzione è veloce, economica e ripetibile, che è esattamente ciò che vuole la sperimentazione. La consegna torna ancora al cloud per il finale. Le due estremità non sono sostituti. Sono due stazioni su una linea.

Cosa passa effettivamente tra le due fasi di MiniMax H3

Questa è la domanda che ci interessa davvero.

Fai venti passaggi a 480p in locale e finalmente ottieni l'aspetto che desideri. Ora passi al cloud per il finale. Qual è l'unica cosa che puoi effettivamente portare con te?

Non la clip a 480p, la sua risoluzione è troppo bassa. Non i pesi del modello, il cloud ha i suoi.

È il prompt.

Lungo tutta la linea, l'unica cosa che deve attraversare entrambe le estremità e rimanere invariata è il prompt. È l'unico asset in questo flusso di lavoro.

L'implicazione è più importante di quanto sembri:

  • Se il tuo prompt smette di funzionare quando l'ambiente cambia, questo flusso di lavoro a strati non funziona affatto. Tutto ciò che hai ottimizzato localmente viene sprecato sulla strada per il cloud.
  • Se lo riscrivi per ogni modello, ripeti la fase di bozza ogni volta che cambi modello.
  • Ribaltalo: se il prompt è abbastanza portatile, puoi persino fare la bozza su un modello più economico, purché la sua lettura della stessa frase sia prevedibile.

Quindi la domanda diventa: come si scrive un prompt che funzioni ancora dopo che l'ambiente cambia? Lo abbiamo testato.

Un prompt MiniMax H3, quattro modelli contemporaneamente

Negli ultimi giorni abbiamo eseguito più di una dozzina di confronti come questo: un prompt verbatim, cambiando solo i parametri di invio, inviato a quattro modelli ciascuno, su argomenti che vanno dagli effetti visivi all'animazione UI del prodotto fino ai cortometraggi musicali.

Di seguito lo stesso test eseguito su otto soggetti. Ogni clip è una suddivisione a quattro vie dello stesso prompt: in alto a sinistra Seedance 2.5, in alto a destra MiniMax H3, in basso a sinistra Seedance 2.0, in basso a destra Kling v3.0pro.

Duello wuxia: un prompt, quattro modelli. Attiva l'audio.

Scena romantica anime, stessa suddivisione a quattro vie.

Spot pubblicitario per borsa: un prodotto dallo stesso prompt.

Esibizione di un gruppo femminile, con audio sincronizzato nella suddivisione.

KNNOfby0vtw
Invalid YouTube video ID

Una scena incentrata su un personaggio, quattro modelli affiancati.

Spot pubblicitario per videocamera, stesso prompt in parallelo.

Spot pubblicitario per sneaker, l'ultimo degli otto soggetti.

Cosa sta effettivamente testando questa esecuzione

Non è una classifica. È un esame fisico per il prompt.

Poiché il prompt è verbatim e sono cambiati solo i parametri di invio:

  1. Le differenze tra i quattro sono le differenze tra i modelli. Sembra una banalità, ma è il fondamento dell'intero esercizio, e vale solo quando i quattro vengono eseguiti nello stesso ambiente di esecuzione. Unisci insieme alcune interfacce da fonti diverse e mescoli variabili a livello di link nelle differenze, e non puoi più distinguere una differenza di modello da una differenza di piattaforma.
  2. Qualunque cosa tutti e quattro non riescano a fare è un problema del prompt, non del modello. Questo è il segnale più prezioso nella fase di bozza, ed è uno che non puoi mai ottenere eseguendo un singolo modello. Un modello sbaglia e sospetti il modello. Quattro sbagliano e la risposta è chiara: torna indietro e correggi quella singola riga, non cambiare modello.
  3. Cambia una cosa per versione, lascia il resto invariato. È l'unico modo in cui "questa versione è migliore" può reggere. Spargi le modifiche e non puoi attribuire nulla. Eseguire più modelli in parallelo significa che un singolo cambiamento di variabile ti dà quattro punti di osservazione contemporaneamente.

Quindi cosa va nel file

Non una tabella di parametri. I parametri sono sulla pagina del modello, e copiarli non porta informazioni. Ciò che vale la pena registrare è "cosa ho scritto, poi cosa ho osservato." Due esempi:

Cosa diceva il promptCosa hanno mostrato le quattro esecuzioni
Tre battiti a 4s / 8s / 12sEntrambi deriva temporale, in direzioni opposte. MiniMax H3 va in anticipo e il ritardo si accumula, arrivando più vicino a 4/6/8s. Seedance 2.0 è in ritardo e perde del tutto il battito centrale.
"Mantienilo grafico piatto, non renderizzarlo come una creatura realistica"Entrambi obbediscono alla lettera e restituiscono contorni al neon vettoriali lisci. Piatto? Sì. Disegnato a mano? Per niente.

Il valore del primo è la direzione. Registrare solo l'entità dell'errore è inutile, perché la prossima volta che compenserai compenserai nel modo sbagliato. Uno deve essere spinto più avanti, l'altro premuto prima.

Il secondo vale di più, ed è l'argomento della prossima sezione.

Non hai più bisogno di uno script per questo

Quando abbiamo eseguito quei confronti, abbiamo scritto il nostro script per inviare lavori e raccogliere risultati. Non più. Atlas Cloud ha lanciato Model Explorer.

Scrivi un prompt, seleziona fino a 10 modelli da eseguire in parallelo, e i risultati tornano affiancati.

Il suo vero valore non è la comodità, è il controllo. Il motivo per cui quel confronto ha potuto raggiungere una conclusione è che i quattro sono stati eseguiti in un unico ambiente di esecuzione. Collega quattro interfacce da fonti diverse e le variabili della piattaforma si insinuano nelle differenze: comportamento del gateway, parametri predefiniti, come vengono codificati gli asset. Cambiane uno e pensi di confrontare modelli quando invece confronti piattaforme. Esegui all'interno di un singolo pool di modelli e quelle variabili sono tenute sotto controllo per costruzione.

Alcune cose si mappano direttamente sulla fase di bozza:

  • Gruppi di modelli preimpostati. SOTA, Di tendenza ed Economico, più il tuo set salvato. Fai la bozza con il gruppo economico per definire la direzione, poi passa al gruppo SOTA per il finale. Questa è la stessa suddivisione dall'inizio, con entrambe le estremità ora sul cloud.
  • Una stima dei costi prima di eseguire, così non aspetti la fine per sapere quanto è costato un round.
  • Immagini e video entrambi, con text-to-image e image-to-image sul lato immagini.

Interfaccia di Atlas Cloud Model Explorer per confrontare diversi modelli di immagini AI

Atlas Cloud Model Explorer: un gruppo preimpostato di modelli selezionati per essere eseguiti in parallelo da un prompt, con la stima del costo per esecuzione mostrata prima dell'esecuzione

Verificabile non è la stessa cosa che bloccare la dimensione giusta

Quella frase dell'ultima sezione, "mantienilo piatto, non fotorealistico," è la trappola più tipica in cui siamo incappati.

La parte strana è che il vincolo può essere pienamente soddisfatto e comunque fallire completamente. Piatto? Sì. Disegnato a mano? Per niente. Spunta ogni casella della lista di controllo e ottieni il punteggio pieno.

Il problema: abbiamo bloccato la "piattezza", ma la proprietà che effettivamente porta il concetto è "segni di strumento visibili." Sostituisci con "pastello, matita colorata, pennello grosso, direzione del tratteggio, riempimento irregolare, bordi ruvidi" e lo stesso modello si inverte completamente.

Il soggetto disegnato a mano su quattro modelli. "Piatto" è facile da soddisfare, "visibilmente fatto a mano" è la proprietà che doveva effettivamente essere bloccata.

Questo si distilla in un test:

Prendi ogni vincolo che hai scritto e chiediti: il modello può soddisfare questa frase e comunque tralasciare la cosa che voglio davvero?

Se sì, il blocco è mirato a un effetto collaterale, non al concetto.

Il sintomo è familiare: l'output corrisponde alla tua lista di controllo punto per punto, ma chiunque conosca il riferimento può vedere a colpo d'occhio che è sbagliato.

La mossa giusta a quel punto è non aggiungere più blocchi. È tornare indietro e trovare la proprietà che effettivamente porta il concetto.

Riportato in "bozza locale, finalizzazione su cloud", questo ha un peso maggiore: un vincolo mirato alla dimensione sbagliata può essere invisibile alla risoluzione della bozza. A 480p la differenza tra un contorno liscio e un pennello grosso è già sfocata, e scopri che la direzione era sbagliata solo dopo aver speso lo sforzo per un finale su cloud. Se la bozza ti fa risparmiare tempo dipende dal fatto che la proprietà che hai bloccato durante la bozza fosse quella reale.

La community ha già impacchettato il processo MiniMax H3

Il resoconto ufficiale porta un altro segnale che vale la pena menzionare da solo: gli sviluppatori stanno iniziando a racchiudere l'intero processo di produzione in qualcosa di riutilizzabile.

Un artista AI utilizza Claude Code su un Mac per orchestrare un modello locale su una seconda macchina. Il Mac gestisce l'impostazione del progetto, il fact-checking, la sceneggiatura, la timeline, i sottotitoli, lo storyboard e la revisione strutturale, e l'altra estremità gestisce l'inferenza del modello. Il tutto è suddiviso in 14 fasi, dal brief fino al render batch, all'assemblaggio dell'editing e alla registrazione del libro mastro, senza mai aprire un editor tradizionale.

Un altro progetto ha racchiuso la stessa idea in un plugin con competenze integrate che vanno da una storia o un brief aziendale all'impostazione di personaggi e scene, storyboard e progettazione dei fotogrammi chiave, quindi sceglie un flusso di lavoro per ogni inquadratura. I prompt, gli asset di input, il flusso di lavoro, le inquadrature candidate e le selezioni sono tutti conservati nel record del progetto, quindi un'attività interrotta riprende da dove si era fermata.

La direzione è la stessa: tutti stanno trasformando "come è stato realizzato questo" in un asset riutilizzabile, invece di lasciare dietro di sé una pila di film finiti. Le due cose che abbiamo realizzato si trovano esattamente su quella linea.

Due risorse MiniMax H3 che puoi prendere subito

  1. La libreria ufficiale di prompt MiniMax H3 (52 prompt, 16 categorie, ciascuna con un'anteprima)

Plain
1https://github.com/AtlasCloudAI/awesome-minimax-h3-prompts

Non riscritture, ma i prompt originali della vetrina ufficiale, organizzati per scenario, ciascuno abbinato a un video di anteprima generato reale così puoi vedere il risultato prima di decidere quale copiare.

Le 16 categorie coprono brand e cinematografico, creativo visivo e packaging, motion graphics e VFX, narrazione AI, prodotto e e-commerce, creativo digitale e gaming, AI industriale e incarnata, animazione e stilizzazione, riferimento multi-materiale, riferimento personaggio/azione/fotocamera, clonazione vocale, editing di personaggi e oggetti, editing di scene e VFX, editing audio e dialoghi, seguimento preciso di istruzioni e preset di stile. Supporta 20 lingue e accetta contributi.

Il modo più veloce per usarlo durante la bozza: trova un prompt il cui soggetto è vicino al tuo, guarda la sua anteprima e usalo come punto di partenza per modificare. Molto più veloce che partire da una casella vuota.

Pagina del repository GitHub per il progetto awesome-minimax-h3-prompts

Il repository awesome-minimax-h3-prompts su GitHub, che mostra l'indice delle categorie e una voce con il suo video di anteprima

  1. La Skill universale per prompt video

Plain
1https://github.com/kiana-liang/universal-video-prompt-skill
Plain
1npx skills add kiana-liang/universal-video-prompt-skill

Risolve il problema della seconda sezione: hai copiato il prompt, ma non hai potuto copiare il giudizio fatto mentre lo scrivevi. Lo slogan dice esattamente questo. La logica decisionale sottostante che non puoi copiare copiando il prompt è ciò che vive qui.

Cosa fa: suddivide il "pensaci prima, poi scrivilo in una forma" in una lista di controllo decisionale riutilizzabile:

  • Due domande prima di ogni riga: a quale strato appartiene (globale, bloccato o temporale), ed è stato scritto in una forma osservabile?
  • Traduci l'inverificabile in verificabile. "Mantieni coerente" diventa uno stato finale visibile. "Teso" diventa movimento degli occhi, respirazione e movimento delle mani.
  • Un metodo a prova di dialetto: scrivi il termine e una descrizione osservabile insieme. Un modello che conosce il termine prende la scorciatoia, uno che non lo conosce segue la descrizione, e un prompt copre entrambi.
  • Nessuna riscrittura tra ambienti. Lo strato di linguaggio puro è scritto una volta, e i bias specifici del modello vanno in una tabella di profilo separata, del tipo di quella della terza sezione.

Il repo fornisce 5 tipi di inquadratura, 4 casi completamente sviluppati, 6 profili di modello e 4 video demo. Ogni video è legato alla regola specifica che dimostra, non è una showreel.

È anche chiaro su cosa non fa: nessuno slot obbligatorio, nessun esempio è una regola, ogni regola ha eccezioni. Se stai cercando un modello da riempire da inserire, questo non fa per te.

L'estremità di finalizzazione: eseguire MiniMax H3 su Atlas Cloud

Tutte e tre le modalità di chiamata di MiniMax H3 sono attive su Atlas Cloud, text-to-video, image-to-video e reference-to-video, con parametri, opzioni di durata ed esempi di richiesta su ogni pagina del modello.

Plain
1Panoramica         https://www.atlascloud.ai/models/minimax-h3
2Text-to-video      https://www.atlascloud.ai/models/minimax/h3/text-to-video
3Image-to-video     https://www.atlascloud.ai/models/minimax/h3/image-to-video
4Reference-to-video https://www.atlascloud.ai/models/minimax/h3/reference-to-video
5Strumento di confronto https://www.atlascloud.ai/model-explorer

Atlas Cloud raccoglie questi modelli video mainstream in un unico pool, quindi con una singola API cambi una stringa di modello per eseguire l'intero confronto. È così che è stato eseguito il test a quattro modelli nella terza sezione, tranne che allora abbiamo ancora scritto il nostro script, e ora è questione di pochi clic in Model Explorer.

Quindi la pipeline si collega in questo modo nella pratica:

FaseDoveScopo
BozzaModel Explorer, preset economico, un prompt in paralleloTestare la direzione velocemente, costruire la tabella dei profili del modello
FinalizzazioneStesso pool, passa al modello targetPrompt invariato, cambia solo la stringa del modello
ConsegnaChiamata API, nel tuo flusso di produzioneBatch, orchestratile

Tutte e tre le fasi usano lo stesso prompt e la stessa chiave. Niente viene riscritto a metà e niente cambia ambiente, che è il punto della seconda sezione: l'unico asset che deve attraversare le fasi è il prompt, quindi non lasciarlo deformare lungo il percorso. Parametri, opzioni di durata ed esempi API sono tutti sulle pagine del modello MiniMax H3.

Per concludere

Una settimana di open source, e la community ha già adattato MiniMax H3 alle schede grafiche consumer, in un programma Mac nativo e all'interno di flussi di produzione automatizzati. Quel lavoro è ciò che ha reso l'estremità locale davvero utilizzabile.

Ma l'esecuzione locale non è la consegna locale. "Bozza locale, finalizzazione su cloud" è una buona abitudine perché non mette le due estremità l'una contro l'altra. Accetta che questa è una pipeline, con due stazioni che fanno due lavori.

E perché la linea si muova, il pezzo che viene passato nel mezzo deve essere affidabile. Quel pezzo è il prompt. Quindi la cosa che vale il tuo tempo non è mai un singolo film che hai renderizzato. È il motivo per cui l'hai scritto nel modo in cui l'hai fatto.

FAQ sui prompt MiniMax H3

Dove posso eseguire MiniMax H3 senza una GPU locale?

Tutte e tre le modalità di MiniMax H3, text-to-video, image-to-video e reference-to-video, vengono eseguite su Atlas Cloud, con i parametri e le opzioni di durata su ogni pagina del modello. L'inferenza locale è utile per bozze a 480p a basso costo una volta impostate le build della community, ma il finale a risoluzione più alta viene ancora renderizzato nel cloud.

Come posso confrontare MiniMax H3 con altri modelli video in modo equo?

Esegui un prompt verbatim attraverso i modelli in un unico ambiente di esecuzione. Model Explorer lo fa con fino a 10 modelli in parallelo, il che mantiene costanti il comportamento del gateway, i parametri predefiniti e la codifica degli asset, così le differenze che vedi sono le differenze tra i modelli.

I prompt di MiniMax H3 si trasferiscono ad altri modelli?

Questo è l'intero scopo di scriverli bene. Mantieni lo strato di linguaggio puro osservabile e a prova di dialetto, termine più descrizione, e registra i bias temporali specifici del modello in una tabella di profilo separata. Il prompt poi sopravvive al passaggio da un modello di bozza al modello finale invariato.

Dove trovo prompt MiniMax H3 già pronti?

La libreria awesome-minimax-h3-prompts ha 52 prompt ufficiali dalla vetrina in 16 categorie, ciascuno con un video di anteprima reale, in 20 lingue. Trova uno vicino al tuo soggetto, guarda l'anteprima e modifica da lì.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli