Seedance 2.5 è ora live — In anteprima su Atlas Cloud

MiniMax H3 2K vs 768P: Ho eseguito lo stesso prompt due volte e ho ottenuto due film diversi

Misurato il 2026-08-05: MiniMax H3 2K vs 768P restituisce 1344x768 vs 2560x1440 a $0.40 vs $0.56. Perché la bozza economica non è un'anteprima del tuo finale, e la correzione.

Due foto stampate di bottiglie di cold brew su un tavolo di legno

Due stampe della stessa bottiglia di cold brew ripresa sul bancone di un bar, una morbida e una nitida, con uno scontrino in mezzo

Due stampe dello stesso scatto, una morbida e una nitida. Su MiniMax H3 quel divario non è un cursore di qualità. Generato con openai/gpt-image-2/text-to-image.

Ho inviato lo stesso prompt due volte. L'unica cosa che ho cambiato è stato un menu a tendina: 768P, poi 2K.

La prima esecuzione è costata $0.40 e ha restituito il risultato in 130 secondi. La seconda è costata $0.56 e ha impiegato 181 secondi. Poi ho messo i due fotogrammi affiancati e qualcosa mi è sembrato sbagliato. La bottiglia c'era ancora. L'etichetta c'era ancora, con la sua piccola stampa. Ma il bancone era passato da legno caldo a pietra chiara, uno scaffale era apparso sullo sfondo dietro il barista, la condensa sul vetro era improvvisamente ovunque, e la luce aveva cambiato colore.

Non avevo risparmiato su una bozza. Avevo girato due pellicole diverse.

Non è un bug. È ciò che "2K" significa realmente su H3, e una volta capito, il consiglio standard che tutti danno – "bozza economica, poi finale costoso" – cade silenziosamente. Qui sotto ci sono tutti i numeri di quel test, più l'unico cambiamento che fa funzionare la bozza economica.

Punti chiave (tutti i dati misurati su Atlas Cloud, 2026-08-05)

  • 768P ha prodotto 1344x768, 2K ha prodotto 2560x1440 per una richiesta 16:9. Sono 3,6 volte i pixel e 3,6 volte il bitrate video.
  • Il costo è stato di $0.40 vs $0.56 per un clip di 4 secondi, quindi $0,10/s vs $0,14/s. 768P è il 29% più economico al secondo, non la metà del prezzo.
  • 768P è tornato 28% più veloce sulla coppia text-to-video (130s vs 181s) e 17% più veloce sulla coppia image-to-video (194s vs 234s).
  • Text-to-video a 768P e 2K con lo stesso prompt ha prodotto due interpretazioni diverse, non due qualità della stessa. Una semplice bozza 768P non anticipa il tuo finale 2K.
  • Blocca il primo fotogramma con image-to-video e la deriva si ferma. Stessa scena, stessa inquadratura, stessa posizione dell'etichetta, e 2K spende i suoi pixel extra esattamente dove MiniMax dice che lo fa: nella stampa piccola.
  • 768P non è riservato. Entrambi i livelli sono attivi nell'enum delle risoluzioni e selezionabili nel menu a tendina al 2026-08-05, indipendentemente da ciò che dicono ancora i vecchi riepiloghi.

MiniMax H3 2K vs 768P: 768P è ancora in closed beta?

No, e vale la pena chiarirlo subito perché viene ancora ripetuto in molti confronti di prezzi scritti nei giorni successivi al lancio.

Oggi ho estratto lo schema di input live per tutti e tre gli endpoint H3. Il campo resolution riporta enum: ["768P", "2K"] con default: "2K" su text-to-video, image-to-video e reference-to-video allo stesso modo, e duration scorre ogni secondo intero da 4 a 15 su tutti e tre. Nessun flag, nessun blocco, nessun modulo di vendita. Ho poi inviato un lavoro 768P su due endpoint diversi e entrambi sono stati completati e fatturati alla tariffa inferiore. Se una pagina ti dice di contattare le vendite per 768P, quella pagina descrive la prima settimana del lancio, non questa settimana.

MiniMax H3 2K vs 768P, stesso prompt, affiancati

A sinistra 768P. A destra 2K. Stesso identico prompt, identico duration=4, identico ratio=16:9, inviati uno dopo l'altro a minimax/h3/text-to-video.

Confronto affiancato della risoluzione dell'immagine che mostra una bottiglia di cold brew

MiniMax H3 2K vs 768P schermo diviso dallo stesso prompt text-to-video, con risoluzione, prezzo e tempo reale sovrapposti

Stesso prompt, due esecuzioni. Sinistra: 768P, 1344x768, $0.40, 130s. Destra: 2K, 2560x1440, $0.56, 181s. Mostrato come GIF silenziosa; entrambi i file consegnati hanno audio stereo a 32 kHz. Misurato su Atlas Cloud, 2026-08-05.

Guarda cosa differisce realmente. Non è la nitidezza. È la pellicola. Materiale del bancone diverso, arredamento dello sfondo diverso, quantità di condensa diversa, altezza della fotocamera diversa, temperatura colore diversa, e l'etichetta si trova in un punto diverso sulla bottiglia. Niente nel prompt richiedeva che qualcosa di tutto ciò cambiasse.

Ora la parte che tutti presumono funzioni al contrario. Ecco l'area dell'etichetta da entrambe le riprese, ritagliata dai file nativi e ingrandita alla stessa larghezza, quindi il ritaglio 768P è più ingrandito di quello 2K.

Confronto tra risoluzione 768p e 2K sull'etichetta di una cold brew

Confronto del ritaglio dell'etichetta tra le riprese MiniMax H3 768P e 2K, entrambe mostrano la riga degli ingredienti piccola come leggibile

La piccola riga "single origin ethiopia guji / 250ml / roasted 04.08.2026" sopravvive a 768P. È più morbida e la spaziatura delle lettere ondeggia, ma nulla è illeggibile. Il vero costo del 768P qui non era un testo pastoso, ma una composizione diversa.

Quindi l'inquadratura onesta di MiniMax H3 2K vs 768P non è "nitido contro sfocato". È "questa ripresa contro un'altra ripresa, più un passaggio di dettaglio sopra".

La scheda tecnica di MiniMax H3 2K vs 768P, misurata

Tutto in questa tabella proviene da ffmpeg -i sui file consegnati e dal campo price sulla predizione completata, non da una pagina di documentazione.

Misurato sul file consegnato768P2KRapporto
Risoluzione consegnata (richiesta 16:9)1344x7682560x14403,6x pixel
Bitrate video998 kb/s3.624 kb/s3,6x
Dimensione file, clip 4,46s620 KB2,00 MB3,3x
Frame rate24 fps24 fpsuguale
Traccia audioAAC stereo, 32.000 Hz, 131 kb/sAAC stereo, 32.000 Hz, 127 kb/suguale
Durata contenitore per duration=44,46s4,46suguale
Invio a completato, tempo reale130s181s1,39x
Effettivamente fatturato$0.40$0.561,4x
Tariffa effettiva$0,10/s$0,14/s29% più economico

Due note a piè di pagina che mi sono costate soldi per impararle. Primo, entrambi i livelli hanno consegnato 4,46 secondi per una richiesta duration=4 e entrambi hanno fatturato 4 secondi, quindi ottieni i 0,46s extra gratis ma non puoi pianificare un taglio intorno. Secondo, l'audio è identico tra i livelli. Se il tuo clip è sostenuto da un dialogo o da un sync musicale, 2K non ti compra nulla sulla cosa che conta.

Perché MiniMax H3 2K vs 768P coglie tutti di sorpresa

Perché 2K su H3 non è un passaggio di upscaling. È una seconda generazione.

MiniMax descrive direttamente il meccanismo: "Per l'output 2K di H3, invece di utilizzare un modulo di super-risoluzione dedicato convenzionale, facciamo sì che il modello base H3 rigeneri il proprio output a bassa risoluzione in-context." Spiegano anche perché lo hanno costruito in questo modo: l'approccio in-context "gli permette di attingere di nuovo al contesto multimodale originale per produrre output ad alta risoluzione, recuperando dettagli che la super-risoluzione tradizionale può solo 'indovinare' e spesso non può ripristinare, come testi piccoli e dettagli fini" (MiniMax, luglio 2026).

Rileggilo con cappello da produzione. Il passaggio 2K torna al tuo contesto originale e genera di nuovo. Quando il tuo contesto è solo un prompt testuale, "genera di nuovo" significa "tira i dadi di nuovo". Questo è esattamente ciò che mostrano le mie due riprese. Al modello non è mai stato detto di riprodurre la versione 768P, perché non ha mai visto la versione 768P.

Tre modi in cui questo morde nella pratica:

  1. Fai bozze economiche a 768P su text-to-video, scegli un vincitore, poi riesegui a 2K. Ottieni uno sconosciuto. Il prompt è rispettato, la pellicola è nuova. Questo è il test all'inizio di questa pagina.
  2. Fai il budget come se il 29% più economico al secondo significasse il 29% più economico. Non lo fa, perché i finali sono la parte costosa di qualsiasi batch reale, e un singolo 2K sprecato annulla il risparmio su diverse bozze.
  3. Presumi che il percorso di aggiornamento economico sia lì da qualche parte. Ho controllato il catalogo completo su Atlas Cloud oggi: 452 modelli, tre endpoint H3, e nessun endpoint di rigenerazione H3 tra di loro. Dove sono esposti solo i tre endpoint di generazione, "aggiorna questo clip a 2K" significa o rieseguirlo o eseguire un upscaler separato sopra. Entrambi costano soldi, e non comprano la stessa cosa.

Vale la pena dire perché vale persino la pena progettare intorno a questo modello piuttosto che cambiare. L'offerta principale al lancio era video "fino a risoluzione 2K, in clip fino a 15 secondi, con audio stereo nativo" (DataNorth AI, agosto 2026), e i punteggi lo supportavano: H3 attualmente si trova al vertice della classifica Elo di video editing di Artificial Analysis a 1.130, davanti a Gemini Omni Flash a 1.122 e 93 punti sopra Dreamina Seedance 2.0 720p a 1.037 (Artificial Analysis, agosto 2026). La qualità vale un flusso di lavoro. Il flusso di lavoro deve solo rispettare come viene prodotto 2K.

I quattro modelli dietro questo test MiniMax H3 2K vs 768P, in una scheda

L'intero test è quattro modelli, una chiave API, una fattura. L'ho eseguito su Atlas Cloud perché altrimenti passare da un modello di immagine, due endpoint H3 e un upscaler significherebbe tre account e tre fatture da riconciliare a fine mese.

Lavoro in questo testModelloPrezzo ad agosto 2026Cosa ho effettivamente pagato
Blocca il primo fotogrammaopenai/gpt-image-2/text-to-imageelencato da $0.009/immagine (livelli di token sopra)$0.1745 per una 2048x1152 a qualità alta
Bozza e finale, fotogramma bloccatominimax/h3/image-to-video$0.14/s a 2K, $0.10/s a 768P$0.40 e $0.56 per 4s ciascuno
Coppia di controllo nudaminimax/h3/text-to-videostessi due livelli$0.40 e $0.56 per 4s ciascuno
Mantieni la ripresa, alza i pixelatlascloud/video-upscaler$0.018/s a 1080p, $0.024/s a 2K, minimo 5s$0.12 per il clip di 4.46s

Due note prima di copiare i numeri. Gli endpoint H3 pubblicano tutti una tariffa principale unica di $0.14/s, che è il livello 2K; la tariffa 768P appare nella fattura, non nell'elenco, quindi misurala una volta tu stesso. E nessuno di questi quattro modelli è scontato al momento. Se vuoi ridurre il passaggio di blocco del fotogramma, openai/gpt-image-2-developer/text-to-image è al 50% di sconto ($0.004 da $0.009) ad agosto 2026, ed è la stessa famiglia che fa lo stesso lavoro.

Come eseguire tu stesso il test MiniMax H3 2K vs 768P

Cinque passaggi, $2.21 di credito e circa 15 minuti di tempo totale. Ogni prompt qui sotto è la stringa esatta che ho inviato.

Tre note sui parametri prima, perché ognuno può costarti silenziosamente un'esecuzione:

  • Su text-to-video il campo è ratio, non aspect_ratio, il suo valore predefinito è 1:1, e il suo enum non ha opzione adaptive. Passa 16:9 tu stesso o ottieni un clip quadrato. Su image-to-video l'enum è solo adaptive, perché il tuo primo fotogramma decide la forma.
  • Invia sempre duration esplicitamente piuttosto che fidarti del valore predefinito documentato di 8. Ciò che ti viene fatturato segue ciò che viene consegnato, non ciò che hai assunto.
  • Ogni lavoro H3 sopravvive a un normale timeout inline, quindi invia in modo asincrono e interroga. Il campo price si riempie anche tardi: quando status passa a completed è spesso ancora vuoto, e devi interrogare l'id di predizione una volta in più per ottenere il numero reale. Senza quella seconda interrogazione non puoi costruire una tabella dei costi onesta.

Passaggio 1: Blocca il fotogramma con GPT Image 2

Questo è il passaggio che trasforma una bozza in un'anteprima invece che in un biglietto della lotteria. Genera la composizione finita come fermo immagine, e diventa la parte immobile di entrambe le esecuzioni video.

text
1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9.
2

Impostazioni: qualità high, dimensione 2048x1152. Non risparmiare qui. Ogni dettaglio che vuoi che il passaggio 2K protegga deve esistere prima in questo fotogramma.

Una bottiglia di caffè cold brew Northbound su un bancone di un bar

Il primo fotogramma bloccato generato con GPT Image 2 a 2048x1152, che mostra la bottiglia di cold brew e la sua piccola stampa leggibile

Generato con openai/gpt-image-2/text-to-image, qualità alta, 2048x1152. Fatturato $0.1745, tornato in 146s.

Screenshot di un'interfaccia di generazione immagini AI con passaggi numerati

Playground di GPT Image 2 su Atlas Cloud con il prompt del fotogramma compilato e la bottiglia generata nel pannello di output

GPT Image 2 su Atlas Cloud: qualità impostata su alta, 16:9, il fotogramma bloccato renderizzato a destra.

Passaggio 2: Bozza a 768P

Stesso endpoint che userai per il finale. Solo la risoluzione differisce tra questo passaggio e il passaggio 4.

text
1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake.
2

Impostazioni su minimax/h3/image-to-video: primo fotogramma = il tuo output del passaggio 1, resolution=768P, duration=4, ratio=adaptive.

Una bottiglia di caffè cold brew Northbound su un bancone di un bar

Il clip bozza 768P di MiniMax H3, un lento dolly-in macro sulla bottiglia di cold brew

La bozza 768P: 1344x768, fatturato $0.40, tornato in 194s. Mostrato come GIF silenziosa; il file stesso trasporta stereo a 32 kHz. Nota le quattro strisce pesanti di gocciolamento spalmate sull'etichetta.

Interfaccia del generatore video AI con prompt e video di cold brew generato

Playground di MiniMax H3 image-to-video su Atlas Cloud con il fotogramma bloccato caricato, il prompt digitato e un clip finito nel pannello di output

Il modulo image-to-video con il fotogramma bloccato caricato. Risoluzione e Durata sono gli unici due campi che separano questo passaggio dal passaggio 4, e entrambi i livelli si trovano nello stesso elenco senza nulla che blocchi l'uno o l'altro. Questa cattura è stata lasciata sui valori predefiniti 2K e 8 secondi, motivo per cui il pulsante Esegui cita $1.12; passa Risoluzione a 768P e Durata a 4 e quella citazione scende a $0.40.

Passaggio 3: Giudica la bozza MiniMax H3 2K vs 768P sulle cose giuste

La bozza è una prova, non una prova definitiva. Dalle mie due coppie, ecco cosa ti dice in modo affidabile e cosa no.

Fidati per: formulazione del prompt, se il movimento è leggibile, la quantità di movimento della fotocamera, il ritmo nei quattro secondi e il tappeto sonoro. Tutto questo è stato trasferito in modo pulito.

Non fidarti per: texture superficiale fine, il carattere più piccolo sul tuo prodotto, o qualsiasi artefatto che inventa. Nella mia bozza 768P l'etichetta ha raccolto quattro gocce marroni spesse che l'esecuzione 2K non ha prodotto, e la piccola riga degli ingredienti è collassata in poltiglia. Se avessi respinto quella bozza perché sembrava sporca, avrei respinto un prompt che funzionava.

Questa è la vera divisione del lavoro. 768P risponde "è questa la giusta inquadratura", 2K risponde "è questo consegnabile".

Passaggio 4: Cambia un campo e finisci a 2K

Stesso endpoint, stesso primo fotogramma, stessa stringa di prompt. Cambia resolution in 2K e nient'altro.

Una bottiglia di caffè cold brew Northbound su un bancone di un bar

Il clip finale 2K di MiniMax H3 dallo stesso primo fotogramma bloccato, con etichetta pulita e piccola stampa leggibile

Il finale 2K: 2560x1440, fatturato $0.56, tornato in 234s. Stessa lastra, stessa macchina per caffè espresso, stessa pianta, stesso barista, stessa posizione dell'etichetta della bozza.

Ecco la risposta alla domanda per cui questo intero articolo è stato costruito per testare, e ha funzionato bene. Con il primo fotogramma bloccato, la deriva si è fermata. La scena, l'inquadratura, l'altezza della fotocamera e la posizione della tipografia sono rimaste tutte tra la bozza 768P e il finale 2K. Le differenze erano limitate al dettaglio: il passaggio 2K ha pulito le gocce spalmate fino a un sottile rivolo, ha risolto la grana della carta e ha trasformato la piccola riga degli ingredienti da rumore in parole. Questo è esattamente il comportamento che MiniMax rivendica per la rigenerazione in-context, ed è la prima volta in questo test che 2K sembrava un livello di qualità piuttosto che una ripetizione.

Per contrasto, il gruppo di controllo. Questa è l'esecuzione nuda text-to-video a 2K, quella che ha prodotto lo sconosciuto all'inizio di questa pagina. Stesso contenuto del prompt, nessun primo fotogramma, quindi nulla blocca la composizione.

11 parole

Playground di MiniMax H3 text-to-video a 2K con il clip di controllo finito nel pannello di output

MiniMax H3 text-to-video su Atlas Cloud: nessun primo fotogramma, Risoluzione 2K, Aspect Ratio 16:9, e il clip finito nel pannello di output. Non c'era niente di sbagliato in questa generazione. Semplicemente non è la stessa pellicola che l'esecuzione 768P ha prodotto.

Passaggio 5: O salta la ripetizione MiniMax H3 2K vs 768P e upscala invece

A volte la ripresa 768P è già quella giusta. La performance è azzeccata, il tempismo è giusto, e non vuoi una rigenerazione che potrebbe atterrare diversamente. Allora non ripeterla. Spingi il file esatto attraverso un upscaler.

Impostazioni su atlascloud/video-upscaler: video = URL del tuo output 768P, target_resolution=2k. I limiti di input a 2K sono 23 secondi e 690 fotogrammi, e l'fps di input deve essere 30 o inferiore, quindi i clip 24 fps di H3 passano comodamente.

Bottiglia di caffè cold brew Northbound su un bancone di un bar

La ripresa 768P passata attraverso l'upscaler video di Atlas Cloud a 2K, stesso filmato a risoluzione più alta

La ripresa upscalata: 2540x1452, fatturato $0.12, tornato in 40s. Stesse quattro gocce, stesso tutto. Questo è lo stesso film, non uno nuovo.

Interfaccia del generatore video AI che mostra video di input e output completato

Playground di video upscaler di Atlas Cloud con il clip 768P caricato e il risultato 2K nel pannello di output

Il video upscaler su Atlas Cloud con il clip 768P H3 caricato e il risultato upscalato in riproduzione a destra. Questa cattura è stata eseguita sul valore predefinito 1080p, che il pulsante Esegui prezza a $0.09 per qualsiasi cosa sotto il minimo di 5 secondi. Passa Target Resolution a 2k e sei sul livello $0.024/s, che è il $0.12 che mi è stato fatturato per la mia esecuzione.

Ed ecco il verdetto che nessuno dovrebbe saltare, tutti e tre i ritagli dell'etichetta dallo stesso fotogramma bloccato allo stesso ingrandimento.

Confronto a tre pannelli di etichette di bottiglie di cold brew a diverse risoluzioni

Confronto a tre vie del ritaglio dell'etichetta: 768P nativo, quel clip upscalato a 2K, e 2K nativo, che mostra solo il 2K nativo recupera la piccola stampa

768P nativo, lo stesso clip upscalato e 2K nativo. L'upscaler nitidisce la grana della carta e il grande titolo meravigliosamente, e mantiene la ripresa esatta. Ciò che non può fare è rimettere la piccola riga, perché quell'informazione non era mai stata nel file 768P. Il passaggio di rigenerazione può farlo, perché torna al contesto invece che ai pixel.

Quindi le due rotte non sono in competizione. Rispondono a domande diverse. L'upscaling preserva una performance. La rigenerazione recupera dettaglio. Scegli in base a quale il tuo clip non può permettersi di perdere.

Variazioni che vale la pena testare su MiniMax H3 2K vs 768P

  • Verticale. I miei test 16:9 sono tornati 1344x768, quindi il lato corto è ciò che il livello blocca. Una richiesta 9:16 dovrebbe atterrare a 768x1344 con la stessa logica, ma misuralo una volta prima di costruire un batch verticale su questa ipotesi. Su image-to-video imposti la forma attraverso il primo fotogramma piuttosto che combattere l'enum adaptive.
  • Teste parlanti. Questo è dove salterei del tutto la bozza e andrei direttamente a 2K. Volti, denti e linee di sguardo sono precisamente la classe di dettaglio fine per cui esiste il passaggio di rigenerazione, e una bozza 768P ti disinformerà su tutti e tre.
  • Clip lunghi. A 15 secondi il divario si allarga a $1.50 contro $2.10, e il tempo reale si allunga con esso. Pianifica la coda, non solo il budget.
  • Testo di prodotto e lavoro multilingua. Il tipo stabile di H3 all'interno del fotogramma e il suo audio multilingue nativo sono i motivi per cui le persone lo scelgono per packaging commerciali in primo luogo. Entrambi sopravvivono a 768P, il che rende 768P un livello di consegna genuinamente utilizzabile per ritagli social, non solo una sala prove.

Quanto costa realmente MiniMax H3 2K vs 768P per clip utilizzabile

Prima le tre rotte per un file consegnabile 2K, per clip di 8 secondi, alle tariffe che mi sono state effettivamente addebitate.

Rotte per un clip 2KTariffe utilizzateCosto per un clip di 8sMantiene la stessa ripresaRecupera testo piccolo
Direttamente a 2K$0.14/s$1.12n/a
Bozza 768P, poi ripetizione 2K su fotogramma bloccato$0.10/s poi $0.14/s$0.80 + $1.12 = $1.92Sì, se il primo fotogramma è bloccato
Finale 768P, poi upscalato a 2K$0.10/s poi $0.024/s$0.80 + $0.192 = $0.99Sì, esattamenteNo

Ora il numero che decide il tuo mese. Prendi un mix realistico: dieci bozze da 4 secondi per trovare lo scatto, poi due clip finali da 8 secondi.

Batch di 10 bozze + 2 finaliBozzeFinaliBlocco fotogrammaTotale
Tutto a 2K10 x 4s x $0.14 = $5.602 x 8s x $0.14 = $2.24nessuno$7.84
Bozze 768P, finali 2K, fotogramma bloccato10 x 4s x $0.10 = $4.00$2.24$0.17$6.41 (18% in meno)
Bozze 768P, finali 768P, upscalati$4.002 x ($0.80 + $0.192) = $1.98$0.17$6.15 (22% in meno)

Leggi la riga centrale onestamente. Il risparmio al secondo è del 29%, ma il risparmio per batch è del 18%, perché i tuoi finali sono ancora finali. Il risparmio cresce solo verso il 29% quando la bozza domina: a venti bozze da 8 secondi invece di dieci corte, la seconda rotta atterra circa il 25% sotto il tutto-2K. E ogni centesimo di esso dipende dal fotogramma bloccato, perché senza quelle dieci bozze economiche sono dieci film che non spedirai.

Il secondo dividendo è il tempo, e potrebbe importare di più. Sulla coppia text-to-video 768P è tornato il 28% più veloce, e su entrambe le coppie non ha mai impiegato più tempo. Su clip da 4 secondi a quei tempi reali, sono circa 27 bozze in un'ora invece di 20. Quando stai ancora cercando il prompt giusto, sette oscillazioni in più contano più degli $1.60 che hai risparmiato.

Una nota legale se stavi pianificando di evitare tutto questo ospitando da solo. I pesi aperti su Hugging Face sono H3-Base, che genera al lato corto 768. Il passaggio 2K vive sul lato API, quindi i pesi aperti ti danno il livello bozza e non il livello finale. La licenza comunitaria porta anche territori esclusi che coprono UE, Regno Unito, Corea e USA, con un canale di autorizzazione separato aperto, quindi leggi la licenza prima di costruire una pipeline commerciale su un checkout locale. Per uno sguardo più ampio su ciò che i pesi rilasciati fanno e non fanno, vedi la nostra recensione di MiniMax H3, e il catalogo completo dei modelli se vuoi confrontare H3 con il resto del campo video attuale.

Domande frequenti

In MiniMax H3 2K vs 768P, 768P è effettivamente più economico per clip?

Sì. Mi è stato fatturato $0.40 per un clip di 4 secondi a 768P e $0.56 per la stessa richiesta a 2K, quindi $0.10/s contro $0.14/s, un risparmio del 29% al secondo. Il problema è che il risparmio conta solo se l'esecuzione economica ti insegna qualcosa su quella costosa, il che richiede di bloccare il primo fotogramma. Una bozza nuda text-to-video a 768P è un film separato, e i soldi spesi per essa non sono soldi risparmiati.

In MiniMax H3 2K vs 768P, 2K è solo un upscale dell'output 768P?

No. MiniMax fa sì che il modello base rigeneri il proprio output a bassa risoluzione in-context piuttosto che eseguire un modulo di super-risoluzione dedicato, motivo per cui 2K può ripristinare testi piccoli e dettagli superficiali fini che un upscaler può solo approssimare. Il mio ritaglio a tre vie dell'etichetta mostra esattamente questo: il clip 768P upscalato ha nitidito la grana della carta ma ha lasciato la piccola riga degli ingredienti come rumore illeggibile, mentre l'esecuzione nativa 2K l'ha trasformata di nuovo in parole.

La mia bozza MiniMax H3 768P assomiglierà al mio finale 2K?

Solo se blocchi il primo fotogramma. Su text-to-video nudo i due livelli mi hanno dato diverso arredamento di scena, diversa altezza della fotocamera, diversa condensa e una diversa posizione dell'etichetta dallo stesso prompt. Su image-to-video con un primo fotogramma fisso, la composizione, l'inquadratura e la tipografia sono rimaste tutte tra i livelli e gli unici cambiamenti sono stati nel dettaglio e nella texture.

Devo ancora contattare le vendite per MiniMax H3 768P?

No, non al 2026-08-05. Lo schema live su tutti e tre gli endpoint H3 elenca resolution come enum: ["768P", "2K"], il playground mostra entrambi in un menu a tendina, e i miei lavori 768P sono stati completati e fatturati alla tariffa inferiore su due endpoint diversi. La linea della closed beta proviene da coperture scritte nei primi giorni dopo il lancio.

In MiniMax H3 2K vs 768P, quanto è più lento 2K?

Sulle mie coppie da 4 secondi, da 1.2x a 1.4x più lento: 181s contro 130s su text-to-video e 234s contro 194s su image-to-video, misurati dall'invio al completamento. Architetturalmente 2K è un secondo passaggio di generazione sullo stesso contesto, quindi aspettati che il divario assoluto si allarghi su clip più lunghi piuttosto che rimanere piatto.

Posso aggiornare un clip 768P a 2K senza ripeterlo?

Puoi aumentare la risoluzione senza toccare la ripresa eseguendolo attraverso un upscaler video, che mi è costato $0.12 per un clip di 4.46 secondi al livello 2K ($0.024/s con un minimo di 5 secondi) ed è tornato in 40 secondi. Questo preserva la performance fotogramma per fotogramma. Ciò che non farà è recuperare dettaglio che non è mai stato catturato, quindi se lo scopo di andare a 2K è il tipo piccolo leggibile, hai bisogno del passaggio di rigenerazione, non dell'upscaler.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli