Seedance 2.0 Mini & Fast API ai prezzi più bassi al mondo — fino al 68% di sconto sul prezzo ufficiale

MiniMax H3 2K vs 768P: Ho eseguito lo stesso prompt due volte e ho ottenuto due film diversi

Misurato 2026-08-05: MiniMax H3 2K vs 768P restituisce 1344x768 vs 2560x1440 a $0.40 vs $0.56. Perché la bozza economica non è un'anteprima del tuo finale, e la soluzione.

Due stampe fotografiche di bottiglie di cold brew su un tavolo di legno

Due stampe della stessa bottiglia di cold brew appoggiata su un bancone di un caffè, una morbida e una nitida, con uno scontrino tra di loro

Due stampe della stessa inquadratura, una morbida e una nitida. Su MiniMax H3 quel divario non è un cursore di qualità. Generato con openai/gpt-image-2/text-to-image.

Ho inviato lo stesso prompt due volte. L'unica cosa che ho cambiato è stato un menu a tendina: 768P, poi 2K.

La prima esecuzione è costata $0,40 ed è tornata in 130 secondi. La seconda è costata $0,56 e ha impiegato 181 secondi. Poi ho messo i due fotogrammi uno accanto all'altro e qualcosa non quadrava. La bottiglia c'era ancora. L'etichetta c'era ancora, con la stampa piccola e tutto il resto. Ma il bancone era passato da legno caldo a pietra chiara, uno scaffale era apparso sullo sfondo dietro al barista, la condensa sul vetro era improvvisamente ovunque, e la luce aveva cambiato colore.

Non avevo risparmiato su una bozza. Avevo girato due pellicole diverse.

Non è un bug. È ciò che "2K" significa realmente su H3, e una volta che lo capisci, il consiglio standard che tutti danno, "bozza a basso costo, poi finitura costosa", cade silenziosamente. Di seguito ci sono tutti i numeri di quel test, più l'unico cambiamento che rende efficace la bozza economica.

Punti chiave (tutti i dati misurati su Atlas Cloud, 2026-08-05)

  • 768P ha fornito 1344x768, 2K ha fornito 2560x1440 su una richiesta 16:9. Sono 3,6 volte i pixel e 3,6 volte il bitrate video.
  • La fatturazione è stata di $0,40 vs $0,56 per un clip di 4 secondi, quindi $0,10/s vs $0,14/s. 768P è più economico del 29% al secondo, non la metà del prezzo.
  • 768P è tornato il 28% più veloce sulla coppia text-to-video (130s vs 181s) e il 17% più veloce sulla coppia image-to-video (194s vs 234s).
  • Text-to-video a 768P e 2K con lo stesso prompt ha prodotto due riprese diverse, non due qualità della stessa ripresa. Una bozza 768P nuda non prevede il tuo finale 2K.
  • Blocca il primo fotogramma con image-to-video e la deriva si ferma. Stessa scena, stessa inquadratura, stessa posizione dell'etichetta, e 2K spende i suoi pixel extra esattamente dove dice MiniMax: sulla stampa piccola.
  • 768P non è limitato. Entrambi i livelli sono attivi nell'enumerazione della risoluzione e selezionabili nel menu a tendina al 2026-08-05, indipendentemente da ciò che dicono ancora i vecchi riepiloghi.

MiniMax H3 2K vs 768P: 768P è ancora in closed beta?

No, e vale la pena chiarirlo subito perché è ancora ripetuto in molti riepiloghi sui prezzi scritti nei giorni successivi al lancio.

Ho estratto oggi lo schema di input live per tutti e tre gli endpoint H3. Il campo resolution legge enum: ["768P", "2K"] con default: "2K" su text-to-video, image-to-video e reference-to-video, e duration esegue ogni secondo intero da 4 a 15 su tutti e tre. Nessun flag, nessun gate, nessun modulo di vendita. Ho poi inviato un job 768P su due endpoint diversi e entrambi sono stati completati e fatturati alla tariffa inferiore. Se una pagina ti dice di contattare le vendite per 768P, quella pagina descrive la prima settimana del lancio, non questa settimana.

MiniMax H3 2K vs 768P, stesso prompt, affiancati

A sinistra 768P. A destra 2K. Stesso prompt identico, stessa duration=4, stesso ratio=16:9, inviati uno dopo l'altro a minimax/h3/text-to-video.

Confronto affiancato della risoluzione dell'immagine che mostra una bottiglia di cold brew

MiniMax H3 2K vs 768P schermo diviso dallo stesso prompt text-to-video, con risoluzione, prezzo e tempo reale incorporati

Stesso prompt, due esecuzioni. A sinistra: 768P, 1344x768, $0,40, 130s. A destra: 2K, 2560x1440, $0,56, 181s. Mostrato come GIF muta; entrambi i file consegnati hanno audio stereo a 32 kHz. Misurato su Atlas Cloud, 2026-08-05.

Guarda cosa effettivamente differisce. Non è la nitidezza. È la pellicola. Diverso materiale del bancone, diversa scenografia di sfondo, diversa quantità di condensa, diversa altezza della telecamera, diversa temperatura di colore, e l'etichetta si trova in un punto diverso sulla bottiglia. Niente nel prompt chiedeva che qualcosa di tutto ciò cambiasse.

Ora la parte che tutti suppongono vada nell'altro senso. Ecco l'area dell'etichetta da entrambe le riprese, ritagliata dai file nativi e ingrandita alla stessa larghezza, quindi il ritaglio 768P è ingrandito più di quello 2K.

Confronto tra risoluzione 768p e 2K su un'etichetta di cold brew

Confronto del ritaglio dell'etichetta tra le riprese MiniMax H3 768P e 2K, entrambe mostrano la riga degli ingredienti piccola come leggibile

La riga piccola "single origin ethiopia guji / 250ml / roasted 04.08.2026" sopravvive a 768P. È più morbida e la spaziatura delle lettere oscilla, ma nulla è illeggibile. Il vero costo di 768P qui non era il testo pastoso, era una composizione diversa.

Quindi l'inquadratura onesta di MiniMax H3 2K vs 768P non è "nitido contro sfocato". È "questa ripresa contro una ripresa diversa, più un passaggio di dettaglio in cima".

La scheda tecnica di MiniMax H3 2K vs 768P, misurata

Tutto in questa tabella proviene da ffmpeg -i sui file consegnati e dal campo price sulla previsione completata, non da una pagina di documentazione.

Misurato sul file consegnato768P2KRapporto
Risoluzione consegnata (richiesta 16:9)1344x7682560x14403,6x pixel
Bitrate video998 kb/s3.624 kb/s3,6x
Dimensione file, clip 4,46s620 KB2,00 MB3,3x
Frame rate24 fps24 fpsstesso
Traccia audioAAC stereo, 32.000 Hz, 131 kb/sAAC stereo, 32.000 Hz, 127 kb/sstesso
Durata contenitore per duration=44,46s4,46sstesso
Da invio a completamento, tempo reale130s181s1,39x
Effettivamente fatturato$0,40$0,561,4x
Tariffa effettiva$0,10/s$0,14/s29% più economico

Vuoi confrontare MiniMax H3 con altri modelli video sullo stesso prompt? Il confronto modelli di Atlas Cloud li esegue affiancati con risoluzione e costo al secondo mostrati prima di generare.

Due note a piè di pagina che mi sono costate soldi da imparare. Primo, entrambi i livelli hanno consegnato 4,46 secondi per una richiesta duration=4 ed entrambi hanno fatturato 4 secondi, quindi ottieni lo 0,46s extra gratis ma non puoi pianificare un taglio intorno ad esso. Secondo, l'audio è identico tra i livelli. Se il tuo clip è portato da un dialogo o da un sync musicale, 2K non ti compra nulla sulla cosa che conta.

Perché MiniMax H3 2K vs 768P fa inciampare tutti

Perché 2K su H3 non è un passaggio di upscaling. È una seconda generazione.

MiniMax descrive il meccanismo direttamente: "Per l'output 2K di H3, invece di usare un modulo di super-risoluzione dedicato convenzionale, facciamo sì che il modello base H3 rigeneri il proprio output a bassa risoluzione in contesto." Spiegano anche perché lo hanno costruito così: l'approccio in contesto "gli permette di attingere di nuovo al contesto multimodale originale per produrre output ad alta risoluzione, recuperando dettagli che la super-risoluzione tradizionale può solo 'indovinare' e spesso non può ripristinare, come testo piccolo e dettagli fini" (MiniMax, luglio 2026).

Leggi di nuovo con un cappello da produzione. Il passaggio 2K torna al tuo contesto originale e genera di nuovo. Quando il tuo contesto è solo un prompt di testo, "genera di nuovo" significa "tira i dadi di nuovo". Questo è esattamente ciò che mostrano le mie due riprese. Al modello non è mai stato detto di riprodurre la versione 768P, perché non ha mai visto la versione 768P.

Tre modi in cui questo morde nella pratica:

  1. Fai bozze economiche a 768P su text-to-video, scegli un vincitore, poi lo riesegui a 2K. Ottieni un estraneo. Il prompt è onorato, la pellicola è nuova. Questo è il test all'inizio di questa pagina.
  2. Fai il budget come se il 29% più economico al secondo significasse il 29% più economico. Non è così, perché i finali sono la parte costosa di qualsiasi batch reale, e un solo 2K rigenerato sprecato cancella il risparmio su diverse bozze.
  3. Presumi che il percorso di upgrade economico sia lì da qualche parte. Ho controllato il catalogo completo su Atlas Cloud oggi: 452 modelli, tre endpoint H3, e nessun endpoint di rigenerazione H3 tra di loro. Dove sono esposti solo i tre endpoint di generazione, "aggiorna questo clip a 2K" significa rigenerarlo o eseguire un upscaler separato sopra di esso. Entrambi costano soldi, e non comprano la stessa cosa.

Vale la pena dire perché vale la pena progettare attorno a questo modello piuttosto che cambiare. L'offerta principale al lancio era video "fino a risoluzione 2K, in clip fino a 15 secondi, con audio stereo nativo" (DataNorth AI, agosto 2026), e i punteggi lo confermavano: H3 siede attualmente in cima alla classifica Elo di video editing di Artificial Analysis con 1.130, davanti a Gemini Omni Flash con 1.122 e 93 punti di vantaggio su Dreamina Seedance 2.0 720p con 1.037 (Artificial Analysis, agosto 2026). La qualità vale un workflow. Il workflow deve solo rispettare come viene prodotto il 2K.

I quattro modelli dietro questo test MiniMax H3 2K vs 768P, in una scheda

L'intero test è quattro modelli, una chiave API, una fattura. L'ho eseguito su Atlas Cloud perché passare da un modello immagine, due endpoint H3 e un upscaler altrimenti significa tre account e tre fatture da riconciliare alla fine del mese.

Lavoro in questo testModelloPrezzo ad agosto 2026Quello che ho effettivamente pagato
Blocca il primo fotogrammaopenai/gpt-image-2/text-to-imageelencato da $0,009/immagine (livelli di token sopra)$0,1745 per un 2048x1152 a qualità high
Bozza e finale, fotogramma bloccatominimax/h3/image-to-video$0,14/s a 2K, $0,10/s a 768P$0,40 e $0,56 per 4s ciascuno
Coppia di controllo nudaminimax/h3/text-to-videostessi due livelli$0,40 e $0,56 per 4s ciascuno
Mantieni la ripresa, alza i pixelatlascloud/video-upscaler$0,018/s fino a 1080p, $0,024/s fino a 2K, minimo 5s$0,12 per il clip di 4,46s

Due note prima di copiare i numeri. Gli endpoint H3 pubblicano tutti una singola tariffa headline di $0,14/s, che è il livello 2K; la tariffa 768P appare nella fattura, non nell'elenco, quindi misura tu stesso una volta. E nessuno di questi quattro modelli è scontato in questo momento. Se vuoi tagliare il passaggio di blocco del fotogramma, openai/gpt-image-2-developer/text-to-image è in esecuzione con il 50% di sconto ($0,004 da $0,009) ad agosto 2026, ed è la stessa famiglia che fa lo stesso lavoro.

Come eseguire il test MiniMax H3 2K vs 768P da solo

Cinque passaggi, $2,21 di credito, e circa 15 minuti di tempo reale totale. Ogni prompt qui sotto è la stringa esatta che ho inviato.

Tre note sui parametri prima, perché ognuno può costarti silenziosamente un'esecuzione:

  • Su text-to-video il campo è ratio, non aspect_ratio, il suo default è 1:1, e la sua enumerazione non ha opzione adaptive. Passa 16:9 tu stesso o ottieni un clip quadrato. Su image-to-video l'enumerazione è solo adaptive, perché il tuo primo fotogramma decide la forma.
  • Invia sempre duration esplicitamente piuttosto che fidarti del default documentato di 8. Ciò che ti viene fatturato segue ciò che viene consegnato, non ciò che hai assunto.
  • Ogni job H3 sopravvive a un normale timeout inline, quindi invia in modo asincrono e interroga. Anche il campo price si riempie in ritardo: quando status passa a completed è spesso ancora vuoto, e devi interrogare l'id di previsione ancora una volta per ottenere il numero reale. Senza quella seconda interrogazione non puoi costruire una tabella dei costi onesta.

Passaggio 1: blocca il fotogramma con GPT Image 2

Questo è il passaggio che trasforma una bozza in un'anteprima invece di un biglietto della lotteria. Genera la composizione finita come fermo immagine, e diventa la parte immobile di entrambe le esecuzioni video.

text
1Foto macro di prodotto di una bottiglia di caffè cold brew nera opaca in piedi su una lastra di ardesia bagnata, luce della finestra mattutina che la investe da destra. Un'etichetta di carta crema avvolge la bottiglia, nettamente leggibile: titolo in grassetto maiuscolo "NORTHBOUND COLD BREW" su una riga, e direttamente sotto in caratteri piccoli "single origin ethiopia guji / 250ml / roasted 04.08.2026". Gocce di condensa sul vetro, una macchina per caffè espresso e un barista in camicia di jeans leggermente fuori fuoco sullo sfondo. Cinematografico, profondità di campo ridotta, gradazione neutra calda, fotorealistico, 16:9.
2

Impostazioni: qualità high, dimensione 2048x1152. Non risparmiare qui. Ogni dettaglio che vuoi che il passaggio 2K protegga deve esistere prima in questo fotogramma.

Una bottiglia di caffè Northbound Cold Brew su un bancone di un caffè

Il primo fotogramma bloccato generato con GPT Image 2 a 2048x1152, che mostra la bottiglia di cold brew e la sua stampa piccola leggibile

Generato con openai/gpt-image-2/text-to-image, qualità high, 2048x1152. Fatturato $0,1745, tornato in 146s.

Screenshot di un'interfaccia di un generatore di immagini AI con passaggi numerati

Playground di GPT Image 2 su Atlas Cloud con il prompt del fotogramma inserito e la bottiglia generata nel pannello di output

GPT Image 2 su Atlas Cloud: qualità impostata su high, 16:9, il fotogramma bloccato renderizzato a destra.

Passaggio 2: Bozza a 768P

Stesso endpoint che userai per il finale. Solo la risoluzione differisce tra questo passaggio e il passaggio 4.

text
1Slow macro dolly-in sulla bottiglia. Le gocce di condensa scivolano giù dal vetro. L'etichetta rimane perfettamente ferma e leggibile. Nello sfondo morbido il barista pulisce il bancone una volta. Tono ambiente naturale del caffè, un debole sibilo della macchina per espresso. Nessun tremolio della telecamera.
2

Impostazioni su minimax/h3/image-to-video: primo fotogramma = output del passaggio 1, resolution=768P, duration=4, ratio=adaptive.

Una bottiglia di caffè Northbound Cold Brew su un bancone di un caffè

Il clip bozza MiniMax H3 768P, un slow macro dolly-in sulla bottiglia di cold brew

La bozza 768P: 1344x768, fatturato $0,40, tornato in 194s. Mostrato come GIF muta; il file stesso trasporta stereo a 32 kHz. Nota le quattro strisce di gocciolamento pesanti sbavate sull'etichetta.

Interfaccia del generatore video AI con prompt e video di cold brew generato

Playground di MiniMax H3 image-to-video su Atlas Cloud con il fotogramma bloccato caricato, il prompt digitato e un clip finito nel pannello di output

Il modulo image-to-video con il fotogramma bloccato caricato. Risoluzione e Durata sono gli unici due campi che separano questo passaggio dal passaggio 4, ed entrambi i livelli siedono nello stesso elenco senza nulla che ne blocchi nessuno. Questa acquisizione è stata lasciata sui default 2K e 8 secondi, motivo per cui il pulsante Esegui quota $1,12; passa Risoluzione a 768P e Durata a 4 e quella quota scende a $0,40.

Passaggio 3: Giudica la bozza MiniMax H3 2K vs 768P sulle cose giuste

La bozza è una prova, non una dimostrazione. Dalle mie due coppie, ecco cosa ti dice in modo affidabile e cosa no.

Fidati per: la formulazione del prompt, se il movimento si legge affatto, la quantità di movimento della telecamera, il ritmo nei quattro secondi, e il letto audio. Tutto questo è stato trasferito pulitamente.

Non fidarti per: la texture superficiale fine, il carattere più piccolo sul tuo prodotto, o qualsiasi artefatto che inventa. Nella mia bozza 768P l'etichetta ha raccolto quattro gocce marroni spesse che l'esecuzione 2K non ha prodotto, e la riga degli ingredienti piccola è collassata in poltiglia. Se avessi rifiutato quella bozza per averla vista sporca, avrei rifiutato un prompt che funzionava.

Questa è la vera divisione del lavoro. 768P risponde "è questa l'inquadratura giusta", 2K risponde "è questo consegnabile".

Passaggio 4: Cambia un campo e finisci a 2K

Stesso endpoint, stesso primo fotogramma, stessa stringa di prompt. Cambia resolution in 2K e nient'altro.

Una bottiglia di caffè Northbound Cold Brew su un bancone di un caffè

Il clip finale MiniMax H3 2K dallo stesso primo fotogramma bloccato, con etichetta pulita e stampa piccola leggibile

Il finale 2K: 2560x1440, fatturato $0,56, tornato in 234s. Stessa lastra, stessa macchina per espresso, stessa pianta, stesso barista, stessa posizione dell'etichetta della bozza.

Ecco la risposta alla domanda che questo intero articolo è stato costruito per testare, ed è andata nel verso giusto. Con il primo fotogramma bloccato, la deriva si è fermata. La scena, l'inquadratura, l'altezza della telecamera e la posizione tipografica sono rimaste tutte tra la bozza 768P e il finale 2K. Le differenze sono state confinate al dettaglio: il passaggio 2K ha pulito le gocce sbavate fino a una sottile colata, ha risolto la grana della carta, e ha trasformato la riga degli ingredienti piccola da rumore in parole. Questo è esattamente il comportamento che MiniMax rivendica per la rigenerazione in contesto, ed è la prima volta in questo test che 2K è sembrato un livello di qualità piuttosto che una rigenerazione.

Per contrasto, il gruppo di controllo. Questa è l'esecuzione text-to-video nuda a 2K, quella che ha prodotto l'estraneo all'inizio di questa pagina. Stesso contenuto del prompt, nessun primo fotogramma, quindi nulla fissa la composizione.

11 parole

Playground di MiniMax H3 text-to-video a 2K con il clip di controllo finito nel pannello di output

MiniMax H3 text-to-video su Atlas Cloud: nessun primo fotogramma, Risoluzione 2K, Aspect Ratio 16:9, e il clip finito nel pannello di output. Non c'era niente di sbagliato in questa generazione. Semplicemente non è la stessa pellicola che l'esecuzione 768P ha prodotto.

Passaggio 5: Oppure salta la rigenerazione MiniMax H3 2K vs 768P e fai upscaling invece

A volte la ripresa 768P è già quella giusta. La performance è azzeccata, il tempismo è corretto, e non vuoi una rigenerazione che potrebbe atterrare diversamente. Allora non rigenerarla. Invia il file esatto attraverso un upscaler.

Impostazioni su atlascloud/video-upscaler: video = URL del tuo output 768P, target_resolution=2k. I limiti di input a 2K sono 23 secondi e 690 fotogrammi, e l'fps di input deve essere 30 o inferiore, quindi i clip a 24 fps di H3 passano comodamente.

Bottiglia di caffè Northbound Cold Brew su un bancone di un caffè

La ripresa 768P inviata attraverso l'upscaler video di Atlas Cloud a 2K, stesso metraggio a risoluzione più alta

La ripresa upscalata: 2540x1452, fatturato $0,12, tornato in 40s. Stesse quattro gocce, stesso tutto. Questa è la stessa pellicola, non una nuova.

Interfaccia del generatore video AI che mostra input e video di output completato

Playground dell'upscaler video di Atlas Cloud con il clip 768P caricato e il risultato 2K nel pannello di output

L'upscaler video su Atlas Cloud con il clip H3 768P caricato e il risultato upscalato che riproduce a destra. Questa acquisizione è stata eseguita sul default 1080p, che il pulsante Esegui prezza a $0,09 per qualsiasi cosa sotto il minimo di 5 secondi. Passa Target Resolution a 2k e sei sul livello $0,024/s, che è i $0,12 che mi sono stati fatturati per la mia esecuzione.

Ed ecco il verdetto che nessuno dovrebbe saltare, tutti e tre i ritagli dell'etichetta dallo stesso fotogramma bloccato alla stessa magnificazione.

Confronto a tre pannelli di etichette di bottiglie di cold brew a diverse risoluzioni

Confronto del ritaglio dell'etichetta a tre vie: 768P nativo, quel clip upscalato a 2K, e 2K nativo, che mostra solo 2K nativo recupera la stampa piccola

768P nativo, lo stesso clip upscalato, e 2K nativo. L'upscaler nitidisce la grana della carta e il grande titolo meravigliosamente, e mantiene l'esatta ripresa. Quello che non può fare è rimettere la riga piccola, perché quella informazione non era mai stata nel file 768P. Il passaggio di rigenerazione può, perché torna al contesto invece che ai pixel.

Quindi le due rotte non sono in competizione. Rispondono a domande diverse. L'upscaling preserva una performance. La rigenerazione recupera il dettaglio. Scegli in base a quale dei due il tuo clip non può permettersi di perdere.

Variazioni che vale la pena testare su MiniMax H3 2K vs 768P

  • Verticale. I miei test 16:9 sono tornati 1344x768, quindi il lato corto è ciò a cui il livello si aggancia. Una richiesta 9:16 dovrebbe atterrare a 768x1344 sulla stessa logica, ma misura una volta prima di costruire un batch verticale sulla supposizione. Su image-to-video imposti la forma attraverso il primo fotogramma piuttosto che combattere l'enumerazione adaptive.
  • Teste parlanti. Qui salterei del tutto la bozza e andrei direttamente a 2K. Volti, denti e linee degli occhi sono precisamente la classe di dettaglio fine per cui esiste il passaggio di rigenerazione, e una bozza 768P ti disinforma su tutti e tre.
  • Clip lunghi. A 15 secondi il divario si allarga a $1,50 contro $2,10, e il tempo reale si allunga con esso. Pianifica la coda, non solo il budget.
  • Testo del prodotto e lavoro multilingua. Il tipo stabile nel fotogramma di H3 e il suo audio multilingua nativo sono i motivi per cui le persone lo scelgono per packaging commerciali in primo luogo. Entrambi sopravvivono a 768P, il che rende 768P un livello di consegna genuinamente utilizzabile per ritagli sociali, non solo una sala prove.

Quanto costa realmente MiniMax H3 2K vs 768P per clip utilizzabile

Prima le tre rotte per un prodotto consegnabile 2K, per clip di 8 secondi, alle tariffe che mi sono state effettivamente addebitate.

Rotte per un clip 2KTariffe utilizzateCosto per un clip 8sMantiene la stessa ripresaRecupera testo piccolo
Direttamente a 2K$0,14/s$1,12n/d
Bozza 768P, poi rigenerazione 2K su fotogramma bloccato$0,10/s poi $0,14/s$0,80 + $1,12 = $1,92Sì, se il primo fotogramma è bloccato
Finale 768P, poi upscale a 2K$0,10/s poi $0,024/s$0,80 + $0,192 = $0,99Sì, esattamenteNo

Ora il numero che decide il tuo mese. Prendi un mix realistico: dieci bozze da 4 secondi per trovare l'inquadratura, poi due clip finali da 8 secondi.

Batch di 10 bozze + 2 finaliBozzeFinaliBlocco fotogrammaTotale
Tutto a 2K10 x 4s x $0,14 = $5,602 x 8s x $0,14 = $2,24nessuno$7,84
Bozze 768P, finali 2K, fotogramma bloccato10 x 4s x $0,10 = $4,00$2,24$0,17$6,41 (18% in meno)
Bozze 768P, finali 768P, upscalati$4,002 x ($0,80 + $0,192) = $1,98$0,17$6,15 (22% in meno)

Leggi la riga centrale onestamente. Il risparmio al secondo è del 29%, ma il risparmio per batch è del 18%, perché i tuoi finali sono ancora finali. Il risparmio cresce solo verso il 29% man mano che la bozza domina: a venti bozze da 8 secondi invece di dieci corte, la rotta due atterra circa il 25% sotto tutto 2K. E ogni centesimo di esso dipende dal fotogramma bloccato, perché senza di esso quelle dieci bozze economiche sono dieci pellicole che non spedirai.

Il secondo dividendo è il tempo, e potrebbe importare di più. Sulla coppia text-to-video 768P è tornato il 28% più veloce, e su entrambe le coppie non ha mai impiegato più tempo. Su clip di 4 secondi a quei tempi reali, sono circa 27 bozze in un'ora invece di 20. Quando stai ancora cercando il prompt giusto, sette swing extra contano più di $1,60 risparmiati.

Una nota legale se stavi pianificando di evitare tutto questo auto-hostando. I pesi aperti su Hugging Face sono H3-Base, che genera al lato corto 768. Il passaggio 2K vive sul lato API, quindi i pesi aperti ti danno il livello bozza e non il livello finito. La licenza comunitaria porta anche territori esclusi che coprono UE, Regno Unito, Corea e USA, con un canale di autorizzazione separato aperto, quindi leggi la licenza prima di costruire una pipeline commerciale su un checkout locale. Per una visione più ampia di ciò che i pesi rilasciati fanno e non includono, vedi la nostra recensione di MiniMax H3, e il catalogo completo dei modelli se vuoi confrontare H3 con il resto del campo video attuale.

Domande frequenti

In MiniMax H3 2K vs 768P, 768P è effettivamente più economico per clip?

Sì. Mi è stato fatturato $0,40 per un clip 768P di 4 secondi e $0,56 per la stessa richiesta a 2K, quindi $0,10/s contro $0,14/s, un risparmio del 29% al secondo. Il problema è che il risparmio conta solo se l'esecuzione economica ti insegna qualcosa su quella costosa, il che richiede di bloccare il primo fotogramma. Una bozza text-to-video nuda a 768P è una pellicola separata, e i soldi spesi per essa non sono soldi risparmiati.

In MiniMax H3 2K vs 768P, 2K è solo un upscale dell'output 768P?

No. MiniMax fa rigenerare al modello base il proprio output a bassa risoluzione in contesto piuttosto che eseguire un modulo di super-risoluzione dedicato, motivo per cui 2K può ripristinare testo piccolo e dettagli superficiali fini che un upscaler può solo approssimare. Il mio ritaglio dell'etichetta a tre vie mostra esattamente questo: il clip 768P upscalato ha nitidito la grana della carta ma ha lasciato la riga degli ingredienti piccola come rumore illeggibile, mentre l'esecuzione 2K nativa l'ha trasformata di nuovo in parole.

La mia bozza MiniMax H3 768P sarà simile al mio finale 2K?

Solo se blocchi il primo fotogramma. Su text-to-video nudo i due livelli mi hanno dato diversa scenografia, diversa altezza della telecamera, diversa condensa e una diversa posizione dell'etichetta dallo stesso prompt. Su image-to-video con un primo fotogramma fisso, la composizione, l'inquadratura e la tipografia sono rimaste tutte tra i livelli e gli unici cambiamenti sono stati nel dettaglio e nella texture.

Devo ancora contattare le vendite per MiniMax H3 768P?

No, non al 2026-08-05. Lo schema live su tutti e tre gli endpoint H3 elenca resolution come enum: ["768P", "2K"], il playground mostra entrambi in un menu a tendina, e i miei job 768P sono stati completati e fatturati alla tariffa inferiore su due endpoint diversi. La linea della closed beta proviene da coperture scritte nei primi giorni dopo il lancio.

In MiniMax H3 2K vs 768P, quanto è più lento 2K?

Sulle mie coppie di 4 secondi, da 1,2 a 1,4 volte più lento: 181s contro 130s su text-to-video e 234s contro 194s su image-to-video, misurato dall'invio al completamento. Architetturalmente 2K è un secondo passaggio di generazione sullo stesso contesto, quindi aspettati che il divario assoluto si allarghi su clip più lunghi piuttosto che rimanere piatto.

Posso aggiornare un clip 768P a 2K senza rigenerarlo?

Puoi alzare la risoluzione senza toccare la ripresa inviandolo attraverso un upscaler video, che mi è costato $0,12 per un clip di 4,46 secondi al livello 2K ($0,024/s con un minimo di 5 secondi) ed è tornato in 40 secondi. Questo preserva la performance fotogramma per fotogramma. Quello che non farà è recuperare dettagli che non sono mai stati catturati, quindi se lo scopo di andare a 2K è un tipo di carattere piccolo leggibile, hai bisogno del passaggio di rigenerazione, non dell'upscaler.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli