
Två utskrifter av samma cold brew-flaska liggande på en kafédisk, en mjuk och en skarp, med ett kvitto mellan dem
Två utskrifter av samma bild, en mjuk och en skarp. På MiniMax H3 är det gapet ingen kvalitetsreglage. Genererad med openai/gpt-image-2/text-to-image.
Jag skickade in samma prompt två gånger. Det enda jag ändrade var en rullgardinsmeny: 768P, sedan 2K.
Den första körningen kostade $0,40 och kom tillbaka på 130 sekunder. Den andra kostade $0,56 och tog 181 sekunder. Sedan lade jag de två bilderna bredvid varandra och något kändes fel. Flaskan var fortfarande där. Etiketten var fortfarande där, liten text och allt. Men disken hade ändrats från varmt trä till blek sten, en hylla hade dykt upp i bakgrunden bakom baristan, kondensen på glaset var plötsligt överallt och ljuset hade ändrat färg.
Jag hade inte sparat pengar på ett utkast. Jag hade tagit två olika filmer.
Det här är inte en bugg. Det är vad "2K" faktiskt betyder på H3, och när du väl förstår det faller standardrådet som alla ger, "skissa billigt, avsluta dyrt", tyst samman. Nedan finns alla siffror från det testet, plus den enda ändringen som gör billig skissning fungerande.
Viktiga slutsatser (alla siffror uppmätta på Atlas Cloud, 2026-08-05)
- 768P levererade 1344x768, 2K levererade 2560x1440 på en 16:9-förfrågan. Det är 3,6 gånger antalet pixlar och 3,6 gånger videobitraten.
- Faktureringen var $0,40 vs $0,56 för ett 4 sekunders klipp, alltså $0,10/s vs $0,14/s. 768P är 29 % billigare per sekund, inte halva priset.
- 768P kom tillbaka 28 % snabbare på text-till-video-paret (130s vs 181s) och 17 % snabbare på bild-till-video-paret (194s vs 234s).
- Text-till-video vid 768P och 2K på samma prompt producerade två olika tagningar, inte två kvaliteter av en tagning. Ett naket 768P-utkast förhandsvisar inte din 2K-final.
- Lås den första bildrutan med bild-till-video och avdriften upphör. Samma set, samma inramning, samma etikettposition, och 2K lägger sina extra pixlar exakt där MiniMax säger att de gör: den lilla texten.
- 768P är inte spärrat. Båda nivåerna är aktiva i upplösningsnumreringen och valbara i rullgardinsmenyn från och med 2026-08-05, oavsett vad äldre sammanfattningar fortfarande säger.
MiniMax H3 2K vs 768P: Är 768P fortfarande i sluten beta?
Nej, och det här är värt att slå hål på tidigt eftersom det fortfarande upprepas i de flesta prissammanställningar som skrevs dagarna efter lanseringen.
Jag drog in det levande indataschemat för alla tre H3-slutpunkterna idag. Fältet resolution läser enum: ["768P", "2K"] med default: "2K" på text-till-video, bild-till-video och referens-till-video, och duration kör varje hel sekund från 4 till 15 på alla tre. Ingen flagga, ingen spärr, inget försäljningsformulär. Jag skickade sedan in ett 768P-jobb på två olika slutpunkter och båda slutfördes och fakturerades till den lägre satsen. Om en sida säger åt dig att kontakta försäljning för 768P, beskriver den sidan den första veckan av lanseringen, inte den här veckan.
MiniMax H3 2K vs 768P, samma prompt, sida vid sida
Vänster är 768P. Höger är 2K. Identisk prompt, identisk duration=4, identisk ratio=16:9, skickade in efter varandra till minimax/h3/text-to-video.

MiniMax H3 2K vs 768P delad skärm från samma text-till-video-prompt, med upplösning, pris och verklig tid inbränd
Samma prompt, två körningar. Vänster: 768P, 1344x768, $0,40, 130s. Höger: 2K, 2560x1440, $0,56, 181s. Visad som en tyst GIF; båda levererade filerna har 32 kHz stereoljud. Uppmätt på Atlas Cloud, 2026-08-05.
Titta på vad som faktiskt skiljer sig. Det är inte skärpa. Det är filmen. Olika diskmaterial, olika bakgrundsdetaljer, olika mängd kondens, olika kamerahöjd, olika färgtemperatur, och etiketten sitter på en annan punkt på flaskan. Ingenting i prompten bad om att något av detta skulle ändras.
Nu delen som alla antar går åt andra hållet. Här är etikettområdet från båda tagningarna, beskuret från originalfilerna och förstorat till samma bredd, så 768P-beskärningen är mer förstorad än 2K-beskärningen.

Etikettbeskärningsjämförelse mellan MiniMax H3 768P- och 2K-tagningarna, båda visar den lilla ingrediensraden som läsbar
Den lilla raden "single origin ethiopia guji / 250ml / roasted 04.08.2026" överlever vid 768P. Den är mjukare och bokstavsavståndet vacklar, men ingenting är oläsligt. Den verkliga kostnaden för 768P här var inte mosig text, det var en annan komposition.
Så den ärliga inramningen av MiniMax H3 2K vs 768P är inte "skarp versus suddig". Det är "den här tagningen versus en annan tagning, plus en detaljgenomgång ovanpå".
MiniMax H3 2K vs 768P specifikationsblad, uppmätt
Allt i den här tabellen kom från ffmpeg -i på de levererade filerna och från fältet price på den färdiga förutsägelsen, inte från en dokumentsida.
| Uppmätt på den levererade filen | 768P | 2K | Förhållande |
|---|---|---|---|
| Levererad upplösning (16:9-förfrågan) | 1344x768 | 2560x1440 | 3,6x pixlar |
| Video bitrate | 998 kb/s | 3 624 kb/s | 3,6x |
| Filstorlek, 4,46s klipp | 620 KB | 2,00 MB | 3,3x |
| Bildhastighet | 24 fps | 24 fps | samma |
| Ljudspår | AAC stereo, 32 000 Hz, 131 kb/s | AAC stereo, 32 000 Hz, 127 kb/s | samma |
| Containerlängd för duration=4 | 4,46s | 4,46s | samma |
| Inskickat till slutfört, verklig tid | 130s | 181s | 1,39x |
| Faktiskt fakturerat | $0,40 | $0,56 | 1,4x |
| Effektiv taxa | $0,10/s | $0,14/s | 29 % billigare |
Vill du väga MiniMax H3 mot andra videomodeller på samma prompt? Atlas Cloud-modelljämförelsen kör dem sida vid sida med upplösning och kostnad per sekund visad innan du genererar.
Två fotnoter som kostade mig pengar att lära mig. För det första, båda nivåerna levererade 4,46 sekunder för en duration=4-förfrågan och båda fakturerade för 4 sekunder, så du får de extra 0,46s gratis men du kan inte planera en klippning runt den. För det andra, ljudet är identiskt över nivåerna. Om ditt klipp bärs av dialog eller en musiksynk, köper 2K dig ingenting på det som spelar roll.
Varför MiniMax H3 2K vs 768P lurar alla
För 2K på H3 är inte ett uppskalningssteg. Det är en andra generation.
MiniMax beskriver mekanismen direkt: "För H3:s 2K-utgång, istället för att använda en konventionell dedikerad superupplösningsmodul, låter vi H3-basmodellen återskapa sin egen lågupplösta utgång i kontext." De förklarar också varför de byggde det så: kontextmetoden "låter den dra nytta av den ursprungliga multimodala kontexten igen för att producera högupplöst utgång, och återställer detaljer som traditionell superupplösning bara kan 'gissa' och ofta inte kan återställa, som liten text och fina detaljer" (MiniMax, juli 2026).
Läs det igen med en produktionshatt på. 2K-genomgången går tillbaka till din ursprungliga kontext och genererar igen. När din kontext är inget annat än en textprompt, betyder "generera igen" "slå tärningen igen". Det är precis vad mina två tagningar visar. Modellen blev aldrig tillsagd att återskapa 768P-versionen, för den såg aldrig 768P-versionen.
Tre sätt som detta biter i praktiken:
- Du rullar billiga utkast vid 768P på text-till-video, väljer en vinnare, kör den sedan igen vid 2K. Du får en främling tillbaka. Prompterna är uppfyllda, filmen är ny. Det är testet högst upp på denna sida.
- Du budgeterar som om 29 % billigare per sekund betyder 29 % billigare. Det gör det inte, eftersom finalerna är den dyra delen av varje verklig batch, och en bortkastad 2K-omrullning raderar besparingen från flera utkast.
- Du antar att den billiga uppgraderingsvägen finns där någonstans. Jag kollade hela katalogen på Atlas Cloud idag: 452 modeller, tre H3-slutpunkter, och ingen H3-återskapningsslutpunkt bland dem. Där bara de tre generationsslutpunkterna är exponerade, betyder "uppgradera detta klipp till 2K" antingen att rulla om det eller köra en separat uppskalare över det. Båda kostar pengar, och de köper inte samma sak.
Värt att säga varför det ens är värt att konstruera runt denna modell snarare än att byta. Huvuderbjudandet vid lanseringen var video "i upp till 2K-upplösning, i klipp på upp till 15 sekunder, med inbyggt stereoljud" (DataNorth AI, augusti 2026), och poängen backade upp det: H3 sitter för närvarande överst på Artificial Analysis videoredigerings Elo-tavla vid 1 130, före Gemini Omni Flash vid 1 122 och 93 poäng före Dreamina Seedance 2.0 720p vid 1 037 (Artificial Analysis, augusti 2026). Kvaliteten är värd ett arbetsflöde. Arbetsflödet måste bara respektera hur 2K produceras.
De fyra modellerna bakom detta MiniMax H3 2K vs 768P-test, i en flik
Hela testet är fyra modeller, en API-nyckel, en faktura. Jag körde det på Atlas Cloud eftersom att växla mellan en bildmodell, två H3-slutpunkter och en uppskalare annars innebär tre konton och tre fakturor att stämma av i slutet av månaden.
| Jobb i detta test | Modell | Pris från och med augusti 2026 | Vad jag faktiskt betalade |
|---|---|---|---|
| Lås den första bildrutan | openai/gpt-image-2/text-to-image | listat från $0,009/bild (token-nivåer ovanför det) | $0,1745 för en 2048x1152 vid kvalitet hög |
| Utkast och final, låst bildruta | minimax/h3/image-to-video | $0,14/s vid 2K, $0,10/s vid 768P | $0,40 och $0,56 för 4s var |
| Naken kontrollpar | minimax/h3/text-to-video | samma två nivåer | $0,40 och $0,56 för 4s var |
| Behåll tagningen, höj pixlarna | atlascloud/video-upscaler | $0,018/s till 1080p, $0,024/s till 2K, 5s minimum | $0,12 för 4,46s klippet |
Två anteckningar innan du kopierar siffrorna. H3-slutpunkterna publicerar alla en enda rubrikavgift på $0,14/s, vilket är 2K-nivån; 768P-avgiften visas i fakturan, inte i listningen, så mät den själv en gång. Och ingen av dessa fyra modeller är rabatterad just nu. Om du vill trimma steget med bildlåsning, körs openai/gpt-image-2-developer/text-to-image med 50 % rabatt ($0,004 från $0,009) från och med augusti 2026, och det är samma familj som gör samma jobb.
Hur du kör MiniMax H3 2K vs 768P-testet själv
Fem steg, $2,21 i kredit och cirka 15 minuters total verklig tid. Varje prompt nedan är exakt strängen jag skickade.
Tre parameteranteckningar först, eftersom var och en tyst kan kosta dig en körning:
- På text-till-video är fältet
ratio, inteaspect_ratio, dess standard är1:1, och dess enum har ingetadaptive-alternativ. Skicka16:9själv annars får du ett fyrkantigt klipp. På bild-till-video är enumen baraadaptive, eftersom din första bildruta bestämmer formen. - Skicka alltid
durationexplicit istället för att lita på dokumenterade standardvärdet 8. Det du faktureras följer det som levereras, inte det du antog. - Varje H3-jobb överlever en normal inline-timeout, så skicka asynkront och polla. Fältet
pricefylls också i sent: närstatusväxlar tillcompletedär det ofta fortfarande tomt, och du måste polla förutsägelse-id:t en gång till för att få det verkliga numret. Utan den andra pollningen kan du inte bygga en ärlig kostnadstabell.
Steg 1: Lås bildrutan med GPT Image 2
Detta är steget som förvandlar ett utkast till en förhandsvisning istället för en lottobiljett. Generera den färdiga kompositionen som en stillbild, och den blir den orörliga delen av båda videokörningarna.
text1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9. 2
Inställningar: kvalitet high, storlek 2048x1152. Var inte snål här. Varje detalj du vill att 2K-genomgången ska skydda måste finnas i denna bildruta först.

Den låsta första bildrutan genererad med GPT Image 2 vid 2048x1152, som visar cold brew-flaskan och dess läsbara lilla text
Genererad med openai/gpt-image-2/text-to-image, kvalitet hög, 2048x1152. Fakturerad $0,1745, tillbaka på 146s.

GPT Image 2-lekplatsen på Atlas Cloud med bildrute-prompten ifylld och den genererade flaskan i utmatningspanelen
GPT Image 2 på Atlas Cloud: kvalitet inställd på hög, 16:9, den låsta bildrutan renderad till höger.
Steg 2: Skissa det vid 768P
Samma slutpunkt som du kommer att använda för finalen. Endast upplösningen skiljer sig mellan detta steg och steg 4.
text1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake. 2
Inställningar på minimax/h3/image-to-video: första bildruta = din utmatning från steg 1, resolution=768P, duration=4, ratio=adaptive.

MiniMax H3 768P-utkastklippet, en långsam makro-dolly in på cold brew-flaskan
768P-utkastet: 1344x768, fakturerad $0,40, tillbaka på 194s. Visad som en tyst GIF; filen i sig har 32 kHz stereo. Notera de fyra tunga drip-strimmorna som smetats ner över etiketten.

MiniMax H3 bild-till-video-lekplats på Atlas Cloud med den låsta bildrutan uppladdad, prompten inskriven och ett färdigt klipp i utmatningspanelen
Bild-till-video-formuläret med den låsta bildrutan laddad. Upplösning och Duration är de enda två fälten som skiljer detta steg från steg 4, och båda nivåerna sitter i samma lista utan att något spärrar någon av dem. Denna fångst lämnades på 2K- och 8 sekunders-standardvärdena, vilket är anledningen till att Kör-knappen anger $1,12; växla Upplösning till 768P och Duration till 4 och den offerten sjunker till $0,40.
Steg 3: Bedöm MiniMax H3 2K vs 768P-utkastet på rätt saker
Utkastet är en repetition, inte ett bevis. Från mina två par, här är vad det pålitligt berättar och vad det inte gör.
Lita på det för: promptens formulering, om rörelsen överhuvudtaget fungerar, mängden kamerarörelse, tempo över de fyra sekunderna och ljudmiljön. Allt det överfördes rent.
Lita inte på det för: fin ytstruktur, den minsta typen på din produkt, eller någon artefakt det hittar på. I mitt 768P-utkast fick etiketten fyra tjocka bruna droppar som 2K-körningen inte producerade, och den lilla ingrediensraden kollapsade till otydlighet. Om jag hade förkastat det utkastet för att det såg smutsigt ut, hade jag förkastat en prompt som fungerade.
Det är den verkliga arbetsfördelningen. 768P svarar på "är detta rätt bild", 2K svarar på "är detta leveransbart".
Steg 4: Vänd ett fält och avsluta vid 2K
Samma slutpunkt, samma första bildruta, samma promptsträng. Ändra resolution till 2K och inget annat.

MiniMax H3 2K-finalklippet från samma låsta första bildruta, med en ren etikett och läsbar liten text
2K-finalen: 2560x1440, fakturerad $0,56, tillbaka på 234s. Samma skifferplatta, samma espressomaskin, samma växt, samma barista, samma etikettposition som utkastet.
Här är svaret på frågan som hela denna artikel byggdes för att testa, och det gick åt rätt håll. Med den första bildrutan låst stannade avdriften. Setet, inramningen, kamerahöjden och typografipositionen höll alla mellan 768P-utkastet och 2K-finalen. Skillnaderna var begränsade till detaljer: 2K-genomgången rengjorde de smetiga dropparna till en tunn strimma, återställde pappersstrukturen och förvandlade den lilla ingrediensraden från brus tillbaka till ord. Det är exakt det beteende MiniMax hävdar för kontextuell återskapning, och det är första gången i detta test som 2K såg ut som en kvalitetsnivå snarare än en omrullning.
Som kontrast, kontrollgruppen. Detta är den nakna text-till-video-körningen vid 2K, den som producerade främlingen högst upp på denna sida. Samma promptinnehåll, ingen första bildruta, så ingenting håller kompositionen fast.

MiniMax H3 text-till-video-lekplats vid 2K med det färdiga kontrollklippet i utmatningspanelen
MiniMax H3 text-till-video på Atlas Cloud: ingen första bildruta, Upplösning 2K, Bildförhållande 16:9, och det färdiga klippet i utmatningspanelen. Ingenting var fel med denna generation. Det är bara inte samma film som 768P-körningen producerade.
Steg 5: Eller hoppa över MiniMax H3 2K vs 768P-omrullningen och skala upp istället
Ibland är 768P-tagningen redan den rätta. Prestationen satt, timingen är rätt, och du vill inte ha en återskapning som kan landa annorlunda. Rulla inte om den då. Skicka den exakta filen genom en uppskalare.
Inställningar på atlascloud/video-upscaler: video = din 768P-utgångs-URL, target_resolution=2k. Inmatningsgränser vid 2K är 23 sekunder och 690 bildrutor, och inmatningsfps måste vara 30 eller lägre, så H3:s 24 fps-klipp passerar bekvämt.

768P-tagningen skickad genom Atlas Cloud-videouppskalaren till 2K, samma material i högre upplösning
Den uppskalade tagningen: 2540x1452, fakturerad $0,12, tillbaka på 40s. Samma fyra droppar, samma allt. Detta är samma film, inte en ny.

Atlas Cloud-videouppskalarleksplatsen med 768P-klippet laddat och 2K-resultatet i utmatningspanelen
Videouppskalaren på Atlas Cloud med 768P H3-klippet laddat och det uppskalade resultatet som spelas upp till höger. Denna fångst kördes på 1080p-standarden, vilket Kör-knappen prissätter till $0,09 för allt under 5 sekunders minimum. Växla Målupplösning till 2k och du är på nivån $0,024/s, vilket är $0,12 jag fakturerades för min egen körning.
Och här är domen som ingen bör hoppa över, alla tre etikettbeskärningar från samma låsta bildruta vid samma förstoring.

Trevägs etikettbeskärningsjämförelse: inbyggd 768P, det klippet uppskalat till 2K, och inbyggd 2K, som visar att endast inbyggd 2K återställer den lilla texten
Inbyggd 768P, samma klipp uppskalat, och inbyggd 2K. Uppskalaren skärper pappersstrukturen och den stora titeln vackert, och den behåller den exakta tagningen. Vad den inte kan göra är att sätta tillbaka den lilla raden, eftersom den informationen aldrig fanns i 768P-filen. Återskapningsgenomgången kan det, eftersom den går tillbaka till kontexten istället för till pixlarna.
Så de två vägarna är inte konkurrenter. De svarar på olika frågor. Uppskalning bevarar en prestation. Återskapning återställer detaljer. Välj efter vilken din film inte har råd att förlora.
Variationer värda att testa på MiniMax H3 2K vs 768P
- Vertikalt. Mina 16:9-tester kom tillbaka 1344x768, så kortsidan är vad nivån bestämmer. En 9:16-förfrågan borde landa på 768x1344 med samma logik, men mät det en gång innan du bygger en vertikal batch på antagandet. På bild-till-video ställer du in formen genom den första bildrutan istället för att slåss mot
adaptive-enumen. - Talande huvuden. Det här är där jag skulle hoppa över att skissa helt och gå direkt till 2K. Ansikten, tänder och ögonlinjer är precis den smådetaljklass som återskapningsgenomgången finns för, och ett 768P-utkast kommer att missinformera dig om alla tre.
- Långa klipp. Vid 15 sekunder vidgas gapet till $1,50 mot $2,10, och den verkliga tiden sträcker sig med den. Planera kön, inte bara budgeten.
- Produkttext och flerspråkigt arbete. H3:s stadiga typ i bild och dess inbyggda flerspråkiga ljud är anledningarna till att folk väljer det för kommersiella förpackningar från första början. Båda överlever vid 768P, vilket gör 768P till en genuint användbar leveransnivå för sociala beskärningar, inte bara ett repetitionsrum.
Vad MiniMax H3 2K vs 768P verkligen kostar per användbart klipp
Först de tre vägarna till ett 2K-levererbart klipp, per 8 sekunders klipp, till de avgifter jag faktiskt debiterades.
| Väg till ett 2K-klipp | Använda avgifter | Kostnad för ett 8s klipp | Behåller samma tagning | Återställer liten text |
|---|---|---|---|---|
| Direkt till 2K | $0,14/s | $1,12 | n/a | Ja |
| 768P-utkast, sedan 2K-omrullning på en låst bildruta | $0,10/s sedan $0,14/s | $0,80 + $1,12 = $1,92 | Ja, om den första bildrutan är låst | Ja |
| 768P-final, sedan uppskala till 2K | $0,10/s sedan $0,024/s | $0,80 + $0,192 = $0,99 | Ja, exakt | Nej |
Nu siffran som bestämmer din månad. Ta en realistisk blandning: tio 4 sekunders utkastrullar för att hitta tagningen, sedan två färdiga 8 sekunders klipp.
| Batch med 10 utkast + 2 finaler | Utkast | Finaler | Bildlåsning | Totalt |
|---|---|---|---|---|
| Allt vid 2K | 10 x 4s x $0,14 = $5,60 | 2 x 8s x $0,14 = $2,24 | ingen | $7,84 |
| 768P-utkast, 2K-finaler, låst bildruta | 10 x 4s x $0,10 = $4,00 | $2,24 | $0,17 | $6,41 (18 % mindre) |
| 768P-utkast, 768P-finaler, uppskalade | $4,00 | 2 x ($0,80 + $0,192) = $1,98 | $0,17 | $6,15 (22 % mindre) |
Läs den mittersta raden ärligt. Besparingen per sekund är 29 %, men besparingen per batch är 18 %, eftersom dina finaler fortfarande är finaler. Besparingen växer bara mot 29 % när skissning dominerar: vid tjugo 8 sekunders utkastrullar istället för tio korta, landar väg två cirka 25 % under allt-2K. Och varje cent av det beror på den låsta bildrutan, för utan den är de tio billiga rullarna tio filmer du inte kommer att leverera.
Den andra utdelningen är tid, och den kan vara viktigare. På text-till-video-paret återvände 768P 28 % snabbare, och över båda paren tog det aldrig en gång längre tid. På 4 sekunders klipp vid dessa verkliga tider är det ungefär 27 utkastrullar på en timme istället för 20. När du fortfarande letar efter rätt prompt, betyder sju extra försök mer än de $1,60 du sparade.
En juridisk anteckning om du planerade att undvika allt detta genom att själv hosta. De öppna vikterna på Hugging Face är H3-Base, som genererar vid 768 kortsidan. 2K-genomgången finns på API-sidan, så öppna vikter ger dig utkastnivån och inte finishnivån. Communitylicensen bär också exkluderade territorier som täcker EU, Storbritannien, Korea och USA, med en separat auktorisationskanal öppen, så läs licensen innan du bygger en kommersiell pipeline på en lokal checkout. För en bredare titt på vad de släppta vikterna gör och inte inkluderar, se vår MiniMax H3-recension, och hela modellkatalogen om du vill prissätta H3 mot resten av det nuvarande videofältet.
Vanliga frågor
I MiniMax H3 2K vs 768P, är 768P faktiskt billigare per klipp?
Ja. Jag fakturerades $0,40 för ett 4 sekunders 768P-klipp och $0,56 för samma förfrågan vid 2K, alltså $0,10/s mot $0,14/s, en besparing på 29 % per sekund. Haken är att besparingen bara räknas om den billiga körningen lär dig något om den dyra, vilket kräver att den första bildrutan låses. Ett naket text-till-video-utkast vid 768P är en separat film, och pengar spenderade på det är inte sparade pengar.
I MiniMax H3 2K vs 768P, är 2K bara en uppskalning av 768P-utgången?
Nej. MiniMax låter basmodellen återskapa sin egen lågupplösta utgång i kontext snarare än att köra en dedikerad superupplösningsmodul, vilket är anledningen till att 2K kan återställa liten text och fin ytstruktur som en uppskalare bara kan approximera. Min trevägs etikettbeskärning visar exakt det: det uppskalade 768P-klippet skärpte pappersstrukturen men lämnade den lilla ingrediensraden som oläsligt brus, medan den inbyggda 2K-körningen förvandlade den tillbaka till ord.
Kommer mitt MiniMax H3 768P-utkast att se ut som min 2K-final?
Endast om du låser den första bildrutan. På naken text-till-video gav de två nivåerna mig olika dekorationer, olika kamerahöjd, olika kondens och en annan etikettposition från samma prompt. På bild-till-video med en fast första bildruta höll kompositionen, inramningen och typografin mellan nivåerna och de enda förändringarna var i detalj och textur.
Måste jag fortfarande kontakta försäljning för MiniMax H3 768P?
Nej, inte från och med 2026-08-05. Det levande schemat på alla tre H3-slutpunkterna listar resolution som enum: ["768P", "2K"], lekplatsen visar båda i en rullgardinsmeny, och mina 768P-jobb slutfördes och fakturerades till den lägre avgiften på två olika slutpunkter. Closed-beta-linjen kommer från rapportering skriven under de första dagarna efter lanseringen.
I MiniMax H3 2K vs 768P, hur mycket långsammare är 2K?
På mina 4 sekunders par, 1,2x till 1,4x långsammare: 181s mot 130s på text-till-video och 234s mot 194s på bild-till-video, uppmätt från inskickad till slutförd. Arkitektoniskt är 2K en andra generationsgenomgång över samma kontext, så förvänta dig att det absoluta gapet vidgas på längre klipp snarare än att förbli platt.
Kan jag uppgradera ett 768P-klipp till 2K utan att rulla om det?
Du kan höja upplösningen utan att röra tagningen genom att köra den genom en videouppskalare, vilket kostade mig $0,12 för ett 4,46 sekunders klipp på 2K-nivån ($0,024/s med ett 5 sekunders minimum) och återvände på 40 sekunder. Det bevarar prestationen bildruta för bildruta. Vad det inte kommer att göra är att återställa detaljer som aldrig fångades, så om poängen med att gå till 2K är läsbar liten typ, behöver du återskapningsgenomgången, inte uppskalaren.






