
Dwa wydruki tego samego ujęcia butelki cold brew leżącej na ladzie kawiarni – jeden miękki, drugi ostry – z paragonem między nimi
Dwa wydruki tego samego ujęcia, jeden miękki, drugi ostry. W MiniMax H3 ta różnica to nie suwak jakości. Wygenerowane za pomocą openai/gpt-image-2/text-to-image.
Wysłałem dwa razy ten sam prompt. Zmieniłem tylko jedno pole rozwijane: 768P, potem 2K.
Pierwsze uruchomienie kosztowało 0,40 $ i zwróciło się po 130 sekundach. Drugie kosztowało 0,56 $ i zajęło 181 sekund. Potem zestawiłem dwie klatki obok siebie i coś było nie tak. Butelka wciąż tam była. Etykieta wciąż tam była, drobny druk i wszystko. Ale lada zmieniła się z ciepłego drewna w blady kamień, w tle pojawiła się półka za baristą, kondensacja na szkle nagle była wszędzie, a światło zmieniło barwę.
Nie zaoszczędziłem na szkicu. Zrobiłem dwa różne filmy.
To nie jest błąd. To znaczenie „2K" w H3, a gdy to zrozumiesz, standardowa rada, którą wszyscy dają – „najpierw tani szkic, potem drogi finalny" – cicho się rozpada. Poniżej wszystkie liczby z tego testu oraz jedna zmiana, która sprawia, że tanie szkicowanie działa.
Kluczowe wnioski (wszystkie wartości zmierzone na Atlas Cloud, 2026-08-05)
- 768P dostarczyło 1344x768, 2K dostarczyło 2560x1440 na żądanie 16:9. To 3,6× więcej pikseli i 3,6× więcej bitrate'u wideo.
- Opłata wyniosła 0,40 $ vs 0,56 $ za 4-sekundowy klip, czyli 0,10 $/s vs 0,14 $/s. 768P jest 29% tańsze na sekundę, a nie o połowę.
- 768P zwróciło się 28% szybciej na parze tekst-wideo (130 s vs 181 s) i 17% szybciej na parze obraz-wideo (194 s vs 234 s).
- Tekst-wideo przy 768P i 2K na tym samym prompcie wyprodukowało dwa różne ujęcia, a nie dwie jakości tego samego ujęcia. Surowy szkic 768P nie zapowiada twojego finalnego 2K.
- Zablokuj pierwszą klatkę za pomocą obraz-wideo, a dryf ustanie. Ten sam zestaw, to samo kadrowanie, ta sama pozycja etykiety, a 2K wydaje swoje dodatkowe piksele dokładnie tam, gdzie MiniMax mówi: w drobnym druku.
- 768P nie jest ograniczone. Oba poziomy są dostępne w wyliczeniu rozdzielczości i wybieralne w polu rozwijanym stan na 2026-08-05, niezależnie od tego, co wciąż piszą starsze podsumowania.
MiniMax H3 2K vs 768P: Czy 768P wciąż jest w zamkniętej becie?
Nie, i warto to od razu wyjaśnić, bo wciąż powtarza się to w wielu zestawieniach cen pisanych w pierwszych dniach po premierze.
Dziś wyciągnąłem aktualny schemat wejściowy dla wszystkich trzech endpointów H3. Pole resolution ma wartość enum: ["768P", "2K"] z default: "2K" w tekst-wideo, obraz-wideo i referencja-wideo, a duration działa co całą sekundę od 4 do 15 na wszystkich trzech. Żadnej flagi, żadnej bramki, żadnego formularza sprzedażowego. Następnie wysłałem zadanie 768P na dwóch różnych endpointach i oba zostały ukończone i rozliczone według niższej stawki. Jeśli strona mówi, że trzeba skontaktować się z działem sprzedaży dla 768P, to ta strona opisuje pierwszy tydzień premiery, nie ten tydzień.
MiniMax H3 2K vs 768P, ten sam prompt, obok siebie
Po lewej 768P. Po prawej 2K. Identyczny prompt, identyczne duration=4, identyczne ratio=16:9, wysłane jeden po drugim do minimax/h3/text-to-video.

Podzielony ekran MiniMax H3 2K vs 768P z tego samego promptu tekst-wideo, z wbudowaną rozdzielczością, ceną i czasem rzeczywistym
Ten sam prompt, dwa uruchomienia. Po lewej: 768P, 1344x768, 0,40 $, 130 s. Po prawej: 2K, 2560x1440, 0,56 $, 181 s. Pokazane jako cichy GIF; oba dostarczone pliki mają 32 kHz stereo audio. Zmierzone na Atlas Cloud, 2026-08-05.
Spójrz, co się faktycznie różni. To nie ostrość. To film. Inny materiał lady, inne dekoracje tła, inna ilość kondensacji, inna wysokość kamery, inna temperatura barwowa, a etykieta znajduje się w innym miejscu na butelce. Nic w prompcie nie prosiło o żadną z tych zmian.
A teraz część, którą wszyscy zakładają, że działa odwrotnie. Oto obszar etykiety z obu ujęć, przycięty z natywnych plików i powiększony do tej samej szerokości, więc przycięcie 768P jest powiększone bardziej niż przycięcie 2K.

Porównanie przycięcia etykiety między ujęciami MiniMax H3 768P i 2K, oba pokazują małą linię składników jako czytelną
Mała linia „single origin ethiopia guji / 250ml / roasted 04.08.2026" przetrwa przy 768P. Jest bardziej miękka, a odstępy między literami się chwieją, ale nic nie jest nieczytelne. Prawdziwym kosztem 768P nie była tutaj rozmazana czcionka, tylko inna kompozycja.
Zatem uczciwym ujęciem MiniMax H3 2K vs 768P nie jest „ostry kontra rozmazany". To „to ujęcie kontra inne ujęcie, plus dodatkowa warstwa szczegółów".
Arkusz specyfikacji MiniMax H3 2K vs 768P, zmierzony
Wszystko w tej tabeli pochodzi z ffmpeg -i na dostarczonych plikach oraz z pola price w ukończonym przewidywaniu, a nie ze strony dokumentacji.
| Zmierzone na dostarczonym pliku | 768P | 2K | Stosunek |
|---|---|---|---|
| Dostarczona rozdzielczość (żądanie 16:9) | 1344x768 | 2560x1440 | 3,6× pikseli |
| Bitrate wideo | 998 kb/s | 3 624 kb/s | 3,6× |
| Rozmiar pliku, 4,46 s klip | 620 KB | 2,00 MB | 3,3× |
| Liczba klatek na sekundę | 24 fps | 24 fps | taki sam |
| Ścieżka audio | AAC stereo, 32 000 Hz, 131 kb/s | AAC stereo, 32 000 Hz, 127 kb/s | taki sam |
| Czas trwania kontenera dla duration=4 | 4,46 s | 4,46 s | taki sam |
| Czas od wysłania do ukończenia (zegar) | 130 s | 181 s | 1,39× |
| Faktycznie naliczona opłata | 0,40 $ | 0,56 $ | 1,4× |
| Efektywna stawka | 0,10 $/s | 0,14 $/s | 29% taniej |
Chcesz porównać MiniMax H3 z innymi modelami wideo na tym samym prompcie? Porównanie modeli Atlas Cloud pokazuje je obok siebie z rozdzielczością i kosztem na sekundę przed generowaniem.
Dwa przypisy, których nauczyłem się na własnym koszcie. Po pierwsze, oba poziomy dostarczyły 4,46 sekundy dla żądania duration=4 i oba naliczyły opłatę za 4 sekundy, więc dostajesz dodatkowe 0,46 s gratis, ale nie możesz zaplanować cięcia wokół tego. Po drugie, audio jest identyczne w obu poziomach. Jeśli twój klip opiera się na dialogu lub synchronizacji z muzyką, 2K nie kupuje ci niczego w tym, co się liczy.
Dlaczego MiniMax H3 2K vs 768P wszystkich myli
Ponieważ 2K w H3 nie jest etapem upskalowania. To druga generacja.
MiniMax opisuje mechanizm wprost: „W przypadku wyjścia 2K w H3, zamiast używać konwencjonalnego dedykowanego modułu superrozdzielczości, podstawowy model H3 regeneruje własne wyjście niskiej rozdzielczości w kontekście." Wyjaśniają też, dlaczego to zbudowali w ten sposób: podejście w kontekście „pozwala mu ponownie sięgnąć do oryginalnego multimodalnego kontekstu, aby wyprodukować wyjście wysokiej rozdzielczości, odzyskując szczegóły, które tradycyjna superrozdzielczość może tylko 'zgadywać' i często nie może przywrócić, takie jak mały tekst i drobne detale" (MiniMax, lipiec 2026).
Przeczytaj to jeszcze raz, zakładając czapkę producenta. Przejście 2K wraca do twojego oryginalnego kontekstu i generuje ponownie. Gdy twój kontekst to nic innego jak prompt tekstowy, „generuj ponownie" oznacza „rzuć kośćmi jeszcze raz". To dokładnie to, co pokazują moje dwa ujęcia. Model nigdy nie został poinstruowany, aby odtworzyć wersję 768P, ponieważ nigdy nie widział wersji 768P.
Trzy sposoby, w jakie to boli w praktyce:
- Rzucasz tanie szkice przy 768P w tekst-wideo, wybierasz zwycięzcę, a potem uruchamiasz go ponownie przy 2K. Dostajesz obcego. Prompt jest honorowany, film jest nowy. To jest test na górze tej strony.
- Budżetujesz tak, jakby 29% taniej na sekundę oznaczało 29% taniej. Nie oznacza, ponieważ finalne wersje są drogą częścią każdej prawdziwej partii, a jeden zmarnowany przerzut 2K kasuje oszczędności z kilku szkiców.
- Zakładasz, że tania ścieżka uaktualnienia gdzieś tam jest. Sprawdziłem pełny katalog na Atlas Cloud dzisiaj: 452 modele, trzy endpointy H3 i żadnego endpointu regeneracji H3 wśród nich. Tam, gdzie udostępnione są tylko trzy endpointy generacji, „uaktualnij ten klip do 2K" oznacza albo jego powtórne wygenerowanie, albo uruchomienie oddzielnego upskalera. Oboje kosztują pieniądze i nie kupują tego samego.
Warto powiedzieć, dlaczego w ogóle warto inżynieryjnie obejść ten model, zamiast go zmieniać. Główną ofertą przy premierze było wideo „w rozdzielczości do 2K, w klipach do 15 sekund, z natywnym stereo audio" (DataNorth AI, sierpień 2026), a wyniki to potwierdzały: H3 obecnie znajduje się na szczycie tablicy Elo edycji wideo Artificial Analysis z wynikiem 1 130, przed Gemini Omni Flash z 1 122 i 93 punkty przed Dreamina Seedance 2.0 720p z 1 037 (Artificial Analysis, sierpień 2026). Jakość jest warta przepływu pracy. Przepływ pracy musi tylko respektować sposób, w jaki produkowane jest 2K.
Cztery modele stojące za tym testem MiniMax H3 2K vs 768P, w jednej zakładce
Cały test to cztery modele, jeden klucz API, jeden rachunek. Przeprowadziłem go na Atlas Cloud, ponieważ przełączanie między modelem obrazu, dwoma endpointami H3 i upskalerem oznacza inaczej trzy konta i trzy faktury do uzgodnienia na koniec miesiąca.
| Zadanie w tym teście | Model | Cena według sierpnia 2026 | Co faktycznie zapłaciłem |
|---|---|---|---|
| Zablokuj pierwszą klatkę | openai/gpt-image-2/text-to-image | od 0,009 $/obraz (wyższe poziomy tokenów) | 0,1745 $ za jeden 2048x1152 przy jakości high |
| Szkic i final, zablokowana klatka | minimax/h3/image-to-video | 0,14 $/s przy 2K, 0,10 $/s przy 768P | 0,40 $ i 0,56 $ za 4 s każdy |
| Para kontrolna (bez obrazu) | minimax/h3/text-to-video | te same dwa poziomy | 0,40 $ i 0,56 $ za 4 s każdy |
| Zachowaj ujęcie, podnieś piksele | atlascloud/video-upscaler | 0,018 $/s do 1080p, 0,024 $/s do 2K, min. 5 s | 0,12 $ za 4,46 s klip |
Dwie uwagi, zanim skopiujesz liczby. Wszystkie endpointy H3 publikują jedną stawkę podstawową 0,14 $/s, która jest poziomem 2K; stawka 768P pojawia się na rachunku, a nie w ofercie, więc zmierz ją sam raz. I żaden z tych czterech modeli nie jest obecnie przeceniony. Jeśli chcesz przyciąć etap blokowania klatki, openai/gpt-image-2-developer/text-to-image działa z 50% zniżką (0,004 $ z 0,009 $) według sierpnia 2026 i jest to ta sama rodzina wykonująca to samo zadanie.
Jak samodzielnie przeprowadzić test MiniMax H3 2K vs 768P
Pięć kroków, kredyt 2,21 $ i około 15 minut czasu rzeczywistego. Każdy prompt poniżej to dokładnie ten ciąg, który wysłałem.
Najpierw trzy uwagi o parametrach, ponieważ każdy z nich może po cichu kosztować cię jedno uruchomienie:
- W tekst-wideo pole nazywa się
ratio, nieaspect_ratio, jego domyślna wartość to1:1, a jego wyliczenie nie ma opcjiadaptive. Sam podaj16:9albo dostaniesz kwadratowy klip. W obraz-wideo wyliczenie to tylkoadaptive, ponieważ twoja pierwsza klatka decyduje o kształcie. - Zawsze wysyłaj
durationjawnie, zamiast ufać udokumentowanej domyślnej wartości 8. Opłata naliczana jest według tego, co jest dostarczone, a nie co zakładasz. - Każde zadanie H3 przekracza normalny limit czasu inline, więc wysyłaj asynchronicznie i sonduj. Pole
pricerównież wypełnia się późno: gdystatuszmieni się nacompleted, często jest jeszcze puste i musisz ponownie sondować identyfikator przewidywania, aby uzyskać prawdziwą liczbę. Bez tego drugiego sondowania nie zbudujesz uczciwej tabeli kosztów.
Krok 1: Zablokuj klatkę za pomocą GPT Image 2
To jest krok, który zamienia szkic w podgląd, a nie w los na loterii. Wygeneruj gotową kompozycję jako nieruchomy obraz, a stanie się niezmienną częścią obu uruchomień wideo.
text1Makro produktowe butelki cold brew w kolorze matowej czerni stojącej na mokrej płycie łupkowej, poranne światło okienne pada na nią z prawej strony. Kremowa papierowa etykieta owija butelkę, wyraźnie czytelna: pogrubiona wielka litera tytuł „NORTHBOUND COLD BREW" w jednej linii, a bezpośrednio pod nią małą czcionką „single origin ethiopia guji / 250ml / roasted 04.08.2026". Krople kondensacji na szkle, ekspres do kawy i barista w dżinsowej koszuli delikatnie nieostrzy w tle. Kinowy, płytka głębia ostrości, ciepła neutralna gradacja, fotorealistyczny, 16:9. 2
Ustawienia: jakość high, rozmiar 2048x1152. Nie oszczędzaj tutaj. Każdy szczegół, który ma być chroniony przez przejście 2K, musi najpierw istnieć w tej klatce.

Zablokowana pierwsza klatka wygenerowana za pomocą GPT Image 2 w rozdzielczości 2048x1152, pokazująca butelkę cold brew i czytelny drobny druk
Wygenerowane za pomocą openai/gpt-image-2/text-to-image, jakość high, 2048x1152. Naliczono 0,1745 $, zwrócone po 146 s.

Playground GPT Image 2 na Atlas Cloud z promptem klatki i wygenerowaną butelką w panelu wyjściowym
GPT Image 2 na Atlas Cloud: jakość ustawiona na high, 16:9, zablokowana klatka wyrenderowana po prawej.
Krok 2: Szkic w 768P
Ten sam endpoint, którego użyjesz do finalnej wersji. Tylko rozdzielczość różni się między tym krokiem a krokiem 4.
text1Powolny najazd makro na butelkę. Krople kondensacji spływają po szkle. Etykieta pozostaje idealnie nieruchoma i czytelna. W miękkim tle barista raz przeciera ladę. Naturalny dźwięk kawiarni, delikatny syk ekspresu. Brak drgań kamery. 2
Ustawienia na minimax/h3/image-to-video: pierwsza klatka = wynik z kroku 1, resolution=768P, duration=4, ratio=adaptive.

Szkic MiniMax H3 768P, powolny najazd makro na butelkę cold brew
Szkic 768P: 1344x768, naliczono 0,40 $, zwrócone po 194 s. Pokazane jako cichy GIF; plik sam w sobie ma 32 kHz stereo. Zwróć uwagę na cztery grube smugi kapania rozmazane na etykiecie.

Playground MiniMax H3 obraz-wideo na Atlas Cloud z załadowaną zablokowaną klatką, wpisanym promptem i gotowym klipem w panelu wyjściowym
Formularz obraz-wideo z załadowaną zablokowaną klatką. Rozdzielczość i Czas trwania to jedyne dwa pola, które oddzielają ten krok od kroku 4, a oba poziomy znajdują się na tej samej liście, bez żadnej bramki. To przechwycenie pozostawiono na domyślnych 2K i 8 sekund, dlatego przycisk Uruchom pokazuje 1,12 $; przełącz Rozdzielczość na 768P i Czas trwania na 4, a ta kwota spadnie do 0,40 $.
Krok 3: Oceń szkic MiniMax H3 2K vs 768P pod kątem odpowiednich rzeczy
Szkic to próba generalna, a nie dowód. Z moich dwóch par wynika, co ci niezawodnie mówi, a czego nie.
Ufaj mu w kwestii: treści promptu, czy ruch w ogóle działa, ilości ruchu kamery, tempa w ciągu czterech sekund oraz podkładu audio. Wszystko to przeniosło się czysto.
Nie ufaj mu w kwestii: drobnej tekstury powierzchni, najmniejszej czcionki na twoim produkcie ani żadnych artefaktów, które wymyśla. W moim szkicu 768P etykieta dostała cztery grube brązowe smugi, których nie było w uruchomieniu 2K, a mała linia składników zamieniła się w papkę. Gdybym odrzucił ten szkic, bo wyglądał brudno, odrzuciłbym prompt, który działał.
To jest prawdziwy podział pracy. 768P odpowiada na pytanie „czy to jest właściwe ujęcie", 2K odpowiada na pytanie „czy to jest do dostarczenia".
Krok 4: Zmień jedno pole i sfinalizuj w 2K
Ten sam endpoint, ta sama pierwsza klatka, ten sam ciąg promptu. Zmień resolution na 2K i nic więcej.

Finalny klip MiniMax H3 2K z tej samej zablokowanej pierwszej klatki, z czystą etykietą i czytelnym drobnym drukiem
Final 2K: 2560x1440, naliczono 0,56 $, zwrócone po 234 s. Ta sama płyta, ten sam ekspres, ta sama roślina, ten sam barista, ta sama pozycja etykiety co w szkicu.
Oto odpowiedź na pytanie, które cały ten artykuł miał testować, i poszła w dobrym kierunku. Z zablokowaną pierwszą klatką dryf ustał. Zestaw, kadrowanie, wysokość kamery i położenie typografii – wszystko utrzymało się między szkicem 768P a finalem 2K. Różnice ograniczyły się do szczegółów: przejście 2K oczyściło rozmazane smugi do jednej cienkiej strugi, oddało ziarno papieru i zamieniło małą linię składników z szumu z powrotem w słowa. To dokładnie takie zachowanie, jakie MiniMax obiecuje po regeneracji w kontekście, i to pierwszy raz w tym teście, kiedy 2K wyglądało jak poziom jakości, a nie ponowne losowanie.
Dla kontrastu, grupa kontrolna. To jest surowe uruchomienie tekst-wideo w 2K, to, które wyprodukowało obcego na górze tej strony. Ta sama treść promptu, bez pierwszej klatki, więc nic nie przypina kompozycji.

Playground MiniMax H3 tekst-wideo w 2K z ukończonym klipem kontrolnym w panelu wyjściowym
MiniMax H3 tekst-wideo na Atlas Cloud: bez pierwszej klatki, Rozdzielczość 2K, Proporcje 16:9 i ukończony klip w panelu wyjściowym. Nic nie było nie tak z tą generacją. Po prostu nie jest to ten sam film, który wyprodukowało uruchomienie 768P.
Krok 5: Albo pomiń ponowne losowanie MiniMax H3 2K vs 768P i zamiast tego upskaluj
Czasami ujęcie 768P jest już tym właściwym. Występ trafił, timing jest dobry i nie chcesz regeneracji, która może wypaść inaczej. Wtedy nie losuj ponownie. Przepuść dokładny plik przez upskaler.
Ustawienia na atlascloud/video-upscaler: video = URL twojego wyjścia 768P, target_resolution=2k. Limit wejściowy 2K to 23 sekundy i 690 klatek, a fps wejściowy musi być 30 lub mniejszy, więc klipy H3 z 24 fps przechodzą bez problemu.

Ujęcie 768P przepuszczone przez upskaler wideo Atlas Cloud do 2K, ten sam materiał w wyższej rozdzielczości
Upskalowane ujęcie: 2540x1452, naliczono 0,12 $, zwrócone po 40 s. Te same cztery smugi, to samo wszystko. To ten sam film, nie nowy.

Playground upskalera wideo Atlas Cloud z załadowanym klipem 768P i wynikiem 2K w panelu wyjściowym
Upskaler wideo na Atlas Cloud z załadowanym klipem H3 768P i upskalowanym wynikiem odtwarzanym po prawej. To przechwycenie uruchomiono na domyślnej 1080p, którą przycisk Uruchom wycenia na 0,09 $ za wszystko poniżej 5-sekundowego minimum. Przełącz Docelową rozdzielczość na 2k i jesteś na poziomie 0,024 $/s, co daje 0,12 $ naliczone za moje własne uruchomienie.
A oto werdykt, którego nikt nie powinien pominąć – wszystkie trzy przycięcia etykiety z tej samej zablokowanej klatki przy tym samym powiększeniu.

Trójstronne porównanie przycięcia etykiety: natywne 768P, ten klip upskalowany do 2K i natywne 2K, pokazujące, że tylko natywne 2K odzyskuje drobny druk
Natywne 768P, ten sam klip upskalowany i natywne 2K. Upskaler wyostrza ziarno papieru i duży tytuł pięknie, i zachowuje dokładnie to ujęcie. Czego nie może zrobić, to przywrócić małej linii, ponieważ ta informacja nigdy nie była w pliku 768P. Przejście regeneracji może, ponieważ wraca do kontekstu, a nie do pikseli.
Zatem te dwie ścieżki nie są konkurencyjne. Odpowiadają na różne pytania. Upskalowanie zachowuje występ. Regeneracja odzyskuje szczegóły. Wybierz według tego, czego twój klip nie może stracić.
Warianty warte przetestowania na MiniMax H3 2K vs 768P
- Pion. Moje testy 16:9 zwróciły 1344x768, więc krótszy bok jest tym, co przypina poziom. Żądanie 9:16 powinno lądować na 768x1344 na tej samej logice, ale zmierz to raz, zanim zbudujesz pionową partię na podstawie założenia. W obraz-wideo ustawiasz kształt przez pierwszą klatkę, zamiast walczyć z wyliczeniem
adaptive. - Twarze mówiące. To jest przypadek, w którym pominąłbym szkicowanie i poszedł od razu do 2K. Twarze, zęby i linie wzroku to dokładnie ta klasa drobnych szczegółów, dla których istnieje przejście regeneracji, a szkic 768P wprowadzi cię w błąd co do wszystkich trzech.
- Długie klipy. Przy 15 sekundach różnica wzrasta do 1,50 $ vs 2,10 $, a czas rzeczywisty wydłuża się wraz z nimi. Planuj kolejkę, a nie tylko budżet.
- Tekst produktu i praca wielojęzyczna. Stabilna czcionka w kadrze H3 i natywne wielojęzyczne audio to powody, dla których ludzie wybierają go do komercyjnych opakowań. Oboje przetrwają przy 768P, co czyni 768P naprawdę użytecznym poziomem dostarczania dla przycięć społecznościowych, a nie tylko salą prób.
Co MiniMax H3 2K vs 768P naprawdę kosztuje na użyteczny klip
Najpierw trzy ścieżki do klipu 2K, na 8-sekundowy klip, według stawek, które faktycznie mi naliczono.
| Ścieżka do klipu 2K | Użyte stawki | Koszt jednego 8-sekundowego klipu | Zachowuje to samo ujęcie | Odzyskuje drobny tekst |
|---|---|---|---|---|
| Prosto do 2K | 0,14 $/s | 1,12 $ | n/d | Tak |
| Szkic 768P, potem ponowne losowanie 2K na zablokowanej klatce | 0,10 $/s, potem 0,14 $/s | 0,80 $ + 1,12 $ = 1,92 $ | Tak, jeśli pierwsza klatka zablokowana | Tak |
| Final 768P, potem upskalowanie do 2K | 0,10 $/s, potem 0,024 $/s | 0,80 $ + 0,192 $ = 0,99 $ | Tak, dokładnie | Nie |
Teraz liczba, która decyduje o twoim miesiącu. Weź realistyczną mieszankę: dziesięć 4-sekundowych szkiców, aby znaleźć ujęcie, potem dwa gotowe 8-sekundowe klipy finalne.
| Partia 10 szkiców + 2 finaly | Szkice | Finaly | Blokada klatki | Łącznie |
|---|---|---|---|---|
| Wszystko w 2K | 10 × 4 s × 0,14 $ = 5,60 $ | 2 × 8 s × 0,14 $ = 2,24 $ | brak | 7,84 $ |
| Szkice 768P, finaly 2K, zablokowana klatka | 10 × 4 s × 0,10 $ = 4,00 $ | 2,24 $ | 0,17 $ | 6,41 $ (18% mniej) |
| Szkice 768P, finaly 768P, upskalowane | 4,00 $ | 2 × (0,80 $ + 0,192 $) = 1,98 $ | 0,17 $ | 6,15 $ (22% mniej) |
Przeczytaj środkowy wiersz uczciwie. Oszczędność na sekundę wynosi 29%, ale oszczędność na partii wynosi 18%, ponieważ twoje finaly wciąż są finalami. Oszczędność rośnie w kierunku 29% tylko wtedy, gdy szkicowanie dominuje: przy dwudziestu 8-sekundowych szkicach zamiast dziesięciu krótkich, trasa numer dwa ląduje około 25% poniżej wszystkiego-2K. I każdy cent z tego zależy od zablokowanej klatki, ponieważ bez niej te dziesięć tanich szkiców to dziesięć filmów, które nie zostaną wysłane.
Drugą dywidendą jest czas, i może to być ważniejsze. Na parze tekst-wideo 768P zwróciło się 28% szybciej, a w obu parach ani razu nie trwało dłużej. Na 4-sekundowych klipach przy tych czasach rzeczywistych oznacza to mniej więcej 27 szkiców na godzinę zamiast 20. Kiedy wciąż szukasz odpowiedniego promptu, siedem dodatkowych prób ma większe znaczenie niż zaoszczędzone 1,60 $.
Jedna uwaga prawna, jeśli planowałeś ominąć to wszystko przez samodzielne hostowanie. Wagi otwarte na Hugging Face to H3-Base, który generuje na krótkim boku 768. Przejście 2K znajduje się po stronie API, więc wagi otwarte dają ci poziom szkicu, a nie poziom finalny. Licencja społecznościowa zawiera również wykluczone terytoria obejmujące UE, Wielką Brytanię, Koreę i USA, z osobnym kanałem autoryzacji dostępnym, więc przeczytaj licencję, zanim zbudujesz komercyjny potok na lokalnym wypłacie. Aby uzyskać szerszy obraz tego, co opublikowane wagi zawierają, a czego nie, zobacz naszą recenzję MiniMax H3 oraz pełny katalog modeli, jeśli chcesz wycenić H3 względem reszty obecnego pola wideo.
Często zadawane pytania
W MiniMax H3 2K vs 768P, czy 768P jest faktycznie tańsze na klip?
Tak. Naliczono mi 0,40 $ za 4-sekundowy klip 768P i 0,56 $ za identyczne żądanie w 2K, więc 0,10 $/s wobec 0,14 $/s, oszczędność 29% na sekundę. Haczyk polega na tym, że oszczędność liczy się tylko wtedy, gdy tanie uruchomienie uczy cię czegoś o drogim, co wymaga zablokowania pierwszej klatki. Surowy szkic tekst-wideo w 768P to osobny film, a pieniądze na niego wydane to nie zaoszczędzone pieniądze.
W MiniMax H3 2K vs 768P, czy 2K to tylko upskalowanie wyjścia 768P?
Nie. MiniMax każe podstawowemu modelowi regenerować własne wyjście niskiej rozdzielczości w kontekście, zamiast uruchamiać dedykowany moduł superrozdzielczości, dlatego 2K może przywrócić mały tekst i drobne szczegóły powierzchni, które upskaler może tylko przybliżyć. Moje trójstronne przycięcie etykiety pokazuje dokładnie to: upskalowany klip 768P wyostrzył ziarno papieru, ale pozostawił małą linię składników jako nieczytelny szum, podczas gdy natywne uruchomienie 2K zamieniło ją z powrotem w słowa.
Czy mój szkic MiniMax H3 768P będzie wyglądał jak mój final 2K?
Tylko jeśli zablokujesz pierwszą klatkę. Na samym tekst-wideo oba poziomy dały mi inną dekorację zestawu, inną wysokość kamery, inną kondensację i inną pozycję etykiety z tego samego promptu. W obraz-wideo z ustaloną pierwszą klatką kompozycja, kadrowanie i typografia utrzymały się między poziomami, a jedynymi zmianami były szczegóły i tekstura.
Czy nadal muszę kontaktować się z działem sprzedaży dla MiniMax H3 768P?
Nie, nie według stanu na 2026-08-05. Aktualny schemat na wszystkich trzech endpointach H3 wymienia resolution jako enum: ["768P", "2K"], playground pokazuje oba w jednym polu rozwijanym, a moje zadania 768P zostały ukończone i rozliczone według niższej stawki na dwóch różnych endpointach. Linia o zamkniętej becie pochodzi z relacji napisanych w pierwszych dniach po premierze.
W MiniMax H3 2K vs 768P, o ile wolniejsze jest 2K?
Na moich 4-sekundowych parach 1,2× do 1,4× wolniej: 181 s wobec 130 s w tekst-wideo i 234 s wobec 194 s w obraz-wideo, mierzone od wysłania do ukończenia. Architektonicznie 2K to drugie przejście generacji w tym samym kontekście, więc spodziewaj się, że bezwzględna różnica wzrośnie w dłuższych klipach, zamiast pozostać płaska.
Czy mogę uaktualnić klip 768P do 2K bez ponownego losowania?
Możesz podnieść rozdzielczość bez dotykania ujęcia, przepuszczając go przez upskaler wideo, co kosztowało mnie 0,12 $ za 4,46-sekundowy klip na poziomie 2K (0,024 $/s z minimum 5 sekund) i zwróciło się po 40 sekundach. To zachowuje występ klatka po klatce. Czego nie zrobi, to odzyskanie szczegółów, które nigdy nie zostały uchwycone, więc jeśli celem przejścia na 2K jest czytelna mała czcionka, potrzebujesz przejścia regeneracji, a nie upskalera.






