

MiniMax H3 to rodzina modeli wideo firmy MiniMax do generowania na podstawie tekstu, obrazu i materiałów referencyjnych. Twórz klipy o długości od 5 do 15 sekund, steruj ruchem za pomocą opcjonalnej klatki końcowej, zachowuj obiekty z obrazów referencyjnych lub wybierz H3 Developer, gdy generowany dźwięk pasuje do Twojego przepływu pracy. Atlas Cloud udostępnia H3, H3 Fast, H3 Max i H3 Developer w ramach jednego przepływu pracy API, a standardowe ceny zaczynają się od $0.038 za sekundę. Zacznij tworzyć już dziś.
MiniMax H3 został opracowany przez MiniMax. Atlas Cloud (prowadzona przez Atlas Cloud AI LLC) zapewnia dostęp do modelu, ale nie jest jego właścicielem. Wszystkie znaki towarowe należą do ich odpowiednich właścicieli.
Atlas Cloud zapewnia najnowsze, wiodące w branży modele kreatywne.
Porównaj endpointy MiniMax H3, H3 Fast, H3 Max i H3 Developer dla danych tekstowych, obrazów lub materiałów referencyjnych według rozdzielczości, czasu trwania, obsługi dźwięku, proporcji obrazu i standardowej ceny.
| Modalność | Opis |
|---|---|
| MiniMax H3 Max T2V API (Text to Video) | Wprowadź prompt tekstowy, aby wygenerować film w kinowej stylistyce w rozdzielczości 480P lub 768P, o długości od 5 do 15 sekund. Wybierz proporcje 16:9, 9:16, 1:1 lub kadrowanie adaptacyjne dla reklam, zwiastunów i treści do mediów społecznościowych w standardowej cenie $0.05 za sekundę. |
| MiniMax H3 Max I2V API (Image to Video) | Rozpocznij od pierwszej klatki i określ jej animację za pomocą promptu tekstowego, opcjonalnie dodając ostatnią klatkę sterującą kompozycją końcową. Wyjście w rozdzielczości 480P lub 768P, trwające od 5 do 15 sekund, sprawdzi się przy animowaniu produktów, key artów i przejściach storyboardowych w cenie $0.05 za sekundę. |
| MiniMax H3 Fast T2V API (Text to Video) | Do produkcji tekstowych materiałów w rozdzielczości 480P MiniMax H3 Fast generuje kinowe klipy trwające od 5 do 15 sekund. Opcje 16:9, 9:16, 1:1 i adaptacyjna wspierają szybkie filmy koncepcyjne oraz treści dopasowane do platform w standardowej cenie $0.046 za sekundę. |
| MiniMax H3 Fast I2V API (Image to Video) | Animuj dostarczoną pierwszą klatkę za pomocą ruchu sterowanego promptem, dodając opcjonalną ostatnią klatkę, gdy zakończenie wymaga określonego kierunku wizualnego. Przy rozdzielczości 480P i czasie trwania od 5 do 15 sekund endpoint sprawdzi się w demonstracjach produktów, animowanych grafikach i krótkich materiałach do mediów społecznościowych w cenie $0.046 za sekundę. |
| MiniMax H3 Fast Reference to Video API | Zachowaj obiekt z obrazu referencyjnego, podczas gdy prompt tekstowy definiuje wygenerowane wideo w rozdzielczości 480P. Ta ścieżka, obsługująca materiały o długości od 5 do 15 sekund, dobrze sprawdza się w przypadku powracających postaci, rozpoznawalnych produktów i spójnych materiałów kampanii, przy standardowej cenie $0.046 za sekundę. |
| MiniMax H3 Developer T2V API (Text to Video) | Zamieniaj tekstowe prompty na wideo z wygenerowanym dźwiękiem za pomocą self-hosted endpointu MiniMax H3 Developer. Wybierz wyjście 480P, 768P lub 2K w proporcjach 16:9, 9:16 albo 1:1 dla koncepcji narracyjnych, wersji demonstracyjnych kampanii i produkcji do mediów społecznościowych w cenie $0.05 za sekundę. |
| MiniMax H3 Developer I2V API (Image to Video) | Dostarcz obraz początkowy, opcjonalną klatkę końcową i prompt tekstowy, aby utworzyć ruch z wygenerowanym dźwiękiem. Opcje wyjścia 480P, 768P i 2K sprawiają, że ten self-hosted endpoint nadaje się do animowania key artów, scen produktowych i sekwencji storyboardowych w cenie $0.05 za sekundę. |
| MiniMax H3 Developer Reference to Video API | Gdy ciągłość zależy od istniejących materiałów, jeden lub więcej obrazów albo filmów referencyjnych może zachować obiekt w nowym filmie kierowanym promptem i wzbogaconym o wygenerowany dźwięk. Użyj wyjścia 480P, 768P lub 2K dla powracających postaci i spójnych, powiązanych sekwencji brandowych w standardowej cenie $0.05 za sekundę. |
| MiniMax H3 T2V API (Text to Video) | Prompt tekstowy staje się kinowym wideo w rozdzielczości 2K o wybieralnym czasie trwania od 5 do 15 sekund. Kadruj każdy rezultat w proporcjach 16:9, 9:16, 1:1 lub adaptacyjnych, aby tworzyć dopracowane zwiastuny, pionowe historie i materiały kampanii w cenie $0.038 za sekundę. |
| MiniMax H3 I2V API (Image to Video) | Ożyw pierwszą klatkę w rozdzielczości 2K, łącząc ją z promptem tekstowym i, w razie potrzeby, opcjonalną ostatnią klatką. Zakres długości od 5 do 15 sekund wspiera prezentacje produktów, animację postaci i zaplanowane przejścia wizualne w standardowej cenie $0.038 za sekundę. |
| MiniMax H3 Reference to Video API | Generowanie sterowane materiałem referencyjnym zachowuje obiekt z obrazu wejściowego, podczas gdy prompt kieruje tworzeniem wynikowego wideo w rozdzielczości 2K. Klipy trwające od 5 do 15 sekund sprawdzą się w scenach skoncentrowanych na postaciach i spójnych materiałach produktowych w cenie $0.038 za sekundę. |
Każdy klip zwracany przez MiniMax H3 API może trwać do 15 sekund w rozdzielczości 1440p i zawiera natywny dźwięk stereo. Powstaje na podstawie dowolnej kombinacji referencji tekstowych, obrazów, wideo i głosu, a to samo wywołanie może również edytować postacie, sceny i dialogi w dostarczonym materiale.
Jedno żądanie MiniMax H3 API obsługuje do dziewięciu obrazów referencyjnych, trzech klipów wideo i trzech ścieżek audio, łącznie maksymalnie dwanaście plików. Zamiast traktować je jako osobne pola, model interpretuje tekst, obraz i dźwięk jako jeden kontekst, przenosząc postać ze zdjęcia, ruch kamery z klipu i nastrój ze ścieżki do tej samej sceny. Zespoły dysponujące istniejącym materiałem otrzymują bezpośrednią drogę do gotowego ujęcia.
Każdy wynik zawiera dźwięk. Dialogi, ambient i muzyka powstają w natywnym stereo podczas tego samego przebiegu, w którym obraz jest renderowany z prędkością 24 klatek na sekundę, więc nie trzeba dodawać ścieżki dźwiękowej ani dubbingu później. Ponieważ rytm jest ustalany podczas generowania ujęcia, kroki, mowa i cięcia pozostają zsynchronizowane z akcją. Krótkie reklamy i materiały do mediów społecznościowych są gotowe do publikacji.
Chcesz zamienić kota na psa, usunąć zielone tło albo przepisać jedną kwestię dialogową? MiniMax H3 API stosuje takie edycje do dostarczonego wideo, obejmując postacie, obiekty, tła, oświetlenie i efekty, podczas gdy elementy, o których nie wspomniano, pozostają zbliżone do oryginału. Prompty mogą mieć do 7000 znaków, dzięki czemu można połączyć kilkanaście zmian w jednym przebiegu. To ułatwia praktyczne iterowanie nad zaakceptowaną wersją montażową.
Prześlij próbkę głosu wraz z obrazami lub materiałem wideo, a wygenerowana postać przemówi jego barwą. Jedno żądanie może zawierać do trzech referencji audio, każdą o długości od 2 do 15 sekund, przy czym audio zawsze musi towarzyszyć wejściu wizualnemu i nie może być przesłane samodzielnie. Istniejący dialog można również zastąpić i dostosować sposób wykonania tak, aby zachować spójność. Przy produkcji serialowej ten sam rozpoznawalny głos może pojawiać się w każdym odcinku.
Klipy trwają od 5 do 15 sekund, a tryb 1440p zapewnia 1440 pikseli na krótszym boku dla proporcji od 16:9 do 9:16 lub około 3.7 megapixels przy szerszych proporcjach, takich jak 2976 by 1248 dla 21:9. Można wybrać jedną z sześciu proporcji — od kinowego 21:9 po pionowe 9:16 — albo pozwolić, by MiniMax H3 API dobrało ją automatycznie. Ten zakres wystarcza do zwiastuna, pętli produktowej i pionowego dramatu bez przełączania modeli.
Jeśli pliki źródłowe pochodzą bezpośrednio z kamery lub osi czasu montażu, możesz przesłać je w oryginalnej postaci: wideo H.264 i H.265, obrazy JPG, PNG, WEBP, HEIC i HEIF oraz audio WAV i MP3. Limity pojedynczych plików wynoszą 50MB dla wideo, 30MB dla obrazów i 15MB dla audio, a przekazywanie zasobów przez URL pozwala zmieścić żądania w limicie rozmiaru treści wynoszącym 64MB. W Atlas Cloud cały zestaw działa z użyciem jednego klucza zgodnego z OpenAI i rozliczaniem według zużycia.
Każdy klip w tym zestawie powstał z jednego identycznego promptu wysłanego do MiniMax H3 API oraz dwóch innych modeli wideo hostowanych w Atlas Cloud, dzięki czemu można porównać ruch, dźwięk i zgodność z instrukcją bez zmiany ani jednego słowa.
15 seconds, 16:9 landscape, krótki film. Ujęcie live-action przedstawiające nocną pralnię samoobsługową, połączone z ręcznie rysowaną, świecącą animacją w obraz mixed-media. Mała pralnia samoobsługowa, której świetlówki lekko migoczą; w środku działają pralki, stoją plastikowe kosze na pranie i stara ławka, a na podłodze leży pojedyncza skarpetka. Cała przestrzeń jest cicha i ma delikatny, nostalgiczny nastrój. Obraz powinien mieć fakturę nagrania z telefonu trzymanego jedną ręką, z wyraźnym drżeniem kamery; białe światło świetlówek powoduje wahania ekspozycji między jasnością a przyciemnieniem; na szklanych powierzchniach widać odbicia otoczenia; gdy obiektyw zbliża się do przedmiotów, pojawia się opóźnienie ostrości. Obraz nie powinien być tak dopracowany i uporządkowany jak reklama — ogólne wrażenie ma przypominać autentyczny dokumentalny kadr, jakby ktoś przypadkiem wszedł tam późno w nocy i uchwycił ujęcie, podążając za dziwną, oniryczną wizją.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Perspektywa pierwszoosobowa · wysokość oczu · handheld gaming camera Scena: Ujęcie symuluje gracza sterującego w grze FPS w realiach modern warfare, z obiema dłońmi trzymającymi karabin szturmowy, który powoli posuwa się wzdłuż zewnętrznego obwodu bazy wojskowej. Gracz idzie naprzód drogą obok osłon, krzyż celownika przesuwa się po przejściu przed nim; po krótkiej pauzie oddaje kilka strzałów w kierunku odległego celu, po czym dalej naciera — jak nagranie live gameplay zwykłego gracza. Oświetlenie: Chłodne, naturalne światło współczesnej bazy wojskowej przeplata się z dymem i błyskami wylotowymi. Obraz jest realistyczny i wyrazisty, a metaliczna broń oraz bitewny pył i zamglenie mają jakość gry AAA. Praca kamery: Kamera lekko kołysze się jak przy ujęciu z ręki, gdy gracz się porusza — najpierw powoli posuwa się naprzód, potem wykonuje niewielkie ruchy w lewo i w prawo, aby się rozejrzeć, z subtelnym wstrząsem od odrzutu podczas strzelania, po czym na końcu dalej stabilnie naciera.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Przejdź od wersji roboczych 480P w MiniMax H3 Fast do ujęć kampanijnych w 2K i koncepcji z obsługą dźwięku w H3 Developer; rodzina MiniMax H3 obejmuje animacje produktów, warianty do mediów społecznościowych, powtarzające się postacie i podglądy storyboardów na podstawie tekstu, obrazów lub materiałów referencyjnych.
MiniMax H3 Fast zamienia prompty tekstowe w klipy 480P trwające od 5 do 15 sekund. Zespoły zajmujące się mediami społecznościowymi mogą testować haki kampanii, tempo i proporcje obrazu przed rozpoczęciem produkcji w wyższej rozdzielczości.
Animuj pierwszą klatkę i opcjonalnie wskaż zakończenie za pomocą ostatniej klatki, korzystając ze ścieżki obrazów. Zespoły merchandisingowe zyskują prezentacje produktów, animacje katalogowe i materiały premierowe na podstawie zatwierdzonych zdjęć.
Wybierz ścieżkę MiniMax H3 w 2K, gdy kampania wymaga wyjścia w wysokiej rozdzielczości. Agencje mogą tworzyć dopracowane ujęcia główne, filmowe momenty produktowe i materiały do mediów społecznościowych w wysokiej rozdzielczości na podstawie tekstu lub obrazów.
Dostarcz obraz referencyjny, aby zachować rozpoznawalność obiektu, a następnie użyj promptu do pokierowania nowym klipem. Studia mogą tworzyć krótkie formy z powtarzającymi się postaciami, powiązane materiały promocyjne i markowe sceny produktowe o większej spójności wizualnej.
Potrzebujesz podglądów poziomych, kwadratowych i pionowych na podstawie jednego briefu? Generowanie tekstowe obsługuje proporcje 16:9, 1:1, 9:16 lub adaptacyjne kadrowanie, pomagając zespołom kreatywnym przygotować warianty storyboardu dla wielu miejsc emisji bez zmiany rodziny modeli.
Użyj MiniMax H3 Developer do generowania wideo z dźwiękiem na podstawie promptów tekstowych lub obrazów źródłowych. Zespoły kreatywne mogą opracowywać sekwencje prezentacyjne, momenty z udziałem postaci i koncepcje kampanii, w których obraz i dźwięk powstają w jednym procesie.
Porównaj warianty MiniMax H3 text-to-video z innymi modelami Atlas Cloud pod względem maksymalnej rozdzielczości, długości klipu, proporcji obrazu i podanej ceny standardowej.
| Model | Maksymalna rozdzielczość | Długość klipu | Proporcje obrazu | Podana cena bazowa |
|---|---|---|---|---|
| MiniMax H3 Text-to-Video | 2K | od 5 do 15 sekund | 16:9, 9:16, 1:1, adaptacyjne | $0.038 za sekundę |
| MiniMax H3 Fast Text-to-Video | 480P | od 5 do 15 sekund | 16:9, 9:16, 1:1, adaptacyjne | $0.046 za sekundę |
| MiniMax H3 Max Text-to-Video | 768P | od 5 do 15 sekund | 16:9, 9:16, 1:1, adaptacyjne | $0.05 za sekundę |
| MiniMax H3-Developer Text-to-Video | 2K | - | 16:9, 9:16, 1:1 | $0.05 za sekundę |
| Kling V3.0 Turbo Text-to-Video | 1080p | od 3 do 15 sekund | 16:9, 9:16, 1:1 | $0.112 |
| Veo 3.1 Lite Text-to-video | 1080p | 4, 6 lub 8 sekund | 16:9, 9:16 | $0.05 |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli MiniMax H3 z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj MiniMax H3, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
MiniMax H3 to rodzina modeli wideo MiniMax służących do generowania klipów na podstawie tekstu, obrazów i materiałów referencyjnych. W Atlas Cloud rodzina obejmuje standardowe H3, H3 Fast, H3 Max i H3 Developer dla tras tekst-na-wideo, obraz-na-wideo oraz wybranych tras materiał referencyjny-na-wideo. Dostępne profile wyjściowe obejmują zakres od 480P do 2K, zależnie od wybranego modelu.
Zacznij od promptu tekstowego, animuj pierwszą klatkę z opcjonalną ostatnią klatką albo zachowaj wygląd obiektu za pomocą obsługiwanej trasy materiał referencyjny-na-wideo. H3 Developer może również generować dźwięk wraz z wideo, a każdy wariant ma własną trasę, rozdzielczość i limity parametrów.
Utwórz konto i klucz API Atlas Cloud, a następnie wybierz dokładny identyfikator modelu i sprawdź aktualny schemat parametrów tego modelu. Wyślij żądanie za pośrednictwem zgodnego z OpenAI API Atlas Cloud i przetwórz zwrócone wideo w swojej aplikacji. Zacznij tworzyć już dziś.
MiniMax H3 Fast udostępnia trasy tekst-na-wideo, obraz-na-wideo i materiał referencyjny-na-wideo w rozdzielczości 480P dla klipów trwających od 5 do 15 sekund. Jego standardowa cena wynosi $0.046 za wygenerowaną sekundę, a trasa obrazowa przyjmuje pierwszą klatkę z opcjonalną ostatnią klatką. Wybierz go, gdy rozdzielczość 480P i dostęp do wszystkich trzech przepływów wejściowych odpowiadają wymaganiom projektu.
Wybierz standardowy H3, gdy Twój przepływ pracy wymaga rozdzielczości 2K. Wybierz H3 Fast dla wejścia tekstowego, obrazowego lub referencyjnego w rozdzielczości 480P, H3 Max dla generowania na podstawie tekstu i obrazów w rozdzielczości 480P lub 768P albo H3 Developer dla przepływów w rozdzielczości 480P, 768P lub 2K z generowanym dźwiękiem.
Trasy obraz-na-wideo przyjmują pierwszą klatkę i opcjonalnie mogą używać ostatniej klatki do sterowania zakończeniem. Materiał referencyjny-na-wideo jest dostępny dla standardowego H3, H3 Fast i H3 Developer, przy czym obsługiwane dane referencyjne różnią się w zależności od trasy. H3 Max obecnie udostępnia w Atlas Cloud trasy tekstową i obrazową.
Standardowy H3 generuje klipy 2K trwające od 5 do 15 sekund, H3 Fast obsługuje 480P w tym samym zakresie czasu, a H3 Max obsługuje 480P lub 768P dla klipów trwających od 5 do 15 sekund. W przypadku tekstu na wideo te trzy warianty oferują proporcje 16:9, 9:16, 1:1 oraz kadrowanie adaptacyjne, natomiast H3 Developer obsługuje 16:9, 9:16 i 1:1. Sprawdź schemat wybranej trasy, ponieważ trasy obrazowe i referencyjne mogą udostępniać inne opcje.
Rozliczenie odbywa się na podstawie każdej wygenerowanej sekundy. Standardowe ceny wynoszą $0.038 za sekundę dla H3, $0.046 za sekundę dla H3 Fast oraz $0.05 za sekundę dla H3 Max lub H3 Developer. Oszacuj koszt żądania, mnożąc standardową stawkę danej trasy przez wybrany czas trwania wyjścia.
Nie. Zweryfikowane profile Atlas Cloud wyraźnie uwzględniają generowany dźwięk dla tras tekstowej, obrazowej i referencyjnej H3 Developer, ale nie określają obsługi dźwięku dla standardowego H3, H3 Fast ani H3 Max. Wybierz H3 Developer, gdy dźwięk musi być częścią udokumentowanego wyniku.
Najpierw upewnij się, że identyfikator modelu odpowiada zamierzonej trasie tekstowej, obrazowej lub referencyjnej. Zweryfikuj każde wymagane pole względem aktualnego schematu tej trasy, zwłaszcza prompt, dane multimedialne, rozdzielczość, czas trwania i proporcje obrazu. Jeśli żądanie nadal kończy się niepowodzeniem, przeanalizuj zwrócony błąd przed ponowną próbą zamiast ponownie wysyłać ten sam nieprawidłowy payload.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.