

MiniMax H3 API udostępnia ogólnego zastosowania multimodalny model wideo MiniMax, który odczytuje tekst, obrazy, wideo i audio jako jeden kontekst, zamiast przetwarzać po jednym zadaniu naraz. Klipy trwają od 5 do 15 sekund przy 24 FPS w proporcjach obrazu od 21:9 do 9:16, a jeden prompt może podmieniać postacie, zastępować tła, przepisywać dialogi lub klonować głos na podstawie klipu referencyjnego. Atlas Cloud udostępnia to wszystko przez jeden endpoint zgodny z OpenAI. Zacznij tworzyć już dziś.
Atlas Cloud zapewnia najnowsze, wiodące w branży modele kreatywne.
Każdy endpoint MiniMax H3 API inaczej przetwarza tekst, obrazy, wideo i audio, więc przejrzyj poniższe wiersze i dopasuj modalność do tego, co tworzysz.
| Modalność | Opis |
|---|---|
| MiniMax H3 T2V API (tekst na wideo) | Napisz prompt o długości do 7 000 znaków, a model zwróci klip trwający od 5 do 15 sekund, w 24 FPS i 1440p, z natywnym dźwiękiem stereo wygenerowanym w tym samym przebiegu. Proporcje obrazu ustawia się dla każdego żądania spośród 21:9, 16:9, 4:3, 1:1, 3:4 i 9:16, więc jedno wywołanie obsługuje zarówno kinowe trailery, jak i pionowe materiały do social mediów. |
| MiniMax H3 I2V API (obraz na wideo) | Jeden obraz ustawia klatkę początkową, a dwa blokują zarówno pierwszą, jak i ostatnią, podczas gdy H3 wypełnia ruch między nimi w proporcjach obrazu wejściowego. Akceptowane są źródła od 256 do 5760 pikseli na bok, co pozwala łatwo wprawić w ruch key arty, zdjęcia produktowe i klatki storyboardu. |
| MiniMax H3 Omni Reference API (referencja na wideo) | Potrzebujesz kilku źródeł działających razem? W jednym żądaniu, przy limicie 12 plików, zmieści się do dziewięciu obrazów, trzech klipów wideo i trzech ścieżek audio, a wszystkie zostaną odczytane jako jeden multimodalny kontekst. Przenieś postać, ruch kamery albo barwę głosu między ujęciami lub edytuj istniejący klip, podmieniając obiekty, tła i wypowiadane kwestie. |
Każdy klip zwracany przez MiniMax H3 API trwa do piętnastu sekund w 1440p, z natywnym dźwiękiem stereo, powstaje z dowolnej kombinacji odniesień tekstowych, obrazowych, wideo i głosowych, a to samo wywołanie może też edytować postacie, sceny i dialogi w materiale, który już masz.
Jedno żądanie MiniMax H3 API przyjmuje do dziewięciu obrazów referencyjnych, trzy klipy wideo i trzy ścieżki audio, z limitem dwunastu plików. Zamiast traktować je jako osobne sloty, model odczytuje tekst, obraz i dźwięk jako jeden kontekst, przenosząc postać ze zdjęcia, ruch kamery z klipu i nastrój ze ścieżki do tej samej sceny. Zespoły dysponujące gotowymi materiałami dostają prostą drogę do finalnego ujęcia.
Każdy wynik zawiera dźwięk. Dialogi, tło dźwiękowe i muzyka powstają w natywnym stereo podczas tego samego przebiegu, który renderuje obraz w 24 frames per second, więc nie trzeba później niczego udźwiękawiać ani dubbingować. Ponieważ timing jest ustalany w trakcie generowania ujęcia, kroki, mowa i cięcia pozostają zsynchronizowane z akcją. Krótkie reklamy i materiały do social mediów są od razu gotowe do publikacji.
Chcesz zamienić kota na psa, podmienić green screen albo przepisać jedną kwestię dialogową? MiniMax H3 API stosuje takie edycje w dostarczonym przez Ciebie wideo, obejmując postacie, obiekty, tła, oświetlenie i efekty, a fragmenty, których nie wskażesz, pozostają bliskie oryginałowi. Prompty mogą mieć do 7000 znaków, więc kilkanaście zmian da się połączyć w jednym przebiegu. Dzięki temu iterowanie na zatwierdzonym montażu staje się praktyczne.
Prześlij próbkę głosu razem z obrazami lub materiałem wideo, a wygenerowana postać przemówi tą barwą. Na jedno żądanie można dodać do trzech odniesień audio, każde o długości od dwóch do piętnastu sekund, a audio musi zawsze towarzyszyć wejściu wizualnemu, zamiast być przesyłane samodzielnie. Istniejący dialog można też zastąpić i dopasować sposób wykonania. Przy pracy nad serią ten sam rozpoznawalny głos pozostaje spójny w każdym odcinku.
Klipy trwają od pięciu do piętnastu sekund, a tryb 1440p umieszcza 1440 pikseli na krótszym boku między 16:9 a 9:16, czyli około 3,7 megapiksela przy szerszych proporcjach, takich jak 2976 by 1248 dla 21:9. Do wyboru jest sześć proporcji, od kinowego 21:9 po pionowe 9:16, a MiniMax H3 API może też wybrać jedną za Ciebie. Ten zakres obejmuje trailer, pętlę produktową i pionowy dramat bez przełączania modeli.
Jeśli pliki źródłowe pochodzą prosto z kamery albo osi czasu montażu, trafiają do systemu takie, jakie są: wideo H.264 i H.265, obrazy JPG, PNG, WEBP, HEIC i HEIF oraz audio WAV i MP3. Limity na plik wynoszą 50MB dla wideo, 30MB dla obrazów i 15MB dla audio, a przekazywanie zasobów przez URL pozwala utrzymać żądania w limicie 64MB body. W Atlas Cloud cały zestaw działa przez jeden klucz zgodny z OpenAI, z rozliczeniem pay-as-you-go.
Każdy klip w tym zestawie powstał z jednego identycznego promptu wysłanego do MiniMax H3 API oraz dwóch innych modeli wideo hostowanych w Atlas Cloud, dzięki czemu można porównać ruch, dźwięk i zgodność z instrukcją bez zmiany ani jednego słowa.
15 seconds, 16:9 landscape, krótki film. Ujęcie live-action przedstawiające nocną pralnię samoobsługową, połączone z ręcznie rysowaną, świecącą animacją w obraz mixed-media. Mała pralnia samoobsługowa, której świetlówki lekko migoczą; w środku działają pralki, stoją plastikowe kosze na pranie i stara ławka, a na podłodze leży pojedyncza skarpetka. Cała przestrzeń jest cicha i ma delikatny, nostalgiczny nastrój. Obraz powinien mieć fakturę nagrania z telefonu trzymanego jedną ręką, z wyraźnym drżeniem kamery; białe światło świetlówek powoduje wahania ekspozycji między jasnością a przyciemnieniem; na szklanych powierzchniach widać odbicia otoczenia; gdy obiektyw zbliża się do przedmiotów, pojawia się opóźnienie ostrości. Obraz nie powinien być tak dopracowany i uporządkowany jak reklama — ogólne wrażenie ma przypominać autentyczny dokumentalny kadr, jakby ktoś przypadkiem wszedł tam późno w nocy i uchwycił ujęcie, podążając za dziwną, oniryczną wizją.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Perspektywa pierwszoosobowa · wysokość oczu · handheld gaming camera Scena: Ujęcie symuluje gracza sterującego w grze FPS w realiach modern warfare, z obiema dłońmi trzymającymi karabin szturmowy, który powoli posuwa się wzdłuż zewnętrznego obwodu bazy wojskowej. Gracz idzie naprzód drogą obok osłon, krzyż celownika przesuwa się po przejściu przed nim; po krótkiej pauzie oddaje kilka strzałów w kierunku odległego celu, po czym dalej naciera — jak nagranie live gameplay zwykłego gracza. Oświetlenie: Chłodne, naturalne światło współczesnej bazy wojskowej przeplata się z dymem i błyskami wylotowymi. Obraz jest realistyczny i wyrazisty, a metaliczna broń oraz bitewny pył i zamglenie mają jakość gry AAA. Praca kamery: Kamera lekko kołysze się jak przy ujęciu z ręki, gdy gracz się porusza — najpierw powoli posuwa się naprzód, potem wykonuje niewielkie ruchy w lewo i w prawo, aby się rozejrzeć, z subtelnym wstrząsem od odrzutu podczas strzelania, po czym na końcu dalej stabilnie naciera.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Od filmów brandowych i pionowych dram po ujęcia produktowe, wizualizacje do gier oraz precyzyjne edycje istniejącego materiału — MiniMax H3 API obsługuje każdy scenariusz za pomocą jednego multimodalnego żądania, które zwraca wideo z natywnym dźwiękiem stereo.
Prześlij klatki storyboardu i listę ujęć w jednym wywołaniu, aby tworzyć trailery 1440p, spoty TVC i kampanie modowe w 24 FPS. Natywny dźwięk stereo jest dołączany do każdego wyniku, więc zespoły brandowe mogą od razu oglądać gotowe montaże.
Pionowy output 9:16 obsługuje sceny dram fabularnych — od kostiumowych tajemnic po rodzinne konfrontacje — z dialogami udźwiękowionymi w tym samym przebiegu. Studia budujące biblioteki krótkich dram otrzymują 15-sekundowe hooki bez rezerwowania aktorów ani planów zdjęciowych.
Jeśli ujęcie wymaga konkretnej twarzy i ruchu, jednym wywołaniem można pokierować za pomocą maksymalnie dziewięciu obrazów, trzech wideo i trzech klipów audio. Tożsamość postaci, praca kamery i barwa głosu pozostają spójne między odcinkami.
Potrzebujesz zmiany po fakcie? Istniejący materiał można edytować promptem: podmienić obiekt, zastąpić tło, skorygować oświetlenie albo przepisać wypowiedzianą kwestię bez ponownego nagrywania choćby jednej klatki.
Zdjęcia produktowe zyskują ruch: jeden obraz referencyjny zmienia się w prezentację 360 degree, objaśnienie funkcji albo płatny materiał do social mediów. Proporcje obrazu od 21:9 do 9:16 pozwalają wykorzystać jeden zestaw assetów w każdym placementcie.
Stylizowany output sprawdza się w game CG, character PV, openingach anime i demach interfejsów, gdzie menu, elementy HUD i nakładki tekstowe muszą pozostać czytelne. Zespoły artystyczne używają go do walidacji koncepcji przed produkcją.
Porównaj MiniMax H3 API z innymi modelami wideo hostowanymi w Atlas Cloud i sprawdź, czym faktycznie różnią się modalności wejściowe, limity referencji, długość, rozdzielczość oraz wyjście audio, zanim wybierzesz endpoint.
| Model | Modalności wejściowe | Maks. liczba plików referencyjnych | Czas trwania wyjścia | Maks. rozdzielczość | Natywne audio |
|---|---|---|---|---|---|
| MiniMax H3 | Tekst, obraz, wideo, audio | 9 obrazów, 3 filmy, 3 klipy audio, łącznie 12 plików | Od 5s do 15s | 1440p przy 24 FPS | √ Natywne audio stereo w każdym wyniku |
| Seedance 2.0 Reference-to-Video | Tekst, obraz, wideo, audio | 9 obrazów, 3 filmy, 3 klipy audio | Do 15s | 720p | √ Dialogi stereo, efekty i muzyka generowane w jednym przebiegu |
| Veo3.1 Reference-to-video | Tekst i obraz | 3 obrazy referencyjne | 4s, 6s lub 8s | 4K tylko przy długości 8s | √ Dialogi, tło dźwiękowe i efekty dźwiękowe zsynchronizowane z osią czasu |
| Wan-2.7 Reference-to-video | Tekst, obraz, wideo, audio | 5 obrazów lub klipów wideo oraz jeden klip głosowy | Od 2s do 15s | 1080p | √ Generowana muzyka i efekty albo sterowanie synchronizacją ruchu ust za pomocą własnego audio |
| Kling v3.0 Pro Image-to-Video | Tekst i obraz | - | Do 15s | 1080p | √ Wielojęzyczne dialogi z synchronizacją ruchu ust w pięciu językach |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli MiniMax H3 z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj MiniMax H3, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
MiniMax H3 API zapewnia deweloperom programistyczny dostęp do MiniMax H3 — otwartego, ogólnego multimodalnego modelu wideo, który traktuje tekst, obrazy, wideo i audio jako jeden wspólny kontekst. Zamiast rozdzielać generowanie, edycję i odwołania na osobne modele zadaniowe, H3 odczytuje cały zestaw danych wejściowych i zwraca gotowy klip z dźwiękiem. W Atlas Cloud działa za jednym kluczem API, z rozliczaniem pay-as-you-go.
W jego możliwościach mieszczą się filmy brandowe, trailery, pionowe krótkie dramy, spoty produktowe i ecommerce, dema animacji dla gier i UI oraz stylizowana animacja. Ponieważ model obsługuje tekst na ekranie, napisy i zasoby marki, zespoły wykorzystują go także do walidacji koncepcji, podglądów storyboardów i prezentacji wizualnych przed zatwierdzeniem budżetu produkcyjnego.
Utwórz konto Atlas Cloud, wygeneruj klucz API, a następnie wyślij prompt wraz z ewentualnymi plikami referencyjnymi do endpointu generowania wideo i odpytuj go o gotowy wynik. Zaleca się przekazywanie mediów jako hostowanych URL-i zamiast uploadów inline, ponieważ treść żądania jest ograniczona do 64MB. Zacznij tworzyć już dziś.
Rozliczanie działa w modelu pay-as-you-go, więc płacisz za każde wywołanie zamiast kupować subskrypcję lub licencję na stanowisko. Koszt zależy od tego, co faktycznie renderujesz, co oznacza, że rozdzielczość i długość klipu wpływają na łączną cenę batcha. Przed planowaniem dużych wolumenów sprawdź na stronie modelu aktualną stawkę za generowanie.
Tak. Każdy wynik H3 jest dostarczany z dźwiękiem w natywnym stereo, więc dialogi, efekty i ambience powstają w tym samym przebiegu co obraz. Jeśli dostarczysz referencyjny klip audio, model może przenieść jego barwę na postać, eliminując z pipeline’u osobny krok syntezy głosu.
Klipy trwają od 5 do 15 sekund przy 24 FPS. W trybie 1440p krótszy bok renderuje się w 1440 pikselach dla proporcji od 16:9 do 9:16, a poza tym zakresem kadr ma łącznie około 3.7M pikseli, na przykład 2976 na 1248 przy 21:9. Żądania text to video i omni reference obsługują 21:9, 16:9, 4:3, 1:1, 3:4 i 9:16, natomiast żądania first and last frame dziedziczą proporcje obrazu wejściowego.
Z jednym promptem można przesłać do dziewięciu obrazów, trzech segmentów wideo i trzech klipów audio, przy limicie dwunastu plików łącznie. Wideo i audio muszą mieścić się łącznie w 15 sekundach każde, a audio musi towarzyszyć obrazowi lub wideo, zamiast być wysyłane samodzielnie. Prompty mogą mieć do 7000 znaków, co zostawia miejsce na reżyserię ujęcie po ujęciu, obejmującą kamerę, grę aktorską i dźwięk.
Akceptowane dane wejściowe obejmują wideo H.264 i H.265, obrazy JPG, JPEG, PNG, WEBP, HEIC i HEIF oraz audio WAV lub MP3, z AAC lub MP3 dla ścieżki audio wewnątrz pliku wideo. Limity na plik wynoszą 50MB dla wideo, 30MB dla obrazów i 15MB dla audio. Ponieważ treść żądania jest ograniczona do 64MB, hostowane URL-e pozostają bezpieczniejszą ścieżką dla ciężkich zasobów.
Edycja to jeden z jego podstawowych trybów. Wyślij klip źródłowy z instrukcjami, a MiniMax H3 API może podmienić postacie lub obiekty, zastąpić tła i oświetlenie, dodać warstwy efektów wizualnych oraz przepisać dialogi, zachowując stabilność niezmienionych obszarów. Złożone instrukcje są obsługiwane w jednym żądaniu, więc kilka zmian trafia do wyniku jednocześnie zamiast po wielu kolejnych rundach.
Większość modeli wideo przyjmuje jeden prompt i jeden obraz, a następnie zwraca niemy klip. H3 zamiast tego pobiera mieszany zestaw referencji, odczytuje z nich intencje dotyczące postaci, ruchu, kamery i dźwięku, po czym zwraca klip z natywnym audio. Jeśli Twój pipeline obecnie łączy model wideo, model głosu i edytor, H3 scala te etapy w jedno wywołanie.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.