

Die MiniMax H3 API stellt MiniMax's allgemeines multimodales Videomodell bereit, das Text, Bilder, Video und Audio als einen gemeinsamen Kontext verarbeitet, statt Aufgabe für Aufgabe. Clips laufen 5 bis 15 Sekunden mit 24 FPS in Seitenverhältnissen von 21:9 bis 9:16, und ein einzelner Prompt kann Figuren austauschen, Hintergründe ersetzen, Dialoge umschreiben oder eine Stimme aus einem Referenzclip klonen. Atlas Cloud stellt all das über einen einzigen OpenAI-kompatiblen Endpoint bereit. Starten Sie noch heute mit der Entwicklung.
Atlas Cloud bietet Ihnen die neuesten branchenführenden kreativen Modelle.
Jeder MiniMax H3 API-Endpoint verarbeitet Text, Bilder, Video und Audio anders. Sieh dir daher die Zeilen unten an und wähle die Modalität, die zu deinem Vorhaben passt.
| Modalität | Beschreibung |
|---|---|
| MiniMax H3 T2V API (Text to Video) | Schreibe einen Prompt mit bis zu 7,000 Zeichen, und das Modell gibt einen 5 to 15 Sekunden langen Clip mit 24 FPS in 1440p zurück, inklusive nativem Stereoton, der im selben Durchlauf erzeugt wird. Das Seitenverhältnis wird pro Anfrage aus 21:9, 16:9, 4:3, 1:1, 3:4 und 9:16 festgelegt, sodass ein einziger Aufruf sowohl cineastische Trailer als auch vertikale Social-Media-Cuts abdeckt. |
| MiniMax H3 I2V API (Image to Video) | Ein Bild legt das Startbild fest, zwei Bilder fixieren sowohl das erste als auch das letzte Bild, während H3 die Bewegung dazwischen im Seitenverhältnis des Eingabebilds ergänzt. Quellen mit 256 to 5760 Pixeln pro Seite werden akzeptiert, wodurch sich Key Art, Produkt-Stills und Storyboard-Frames unkompliziert in Bewegung setzen lassen. |
| MiniMax H3 Omni Reference API (Reference to Video) | Müssen mehrere Quellen zusammenspielen? Bis zu neun Bilder, drei Videoclips und drei Audiospuren passen in eine einzige Anfrage mit einem Limit von 12 Dateien und werden alle als ein multimodaler Kontext verarbeitet. Übertrage eine Figur, eine Kamerabewegung oder eine Stimmfarbe über mehrere Einstellungen hinweg, oder bearbeite einen vorhandenen Clip, indem du Motive, Hintergründe und gesprochene Zeilen austauschst. |
Jeder Clip, den die MiniMax H3 API zurückgibt, läuft bis zu 15 Sekunden in 1440p mit nativem Stereoton, wird aus beliebigen Kombinationen von Text-, Bild-, Video- und Sprachreferenzen erstellt, und derselbe Aufruf kann außerdem Figuren, Szenen und Dialoge in vorhandenem Material bearbeiten.
Eine MiniMax H3 API-Anfrage akzeptiert bis zu neun Referenzbilder, drei Videoclips und drei Audiospuren, begrenzt auf zwölf Dateien. Statt sie als getrennte Slots zu interpretieren, behandelt das Modell Text, Bild und Ton als einen gemeinsamen Kontext und übernimmt eine Figur aus einem Foto, eine Kamerabewegung aus einem Clip und eine Stimmung aus einem Track in dieselbe Szene. Teams mit vorhandenem Material erhalten so einen direkten Weg zum fertigen Shot.
Jedes Ergebnis wird mit Ton ausgeliefert. Dialoge, Atmosphäre und Musik werden im selben Durchlauf in nativem Stereo erzeugt, in dem auch das Bild mit 24 frames per second gerendert wird, sodass anschließend nichts mehr vertont oder nachsynchronisiert werden muss. Da das Timing während der Generierung des Shots festgelegt wird, bleiben Schritte, Sprache und Schnitte fest mit der Handlung synchronisiert. Kurze Anzeigen und Social-Spots sind direkt veröffentlichungsbereit.
Soll eine Katze gegen einen Hund getauscht, ein Green Screen ersetzt oder eine Dialogzeile umgeschrieben werden? Die MiniMax H3 API wendet solche Änderungen auf von Ihnen bereitgestelltes Video an und deckt Figuren, Objekte, Hintergründe, Beleuchtung und Effekte ab, während nicht erwähnte Bereiche nah am Original bleiben. Prompts können bis zu 7000 Zeichen lang sein, sodass sich ein Dutzend Änderungen in einem Durchlauf bündeln lässt. So wird das Iterieren auf einem freigegebenen Schnitt praxistauglich.
Senden Sie eine Sprachprobe zusammen mit Ihren Bildern oder Ihrem Filmmaterial, und die generierte Figur spricht mit diesem Timbre. Pro Anfrage sind bis zu drei Audioreferenzen erlaubt, jeweils zwischen 2 und 15 Sekunden lang, und Audio muss immer zusammen mit visuellem Input übergeben werden, statt allein einzutreffen. Vorhandene Dialoge können ebenfalls ersetzt und die Performance passend angepasst werden. Bei Serienproduktionen bleibt über jede Folge hinweg eine wiedererkennbare Stimme erhalten.
Clips laufen zwischen 5 und 15 Sekunden, und der 1440p-Modus setzt 1440 Pixel auf die kurze Seite zwischen 16:9 und 9:16, beziehungsweise ungefähr 3,7 Megapixel bei breiteren Verhältnissen wie 2976 mal 1248 für 21:9. Sechs Seitenverhältnisse sind auswählbar, von cineastischem 21:9 bis vertikalem 9:16, und die MiniMax H3 API kann auch automatisch eines für Sie auswählen. Diese Bandbreite deckt Trailer, Product Loop und vertikales Drama ab, ohne das Modell zu wechseln.
Wenn Ihre Quelldateien direkt aus einer Kamera oder einer Schnitt-Timeline kommen, können sie unverändert verwendet werden: H.264- und H.265-Video, JPG-, PNG-, WEBP-, HEIC- und HEIF-Bilder sowie WAV- und MP3-Audio. Die Limits pro Datei liegen bei 50MB für Video, 30MB für Bilder und 15MB für Audio, während Assets per URL die Anfragen innerhalb des 64MB-Body-Limits halten. Auf Atlas Cloud läuft der gesamte Satz über einen OpenAI-compatible key mit Pay-as-you-go billing.
Jeder Clip in diesem Set stammt aus einem identischen Prompt, der an die MiniMax H3 API und zwei weitere auf Atlas Cloud gehostete Videomodelle gesendet wurde. So lassen sich Bewegung, Ton und Anweisungstreue vergleichen, ohne ein einziges Wort zu ändern.
15 Sekunden, 16:9-Landschaftsformat, Kurzvideo. Live-Action-Aufnahmen eines Selbstbedienungs-Waschsalons spät in der Nacht, kombiniert mit handgezeichneter, leuchtender Animation zu einem Mixed-Media-Bild. Ein kleiner Selbstbedienungs-Waschsalon, dessen Neonröhren schwach flackern; drinnen laufen Waschmaschinen, es gibt Plastikwäschekörbe und eine alte Bank, auf dem Boden liegt eine einzelne Socke. Der ganze Raum ist still und trägt eine leise, nostalgische Stimmung. Die Aufnahme hat die Textur eines einhändig gefilmten Handyvideos, mit deutlichem Kamerawackeln; das weiße Leuchtstofflicht lässt die Belichtung zwischen hell und dunkel schwanken; Glasflächen zeigen Umgebungsreflexionen; wenn sich das Objektiv Objekten nähert, gibt es eine Fokusverzögerung. Das Bild soll nicht so glatt und geordnet wirken wie eine Werbeanzeige – das Gesamtgefühl soll eher einer echten dokumentarischen Momentaufnahme ähneln, als wärst du spät nachts zufällig hineingestolpert und hättest die Aufnahme gemacht, während du einer seltsamen, traumartigen Vision nachjagst.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
First-Person-Perspektive · Augenhöhe · handgeführte Gaming-Kamera Szene: Die Aufnahme simuliert einen Spieler, der ein Modern-Warfare-FPS-Game steuert: Beide Hände halten ein Sturmgewehr, während er langsam am äußeren Perimeter einer Militärbasis vorrückt. Der Spieler bewegt sich entlang einer Straße neben Deckung vorwärts, das Fadenkreuz gleitet über den Durchgang voraus; nach einer kurzen Pause feuert er ein paar Schüsse auf ein entferntes Ziel ab und rückt dann weiter vor – wie Live-Gameplay-Aufnahmen eines ganz normalen Spielers. Beleuchtung: Das kühl getönte natürliche Licht einer modernen Militärbasis vermischt sich mit Rauch und Mündungsfeuer. Das Bild ist realistisch und klar, die metallische Waffe sowie Staub und Dunst des Schlachtfelds vermitteln AAA-Game-Qualität. Kameraführung: Die Kamera weist beim Bewegen des Spielers ein leichtes handgeführtes Schwanken auf – zunächst langsames Vorrücken, dann kleine Schwenks nach links und rechts zum Beobachten, beim Feuern ein dezentes Rückstoßwackeln und schließlich ein gleichmäßiges weiteres Vorrücken.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Von Markenfilmen und vertikalen Dramen bis hin zu Produktclips, Game-Visuals und präzisen Bearbeitungen bestehenden Materials deckt die MiniMax H3 API jedes Szenario mit einer einzigen multimodalen Anfrage ab, die Video mit nativem Stereo-Audio zurückliefert.
Übergeben Sie Storyboard-Frames und eine Shotlist in einem einzigen Call, um 1440p-Trailer, TVC-Spots und Fashion-Kampagnen mit 24 FPS zu erstellen. Natives Stereo-Audio ist in jedem Ergebnis enthalten, sodass Brand-Teams fertige Schnitte sichten können.
Vertikale 9:16-Ausgaben decken geskriptete Dramaszenen ab, vom Kostüm-Mystery bis zur Familienkonfrontation, inklusive Dialog, der im selben Durchlauf vertont wird. Studios, die Short-Drama-Bibliotheken aufbauen, erhalten 15 second Hooks, ohne Schauspieler oder Bühnen zu buchen.
Wenn ein Shot ein bestimmtes Gesicht und eine bestimmte Bewegung erfordert, können bis zu neun Bilder, drei Videos und drei Audioclips einen einzigen Call steuern. Charakteridentität, Kameraführung und Stimmfarbe bleiben über Episoden hinweg konsistent.
Brauchen Sie nachträglich eine Änderung? Bestehendes Footage lässt sich per Prompt bearbeiten: ein Motiv austauschen, einen Hintergrund ersetzen, die Beleuchtung anpassen oder eine gesprochene Zeile umschreiben, ohne ein einziges Frame neu zu drehen.
Produktfotos werden zu Motion-Assets: Ein Referenzbild wird zu einer 360 degree-Präsentation, einem Feature-Erklärvideo oder einem Paid-Social-Clip. Seitenverhältnisse von 21:9 bis 9:16 sorgen dafür, dass ein Asset-Set jede Platzierung bedienen kann.
Stilisierte Ausgaben überzeugen bei Game CG, Charakter-PV, Anime-Openings und Interface-Demos, bei denen Menüs, HUD-Elemente und Text-Overlays lesbar bleiben müssen. Art-Teams nutzen sie zur Konzeptvalidierung vor der Produktion.
Vergleichen Sie die MiniMax H3 API mit den anderen auf Atlas Cloud gehosteten Videomodellen und sehen Sie, wie sich Eingabemodalitäten, Referenzlimits, Länge, Auflösung und Audioausgabe tatsächlich unterscheiden, bevor Sie sich für einen Endpoint entscheiden.
| Modell | Eingabemodalitäten | Max. Referenzdateien | Ausgabedauer | Max. Auflösung | Natives Audio |
|---|---|---|---|---|---|
| MiniMax H3 | Text, Bild, Video, Audio | 9 Bilder, 3 Videos, 3 Audioclips, insgesamt 12 Dateien | 5s bis 15s | 1440p bei 24 FPS | √ Natives Stereo-Audio in jeder Ausgabe |
| Seedance 2.0 Reference-to-Video | Text, Bild, Video, Audio | 9 Bilder, 3 Videos, 3 Audioclips | Bis zu 15s | 720p | √ Stereo-Dialoge, Effekte und Musik werden in einem Durchlauf generiert |
| Veo3.1 Reference-to-video | Text und Bild | 3 Referenzbilder | 4s, 6s oder 8s | 4K nur bei 8s Länge | √ Dialoge, Atmosphäre und Soundeffekte auf die Timeline abgestimmt |
| Wan-2.7 Reference-to-video | Text, Bild, Video, Audio | 5 Bilder oder Videoclips plus ein Sprachclip | 2s bis 15s | 1080p | √ Musik und Effekte werden generiert, oder Lip-Sync mit eigenem Audio steuern |
| Kling v3.0 Pro Image-to-Video | Text und Bild | - | Bis zu 15s | 1080p | √ Mehrsprachige Dialoge mit Lip-Sync in fünf Sprachen |
In wenigen Minuten startklar — folgen Sie diesen einfachen Schritten, um Modelle über die Plattform von Atlas Cloud zu integrieren und bereitzustellen.
Registrieren Sie sich auf atlascloud.ai und schließen Sie die Verifizierung ab. Neue Nutzer erhalten kostenlose Credits zum Erkunden der Plattform und Testen von Modellen.
Die Kombination der fortschrittlichen MiniMax H3-Modelle mit der GPU-beschleunigten Plattform von Atlas Cloud bietet unübertroffene Leistung, Skalierbarkeit und Entwicklererfahrung.
Niedrige Latenz:
GPU-optimierte Inferenz für Echtzeit-Reasoning.
Einheitliche API:
Führen Sie MiniMax H3, GPT, Gemini und DeepSeek mit einer Integration aus.
Transparente Preisgestaltung:
Vorhersehbare Token-basierte Abrechnung mit serverlosen Optionen.
Entwicklererfahrung:
SDKs, Analysen, Fine-Tuning-Tools und Vorlagen.
Zuverlässigkeit:
99,99% Verfügbarkeit, RBAC und compliance-bereite Protokollierung.
Sicherheit & Compliance:
SOC 2 Type II, HIPAA-Ausrichtung, Datensouveränität in den USA.
Die MiniMax H3 API bietet Entwicklern programmgesteuerten Zugriff auf MiniMax H3, ein offenes, universelles multimodales Videomodell, das Text, Bilder, Video und Audio als einen gemeinsamen Kontext verarbeitet. Statt Generierung, Bearbeitung und Referenzen auf separate Aufgabenmodelle aufzuteilen, liest H3 den gesamten Eingabesatz und gibt einen fertigen Clip mit Ton zurück. Auf Atlas Cloud läuft es hinter einem einzigen API key mit Pay-as-you-go-Preisen.
Brand films, Trailer, vertikale Kurzdramen, Produkt- und Ecommerce-Spots, Game- und UI-Motion-Demos sowie stilisierte Animationen gehören alle zu seinem Einsatzbereich. Da das Modell On-Screen-Text, Untertitel und Marken-Assets verarbeitet, nutzen Teams es auch für Konzeptvalidierung, Storyboard-Previews und visuelle Pitches, bevor sie Produktionsbudget freigeben.
Erstelle ein Atlas Cloud-Konto, generiere einen API key und sende dann einen Prompt plus alle Referenzdateien an den Video-Generation-Endpoint. Frage anschließend den fertigen Ergebnissstatus per Polling ab. Es wird empfohlen, Medien als gehostete URLs statt als Inline-Uploads zu übergeben, da der Request Body auf 64MB begrenzt ist. Starte noch heute mit der Entwicklung.
Die Abrechnung erfolgt nach dem Pay-as-you-go-Modell: Du zahlst pro Aufruf, statt ein Abonnement oder eine Seat License zu kaufen. Die Kosten richten sich nach dem, was du tatsächlich renderst. Das heißt, Auflösung und Cliplänge bestimmen die Gesamtkosten eines Batches. Prüfe vor der Planung großer Durchläufe die aktuelle Rate pro Generation auf der Modellseite.
Ja. Jedes H3-Ergebnis wird mit Ton in nativem Stereo geliefert, sodass Dialoge, Effekte und Atmosphäre im selben Durchlauf wie das Bild entstehen. Wenn du einen Referenz-Audioclip bereitstellst, kann das Modell diese Klangfarbe auf eine Figur übertragen. Dadurch entfällt ein separater Sprachsynthese-Schritt in der Pipeline.
Clips laufen 5 bis 15 Sekunden bei 24 FPS. Im 1440p-Modus wird die kurze Seite bei Seitenverhältnissen zwischen 16:9 und 9:16 mit 1440 Pixeln gerendert; außerhalb dieses Bereichs umfasst das Frame insgesamt etwa 3.7M Pixel, zum Beispiel 2976 mal 1248 bei 21:9. Text to video- und omni reference-Requests akzeptieren 21:9, 16:9, 4:3, 1:1, 3:4 und 9:16, während first and last frame-Requests das Seitenverhältnis des Eingabebilds übernehmen.
Bis zu neun Bilder, drei Videosegmente und drei Audioclips können zusammen mit einem Prompt übertragen werden, begrenzt auf insgesamt zwölf Dateien. Video und Audio dürfen jeweils kombiniert höchstens 15 Sekunden lang sein, und Audio muss zusammen mit einem Bild oder Video übergeben werden, statt allein anzukommen. Prompts können bis zu 7000 Zeichen lang sein, was Platz für eine Shot-by-Shot-Regie mit Kamera, Performance und Ton lässt.
Akzeptierte Eingaben umfassen H.264- und H.265-Video, JPG-, JPEG-, PNG-, WEBP-, HEIC- und HEIF-Bilder sowie WAV- oder MP3-Audio, mit AAC oder MP3 für die Audiospur innerhalb einer Videodatei. Die Obergrenzen pro Datei liegen bei 50MB für Video, 30MB für Bilder und 15MB für Audio. Da der Request Body auf 64MB begrenzt ist, bleiben gehostete URLs für große Assets die sicherere Wahl.
Bearbeitung ist einer seiner Kernmodi. Sende einen Quellclip mit Anweisungen, und die MiniMax H3 API kann Figuren oder Objekte austauschen, Hintergründe und Beleuchtung ersetzen, visuelle Effekte einfügen und Dialoge umschreiben, während unveränderte Bereiche stabil bleiben. Zusammengesetzte Anweisungen werden in einem einzigen Request verarbeitet, sodass mehrere Änderungen gemeinsam umgesetzt werden, statt über wiederholte Round Trips hinweg.
Die meisten Videomodelle nehmen einen Prompt plus ein Bild entgegen und geben einen stummen Clip zurück. H3 verarbeitet stattdessen einen gemischten Satz von Referenzen, erkennt Absichten zu Figur, Bewegung, Kamera und Ton über alle Referenzen hinweg und gibt anschließend einen Clip mit nativem Audio zurück. Wenn deine Pipeline derzeit ein Videomodell, ein Sprachmodell und einen Editor miteinander verkettet, fasst H3 diese Schritte in einem einzigen Aufruf zusammen.
Anleitungen, Tutorials und Produkt-Updates, mit denen Sie das Beste aus Atlas Cloud herausholen.