

MiniMax H3 API membuka akses ke model video multimodal serbaguna MiniMax, yang membaca teks, gambar, video, dan audio sebagai satu konteks, bukan satu tugas sekaligus. Klip berjalan 5 hingga 15 seconds pada 24 FPS dalam berbagai rasio aspek dari 21:9 hingga 9:16, dan satu prompt dapat menukar karakter, mengganti latar belakang, menulis ulang dialog, atau mengkloning suara dari klip referensi. Atlas Cloud menyajikan semuanya melalui satu endpoint yang kompatibel dengan OpenAI. Mulai bangun hari ini.
Atlas Cloud menyediakan model kreatif terdepan dan terbaru di industri untuk Anda.
Setiap endpoint MiniMax H3 API membaca teks, gambar, video, dan audio dengan cara berbeda, jadi lihat baris di bawah ini dan cocokkan modalitas dengan apa yang sedang Anda bangun.
| Modalitas | Deskripsi |
|---|---|
| MiniMax H3 T2V API (Teks ke Video) | Tulis prompt hingga 7,000 karakter dan model akan mengembalikan klip berdurasi 5 hingga 15 detik pada 24 FPS dalam 1440p, dengan suara stereo native yang dihasilkan dalam pass yang sama. Rasio aspek ditetapkan per permintaan di antara 21:9, 16:9, 4:3, 1:1, 3:4, dan 9:16, sehingga satu call mencakup trailer sinematik maupun potongan vertikal untuk media sosial. |
| MiniMax H3 I2V API (Gambar ke Video) | Satu gambar menetapkan frame pembuka dan dua gambar mengunci frame pertama sekaligus terakhir, sementara H3 mengisi gerakan di antaranya sesuai rasio aspek gambar input. Sumber berukuran 256 hingga 5760 piksel per sisi diterima, sehingga key art, still produk, dan frame storyboard mudah dibuat bergerak. |
| MiniMax H3 Omni Reference API (Referensi ke Video) | Perlu beberapa sumber bekerja bersama? Hingga sembilan gambar, tiga klip video, dan tiga track audio dapat dimuat dalam satu permintaan dengan batas 12 file, semuanya dibaca sebagai satu konteks multimodal. Pertahankan karakter, gerakan kamera, atau timbre suara lintas shot, atau edit klip yang sudah ada dengan menukar subjek, latar belakang, dan dialog yang diucapkan. |
Setiap klip yang dikembalikan MiniMax H3 API berdurasi hingga lima belas detik pada 1440p dengan suara stereo native, dibuat dari kombinasi referensi teks, gambar, video, dan suara apa pun, dan panggilan yang sama juga dapat mengedit karakter, adegan, serta dialog di dalam footage yang sudah Anda miliki.
Satu request MiniMax H3 API menerima hingga sembilan gambar referensi, tiga klip video, dan tiga track audio, dengan batas total dua belas file. Alih-alih membacanya sebagai slot terpisah, model memperlakukan teks, gambar, dan suara sebagai satu konteks, mengambil karakter dari foto, gerakan kamera dari klip, dan suasana dari track ke dalam adegan yang sama. Tim yang sudah memiliki materi mendapatkan jalur langsung menuju shot final.
Setiap hasil sudah dilengkapi suara. Dialog, ambience, dan musik diproduksi dalam stereo native pada proses yang sama saat gambar dirender pada 24 frames per second, sehingga tidak ada yang perlu diberi skor musik atau dubbing setelahnya. Karena timing ditentukan saat shot dibuat, langkah kaki, ucapan, dan cut tetap sinkron dengan aksi. Iklan pendek dan spot sosial siap dipublikasikan begitu keluar.
Perlu mengganti kucing dengan anjing, mengganti green screen, atau menulis ulang satu baris dialog? MiniMax H3 API menerapkan edit seperti ini pada video yang Anda berikan, mencakup karakter, objek, latar belakang, pencahayaan, dan efek, sementara bagian yang tidak Anda sebutkan tetap dekat dengan aslinya. Prompt dapat mencapai 7000 karakter, sehingga belasan perubahan dapat ditumpuk dalam satu proses. Ini membuat iterasi pada cut yang sudah disetujui menjadi praktis.
Kirim sampel suara bersama gambar atau footage Anda, dan karakter yang dihasilkan akan berbicara dengan timbre tersebut. Hingga tiga referensi audio diizinkan per request, masing-masing berdurasi antara dua hingga lima belas detik, dan audio harus selalu menyertai input visual, bukan dikirim sendiri. Dialog yang sudah ada juga dapat diganti dan performanya disesuaikan agar cocok. Pekerjaan serial mempertahankan satu suara yang mudah dikenali di setiap episode.
Klip berdurasi lima hingga lima belas detik, dan mode 1440p menempatkan 1440 pixels pada sisi pendek antara 16:9 dan 9:16, atau sekitar 3.7 megapixels pada rasio lebih lebar seperti 2976 by 1248 untuk 21:9. Enam rasio dapat dipilih, dari sinematik 21:9 hingga vertikal 9:16, dan MiniMax H3 API juga dapat memilihkannya untuk Anda. Rentang ini mencakup trailer, product loop, dan drama vertikal tanpa berganti model.
Jika file sumber Anda berasal langsung dari kamera atau timeline editing, file tersebut dapat masuk apa adanya: video H.264 dan H.265, stills JPG, PNG, WEBP, HEIC, dan HEIF, plus audio WAV dan MP3. Batas per file adalah 50MB untuk video, 30MB untuk gambar, dan 15MB untuk audio, sementara pengiriman aset melalui URL menjaga request tetap berada dalam batas body 64MB. Di Atlas Cloud, seluruh set berjalan melalui satu key yang kompatibel dengan OpenAI dengan penagihan pay-as-you-go.
Setiap klip dalam set ini berasal dari satu prompt identik yang dikirim ke MiniMax H3 API dan dua model video lain yang di-host di Atlas Cloud, sehingga gerakan, suara, dan kepatuhan terhadap instruksi dapat dibandingkan tanpa mengubah satu kata pun.
15 seconds, 16:9 video pendek lanskap. Rekaman live-action sebuah laundromat swalayan larut malam, dipadukan dengan animasi bercahaya yang digambar tangan menjadi gambar mixed-media. Sebuah laundromat swalayan kecil, lampu fluoresennya berkelip redup; di dalamnya ada mesin cuci yang sedang berjalan, keranjang cucian plastik, dan bangku tua, dengan satu kaus kaki tergeletak di lantai. Seluruh ruang terasa sunyi, membawa nuansa nostalgia yang samar. Teksturnya seperti rekaman ponsel handheld yang dipegang satu tangan, dengan guncangan kamera yang kentara; cahaya fluoresen putih membuat eksposur naik-turun antara terang dan redup; permukaan kaca memantulkan cahaya sekitar; ada lag fokus saat lensa bergerak mendekati objek. Gambar tidak boleh terlihat sehalus dan serapi iklan komersial — kesan keseluruhannya harus seperti cuplikan dokumenter yang autentik, seolah-olah Anda kebetulan masuk larut malam dan merekam momen itu sambil mengejar semacam penglihatan aneh yang terasa seperti mimpi.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Perspektif orang pertama · ketinggian setinggi mata · kamera game handheld Adegan: Shot ini menyimulasikan pemain yang mengoperasikan game FPS perang modern, dengan kedua tangan memegang senapan serbu sambil perlahan maju di sepanjang perimeter luar sebuah pangkalan militer. Pemain bergerak maju di sepanjang jalan di samping perlindungan, crosshair menyapu jalur di depan; setelah jeda singkat, mereka menembakkan beberapa peluru ke arah objektif yang jauh, lalu terus mendorong maju — seperti rekaman gameplay langsung dari pemain biasa. Pencahayaan: Cahaya alami bernuansa dingin dari pangkalan militer modern berpadu dengan asap dan kilatan tembakan. Gambar realistis dan tajam, dengan senjata logam serta debu dan kabut medan tempur yang menghadirkan kualitas AAA-game. Gerak kamera: Kamera memiliki ayunan handheld ringan saat pemain bergerak — mula-mula maju perlahan, lalu melakukan sapuan kecil ke kiri dan kanan untuk mengamati, dengan guncangan recoil halus saat menembak, sebelum akhirnya terus mendorong maju dengan stabil.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Dari film brand dan drama vertikal hingga potongan produk, visual game, dan pengeditan presisi pada footage yang sudah ada, MiniMax H3 API mencakup setiap skenario melalui satu request multimodal yang menghasilkan video dengan audio stereo native.
Masukkan frame storyboard dan shot list dalam satu call untuk trailer 1440p, spot TVC, dan kampanye fashion pada 24 FPS. Audio stereo native disertakan dalam setiap hasil, sehingga tim brand dapat meninjau potongan final.
Output vertikal 9:16 mencakup adegan drama berskrip, dari misteri berkostum hingga konfrontasi keluarga, dengan dialog yang diisi suara dalam pass yang sama. Studio yang membangun pustaka drama pendek mendapatkan hook 15 second tanpa perlu memesan aktor atau panggung.
Jika sebuah shot membutuhkan wajah dan gerakan tertentu, hingga sembilan gambar, tiga video, dan tiga klip audio dapat memandu satu call. Identitas karakter, camera work, dan timbre vokal tetap konsisten di seluruh episode.
Perlu perubahan setelah produksi? Footage yang sudah ada dapat diedit melalui prompt: tukar subjek, ganti latar belakang, sesuaikan pencahayaan, atau tulis ulang dialog lisan tanpa merekam ulang satu frame pun.
Foto produk menjadi bergerak: satu gambar referensi berubah menjadi showcase 360 degree, penjelasan fitur, atau potongan paid social. Aspect ratio dari 21:9 hingga 9:16 memungkinkan satu set aset dipakai untuk setiap placement.
Output bergaya tetap kuat untuk game CG, character PV, opening anime, dan demo interface ketika menu, elemen HUD, serta overlay teks harus tetap terbaca. Tim art menggunakannya untuk validasi konsep sebelum produksi.
Line the MiniMax H3 API up against the other video models hosted on Atlas Cloud and see how input modalities, reference limits, length, resolution, and audio output actually differ before you commit to an endpoint.
| Model | Input Modalities | Max Reference Files | Output Duration | Max Resolution | Native Audio |
|---|---|---|---|---|---|
| MiniMax H3 | Text, image, video, audio | 9 images, 3 videos, 3 audio clips, 12 files total | 5s to 15s | 1440p at 24 FPS | √ Native stereo audio on every output |
| Seedance 2.0 Reference-to-Video | Text, image, video, audio | 9 images, 3 videos, 3 audio clips | Up to 15s | 720p | √ Stereo dialogue, effects, and music generated in one pass |
| Veo3.1 Reference-to-video | Text and image | 3 reference images | 4s, 6s, or 8s | 4K at 8s length only | √ Dialogue, ambience, and sound effects aligned to the timeline |
| Wan-2.7 Reference-to-video | Text, image, video, audio | 5 images or video clips, plus one voice clip | 2s to 15s | 1080p | √ Music and effects generated, or drive lip sync with your own audio |
| Kling v3.0 Pro Image-to-Video | Text and image | - | Up to 15s | 1080p | √ Multilingual dialogue with lip sync in five languages |
Mulai dalam hitungan menit — ikuti langkah-langkah sederhana berikut untuk mengintegrasikan dan men-deploy model melalui platform Atlas Cloud.
Daftar di atlascloud.ai dan selesaikan verifikasi. Pengguna baru mendapatkan kredit gratis untuk menjelajahi platform dan menguji model.
Gabungkan model MiniMax H3 canggih dengan platform akselerasi GPU Atlas Cloud untuk performa, skalabilitas, dan pengalaman pengembangan yang tak tertandingi.
Latensi Rendah:
Inferensi yang dioptimalkan GPU untuk respons real-time.
API Terpadu:
Satu integrasi untuk MiniMax H3, GPT, Gemini, dan DeepSeek.
Harga Transparan:
Billing per token, mendukung mode Serverless.
Pengalaman Developer:
SDK, analitik data, alat fine-tuning, dan template tersedia lengkap.
Keandalan:
Ketersediaan 99.99%, kontrol izin RBAC, logging kepatuhan.
Keamanan & Kepatuhan:
Sertifikasi SOC 2 Type II, kepatuhan HIPAA, kedaulatan data AS.
MiniMax H3 API memberi developer akses terprogram ke MiniMax H3, model video multimodal general purpose terbuka yang memperlakukan teks, gambar, video, dan audio sebagai satu konteks bersama. Alih-alih memisahkan pembuatan, pengeditan, dan referensi ke dalam model tugas yang berbeda, H3 membaca seluruh kumpulan input dan mengembalikan klip final dengan suara. Di Atlas Cloud, model ini berjalan di balik satu API key dengan harga bayar sesuai pemakaian.
Film brand, trailer, drama pendek vertikal, spot produk dan e-commerce, demo gerak untuk game dan UI, serta animasi bergaya semuanya berada dalam jangkauannya. Karena model ini menangani teks di layar, subtitle, dan aset brand, tim juga menggunakannya untuk validasi konsep, pratinjau storyboard, dan pitch visual sebelum mengalokasikan anggaran produksi.
Buat akun Atlas Cloud, buat API key, lalu kirim prompt beserta file referensi apa pun ke endpoint pembuatan video dan lakukan polling hingga hasil akhir tersedia. Mengirim media sebagai URL yang di-host lebih disarankan daripada unggahan inline, karena request body dibatasi hingga 64MB. Mulai kembangkan sekarang.
Penagihan bersifat bayar sesuai pemakaian, jadi Anda membayar per panggilan, bukan membeli langganan atau lisensi per seat. Biaya mengikuti apa yang benar-benar Anda render, yang berarti resolusi dan durasi klip menentukan total untuk satu batch. Periksa halaman model untuk tarif per generasi terbaru sebelum merencanakan proses dalam volume besar.
Ya. Setiap hasil H3 dikirim dengan suara dalam stereo native, sehingga dialog, efek, dan ambience hadir dalam proses yang sama dengan gambar. Berikan klip audio referensi dan model dapat menerapkan warna suara tersebut ke sebuah karakter, sehingga satu langkah sintesis suara terpisah dapat dihapus dari pipeline.
Klip berdurasi 5 hingga 15 detik pada 24 FPS. Dalam mode 1440p, sisi pendek dirender pada 1440 piksel untuk rasio antara 16:9 dan 9:16, dan di luar rentang itu frame mempertahankan total sekitar 3.7M piksel, misalnya 2976 x 1248 pada 21:9. Permintaan text to video dan omni reference menerima 21:9, 16:9, 4:3, 1:1, 3:4, dan 9:16, sedangkan permintaan first and last frame mewarisi aspect ratio dari gambar input.
Hingga sembilan gambar, tiga segmen video, dan tiga klip audio dapat dikirim bersama satu prompt, dengan batas total dua belas file. Video dan audio masing-masing harus tetap dalam total gabungan 15 detik, dan audio harus menyertai gambar atau video, bukan dikirim sendiri. Prompt dapat mencapai 7000 karakter, sehingga tersedia ruang untuk arahan per shot yang mencakup kamera, performa, dan suara.
Input yang diterima mencakup video H.264 dan H.265, gambar JPG, JPEG, PNG, WEBP, HEIC, dan HEIF, serta audio WAV atau MP3, dengan AAC atau MP3 untuk track audio di dalam file video. Batas per file adalah 50MB untuk video, 30MB untuk gambar, dan 15MB untuk audio. Karena request body dibatasi hingga 64MB, URL yang di-host tetap menjadi pilihan yang lebih aman untuk aset berukuran besar.
Pengeditan adalah salah satu mode intinya. Kirim klip sumber beserta instruksi, dan MiniMax H3 API dapat menukar karakter atau objek, mengganti latar belakang dan pencahayaan, menambahkan visual effects, serta menulis ulang dialog sambil menjaga area yang tidak disentuh tetap stabil. Instruksi gabungan ditangani dalam satu permintaan, sehingga beberapa perubahan diterapkan bersamaan, bukan melalui beberapa round trip berulang.
Sebagian besar model video menerima satu prompt plus satu gambar dan mengembalikan klip tanpa suara. H3 justru memproses kumpulan referensi campuran, membaca maksud karakter, gerakan, kamera, dan suara di seluruh referensi tersebut, lalu mengembalikan klip dengan audio native. Jika pipeline Anda saat ini menggabungkan model video, model suara, dan editor, H3 merangkum semua tahap itu menjadi satu panggilan.
Panduan, tutorial, dan pembaruan produk untuk membantu Anda memaksimalkan Atlas Cloud.