Setiap orang melakukan hal yang sama di hari pertama. Anda membuka dropdown durasi, melihat angka 15, dan mulai membagi. Film sepuluh menit? Empat puluh generasi. Video penjelasan tiga menit? Dua belas. Lalu Anda melihat angka hasil pembagian itu, menutup tab, dan memutuskan bahwa model ini belum siap untuk sesuatu yang memiliki cerita di dalamnya.
Saya juga melakukan pembagian itu. Lalu saya menjalankan ffmpeg pada sembilan klip H3 asli dan menemukan sesuatu yang membuat seluruh perhitungan itu terlihat konyol.
Salah satu klip tersebut berdurasi 15,10 detik. Di dalamnya, detektor adegan menandai sepuluh potongan bersih. Sepuluh. Pakaian berbeda, pembingkaian berbeda, latar belakang berbeda, kartu tipe bingkai penuh, semuanya di dalam satu generasi yang harganya sama dengan satu generasi. Jika saya merencanakan klip itu seperti yang disiratkan oleh pembagian, satu generasi per bidikan, saya akan membayar sepuluh kali lipat untuk lima belas detik yang sama.
Pembagian adalah kesalahannya. Batasnya bukanlah stopwatch, melainkan wadah, dan hampir tidak ada yang mengisinya.

Seorang pemain skateboard di tengah trik yang ditangkap sebagai urutan strobo, banyak posisi berbeda yang dibekukan dalam satu bingkai
Satu bingkai, banyak momen. Itulah model mental yang dibujuk oleh dropdown durasi untuk Anda tinggalkan.
Poin-poin penting
- Parameter
durationhanya menerima bilangan bulat dari 4 hingga 15. Default adalah 8. Tidak ada 7,5, dan tidak ada nilai di atas 15. - Setiap klip dikembalikan dalam 24 FPS, hingga 2K asli, dengan audio stereo yang dihasilkan dalam proses yang sama dengan gambar.
- Klip "15 detik" Anda sebenarnya adalah 362 bingkai, yaitu 15,083 detik. Durasi terpaku ke atas ke grid 17 bingkai, dan hanya
duration: 8yang tepat pada satu detik penuh. - Satu generasi dapat menampung banyak bidikan. Tulis
SHOT 1 / CUT TOke dalam prompt dan model akan memotong untuk Anda, tanpa biaya tambahan. - Tidak ada parameter extend di API. Anda bisa melewati 15 detik dengan merantai: bingkai terakhir ke bingkai pertama berikutnya, gambar referensi untuk mempertahankan tampilan, lalu penggabungan keras (hard concat).
Tonton 45 Detik Panjang Video MiniMax H3, Dibuat dari Tiga Klip
Sebelum teori apa pun, inilah wujud aslinya. Sebuah spot mie stall berdurasi 45 detik yang disebut MIDNIGHT BOWL. Tiga generasi, masing-masing lima belas detik, tiga bidikan di dalam setiap generasi. Sembilan bidikan, satu bagian naratif berkelanjutan, tanpa transisi yang menyembunyikan sambungan.
Potongan 45 detik penuh. Tiga generasi MiniMax H3 yang digabungkan tanpa efek transisi. Koki, celemek, bola lampu, dan papan tanda tulisan tangan bertahan melalui dua kali perpindahan.

Sembilan bingkai dari spot MIDNIGHT BOWL yang disusun sebagai lembar kontak 3x3, diberi label SHOT 1 hingga SHOT 9 dengan kode waktu
Sembilan bidikan, tiga generasi. Setiap baris adalah satu generasi, setiap kolom adalah potongan yang dibuat model sendiri. Bidikan 3 dan 4 berirama karena generasi 2 dimulai dari bingkai terakhir generasi 1, itulah yang membuat sambungan tidak terlihat.
Tiga generasi. Bukan sembilan. Kesenjangan itulah inti dari artikel ini.
Saya tidak memotong satu pun secara manual. Saya meminta setiap generasi untuk tiga bidikan dengan kode waktu, dan detektor adegan ffmpeg menemukan potongan di posisi 4,9 detik dan 9,1 detik pada yang pertama, 4,9 detik dan 9,0 detik pada yang kedua, 5,3 detik dan 11,0 detik pada yang ketiga. Sembilan bidikan, tiga tagihan.
Mengapa Panjang Video MiniMax H3 Merusak Rencana Durasi Panjang
Angkanya sendiri baik-baik saja. Lima belas detik di puncak rentang sudah cukup murah hati untuk model generasi ini, dan klipnya 2K dengan suara stereo asli. Yang merusak rencana orang adalah satuan yang mereka gunakan untuk merencanakan.
Jika Anda menghitung anggaran dalam detik, satu menit berarti "empat klip" dan sepuluh menit berarti "empat puluh klip," dan empat puluh klip apa pun adalah mimpi buruk dalam hal kontinuitas. Jika Anda menghitung anggaran dalam bidikan, satu menit berarti empat generasi yang menampung kira-kira dua belas bidikan, yang merupakan jumlah cakupan normal untuk iklan. Model yang sama, batas yang sama, rencana produksi yang sama sekali berbeda.

Ilustrasi poster datar retro dari satu strip film 35mm di mana tiga bingkai berurutan masing-masing berisi adegan yang sama sekali berbeda
Anggaran dalam bidikan, bukan detik. Satu strip yang ditagih, tiga adegan berbeda di dalamnya.
Ada hal kedua yang merusak rencana durasi panjang, dan itu sama sekali bukan batasnya. Ini adalah sambungannya. Klip individual hampir tidak pernah berantakan di tengah. Mereka berantakan di sambungan, karena setiap generasi menciptakan latar audio sendiri dan sedikit bergeser pada pakaian dan pencahayaan. Rencanakan untuk sambungan dan 45 detik menjadi mudah. Abaikan mereka dan empat klip sempurna tetap terlihat seperti empat klip.
Apa Sebenarnya Panjang Video MiniMax H3: 4 hingga 15 Detik Penuh pada Grid 17 Bingkai
Mulai dengan spesifikasi, karena ada dua angka berbeda yang beredar. Skema API langsung untuk ketiga titik akhir H3 di Atlas Cloud mencantumkan duration sebagai enum yang tepat 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, dengan default 8. Bilangan bulat penuh, tidak ada fraksional, tidak ada yang melewati 15. Liputan peluncuran cocok dengan bacaan itu: output 2K, 4 hingga 15 detik, hanya durasi bilangan bulat (MarkTechPost, Agustus 2026). Postingan peluncuran MiniMax sendiri menggambarkannya sebagai hingga 15 detik pada 2K dengan suara stereo asli (MiniMax, Agustus 2026).
Anda masih akan melihat "5 hingga 15 detik" ditulis di berbagai profil dan quickstart, termasuk beberapa salinan di platform. Perlakukan enum skema sebagai kebenaran. Batas bawahnya adalah 4, dan saya telah menagih klip 4 detik untuk membuktikannya.
Sekarang bagian yang hampir tidak ada yang menyebutkan. Minta 15 detik dan Anda tidak mendapatkan 360 bingkai. Anda mendapatkan 362.
H3 membangun video dalam blok 17 bingkai dan menjepret durasi yang diminta ke atas ke jumlah bingkai 17k + 5 berikutnya pada 24 FPS. Grid tersebut didokumentasikan dalam tutorial H3 resmi ComfyUI (ComfyUI Docs, 2026), dan juga berlaku di sisi API. Saya menghitung bingkai pada sembilan file H3 asli dengan ffmpeg:
text1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1 2# frame= 362 ... 3# Duration: 00:00:15.10, 1280x720, 24 fps 4
Setiap file 15 detik kembali dengan 362 bingkai. Setiap file 10 detik kembali dengan 243. Tiga generasi baru yang saya jalankan untuk artikel ini kembali dengan 362 juga, dan latihan 4 detik di Langkah 5 kembali dengan 107. Jalankan melalui grid: 362 adalah 17x21+5, 243 adalah 17x14+5, dan 107 adalah 17x6+5. Rumus memprediksi ketiganya dengan tepat, yang merupakan jenis kesepakatan yang membuat saya mempercayai sisa tabel.
| durasi | Bingkai yang dikirimkan (17k+5) | Panjang sebenarnya pada 24 FPS | Tepat pada satu detik penuh? | Sumber |
|---|---|---|---|---|
| 4 | 107 | 4,458 dtk | Tidak | Terukur |
| 5 | 124 | 5,167 dtk | Tidak | Grid |
| 6 | 158 | 6,583 dtk | Tidak | Grid |
| 7 | 175 | 7,292 dtk | Tidak | Grid |
| 8 | 192 | 8,000 dtk | Ya | Grid |
| 9 | 226 | 9,417 dtk | Tidak | Grid |
| 10 | 243 | 10,125 dtk | Tidak | Terukur |
| 11 | 277 | 11,542 dtk | Tidak | Grid |
| 12 | 294 | 12,250 dtk | Tidak | Grid |
| 13 | 328 | 13,667 dtk | Tidak | Grid |
| 14 | 345 | 14,375 dtk | Tidak | Grid |
| 15 | 362 | 15,083 dtk | Tidak | Terukur |
Tiga hal yang keluar dari tabel itu.
duration: 8 adalah satu-satunya nilai di seluruh rentang yang memberi Anda satu detik penuh yang bersih, dan kebetulan itu adalah default. Itu bukan kebetulan, itu adalah 17x11+5 = 192 = 8 x 24 tepat.
Minta 6 dan Anda mendapatkan 6,583 detik, lebih dari setengah detik gambar gratis. Minta 13 dan Anda mendapatkan 13,667. Grid selalu membulatkan ke atas, tidak pernah ke bawah, jadi Anda tidak pernah kekurangan.
Dan jika Anda memotong sesuai musik atau mencocokkan suntingan yang akurat bingkai, jangan pernah menghitung garis waktu Anda sebagai durasi x 24. Ukur file. Proyek 40 klip yang direncanakan dengan asumsi detik penuh akan meleset hampir empat detik pada akhirnya.
Sepuluh Potongan di Dalam Satu Generasi MiniMax H3 15 Detik
Inilah klip yang saya sebutkan di awal. Satu generasi, 362 bingkai, 15,10 detik di dalam wadah. Ini adalah potongan bertipe kinetic fashion, dan berperilaku seperti video musik yang diedit daripada satu pengambilan.

Satu generasi MiniMax H3 tunggal. Perubahan pakaian, perubahan pembingkaian, layar terbagi dan kartu tipe bingkai penuh, semuanya di dalam satu pekerjaan 15 detik.
Saya menjalankan detektor adegan ffmpeg di atasnya daripada menghitung dengan mata:
text1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null - 2# 18 jeda ditandai, pada 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ... 3
Sepuluh di antaranya adalah perubahan bidikan bersih di tiga belas detik pertama. Ekornya adalah kartu judul berkedip di latar hitam, yang meningkatkan jumlah mentah, jadi sepuluh adalah angka konservatif yang jujur. Bagaimanapun, itu bukan satu bidikan, dan bukan tiga.
Sekarang kasus kontrol, karena "H3 selalu memotong klip Anda menjadi beberapa bagian" adalah kegagalan yang berlawanan dan sama salahnya. File berikutnya ini juga merupakan satu generasi 15 detik tunggal, juga 362 bingkai, dan detektor yang sama menemukan tepat nol potongan di dalamnya.

Generasi tunggal yang berbeda, 362 bingkai yang sama, nol potongan terdeteksi. Satu gerakan kamera berkelanjutan selama lima belas detik penuh.
Jadi batasnya bukanlah "lima belas detik rekaman." Itu adalah lima belas detik waktu layar yang dapat Anda bagi sesuai keinginan, dari satu pengambilan tanpa putus hingga sepuluh potongan. Anda mengendalikannya dari prompt, dan Anda membayar sama bagaimanapun caranya.
Tiga Titik Akhir di Balik Panjang Video MiniMax H3, dalam Satu Tab
Melewati lima belas detik membutuhkan tiga pekerjaan berbeda: sesuatu untuk membuat bingkai jangkar, sesuatu untuk menganimasikan dan merantai, dan sesuatu untuk menggerakkan kamera tanpa kehilangan subjek. Di Atlas Cloud keempatnya hidup dalam katalog yang sama dengan satu kunci dan satu saldo, yang penting di sini terutama karena rantai di bagian berikutnya menyerahkan file di antara mereka berulang kali.
| Langkah | Model | Pekerjaan dalam build ini | Rentang panjang | Tarif terdaftar, 4 Agustus 2026 |
|---|---|---|---|---|
| Bingkai jangkar | openai/gpt-image-2/text-to-image | Satu gambar diam yang menentukan keseluruhan tampilan | t/a | $0,1745 untuk menjalankan saya di high |
| Pembukaan, tanpa gambar diam | minimax/h3/text-to-video | Langsung dari prompt ke klip | 4 hingga 15 dtk, default 8 | $0,14 / dtk |
| Generasi 1 dan 2 | minimax/h3/image-to-video | Menganimasikan bingkai pertama, lalu merantai dari bingkai terakhir | 4 hingga 15 dtk, default 8 | $0,14 / dtk |
| Generasi 3 | minimax/h3/reference-to-video | Posisi kamera baru, subjek yang sama | 4 hingga 15 dtk, default 8 | $0,14 / dtk |
Ketiga titik akhir H3 tidak memiliki diskon saat ini, jadi tarifnya adalah tarifnya. Anda dapat mengonfirmasi semuanya di katalog model lengkap.
Tiga perangkap parameter yang perlu diketahui sebelum Anda menulis satu permintaan pun, semuanya diambil dari skema langsung daripada prosa dokumen:
ratioberperilaku berbeda di setiap titik akhir.text-to-videomenawarkan enam rasio dan default ke1:1, yang diam-diam akan memberi Anda klip persegi jika Anda lupa mengaturnya, dan tidak menerimaadaptivesama sekali.image-to-videohanya menawarkanadaptive, jadi pembingkaian mengikuti bingkai pertama Anda.reference-to-videoadalah satu-satunya yang memiliki set lengkap plusadaptive.resolutionadalah768Patau2K, default ke2K. Kedua tingkatan berada di bawah satu tarif per detik yang terdaftar di katalog, jadi turun ke 768P tidak menghemat uang Anda. Gunakan 2K.image-to-videojuga menerimaend_imageopsional. Anda dapat menjepit kedua ujung klip, bukan hanya awal. Itu mengubah trik rantai di bawah menjadi sesuatu yang dapat Anda arahkan dari kedua arah.
Cara Mengalahkan Batas Panjang Video MiniMax H3, Langkah demi Langkah
Ini adalah build MIDNIGHT BOWL yang lengkap. Setiap prompt di bawah adalah yang benar-benar saya kirim, salin persis. Total waktu proses adalah tiga generasi H3 ditambah satu gambar diam, dan semuanya dapat direproduksi di tab browser.
Langkah 1: Kunci Tampilan dalam Satu Bingkai Jangkar
Jangan mulai dengan video. Mulailah dengan satu gambar diam yang benar-benar Anda sukai, karena setiap klip dalam rantai akan mewarisi pencahayaan, pakaian, dan petunjuknya. Mendapatkan ini salah itu mahal; melakukannya dengan benar hanya membutuhkan biaya sen.
Model: openai/gpt-image-2/text-to-image. Pengaturan: kualitas tinggi, rasio 16:9.
text1Gambar diam film, jam 2 pagi di gang sempit Tokyo dengan warung mie. Seorang koki berusia 50 tahun dengan celemek biru laut dan bandana putih mencondongkan tubuh ke atas panci kaldu yang mengepul di belakang meja kayu yang tergores, lengan digulung hingga siku, lengan bawah diterangi oranye panas oleh satu bola lampu gantung. Aspal basah hujan memantulkan papan tanda merah dan hijau; lentera kertas dan papan kayu bertuliskan "MIDNIGHT BOWL" tergantung di atas konter. Uap bergulung melintasi bingkai dari kanan kamera. Difilmkan dengan lensa 35mm pada f/2, kedalaman bidang dangkal, bayangan dalam, lampu utama tungsten hangat melawan malam biru dingin, butiran film halus yang terlihat, tidak ada hamparan teks. 2

Playground GPT Image 2 di Atlas Cloud dengan prompt jangkar MIDNIGHT BOWL diisi dan gambar jadi di panel output
GPT Image 2 di Atlas Cloud: kualitas diatur ke tinggi, 16:9, bingkai jangkar dirender di sebelah kanan.

Bingkai jangkar MIDNIGHT BOWL: seorang koki dengan celemek biru laut di belakang panci kaldu yang mengepul di bawah satu bola lampu gantung di gang belakang yang hujan
Bingkai jangkar. Semua yang di hilir mewarisi bola lampu, celemek, dan papan tanda ini.
Langkah 2: Tempatkan Tiga Bidikan di Dalam Satu Generasi MiniMax H3 15 Detik
Inilah langkah yang mengubah anggaran. Alih-alih meminta satu lima belas detik berkelanjutan, berikan model daftar bidikan dengan kode waktu eksplisit dan kata-kata CUT TO. Model akan memotong untuk Anda, di dalam satu generasi yang ditagih.
Model: minimax/h3/image-to-video. Pengaturan: resolution 2K, duration 15, ratio adaptive (satu-satunya opsi di sini, pembingkaian mengikuti bingkai pertama Anda), bingkai pertama = gambar diam Langkah 1.
text1SHOT 1 (0-5dtk): Wide terkunci dari warung. Uap membumbung; koki menyendok kaldu ke dalam mangkuk hitam; hujan menetes dari tepi tenda. SHOT 2 (5-10dtk): CUT TO close-up makro dari sendok yang memecah permukaan kaldu, lemak emas berputar, daun bawang cincang jatuh dalam busur lambat. SHOT 3 (10-15dtk): CUT TO medium shot koki menatap langsung ke lensa, mengelap tangannya di celemek, dan berkata dalam bahasa Jepang dengan senyum lelah: "Ippai, dozo." Dia meletakkan mangkuk di atas konter dan bidikan bertahan di wajahnya. 2Audio: hujan deras di tenda, kaldu mendidih, sendok mengenai tepi panci, kereta api jauh, dengung kota larut malam yang rendah. Satu baris dialog pria Jepang yang jelas, nada ruangan alami, tanpa musik. 3Pertahankan koki, celemek, bandana, bola lampu, dan papan tanda yang sama di ketiga bidikan. Hanya potongan keras, tanpa transisi, tanpa transisi gerakan kamera. Lampu utama tungsten hangat, malam biru dingin, tampilan 35mm, butiran film. 4
Tiga hal yang membuat ini berhasil. Rentang detik eksplisit, string literal CUT TO, dan klausa kontinuitas di bagian bawah yang menyebutkan setiap elemen yang harus bertahan dari potongan. Hapus klausa kontinuitas dan bidikan 3 kembali dengan celemek yang berbeda.

Playground MiniMax H3 image-to-video di Atlas Cloud dengan bingkai jangkar dimuat, durasi 15 dan 2K dipilih, klip jadi diputar di panel output
MiniMax H3 image-to-video di Atlas Cloud: bingkai jangkar dimuat sebagai bingkai pertama, resolusi 2K, klip jadi di sebelah kanan. Perhatikan penggeser Durasi dan harga yang melacaknya. Proses khusus ini membiarkan durasi pada default 8, itulah sebabnya tombol bertuliskan $1,12; pada 15 tertulis $2,10.

Generasi 1. Satu pekerjaan yang ditagih, tiga bidikan (potongan diukur pada 4,92 dtk dan 9,13 dtk), satu baris dialog dengan sinkronisasi bibir, 2560x1440 asli, dan audio stereo 32 kHz dalam file yang sama.
Langkah 3: Rantai 15 Detik Berikutnya dari Bingkai Terakhir
Tidak ada parameter extend. Rantai bersifat manual dan sepele: ambil bingkai terakhir dari generasi 1 dan masukkan kembali sebagai bingkai pertama generasi 2.
bash1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg 2
Model: minimax/h3/image-to-video lagi. Pengaturan: bingkai pertama = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.
Disiplin penting di sini adalah apa yang Anda tinggalkan. Jangan deskripsikan koki lagi. Dia sudah ada di piksel yang baru saja Anda serahkan, dan mendeskripsikannya lagi memberi model izin untuk menafsirkannya kembali.
text1Lanjutkan dari bingkai yang tepat ini, pria yang sama, celemek yang sama, cahaya yang sama. SHOT 1 (0-5dtk): Dia mendorong mangkuk melintasi konter dengan kedua tangan ke arah kamera. SHOT 2 (5-10dtk): CUT TO over-the-shoulder dari tangan pelanggan yang mengangkat sumpit kayu dan membelahnya, ujung lengan jas hujan abu-abu basah terlihat. SHOT 3 (10-15dtk): CUT TO makro ekstrem tarikan mie, uap melengkung melewati lensa, kaldu menetes kembali ke mangkuk. 2Audio: hujan berkelanjutan dan mendidih dibawa dari sebelumnya, keramik di kayu, sumpit patah, suara menyeruput, kereta api jauh yang sama. Tanpa musik, tanpa narasi. 3Hanya potongan keras. Lampu utama tungsten yang sama dari bola lampu gantung, malam biru dingin yang sama di belakang, kedalaman bidang dangkal 35mm dan butiran film yang sama. 4

Generasi 2, dimulai dari bingkai terakhir generasi 1. Koki yang sama, pola bandana yang sama, atasan biru laut yang sama, dapur yang sama di belakangnya. Tiga bidikan lagi, potongan pada 4,92 dtk dan 9,04 dtk.

Putaran dua detik melintasi sambungan antara generasi satu dan generasi dua
Sambungan itu sendiri: detik terakhir generasi 1 ke detik pertama generasi 2. Tidak ada efek transisi, hanya potongan.
Langkah 4: Pindahkan Kamera dengan Reference-to-Video
Rantai bingkai terakhir memiliki satu keterbatasan bawaan: ia selalu melanjutkan dari tempat kamera sebelumnya berdiri. Untuk melompat ke sudut yang benar-benar baru sambil mempertahankan subjek yang sama, ganti titik akhir.
Model: minimax/h3/reference-to-video. Pengaturan: refers = bingkai jangkar Langkah 1 ditambah bingkai terakhir generasi 2, resolution 2K, duration 15, dan atur ratio secara eksplisit ke 16:9 di sini daripada membiarkannya pada adaptive. Titik akhir ini menerima hingga sembilan gambar referensi, tiga video referensi, dan tiga klip audio, dengan video referensi dibatasi maksimal 15 detik total (MarkTechPost, Agustus 2026).
text1Wide low-angle shot dari tengah jalan basah melihat kembali ke warung mie yang sama, koki yang sama di dalamnya. SHOT 1 (0-6dtk): Hujan mengalir melintasi bingkai; dua pelanggan siluet duduk di konter; koki bekerja di bawah satu bola lampu. SHOT 2 (6-11dtk): CUT TO papan tanda kayu bertuliskan tangan saat tipe putih kinetik dianimasikan di sampingnya, huruf demi huruf: "MIDNIGHT BOWL - BUKA SAMPAI JAM 4 PAGI". Tipe tetap tajam dan terkunci pada papan tanda saat kamera melayang. SHOT 3 (11-15dtk): CUT BACK ke wide saat koki mendongak, mengangkat satu tangan dalam lambaian kecil, dan bola lampu berkedip sekali. 2Audio: hujan, ambien jalan, skuter lewat, kereta api samar yang sama, satu pukulan rendah saat tipe mendarat. Tanpa dialog. 3Koki, celemek, dan bandana yang sama, papan tanda dan warna lentera yang sama dengan gambar referensi. Hanya potongan keras, butiran film, 35mm, tungsten hangat melawan biru dingin. 4
Instruksi ratio itu bukan paranoia. Inilah yang terjadi ketika Anda membiarkan dropdown pada titik akhir ini:

Playground MiniMax H3 reference-to-video di Atlas Cloud dengan dua gambar referensi dimuat, rasio aspek dibiarkan pada adaptive, dan kesalahan validasi 400 di panel output
MiniMax H3 reference-to-video di Atlas Cloud: kedua gambar referensi dimuat, resolusi 2K, dan Rasio Aspek masih pada default adaptive-nya. Proses kembali 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Atur secara eksplisit dan permintaan yang sama berhasil, begitulah klip di bawah dibuat. Perhatikan juga blurb halaman di atas terbaca "768P/1080P/2K, 5s/10s" sementara skema mengatakan 768P atau 2K dan 4 hingga 15 detik. Percayai skema.
Saya tidak bisa membuat dropdown rasio playground mempertahankan perubahan yang dituliskan dalam tiga kali percobaan, jadi generasi 3 yang berhasil di bawah berasal dari API dengan ratio: "16:9" diatur di badan permintaan. Proses yang gagal tidak dikenakan biaya.

Generasi 3. Posisi kamera baru dari seberang jalan basah, koki yang sama, dan tipe putih animasi di papan tanda tetap sangat tajam saat kamera melayang. Potongan pada 5,29 dtk dan 10,96 dtk.

Perbandingan berdampingan bingkai jangkar asli dan bingkai dari generasi tiga, menunjukkan koki dan papan tanda yang sama 41 detik dan dua kali perpindahan kemudian
Kiri: jangkar Langkah 1. Kanan: generasi 3 pada tanda 41 detik, dua kali perpindahan kemudian. Koki yang sama, bandana yang sama, atasan biru laut yang sama, papan tanda tulisan tangan yang sama, lentera merah yang sama.
Langkah 5: Ukur Panjang Video MiniMax H3 yang Sebenarnya, Lalu Gabung
Dua kebiasaan untuk diakhiri. Pertama, lakukan latihan murah sebelum Anda membeli lima belas detik. Prompt yang sama, duration 4, dan Anda akan tahu apakah model memahami daftar bidikan Anda dengan kira-kira seperempat harga.

Latihan 4 detik dari daftar bidikan yang sama. Diukur pada 107 bingkai, yaitu 4,458 detik, persis seperti yang diprediksi grid. Cukup untuk melihat apakah model memahami adegan sebelum membeli pengambilan penuh.
Kedua, ukur setiap file sebelum Anda memotong, karena tidak ada yang sepanjang yang Anda minta:
bash1# jumlah bingkai nyata dan durasi wadah, bukan durasi x 24 2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1 3 4# gabung potongan keras, tanpa transisi, tanpa re-encode 5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt 6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4 7
Tiga file masing-masing 362 bingkai menghasilkan 1086 bingkai, yang saya ukur pada concat yang sudah jadi: 45,25 detik gambar, bukan 45. Kecil, sampai Anda menggabungkan empat puluh di antaranya.
Variasi: Dialog, Vertikal, dan Latihan 4 Detik
Setelah rantai berfungsi, tiga titik akhir yang sama mencakup sebagian besar dari apa yang sebenarnya diminta orang.
Dialog bidikan dan balik bidikan. Tempatkan kedua sisi percakapan di dalam satu generasi daripada di dua generasi. Sinkronisasi bibir dan latar audio bersifat kontinu dalam satu pekerjaan dan independen antar pekerjaan, jadi percakapan yang terbagi di dua generasi memberi Anda dua nada ruangan yang tidak terkait. Jaga pertukaran di dalam satu klip.

Dua aktor muda sedang bertengkar di pendaratan tangga beton, cahaya jendela keras menyapu mereka, difilmkan di atas satu bahu
Bidikan dan balik bidikan berfungsi, selama kedua sudut berada di dalam generasi yang sama.
Vertikal. Pada image-to-video Anda tidak mengatur rasio, Anda mengatur bingkai pertama. Hasilkan jangkar yang tinggi dan adaptive akan mengikutinya. Salah satu klip yang saya ukur kembali pada 1280x2276 dengan jumlah bingkai 243 yang sama dengan saudara 16:9-nya, jadi grid bingkai tidak peduli dengan rasio aspek Anda.
Latihan 4 detik sebagai praktik standar. Pada $0,14 per detik, empat detik adalah $0,56 dibandingkan $2,10 untuk pengambilan penuh. Pada build sembilan bidikan, melatih setiap generasi sebelum berkomitmen menghabiskan biaya lebih murah daripada satu pekerjaan 15 detik yang terbuang.
Di mana batasnya benar-benar menggigit. Apa pun yang membutuhkan penampilan tak terputus lebih lama dari lima belas detik. Monolog 30 detik yang berkelanjutan bukanlah masalah rantai, ini adalah masalah sinkronisasi bibir di seluruh sambungan, dan tidak ada disiplin prompt yang bisa memperbaikinya.
Berapa Biaya 45 Detik Panjang Video MiniMax H3
Pada $0,14 per detik, generasi 15 detik penuh adalah $2,10. Itu satu-satunya angka yang Anda butuhkan; yang lainnya hanyalah perkalian. Kolom yang menarik adalah yang terakhir.
| Panjang target | Generasi pada 15 dtk | Biaya garis lurus | Realistis pada tingkat penyimpanan 1-dari-3 | Bidikan yang dikirimkan | Biaya per bidikan |
|---|---|---|---|---|---|
| 15 dtk | 1 | $2,10 | $6,30 | 3 | $0,70 |
| 45 dtk (build ini) | 3 | $6,30 | $18,90 | 9 | $0,70 |
| 60 dtk | 4 | $8,40 | $25,20 | 12 | $0,70 |
| 3 menit | 12 | $25,20 | $75,60 | 36 | $0,70 |
| 10 menit | 40 | $84,00 | $252,00 | 120 | $0,70 |
Baca kolom per bidikan dan kepanikan tentang batas sebagian besar menguap. Merencanakan satu generasi per bidikan menempatkan Anda pada $2,10 per bidikan. Mengemas tiga bidikan ke dalam setiap generasi menempatkan Anda pada $0,70. Model yang sama, batas lima belas detik yang sama, sepertiga dari faktur.
Kolom tingkat penyimpanan adalah yang dilupakan orang. Tidak ada yang dapat digunakan yang kembali pada percobaan pertama setiap saat, dan rencana yang menganggapnya akan terjadi adalah rencana yang kehabisan anggaran pada menit kedua.
Untuk konteks di mana batas itu berada dibandingkan dengan yang lainnya di katalog, semua ini terkini per 4 Agustus 2026:
| Model | Generasi tunggal maks | Terkemuka | Tarif terdaftar |
|---|---|---|---|
| minimax/h3 | 4 hingga 15 dtk | 768P atau 2K, audio stereo asli | $0,14 / dtk |
| bytedance/seedance-2.0 | 4 hingga 15 dtk, atau -1 untuk otomatis | 480p hingga 4K asli | $0,112 / dtk |
| kwaivgi/kling-v3.0-pro | 3 hingga 15 dtk | Memiliki flag multi_shot eksplisit dengan prompt per bidikan | $0,095 / dtk, diskon 15% |
| alibaba/wan-2.7 | 2 hingga 15 dtk | Lantai terluas, 720P atau 1080P | $0,10 / dtk |
| google/veo3.1 | Hanya 4, 6 atau 8 dtk | Tidak ada opsi 15 detik sama sekali | $0,20 / dtk |
| alibaba/wan-2.5/video-extend | menambah 5 hingga 10 dtk | Memperluas file yang ada daripada menghasilkan yang baru | $0,052 / dtk |
Dua kesimpulan. Lima belas detik H3 berada di puncak generasi saat ini, bukan di belakangnya, dan Veo 3.1 maksimal pada delapan. Dan jika yang Anda butuhkan benar-benar satu file panjang dari satu titik akhir, model ekstensi khusus ada, tetapi mengganti model di tengah rantai berarti mengganti wajah.
Satu Catatan Jujur tentang Audio, Bobot, dan Panjang Video MiniMax H3
Tiga peringatan, tidak ada yang mengubah batas.
Audio tidak terbawa antar generasi. Setiap pekerjaan menyusun latar stereo sendiri dari awal. Tiga klip yang dirantai berarti tiga latar hujan yang tidak terkait, dan Anda akan mendengar perubahannya bahkan ketika gambar cocok dengan sempurna. Dua perbaikan: tulis klausa ambien secara identik di setiap prompt sehingga latar mendekati, atau diamkan potongan yang digabung dan letakkan satu trek kontinu di bawahnya. Untuk dialog, jaga pertukaran di dalam satu generasi.

Beberapa fragmen bentuk gelombang audio pendek terpisah dengan celah terlihat di sebelah kiri, satu bentuk gelombang kontinu tunggal di sebelah kanan, dengan latar belakang pucat yang seragam
Kiri: apa yang sebenarnya diberikan oleh rantai kepada Anda. Kanan: apa yang harus Anda bangun di bawahnya.
Hosting mandiri tidak membuka kunci klip yang lebih panjang. Bobot terbuka dirilis pada 2 Agustus 2026 (Hugging Face, Agustus 2026), dan menjalankannya secara lokal memberi Anda tepi pendek 768 piksel yang dibulatkan ke kelipatan 32, sesuai catatan pengaturan ComfyUI. Grid 17 bingkai dan batas 15 detik adalah sama. Lisensi komunitas juga saat ini tidak mencakup UE, Inggris, Korea, atau AS, jadi API adalah rute praktis untuk sebagian besar tim.
Model dapat diam-diam menulis ulang Anda. Saya pernah mengalami H3 mengembalikan completed pada pekerjaan di mana ia secara diam-diam menjatuhkan elemen yang saya minta. Ambil bingkai dari setiap klip dan lihat sebelum Anda menggabungkan. Pada rantai sembilan bidikan, satu klip yang tidak diawasi adalah satu sambungan yang terbuang.
Pertanyaan yang Sering Diajukan
Berapa panjang video MiniMax H3 maksimum?
Lima belas detik. Parameter duration adalah enum bilangan bulat dari 4 hingga 15 dengan default 8, jadi 16 ditolak dan 7,5 bukan nilai yang valid. Setiap klip adalah 24 FPS hingga 2K asli dengan audio stereo yang dihasilkan bersama gambar.
Bisakah MiniMax H3 menghasilkan video yang lebih panjang dari 15 detik?
Tidak dalam satu generasi, dan API tidak memiliki parameter extend. Anda melewati 15 detik dengan merantai: ambil bingkai terakhir dari satu klip sebagai bingkai pertama klip berikutnya, gunakan reference-to-video saat Anda membutuhkan sudut kamera baru, lalu gabungkan dengan potongan keras. Beberapa antarmuka pengguna konsumen melapisi fitur ekstensi mereka sendiri di atas H3 untuk mencapai sekitar 30 detik, tetapi itu adalah produk yang melakukan penggabungan, bukan model yang menghasilkan lebih lama.
Mengapa klip MiniMax H3 15 detik saya sebenarnya 15,08 detik?
Karena durasi terpaku ke atas ke grid 17 bingkai. Meminta 15 detik mengembalikan 362 bingkai, yaitu 17x21+5, dan pada 24 FPS itu adalah 15,083 detik. Meminta 10 mengembalikan 243 bingkai, atau 10,125 detik. Hanya duration: 8 yang tepat pada satu detik penuh, tepatnya 192 bingkai. Jika suntingan Anda akurat bingkai, ukur setiap file daripada menghitung durasi x 24.
Bisakah saya menempatkan beberapa bidikan di dalam satu generasi MiniMax H3?
Ya, dan itu adalah penghematan tunggal terbesar yang tersedia. Tulis bidikan dengan kode waktu eksplisit ke dalam prompt dengan kata literal CUT TO, dan tambahkan klausa kontinuitas yang menyebutkan apa yang harus bertahan dari potongan. Saya mengukur sepuluh potongan bersih di dalam satu generasi 15 detik nyata. Tiga bidikan per generasi nyaman dan andal, yang mengubah klip $2,10 menjadi tiga bidikan $0,70.
Apakah panjang video MiniMax H3 yang lebih pendek lebih murah?
Ya, secara linear. Penagihan per detik pada $0,14, jadi latihan 4 detik berjalan $0,56 dibandingkan $2,10 untuk pengambilan 15 detik penuh. Resolusi adalah cerita yang berbeda: 768P dan 2K berada di bawah satu tarif yang terdaftar di katalog, jadi menurunkan resolusi tidak menghemat apa pun. Perpendek klip, bukan piksel.
Berapa banyak klip MiniMax H3 yang saya butuhkan untuk video satu menit?
Empat, jika Anda mengisi semua lima belas detik setiap kali. Tapi hitung dalam bidikan: empat generasi dengan tiga bidikan masing-masing memberi Anda dua belas bidikan cakupan, yang merupakan jumlah normal untuk iklan satu menit. Kemudian kalikan anggaran Anda dengan kira-kira tiga untuk memperhitungkan pengambilan yang Anda buang.






