Seedance 2.5 Kini Tersedia — Hadir Pertama di Atlas Cloud

MiniMax H3 Panjang Video Adalah 15 Detik. Saya Menghitung Sepuluh Potongan di Dalam Salah Satunya.

Durasi video MiniMax H3 berjalan dari 4 hingga 15 detik penuh pada 24 FPS. Lihat apa yang sebenarnya Anda dapatkan bingkai per bingkai, berapa banyak potongan yang muat dalam satu klip, dan cara merangkai 45s.

Setiap orang melakukan hal yang sama di hari pertama. Anda membuka dropdown durasi, melihat angka 15, dan mulai membagi. Film sepuluh menit? Empat puluh generasi. Video penjelasan tiga menit? Dua belas. Lalu Anda melihat angka hasil pembagian itu, menutup tab, dan memutuskan bahwa model ini belum siap untuk sesuatu yang memiliki cerita di dalamnya.

Saya juga melakukan pembagian itu. Lalu saya menjalankan ffmpeg pada sembilan klip H3 asli dan menemukan sesuatu yang membuat seluruh perhitungan itu terlihat konyol.

Salah satu klip tersebut berdurasi 15,10 detik. Di dalamnya, detektor adegan menandai sepuluh potongan bersih. Sepuluh. Pakaian berbeda, pembingkaian berbeda, latar belakang berbeda, kartu tipe bingkai penuh, semuanya di dalam satu generasi yang harganya sama dengan satu generasi. Jika saya merencanakan klip itu seperti yang disiratkan oleh pembagian, satu generasi per bidikan, saya akan membayar sepuluh kali lipat untuk lima belas detik yang sama.

Pembagian adalah kesalahannya. Batasnya bukanlah stopwatch, melainkan wadah, dan hampir tidak ada yang mengisinya.

Urutan seorang pemain skateboard melompati tepian beton di malam hari

Seorang pemain skateboard di tengah trik yang ditangkap sebagai urutan strobo, banyak posisi berbeda yang dibekukan dalam satu bingkai

Satu bingkai, banyak momen. Itulah model mental yang dibujuk oleh dropdown durasi untuk Anda tinggalkan.

Poin-poin penting

  • Parameter duration hanya menerima bilangan bulat dari 4 hingga 15. Default adalah 8. Tidak ada 7,5, dan tidak ada nilai di atas 15.
  • Setiap klip dikembalikan dalam 24 FPS, hingga 2K asli, dengan audio stereo yang dihasilkan dalam proses yang sama dengan gambar.
  • Klip "15 detik" Anda sebenarnya adalah 362 bingkai, yaitu 15,083 detik. Durasi terpaku ke atas ke grid 17 bingkai, dan hanya duration: 8 yang tepat pada satu detik penuh.
  • Satu generasi dapat menampung banyak bidikan. Tulis SHOT 1 / CUT TO ke dalam prompt dan model akan memotong untuk Anda, tanpa biaya tambahan.
  • Tidak ada parameter extend di API. Anda bisa melewati 15 detik dengan merantai: bingkai terakhir ke bingkai pertama berikutnya, gambar referensi untuk mempertahankan tampilan, lalu penggabungan keras (hard concat).

Tonton 45 Detik Panjang Video MiniMax H3, Dibuat dari Tiga Klip

Sebelum teori apa pun, inilah wujud aslinya. Sebuah spot mie stall berdurasi 45 detik yang disebut MIDNIGHT BOWL. Tiga generasi, masing-masing lima belas detik, tiga bidikan di dalam setiap generasi. Sembilan bidikan, satu bagian naratif berkelanjutan, tanpa transisi yang menyembunyikan sambungan.

Potongan 45 detik penuh. Tiga generasi MiniMax H3 yang digabungkan tanpa efek transisi. Koki, celemek, bola lampu, dan papan tanda tulisan tangan bertahan melalui dua kali perpindahan.

Sembilan bingkai video menunjukkan seorang koki menyiapkan dan menyajikan ramen

Sembilan bingkai dari spot MIDNIGHT BOWL yang disusun sebagai lembar kontak 3x3, diberi label SHOT 1 hingga SHOT 9 dengan kode waktu

Sembilan bidikan, tiga generasi. Setiap baris adalah satu generasi, setiap kolom adalah potongan yang dibuat model sendiri. Bidikan 3 dan 4 berirama karena generasi 2 dimulai dari bingkai terakhir generasi 1, itulah yang membuat sambungan tidak terlihat.

Tiga generasi. Bukan sembilan. Kesenjangan itulah inti dari artikel ini.

Saya tidak memotong satu pun secara manual. Saya meminta setiap generasi untuk tiga bidikan dengan kode waktu, dan detektor adegan ffmpeg menemukan potongan di posisi 4,9 detik dan 9,1 detik pada yang pertama, 4,9 detik dan 9,0 detik pada yang kedua, 5,3 detik dan 11,0 detik pada yang ketiga. Sembilan bidikan, tiga tagihan.

Mengapa Panjang Video MiniMax H3 Merusak Rencana Durasi Panjang

Angkanya sendiri baik-baik saja. Lima belas detik di puncak rentang sudah cukup murah hati untuk model generasi ini, dan klipnya 2K dengan suara stereo asli. Yang merusak rencana orang adalah satuan yang mereka gunakan untuk merencanakan.

Jika Anda menghitung anggaran dalam detik, satu menit berarti "empat klip" dan sepuluh menit berarti "empat puluh klip," dan empat puluh klip apa pun adalah mimpi buruk dalam hal kontinuitas. Jika Anda menghitung anggaran dalam bidikan, satu menit berarti empat generasi yang menampung kira-kira dua belas bidikan, yang merupakan jumlah cakupan normal untuk iklan. Model yang sama, batas yang sama, rencana produksi yang sama sekali berbeda.

Jari memegang strip film sepia yang menunjukkan jalan, tangan, dan siluet

Ilustrasi poster datar retro dari satu strip film 35mm di mana tiga bingkai berurutan masing-masing berisi adegan yang sama sekali berbeda

Anggaran dalam bidikan, bukan detik. Satu strip yang ditagih, tiga adegan berbeda di dalamnya.

Ada hal kedua yang merusak rencana durasi panjang, dan itu sama sekali bukan batasnya. Ini adalah sambungannya. Klip individual hampir tidak pernah berantakan di tengah. Mereka berantakan di sambungan, karena setiap generasi menciptakan latar audio sendiri dan sedikit bergeser pada pakaian dan pencahayaan. Rencanakan untuk sambungan dan 45 detik menjadi mudah. Abaikan mereka dan empat klip sempurna tetap terlihat seperti empat klip.

Apa Sebenarnya Panjang Video MiniMax H3: 4 hingga 15 Detik Penuh pada Grid 17 Bingkai

Mulai dengan spesifikasi, karena ada dua angka berbeda yang beredar. Skema API langsung untuk ketiga titik akhir H3 di Atlas Cloud mencantumkan duration sebagai enum yang tepat 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, dengan default 8. Bilangan bulat penuh, tidak ada fraksional, tidak ada yang melewati 15. Liputan peluncuran cocok dengan bacaan itu: output 2K, 4 hingga 15 detik, hanya durasi bilangan bulat (MarkTechPost, Agustus 2026). Postingan peluncuran MiniMax sendiri menggambarkannya sebagai hingga 15 detik pada 2K dengan suara stereo asli (MiniMax, Agustus 2026).

Anda masih akan melihat "5 hingga 15 detik" ditulis di berbagai profil dan quickstart, termasuk beberapa salinan di platform. Perlakukan enum skema sebagai kebenaran. Batas bawahnya adalah 4, dan saya telah menagih klip 4 detik untuk membuktikannya.

Sekarang bagian yang hampir tidak ada yang menyebutkan. Minta 15 detik dan Anda tidak mendapatkan 360 bingkai. Anda mendapatkan 362.

H3 membangun video dalam blok 17 bingkai dan menjepret durasi yang diminta ke atas ke jumlah bingkai 17k + 5 berikutnya pada 24 FPS. Grid tersebut didokumentasikan dalam tutorial H3 resmi ComfyUI (ComfyUI Docs, 2026), dan juga berlaku di sisi API. Saya menghitung bingkai pada sembilan file H3 asli dengan ffmpeg:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

Setiap file 15 detik kembali dengan 362 bingkai. Setiap file 10 detik kembali dengan 243. Tiga generasi baru yang saya jalankan untuk artikel ini kembali dengan 362 juga, dan latihan 4 detik di Langkah 5 kembali dengan 107. Jalankan melalui grid: 362 adalah 17x21+5, 243 adalah 17x14+5, dan 107 adalah 17x6+5. Rumus memprediksi ketiganya dengan tepat, yang merupakan jenis kesepakatan yang membuat saya mempercayai sisa tabel.

durasiBingkai yang dikirimkan (17k+5)Panjang sebenarnya pada 24 FPSTepat pada satu detik penuh?Sumber
41074,458 dtkTidakTerukur
51245,167 dtkTidakGrid
61586,583 dtkTidakGrid
71757,292 dtkTidakGrid
81928,000 dtkYaGrid
92269,417 dtkTidakGrid
1024310,125 dtkTidakTerukur
1127711,542 dtkTidakGrid
1229412,250 dtkTidakGrid
1332813,667 dtkTidakGrid
1434514,375 dtkTidakGrid
1536215,083 dtkTidakTerukur

Tiga hal yang keluar dari tabel itu.

duration: 8 adalah satu-satunya nilai di seluruh rentang yang memberi Anda satu detik penuh yang bersih, dan kebetulan itu adalah default. Itu bukan kebetulan, itu adalah 17x11+5 = 192 = 8 x 24 tepat.

Minta 6 dan Anda mendapatkan 6,583 detik, lebih dari setengah detik gambar gratis. Minta 13 dan Anda mendapatkan 13,667. Grid selalu membulatkan ke atas, tidak pernah ke bawah, jadi Anda tidak pernah kekurangan.

Dan jika Anda memotong sesuai musik atau mencocokkan suntingan yang akurat bingkai, jangan pernah menghitung garis waktu Anda sebagai durasi x 24. Ukur file. Proyek 40 klip yang direncanakan dengan asumsi detik penuh akan meleset hampir empat detik pada akhirnya.

Sepuluh Potongan di Dalam Satu Generasi MiniMax H3 15 Detik

Inilah klip yang saya sebutkan di awal. Satu generasi, 362 bingkai, 15,10 detik di dalam wadah. Ini adalah potongan bertipe kinetic fashion, dan berperilaku seperti video musik yang diedit daripada satu pengambilan.

Close-up mata seorang wanita di belakang teks putih tebal SATU TAMPILAN

Satu generasi MiniMax H3 tunggal. Perubahan pakaian, perubahan pembingkaian, layar terbagi dan kartu tipe bingkai penuh, semuanya di dalam satu pekerjaan 15 detik.

Saya menjalankan detektor adegan ffmpeg di atasnya daripada menghitung dengan mata:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 jeda ditandai, pada 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

Sepuluh di antaranya adalah perubahan bidikan bersih di tiga belas detik pertama. Ekornya adalah kartu judul berkedip di latar hitam, yang meningkatkan jumlah mentah, jadi sepuluh adalah angka konservatif yang jujur. Bagaimanapun, itu bukan satu bidikan, dan bukan tiga.

Sekarang kasus kontrol, karena "H3 selalu memotong klip Anda menjadi beberapa bagian" adalah kegagalan yang berlawanan dan sama salahnya. File berikutnya ini juga merupakan satu generasi 15 detik tunggal, juga 362 bingkai, dan detektor yang sama menemukan tepat nol potongan di dalamnya.

Pandangan orang pertama dari gedung pencakar langit yang runtuh ke jalan kota

Generasi tunggal yang berbeda, 362 bingkai yang sama, nol potongan terdeteksi. Satu gerakan kamera berkelanjutan selama lima belas detik penuh.

Jadi batasnya bukanlah "lima belas detik rekaman." Itu adalah lima belas detik waktu layar yang dapat Anda bagi sesuai keinginan, dari satu pengambilan tanpa putus hingga sepuluh potongan. Anda mengendalikannya dari prompt, dan Anda membayar sama bagaimanapun caranya.

Tiga Titik Akhir di Balik Panjang Video MiniMax H3, dalam Satu Tab

Melewati lima belas detik membutuhkan tiga pekerjaan berbeda: sesuatu untuk membuat bingkai jangkar, sesuatu untuk menganimasikan dan merantai, dan sesuatu untuk menggerakkan kamera tanpa kehilangan subjek. Di Atlas Cloud keempatnya hidup dalam katalog yang sama dengan satu kunci dan satu saldo, yang penting di sini terutama karena rantai di bagian berikutnya menyerahkan file di antara mereka berulang kali.

LangkahModelPekerjaan dalam build iniRentang panjangTarif terdaftar, 4 Agustus 2026
Bingkai jangkaropenai/gpt-image-2/text-to-imageSatu gambar diam yang menentukan keseluruhan tampilant/a$0,1745 untuk menjalankan saya di high
Pembukaan, tanpa gambar diamminimax/h3/text-to-videoLangsung dari prompt ke klip4 hingga 15 dtk, default 8$0,14 / dtk
Generasi 1 dan 2minimax/h3/image-to-videoMenganimasikan bingkai pertama, lalu merantai dari bingkai terakhir4 hingga 15 dtk, default 8$0,14 / dtk
Generasi 3minimax/h3/reference-to-videoPosisi kamera baru, subjek yang sama4 hingga 15 dtk, default 8$0,14 / dtk

Ketiga titik akhir H3 tidak memiliki diskon saat ini, jadi tarifnya adalah tarifnya. Anda dapat mengonfirmasi semuanya di katalog model lengkap.

Tiga perangkap parameter yang perlu diketahui sebelum Anda menulis satu permintaan pun, semuanya diambil dari skema langsung daripada prosa dokumen:

  1. ratio berperilaku berbeda di setiap titik akhir. text-to-video menawarkan enam rasio dan default ke 1:1, yang diam-diam akan memberi Anda klip persegi jika Anda lupa mengaturnya, dan tidak menerima adaptive sama sekali. image-to-video hanya menawarkan adaptive, jadi pembingkaian mengikuti bingkai pertama Anda. reference-to-video adalah satu-satunya yang memiliki set lengkap plus adaptive.
  2. resolution adalah 768P atau 2K, default ke 2K. Kedua tingkatan berada di bawah satu tarif per detik yang terdaftar di katalog, jadi turun ke 768P tidak menghemat uang Anda. Gunakan 2K.
  3. image-to-video juga menerima end_image opsional. Anda dapat menjepit kedua ujung klip, bukan hanya awal. Itu mengubah trik rantai di bawah menjadi sesuatu yang dapat Anda arahkan dari kedua arah.

Cara Mengalahkan Batas Panjang Video MiniMax H3, Langkah demi Langkah

Ini adalah build MIDNIGHT BOWL yang lengkap. Setiap prompt di bawah adalah yang benar-benar saya kirim, salin persis. Total waktu proses adalah tiga generasi H3 ditambah satu gambar diam, dan semuanya dapat direproduksi di tab browser.

Langkah 1: Kunci Tampilan dalam Satu Bingkai Jangkar

Jangan mulai dengan video. Mulailah dengan satu gambar diam yang benar-benar Anda sukai, karena setiap klip dalam rantai akan mewarisi pencahayaan, pakaian, dan petunjuknya. Mendapatkan ini salah itu mahal; melakukannya dengan benar hanya membutuhkan biaya sen.

Model: openai/gpt-image-2/text-to-image. Pengaturan: kualitas tinggi, rasio 16:9.

text
1Gambar diam film, jam 2 pagi di gang sempit Tokyo dengan warung mie. Seorang koki berusia 50 tahun dengan celemek biru laut dan bandana putih mencondongkan tubuh ke atas panci kaldu yang mengepul di belakang meja kayu yang tergores, lengan digulung hingga siku, lengan bawah diterangi oranye panas oleh satu bola lampu gantung. Aspal basah hujan memantulkan papan tanda merah dan hijau; lentera kertas dan papan kayu bertuliskan "MIDNIGHT BOWL" tergantung di atas konter. Uap bergulung melintasi bingkai dari kanan kamera. Difilmkan dengan lensa 35mm pada f/2, kedalaman bidang dangkal, bayangan dalam, lampu utama tungsten hangat melawan malam biru dingin, butiran film halus yang terlihat, tidak ada hamparan teks.
2

Antarmuka generator gambar AI menunjukkan teks prompt dan gambar yang dihasilkan

Playground GPT Image 2 di Atlas Cloud dengan prompt jangkar MIDNIGHT BOWL diisi dan gambar jadi di panel output

GPT Image 2 di Atlas Cloud: kualitas diatur ke tinggi, 16:9, bingkai jangkar dirender di sebelah kanan.

4

Bingkai jangkar MIDNIGHT BOWL: seorang koki dengan celemek biru laut di belakang panci kaldu yang mengepul di bawah satu bola lampu gantung di gang belakang yang hujan

Bingkai jangkar. Semua yang di hilir mewarisi bola lampu, celemek, dan papan tanda ini.

Langkah 2: Tempatkan Tiga Bidikan di Dalam Satu Generasi MiniMax H3 15 Detik

Inilah langkah yang mengubah anggaran. Alih-alih meminta satu lima belas detik berkelanjutan, berikan model daftar bidikan dengan kode waktu eksplisit dan kata-kata CUT TO. Model akan memotong untuk Anda, di dalam satu generasi yang ditagih.

Model: minimax/h3/image-to-video. Pengaturan: resolution 2K, duration 15, ratio adaptive (satu-satunya opsi di sini, pembingkaian mengikuti bingkai pertama Anda), bingkai pertama = gambar diam Langkah 1.

text
1SHOT 1 (0-5dtk): Wide terkunci dari warung. Uap membumbung; koki menyendok kaldu ke dalam mangkuk hitam; hujan menetes dari tepi tenda. SHOT 2 (5-10dtk): CUT TO close-up makro dari sendok yang memecah permukaan kaldu, lemak emas berputar, daun bawang cincang jatuh dalam busur lambat. SHOT 3 (10-15dtk): CUT TO medium shot koki menatap langsung ke lensa, mengelap tangannya di celemek, dan berkata dalam bahasa Jepang dengan senyum lelah: "Ippai, dozo." Dia meletakkan mangkuk di atas konter dan bidikan bertahan di wajahnya.
2Audio: hujan deras di tenda, kaldu mendidih, sendok mengenai tepi panci, kereta api jauh, dengung kota larut malam yang rendah. Satu baris dialog pria Jepang yang jelas, nada ruangan alami, tanpa musik.
3Pertahankan koki, celemek, bandana, bola lampu, dan papan tanda yang sama di ketiga bidikan. Hanya potongan keras, tanpa transisi, tanpa transisi gerakan kamera. Lampu utama tungsten hangat, malam biru dingin, tampilan 35mm, butiran film.
4

Tiga hal yang membuat ini berhasil. Rentang detik eksplisit, string literal CUT TO, dan klausa kontinuitas di bagian bawah yang menyebutkan setiap elemen yang harus bertahan dari potongan. Hapus klausa kontinuitas dan bidikan 3 kembali dengan celemek yang berbeda.

Antarmuka generator video AI menunjukkan pengaturan input dan output video yang selesai

Playground MiniMax H3 image-to-video di Atlas Cloud dengan bingkai jangkar dimuat, durasi 15 dan 2K dipilih, klip jadi diputar di panel output

MiniMax H3 image-to-video di Atlas Cloud: bingkai jangkar dimuat sebagai bingkai pertama, resolusi 2K, klip jadi di sebelah kanan. Perhatikan penggeser Durasi dan harga yang melacaknya. Proses khusus ini membiarkan durasi pada default 8, itulah sebabnya tombol bertuliskan $1,12; pada 15 tertulis $2,10.

Koki menyiapkan makanan di warung jalanan yang mengepul di malam hujan

Generasi 1. Satu pekerjaan yang ditagih, tiga bidikan (potongan diukur pada 4,92 dtk dan 9,13 dtk), satu baris dialog dengan sinkronisasi bibir, 2560x1440 asli, dan audio stereo 32 kHz dalam file yang sama.

Langkah 3: Rantai 15 Detik Berikutnya dari Bingkai Terakhir

Tidak ada parameter extend. Rantai bersifat manual dan sepele: ambil bingkai terakhir dari generasi 1 dan masukkan kembali sebagai bingkai pertama generasi 2.

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

Model: minimax/h3/image-to-video lagi. Pengaturan: bingkai pertama = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.

Disiplin penting di sini adalah apa yang Anda tinggalkan. Jangan deskripsikan koki lagi. Dia sudah ada di piksel yang baru saja Anda serahkan, dan mendeskripsikannya lagi memberi model izin untuk menafsirkannya kembali.

text
1Lanjutkan dari bingkai yang tepat ini, pria yang sama, celemek yang sama, cahaya yang sama. SHOT 1 (0-5dtk): Dia mendorong mangkuk melintasi konter dengan kedua tangan ke arah kamera. SHOT 2 (5-10dtk): CUT TO over-the-shoulder dari tangan pelanggan yang mengangkat sumpit kayu dan membelahnya, ujung lengan jas hujan abu-abu basah terlihat. SHOT 3 (10-15dtk): CUT TO makro ekstrem tarikan mie, uap melengkung melewati lensa, kaldu menetes kembali ke mangkuk.
2Audio: hujan berkelanjutan dan mendidih dibawa dari sebelumnya, keramik di kayu, sumpit patah, suara menyeruput, kereta api jauh yang sama. Tanpa musik, tanpa narasi.
3Hanya potongan keras. Lampu utama tungsten yang sama dari bola lampu gantung, malam biru dingin yang sama di belakang, kedalaman bidang dangkal 35mm dan butiran film yang sama.
4

Koki tersenyum dengan bandana menyajikan semangkuk makanan yang mengepul

Generasi 2, dimulai dari bingkai terakhir generasi 1. Koki yang sama, pola bandana yang sama, atasan biru laut yang sama, dapur yang sama di belakangnya. Tiga bidikan lagi, potongan pada 4,92 dtk dan 9,04 dtk.

Koki tersenyum memakai bandana menyajikan mangkuk hitam mengepul

Putaran dua detik melintasi sambungan antara generasi satu dan generasi dua

Sambungan itu sendiri: detik terakhir generasi 1 ke detik pertama generasi 2. Tidak ada efek transisi, hanya potongan.

Langkah 4: Pindahkan Kamera dengan Reference-to-Video

Rantai bingkai terakhir memiliki satu keterbatasan bawaan: ia selalu melanjutkan dari tempat kamera sebelumnya berdiri. Untuk melompat ke sudut yang benar-benar baru sambil mempertahankan subjek yang sama, ganti titik akhir.

Model: minimax/h3/reference-to-video. Pengaturan: refers = bingkai jangkar Langkah 1 ditambah bingkai terakhir generasi 2, resolution 2K, duration 15, dan atur ratio secara eksplisit ke 16:9 di sini daripada membiarkannya pada adaptive. Titik akhir ini menerima hingga sembilan gambar referensi, tiga video referensi, dan tiga klip audio, dengan video referensi dibatasi maksimal 15 detik total (MarkTechPost, Agustus 2026).

text
1Wide low-angle shot dari tengah jalan basah melihat kembali ke warung mie yang sama, koki yang sama di dalamnya. SHOT 1 (0-6dtk): Hujan mengalir melintasi bingkai; dua pelanggan siluet duduk di konter; koki bekerja di bawah satu bola lampu. SHOT 2 (6-11dtk): CUT TO papan tanda kayu bertuliskan tangan saat tipe putih kinetik dianimasikan di sampingnya, huruf demi huruf: "MIDNIGHT BOWL - BUKA SAMPAI JAM 4 PAGI". Tipe tetap tajam dan terkunci pada papan tanda saat kamera melayang. SHOT 3 (11-15dtk): CUT BACK ke wide saat koki mendongak, mengangkat satu tangan dalam lambaian kecil, dan bola lampu berkedip sekali.
2Audio: hujan, ambien jalan, skuter lewat, kereta api samar yang sama, satu pukulan rendah saat tipe mendarat. Tanpa dialog.
3Koki, celemek, dan bandana yang sama, papan tanda dan warna lentera yang sama dengan gambar referensi. Hanya potongan keras, butiran film, 35mm, tungsten hangat melawan biru dingin.
4

Instruksi ratio itu bukan paranoia. Inilah yang terjadi ketika Anda membiarkan dropdown pada titik akhir ini:

Antarmuka generator video AI menampilkan pesan kesalahan validasi input

Playground MiniMax H3 reference-to-video di Atlas Cloud dengan dua gambar referensi dimuat, rasio aspek dibiarkan pada adaptive, dan kesalahan validasi 400 di panel output

MiniMax H3 reference-to-video di Atlas Cloud: kedua gambar referensi dimuat, resolusi 2K, dan Rasio Aspek masih pada default adaptive-nya. Proses kembali 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Atur secara eksplisit dan permintaan yang sama berhasil, begitulah klip di bawah dibuat. Perhatikan juga blurb halaman di atas terbaca "768P/1080P/2K, 5s/10s" sementara skema mengatakan 768P atau 2K dan 4 hingga 15 detik. Percayai skema.

Saya tidak bisa membuat dropdown rasio playground mempertahankan perubahan yang dituliskan dalam tiga kali percobaan, jadi generasi 3 yang berhasil di bawah berasal dari API dengan ratio: "16:9" diatur di badan permintaan. Proses yang gagal tidak dikenakan biaya.

Koki menyiapkan makanan untuk pelanggan di warung makan malam hujan

Generasi 3. Posisi kamera baru dari seberang jalan basah, koki yang sama, dan tipe putih animasi di papan tanda tetap sangat tajam saat kamera melayang. Potongan pada 5,29 dtk dan 10,96 dtk.

Perbandingan berdampingan warung makan Jepang di malam hari

Perbandingan berdampingan bingkai jangkar asli dan bingkai dari generasi tiga, menunjukkan koki dan papan tanda yang sama 41 detik dan dua kali perpindahan kemudian

Kiri: jangkar Langkah 1. Kanan: generasi 3 pada tanda 41 detik, dua kali perpindahan kemudian. Koki yang sama, bandana yang sama, atasan biru laut yang sama, papan tanda tulisan tangan yang sama, lentera merah yang sama.

Langkah 5: Ukur Panjang Video MiniMax H3 yang Sebenarnya, Lalu Gabung

Dua kebiasaan untuk diakhiri. Pertama, lakukan latihan murah sebelum Anda membeli lima belas detik. Prompt yang sama, duration 4, dan Anda akan tahu apakah model memahami daftar bidikan Anda dengan kira-kira seperempat harga.

Koki memasak di warung luar ruangan yang mengepul di gang hujan

Latihan 4 detik dari daftar bidikan yang sama. Diukur pada 107 bingkai, yaitu 4,458 detik, persis seperti yang diprediksi grid. Cukup untuk melihat apakah model memahami adegan sebelum membeli pengambilan penuh.

Kedua, ukur setiap file sebelum Anda memotong, karena tidak ada yang sepanjang yang Anda minta:

bash
1# jumlah bingkai nyata dan durasi wadah, bukan durasi x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# gabung potongan keras, tanpa transisi, tanpa re-encode
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

Tiga file masing-masing 362 bingkai menghasilkan 1086 bingkai, yang saya ukur pada concat yang sudah jadi: 45,25 detik gambar, bukan 45. Kecil, sampai Anda menggabungkan empat puluh di antaranya.

Variasi: Dialog, Vertikal, dan Latihan 4 Detik

Setelah rantai berfungsi, tiga titik akhir yang sama mencakup sebagian besar dari apa yang sebenarnya diminta orang.

Dialog bidikan dan balik bidikan. Tempatkan kedua sisi percakapan di dalam satu generasi daripada di dua generasi. Sinkronisasi bibir dan latar audio bersifat kontinu dalam satu pekerjaan dan independen antar pekerjaan, jadi percakapan yang terbagi di dua generasi memberi Anda dua nada ruangan yang tidak terkait. Jaga pertukaran di dalam satu klip.

Wanita muda menangis menatap seorang pria di tangga

Dua aktor muda sedang bertengkar di pendaratan tangga beton, cahaya jendela keras menyapu mereka, difilmkan di atas satu bahu

Bidikan dan balik bidikan berfungsi, selama kedua sudut berada di dalam generasi yang sama.

Vertikal. Pada image-to-video Anda tidak mengatur rasio, Anda mengatur bingkai pertama. Hasilkan jangkar yang tinggi dan adaptive akan mengikutinya. Salah satu klip yang saya ukur kembali pada 1280x2276 dengan jumlah bingkai 243 yang sama dengan saudara 16:9-nya, jadi grid bingkai tidak peduli dengan rasio aspek Anda.

Latihan 4 detik sebagai praktik standar. Pada $0,14 per detik, empat detik adalah $0,56 dibandingkan $2,10 untuk pengambilan penuh. Pada build sembilan bidikan, melatih setiap generasi sebelum berkomitmen menghabiskan biaya lebih murah daripada satu pekerjaan 15 detik yang terbuang.

Di mana batasnya benar-benar menggigit. Apa pun yang membutuhkan penampilan tak terputus lebih lama dari lima belas detik. Monolog 30 detik yang berkelanjutan bukanlah masalah rantai, ini adalah masalah sinkronisasi bibir di seluruh sambungan, dan tidak ada disiplin prompt yang bisa memperbaikinya.

Berapa Biaya 45 Detik Panjang Video MiniMax H3

Pada $0,14 per detik, generasi 15 detik penuh adalah $2,10. Itu satu-satunya angka yang Anda butuhkan; yang lainnya hanyalah perkalian. Kolom yang menarik adalah yang terakhir.

Panjang targetGenerasi pada 15 dtkBiaya garis lurusRealistis pada tingkat penyimpanan 1-dari-3Bidikan yang dikirimkanBiaya per bidikan
15 dtk1$2,10$6,303$0,70
45 dtk (build ini)3$6,30$18,909$0,70
60 dtk4$8,40$25,2012$0,70
3 menit12$25,20$75,6036$0,70
10 menit40$84,00$252,00120$0,70

Baca kolom per bidikan dan kepanikan tentang batas sebagian besar menguap. Merencanakan satu generasi per bidikan menempatkan Anda pada $2,10 per bidikan. Mengemas tiga bidikan ke dalam setiap generasi menempatkan Anda pada $0,70. Model yang sama, batas lima belas detik yang sama, sepertiga dari faktur.

Kolom tingkat penyimpanan adalah yang dilupakan orang. Tidak ada yang dapat digunakan yang kembali pada percobaan pertama setiap saat, dan rencana yang menganggapnya akan terjadi adalah rencana yang kehabisan anggaran pada menit kedua.

Untuk konteks di mana batas itu berada dibandingkan dengan yang lainnya di katalog, semua ini terkini per 4 Agustus 2026:

ModelGenerasi tunggal maksTerkemukaTarif terdaftar
minimax/h34 hingga 15 dtk768P atau 2K, audio stereo asli$0,14 / dtk
bytedance/seedance-2.04 hingga 15 dtk, atau -1 untuk otomatis480p hingga 4K asli$0,112 / dtk
kwaivgi/kling-v3.0-pro3 hingga 15 dtkMemiliki flag multi_shot eksplisit dengan prompt per bidikan$0,095 / dtk, diskon 15%
alibaba/wan-2.72 hingga 15 dtkLantai terluas, 720P atau 1080P$0,10 / dtk
google/veo3.1Hanya 4, 6 atau 8 dtkTidak ada opsi 15 detik sama sekali$0,20 / dtk
alibaba/wan-2.5/video-extendmenambah 5 hingga 10 dtkMemperluas file yang ada daripada menghasilkan yang baru$0,052 / dtk

Dua kesimpulan. Lima belas detik H3 berada di puncak generasi saat ini, bukan di belakangnya, dan Veo 3.1 maksimal pada delapan. Dan jika yang Anda butuhkan benar-benar satu file panjang dari satu titik akhir, model ekstensi khusus ada, tetapi mengganti model di tengah rantai berarti mengganti wajah.

Satu Catatan Jujur tentang Audio, Bobot, dan Panjang Video MiniMax H3

Tiga peringatan, tidak ada yang mengubah batas.

Audio tidak terbawa antar generasi. Setiap pekerjaan menyusun latar stereo sendiri dari awal. Tiga klip yang dirantai berarti tiga latar hujan yang tidak terkait, dan Anda akan mendengar perubahannya bahkan ketika gambar cocok dengan sempurna. Dua perbaikan: tulis klausa ambien secara identik di setiap prompt sehingga latar mendekati, atau diamkan potongan yang digabung dan letakkan satu trek kontinu di bawahnya. Untuk dialog, jaga pertukaran di dalam satu generasi.

Enam gelombang suara hitam kecil di sebelah satu gelombang suara oranye panjang

Beberapa fragmen bentuk gelombang audio pendek terpisah dengan celah terlihat di sebelah kiri, satu bentuk gelombang kontinu tunggal di sebelah kanan, dengan latar belakang pucat yang seragam

Kiri: apa yang sebenarnya diberikan oleh rantai kepada Anda. Kanan: apa yang harus Anda bangun di bawahnya.

Hosting mandiri tidak membuka kunci klip yang lebih panjang. Bobot terbuka dirilis pada 2 Agustus 2026 (Hugging Face, Agustus 2026), dan menjalankannya secara lokal memberi Anda tepi pendek 768 piksel yang dibulatkan ke kelipatan 32, sesuai catatan pengaturan ComfyUI. Grid 17 bingkai dan batas 15 detik adalah sama. Lisensi komunitas juga saat ini tidak mencakup UE, Inggris, Korea, atau AS, jadi API adalah rute praktis untuk sebagian besar tim.

Model dapat diam-diam menulis ulang Anda. Saya pernah mengalami H3 mengembalikan completed pada pekerjaan di mana ia secara diam-diam menjatuhkan elemen yang saya minta. Ambil bingkai dari setiap klip dan lihat sebelum Anda menggabungkan. Pada rantai sembilan bidikan, satu klip yang tidak diawasi adalah satu sambungan yang terbuang.

Pertanyaan yang Sering Diajukan

Berapa panjang video MiniMax H3 maksimum?

Lima belas detik. Parameter duration adalah enum bilangan bulat dari 4 hingga 15 dengan default 8, jadi 16 ditolak dan 7,5 bukan nilai yang valid. Setiap klip adalah 24 FPS hingga 2K asli dengan audio stereo yang dihasilkan bersama gambar.

Bisakah MiniMax H3 menghasilkan video yang lebih panjang dari 15 detik?

Tidak dalam satu generasi, dan API tidak memiliki parameter extend. Anda melewati 15 detik dengan merantai: ambil bingkai terakhir dari satu klip sebagai bingkai pertama klip berikutnya, gunakan reference-to-video saat Anda membutuhkan sudut kamera baru, lalu gabungkan dengan potongan keras. Beberapa antarmuka pengguna konsumen melapisi fitur ekstensi mereka sendiri di atas H3 untuk mencapai sekitar 30 detik, tetapi itu adalah produk yang melakukan penggabungan, bukan model yang menghasilkan lebih lama.

Mengapa klip MiniMax H3 15 detik saya sebenarnya 15,08 detik?

Karena durasi terpaku ke atas ke grid 17 bingkai. Meminta 15 detik mengembalikan 362 bingkai, yaitu 17x21+5, dan pada 24 FPS itu adalah 15,083 detik. Meminta 10 mengembalikan 243 bingkai, atau 10,125 detik. Hanya duration: 8 yang tepat pada satu detik penuh, tepatnya 192 bingkai. Jika suntingan Anda akurat bingkai, ukur setiap file daripada menghitung durasi x 24.

Bisakah saya menempatkan beberapa bidikan di dalam satu generasi MiniMax H3?

Ya, dan itu adalah penghematan tunggal terbesar yang tersedia. Tulis bidikan dengan kode waktu eksplisit ke dalam prompt dengan kata literal CUT TO, dan tambahkan klausa kontinuitas yang menyebutkan apa yang harus bertahan dari potongan. Saya mengukur sepuluh potongan bersih di dalam satu generasi 15 detik nyata. Tiga bidikan per generasi nyaman dan andal, yang mengubah klip $2,10 menjadi tiga bidikan $0,70.

Apakah panjang video MiniMax H3 yang lebih pendek lebih murah?

Ya, secara linear. Penagihan per detik pada $0,14, jadi latihan 4 detik berjalan $0,56 dibandingkan $2,10 untuk pengambilan 15 detik penuh. Resolusi adalah cerita yang berbeda: 768P dan 2K berada di bawah satu tarif yang terdaftar di katalog, jadi menurunkan resolusi tidak menghemat apa pun. Perpendek klip, bukan piksel.

Berapa banyak klip MiniMax H3 yang saya butuhkan untuk video satu menit?

Empat, jika Anda mengisi semua lima belas detik setiap kali. Tapi hitung dalam bidikan: empat generasi dengan tiga bidikan masing-masing memberi Anda dua belas bidikan cakupan, yang merupakan jumlah normal untuk iklan satu menit. Kemudian kalikan anggaran Anda dengan kira-kira tiga untuk memperhitungkan pengambilan yang Anda buang.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model