Độ dài video MiniMax H3 là 15 giây. Tôi đếm được mười lần cắt trong một trong số đó.

Độ dài video MiniMax H3 chạy từ 4 đến 15 giây nguyên ở tốc độ 24 FPS. Xem những gì bạn thực sự nhận được từng khung hình một, bao nhiêu cảnh cắt vừa vặn trong một clip, và cách ghép nối 45 giây.

Mọi người đều làm điều tương tự vào ngày đầu tiên. Bạn mở menu thả xuống duration, thấy 15, và bắt đầu chia. Phim mười phút? Bốn mươi thế hệ. Video giải thích ba phút? Mười hai. Sau đó, bạn nhìn vào con số mà phép chia tạo ra, đóng tab, và quyết định rằng mô hình chưa sẵn sàng cho bất cứ thứ gì có cốt truyện.

Tôi cũng đã thực hiện phép chia. Sau đó, tôi chạy ffmpeg trên chín clip H3 thực tế và tìm thấy điều gì đó khiến toàn bộ phép tính trông thật ngớ ngẩn.

Một trong những clip đó dài 15,10 giây. Bên trong nó, bộ phát hiện cảnh đánh dấu mười đường cắt rõ ràng. Mười. Trang phục khác, khung hình khác, phông nền khác, thẻ kiểu toàn màn hình, tất cả đều nằm trong một thế hệ có giá bằng một thế hệ. Nếu tôi đã lên kế hoạch cho clip đó theo cách phép chia ngụ ý, một thế hệ cho một cảnh quay, tôi đã phải trả gấp mười lần cho cùng mười lăm giây đó.

Phép chia là sai lầm. Giới hạn không phải là đồng hồ bấm giờ, nó là một thùng chứa, và hầu như không ai lấp đầy nó.

Trình tự một người trượt ván nhảy qua một mảng bê tông vào ban đêm

Một người trượt ván đang thực hiện pha nguy hiểm được ghi lại dưới dạng chuỗi nhấp nháy, nhiều vị trí riêng biệt bị đóng băng trong một khung hình duy nhất

Một khung hình, nhiều khoảnh khắc. Đó là mô hình tinh thần mà menu thả xuống duration đã thuyết phục bạn từ bỏ.

Những điểm chính

  • Tham số duration chỉ chấp nhận số nguyên từ 4 đến 15. Mặc định là 8. Không có 7,5 và không có giá trị nào trên 15.
  • Mọi clip đều được trả về ở 24 FPS, lên tới 2K gốc, với âm thanh nổi được tạo cùng lúc với hình ảnh.
  • Clip "15 giây" của bạn thực sự có 362 khung hình, tức là 15,083 giây. Thời lượng được làm tròn lên theo lưới 17 khung hình và chỉ có duration: 8 mới rơi vào một giây tròn.
  • Một thế hệ có thể chứa nhiều cảnh quay. Viết SHOT 1 / CUT TO vào prompt và mô hình sẽ tự động cắt cho bạn mà không mất thêm chi phí.
  • Không có tham số extend trong API. Bạn vượt quá 15 giây bằng cách xâu chuỗi: khung hình cuối vào khung hình đầu tiên tiếp theo, hình ảnh tham chiếu để giữ phong cách, sau đó nối cứng.

Xem 45 Giây Chiều Dài Video MiniMax H3, Được Xây Dựng Từ Ba Clip

Trước bất kỳ lý thuyết nào, đây là sản phẩm thực tế. Một quảng cáo bán mì kéo dài 45 giây có tên MIDNIGHT BOWL. Ba thế hệ, mỗi thế hệ mười lăm giây, ba cảnh quay bên trong mỗi thế hệ. Chín cảnh quay, một câu chuyện liên tục, không có hiệu ứng hòa tan che giấu các mối nối.

Đoạn cắt hoàn chỉnh 45 giây. Ba thế hệ MiniMax H3 được nối với nhau không có hiệu ứng chuyển tiếp. Đầu bếp, tạp dề, bóng đèn và biển hiệu vẽ tay vẫn tồn tại qua hai lần chuyển giao.

Chín khung hình video cho thấy một đầu bếp đang chuẩn bị và phục vụ mì ramen

Chín khung hình từ quảng cáo MIDNIGHT BOWL được sắp xếp dưới dạng bảng liên hệ 3x3, được gắn nhãn SHOT 1 đến SHOT 9 với mã thời gian

Chín cảnh quay, ba thế hệ. Mỗi hàng là một thế hệ, mỗi cột là một đường cắt mà mô hình tự thực hiện. Cảnh 3 và 4 trùng khớp vì thế hệ 2 bắt đầu từ khung hình cuối cùng của thế hệ 1, đó chính xác là điều làm cho đường nối trở nên vô hình.

Ba thế hệ. Không phải chín. Khoảng cách đó là toàn bộ mục đích của bài viết này.

Tôi không tự tay cắt bất kỳ phần nào trong số đó. Tôi yêu cầu mỗi thế hệ tạo ba cảnh quay có mã thời gian, và bộ phát hiện cảnh của ffmpeg đã tìm thấy các đường cắt ở 4,9s và 9,1s trong thế hệ đầu tiên, 4,9s và 9,0s trong thế hệ thứ hai, 5,3s và 11,0s trong thế hệ thứ ba. Chín cảnh quay, ba hóa đơn.

Tại Sao Chiều Dài Video MiniMax H3 Lại Phá Hỏng Kế Hoạch Dài Hạn

Bản thân con số này là ổn. Mười lăm giây ở đầu dải là hào phóng đối với thế hệ mô hình này, và các clip là 2K với âm thanh nổi thực tế đi kèm. Điều làm mọi người thất vọng là đơn vị họ lập kế hoạch.

Nếu bạn tính toán theo giây, một đoạn video một phút là "bốn clip" và một đoạn mười phút là "bốn mươi clip", và bốn mươi clip bất kỳ thứ gì cũng là một cơn ác mộng về công việc duy trì tính liên tục. Nếu bạn tính toán theo cảnh quay, một đoạn video một phút là bốn thế hệ chứa khoảng mười hai cảnh quay, đó là một lượng cảnh quay bình thường cho một quảng cáo thương mại. Cùng một mô hình, cùng một giới hạn, một kế hoạch sản xuất hoàn toàn khác.

Những ngón tay cầm một cuộn phim màu nâu đất hiện ra đường phố, bàn tay, và hình bóng

Minh họa áp phích phẳng phong cách retro của một cuộn phim 35mm trong đó ba khung hình liên tiếp mỗi khung hình chứa một cảnh hoàn toàn khác nhau

Lập ngân sách theo cảnh quay, không phải theo giây. Một cuộn phim được thanh toán, ba cảnh khác nhau bên trong nó.

Có một điều thứ hai phá hỏng các kế hoạch dài hạn, và hoàn toàn không phải là giới hạn. Đó là các đường nối. Các clip riêng lẻ hầu như không bao giờ hỏng ở giữa. Chúng hỏng ở các điểm nối, bởi vì mỗi thế hệ tự tạo ra nền âm thanh riêng và lệch nhẹ về trang phục và ánh sáng. Lập kế hoạch cho các đường nối và 45 giây là dễ dàng. Bỏ qua chúng và bốn clip hoàn hảo vẫn trông giống như bốn clip.

Chiều dài video MiniMax H3 thực sự là gì: 4 đến 15 giây tròn trên lưới 17 khung hình

Bắt đầu với thông số kỹ thuật, vì có hai con số khác nhau đang được lưu hành. Lược đồ API trực tiếp cho tất cả ba điểm cuối H3 trên Atlas Cloud liệt kê duration dưới dạng enum của chính xác 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, với mặc định là 8. Số nguyên, không có phân số, không có gì quá 15. Các bài báo ra mắt cũng phù hợp với cách đọc đó: đầu ra 2K, 4 đến 15 giây, chỉ thời lượng số nguyên (MarkTechPost, tháng 8 năm 2026). Bài đăng ra mắt của chính MiniMax mô tả nó lên tới 15 giây ở 2K với âm thanh nổi gốc (MiniMax, tháng 8 năm 2026).

Bạn vẫn sẽ thấy "5 đến 15 giây" được viết trong nhiều phần giới thiệu hồ sơ và hướng dẫn nhanh khác nhau, bao gồm cả một số bản sao trên nền tảng. Hãy coi enum lược đồ là sự thật. Mức tối thiểu là 4, và tôi đã xuất hóa đơn cho các clip 4 giây để chứng minh điều đó.

Bây giờ là phần hầu như không ai đề cập đến. Yêu cầu 15 giây và bạn không nhận được 360 khung hình. Bạn nhận được 362.

H3 xây dựng video trong các khối 17 khung hình và chụp thời lượng bạn yêu cầu lên đến số lượng khung hình 17k + 5 tiếp theo ở 24 FPS. Lưới đó được ghi lại trong hướng dẫn H3 chính thức của ComfyUI (Tài liệu ComfyUI, 2026) và nó cũng đúng ở phía API. Tôi đã đếm khung hình trên chín tệp H3 thực tế bằng ffmpeg:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

Mọi tệp 15 giây đều trả về 362 khung hình. Mọi tệp 10 giây đều trả về 243. Ba thế hệ mới tôi chạy cho bài viết này cũng trả về 362, và bản diễn tập 4 giây trong Bước 5 trả về 107. Chạy chúng qua lưới: 362 là 17x21+5, 243 là 17x14+5, và 107 là 17x6+5. Công thức dự đoán chính xác cả ba, đó là loại thống nhất khiến tôi tin tưởng phần còn lại của bảng.

durationSố khung hình được giao (17k+5)Chiều dài thực tế ở 24 FPSRơi vào một giây tròn?Nguồn
41074,458 sKhôngĐo lường
51245,167 sKhôngLưới
61586,583 sKhôngLưới
71757,292 sKhôngLưới
81928,000 sLưới
92269,417 sKhôngLưới
1024310,125 sKhôngĐo lường
1127711,542 sKhôngLưới
1229412,250 sKhôngLưới
1332813,667 sKhôngLưới
1434514,375 sKhôngLưới
1536215,083 sKhôngĐo lường

Ba điều rút ra từ bảng đó.

duration: 8 là giá trị duy nhất trong toàn bộ phạm vi cho bạn một giây tròn hoàn hảo và nó tình cờ là mặc định. Đó không phải là sự trùng hợp ngẫu nhiên, đó là 17x11+5 = 192 = 8 x 24 chính xác.

Yêu cầu 6 và bạn nhận được 6,583 giây, hơn nửa giây hình ảnh miễn phí. Yêu cầu 13 và bạn nhận được 13,667. Lưới luôn làm tròn lên, không bao giờ làm tròn xuống, vì vậy bạn không bao giờ bị thiếu.

Và nếu bạn đang cắt theo nhạc hoặc khớp với một chỉnh sửa chính xác theo khung hình, đừng bao giờ tính toán dòng thời gian của bạn là duration x 24. Hãy đo tệp. Một dự án 40 clip được lên kế hoạch dựa trên giả định về giây tròn sẽ sai gần bốn giây khi kết thúc.

Mười Đường Cắt Bên Trong Một Thế Hệ MiniMax H3 15 Giây

Đây là clip tôi đã đề cập ở đầu bài. Một thế hệ, 362 khung hình, 15,10 giây trong vùng chứa. Đó là một tác phẩm kiểu chữ động thời trang và nó hoạt động giống như một video âm nhạc đã được chỉnh sửa thay vì một cảnh quay duy nhất.

Cận cảnh mắt phụ nữ sau dòng chữ trắng đậm ONE LOOK

Một thế hệ MiniMax H3 duy nhất. Thay đổi trang phục, thay đổi khung hình, màn hình chia nhỏ và thẻ kiểu toàn màn hình, tất cả đều nằm trong một công việc 15 giây.

Tôi đã chạy bộ phát hiện cảnh của ffmpeg trên nó thay vì đếm bằng mắt:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 điểm ngắt được đánh dấu, tại 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

Mười trong số đó là những thay đổi cảnh sạch sẽ trong mười ba giây đầu tiên. Phần đuôi là một thẻ tiêu đề nhấp nháy trên nền đen, làm tăng số lượng thô, vì vậy mười là con số trung thực bảo thủ. Dù thế nào đi nữa, nó không phải là một cảnh và cũng không phải là ba.

Bây giờ là trường hợp kiểm soát, bởi vì "H3 luôn cắt clip của bạn thành nhiều mảnh" là lỗi ngược lại và cũng sai không kém. Tệp tiếp theo này cũng là một thế hệ 15 giây duy nhất, cũng 362 khung hình và cùng một bộ phát hiện tìm thấy chính xác không có đường cắt nào trong đó.

Góc nhìn thứ nhất về các tòa nhà chọc trời đổ sập xuống một con phố thành phố

Một thế hệ duy nhất khác, cùng 362 khung hình, không có đường cắt nào được phát hiện. Một chuyển động máy quay liên tục trong suốt mười lăm giây.

Vì vậy, giới hạn không phải là "mười lăm giây cảnh quay". Đó là mười lăm giây thời lượng màn hình mà bạn có thể chia nhỏ tùy thích, từ một cảnh quay không gián đoạn đến mười đường cắt. Bạn điều khiển nó từ prompt và bạn trả tiền như nhau cho dù thế nào đi nữa.

Ba Điểm Cuối Đằng Sau Chiều Dài Video MiniMax H3, Trong Một Tab

Để vượt quá mười lăm giây cần ba công việc khác nhau: thứ gì đó để tạo khung hình neo, thứ gì đó để tạo hoạt ảnh và xâu chuỗi, và thứ gì đó để di chuyển máy quay mà không làm mất chủ thể. Trên Atlas Cloud, cả bốn đều nằm trong cùng một danh mục với một khóa và một số dư, điều này quan trọng ở đây chủ yếu vì chuỗi trong phần tiếp theo chuyển các tệp giữa chúng nhiều lần.

BướcMô hìnhCông việc trong bản dựng nàyPhạm vi độ dàiTỷ giá niêm yết, ngày 4 tháng 8 năm 2026
Khung hình neoopenai/gpt-image-2/text-to-imageMột hình ảnh tĩnh xác định toàn bộ phong cáchn/a$0,1745 cho lần chạy của tôi ở mức cao
Mở đầu, không cần ảnh tĩnhminimax/h3/text-to-videoTrực tiếp từ prompt đến clip4 đến 15 s, mặc định 8$0,14 / giây
Thế hệ 1 và 2minimax/h3/image-to-videoTạo hoạt ảnh cho khung hình đầu tiên, sau đó xâu chuỗi từ khung hình cuối cùng4 đến 15 s, mặc định 8$0,14 / giây
Thế hệ 3minimax/h3/reference-to-videoVị trí máy quay mới, cùng chủ thể4 đến 15 s, mặc định 8$0,14 / giây

Cả ba điểm cuối H3 đều không có giảm giá nào vào lúc này, vì vậy tỷ giá là tỷ giá. Bạn có thể xác nhận bất kỳ điều nào trong số đó trên danh mục mô hình đầy đủ.

Ba cạm bẫy tham số đáng biết trước khi bạn viết một yêu cầu duy nhất, tất cả đều lấy từ lược đồ trực tiếp thay vì văn xuôi tài liệu:

  1. ratio hoạt động khác nhau trên mỗi điểm cuối. text-to-video cung cấp sáu tỷ lệ và mặc định là 1:1, tỷ lệ này sẽ âm thầm đưa cho bạn một clip vuông nếu bạn quên đặt nó và nó hoàn toàn không chấp nhận adaptive. image-to-video chỉ cung cấp adaptive, vì vậy khung hình tuân theo khung hình đầu tiên của bạn. reference-to-video là điểm cuối duy nhất có đầy đủ bộ cộng với adaptive.
  2. resolution768P hoặc 2K, mặc định là 2K. Cả hai bậc đều nằm dưới một tỷ lệ trên giây duy nhất được liệt kê trong danh mục, vì vậy việc hạ xuống 768P không giúp bạn tiết kiệm tiền. Sử dụng 2K.
  3. image-to-video cũng nhận một end_image tùy chọn. Bạn có thể ghim cả hai đầu của một clip, không chỉ điểm bắt đầu. Điều đó biến thủ thuật xâu chuỗi bên dưới thành một thứ mà bạn có thể điều khiển từ cả hai hướng.

Cách Vượt Qua Giới Hạn Chiều Dài Video MiniMax H3, Từng Bước Một

Đây là bản dựng MIDNIGHT BOWL đầy đủ. Mọi prompt bên dưới là cái tôi thực sự đã gửi, hãy sao chép chúng nguyên văn. Tổng thời gian chạy là ba thế hệ H3 cộng với một hình ảnh tĩnh và toàn bộ có thể tái tạo trong một tab trình duyệt.

Bước 1: Khóa Phong Cách Trong Một Khung Hình Neo

Đừng bắt đầu với video. Bắt đầu với một hình ảnh tĩnh mà bạn thực sự thích, bởi vì mọi clip trong chuỗi sẽ kế thừa ánh sáng, trang phục và biển hiệu của nó. Sai lầm này rất tốn kém; làm đúng thì chỉ tốn vài xu.

Mô hình: openai/gpt-image-2/text-to-image. Cài đặt: quality high, ratio 16:9.

text
1Film still, 2am at a narrow Tokyo back-alley noodle stall. A 50-year-old chef in a navy apron and white bandana leans over a steaming stockpot behind a scratched wooden counter, sleeves rolled to the elbow, forearms lit hot orange by a single hanging bulb. Rain-slick asphalt reflects red and green signage; paper lanterns and a hand-painted wooden sign reading "MIDNIGHT BOWL" hang above the counter. Steam rolls across the frame from camera right. Shot on a 35mm lens at f/2, shallow depth of field, deep shadows, warm tungsten key against cool blue night, visible fine film grain, no text overlays.
2

Giao diện trình tạo hình ảnh AI hiển thị lời nhắc văn bản và hình ảnh kết quả

Sân chơi GPT Image 2 trên Atlas Cloud với prompt neo MIDNIGHT BOWL đã được điền và hình ảnh hoàn chỉnh trong bảng đầu ra

GPT Image 2 trên Atlas Cloud: chất lượng đặt ở mức cao, 16:9, khung hình neo được hiển thị ở bên phải.

4

Khung hình neo MIDNIGHT BOWL: một đầu bếp mặc tạp dề xanh đậm đứng sau nồi nước dùng bốc hơi dưới một bóng đèn treo duy nhất trong một con hẻm mưa

Khung hình neo. Mọi thứ ở phía dưới đều kế thừa bóng đèn này, tạp dề này và biển hiệu này.

Bước 2: Đặt Ba Cảnh Quay Bên Trong Một Thế Hệ MiniMax H3 15 Giây

Đây là động thái thay đổi ngân sách. Thay vì yêu cầu mười lăm giây liên tục, hãy đưa cho mô hình một danh sách cảnh quay với mã thời gian rõ ràng và các từ CUT TO. Nó sẽ cắt cho bạn, bên trong một thế hệ được thanh toán.

Mô hình: minimax/h3/image-to-video. Cài đặt: resolution 2K, duration 15, ratio adaptive (tùy chọn duy nhất ở đây, khung hình tuân theo khung hình đầu tiên của bạn), khung hình đầu tiên = hình ảnh tĩnh ở Bước 1.

text
1SHOT 1 (0-5s): Locked-off wide of the stall. Steam billows; the chef ladles broth into a black bowl; rain drips off the awning edge. SHOT 2 (5-10s): CUT TO a macro close-up of the ladle breaking the broth surface, golden fat swirling, chopped scallion falling in slow arcs. SHOT 3 (10-15s): CUT TO a medium shot of the chef looking straight into the lens, wiping his hands on the apron, and saying in Japanese with a tired smile: "Ippai, dozo." He sets the bowl down on the counter and the shot holds on his face.
2Audio: heavy rain on the awning, broth simmering, the ladle knocking the pot rim, a distant train, low late-night city hum. One line of clear male Japanese dialogue, natural room tone, no music.
3Keep the same chef, apron, bandana, bulb and signage in all three shots. Hard cuts only, no dissolves, no camera whip transitions. Warm tungsten key, cool blue night, 35mm look, film grain.
4

Ba điều làm cho điều này hoạt động. Phạm vi giây rõ ràng, chuỗi ký tự CUT TO và một mệnh đề liên tục ở cuối nêu tên mọi yếu tố phải tồn tại qua các đường cắt. Bỏ mệnh đề liên tục và cảnh 3 sẽ quay lại với một chiếc tạp dề khác.

Giao diện trình tạo video AI hiển thị cài đặt đầu vào và đầu ra video hoàn chỉnh

Sân chơi MiniMax H3 image-to-video trên Atlas Cloud với khung hình neo được tải, duration 15 và 2K được chọn, clip hoàn chỉnh đang phát trong bảng đầu ra

MiniMax H3 image-to-video trên Atlas Cloud: khung hình neo được tải làm khung hình đầu tiên, độ phân giải 2K, clip hoàn chỉnh ở bên phải. Lưu ý thanh trượt Duration và giá tiền theo dõi nó. Lần chạy cụ thể này để duration ở mặc định 8, đó là lý do tại sao nút hiển thị $1,12; ở mức 15, nó hiển thị $2,10.

Đầu bếp chuẩn bị thức ăn tại một quầy hàng bốc hơi trên đường phố vào một đêm mưa

Thế hệ 1. Một công việc được thanh toán, ba cảnh quay (các đường cắt được đo ở 4,92s và 9,13s), một câu thoại với khớp môi, độ phân giải gốc 2560x1440 và âm thanh nổi 32 kHz trong cùng một tệp.

Bước 3: Xâu Chuỗi 15 Giây Tiếp Theo Từ Khung Hình Cuối Cùng

Không có tham số extend. Chuỗi là thủ công và rất đơn giản: lấy khung hình cuối cùng của thế hệ 1 và đưa nó trở lại làm khung hình đầu tiên của thế hệ 2.

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

Mô hình: minimax/h3/image-to-video một lần nữa. Cài đặt: khung hình đầu tiên = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.

Nguyên tắc quan trọng ở đây là những gì bạn bỏ qua. Đừng mô tả lại đầu bếp. Anh ta đã có trong các pixel bạn vừa đưa ra và việc mô tả lại anh ta sẽ cho phép mô hình diễn giải lại anh ta.

text
1Continue from this exact frame, same man, same apron, same light. SHOT 1 (0-5s): He slides the bowl across the counter with both hands toward camera. SHOT 2 (5-10s): CUT TO over-the-shoulder of a customer's hands lifting wooden chopsticks and splitting them, sleeve cuffs of a wet grey raincoat visible. SHOT 3 (10-15s): CUT TO an extreme macro noodle pull, steam curling up past the lens, broth dripping back into the bowl.
2Audio: continuous rain and simmering carried over from before, ceramic on wood, chopsticks snapping, a slurp, the same distant train. No music, no narration.
3Hard cuts only. Same tungsten key from the hanging bulb, same cool blue night behind, same 35mm shallow depth of field and film grain.
4

Đầu bếp mỉm cười đeo băng đô đang phục vụ một bát thức ăn bốc hơi

Thế hệ 2, bắt đầu từ khung hình cuối cùng của thế hệ 1. Cùng một đầu bếp, cùng một họa tiết băng đô, cùng một áo trên màu xanh đậm, cùng một căn bếp phía sau anh ta. Lại ba cảnh quay, các đường cắt ở 4,92s và 9,04s.

Đầu bếp mỉm cười đeo băng đô phục vụ một cái bát đen bốc hơi

Vòng lặp hai giây qua đường nối giữa thế hệ một và thế hệ hai

Chính đường nối: giây cuối cùng của thế hệ 1 vào giây đầu tiên của thế hệ 2. Không có hiệu ứng chuyển tiếp, chỉ là một đường cắt.

Bước 4: Di Chuyển Máy Quay Với Reference-to-Video

Xâu chuỗi khung hình cuối có một hạn chế cố hữu: nó luôn tiếp tục từ vị trí máy quay trước đó. Để nhảy đến một góc hoàn toàn mới trong khi vẫn giữ nguyên chủ thể, hãy chuyển đổi điểm cuối.

Mô hình: minimax/h3/reference-to-video. Cài đặt: refers = khung hình neo ở Bước 1 cộng với khung hình cuối cùng của thế hệ 2, resolution 2K, duration 15, và đặt ratio rõ ràng thành 16:9 ở đây thay vì để nó ở adaptive. Điểm cuối này chấp nhận tối đa chín hình ảnh tham chiếu, ba video tham chiếu và ba clip âm thanh, với video tham chiếu giới hạn ở tổng cộng 15 giây (MarkTechPost, tháng 8 năm 2026).

text
1Wide low-angle shot from the middle of the wet street looking back at the same noodle stall, the same chef inside it. SHOT 1 (0-6s): Rain streaks through the frame; two silhouetted customers sit at the counter; the chef works under the single bulb. SHOT 2 (6-11s): CUT TO the hand-painted wooden sign as kinetic white type animates on beside it, letter by letter: "MIDNIGHT BOWL - OPEN TILL 4AM". Type stays razor-sharp and locked to the sign as the camera drifts. SHOT 3 (11-15s): CUT BACK to the wide as the chef looks up, raises one hand in a small wave, and the bulb flickers once.
2Audio: rain, street ambience, a scooter passing, the same faint train, a single low sub hit as the type lands. No dialogue.
3Same chef, same apron and bandana, same signage and lantern colours as the reference images. Hard cuts only, film grain, 35mm, warm tungsten against cool blue.
4

Hướng dẫn ratio đó không phải là hoang tưởng. Đây là điều xảy ra khi bạn để menu thả xuống ở điểm cuối này:

Giao diện trình tạo video AI hiển thị thông báo lỗi xác thực đầu vào

Sân chơi MiniMax H3 reference-to-video trên Atlas Cloud với hai hình ảnh tham chiếu được tải, tỷ lệ khung hình để ở chế độ adaptive và lỗi xác thực 400 trong bảng đầu ra

MiniMax H3 reference-to-video trên Atlas Cloud: cả hai hình ảnh tham chiếu đã được tải, độ phân giải 2K và Aspect Ratio vẫn ở mặc định adaptive. Lần chạy trả về 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Đặt nó rõ ràng và cùng một yêu cầu sẽ được thực hiện, đó là cách clip bên dưới được tạo. Lưu ý rằng phần giới thiệu trang ở trên cũng đọc "768P/1080P/2K, 5s/10s" trong khi lược đồ nói 768P hoặc 2K và 4 đến 15 giây. Hãy tin tưởng vào lược đồ.

Tôi không thể làm cho menu thả xuống tỷ lệ của sân chơi giữ một thay đổi theo kịch bản sau ba lần thử, vì vậy thế hệ 3 thành công bên dưới đến từ API với ratio: "16:9" được đặt trong phần thân yêu cầu. Lần chạy thất bại không tốn gì.

Đầu bếp chuẩn bị thức ăn cho khách hàng tại một quầy hàng ăn đêm mưa

Thế hệ 3. Vị trí máy quay hoàn toàn mới từ bên kia đường ướt, cùng một đầu bếp và dòng chữ trắng động trên biển hiệu vẫn sắc nét trong khi máy quay di chuyển. Các đường cắt ở 5,29s và 10,96s.

So sánh song song một quầy hàng đồ ăn Nhật Bản vào ban đêm

So sánh song song khung hình neo ban đầu và một khung hình từ thế hệ ba, cho thấy cùng một đầu bếp và biển hiệu 41 giây và hai lần chuyển giao sau đó

Bên trái: khung hình neo Bước 1. Bên phải: thế hệ 3 tại mốc 41 giây, hai lần chuyển giao sau đó. Cùng một đầu bếp, cùng một băng đô, cùng một áo trên xanh đậm, cùng một biển hiệu vẽ tay, cùng một chiếc đèn lồng đỏ.

Bước 5: Đo Chiều Dài Video MiniMax H3 Thực Tế, Sau Đó Ghép Nối

Hai thói quen để kết thúc. Đầu tiên, hãy chạy một buổi diễn tập rẻ tiền trước khi bạn mua mười lăm giây. Cùng một prompt, duration 4, và bạn sẽ biết liệu mô hình có hiểu danh sách cảnh quay của bạn với giá khoảng một phần tư giá hay không.

Đầu bếp nấu ăn tại một quầy hàng ngoài trời bốc hơi trong một con hẻm mưa

Buổi diễn tập 4 giây của cùng một danh sách cảnh quay. Đo được 107 khung hình, tức là 4,458 giây, chính xác như lưới dự đoán. Đủ để biết liệu mô hình có hiểu được cảnh trước khi mua toàn bộ cảnh quay hay không.

Thứ hai, đo mọi tệp trước khi bạn cắt, bởi vì không có tệp nào có độ dài bạn yêu cầu:

bash
1# real frame count and container duration, not duration x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# hard-cut concat, no transitions, no re-encode
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

Ba tệp, mỗi tệp 362 khung hình, cho tổng cộng 1086 khung hình, mà tôi đã đo trên bản nối hoàn chỉnh: 45,25 giây hình ảnh, không phải 45. Nhỏ, cho đến khi bạn đang ghép bốn mươi cái.

Các Biến Thể: Đối Thoại, Dọc và Buổi Diễn Tập 4 Giây

Khi chuỗi hoạt động, ba điểm cuối tương tự bao phủ hầu hết những gì mọi người thực sự yêu cầu.

Đối thoại quay và quay ngược. Đặt cả hai bên của một cuộc trò chuyện trong một thế hệ thay vì trên hai. Khớp môi và nền âm thanh là liên tục trong một công việc duy nhất và độc lập giữa các công việc, vì vậy một cuộc trò chuyện được chia thành hai thế hệ sẽ tạo ra hai tông màu phòng không liên quan. Giữ các cuộc trao đổi trong một clip.

Người phụ nữ trẻ đang khóc nhìn lên một người đàn ông trong cầu thang

Hai diễn viên trẻ đang tranh luận trên một chiếu nghỉ cầu thang bê tông, ánh sáng cửa sổ gay gắt chiếu vào họ, quay qua vai

Quay và quay ngược hoạt động, miễn là cả hai góc đều nằm trong cùng một thế hệ.

Dọc. Trên image-to-video, bạn không đặt tỷ lệ, bạn đặt khung hình đầu tiên. Tạo một khung hình neo cao và adaptive tuân theo nó. Một trong những clip tôi đo được trả về ở 1280x2276 với cùng số lượng khung hình 243 như các clip 16:9 của nó, vì vậy lưới khung hình không quan tâm đến tỷ lệ khung hình của bạn.

Buổi diễn tập 4 giây như một thông lệ tiêu chuẩn. Với $0,14 mỗi giây, bốn giây là $0,56 so với $2,10 cho một lần quay đầy đủ. Trên một bản dựng chín cảnh quay, việc diễn tập mọi thế hệ trước khi cam kết tốn ít hơn một công việc 15 giây bị lãng phí.

Nơi giới hạn thực sự cắn. Bất cứ thứ gì cần một màn trình diễn không gián đoạn dài hơn mười lăm giây. Một đoạn độc thoại 30 giây liên tục không phải là vấn đề xâu chuỗi, đó là vấn đề khớp môi qua một đường nối, và không có kỷ luật prompt nào khắc phục được.

45 Giây Chiều Dài Video MiniMax H3 Có Giá Bao Nhiêu

Với $0,14 mỗi giây, một thế hệ 15 giây đầy đủ là $2,10. Đó là con số duy nhất bạn cần; mọi thứ khác là phép nhân. Cột thú vị là cột cuối cùng.

Độ dài mục tiêuThế hệ ở 15 giâyChi phí thẳngThực tế với tỷ lệ giữ 1/3Số cảnh quay được giaoChi phí mỗi cảnh
15 giây1$2,10$6,303$0,70
45 giây (bản dựng này)3$6,30$18,909$0,70
60 giây4$8,40$25,2012$0,70
3 phút12$25,20$75,6036$0,70
10 phút40$84,00$252,00120$0,70

Đọc cột chi phí mỗi cảnh và sự hoảng loạn về giới hạn gần như biến mất. Lập kế hoạch một thế hệ cho mỗi cảnh quay đưa bạn đến $2,10 một cảnh. Đóng gói ba cảnh quay vào mỗi thế hệ đưa bạn đến $0,70. Cùng một mô hình, cùng một giới hạn mười lăm giây, một phần ba hóa đơn.

Cột tỷ lệ giữ là cột mà mọi người quên. Không có gì có thể sử dụng được trở lại trong lần thử đầu tiên mọi lúc và một kế hoạch cho rằng nó sẽ là một kế hoạch hết ngân sách ở phút thứ hai.

Để có bối cảnh về vị trí giới hạn so với mọi thứ khác trong danh mục, tất cả những điều này đều hiện tại tính đến ngày 4 tháng 8 năm 2026:

Mô hìnhThế hệ đơn tối đaĐáng chú ýTỷ giá niêm yết
minimax/h34 đến 15 giây768P hoặc 2K, âm thanh nổi gốc$0,14 / giây
bytedance/seedance-2.04 đến 15 giây, hoặc -1 để tự động480p đến 4K gốc$0,112 / giây
kwaivgi/kling-v3.0-pro3 đến 15 giâyCó cờ multi_shot rõ ràng với các prompt cho mỗi cảnh$0,095 / giây, giảm 15%
alibaba/wan-2.72 đến 15 giâyMức sàn rộng nhất, 720P hoặc 1080P$0,10 / giây
google/veo3.1Chỉ 4, 6 hoặc 8 giâyKhông có tùy chọn 15 giây nào cả$0,20 / giây
alibaba/wan-2.5/video-extendthêm 5 đến 10 giâyMở rộng một tệp hiện có thay vì tạo mới$0,052 / giây

Hai kết luận. Mười lăm giây của H3 nằm ở đầu của thế hệ hiện tại, không phải phía sau nó, và Veo 3.1 giới hạn ở tám. Và nếu những gì bạn thực sự cần là một tệp dài từ một điểm cuối, một mô hình mở rộng chuyên dụng tồn tại, nhưng việc chuyển đổi mô hình giữa chuỗi có nghĩa là chuyển đổi khuôn mặt.

Một Lưu Ý Trung Thực Về Âm Thanh, Trọng Lượng và Chiều Dài Video MiniMax H3

Ba lưu ý, không có lưu ý nào làm thay đổi giới hạn.

Âm thanh không truyền qua các thế hệ. Mỗi công việc tự tạo nền âm thanh nổi từ đầu. Ba clip được xâu chuỗi có nghĩa là ba nền mưa không liên quan và bạn sẽ nghe thấy sự thay đổi ngay cả khi hình ảnh khớp hoàn hảo. Hai cách khắc phục: viết mệnh đề không gian âm thanh giống hệt nhau trong mọi prompt để các nền gần nhau hoặc tắt tiếng đoạn cắt đã ghép và đặt một bản nhạc liên tục bên dưới. Đối với đối thoại, hãy giữ cuộc trao đổi trong một thế hệ duy nhất.

Sáu sóng âm nhỏ màu đen bên cạnh một sóng âm dài màu cam

Một số đoạn dạng sóng âm thanh ngắn riêng biệt với khoảng trống có thể nhìn thấy giữa chúng ở bên trái, một dạng sóng liên tục duy nhất ở bên phải, trên nền đồng nhất nhạt

Bên trái: những gì xâu chuỗi thực sự mang lại cho bạn. Bên phải: những gì bạn phải xây dựng bên dưới nó.

Tự lưu trữ không mở khóa được các clip dài hơn. Các trọng lượng mở đã được phát hành vào ngày 2 tháng 8 năm 2026 (Hugging Face, tháng 8 năm 2026) và việc chạy chúng cục bộ cung cấp cho bạn cạnh ngắn 768 pixel được làm tròn thành bội số của 32, theo ghi chú thiết lập của ComfyUI. Lưới 17 khung hình và trần 15 giây là như nhau. Giấy phép cộng đồng cũng hiện không bao gồm EU, Vương quốc Anh, Hàn Quốc hoặc Mỹ, vì vậy API là con đường thực tế cho hầu hết các nhóm.

Mô hình có thể âm thầm viết lại bạn. Tôi đã từng thấy H3 trả về completed trên một công việc mà nó âm thầm loại bỏ một yếu tố tôi yêu cầu. Kéo khung hình từ mọi clip và xem xét chúng trước khi bạn ghép. Trên một chuỗi chín cảnh quay, một clip không được giám sát là một đường nối bị lãng phí.

Câu Hỏi Thường Gặp

Chiều dài video MiniMax H3 tối đa là bao nhiêu?

Mười lăm giây. Tham số duration là một enum gồm các số nguyên từ 4 đến 15 với mặc định là 8, vì vậy 16 bị từ chối và 7.5 không phải là giá trị hợp lệ. Mọi clip đều là 24 FPS lên tới 2K gốc với âm thanh nổi được tạo cùng với hình ảnh.

MiniMax H3 có thể tạo video dài hơn 15 giây không?

Không trong một thế hệ duy nhất và API không có tham số extend. Bạn vượt quá 15 giây bằng cách xâu chuỗi: lấy khung hình cuối cùng của một clip làm khung hình đầu tiên của clip tiếp theo, sử dụng reference-to-video khi bạn cần một góc máy quay mới, sau đó nối với các đường cắt cứng. Một số giao diện người dùng tiêu dùng tự xây dựng tính năng mở rộng của riêng họ trên H3 để đạt khoảng 30 giây, nhưng đó là sản phẩm thực hiện việc ghép nối, không phải mô hình tạo ra lâu hơn.

Tại sao clip MiniMax H3 15 giây của tôi thực sự là 15,08 giây?

Bởi vì thời lượng được làm tròn lên theo lưới 17 khung hình. Yêu cầu 15 giây trả về 362 khung hình, là 17x21+5 và ở 24 FPS, đó là 15,083 giây. Yêu cầu 10 trả về 243 khung hình, tức 10,125 giây. Chỉ có duration: 8 rơi vào một giây tròn, ở chính xác 192 khung hình. Nếu chỉnh sửa của bạn chính xác theo khung hình, hãy đo từng tệp thay vì tính toán duration x 24.

Tôi có thể đặt nhiều cảnh quay bên trong một thế hệ MiniMax H3 không?

Có, và đó là khoản tiết kiệm lớn nhất hiện có. Viết các cảnh quay có mã thời gian rõ ràng vào prompt với các từ CUT TO và thêm một mệnh đề liên tục nêu tên những gì phải tồn tại qua các đường cắt. Tôi đã đo mười đường cắt sạch sẽ bên trong một thế hệ 15 giây thực tế. Ba cảnh quay mỗi thế hệ là thoải mái và đáng tin cậy, biến một clip $2,10 thành ba cảnh quay $0,70.

Chiều dài video MiniMax H3 ngắn hơn có tốn ít chi phí hơn không?

Có, tuyến tính. Thanh toán theo giây với giá $0,14, vì vậy một buổi diễn tập 4 giây có giá $0,56 so với $2,10 cho một lần quay 15 giây đầy đủ. Độ phân giải là một câu chuyện khác: 768P2K nằm dưới một tỷ giá duy nhất được liệt kê trong danh mục, vì vậy việc hạ cấp độ phân giải không tiết kiệm được gì. Rút ngắn clip, không phải pixel.

Tôi cần bao nhiêu clip MiniMax H3 cho một video một phút?

Bốn, nếu bạn lấp đầy tất cả mười lăm giây mỗi lần. Nhưng hãy đếm theo cảnh quay: bốn thế hệ với ba cảnh quay mỗi thế hệ cho bạn mười hai cảnh quay, đó là một lượng bình thường cho một quảng cáo thương mại một phút. Sau đó nhân ngân sách của bạn với khoảng ba để tính đến các lần quay bạn vứt bỏ.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình