
Một phòng màu đêm khuya, sáu màn hình hiển thị sáu góc quay khác nhau của cùng một ca sĩ tóc bạc_Sáu_ góc quay, một nghệ sĩ, một bài hát. Được tạo bằng openai/gpt-image-2/text-to-image .
Người dùng Suno tạo ra khoảng 7 triệu bài hát mỗi ngày, gần bằng toàn bộ danh mục Spotify mỗi hai tuần (TechCrunch, tháng 2 năm 2026). Hầu như không có bài hát nào trong số đó sẽ có một bức ảnh đi kèm. Không phải vì bức ảnh là không thể, mà vì con đường truyền thống chạy qua bốn công cụ: tạo ảnh tĩnh, làm hoạt ảnh, chạy một bước đồng bộ môi riêng, sau đó sửa mọi thứ trong quá trình chỉnh sửa. Mỗi bước nhảy đều làm mất khuôn mặt, trang phục hoặc nhịp điệu.
Vì vậy, tôi đã bỏ qua các bước nhảy. Tôi thả một đoạn 8 giây của một đoạn điệp khúc trực tiếp vào khe tham chiếu của một mô hình video và nhấn Chạy. Nó không tính phí tôi cho âm thanh.
Sau đó, tôi tách tệp mp4 đã hoàn thành ra để trả lời một câu hỏi mà không ai trên internet trả lời thẳng thắn: âm thanh phát ra từ mô hình là bài hát của tôi, hay thứ gì đó nó tự bịa ra chỉ nghe giống? Tôi đã đo nó. Câu trả lời không phải là điều tôi mong đợi, và nó thay đổi cách bạn nên cắt nó.
Những điểm chính
- Âm thanh tham chiếu là miễn phí. MiniMax H3 chỉ tính phí đầu ra theo giây. Bốn đoạn tham chiếu 8 giây của tôi đã thêm $0,00 vào hóa đơn. Video tham chiếu mới là thứ đắt tiền.
- 15 giây là giới hạn cho mỗi lần tạo, không phải cho mỗi dự án. Cắt bài hát, quay một đoạn cho mỗi cảnh, nối lại. Đoạn cắt 32 giây của tôi là bốn lần tạo.
- Viết đoạn điệp khúc ở 120 BPM. Một ô nhịp chính xác là 2,000 giây, vì vậy các giá trị
durationtính bằng giây nguyên của H3 sẽ rơi vào vạch nhịp mà không cần điều chỉnh thủ công. 8s = 4 ô nhịp.- Âm thanh đầu ra chính là bản nhạc của bạn, căn chỉnh mẫu. Tôi đã đo được tương quan dạng sóng 0,892 ở độ trễ bằng không giữa đầu vào của tôi và bản phối stereo mà H3 trả về. Nó không được tạo lại. Bạn vẫn muốn đặt bản master vào bản cắt cuối cùng, vì một lý do khác (bên dưới).
- Tổng chi tiêu thực tế: $7,53 qua chín lần tạo bao gồm cả những lần thất bại. Bốn cảnh quay trong bản cắt cuối cùng cộng với bài hát và khung hình nền có giá $4,80.
Video Ca Nhạc MiniMax H3 Tôi Cắt Từ Một Đoạn Điệp Khúc 32 Giây
Bật âm thanh. Đây là bốn lần tạo riêng biệt, được nối liền không có hiệu ứng chuyển tiếp, với bản master 32 giây gốc được đặt chồng lên trên.
TfrOvWHf4ys
"MIRA", 32 giây, 2560x1440, 24 khung hình/giây. Bốn lần tạo minimax/h3/reference-to-video mỗi lần 8 giây, $1,12 mỗi cảnh. Bài hát được đưa vào làm âm thanh tham chiếu và có giá $0,00.
Bốn lần tạo, bốn thế giới ánh sáng hoàn toàn khác nhau, một khuôn mặt. Không có gì được chỉnh sửa lại giữa chúng.

Bốn khung hình từ bốn cảnh quay cho thấy cùng một ca sĩ trên sân thượng đèn neon, đường cao tốc sa mạc, phòng thu trắng và bể nước đen_Một_ khung hình lấy từ mỗi clip đã giao. Cùng mái tóc, cùng áo lưới đen, cùng vòng cổ LED đỏ trên mưa, nắng thấp, ánh sáng cao phẳng và dưới nước.
Tại Sao Hầu Hết Các Nỗ Lực Làm Video Ca Nhạc MiniMax H3 Đều Thất Bại Ở Giây Thứ 16
Ba chế độ thất bại, tất cả đều có thể tránh được.
Một: coi 15 giây là giới hạn dự án. H3 giới hạn một lần tạo ở mức 15 giây. Mọi người đọc điều đó, kết luận "không có video ca nhạc" và bỏ cuộc. Nhưng một video ca nhạc chưa bao giờ chỉ là một cảnh quay. Một video thực tế cắt mỗi 4 đến 8 giây. Giới hạn chỉ buộc bạn phải làm những gì một biên tập viên sẽ làm bất kể điều gì.
Hai: mô tả nhịp điệu bằng lời nói. "Sôi động, tràn đầy năng lượng, nhảy theo nhịp" không cho mô hình bất cứ thứ gì để khóa vào. Nó tự phát minh ra một nhịp độ, và các điểm cắt của bạn sẽ lệch nửa nhịp mãi mãi. Đưa cho nó âm thanh thực tế sẽ loại bỏ việc đoán mò.
Ba: để trang phục thay đổi. Mỗi cảnh quay cần cùng một hình ảnh tham chiếu và cùng một từ ngữ trang phục, nguyên văn. Thay đổi "áo lưới đen" thành "áo sơ mi lưới tối" giữa các cảnh sẽ cho ra một người khác.
Đây là chi phí thực tế của hai con đường:
| Chuỗi bốn công cụ truyền thống | Một lần gọi tham chiếu H3 đơn lẻ | |
|---|---|---|
| Công cụ cho mỗi cảnh | Mô hình ảnh, mô hình video, công cụ đồng bộ môi, NLE | Một điểm cuối, sau đó một NLE ở cuối |
| Các bước thủ công mỗi cảnh | 4 bước chuyển giao, 3 lần xuất tệp | 1 lần gửi |
| Giữ nhân vật như thế nào | Gợi ý lại thủ công và may mắn | Một hình ảnh tham chiếu được tái sử dụng nguyên văn |
| Hình ảnh và âm thanh | Kết xuất riêng biệt, căn chỉnh sau | Được tạo trong cùng một lần, âm thanh nổi 32 kHz |
| Chi phí cho mỗi cảnh 8 giây | Bốn đồng hồ đo riêng biệt | $1,12 ở 2K, $0,80 ở 768P |
Công bằng mà nói cho con đường cũ: nó không phải là ảo tưởng. Nhà sáng tạo người Nhật Arata Fukoe đã giành huy chương đồng Project Odyssey với một video ca nhạc hoàn toàn do AI, và cả Queen và Linkin Park đều đã phát hành các video hỗ trợ AI chính thức. Các chuỗi đó chỉ chạy qua bốn hoặc năm công cụ, đó chính xác là thứ mà một nghệ sĩ độc lập với một bài hát không có thời gian để làm.
Âm Thanh Tham Chiếu Thực Sự Mang Lại Lợi Ích Gì Cho Video Ca Nhạc MiniMax H3
Đây là phần đáng để hiểu trước khi bạn chi bất cứ thứ gì.
H3 tạo ra hình ảnh và âm thanh trong một lần thay vì lồng âm thanh lên các khung hình đã hoàn thành. Khi bạn đưa cho nó một bản nhạc tham chiếu, bản nhạc đó không phải là một ghi chú tâm trạng. Tôi đã so sánh đoạn đầu vào của mình với luồng âm thanh bên trong tệp mp4 đã giao, ở cấp độ dạng sóng, trên một bản trộn xuống đơn âm 8 kHz:
- Tương quan đường bao: 0,956 ở độ trễ bằng không
- Tương quan dạng sóng thô trên cửa sổ 2 giây: 0,892 ở độ lệch mẫu bằng không
Đó không phải là một mô hình tái tạo một bài hát tương tự. Đó là tệp của bạn, được căn chỉnh mẫu, với không gian mà lời nhắc yêu cầu được xếp chồng lên trên và một vòng mã hóa lại AAC. Để so sánh, cùng một phép đo đối với một lần chụp đối chứng được tạo mà không có âm thanh tham chiếu cho kết quả 0,26, đó là sàn nhiễu.

Dạng sóng của đoạn đầu vào ở trên, âm thanh H3 cung cấp ở dưới, được căn chỉnh ở độ lệch bằng không_Trên: tệp mp3 8 giây tôi đã tải lên. Dưới: luồng âm thanh bên trong tệp mp4 H3 trả về. Cùng đỉnh, cùng vị trí, không có độ lệch._
Các giới hạn đầu vào rất nghiêm ngặt và chúng được thực thi tại thời điểm gửi thay vì âm thầm:
| Đầu vào tham chiếu | Giới hạn | Được tính phí |
|---|---|---|
| Hình ảnh | lên đến 9 | miễn phí trên các điểm cuối H3 của Atlas Cloud |
| Video | lên đến 3, mỗi video 2-15s | được tính phí theo tỷ lệ đầu ra |
| Âm thanh | lên đến 3, mỗi âm thanh 2-15s, tổng cộng 15s trên tất cả các clip | $0,00 |
| Chỉ âm thanh | bị từ chối, cần ít nhất một hình ảnh hoặc video | n/a |
Tôi đã cố tình kiểm tra giới hạn tổng âm thanh bằng cách gửi ba đoạn 8 giây trong một lần gọi. Nó thất bại sau 5,8 giây với invalid params, total audio duration 24138 ms exceeds 15000 ms và không bị tính phí. Tin tốt: H3 không âm thầm bỏ tệp thừa và tính phí bạn.
Một cái bẫy nữa tôi gặp phải trước đó. Nếu bạn truyền âm thanh dưới dạng URL dữ liệu base64, loại MIME sẽ quyết định phần mở rộng mà API suy ra. data:audio/mpeg bị từ chối với audio format ".mpeg" not allowed. data:audio/mp3 đi qua dễ dàng. Bốn lần gửi đã chết vì điều đó trước khi tôi nhận ra, tất cả đều miễn phí.
Quy Trình Video Ca Nhạc MiniMax H3, và Chi Phí Mỗi Giây Là Bao Nhiêu
Mọi thứ bên dưới chạy qua một khóa API trên Atlas Cloud, nơi tôi đã chạy và thanh toán tất cả. Ba mô hình, một tab trình duyệt.
| Bước | Mô hình | Nó làm gì | Giá tôi thực sự bị tính |
|---|---|---|---|
| Viết đoạn điệp khúc | minimax/music-2.6 | Toàn bộ bài hát từ lời nhắc phong cách cộng với lời bài hát, mp3 lên đến ~5 phút | $0,15 mỗi bài hát, cố định |
| Khóa nghệ sĩ | openai/gpt-image-2/text-to-image | Một khung hình nền mà mọi cảnh quay đều kế thừa | $0,1745 ở chất lượng cao, 2048x1152 |
| Quay mỗi cảnh | minimax/h3/reference-to-video | Hình ảnh cộng với âm thanh đầu vào, clip khóa nhịp với âm thanh nổi đầu ra | $0,14/giây ở 2K, $0,10/giây ở 768P. Đầu vào âm thanh $0,00 |
Hai ghi chú về bảng đó, bởi vì các con số được liệt kê nói dối theo cả hai hướng. GPT Image 2 hiển thị mức sàn $0,009 trong danh mục; đó là bậc token thấp nhất và một kết xuất high 2048x1152 thực tế có giá $0,1745. Mục nhập danh mục của H3 hiển thị $0,10, chỉ là bậc 768P; các công việc 8 giây 2K của tôi mỗi cái được tính chính xác $1,12, tức là $0,14 mỗi giây.
Nếu bạn muốn khóa khung hình đầu tiên thay vì tham chiếu chủ thể, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) có cùng mức giá và [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) bao gồm các cảnh quay chỉ bằng lời nhắc.
Sự điều chỉnh đáng để thực hiện: một phiên bản trước đó của kế hoạch này cho rằng bạn phải tự mang bài hát của mình vì không có trình tạo toàn bộ bài hát trên nền tảng. Bây giờ có một cái. minimax/music-2.6 viết bản nhạc, vì vậy toàn bộ chuỗi, bao gồm cả bài hát, chạy ở một nơi.
Cách Tạo Video Ca Nhạc MiniMax H3, Từng Bước
Bước 1: Viết Một Đoạn Điệp Khúc 120 BPM Và Cắt Nó Thành Các Đoạn Cho Mỗi Cảnh
Yêu cầu 120 BPM một cách rõ ràng. Ở 120 BPM, một ô nhịp chính xác là 2,000 giây, vì vậy enum duration tính bằng giây nguyên của H3 sẽ rơi vào vạch nhịp miễn phí: 4s = 2 ô nhịp, 6s = 3 ô nhịp, 8s = 4 ô nhịp, 10s = 5 ô nhịp. Các điểm cắt của bạn rơi vào phách mạnh mà bạn không cần chạm vào một điểm đánh dấu nào.
Mô hình: minimax/music-2.6. Cài đặt: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Lời nhắc phong cách:
plaintext1Synth-pop ở chính xác 120 BPM, kick bốn phách thẳng, pad analog sáng 2có sidechain, giọng hát nữ chính trong trẻo nổi bật trong bản phối, 3điệp khúc âm thanh nổi rộng, không rap, nguyên âm mở kéo dài, 4điện ảnh và hơi u sầu, master sẵn sàng cho radio
Lời bài hát:
plaintext1[Điệp khúc] 2Giữ vững đường, giữ vững ánh sáng 3Em đang cạn kiệt màn đêm 4Hãy gọi tên em vào cơn mưa 5Và em sẽ lại bùng cháy
Nó trả về một bản nhạc dài 70 giây trong 75 giây với giá $0,15. Sau đó, tôi đã kiểm tra nhịp độ thay vì tin tưởng nó, bằng cách chạy một phép tự tương quan độ nổi bật khi bắt đầu trên tệp. Độ trễ mạnh nhất quay trở lại chính xác 0,500 giây, tức là 120 BPM và lưới nhịp bắt đầu ở 0,24 giây vào tệp đã giải mã thay vì ở số không. Độ lệch đó quan trọng: cắt từ 0,24 và mọi đoạn đều bắt đầu bằng một phách mạnh.
plaintext1# Master 32 giây, bắt đầu ở phách mạnh tại 0,24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# bốn đoạn 8 giây, mỗi đoạn cho một cảnh, mỗi đoạn 4 ô nhịp và dưới giới hạn 15s 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Nếu bạn đã có sẵn bản nhạc của riêng mình, hãy bỏ qua bước này hoàn toàn. Đó là trường hợp bình thường và là trường hợp rẻ nhất.
Bước 2: Khóa Nghệ Sĩ Bằng Một Khung Hình Nền GPT Image 2
Mọi cảnh quay đều tham chiếu tệp duy nhất này. Bất cứ điều gì sai ở đây sẽ sai bốn lần, vì vậy hãy chi $0,17 và nhìn nó đúng cách.
Mô hình: openai/gpt-image-2/text-to-image. Cài đặt: chất lượng high , kích thước 2048x1152 (16:9).
plaintext1Ảnh tĩnh video ca nhạc điện ảnh, chân dung từ thắt lưng trở lên. Một nữ ca sĩ 2nhạc synth-pop người Đông Á 25 tuổi với mái tóc ngắn màu trắng bạc và mái bằng 3cắt thẳng, áo lưới đen mờ, vòng cổ LED đỏ mỏng phát sáng trên xương đòn, và một 4khuyên tai bạc duy nhất. Cô ấy đứng trên sân thượng ướt mưa vào ban đêm, tay cầm 5micro cầm tay mạ crôm cổ điển gần miệng. Phía sau cô ấy, bảng hiệu neon màu 6magenta và lục lam mờ, mưa nhỏ bắt ánh sáng ngược cứng, hơi nước bốc lên từ lỗ 7thông hơi. Quay trên phim 35mm anamorphic, độ sâu trường ảnh nông, gam màu teal- 8và-magenta, hạt phim hiện rõ. Khuôn mặt cô ấy sắc nét và được chiếu sáng đều bởi 9nguồn sáng chính mềm từ bên trái máy ảnh. Không có chữ ở bất kỳ đâu trong khung hình.

Khung hình nền được tạo: ca sĩ tóc bạc với micro crôm trên sân thượng neon ướt mưa_Khung_ hình nền mà mọi cảnh quay sau đó kế thừa. Được tạo bằng openai/gpt-image-2/text-to-image , chất lượng cao, 2048x1152, được tính $0,1745.

GPT Image 2 chạy lời nhắc chính xác này trong sân chơi Atlas Cloud với khung hình đã hoàn thành trong bảng đầu ra
Cùng lời nhắc trong sân chơi: Kích thước 16:9 ở 2048x1152, Chất lượng cao và nút Chạy báo giá $0,1745, đó là số tiền API thực sự tính cho tôi. Mức $0,009 trong danh mục là bậc token thấp nhất, không phải cái này. Cùng lời nhắc, seed khác, vì vậy kết xuất này không phải là tệp chính xác ở trên.
Các từ trang phục trong lời nhắc đó (tóc ngắn trắng bạc, áo lưới đen mờ, vòng cổ LED đỏ, khuyên tai bạc) được tái sử dụng nguyên văn trong mọi lời nhắc bên dưới. Sự lặp lại đó là toàn bộ cơ chế nhất quán. Đừng diễn giải nó.
Bước 3: Chạy Cảnh Quay Video Ca Nhạc MiniMax H3 Đầu Tiên Với Âm Thanh Tham Chiếu Miễn Phí
Mô hình: minimax/h3/reference-to-video. Cài đặt: refers = khung hình nền cộng với slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Đặt ratio một cách rõ ràng. Mặc định của sân chơi là adaptive và điểm cuối sẽ hài lòng hơn nhiều khi bạn đặt tên cho hình dạng bạn muốn.
plaintext1Cảnh quay video ca nhạc. Người phụ nữ trong hình ảnh tham chiếu hát bản nhạc tham chiếu 2thẳng vào ống kính trên sân thượng neon ướt, tay cầm micro crôm ở miệng. 3Cô ấy hát dòng đầu tiên mạnh mẽ vào phách mạnh, mắt nhìn chằm chằm vào máy ảnh, 4sau đó ngả đầu ra sau ở nốt kéo dài. Máy ảnh đẩy chậm từ thắt lưng lên 5đến cận cảnh chặt trong suốt tám giây, rung lắc cầm tay vi mô, vệt mưa 6cắt ngang ánh sáng ngược cứng. Hình dạng miệng cô ấy theo các nguyên âm hát của 7âm thanh tham chiếu một cách chính xác, cô ấy đang hát, không phải nói. Giống hệt 8mái tóc ngắn trắng bạc, áo lưới đen mờ và vòng cổ LED đỏ phát sáng như trong 9hình ảnh tham chiếu. Âm thanh: bản nhạc tham chiếu ở âm thanh nổi, cộng với tiếng mưa nhẹ 10và tiếng ồn thành phố xa xa trộn ở mức thấp.
7sPeYEe-xII
Cảnh quay 1, bật âm thanh. 2560x1440, 8,00 giây chính xác, 24 khung hình/giây, âm thanh nổi 32 kHz. 345 giây từ khi gửi đến khi nhận tệp, được tính $1,12. Xem đầu ngả ra sau ở nốt kéo dài khoảng 5 giây.

Sân chơi reference-to-video với khung hình nền và đoạn âm thanh đã tải lên và clip đã hoàn thành trong bảng đầu ra
Vật liệu tham chiếu có 2/9: slice-0.mp3 trong một khe, khung hình nền trong khe kia. Độ phân giải 2K, Thời lượng 8 và nút Chạy báo giá $1,12, chính xác là 8 x $0,14. Lưu ý menu thả xuống Tỷ lệ khung hình đang ở adaptive , đây là mặc định của trang; các lệnh gọi API của tôi đặt ratio thành 16:9 một cách rõ ràng.
Một con số đáng để ghi lại: duration: 8 đã cung cấp một container chính xác 8,00 giây. duration: 4 cung cấp 4,46 giây. Nếu bạn định nối trên các vạch nhịp, hãy ở trên các thời lượng trả về chính xác.
Bước 4: Quay Thêm Ba Thế Giới Khác Mà Không Mất Khuôn Mặt
Cùng khung hình nền, cùng câu trang phục, đoạn âm thanh tiếp theo. Mọi thứ khác đều thay đổi.
4a. Đường cao tốc sa mạc vào giờ vàng. refers = khung hình nền + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Cảnh quay video ca nhạc. Cùng người phụ nữ từ hình ảnh tham chiếu đứng trên vạch kẻ 2giữa đường cao tốc sa mạc vắng vẻ vào giờ vàng, không micro, một chiếc áo khoác denim 3chàm mở khoác ngoài cùng chiếc áo lưới đen mờ, vòng cổ LED đỏ vẫn sáng. Cô ấy 4mấp máy môi theo điệp khúc của bản nhạc tham chiếu trong gió trong khi máy ảnh lùi 5về phía sau thấp trên mặt đường nhựa. Không khí nóng bốc lên từ mặt đường, bụi bay, 6bóng cô ấy kéo dài về phía ống kính, một vệt sáng anamorphic cắt ngang ở 7điểm giữa chừng. Tóc, mặt và trang phục giống hệt hình ảnh tham chiếu. 8Âm thanh: bản nhạc tham chiếu trên gió sa mạc rộng mở, rộng và thoáng.
4XEki-v2vCU
Cảnh quay 2, bật âm thanh. Cùng khuôn mặt, nhiệt độ màu đối lập và bản nhạc tham chiếu được phối lại dưới gió mở. 332 giây, $1,12.
4b. Không gian vô cực trắng. refers = khung hình nền + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Cảnh quay video ca nhạc. Cùng người phụ nữ từ hình ảnh tham chiếu trong một studio 2không gian vô cực trắng tinh dưới ánh sáng cao phẳng không có bóng, mặc một chiếc áo 3khoác vinyl đỏ bóng loáng bên ngoài cùng chiếc áo lưới đen mờ, vòng cổ LED đỏ 4hiện ra ở cổ áo. Cô ấy nhảy bốn ô nhịp theo bản nhạc tham chiếu, mái tóc trắng bạc 5quất vào mỗi lần xoay. Khung hình rộng cố định, sau đó một cú zoom nhanh mạnh đến 6cảnh vừa ở phách mạnh thứ hai. Những mảnh giấy trắng nhỏ rơi như hoa giấy 7trong hai giây cuối cùng. Mặt và tóc giống hệt hình ảnh tham chiếu. Âm thanh: bản nhạc 8tham chiếu, khô và gần, cộng với tiếng kêu cót két của giày trên sàn phòng thu.
VAyqdkVpnm0
Cảnh quay 3, bật âm thanh. Ánh sáng phẳng không bóng là nơi khó nhất để che giấu sự thay đổi khuôn mặt và nó đã giữ được . 8,00 giây, $1,12.
4c. Cảnh quay phụ dưới nước, không đồng bộ môi. refers = khung hình nền + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Cảnh quay video ca nhạc. Cùng người phụ nữ từ hình ảnh tham chiếu lơ lửng dưới nước 2trong một bể đen, mái tóc trắng bạc bay xung quanh cô ấy, vòng cổ LED đỏ 3phát sáng xuyên qua nước, áo lưới đen mờ phồng lên từ từ. Một chùm ánh sáng cứng 4từ trên cao trực tiếp; bong bóng nổi lên qua ống kính trong chuyển động chậm. Cô ấy 5mở mắt vào phách mạnh và đưa một tay về phía mặt nước. Cô ấy không 6hát và miệng cô ấy vẫn ngậm. Máy ảnh xoay ba mươi độ xung quanh cô ấy 7trong suốt cảnh quay. Mặt giống hệt hình ảnh tham chiếu. Âm thanh: bản nhạc 8tham chiếu nghe từ trên mặt nước, bị bóp nghẹt và lọc thấp, với các âm bong bóng 9thoáng qua.
fibdweUMRpY
Cảnh quay 4, bật âm thanh. Chỉ dẫn "cô ấy không hát và miệng cô ấy vẫn ngậm" đã được tuân theo, đó là phần hữu ích: âm thanh tham chiếu điều khiển thời gian, không phải một màn trình diễn bắt buộc. 329 giây, $1,12.
Bước 5: Chạy Lần Chụp Đối Chứng, Với Khe Âm Thanh Trống
Cùng lời nhắc như Bước 3, từng chữ một. Thay đổi duy nhất: refers chứa hình ảnh và không có gì khác. 768P, duration: 8.
Clip duy nhất này giải thích toàn bộ cơ chế tốt hơn bất kỳ đoạn văn nào. Nghe nó so với Bước 3.
FAoPplGmKJc
Lần chụp đối chứng. Lời nhắc giống hệt, không có âm thanh tham chiếu, 1344x768, 8,00 giây, 200 giây, $0,80. H3 đã tự viết nhạc nền và màn trình diễn là "ai đó đang hát" chung chung thay vì những lời này.
Đo được so với master của tôi, âm thanh của đối chứng đạt tương quan đường bao 0,26. Âm thanh của Bước 3 đạt 0,956. Khoảng cách đó là những gì khe âm thanh miễn phí mang lại cho bạn.
Bước 6: Phá Vỡ Đồng Bộ Môi Một Cách Có Chủ Đích
Mọi mô hình đều có trần âm tiết. Tìm của bạn có giá $0,40.
Tôi đã tạo một bản nhạc rap tốc độ gấp đôi riêng biệt (minimax/music-2.6 một lần nữa, $0,15), cắt một đoạn 4 giây chạy khoảng sáu âm tiết mỗi giây và đưa nó vào cùng thiết lập sân thượng ở 768P, duration: 4.
plaintext1Cảnh quay video ca nhạc. Người phụ nữ trong hình ảnh tham chiếu rap bản nhạc tham chiếu 2thẳng vào ống kính trên sân thượng neon ướt, tay cầm micro crôm ở miệng, 3phát âm mọi âm tiết của đoạn rap tốc độ gấp đôi nhanh. Cận cảnh vừa cố định, 4rung lắc cầm tay nhẹ, vệt mưa trong ánh sáng ngược cứng. Hình dạng miệng cô ấy 5theo các âm tiết rap của âm thanh tham chiếu một cách chính xác. Giống hệt 6mái tóc ngắn trắng bạc, áo lưới đen mờ và vòng cổ LED đỏ phát sáng như trong 7hình ảnh tham chiếu. Âm thanh: bản nhạc tham chiếu ở âm thanh nổi cộng với tiếng mưa nhẹ.
jiQVCjOCbKg
Bài kiểm tra căng thẳng, bật âm thanh. 1344x768, 4,46 giây, 192 giây, $0,40. Miệng vẫn hoạt động và vẫn giữ nhịp, nhưng nó ngừng phân giải các phụ âm riêng lẻ và rơi vào một chu kỳ đóng-mở lặp đi lặp lại. Các dòng hát có hình dạng nguyên âm riêng biệt; cái này thì không.
Đánh giá trung thực của tôi từ các tệp đã giao: các nguyên âm hát kéo dài là nơi hoạt động của miệng H3 thực sự thuyết phục và các phụ âm rap dày đặc là nơi nó suy biến thành chuyển động có vẻ hợp lý. Lên kế hoạch cho các cận cảnh của bạn xung quanh các dòng hát và đặt các đoạn rap nhanh vào cảnh quay phụ. Có thêm chi tiết về sự khác biệt giữa nói và hát trong phân tích âm thanh và đồng bộ môi.
Bước 7: Ghép, Tắt Âm Và Đặt Bản Master Lại Trên Video Ca Nhạc MiniMax H3 Của Bạn
Bốn clip chính xác 8,00 giây nối lại thành chính xác 32,00 giây, tức là 16 ô nhịp ở 120 BPM. Không cần cắt tỉa.
plaintext1# 1. tách âm thanh của mỗi clip 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. nối theo thứ tự ô nhịp (4 x 8s = 32s = 16 ô nhịp @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. đặt master gốc lại 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Tại sao phải tắt âm, nếu mô hình đã trả lại bản nhạc của bạn? Bởi vì bản phối stereo của mỗi clip mang không gian mà lời nhắc của clip đó yêu cầu: mưa ở cảnh 1, gió sa mạc ở cảnh 2, bộ lọc thấp dưới nước ở cảnh 4. Đẹp cho từng cảnh, nhưng không mạch lạc khi cắt. Bản master cung cấp cho bạn một bản phối liên tục ở tốc độ bit đầy đủ mà không cần mã hóa lại cho mỗi cảnh. H3 cung cấp đồng bộ hóa màn trình diễn. Bản master của bạn cung cấp bài hát.
Bốn Biến Thể Của Công Thức Video Ca Nhạc MiniMax H3
Cắt cho phát hành dọc. Đặt ratio: 9:16 và bạn có được một đoạn Spotify Canvas hoặc một đoạn Shorts từ cùng khung hình nền và cùng các đoạn. Nó trả về đúng 768x1344, vì vậy không giống như menu thả xuống tỷ lệ trong sân chơi, giá trị ratio của API thực sự được giữ nguyên. Canvas loop là im lặng theo thiết kế, vì vậy cái này được xuất dưới dạng GIF.

Một vòng lặp cắt dọc 9:16 của cùng nghệ sĩ trên sân thượng neon_Cùng khung hình nền, cùng đoạn tham chiếu,_ ratio: 9:16 ở 768P với giá $0,80. Một nếp nhăn trung thực: tôi yêu cầu "không hát" và vẫn nhận được hát. Với giọng hát trong khe tham chiếu, âm thanh thắng cuộc tranh luận. Nếu bạn muốn một người biểu diễn im lặng, hãy cung cấp một đoạn nhạc cụ.
Video tham chiếu thay vì hình ảnh tham chiếu. Bạn có thể đưa cho H3 tối đa ba clip video tham chiếu để mang chuyển động và khung hình thay vì mô tả chúng. Hãy để ý đến đồng hồ đo: video tham chiếu _được tính phí theo tỷ lệ đầu ra, trong khi âm thanh tham chiếu là miễn phí. Sự bất đối xứng đó là thông tin giá hữu ích nhất trên điểm cuối này.
Trình tạo hình ảnh thuần túy cho cảnh phụ. Bỏ hoàn toàn người biểu diễn. Cung cấp một bức ảnh sản phẩm, một bìa album hoặc một tấm kết cấu cùng với đoạn âm thanh và chỉ nhắc chuyển động máy ảnh. Không có khuôn mặt để giữ, không có đồng bộ môi để phá vỡ và bạn có thể quay toàn bộ ở 768P.
Làm nháp rẻ, hoàn thiện đắt. 768P có giá $0,10/giây so với $0,14/giây của 2K và cả hai đều trả về âm thanh nổi 32 kHz giống hệt nhau, vì vậy màn trình diễn bạn đánh giá là giống nhau. Khoản tiết kiệm không phải ở những lần giữ lại, mà là ở những lần từ chối: mỗi lần chụp thất bại 8 giây có giá $0,80 thay vì $1,12. Quay ở 768P cho đến khi lần chụp đúng, sau đó trả $1,12 một lần. Trên một cảnh quay mất ba lần thử, đó là $2,72 thay vì $3,36. Thêm về sự khác biệt bậc trong so sánh 768P và 2K và về mức độ một clip đơn lẻ có thể kéo dài trong hướng dẫn độ dài clip.
Chi Phí Thực Tế Của Một Video Ca Nhạc MiniMax H3 Đầy Đủ
Mọi dòng bên dưới là một con số thanh toán thực tế được lấy từ bản ghi dự đoán sau khi hoàn thành, không phải giá niêm yết.
| Khoản mục | Mô hình và cài đặt | Đã tính phí |
|---|---|---|
| Đoạn điệp khúc, bài hát 70 giây | minimax/music-2.6, mp3 44,1 kHz | $0,15 |
| Khung hình nền nghệ sĩ | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0,17 |
| Cảnh quay 1, sân thượng neon | minimax/h3/reference-to-video, 2K, 8 giây | $1,12 |
| Cảnh quay 2, đường cao tốc sa mạc | same, 2K, 8 giây | $1,12 |
| Cảnh quay 3, không gian vô cực trắng | same, 2K, 8 giây | $1,12 |
| Cảnh quay 4, dưới nước | same, 2K, 8 giây | $1,12 |
| Tổng phụ video đã hoàn thành | $4,80 | |
| Thử nghiệm xác thực | 768P, 4 giây | $0,40 |
| Chụp đối chứng, không âm thanh | 768P, 8 giây | $0,80 |
| Bản nhạc rap cho bài kiểm tra căng thẳng | minimax/music-2.6 | $0,15 |
| Bài kiểm tra căng thẳng đồng bộ môi | 768P, 4 giây | $0,40 |
| Cắt dọc Canvas | 768P, 8 giây, 9:16 | $0,80 |
| Hình ảnh chính cho bài viết này | openai/gpt-image-2/text-to-image, high | $0,17 |
| Kiểm tra vượt giới hạn, 24 giây âm thanh | bị từ chối khi gửi | $0,00 |
| Bốn lần gửi với MIME âm thanh sai | bị từ chối khi gửi | $0,00 |
| Âm thanh tham chiếu, 4 x 8 giây | đầu vào miễn phí | $0,00 |
| Tổng chi tiêu | $7,53 |
Đó là $9,00 cho mỗi phút hoàn thành ở 2K cho các cảnh quay được chọn, trước bất kỳ sai lầm nào của tôi. Quay toàn bộ ở 768P, cùng một phút có giá $6,61. Một đoàn làm MV con người không báo giá một trong hai con số đó.
Hai lưu ý vận hành nếu bạn đang lập ngân sách cho một tác phẩm dài hơn. Các lần từ chối khi gửi là miễn phí, vì vậy các tham số xấu khiến bạn mất thời gian và không có gì khác. Và trường price trên một dự đoán xuất hiện có độ trễ, vì vậy hãy thăm dò lại ID yêu cầu sau khi tệp tải xuống nếu bạn muốn có hóa đơn thực tế thay vì null.
Bài Hát Của Ai, Khuôn Mặt Của Ai: Những Điều Cần Kiểm Tra Trước Khi Xuất Bản
Ngắn gọn, vì nó quan trọng và không cần một bài giảng.
Bạn cần có quyền đối với bản nhạc tham chiếu. Đầu vào miễn phí không có nghĩa là giải phóng mặt bằng miễn phí. Đưa một đĩa đơn phát hành thương mại vào làm âm thanh tham chiếu, sau đó xuất bản những gì ra, là con đường nhanh nhất đến một lệnh gỡ xuống. Bản ghi âm của riêng bạn, một bản nhạc bạn đã đặt hàng hoặc thứ gì đó bạn đã tạo ra là ổn.
Đừng xây dựng khung hình nền từ khuôn mặt của một nghệ sĩ thực sự còn sống. Cơ chế nhất quán ở đây rất tốt trong việc giữ một khuôn mặt qua các cảnh quay, đó chính xác là lý do tại sao chỉ nó vào một người thật là một ý tưởng tồi.
Trọng lượng mở và quyền truy cập API là hai giấy phép khác nhau. MiniMax đã xuất bản trọng lượng của H3 trên Hugging Face vào tháng 8 năm 2026 và giấy phép cộng đồng của nó hiện loại trừ EU, Vương quốc Anh, Hàn Quốc và Hoa Kỳ, với một kênh cấp phép chính thức mở cho các vùng lãnh thổ đó. Hạn chế đó gắn liền với việc tự chạy trọng lượng. Gọi mô hình thông qua một API được lưu trữ là một mối quan hệ dịch vụ và không đặt bạn dưới giấy phép trọng lượng. Đáng để biết bạn đang ở trong tình huống nào trước khi bạn giả định theo một trong hai cách.
Để có cái nhìn rộng hơn về vị trí của H3 so với các lựa chọn thay thế, có một so sánh Seedance 2.5 và một hướng dẫn cấu trúc lời nhắc. Để biết bối cảnh tại sao nó đáng để gặp rắc rối: trên bảng xếp hạng chỉnh sửa video tính điểm theo âm thanh, H3 hiện đứng đầu ở mức 1.126 Elo, trước Gemini Omni Flash ở mức 1.119 và Dreamina Seedance 2.0 ở mức 1.027 (Artificial Analysis, đã kiểm tra ngày 10 tháng 8 năm 2026). Các điểm số đó thay đổi theo phiếu bầu, vì vậy hãy coi chúng như một ảnh chụp nhanh.
Video Ca Nhạc MiniMax H3: Các Câu Hỏi Thường Gặp
Một video ca nhạc MiniMax H3 có thể chạy đủ ba phút không?
Không trong một lần tạo. Một lần gọi duy nhất giới hạn ở 15 giây. Nhưng đó là giới hạn cho mỗi lần tạo, không phải cho mỗi dự án. Một video ba phút với 8 giây mỗi cảnh là 23 lần tạo, khoảng $25,76 ở 2K và mỗi lần sẽ rơi vào vạch nhịp nếu bản nhạc của bạn là 120 BPM. Cắt, quay, nối, đặt master lại.
Video ca nhạc MiniMax H3 có sử dụng bài hát thực tế của tôi không, hay mô hình tạo lại âm thanh?
Nó sử dụng bài hát thực tế của bạn. Tôi đã đo tương quan dạng sóng thô 0,892 ở độ lệch mẫu bằng không giữa tệp mp3 8 giây tôi tải lên và luồng âm thanh bên trong tệp mp4 được trả về, với không gian được yêu cầu của lời nhắc được xếp chồng lên trên. Một lần chụp đối chứng được tạo mà không có âm thanh tham chiếu đạt 0,26 so với cùng master. Bạn vẫn nên đặt master của mình lại trên bản nối cuối cùng, bởi vì mỗi clip mang không gian riêng cho mỗi cảnh và mã hóa AAC riêng, những thứ này không tồn tại qua một lần cắt sạch sẽ.
Việc đưa một bài hát vào video ca nhạc MiniMax H3 có tốn thêm chi phí không?
Không. Bốn đoạn tham chiếu 8 giây của tôi đã thêm $0,00 vào hóa đơn $4,48 cho các cảnh quay. Video tham chiếu mới là thứ cần chú ý, vì nó được tính phí theo tỷ lệ đầu ra. Các giới hạn là ba clip âm thanh, mỗi clip 2 đến 15 giây, tổng cộng 15 giây và âm thanh không bao giờ có thể là tham chiếu duy nhất.
Đồng bộ môi của MiniMax H3 khi hát tốt như thế nào so với nói?
Các nguyên âm hát kéo dài là thế mạnh của nó: hình dạng miệng riêng biệt, giữ nguyên nốt nhạc và động tác ngả đầu ra sau ở nốt dài đọc như một màn trình diễn chứ không phải vòng lặp. Phát âm dày đặc là nơi nó bỏ cuộc. Bài kiểm tra rap sáu âm tiết mỗi giây của tôi giữ được nhịp nhưng ngừng phân giải các phụ âm và rơi vào một chu kỳ đóng-mở lặp đi lặp lại. Đặt các đoạn rap nhanh vào cảnh quay phụ.
Làm thế nào để giữ cùng một khuôn mặt qua mọi cảnh quay của video ca nhạc MiniMax H3?
Ba điều, tất cả đều nhàm chán. Một hình ảnh tham chiếu được tái sử dụng trong mọi lần gọi, không bao giờ được tạo lại. Cùng từ ngữ trang phục được sao chép nguyên văn giữa các lời nhắc, không diễn giải. Và một mệnh đề "giống hệt hình ảnh tham chiếu" rõ ràng trong mỗi lời nhắc. Bốn cảnh quay của tôi đã vượt qua mưa, nắng thấp, ánh sáng cao phẳng và dưới nước mà không có sự thay đổi.
Một video ca nhạc MiniMax H3 có giá bao nhiêu cho mỗi phút hoàn thành?
$9,00 cho mỗi phút hoàn thành ở 2K, dựa trên hóa đơn thực tế của tôi là $4,80 cho một đoạn cắt 32 giây. Quay toàn bộ ở 768P, cùng một phút có giá $6,61 và 768P cung cấp cùng âm thanh nổi 32 kHz, vì vậy màn trình diễn bạn đánh giá là giống hệt nhau. Quay các lần từ chối của bạn ở $0,80 và trả $1,12 chỉ cho lần chụp sống sót qua quá trình chỉnh sửa.






