Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud

Tôi đã tạo một video âm nhạc MiniMax H3 từ một đoạn hook dài 32 giây với giá $4.80. Bản nhạc đã làm tôi ngạc nhiên.

Tôi đã đưa một đoạn hook dài 32 giây vào MiniMax H3 làm tệp âm thanh tham khảo miễn phí, nhận lại bốn cảnh quay đồng bộ nhịp, và dựng một video nhạc MiniMax H3 thực sự với giá 4,80 đô la. Bao gồm cả lời nhắc và hóa đơn.

Một biên tập viên video đang làm việc tại bàn điều khiển với nhiều màn hình video

Một phòng màu đêm khuya, sáu màn hình hiển thị sáu góc quay khác nhau của cùng một ca sĩ tóc bạc_Sáu_ góc quay, một nghệ sĩ, một bài hát. Được tạo bằng openai/gpt-image-2/text-to-image .

Người dùng Suno tạo ra khoảng 7 triệu bài hát mỗi ngày, gần bằng toàn bộ danh mục Spotify mỗi hai tuần (TechCrunch, tháng 2 năm 2026). Hầu như không có bài hát nào trong số đó sẽ có một bức ảnh đi kèm. Không phải vì bức ảnh là không thể, mà vì con đường truyền thống chạy qua bốn công cụ: tạo ảnh tĩnh, làm hoạt ảnh, chạy một bước đồng bộ môi riêng, sau đó sửa mọi thứ trong quá trình chỉnh sửa. Mỗi bước nhảy đều làm mất khuôn mặt, trang phục hoặc nhịp điệu.

Vì vậy, tôi đã bỏ qua các bước nhảy. Tôi thả một đoạn 8 giây của một đoạn điệp khúc trực tiếp vào khe tham chiếu của một mô hình video và nhấn Chạy. Nó không tính phí tôi cho âm thanh.

Sau đó, tôi tách tệp mp4 đã hoàn thành ra để trả lời một câu hỏi mà không ai trên internet trả lời thẳng thắn: âm thanh phát ra từ mô hình là bài hát của tôi, hay thứ gì đó nó tự bịa ra chỉ nghe giống? Tôi đã đo nó. Câu trả lời không phải là điều tôi mong đợi, và nó thay đổi cách bạn nên cắt nó.

Những điểm chính

  • Âm thanh tham chiếu là miễn phí. MiniMax H3 chỉ tính phí đầu ra theo giây. Bốn đoạn tham chiếu 8 giây của tôi đã thêm $0,00 vào hóa đơn. Video tham chiếu mới là thứ đắt tiền.
  • 15 giây là giới hạn cho mỗi lần tạo, không phải cho mỗi dự án. Cắt bài hát, quay một đoạn cho mỗi cảnh, nối lại. Đoạn cắt 32 giây của tôi là bốn lần tạo.
  • Viết đoạn điệp khúc ở 120 BPM. Một ô nhịp chính xác là 2,000 giây, vì vậy các giá trị duration tính bằng giây nguyên của H3 sẽ rơi vào vạch nhịp mà không cần điều chỉnh thủ công. 8s = 4 ô nhịp.
  • Âm thanh đầu ra chính là bản nhạc của bạn, căn chỉnh mẫu. Tôi đã đo được tương quan dạng sóng 0,892 ở độ trễ bằng không giữa đầu vào của tôi và bản phối stereo mà H3 trả về. Nó không được tạo lại. Bạn vẫn muốn đặt bản master vào bản cắt cuối cùng, vì một lý do khác (bên dưới).
  • Tổng chi tiêu thực tế: $7,53 qua chín lần tạo bao gồm cả những lần thất bại. Bốn cảnh quay trong bản cắt cuối cùng cộng với bài hát và khung hình nền có giá $4,80.

Video Ca Nhạc MiniMax H3 Tôi Cắt Từ Một Đoạn Điệp Khúc 32 Giây

Bật âm thanh. Đây là bốn lần tạo riêng biệt, được nối liền không có hiệu ứng chuyển tiếp, với bản master 32 giây gốc được đặt chồng lên trên.

TfrOvWHf4ys

"MIRA", 32 giây, 2560x1440, 24 khung hình/giây. Bốn lần tạo minimax/h3/reference-to-video mỗi lần 8 giây, $1,12 mỗi cảnh. Bài hát được đưa vào làm âm thanh tham chiếu và có giá $0,00.

Bốn lần tạo, bốn thế giới ánh sáng hoàn toàn khác nhau, một khuôn mặt. Không có gì được chỉnh sửa lại giữa chúng.

Bốn góc nhìn của một người phụ nữ tóc bạc đeo vòng cổ đỏ phát sáng

Bốn khung hình từ bốn cảnh quay cho thấy cùng một ca sĩ trên sân thượng đèn neon, đường cao tốc sa mạc, phòng thu trắng và bể nước đen_Một_ khung hình lấy từ mỗi clip đã giao. Cùng mái tóc, cùng áo lưới đen, cùng vòng cổ LED đỏ trên mưa, nắng thấp, ánh sáng cao phẳng và dưới nước.


Tại Sao Hầu Hết Các Nỗ Lực Làm Video Ca Nhạc MiniMax H3 Đều Thất Bại Ở Giây Thứ 16

Ba chế độ thất bại, tất cả đều có thể tránh được.

Một: coi 15 giây là giới hạn dự án. H3 giới hạn một lần tạo ở mức 15 giây. Mọi người đọc điều đó, kết luận "không có video ca nhạc" và bỏ cuộc. Nhưng một video ca nhạc chưa bao giờ chỉ là một cảnh quay. Một video thực tế cắt mỗi 4 đến 8 giây. Giới hạn chỉ buộc bạn phải làm những gì một biên tập viên sẽ làm bất kể điều gì.

Hai: mô tả nhịp điệu bằng lời nói. "Sôi động, tràn đầy năng lượng, nhảy theo nhịp" không cho mô hình bất cứ thứ gì để khóa vào. Nó tự phát minh ra một nhịp độ, và các điểm cắt của bạn sẽ lệch nửa nhịp mãi mãi. Đưa cho nó âm thanh thực tế sẽ loại bỏ việc đoán mò.

Ba: để trang phục thay đổi. Mỗi cảnh quay cần cùng một hình ảnh tham chiếu cùng một từ ngữ trang phục, nguyên văn. Thay đổi "áo lưới đen" thành "áo sơ mi lưới tối" giữa các cảnh sẽ cho ra một người khác.

Đây là chi phí thực tế của hai con đường:

 Chuỗi bốn công cụ truyền thốngMột lần gọi tham chiếu H3 đơn lẻ
Công cụ cho mỗi cảnhMô hình ảnh, mô hình video, công cụ đồng bộ môi, NLEMột điểm cuối, sau đó một NLE ở cuối
Các bước thủ công mỗi cảnh4 bước chuyển giao, 3 lần xuất tệp1 lần gửi
Giữ nhân vật như thế nàoGợi ý lại thủ công và may mắnMột hình ảnh tham chiếu được tái sử dụng nguyên văn
Hình ảnh và âm thanhKết xuất riêng biệt, căn chỉnh sauĐược tạo trong cùng một lần, âm thanh nổi 32 kHz
Chi phí cho mỗi cảnh 8 giâyBốn đồng hồ đo riêng biệt$1,12 ở 2K, $0,80 ở 768P

Công bằng mà nói cho con đường cũ: nó không phải là ảo tưởng. Nhà sáng tạo người Nhật Arata Fukoe đã giành huy chương đồng Project Odyssey với một video ca nhạc hoàn toàn do AI, và cả Queen và Linkin Park đều đã phát hành các video hỗ trợ AI chính thức. Các chuỗi đó chỉ chạy qua bốn hoặc năm công cụ, đó chính xác là thứ mà một nghệ sĩ độc lập với một bài hát không có thời gian để làm.

Âm Thanh Tham Chiếu Thực Sự Mang Lại Lợi Ích Gì Cho Video Ca Nhạc MiniMax H3

Đây là phần đáng để hiểu trước khi bạn chi bất cứ thứ gì.

H3 tạo ra hình ảnh và âm thanh trong một lần thay vì lồng âm thanh lên các khung hình đã hoàn thành. Khi bạn đưa cho nó một bản nhạc tham chiếu, bản nhạc đó không phải là một ghi chú tâm trạng. Tôi đã so sánh đoạn đầu vào của mình với luồng âm thanh bên trong tệp mp4 đã giao, ở cấp độ dạng sóng, trên một bản trộn xuống đơn âm 8 kHz:

  • Tương quan đường bao: 0,956 ở độ trễ bằng không
  • Tương quan dạng sóng thô trên cửa sổ 2 giây: 0,892độ lệch mẫu bằng không

Đó không phải là một mô hình tái tạo một bài hát tương tự. Đó là tệp của bạn, được căn chỉnh mẫu, với không gian mà lời nhắc yêu cầu được xếp chồng lên trên và một vòng mã hóa lại AAC. Để so sánh, cùng một phép đo đối với một lần chụp đối chứng được tạo mà không có âm thanh tham chiếu cho kết quả 0,26, đó là sàn nhiễu.

Hai dạng sóng âm thanh gần như giống hệt nhau hiển thị đầu vào màu xanh và đầu ra màu đỏ

Dạng sóng của đoạn đầu vào ở trên, âm thanh H3 cung cấp ở dưới, được căn chỉnh ở độ lệch bằng không_Trên: tệp mp3 8 giây tôi đã tải lên. Dưới: luồng âm thanh bên trong tệp mp4 H3 trả về. Cùng đỉnh, cùng vị trí, không có độ lệch._

Các giới hạn đầu vào rất nghiêm ngặt và chúng được thực thi tại thời điểm gửi thay vì âm thầm:

Đầu vào tham chiếuGiới hạnĐược tính phí
Hình ảnhlên đến 9miễn phí trên các điểm cuối H3 của Atlas Cloud
Videolên đến 3, mỗi video 2-15sđược tính phí theo tỷ lệ đầu ra
Âm thanhlên đến 3, mỗi âm thanh 2-15s, tổng cộng 15s trên tất cả các clip$0,00
Chỉ âm thanhbị từ chối, cần ít nhất một hình ảnh hoặc videon/a

Tôi đã cố tình kiểm tra giới hạn tổng âm thanh bằng cách gửi ba đoạn 8 giây trong một lần gọi. Nó thất bại sau 5,8 giây với invalid params, total audio duration 24138 ms exceeds 15000 ms và không bị tính phí. Tin tốt: H3 không âm thầm bỏ tệp thừa và tính phí bạn.

Một cái bẫy nữa tôi gặp phải trước đó. Nếu bạn truyền âm thanh dưới dạng URL dữ liệu base64, loại MIME sẽ quyết định phần mở rộng mà API suy ra. data:audio/mpeg bị từ chối với audio format ".mpeg" not allowed. data:audio/mp3 đi qua dễ dàng. Bốn lần gửi đã chết vì điều đó trước khi tôi nhận ra, tất cả đều miễn phí.


Quy Trình Video Ca Nhạc MiniMax H3, và Chi Phí Mỗi Giây Là Bao Nhiêu

Mọi thứ bên dưới chạy qua một khóa API trên Atlas Cloud, nơi tôi đã chạy và thanh toán tất cả. Ba mô hình, một tab trình duyệt.

BướcMô hìnhNó làm gìGiá tôi thực sự bị tính
Viết đoạn điệp khúcminimax/music-2.6Toàn bộ bài hát từ lời nhắc phong cách cộng với lời bài hát, mp3 lên đến ~5 phút$0,15 mỗi bài hát, cố định
Khóa nghệ sĩopenai/gpt-image-2/text-to-imageMột khung hình nền mà mọi cảnh quay đều kế thừa$0,1745 ở chất lượng cao, 2048x1152
Quay mỗi cảnhminimax/h3/reference-to-videoHình ảnh cộng với âm thanh đầu vào, clip khóa nhịp với âm thanh nổi đầu ra$0,14/giây ở 2K, $0,10/giây ở 768P. Đầu vào âm thanh $0,00

Hai ghi chú về bảng đó, bởi vì các con số được liệt kê nói dối theo cả hai hướng. GPT Image 2 hiển thị mức sàn $0,009 trong danh mục; đó là bậc token thấp nhất và một kết xuất high 2048x1152 thực tế có giá $0,1745. Mục nhập danh mục của H3 hiển thị $0,10, chỉ là bậc 768P; các công việc 8 giây 2K của tôi mỗi cái được tính chính xác $1,12, tức là $0,14 mỗi giây.

Nếu bạn muốn khóa khung hình đầu tiên thay vì tham chiếu chủ thể, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) có cùng mức giá và [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) bao gồm các cảnh quay chỉ bằng lời nhắc.

Sự điều chỉnh đáng để thực hiện: một phiên bản trước đó của kế hoạch này cho rằng bạn phải tự mang bài hát của mình vì không có trình tạo toàn bộ bài hát trên nền tảng. Bây giờ có một cái. minimax/music-2.6 viết bản nhạc, vì vậy toàn bộ chuỗi, bao gồm cả bài hát, chạy ở một nơi.


Cách Tạo Video Ca Nhạc MiniMax H3, Từng Bước

Bước 1: Viết Một Đoạn Điệp Khúc 120 BPM Và Cắt Nó Thành Các Đoạn Cho Mỗi Cảnh

Yêu cầu 120 BPM một cách rõ ràng. Ở 120 BPM, một ô nhịp chính xác là 2,000 giây, vì vậy enum duration tính bằng giây nguyên của H3 sẽ rơi vào vạch nhịp miễn phí: 4s = 2 ô nhịp, 6s = 3 ô nhịp, 8s = 4 ô nhịp, 10s = 5 ô nhịp. Các điểm cắt của bạn rơi vào phách mạnh mà bạn không cần chạm vào một điểm đánh dấu nào.

Mô hình: minimax/music-2.6. Cài đặt: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Lời nhắc phong cách:

plaintext
1Synth-pop ở chính xác 120 BPM, kick bốn phách thẳng, pad analog sáng
2có sidechain, giọng hát nữ chính trong trẻo nổi bật trong bản phối,
3điệp khúc âm thanh nổi rộng, không rap, nguyên âm mở kéo dài,
4điện ảnh và hơi u sầu, master sẵn sàng cho radio

Lời bài hát:

plaintext
1[Điệp khúc]
2Giữ vững đường, giữ vững ánh sáng
3Em đang cạn kiệt màn đêm
4Hãy gọi tên em vào cơn mưa
5Và em sẽ lại bùng cháy

Nó trả về một bản nhạc dài 70 giây trong 75 giây với giá $0,15. Sau đó, tôi đã kiểm tra nhịp độ thay vì tin tưởng nó, bằng cách chạy một phép tự tương quan độ nổi bật khi bắt đầu trên tệp. Độ trễ mạnh nhất quay trở lại chính xác 0,500 giây, tức là 120 BPM và lưới nhịp bắt đầu ở 0,24 giây vào tệp đã giải mã thay vì ở số không. Độ lệch đó quan trọng: cắt từ 0,24 và mọi đoạn đều bắt đầu bằng một phách mạnh.

plaintext
1# Master 32 giây, bắt đầu ở phách mạnh tại 0,24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# bốn đoạn 8 giây, mỗi đoạn cho một cảnh, mỗi đoạn 4 ô nhịp và dưới giới hạn 15s
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Nếu bạn đã có sẵn bản nhạc của riêng mình, hãy bỏ qua bước này hoàn toàn. Đó là trường hợp bình thường và là trường hợp rẻ nhất.

Bước 2: Khóa Nghệ Sĩ Bằng Một Khung Hình Nền GPT Image 2

Mọi cảnh quay đều tham chiếu tệp duy nhất này. Bất cứ điều gì sai ở đây sẽ sai bốn lần, vì vậy hãy chi $0,17 và nhìn nó đúng cách.

Mô hình: openai/gpt-image-2/text-to-image. Cài đặt: chất lượng high , kích thước 2048x1152 (16:9).

plaintext
1Ảnh tĩnh video ca nhạc điện ảnh, chân dung từ thắt lưng trở lên. Một nữ ca sĩ
2nhạc synth-pop người Đông Á 25 tuổi với mái tóc ngắn màu trắng bạc và mái bằng
3cắt thẳng, áo lưới đen mờ, vòng cổ LED đỏ mỏng phát sáng trên xương đòn, và một
4khuyên tai bạc duy nhất. Cô ấy đứng trên sân thượng ướt mưa vào ban đêm, tay cầm
5micro cầm tay mạ crôm cổ điển gần miệng. Phía sau cô ấy, bảng hiệu neon màu
6magenta và lục lam mờ, mưa nhỏ bắt ánh sáng ngược cứng, hơi nước bốc lên từ lỗ
7thông hơi. Quay trên phim 35mm anamorphic, độ sâu trường ảnh nông, gam màu teal-
8và-magenta, hạt phim hiện rõ. Khuôn mặt cô ấy sắc nét và được chiếu sáng đều bởi
9nguồn sáng chính mềm từ bên trái máy ảnh. Không có chữ ở bất kỳ đâu trong khung hình.

Người phụ nữ tóc bạc cầm micro cổ điển trong thành phố neon mưa

Khung hình nền được tạo: ca sĩ tóc bạc với micro crôm trên sân thượng neon ướt mưa_Khung_ hình nền mà mọi cảnh quay sau đó kế thừa. Được tạo bằng openai/gpt-image-2/text-to-image , chất lượng cao, 2048x1152, được tính $0,1745.

Giao diện trình tạo hình ảnh AI hiển thị cài đặt đầu vào và đầu ra được tạo

GPT Image 2 chạy lời nhắc chính xác này trong sân chơi Atlas Cloud với khung hình đã hoàn thành trong bảng đầu ra

Cùng lời nhắc trong sân chơi: Kích thước 16:9 ở 2048x1152, Chất lượng cao và nút Chạy báo giá $0,1745, đó là số tiền API thực sự tính cho tôi. Mức $0,009 trong danh mục là bậc token thấp nhất, không phải cái này. Cùng lời nhắc, seed khác, vì vậy kết xuất này không phải là tệp chính xác ở trên.

Các từ trang phục trong lời nhắc đó (tóc ngắn trắng bạc, áo lưới đen mờ, vòng cổ LED đỏ, khuyên tai bạc) được tái sử dụng nguyên văn trong mọi lời nhắc bên dưới. Sự lặp lại đó là toàn bộ cơ chế nhất quán. Đừng diễn giải nó.

Bước 3: Chạy Cảnh Quay Video Ca Nhạc MiniMax H3 Đầu Tiên Với Âm Thanh Tham Chiếu Miễn Phí

Mô hình: minimax/h3/reference-to-video. Cài đặt: refers = khung hình nền cộng với slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.

Đặt ratio một cách rõ ràng. Mặc định của sân chơi là adaptive và điểm cuối sẽ hài lòng hơn nhiều khi bạn đặt tên cho hình dạng bạn muốn.

plaintext
1Cảnh quay video ca nhạc. Người phụ nữ trong hình ảnh tham chiếu hát bản nhạc tham chiếu
2thẳng vào ống kính trên sân thượng neon ướt, tay cầm micro crôm ở miệng.
3Cô ấy hát dòng đầu tiên mạnh mẽ vào phách mạnh, mắt nhìn chằm chằm vào máy ảnh,
4sau đó ngả đầu ra sau ở nốt kéo dài. Máy ảnh đẩy chậm từ thắt lưng lên
5đến cận cảnh chặt trong suốt tám giây, rung lắc cầm tay vi mô, vệt mưa
6cắt ngang ánh sáng ngược cứng. Hình dạng miệng cô ấy theo các nguyên âm hát của
7âm thanh tham chiếu một cách chính xác, cô ấy đang hát, không phải nói. Giống hệt
8mái tóc ngắn trắng bạc, áo lưới đen mờ và vòng cổ LED đỏ phát sáng như trong
9hình ảnh tham chiếu. Âm thanh: bản nhạc tham chiếu ở âm thanh nổi, cộng với tiếng mưa nhẹ
10và tiếng ồn thành phố xa xa trộn ở mức thấp.

7sPeYEe-xII

Cảnh quay 1, bật âm thanh. 2560x1440, 8,00 giây chính xác, 24 khung hình/giây, âm thanh nổi 32 kHz. 345 giây từ khi gửi đến khi nhận tệp, được tính $1,12. Xem đầu ngả ra sau ở nốt kéo dài khoảng 5 giây.

Giao diện trình tạo video AI hiển thị cài đặt đầu vào và video được tạo

Sân chơi reference-to-video với khung hình nền và đoạn âm thanh đã tải lên và clip đã hoàn thành trong bảng đầu ra

Vật liệu tham chiếu có 2/9: slice-0.mp3 trong một khe, khung hình nền trong khe kia. Độ phân giải 2K, Thời lượng 8 và nút Chạy báo giá $1,12, chính xác là 8 x $0,14. Lưu ý menu thả xuống Tỷ lệ khung hình đang ở adaptive , đây là mặc định của trang; các lệnh gọi API của tôi đặt ratio thành 16:9 một cách rõ ràng.

Một con số đáng để ghi lại: duration: 8 đã cung cấp một container chính xác 8,00 giây. duration: 4 cung cấp 4,46 giây. Nếu bạn định nối trên các vạch nhịp, hãy ở trên các thời lượng trả về chính xác.

Bước 4: Quay Thêm Ba Thế Giới Khác Mà Không Mất Khuôn Mặt

Cùng khung hình nền, cùng câu trang phục, đoạn âm thanh tiếp theo. Mọi thứ khác đều thay đổi.

4a. Đường cao tốc sa mạc vào giờ vàng. refers = khung hình nền + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Cảnh quay video ca nhạc. Cùng người phụ nữ từ hình ảnh tham chiếu đứng trên vạch kẻ
2giữa đường cao tốc sa mạc vắng vẻ vào giờ vàng, không micro, một chiếc áo khoác denim
3chàm mở khoác ngoài cùng chiếc áo lưới đen mờ, vòng cổ LED đỏ vẫn sáng. Cô ấy
4mấp máy môi theo điệp khúc của bản nhạc tham chiếu trong gió trong khi máy ảnh lùi
5về phía sau thấp trên mặt đường nhựa. Không khí nóng bốc lên từ mặt đường, bụi bay,
6bóng cô ấy kéo dài về phía ống kính, một vệt sáng anamorphic cắt ngang ở
7điểm giữa chừng. Tóc, mặt và trang phục giống hệt hình ảnh tham chiếu.
8Âm thanh: bản nhạc tham chiếu trên gió sa mạc rộng mở, rộng và thoáng.

4XEki-v2vCU

Cảnh quay 2, bật âm thanh. Cùng khuôn mặt, nhiệt độ màu đối lập và bản nhạc tham chiếu được phối lại dưới gió mở. 332 giây, $1,12.

4b. Không gian vô cực trắng. refers = khung hình nền + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Cảnh quay video ca nhạc. Cùng người phụ nữ từ hình ảnh tham chiếu trong một studio
2không gian vô cực trắng tinh dưới ánh sáng cao phẳng không có bóng, mặc một chiếc áo
3khoác vinyl đỏ bóng loáng bên ngoài cùng chiếc áo lưới đen mờ, vòng cổ LED đỏ
4hiện ra ở cổ áo. Cô ấy nhảy bốn ô nhịp theo bản nhạc tham chiếu, mái tóc trắng bạc
5quất vào mỗi lần xoay. Khung hình rộng cố định, sau đó một cú zoom nhanh mạnh đến
6cảnh vừa ở phách mạnh thứ hai. Những mảnh giấy trắng nhỏ rơi như hoa giấy
7trong hai giây cuối cùng. Mặt và tóc giống hệt hình ảnh tham chiếu. Âm thanh: bản nhạc
8tham chiếu, khô và gần, cộng với tiếng kêu cót két của giày trên sàn phòng thu.

VAyqdkVpnm0

Cảnh quay 3, bật âm thanh. Ánh sáng phẳng không bóng là nơi khó nhất để che giấu sự thay đổi khuôn mặt và nó đã giữ được . 8,00 giây, $1,12.

4c. Cảnh quay phụ dưới nước, không đồng bộ môi. refers = khung hình nền + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Cảnh quay video ca nhạc. Cùng người phụ nữ từ hình ảnh tham chiếu lơ lửng dưới nước
2trong một bể đen, mái tóc trắng bạc bay xung quanh cô ấy, vòng cổ LED đỏ
3phát sáng xuyên qua nước, áo lưới đen mờ phồng lên từ từ. Một chùm ánh sáng cứng
4từ trên cao trực tiếp; bong bóng nổi lên qua ống kính trong chuyển động chậm. Cô ấy
5mở mắt vào phách mạnh và đưa một tay về phía mặt nước. Cô ấy không
6hát và miệng cô ấy vẫn ngậm. Máy ảnh xoay ba mươi độ xung quanh cô ấy
7trong suốt cảnh quay. Mặt giống hệt hình ảnh tham chiếu. Âm thanh: bản nhạc
8tham chiếu nghe từ trên mặt nước, bị bóp nghẹt và lọc thấp, với các âm bong bóng
9thoáng qua.

fibdweUMRpY

Cảnh quay 4, bật âm thanh. Chỉ dẫn "cô ấy không hát và miệng cô ấy vẫn ngậm" đã được tuân theo, đó là phần hữu ích: âm thanh tham chiếu điều khiển thời gian, không phải một màn trình diễn bắt buộc. 329 giây, $1,12.

Bước 5: Chạy Lần Chụp Đối Chứng, Với Khe Âm Thanh Trống

Cùng lời nhắc như Bước 3, từng chữ một. Thay đổi duy nhất: refers chứa hình ảnh và không có gì khác. 768P, duration: 8.

Clip duy nhất này giải thích toàn bộ cơ chế tốt hơn bất kỳ đoạn văn nào. Nghe nó so với Bước 3.

FAoPplGmKJc

Lần chụp đối chứng. Lời nhắc giống hệt, không có âm thanh tham chiếu, 1344x768, 8,00 giây, 200 giây, $0,80. H3 đã tự viết nhạc nền và màn trình diễn là "ai đó đang hát" chung chung thay vì những lời này.

Đo được so với master của tôi, âm thanh của đối chứng đạt tương quan đường bao 0,26. Âm thanh của Bước 3 đạt 0,956. Khoảng cách đó là những gì khe âm thanh miễn phí mang lại cho bạn.

Bước 6: Phá Vỡ Đồng Bộ Môi Một Cách Có Chủ Đích

Mọi mô hình đều có trần âm tiết. Tìm của bạn có giá $0,40.

Tôi đã tạo một bản nhạc rap tốc độ gấp đôi riêng biệt (minimax/music-2.6 một lần nữa, $0,15), cắt một đoạn 4 giây chạy khoảng sáu âm tiết mỗi giây và đưa nó vào cùng thiết lập sân thượng ở 768P, duration: 4.

plaintext
1Cảnh quay video ca nhạc. Người phụ nữ trong hình ảnh tham chiếu rap bản nhạc tham chiếu
2thẳng vào ống kính trên sân thượng neon ướt, tay cầm micro crôm ở miệng,
3phát âm mọi âm tiết của đoạn rap tốc độ gấp đôi nhanh. Cận cảnh vừa cố định,
4rung lắc cầm tay nhẹ, vệt mưa trong ánh sáng ngược cứng. Hình dạng miệng cô ấy
5theo các âm tiết rap của âm thanh tham chiếu một cách chính xác. Giống hệt
6mái tóc ngắn trắng bạc, áo lưới đen mờ và vòng cổ LED đỏ phát sáng như trong
7hình ảnh tham chiếu. Âm thanh: bản nhạc tham chiếu ở âm thanh nổi cộng với tiếng mưa nhẹ.

jiQVCjOCbKg

Bài kiểm tra căng thẳng, bật âm thanh. 1344x768, 4,46 giây, 192 giây, $0,40. Miệng vẫn hoạt động và vẫn giữ nhịp, nhưng nó ngừng phân giải các phụ âm riêng lẻ và rơi vào một chu kỳ đóng-mở lặp đi lặp lại. Các dòng hát có hình dạng nguyên âm riêng biệt; cái này thì không.

Đánh giá trung thực của tôi từ các tệp đã giao: các nguyên âm hát kéo dài là nơi hoạt động của miệng H3 thực sự thuyết phục và các phụ âm rap dày đặc là nơi nó suy biến thành chuyển động có vẻ hợp lý. Lên kế hoạch cho các cận cảnh của bạn xung quanh các dòng hát và đặt các đoạn rap nhanh vào cảnh quay phụ. Có thêm chi tiết về sự khác biệt giữa nói và hát trong phân tích âm thanh và đồng bộ môi.

Bước 7: Ghép, Tắt Âm Và Đặt Bản Master Lại Trên Video Ca Nhạc MiniMax H3 Của Bạn

Bốn clip chính xác 8,00 giây nối lại thành chính xác 32,00 giây, tức là 16 ô nhịp ở 120 BPM. Không cần cắt tỉa.

plaintext
1# 1. tách âm thanh của mỗi clip
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. nối theo thứ tự ô nhịp (4 x 8s = 32s = 16 ô nhịp @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. đặt master gốc lại
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Tại sao phải tắt âm, nếu mô hình đã trả lại bản nhạc của bạn? Bởi vì bản phối stereo của mỗi clip mang không gian mà lời nhắc của clip đó yêu cầu: mưa ở cảnh 1, gió sa mạc ở cảnh 2, bộ lọc thấp dưới nước ở cảnh 4. Đẹp cho từng cảnh, nhưng không mạch lạc khi cắt. Bản master cung cấp cho bạn một bản phối liên tục ở tốc độ bit đầy đủ mà không cần mã hóa lại cho mỗi cảnh. H3 cung cấp đồng bộ hóa màn trình diễn. Bản master của bạn cung cấp bài hát.


Bốn Biến Thể Của Công Thức Video Ca Nhạc MiniMax H3

Cắt cho phát hành dọc. Đặt ratio: 9:16 và bạn có được một đoạn Spotify Canvas hoặc một đoạn Shorts từ cùng khung hình nền và cùng các đoạn. Nó trả về đúng 768x1344, vì vậy không giống như menu thả xuống tỷ lệ trong sân chơi, giá trị ratio của API thực sự được giữ nguyên. Canvas loop là im lặng theo thiết kế, vì vậy cái này được xuất dưới dạng GIF.

Người phụ nữ tóc bạc cầm micro trên sân thượng thành phố mưa

Một vòng lặp cắt dọc 9:16 của cùng nghệ sĩ trên sân thượng neon_Cùng khung hình nền, cùng đoạn tham chiếu,_ ratio: 9:16 ở 768P với giá $0,80. Một nếp nhăn trung thực: tôi yêu cầu "không hát" và vẫn nhận được hát. Với giọng hát trong khe tham chiếu, âm thanh thắng cuộc tranh luận. Nếu bạn muốn một người biểu diễn im lặng, hãy cung cấp một đoạn nhạc cụ.

Video tham chiếu thay vì hình ảnh tham chiếu. Bạn có thể đưa cho H3 tối đa ba clip video tham chiếu để mang chuyển động và khung hình thay vì mô tả chúng. Hãy để ý đến đồng hồ đo: video tham chiếu _được tính phí theo tỷ lệ đầu ra, trong khi âm thanh tham chiếu là miễn phí. Sự bất đối xứng đó là thông tin giá hữu ích nhất trên điểm cuối này.

Trình tạo hình ảnh thuần túy cho cảnh phụ. Bỏ hoàn toàn người biểu diễn. Cung cấp một bức ảnh sản phẩm, một bìa album hoặc một tấm kết cấu cùng với đoạn âm thanh và chỉ nhắc chuyển động máy ảnh. Không có khuôn mặt để giữ, không có đồng bộ môi để phá vỡ và bạn có thể quay toàn bộ ở 768P.

Làm nháp rẻ, hoàn thiện đắt. 768P có giá $0,10/giây so với $0,14/giây của 2K và cả hai đều trả về âm thanh nổi 32 kHz giống hệt nhau, vì vậy màn trình diễn bạn đánh giá là giống nhau. Khoản tiết kiệm không phải ở những lần giữ lại, mà là ở những lần từ chối: mỗi lần chụp thất bại 8 giây có giá $0,80 thay vì $1,12. Quay ở 768P cho đến khi lần chụp đúng, sau đó trả $1,12 một lần. Trên một cảnh quay mất ba lần thử, đó là $2,72 thay vì $3,36. Thêm về sự khác biệt bậc trong so sánh 768P và 2K và về mức độ một clip đơn lẻ có thể kéo dài trong hướng dẫn độ dài clip.


Chi Phí Thực Tế Của Một Video Ca Nhạc MiniMax H3 Đầy Đủ

Mọi dòng bên dưới là một con số thanh toán thực tế được lấy từ bản ghi dự đoán sau khi hoàn thành, không phải giá niêm yết.

Khoản mụcMô hình và cài đặtĐã tính phí
Đoạn điệp khúc, bài hát 70 giâyminimax/music-2.6, mp3 44,1 kHz$0,15
Khung hình nền nghệ sĩopenai/gpt-image-2/text-to-image, high, 2048x1152$0,17
Cảnh quay 1, sân thượng neonminimax/h3/reference-to-video, 2K, 8 giây$1,12
Cảnh quay 2, đường cao tốc sa mạcsame, 2K, 8 giây$1,12
Cảnh quay 3, không gian vô cực trắngsame, 2K, 8 giây$1,12
Cảnh quay 4, dưới nướcsame, 2K, 8 giây$1,12
Tổng phụ video đã hoàn thành $4,80
Thử nghiệm xác thực768P, 4 giây$0,40
Chụp đối chứng, không âm thanh768P, 8 giây$0,80
Bản nhạc rap cho bài kiểm tra căng thẳngminimax/music-2.6$0,15
Bài kiểm tra căng thẳng đồng bộ môi768P, 4 giây$0,40
Cắt dọc Canvas768P, 8 giây, 9:16$0,80
Hình ảnh chính cho bài viết nàyopenai/gpt-image-2/text-to-image, high$0,17
Kiểm tra vượt giới hạn, 24 giây âm thanhbị từ chối khi gửi$0,00
Bốn lần gửi với MIME âm thanh saibị từ chối khi gửi$0,00
Âm thanh tham chiếu, 4 x 8 giâyđầu vào miễn phí$0,00
Tổng chi tiêu $7,53

Đó là $9,00 cho mỗi phút hoàn thành ở 2K cho các cảnh quay được chọn, trước bất kỳ sai lầm nào của tôi. Quay toàn bộ ở 768P, cùng một phút có giá $6,61. Một đoàn làm MV con người không báo giá một trong hai con số đó.

Hai lưu ý vận hành nếu bạn đang lập ngân sách cho một tác phẩm dài hơn. Các lần từ chối khi gửi là miễn phí, vì vậy các tham số xấu khiến bạn mất thời gian và không có gì khác. Và trường price trên một dự đoán xuất hiện có độ trễ, vì vậy hãy thăm dò lại ID yêu cầu sau khi tệp tải xuống nếu bạn muốn có hóa đơn thực tế thay vì null.


Bài Hát Của Ai, Khuôn Mặt Của Ai: Những Điều Cần Kiểm Tra Trước Khi Xuất Bản

Ngắn gọn, vì nó quan trọng và không cần một bài giảng.

Bạn cần có quyền đối với bản nhạc tham chiếu. Đầu vào miễn phí không có nghĩa là giải phóng mặt bằng miễn phí. Đưa một đĩa đơn phát hành thương mại vào làm âm thanh tham chiếu, sau đó xuất bản những gì ra, là con đường nhanh nhất đến một lệnh gỡ xuống. Bản ghi âm của riêng bạn, một bản nhạc bạn đã đặt hàng hoặc thứ gì đó bạn đã tạo ra là ổn.

Đừng xây dựng khung hình nền từ khuôn mặt của một nghệ sĩ thực sự còn sống. Cơ chế nhất quán ở đây rất tốt trong việc giữ một khuôn mặt qua các cảnh quay, đó chính xác là lý do tại sao chỉ nó vào một người thật là một ý tưởng tồi.

Trọng lượng mở và quyền truy cập API là hai giấy phép khác nhau. MiniMax đã xuất bản trọng lượng của H3 trên Hugging Face vào tháng 8 năm 2026 và giấy phép cộng đồng của nó hiện loại trừ EU, Vương quốc Anh, Hàn Quốc và Hoa Kỳ, với một kênh cấp phép chính thức mở cho các vùng lãnh thổ đó. Hạn chế đó gắn liền với việc tự chạy trọng lượng. Gọi mô hình thông qua một API được lưu trữ là một mối quan hệ dịch vụ và không đặt bạn dưới giấy phép trọng lượng. Đáng để biết bạn đang ở trong tình huống nào trước khi bạn giả định theo một trong hai cách.

Để có cái nhìn rộng hơn về vị trí của H3 so với các lựa chọn thay thế, có một so sánh Seedance 2.5 và một hướng dẫn cấu trúc lời nhắc. Để biết bối cảnh tại sao nó đáng để gặp rắc rối: trên bảng xếp hạng chỉnh sửa video tính điểm theo âm thanh, H3 hiện đứng đầu ở mức 1.126 Elo, trước Gemini Omni Flash ở mức 1.119 và Dreamina Seedance 2.0 ở mức 1.027 (Artificial Analysis, đã kiểm tra ngày 10 tháng 8 năm 2026). Các điểm số đó thay đổi theo phiếu bầu, vì vậy hãy coi chúng như một ảnh chụp nhanh.


Video Ca Nhạc MiniMax H3: Các Câu Hỏi Thường Gặp

Một video ca nhạc MiniMax H3 có thể chạy đủ ba phút không?

Không trong một lần tạo. Một lần gọi duy nhất giới hạn ở 15 giây. Nhưng đó là giới hạn cho mỗi lần tạo, không phải cho mỗi dự án. Một video ba phút với 8 giây mỗi cảnh là 23 lần tạo, khoảng $25,76 ở 2K và mỗi lần sẽ rơi vào vạch nhịp nếu bản nhạc của bạn là 120 BPM. Cắt, quay, nối, đặt master lại.

Video ca nhạc MiniMax H3 có sử dụng bài hát thực tế của tôi không, hay mô hình tạo lại âm thanh?

Nó sử dụng bài hát thực tế của bạn. Tôi đã đo tương quan dạng sóng thô 0,892 ở độ lệch mẫu bằng không giữa tệp mp3 8 giây tôi tải lên và luồng âm thanh bên trong tệp mp4 được trả về, với không gian được yêu cầu của lời nhắc được xếp chồng lên trên. Một lần chụp đối chứng được tạo mà không có âm thanh tham chiếu đạt 0,26 so với cùng master. Bạn vẫn nên đặt master của mình lại trên bản nối cuối cùng, bởi vì mỗi clip mang không gian riêng cho mỗi cảnh và mã hóa AAC riêng, những thứ này không tồn tại qua một lần cắt sạch sẽ.

Việc đưa một bài hát vào video ca nhạc MiniMax H3 có tốn thêm chi phí không?

Không. Bốn đoạn tham chiếu 8 giây của tôi đã thêm $0,00 vào hóa đơn $4,48 cho các cảnh quay. Video tham chiếu mới là thứ cần chú ý, vì nó được tính phí theo tỷ lệ đầu ra. Các giới hạn là ba clip âm thanh, mỗi clip 2 đến 15 giây, tổng cộng 15 giây và âm thanh không bao giờ có thể là tham chiếu duy nhất.

Đồng bộ môi của MiniMax H3 khi hát tốt như thế nào so với nói?

Các nguyên âm hát kéo dài là thế mạnh của nó: hình dạng miệng riêng biệt, giữ nguyên nốt nhạc và động tác ngả đầu ra sau ở nốt dài đọc như một màn trình diễn chứ không phải vòng lặp. Phát âm dày đặc là nơi nó bỏ cuộc. Bài kiểm tra rap sáu âm tiết mỗi giây của tôi giữ được nhịp nhưng ngừng phân giải các phụ âm và rơi vào một chu kỳ đóng-mở lặp đi lặp lại. Đặt các đoạn rap nhanh vào cảnh quay phụ.

Làm thế nào để giữ cùng một khuôn mặt qua mọi cảnh quay của video ca nhạc MiniMax H3?

Ba điều, tất cả đều nhàm chán. Một hình ảnh tham chiếu được tái sử dụng trong mọi lần gọi, không bao giờ được tạo lại. Cùng từ ngữ trang phục được sao chép nguyên văn giữa các lời nhắc, không diễn giải. Và một mệnh đề "giống hệt hình ảnh tham chiếu" rõ ràng trong mỗi lời nhắc. Bốn cảnh quay của tôi đã vượt qua mưa, nắng thấp, ánh sáng cao phẳng và dưới nước mà không có sự thay đổi.

Một video ca nhạc MiniMax H3 có giá bao nhiêu cho mỗi phút hoàn thành?

$9,00 cho mỗi phút hoàn thành ở 2K, dựa trên hóa đơn thực tế của tôi là $4,80 cho một đoạn cắt 32 giây. Quay toàn bộ ở 768P, cùng một phút có giá $6,61 và 768P cung cấp cùng âm thanh nổi 32 kHz, vì vậy màn trình diễn bạn đánh giá là giống hệt nhau. Quay các lần từ chối của bạn ở $0,80 và trả $1,12 chỉ cho lần chụp sống sót qua quá trình chỉnh sửa.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình