
심야 컬러 그레이딩룸, 여섯 대의 모니터에 같은 은발 가수의 여섯 가지 다른 샷이 표시됨_여섯_ 샷, 한 명의 아티스트, 한 곡. openai/gpt-image-2/text-to-image 로 생성됨.
Suno 사용자는 하루에 약 700만 곡을 생성하며, 이는 2주마다 전체 Spotify 카탈로그에 해당하는 양입니다(TechCrunch, 2026년 2월). 그중 거의 어떤 곡도 사진이 첨부되지 않을 것입니다. 사진이 불가능해서가 아니라, 전통적인 방식은 네 가지 도구를 거치기 때문입니다: 스틸 생성, 애니메이션, 별도 립싱크 패스, 그리고 편집에서 모든 것을 수정. 모든 단계에서 얼굴, 옷, 또는 비트가 손실됩니다.
그래서 저는 단계를 건너뛰었습니다. 후렴구의 8초 조각을 비디오 모델의 참조 슬롯에 바로 넣고 실행 버튼을 눌렀습니다. 오디오에 대해서는 비용이 청구되지 않았습니다.
그런 다음 완성된 mp4를 분해하여 인터넷에서 아무도 정직하게 답하지 않는 한 가지 질문에 답했습니다: 모델에서 나오는 사운드가 내 노래인가, 아니면 비슷하게 들리도록 모델이 만들어낸 것인가? 측정해 보았습니다. 결과는 예상과 달랐고, 이는 작업물을 편집하는 방식을 바꿉니다.
핵심 요점
- 참조 오디오는 무료입니다. MiniMax H3는 출력 초만 청구합니다. 제가 사용한 8초짜리 참조 조각 4개는 청구서에 $0.00를 추가했습니다. 비용이 많이 드는 것은 참조 비디오 입니다.
- 15초는 프로젝트 제한이 아니라 생성당 상한선입니다. 노래를 조각내고, 샷당 하나의 조각을 생성한 후 연결합니다. 제 32초 컷은 4번의 생성입니다.
- 후렴구를 120 BPM으로 작성하세요. 한 마디는 정확히 2.000초이므로, H3의 정수초
duration값이 수동 조정 없이 마디선에 맞춰집니다. 8초 = 4마디.- 출력 오디오는 당신의 트랙이며, 샘플 정렬되어 있습니다. 입력 조각과 H3가 전달한 스테레오 믹스 사이의 제로 지연에서 웨이브폼 상관관계를 0.892로 측정했습니다. 재생성된 것이 아닙니다. 최종 컷을 위해 마스터를 다시 입히는 것이 좋습니다. 이유는 아래에 있습니다.
- 실제 총 지출: $7.53 실패를 포함한 9번의 생성에 걸쳐. 최종 컷에 포함된 4개의 샷과 노래, 기본 프레임의 비용은 $4.80이었습니다.
하나의 32초 후렴구로 편집한 MiniMax H3 뮤직 비디오
소리 켜세요. 이것은 4개의 개별 생성물을 트랜지션 없이 연결하고, 원본 32초 마스터를 위에 덧입힌 것입니다.
TfrOvWHf4ys
"MIRA", 32초, 2560x1440, 24fps. 각 8초씩 4개의 minimax/h3/reference-to-video 생성, 샷당 $1.12. 노래는 참조 오디오로 입력되었으며 비용은 $0.00입니다.
4개의 생성, 4개의 완전히 다른 조명 세계, 하나의 얼굴. 그 사이에 어떤 것도 수정되지 않았습니다.

네 개의 샷에서 가져온 한 프레임으로, 네온 옥상, 사막 고속도로, 흰색 스튜디오, 검은색 수조에서 같은 가수를 보여줌_각_ 전달된 클립에서 하나씩 뽑은 프레임. 비, 낮은 태양, 평평한 하이키, 수중에서도 같은 머리, 같은 메쉬 탑, 같은 빨간 LED 초커.
대부분의 MiniMax H3 뮤직 비디오 시도가 16초 만에 실패하는 이유
세 가지 실패 모드, 모두 피할 수 있습니다.
첫째: 15초를 프로젝트 한계로 간주. H3는 단일 생성을 15초로 제한합니다. 사람들은 이를 읽고 "뮤직 비디오 불가능"이라고 결론짓고 포기합니다. 하지만 뮤직 비디오는 결코 하나의 샷이 아닙니다. 실제 영상은 어차피 4~8초마다 컷이 바뀝니다. 이 제한은 편집자가 어차피 했을 작업을 강제로 하게 만드는 것뿐입니다.
둘째: 리듬을 말로 설명. "신나고, 활기차며, 비트에 맞춰 춤추는"은 모델이 고정할 수 있는 것을 제공하지 않습니다. 모델이 템포를 임의로 만들고, 컷 포인트가 영원히 반 박자씩 어긋나게 됩니다. 실제 오디오를 제공하면 추측이 사라집니다.
셋째: 의상이 바뀌도록 방치. 모든 샷은 동일한 참조 이미지 와 동일한 의상 문구를 그대로 사용해야 합니다. 샷 사이에 "검은색 메쉬 탑"을 "어두운 메쉬 셔츠"로 바꾸면 다른 사람이 나옵니다.
두 가지 경로의 실제 비용은 다음과 같습니다:
| 전통적인 4도구 체인 | 단일 H3 참조 호출 | |
|---|---|---|
| 샷당 도구 | 이미지 모델, 비디오 모델, 립싱크 도구, NLE | 하나의 엔드포인트, 마지막에 NLE만 |
| 샷당 수동 단계 | 4번의 핸드오프, 3번의 파일 내보내기 | 1번 제출 |
| 캐릭터 유지 방법 | 수동 재프롬프팅과 운 | 하나의 참조 이미지를 그대로 재사용 |
| 사진과 사운드 | 별도로 렌더링, 나중에 정렬 | 동일 패스에서 생성, 32kHz 스테레오 |
| 8초 샷당 비용 | 4개의 별도 미터 | 2K에서 $1.12, 768P에서 $0.80 |
기존 경로에 공평하게 말하자면: 불가능한 것은 아닙니다. 일본 크리에이터 Arata Fukoe는 완전 AI 뮤직 비디오로 Project Odyssey 동상을 수상했으며, Queen과 Linkin Park 모두 공식 AI 지원 비디오를 출시했습니다. 그 체인은 단지 4~5개의 도구를 거쳤을 뿐이며, 이것이 바로 한 곡을 가진 독립 아티스트가 할 시간이 없는 일입니다.
참조 오디오가 MiniMax H3 뮤직 비디오에 실제로 제공하는 것
비용을 지출하기 전에 이해할 가치가 있는 부분입니다.
H3는 완성된 프레임에 오디오를 더빙하는 대신 하나의 패스로 영상과 사운드를 생성합니다. 참조 트랙을 제공하면, 그 트랙은 분위기 메모가 아닙니다. 입력 조각과 전달된 mp4 내부의 오디오 스트림을 웨이브폼 수준에서 8kHz 모노 다운믹스로 비교했습니다:
- 엔벨로프 상관관계: 0.956 (제로 지연)
- 2초 창에 대한 원시 웨이브폼 상관관계: 0.892 (제로 샘플 오프셋)
이는 모델이 비슷한 노래를 재현하는 것이 아닙니다. 당신의 파일이 샘플 정렬되어 있으며, 프롬프트가 요청한 앰비언스가 위에 더해지고 AAC 재인코딩이 한 번 적용된 것입니다. 비교를 위해, 참조 오디오 없이 생성된 컨트롤 테이크를 동일한 마스터에 대해 측정한 결과는 0.26으로, 이는 노이즈 플로어입니다.

입력 조각의 웨이브폼(위)과 H3가 전달한 오디오(아래), 제로 오프셋에서 정렬됨_위: 업로드한 8초 mp3. 아래: H3가 반환한 mp4 내부의 오디오 스트림. 동일한 피크, 동일한 위치, 오프셋 없음._
입력 제한은 엄격하며, 제출 시점에 조용히 적용되지 않고 명시적으로 적용됩니다:
| 참조 입력 | 제한 | 청구됨 |
|---|---|---|
| 이미지 | 최대 9개 | Atlas Cloud의 H3 엔드포인트에서 무료 |
| 비디오 | 최대 3개, 각 2~15초 | 출력 요율로 청구 |
| 오디오 | 최대 3개, 각 2~15초, 모든 클립 합계 15초 | $0.00 |
| 오디오 단독 | 거부됨, 최소 하나의 이미지 또는 비디오 필요 | 해당 없음 |
의도적으로 총 오디오 상한선을 테스트하기 위해 한 번의 호출에 8초 조각 3개를 보냈습니다. 5.8초 만에 invalid params, total audio duration 24138 ms exceeds 15000 ms 오류로 실패했으며 청구되지 않았습니다. 좋은 소식: H3는 추가 파일을 조용히 버리고 비용을 청구하지 않습니다.
그 전에 또 하나의 함정을 발견했습니다. 오디오를 base64 데이터 URL로 전달하면 MIME 타입이 API가 추론하는 확장자를 결정합니다. data:audio/mpeg는 audio format ".mpeg" not allowed 오류로 거부됩니다. data:audio/mp3는 통과합니다. 이 문제로 4번의 제출이 실패했으며, 모두 무료였습니다.
MiniMax H3 뮤직 비디오 워크플로우 및 각 초의 비용
아래의 모든 것은 Atlas Cloud의 API 키를 통해 실행되며, 여기서 모든 것을 실행하고 청구했습니다. 3개의 모델, 1개의 브라우저 탭.
| 단계 | 모델 | 기능 | 실제 청구된 가격 |
|---|---|---|---|
| 후렴구 작성 | minimax/music-2.6 | 스타일 프롬프트와 가사로 전체 곡 생성, mp3 최대 ~5분 | 노래당 $0.15, 고정 |
| 아티스트 고정 | openai/gpt-image-2/text-to-image | 모든 샷이 상속하는 하나의 기본 프레임 | $0.1745 (quality high, 2048x1152) |
| 각 샷 촬영 | minimax/h3/reference-to-video | 이미지 + 오디오 입력, 비트에 고정된 클립, 스테레오 사운드 출력 | 2K에서 $0.14/s, 768P에서 $0.10/s. 오디오 입력 $0.00 |
표에 대한 두 가지 참고 사항: 나열된 숫자는 양방향으로 거짓말을 합니다. GPT Image 2는 카탈로그에 $0.009의 최저 가격을 표시하지만, 이는 가장 낮은 토큰 등급이며 실제 2048x1152 high 렌더링은 $0.1745가 청구됩니다. H3의 카탈로그 항목은 $0.10을 표시하지만, 이는 768P 등급만 해당됩니다. 제 8초 2K 작업은 각각 정확히 $1.12가 청구되었으며, 이는 초당 $0.14입니다.
주제 참조 대신 첫 프레임 고정을 원한다면 [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video)는 동일한 요율을 적용하며, [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video)는 순수 프롬프트 샷을 다룹니다.
수정할 가치가 있는 부분: 이 계획의 초기 버전은 플랫폼에 전체 곡 생성기가 없었기 때문에 자체 노래를 가져와야 한다고 가정했습니다. 이제는 있습니다. minimax/music-2.6이 트랙을 작성하므로, 노래를 포함한 전체 체인이 한 곳에서 실행됩니다.
MiniMax H3 뮤직 비디오 제작 방법, 단계별
1단계: 120 BPM 후렴구를 작성하고 샷별 조각으로 자르기
명시적으로 120 BPM을 요청하세요. 120 BPM에서 한 마디는 정확히 2.000초이므로, H3의 정수초 duration 열거형이 자동으로 마디선에 맞춰집니다: 4초 = 2마디, 6초 = 3마디, 8초 = 4마디, 10초 = 5마디. 마커를 하나도 건드리지 않고 컷이 다운비트에 떨어집니다.
모델: minimax/music-2.6. 설정: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
스타일 프롬프트:
plaintext1정확히 120 BPM의 신스팝, 직선적인 4온더플로어 킥, 밝은 아날로그 2사이드체인 패드, 믹스 앞쪽에 자리잡은 깨끗한 여성 리드 보컬, 넓은 3스테레오 코러스, 랩 없음, 지속적인 열린 모음, 영화적이고 약간 4우울한, 라디오 레디 마스터
가사:
plaintext1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
75초 만에 70초짜리 트랙을 $0.15에 반환했습니다. 그런 다음 신뢰하지 않고 onset-novelty 자기상관을 통해 템포를 확인했습니다. 가장 강한 지연은 정확히 0.500초로, 이는 120 BPM이며, 비트 그리드는 디코딩된 파일의 0초가 아닌 0.24초에서 시작합니다. 이 오프셋이 중요합니다: 0.24초부터 자르면 모든 조각이 다운비트에서 시작됩니다.
plaintext1# 32초 마스터, 다운비트인 0.24초부터 시작 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# 4개의 8초 조각, 샷당 하나, 각 4마디, 15초 제한을 훨씬 밑돎 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
이미 자신의 트랙이 있다면 이 단계를 완전히 건너뛰세요. 그것이 일반적인 경우이며, 가장 저렴한 방법입니다.
2단계: 하나의 GPT Image 2 기본 프레임으로 아티스트 고정
모든 샷이 이 단일 파일을 참조합니다. 여기서 잘못된 것은 네 번 잘못된 것이므로, $0.17을 투자하여 제대로 확인하세요.
모델: openai/gpt-image-2/text-to-image. 설정: quality high , size 2048x1152 (16:9).
plaintext1영화적인 뮤직 비디오 스틸, 허리 위쪽 초상화. 은백색 짧은 머리와 일자형 앞머리를 가진 25세 동아시아 여성 2신스팝 가수, 무광 검은색 메쉬 탑, 쇄골에 닿는 얇은 빨간 LED 초커, 그리고 하나의 3은색 귀걸이. 그녀는 빗물에 젖은 옥상에서 밤에 서서 빈티지 크롬 4핸드헬드 마이크를 입 가까이에 대고 있습니다. 그녀 뒤로, 초점이 흐려진 마젠타 5및 시안 네온 사인, 강한 역광에 잡힌 가는 빗줄기, 환풍구에서 피어오르는 증기. 635mm 아나모픽 렌즈로 촬영, 얕은 심도, 틸-앤-마젠타 그레이딩, 7가시적인 필름 그레인. 그녀의 얼굴은 카메라 왼쪽에서 오는 부드러운 키 라이트로 선명하고 균일하게 조명됨. 프레임 내 텍스트 없음.

생성된 기본 프레임: 빗속 네온 옥상에서 크롬 마이크를 든 은발 가수_이후_ 모든 샷이 상속하는 기본 프레임. openai/gpt-image-2/text-to-image 로 생성, quality high, 2048x1152, $0.1745 청구됨.

Atlas Cloud 플레이그라운드에서 이 정확한 프롬프트를 실행 중인 GPT Image 2, 출력 패널에 완성된 프레임
플레이그라운드의 동일한 프롬프트: Size 16:9 at 2048x1152, Quality high, 그리고 $0.1745를 인용하는 실행 버튼, 이는 API가 실제로 청구한 금액입니다. 카탈로그의 $0.009는 가장 낮은 토큰 등급으로, 이 경우가 아닙니다. 동일한 프롬프트, 다른 시드이므로 이 렌더링은 위의 정확한 파일이 아닙니다.
해당 프롬프트의 의상 단어(은백색 짧은 머리, 무광 검은색 메쉬 탑, 빨간 LED 초커, 은색 귀걸이)는 아래의 모든 프롬프트에서 그대로 재사용됩니다. 이 반복이 전체 일관성 메커니즘입니다. 의역하지 마세요.
3단계: 무료 참조 오디오로 첫 번째 MiniMax H3 뮤직 비디오 샷 실행
모델: minimax/h3/reference-to-video. 설정: refers = 기본 프레임 + slice-0.mp3 , resolution: 2K, duration: 8, ratio: 16:9.
ratio를 명시적으로 설정하세요. 플레이그라운드 기본값은 adaptive이며, 엔드포인트는 원하는 형태를 지정할 때 훨씬 잘 작동합니다.
plaintext1뮤직 비디오 샷. 참조 이미지의 여성이 젖은 네온 옥상에서 참조 트랙을 2렌즈 정면으로 부르며, 크롬 마이크를 입에 댑니다. 그녀는 첫 번째 라인을 3다운비트에 강하게 넣고, 눈을 카메라에 고정한 후, 지속 음에서 고개를 뒤로 젖힙니다. 48초 동안 허리 위쪽에서 타이트한 클로즈업으로 느린 푸시인, 핸드헬드 마이크로 드리프트, 5강한 역광을 가로지르는 빗줄기. 그녀의 입 모양은 참조 오디오의 노래 모음을 정확히 따르며, 6말하는 것이 아니라 노래하고 있습니다. 참조 이미지와 동일한 은백색 짧은 머리, 7무광 검은색 메쉬 탑, 빛나는 빨간 LED 초커. 사운드스케이프: 스테레오의 참조 트랙, 8약한 빗소리와 먼 도시 소음이 믹스 아래에 깔림.
7sPeYEe-xII
샷 1, 소리 켜기. 2560x1440, 정확히 8.00초, 24fps, 32kHz 스테레오. 제출부터 파일까지 345초, $1.12 청구됨. 약 5초 지점의 지속 음에서 고개를 뒤로 젖히는 모습을 보세요.

기본 프레임과 오디오 조각이 로드되고 출력 패널에 완성된 클립이 있는 reference-to-video 플레이그라운드
참조 자료: 2/9 읽음: slice-0.mp3 이 한 슬롯, 기본 프레임이 다른 슬롯. Resolution 2K, Duration 8, 그리고 $1.12를 인용하는 실행 버튼, 이는 정확히 8 x 0.14$입니다. Aspect Ratio 드롭다운이 adaptive 에 설정되어 있는데, 이는 페이지 기본값입니다. 제 API 호출은 ratio 를 16:9로 명시적으로 설정했습니다.
기록할 가치가 있는 숫자 하나: duration: 8은 정확히 8.00초의 컨테이너를 전달했습니다. duration: 4는 4.46초를 전달했습니다. 마디선에 맞춰 연결하려면 정확하게 반환되는 지속 시간을 사용하세요.
4단계: 얼굴을 잃지 않고 세 개의 다른 세계 촬영
동일한 기본 프레임, 동일한 의상 문장, 다음 오디오 조각. 다른 모든 것은 변경됩니다.
4a. 황금 시간대의 사막 고속도로. refers = 기본 프레임 + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1뮤직 비디오 샷. 참조 이미지의 동일한 여성이 황금 시간대의 빈 사막 고속도로 2중앙선에 서서 마이크 없이, 동일한 무광 검은색 메쉬 탑 위에 열린 남색 데님 재킷을 입고, 3빨간 LED 초커는 여전히 켜져 있습니다. 그녀는 바람을 향해 참조 트랙의 후렴구를 입 모양으로 따라 부르며, 4카메라는 아스팔트 위로 낮게 뒤로 트래킹합니다. 도로의 아지랑이, 먼지가 일고, 5그림자가 렌즈를 향해 길게 늘어지며, 중간 지점에서 아나모픽 플레어가 교차합니다. 6참조 이미지와 동일한 머리, 얼굴 및 의상. 사운드스케이프: 열린 사막 바람 속의 참조 트랙, 7넓고 공기가 많음.
4XEki-v2vCU
샷 2, 소리 켜기. 동일한 얼굴, 반대 색온도, 참조 트랙이 열린 바람 아래에서 리믹스됨. 332초, $1.12.
4b. 흰색 무한 큐브. refers = 기본 프레임 + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1뮤직 비디오 샷. 참조 이미지의 동일한 여성이 그림자가 없는 평평한 하이키 조명 아래 2순백색 무한 큐브 스튜디오에 서서, 동일한 무광 검은색 메쉬 탑 위에 광택이 나는 빨간색 비닐 트렌치 코트를 입고, 3칼라에 빨간 LED 초커가 보입니다. 그녀는 참조 트랙에 맞춰 네 마디를 춤추며, 4은백색 머리가 각 회전마다 휘날립니다. 고정된 와이드 프레임, 그런 다음 두 번째 다운비트에서 5하드 스냅 줌으로 미디엄 샷. 마지막 2초 동안 작은 흰색 종이 사각형이 색종이처럼 떨어집니다. 6참조 이미지와 동일한 얼굴과 머리. 사운드스케이프: 드라이하고 가까운 참조 트랙, 7스튜디오 바닥의 신발 끽하는 소리.
VAyqdkVpnm0
샷 3, 소리 켜기. 평평한 그림자 없는 조명은 얼굴 변경을 숨기기 가장 어려운 곳이며, 유지되었습니다 . 8.00초, $1.12.
4c. 수중 B-롤, 립싱크 없음. refers = 기본 프레임 + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1뮤직 비디오 샷. 참조 이미지의 동일한 여성이 검은색 수조에 물속에 떠 있으며, 2은백색 머리가 주변에 퍼지고, 빨간 LED 초커가 물을 통해 빛나며, 3검은색 메쉬 탑이 천천히 부풀어 오릅니다. 바로 위에서 하나의 강한 빛줄기; 4렌즈를 지나 슬로우 모션으로 거품이 올라옵니다. 그녀는 다운비트에 눈을 뜨고 5한 손을 수면을 향해 뻗습니다. 그녀는 노래하지 않으며 입은 닫혀 있습니다. 6카메라는 샷 전체에 걸쳐 그녀 주위를 30도 회전합니다. 참조 이미지와 동일한 얼굴. 7사운드스케이프: 수면 위에서 들리는 참조 트랙, 음소거되고 로우패스됨, 8거품 소리.
fibdweUMRpY
샷 4, 소리 켜기. "그녀는 노래하지 않으며 입은 닫혀 있다"는 지시가 준수되었으며, 이는 유용한 점입니다: 참조 오디오는 타이밍을 결정하지만, 필수적인 퍼포먼스는 아닙니다. 329초, $1.12.
5단계: 오디오 슬롯을 비운 컨트롤 테이크 실행
3단계와 동일한 프롬프트, 그대로. 유일한 변경: refers는 이미지만 보유하고 오디오는 없음. 768P, duration: 8.
이 하나의 클립이 전체 메커니즘을 어떤 문단보다 더 잘 설명합니다. 3단계와 비교해 들어보세요.
FAoPplGmKJc
컨트롤 테이크. 동일한 프롬프트, 참조 오디오 없음, 1344x768, 8.00초, 200초, $0.80. H3가 자체 사운드트랙을 작성했으며, 퍼포먼스는 "누군가 노래하고 있다"는 일반적인 것일 뿐, 이 특정 가사가 아닙니다.
마스터와 비교했을 때, 컨트롤의 오디오는 0.26의 엔벨로프 상관관계를 기록했습니다. 3단계는 0.956입니다. 이 차이가 무료 오디오 슬롯이 제공하는 것입니다.
6단계: 의도적으로 립싱크 깨기
모든 모델에는 음절 상한선이 있습니다. 자신의 것을 찾는 데 $0.40이 듭니다.
별도의 더블타임 랩 트랙(minimax/music-2.6 다시, $0.15)을 생성하고, 초당 약 6음절 속도의 4초 조각을 잘라 동일한 옥상 설정에 768P, duration: 4로 입력했습니다.
plaintext1뮤직 비디오 샷. 참조 이미지의 여성이 젖은 네온 옥상에서 렌즈 정면으로 2참조 트랙을 랩하며, 크롬 마이크를 입에 대고, 빠른 더블타임 구절의 3모든 음절을 전달합니다. 고정된 미디엄 클로즈업, 약간의 핸드헬드 드리프트, 4강한 역광의 빗줄기. 그녀의 입 모양은 참조 오디오의 랩 음절을 정확히 따릅니다. 5참조 이미지와 동일한 은백색 짧은 머리, 무광 검은색 메쉬 탑, 빛나는 빨간 LED 초커. 6사운드스케이프: 스테레오의 참조 트랙 + 약한 빗소리.
jiQVCjOCbKg
스트레스 테스트, 소리 켜기. 1344x768, 4.46초, 192초, $0.40. 입은 계속 움직이고 비트에 맞춰지지만, 개별 자음을 구분하지 못하고 반복적인 열림-닫힘 주기에 빠집니다. 노래하는 라인은 뚜렷한 모음 형태를 얻지만, 이는 그렇지 않습니다.
전달된 파일에서 제 솔직한 판단: 지속적인 노래 모음은 H3의 입 움직임이 진정으로 설득력 있는 부분이며, 밀집된 랩 자음은 그럴듯한 움직임으로 저하되는 부분입니다. 클로즈업은 노래하는 라인 주변에 배치하고 빠른 구절은 B-롤에 넣으세요. 말하기와 노래하기의 차이에 대한 더 자세한 내용은 립싱크 및 오디오 분석에서 확인할 수 있습니다.
7단계: 연결, 음소거, 마스터를 MiniMax H3 뮤직 비디오 위에 다시 입히기
정확히 8.00초의 4개 클립을 연결하면 정확히 32.00초가 되며, 이는 120 BPM에서 16마디입니다. 트리밍 불필요.
plaintext1# 1. 각 클립의 오디오 제거 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. 마디 순서로 연결 (4 x 8s = 32s = 16 bars @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. 원본 마스터 다시 입히기 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
모델이 이미 트랙을 반환하는데 왜 음소거하는가? 각 클립의 스테레오 믹스는 해당 클립의 프롬프트가 요청한 앰비언스를 담고 있기 때문입니다: 샷 1의 빗소리, 샷 2의 사막 바람, 샷 4의 수중 로우패스 필터. 샷별로는 훌륭하지만 컷을 가로지르면 일관성이 없습니다. 마스터는 전체 비트레이트에서 하나의 연속적인 믹스를 제공하며, 샷별 재인코딩이 없습니다. H3는 퍼포먼스 싱크를 제공하고, 마스터는 노래를 제공합니다.
MiniMax H3 뮤직 비디오 레시피의 네 가지 변형
세로 릴리스 컷. ratio: 9:16으로 설정하면 동일한 기본 프레임과 동일한 조각으로 Spotify Canvas 또는 Shorts용 슬라이스를 얻을 수 있습니다. 진정한 768x1344로 반환되었으며, 플레이그라운드의 종횡비 드롭다운과 달리 API ratio 값은 실제로 적용됩니다. Canvas 루프는 설계상 무음이므로, 이는 GIF로 제공됩니다.

네온 옥상에서 동일한 아티스트의 세로 9:16 루프 컷_동일한 기본 프레임, 동일한 참조 조각,_ ratio: 9:16 at 768P for $0.80. 한 가지 솔직한 문제점: "노래하지 않음"을 요청했지만 노래가 나왔습니다. 참조 슬롯에 보컬이 있으면 오디오가 우선합니다. 무음 퍼포머를 원한다면 악기 조각을 제공하세요.
참조 이미지 대신 참조 비디오. H3에 최대 3개의 참조 비디오 클립을 제공하여 동작과 프레이밍을 설명 대신 전달할 수 있습니다. 미터를 주시하세요: 참조 _비디오_는 출력 요율로 청구되는 반면, 참조 오디오는 무료입니다. 이 비대칭성은 이 엔드포인트에서 가장 유용한 가격 정보입니다.
순수 B-롤 비주얼라이저. 퍼포머를 완전히 제거하세요. 제품 사진, 앨범 커버 오브젝트 또는 텍스처 플레이트와 오디오 조각을 제공하고, 카메라 움직임만 프롬프트하세요. 유지할 얼굴이 없고, 깨질 립싱크가 없으며, 전체를 768P로 촬영할 수 있습니다.
저렴하게 드래프트, 비싸게 마무리. 768P는 초당 $0.10이고 2K는 초당 $0.14이며, 둘 다 동일한 32kHz 스테레오를 제공하므로, 평가하는 퍼포먼스는 동일합니다. 절감은 최종본이 아닌 폐기물에서 발생합니다: 실패한 8초 테이크마다 $1.12 대신 $0.80이 듭니다. 테이크가 맞을 때까지 768P로 돌리고, 맞으면 $1.12를 한 번 지불하세요. 세 번 시도가 필요한 샷의 경우 $2.72 대신 $3.36입니다. 등급 차이에 대한 자세한 내용은 768P 대 2K 비교에서, 단일 클립의 확장 가능성에 대한 내용은 클립 길이 가이드에서 확인하세요.
전체 MiniMax H3 뮤직 비디오의 실제 비용
아래의 모든 라인은 완료 후 예측 기록에서 가져온 실제 청구 금액이며, 정가가 아닙니다.
| 항목 | 모델 및 설정 | 청구된 금액 |
|---|---|---|
| 후렴구, 70초 노래 | minimax/music-2.6, mp3 44.1 kHz | $0.15 |
| 아티스트 기본 프레임 | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0.17 |
| 샷 1, 네온 옥상 | minimax/h3/reference-to-video, 2K, 8 s | $1.12 |
| 샷 2, 사막 고속도로 | same, 2K, 8 s | $1.12 |
| 샷 3, 흰색 큐브 | same, 2K, 8 s | $1.12 |
| 샷 4, 수중 | same, 2K, 8 s | $1.12 |
| 완성된 비디오 소계 | $4.80 | |
| 검증 프로브 | 768P, 4 s | $0.40 |
| 컨트롤 테이크, 오디오 없음 | 768P, 8 s | $0.80 |
| 스트레스 테스트용 랩 트랙 | minimax/music-2.6 | $0.15 |
| 립싱크 스트레스 테스트 | 768P, 4 s | $0.40 |
| 세로 Canvas 컷 | 768P, 8 s, 9:16 | $0.80 |
| 이 기사용 히어로 이미지 | openai/gpt-image-2/text-to-image, high | $0.17 |
| 오버 리밋 테스트, 24초 오디오 | 제출 시 거부됨 | $0.00 |
| 잘못된 오디오 MIME으로 4회 제출 | 제출 시 거부됨 | $0.00 |
| 참조 오디오, 4 x 8 s | 무료 입력 | $0.00 |
| 총 지출 | $7.53 |
이는 최종 컷에 포함된 샷의 2K 기준 분당 $9.00이며, 제 실수 이전입니다. 동일한 분을 768P로 전부 촬영하면 $6.61입니다. 인간 MV 제작진은 이 중 어느 숫자도 견적하지 않습니다.
더 긴 작품을 예산할 때 참고할 두 가지 운영 참고 사항. 제출 시 거부는 무료이므로, 잘못된 매개변수는 시간만 소모할 뿐 비용이 들지 않습니다. 그리고 예측의 price 필드는 지연되어 채워지므로, 실제 인보이스가 아닌 null을 원한다면 파일 다운로드 후 요청 ID를 다시 폴링하세요.
누구의 노래, 누구의 얼굴: 게시 전 확인할 사항
짧게, 이유가 있고 설교가 필요하지 않기 때문입니다.
참조 트랙에 대한 권한이 필요합니다. 무료 입력이 무료 클리어런스를 의미하지는 않습니다. 상업적으로 발매된 싱글을 참조 오디오로 제공한 다음, 결과물을 게시하는 것은 신속한 삭제 요청으로 가는 지름길입니다. 자신의 녹음, 의뢰한 트랙, 또는 생성한 것은 괜찮습니다.
실제 살아있는 아티스트의 얼굴로 기본 프레임을 만들지 마세요. 여기서 일관성 메커니즘은 샷 전반에 걸쳐 얼굴을 유지하는 데 매우 뛰어나며, 이것이 바로 실제 사람을 대상으로 하는 것이 나쁜 생각인 이유입니다.
오픈 웨이트와 API 접근은 두 가지 다른 라이선스입니다. MiniMax는 2026년 8월에 Hugging Face에 H3의 웨이트를 공개했으며, 커뮤니티 라이선스는 현재 EU, 영국, 한국 및 미국을 제외하고 있으며, 해당 지역을 위한 공식 라이선스 채널이 열려 있습니다. 이 제한은 웨이트를 직접 실행하는 경우에 적용됩니다. 호스팅된 API를 통해 모델을 호출하는 것은 서비스 관계이며, 웨이트 라이선스의 적용을 받지 않습니다. 어느 상황에 있는지 알고 가정하지 마세요.
H3가 대안과 비교하여 어디에 위치하는지에 대한 더 넓은 시각은 Seedance 2.5 비교와 프롬프트 구조 가이드를 참조하세요. 왜 이 모든 수고를 할 가치가 있는지에 대한 맥락: 오디오가 포함된 비디오를 평가하는 비디오 편집 리더보드에서 H3는 현재 1,126 Elo로 1위를 차지하고 있으며, Gemini Omni Flash(1,119)와 Dreamina Seedance 2.0(1,027)을 앞서고 있습니다(Artificial Analysis, 2026년 8월 10일 확인). 이 점수는 표와 함께 변동하므로, 스냅샷으로 간주하세요.
MiniMax H3 뮤직 비디오: 자주 묻는 질문
하나의 MiniMax H3 뮤직 비디오가 전체 3분을 실행할 수 있나요?
하나의 생성으로는 불가능합니다. 단일 호출은 15초로 제한됩니다. 그러나 이는 프로젝트 제한이 아니라 생성당 상한선입니다. 3분 비디오를 8초 샷으로 나누면 23번의 생성이며, 2K 기준 약 $25.76이고, 트랙이 120 BPM이면 각각이 마디선에 맞춰집니다. 조각내고, 촬영하고, 연결하고, 마스터를 다시 입히세요.
MiniMax H3 뮤직 비디오가 실제 내 노래를 사용하나요, 아니면 모델이 오디오를 재생성하나요?
실제 노래를 사용합니다. 제가 업로드한 8초 mp3와 반환된 mp4 내부의 오디오 스트림 사이에서 제로 샘플 오프셋에서 0.892의 원시 웨이브폼 상관관계를 측정했으며, 프롬프트가 요청한 앰비언스가 위에 더해졌습니다. 참조 오디오 없이 생성된 컨트롤 테이크는 동일한 마스터에 대해 0.26을 기록했습니다. 최종 연결물 위에 마스터를 다시 입히는 것이 좋습니다. 각 클립이 자체적인 샷별 앰비언스와 자체 AAC 인코딩을 가지고 있어, 컷을 깔끔하게 통과하지 못하기 때문입니다.
MiniMax H3 뮤직 비디오에 노래를 입력하는 데 추가 비용이 드나요?
아니요. 제 8초 참조 조각 4개는 $4.48 샷 비용에 $0.00를 추가했습니다. 주의해야 할 것은 참조 _비디오_이며, 출력 요율로 청구됩니다. 제한은 오디오 클립 3개, 각 2~15초, 총 15초이며, 오디오는 단독 참조가 될 수 없습니다.
MiniMax H3 립싱크가 노래와 말하기에서 얼마나 좋은가요?
지속적인 노래 모음이 강점입니다: 뚜렷한 입 모양, 음에 맞는 유지, 긴 음에서 고개를 뒤로 젖히는 것이 루프가 아닌 퍼포먼스로 읽힙니다. 밀집된 전달은 약점입니다. 초당 6음절 속도의 랩 테스트는 비트를 유지했지만 자음을 구분하지 못하고 반복적인 열림-닫힘 주기에 빠졌습니다. 빠른 구절은 B-롤에 넣으세요.
MiniMax H3 뮤직 비디오의 모든 샷에서 동일한 얼굴을 유지하려면 어떻게 하나요?
세 가지, 모두 지루합니다. 모든 호출에서 재사용되는 하나의 참조 이미지, 절대 재생성하지 않음. 프롬프트 간에 의역하지 않고 그대로 복사된 동일한 의상 문구. 그리고 각 프롬프트에 "참조 이미지와 동일"이라는 명시적 조항. 제 네 샷은 비, 낮은 태양, 평평한 하이키, 수중을 가로질러 드리프트 없이 통과했습니다.
MiniMax H3 뮤직 비디오의 분당 완성 비용은 얼마인가요?
2K 기준 분당 $9.00이며, 제 실제 청구서 $4.80(32초 컷) 기준입니다. 동일한 분을 768P로 전부 촬영하면 $6.61이며, 768P는 동일한 32kHz 스테레오를 제공하므로 평가하는 퍼포먼스는 동일합니다. 폐기물은 $0.80으로 돌리고, 편집에서 살아남은 테이크에만 $1.12를 지불하세요.






