Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

MiniMax H3 Lip Sync and Audio: 6초 분량의 목소리를 입력했더니 내 파이프라인에서 4개의 도구를 삭제했다

MiniMax H3 립싱크와 오디오가 내 6단계 더빙 체인을 하나의 API 호출로 대체했습니다. 두 번의 실제 테이크, 아무도 문서화하지 않은 참조 오디오 제한, 그리고 실제 청구서.

헤드폰을 쓰고 마이크에 대고 대본을 읽는 남성

이 글의 모든 테이크가 시작되는 심야 라디오 프레임. openai/gpt-image-2/text-to-image, 품질 high, 2048x1152로 생성

아래 전체 튜토리얼의 입력값으로 쓰이는 단일 스틸 이미지. openai/gpt-image-2/text-to-image, 품질 high, 2048x1152로 생성.

8초짜리 샷을 완성했는데 소리가 하나도 나오지 않았던 마지막 순간을 떠올려보세요.

클립을 내보내고, TTS 탭을 열어 대사를 입력했습니다. 빗소리와 룸톤을 찾아 사운드 라이브러리를 뒤졌습니다. 그 모든 것을 타임라인에 끌어다 놓고, 입 모양이 거짓말을 멈출 때까지 파형을 좌우로 밀었습니다. 그래도 결국 별도의 립싱크 모델에 돈을 내고 입을 고쳐야 했습니다. 도구 네 개, wav 파일 세 개, 한 시간이 걸렸고, 결과물은 여전히 더빙처럼 느껴졌습니다. 실제로 더빙이었으니까요.

MiniMax H3가 조용히 없앤 것이 바로 그 체인입니다. '오디오를 지원한다'는 점 때문이 아니라(그런 주장을 하는 모델은 많으니까요), 거의 아무도 테스트하지 않는 요청 본문의 슬롯 하나 때문입니다. 이미 보유한 오디오를 무료로 넣으면 그 목소리를 얼굴에 되살려 줍니다.

아래에서는 그 슬롯만 분리해 검증하는 투 테이크 테스트, 그 슬롯이 대체하는 모든 단계의 실제 가격, 요청을 거부하게 만드는 하드 리밋, 그리고 실제 청구 내역을 다룹니다.

핵심 요약

  • 한 번의 호출로 화면, 대사, 룸톤, 입 움직임이 함께 반환됩니다. 텍스트, 비주얼, 오디오는 각각 별도로 인코딩된 뒤, 단일 Omni Transformer가 비디오와 오디오 잠재 변수를 공동으로 예측합니다(Hugging Face 모델 카드, 2026년 8월).
  • 입력 오디오는 무료입니다. 입력 비디오는 유료입니다. MiniMax는 참조 비디오를 출력 요율로 청구하므로, 동일한 15초 분량의 자료가 음악이면 $0, 비디오 클립이면 약 $1.95입니다.
  • 하드 리밋: 오디오 클립 최대 3개, 각 2~15초, 총 15초. 오디오는 단독으로는 절대 사용할 수 없으며, 반드시 이미지나 비디오 하나 이상과 함께해야 합니다.
  • Atlas Cloud에서 2K 기준 초당 $0.14이므로, 사운드를 포함한 10초 풀 샷은 $1.40입니다. 이미 렌더링한 클립을 패치하는 전용 립싱크 모델의 초당 $0.22보다 저렴합니다.

사운드 온: MiniMax H3 립싱크 및 오디오, 테이크 2개와 6초의 차이

이번 테스트는 헤드폰을 착용하고 보세요. 두 테이크 모두 동일한 베이스 프레임, 동일한 두 줄의 대사, 동일한 프롬프트를 단어 하나까지 똑같이 사용했습니다. 단 한 가지, 한쪽만 6초짜리 음성 녹음을 먼저 들려줬습니다.

fXlyer__czg

소리를 켜고 헤드폰을 착용하세요. 왼쪽 절반(테이크 A, 참조 오디오 없음)은 왼쪽 귀로, 오른쪽 절반(테이크 B, 6초 참조 오디오 포함)은 오른쪽 귀로 들립니다. 동일한 프레임, 동일한 대사, 동일한 프롬프트. 두 테이크 모두 minimax/h3/reference-to-video, 2K, 10초, 2560x1440, 24fps, 32kHz 스테레오 트랙으로 제공됩니다.

테이크 A는 프롬프트에 적힌 '차분하고 낮고 매력적인 남성 방송 음성'이라는 단어뿐이었고, 모델이 음성을 새로 만들어냈습니다. 테이크 B는 완전히 다른 문장의 6.19초짜리 녹음을 받아 그것을 음색(timbre) 앵커로만 사용하라는 지시를 받았습니다. 두 테이크 모두 이후 더빙 작업을 거치지 않았고, 립싱크 모델도 사용하지 않았습니다. 두 테이크 모두 입 모양은 모델이 만들어낸 음성을 따라갑니다. 입과 음성이 함께 생성됐기 때문입니다.

음색은 제 말을 믿기보다 직접 귀로 판단하시면 됩니다. 제가 사실로 말씀드릴 수 있는 것은 메커니즘, 설정, 청구 내역이며, 이어서 설명합니다.

MiniMax H3 립싱크 및 오디오가 모두의 6단계 더빙 체인을 무너뜨린 이유

기존 체인은 사실상 워크플로가 아니라 수리 작업이었습니다.

ImGr2NgcCCY

소리를 켜세요. 밤의 서커스 텐트 안에서 서로 대화하는 3D 애니메이션 두꺼비와 카멜레온. 대화 아래에는 공간의 앰비언스가 깔려 있습니다. H3 네이티브 오디오용 MiniMax 참조 클립입니다. 애니메이션 캐릭터의 입 모양은 가짜로 만들기 가장 어려운 케이스라서, 20초의 시선을 보낼 가치가 있습니다.

세 가지가 계속 문제를 일으켰습니다. 운이 나빠서가 아니라 구조적인 이유로 말입니다.

타임라인은 사람 손에 달려 있었습니다. 비디오 모델은 프레임을 주고, TTS 모델은 파형을 줬습니다. 두 출력물 모두 서로에 대해 아는 것이 없었기 때문에, 정렬은 새벽 1시에 눈으로 초당 30프레임을 판단하는 인간의 몫이었습니다. 리렌더링을 할 때마다 그 판단을 처음부터 다시 해야 했습니다.

패치 방식 립싱크에는 한계가 있습니다. 전용 립싱크 모델은 이미 존재하는 푸티지의 입 영역만 다룹니다. 입이 오디오와 일치하게 만들 수는 있지만, 거센 자음 앞에서 턱에 힘을 주거나, 대사 앞에 숨을 넣거나, 문장이 끝날 때 어깨를 내리는 동작은 만들어낼 수 없습니다. 그 프레임들은 캐릭터가 무슨 말을 할지 아무도 모르는 상태에서 렌더링됐기 때문입니다. 정확성은 있지만 연기는 없고, 그래서 어색하게 느껴집니다.

사운드 디자인은 별도의 프로젝트였습니다. 빗소리, 룸톤, 의자가 삐걱이는 소리, 대화 아래에 깔리는 베이스 라인. 모든 것이 각자 다른 출처에서 왔고, 그 자체로 붙여넣기된 음성과 균형을 맞춰야 했습니다.

오디오 VAE가 알려주는 MiniMax H3 립싱크 및 오디오의 진실

여기서부터는 마케팅 문구가 아닙니다. 파일 이름에서 직접 확인할 수 있기 때문입니다.

H3에서 텍스트는 H3-Encoder를 통과하고, 비주얼 입력은 H3-Encoder와 H3-VisualVAE를 모두 통과하며, 오디오는 독립형 H3-AudioVAE만 통과합니다. 이후 H3-Omni-Transformer가 비디오와 오디오 잠재 변수를 공동으로 예측하고, 이는 각각 비디오와 스테레오 오디오로 별도 디코딩됩니다. AudioVAE는 좌우 채널 간에 하나의 인코더와 디코더를 공유하고, 각 채널을 독립적으로 처리한 뒤 스테레오로 재결합하며, 32kHz 오디오를 40Hz의 시간 비율로 잠재 토큰 시퀀스에 압축합니다(Hugging Face 모델 카드).

ComfyUI가 출시 당일(Day-0) 지원을 제공했을 때, 그 아키텍처는 VAE 폴더에 minimax_h3_video_vae_fp16.safetensorsminimax_h3_audio_vae_fp32.safetensors라는 두 개의 별도 파일로 나타났습니다. 비디오 경로와 오디오 경로를 받는 듀얼 VAE 로더로 로드됩니다(ComfyUI 블로그, 2026년 8월). 오디오는 모델이 처음부터 설계한 양식(modality)이지, 마지막에 덧붙인 포스트프로세스가 아닙니다.

리더보드도 이 점을 확인해 줍니다. Artificial Analysis는 비디오 편집 리더보드에서 H3를 1위로 올렸는데, 5,043개의 블라인드 선호도 샘플 기준 오디오 ELO 1,130을 기록했으며, 텍스트-투-비디오와 이미지-투-비디오 모두에서 상위 3위 안에 들었습니다(Artificial Analysis, 2026년 7월). 이 특정 순위에서 '아주 좋은 화면'과 '1위' 사이의 차이가 바로 오디오입니다.

MiniMax H3 립싱크 및 오디오 워크플로를 대체 체인과 비교해 가격으로 따져 보기

이를 평가하는 정직한 방법은 감이 아니라, 10초 완성 샷을 기준으로 기존 체인의 각 단계를 실제 초당 요율로 계산한 뒤 대체안을 별도로 계산해 보는 것입니다.

#기존 체인, 단계별실행 도구단계 비용MiniMax H3 립싱크 및 오디오 사용 시
1무성 화면 렌더링비디오 모델, 예: bytedance/seedance-2.0, $0.112/s$1.12동일한 단일 호출
2대사 음성 생성minimax/speech-2.6-hd약 250자 기준 약 $0.02동일한 단일 호출
3음악 찾기 또는 제작minimax/music-2.6트랙당 $0.15동일한 단일 호출
4앰비언스 및 효과음 레이어링사운드 라이브러리 + 수작업저녁 시간동일한 단일 호출
5타임라인에서 전체 정렬편집기 + 수작업저녁 시간존재하지 않음
6믹싱편집기 + 수작업저녁 시간존재하지 않음
7입 모양 패치sync/lipsync-v3, $0.22/s$2.20존재하지 않음
합계모델 4개 + 수동 작업 2회약 $3.49 + 저녁 시간호출 1회, $1.40

7행을 두 번 읽어보세요. 이미 렌더링한 클립의 입을 패치하는 데는 초당 $0.22가 들지만, 음성과 앰비언스, 입 움직임을 포함한 전체 샷을 생성하는 데는 초당 $0.14가 듭니다. 패치가 원본보다 더 비쌉니다. 이 비교 하나가 모든 논쟁의 핵심입니다.

아무도 언급하지 않는 비대칭성: 내 오디오는 무료지만, 내 비디오는 유료다.

MiniMax의 종량제 가격표는 입력 자료와 출력을 별도로 구분합니다. H3의 경우 오디오 입력은 무료입니다. 이미지 입력은 처음 5장이 무료이고, 이후 1장당 $0.04입니다. 입력 비디오는 출력 해상도 요율로 입력 클립의 길이만큼 청구되며, 2K 기준 초당 $0.13입니다(MiniMax 가격 문서, 2026년 8월 3일 확인). 따라서 동일한 15초 분량의 참조 자료도 음악, 음성 메모, 또는 고객 제공 VO로 넣으면 무료이고, 비디오 클립으로 넣으면 약 $1.95입니다.

이 부분이 바로 개발 방식을 바꿔야 하는 이유입니다. 참조 오디오는 모델에서 가장 저렴한 컨트롤 수단인데, 아무도 테스트하지 않는 영역입니다.

참조 입력개수클립당합계청구 방식(MiniMax)
이미지최대 9개n/an/a처음 5개 무료, 이후 1개당 $0.04
비디오최대 3개2~15초최대 15초출력 요율로 청구, 2K 기준 $0.13/s
오디오최대 3개2~15초최대 15초무료
혼합최대 12개 파일n/an/a유형별 위와 동일
오디오 단독불가. 오디오는 이미지 또는 비디오 입력과 함께해야 하며 단독 입력으로 사용할 수 없음

제한 사항은 모델 카드의 H3-Base-Ref2VA 스펙에 따른 것입니다. minimax/h3/reference-to-video의 Atlas Cloud 스키마도 다음과 같이 동일한 내용을 말합니다. "이미지 또는 비디오가 최소 하나 이상 필요합니다(오디오 단독은 허용되지 않습니다)."

Atlas 과금 측면의 각주 두 개를 추가합니다. 둘 다 문서 페이지가 아니라 제 직접 실행에서 얻은 결과입니다. Atlas는 세 가지 H3 엔드포인트 모두에 대해 출력 초당 단일 요금 $0.14를 청구하며, 제가 첨부한 참조 비디오는 그 위에 별도 요금이 추가되지 않았습니다. 이는 하나의 관찰일 뿐 정책이 아니므로, MiniMax 규칙을 기준으로 예산을 잡고 단일 요금은 보너스로 생각하시면 됩니다. 또한 Atlas는 resolution: "768P"도 동일한 $0.14로 청구하는데, 이 차이는 여기보다 MiniMax H3 API 가격 상세 분석에서 읽어보시길 권합니다.

아래의 모든 과정은 Atlas Cloud의 브라우저 탭 하나에서 실행됩니다. 베이스 프레임, 음성 참조, 두 개의 H3 테이크를 하나의 API 키와 하나의 폴 루프로 처리합니다. 세 가지 H3 엔드포인트는 입력 형태만 다를 뿐이므로, refersimage가 되고 일반 텍스트가 되며, 코드의 다른 부분은 변경되지 않습니다.

MiniMax H3 립싱크 및 오디오, 단계별 가이드

다섯 단계입니다. 두 단계는 저렴한 셋업, 두 단계는 실제 테스트, 마지막 단계는 의도적으로 실패하게 설계되었기 때문에 비용이 들지 않습니다.

1단계: GPT Image 2로 베이스 프레임 만들기

데모는 심야 라디오 진행자로 정했습니다. 이유는 하나입니다. 입을 타이트하게 클로즈업한 구도에서만 립싱크를 제대로 판정할 수 있고, 와이드 샷은 모델이 속임수를 쓸 여지를 주기 때문입니다.

이 프롬프트에서 양보할 수 없는 조건이 두 가지 있습니다. 입이 단어를 말하는 중간에 약간 열려 있어 첫 프레임이 이미 말하는 장면으로 읽혀야 하고, 프레임 어디에도 텍스트가 없어야 합니다. 그래야 나중에 다이나믹 캡션을 넣을 때 프레임에 박힌 글자와 충돌하지 않습니다.

plaintext
1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a
2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm,
3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp
4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his
5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks
6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts
7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on
835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame.
9

openai/gpt-image-2/text-to-image 설정: 품질 high, 크기 16:9, 2048x1152, 이미지 1장. 모델 목록에 표시된 $0.009는 토큰 등급의 최저 가격이지 실제 결제 금액이 아닙니다. 이 크기와 품질에서 Run 버튼은 1회 생성에 $0.1745를 표시하며, 아래 스크린샷에서 확인할 수 있습니다.

프롬프트와 생성 결과를 보여주는 AI 이미지 생성기 인터페이스

Atlas Cloud의 GPT Image 2: 라디오 부스 프롬프트 입력, 품질 high 및 16:9 2048x1152 선택, OUTPUT 패널에 렌더링된 완성 베이스 프레임_Atlas Cloud의 GPT Image 2: 위의 정확한 프롬프트, 품질 high, 16:9 2048x1152, OUTPUT 패널에 동일한 프레임을 두 번째로 생성한 결과._

2단계: 6초 음성 참조 만들기

사람들이 가장 많이 틀리는 단계입니다. 프롬프트를 보기 전에 이유부터 읽어보세요.

참조 오디오는 비디오에서 원하는 문장과 다른 문장을 말해야 합니다. 그것은 음색 앵커일 뿐입니다. 대사는 프롬프트에서 나옵니다. MiniMax 공식 reference-to-video 예시도 이 분리를 명확히 보여줍니다. 한 클립은 음악으로 부분 재사용할 소스 트랙으로, 두 번째 클립은 순수하게 '음성 음색 참조'로 표시하고, 새 대사는 프롬프트에 인라인으로 작성합니다. 참조 오디오가 요청한 것과 같은 단어를 말하면, 모델이 음성을 옮기는 대신 트랙을 그대로 복사하게 될 가능성이 높아집니다.

plaintext
1You're listening to Night Line, ninety-one point four, and it is coming up on
2three in the morning.
3

minimax/speech-2.6-hd 설정: 차분하고 낮은 남성 음성이면 무엇이든 괜찮으며, 저는 Magnetic-voiced Male(English_magnetic_voiced_man)을 선택했습니다. 테이크가 2~15초 창 안에 여유 있게 들어오도록 speed0.95로 설정하고, vol은 1.0으로 두고 mp3 출력을 유지합니다. 이 모델은 1,000자당 $0.10에서 인하된 $0.08이며, 2026년 8월 기준 20% 할인이 적용됩니다. 제 대사는 6.19초로 생성되었고 $0.00792가 청구되었습니다.

텍스트 입력과 오디오 파형 출력을 보여주는 음성 생성기 인터페이스

Atlas Cloud의 MiniMax Speech 2.6 HD: 텍스트 필드에 참조 대사를 입력하고 OUTPUT 패널에서 렌더링된 오디오 파형을 확인하는 화면

Atlas Cloud의 MiniMax Speech 2.6 HD: 대사 한 줄 입력, 짧은 mp3 하나 출력, Run 버튼에 20% 할인이 표시됩니다. 스크린샷은 기본 Expressive Narrator 음성으로 캡처했으므로, 실행 전에 Voice 선택기를 Magnetic-voiced Male로 바꾸고 Speed를 0.95로 낮추세요.

3단계: 참조 오디오와 함께 MiniMax H3 립싱크 및 오디오 실행하기

이제 두 파일을 refers에 함께 넣습니다. 1단계의 스틸 이미지와 2단계의 mp3입니다. 이것이 테이크 B입니다.

프롬프트는 H3가 학습한 섹션 구조를 사용합니다. subject_definitions는 참조 대상이 누구이고 무엇인지 정의하고, detailed_description<d>[English] ...</d> 태그 안에 대사를 담으며, 두 개의 오디오 섹션은 믹스를 설명합니다. 섹션 이름이 처음이라면 MiniMax H3 프롬프트 가이드에서 전체 구조를 확인할 수 있습니다. 오디오 작업에서 중요한 필드는 세 가지뿐이며, 그 세 가지가 모두 여기에 있습니다.

plaintext
1subject_definitions:
2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones
3half-off one ear, red ON AIR neon behind his shoulder.
4<Picture 1> is the opening frame of the target video.
5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male
6broadcast voice. Reference the timbre only; do not reuse its words.
7
8summary:
9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1>
10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the
11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone
12are generated together.
13
14detailed_description:
15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto
16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath,
17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning,
18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with
19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script,
20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d>
21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout,
22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second
23seven. No on-screen text.
24
25overall_soundscape:
26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it:
27a low electrical hum from the desk, rain steady against the glass, one distant car passing on
28the wet street, the soft creak of the chair as he leans in, and a single audible breath before
29each line.
30
31non_diegetic_music:
32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around
33second two and never rising above the dialogue.
34

minimax/h3/reference-to-video 설정: 해상도 2K, 길이 10, 화면 비율 16:9, refers에 두 파일 모두 포함. 배열 내부의 순서는 중요하지 않으며, 이미지나 비디오가 최소 하나 이상이면 됩니다. Duration 슬라이더는 기본값이 8이므로 반드시 변경하고, 원하는 프레임을 얻으려면 Aspect Ratio를 adaptive에서 다른 값으로 바꾸세요.

네 가지 파라미터 함정이 있으며, 그중 세 가지는 제 돈이 들었습니다. 키 이름은 aspect_ratio가 아니라 ratio이며, 틀리면 400을 반환합니다. duration은 항상 명시적으로 보내야 합니다. 스키마 기본값은 8이지만, duration 없이 보낸 요청은 5초짜리 파일로 반환됐기 때문입니다. 이 엔드포인트에서 refers와 함께 image를 보내면 요청은 완료되고 전체가 청구되며, 둘 중 하나는 조용히 누락됩니다. 그리고 오디오를 base64 데이터 URL로 전달할 때는 data:audio/mpeg가 아니라 data:audio/mp3로 표시해야 합니다. 제 첫 시도가 정확히 그 문제로 실패했습니다:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

그 실패는 적어도 무료입니다. 그리고 이것이 제한 사항을 배우는 유용한 방법으로 이어집니다.

텍스트 프롬프트 입력과 비디오 출력을 보여주는 AI 비디오 생성기 인터페이스

Atlas Cloud의 MiniMax H3 reference-to-video 플레이그라운드. Reference Materials의 슬롯 1에 mp3, 슬롯 2에 베이스 프레임, 해상도 2K, OUTPUT 패널에서 재생 중인 완성 클립

Atlas Cloud의 MiniMax H3 reference-to-video: Reference Materials가 2/9로 표시되고 슬롯 1에 mp3, 슬롯 2에 스틸 이미지, 해상도 2K, 오른쪽에 완성 클립. 이 캡처는 플레이그라운드 기본값인 8초로 실행되어 Run 버튼에 $1.12가 표시되었습니다. 위의 두 테이크는 10초로 실행되어 각각 $1.40입니다.

4단계: MiniMax H3 립싱크 및 오디오 컨트롤 테이크 실행하기

입력 하나와 그 입력에 대한 모든 언급을 변경합니다. refers에서 mp3를 제거하여 이미지만 남기고, <Audio 2> 정의를 삭제하고, 요약에서 '<Audio 2>의 음성 음색으로'라는 문구를 빼고, 대괄호 태그를 [image reference]로 변경합니다. 다른 모든 것은 그대로 두고 설정도 동일하게 유지합니다: 2K, 10초, 16:9.

이것이 두 번째 시도가 아니라 컨트롤 테스트가 되는 이유입니다. 이제 모델에는 음색 앵커가 없으므로, 텍스트 설명에서 음성을 창조하고 방금 만든 그 음성에 립싱크합니다. 두 테이크 모두 10.13초로 반환되었고 각각 $1.40이 청구되었습니다. 센트까지 정확히요.

WnfqR2I-a-8

소리를 켜세요. 테이크 A 단독: 동일한 프레임, 동일한 대사, 참조 오디오 없음. 이 음성은 모델이 만든 것이며, 입은 여전히 그 음성을 따라갑니다.

테이크 두 개, 변수 하나. 이 글 전체에서 가장 저렴한 실험이며, 오디오 슬롯이 실제로 무엇을 하는지 알려주는 유일한 실험입니다.

5단계: MiniMax H3 립싱크 및 오디오를 의도적으로 실패시키기

마지막 단계는 무료이며, 새벽 2시에 실패를 알아볼 수 있도록 한 번쯤 해볼 가치가 있습니다.

refers에 mp3만 넣습니다. 이미지 없음, 비디오 없음, 오디오만 넣고 제출합니다.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

여기서 알아둘 점이 있습니다. 스키마가 암시하는 것과 다르기 때문입니다. 제출 호출은 정상적인 작업 ID와 "status": "processing"과 함께 HTTP 200을 반환하므로, 단순한 클라이언트는 성공한 것으로 생각합니다. 그러나 23밀리초 후 작업은 실패합니다:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

해당 예측에는 price 필드가 전혀 나타나지 않았으므로 비용이 들지 않았습니다. 실질적인 교훈은 지갑이 아니라 코드에 관한 것입니다. 제출 시 200은 성공이 아닙니다. ID를 폴링하고, 클립이 있다고 가정하기 전에 status를 확인하세요.

MiniMax H3 립싱크 및 오디오를 더 활용하는 네 가지 방법

두 테이크 테스트는 가장 작은 유용한 실험입니다. 이제 같은 슬롯을 다음 단계로 확장하는 방법입니다.

하나의 샷, 여러 언어. 프레임을 유지하고, 동작을 유지하고, <d>...</d> 안의 언어 태그만 바꿔서 다시 실행합니다. 입과 음성이 동일한 포워드 패스에서 나오므로, 입은 이전 언어가 아닌 새 언어를 따라갑니다. 모델 카드는 11개 언어에 대한 안정적인 대화 지원을 명시합니다: 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어이며, 그 외에도 다양한 수준으로 지원됩니다. 아래 두 클립은 동일한 예고편에 서로 다른 두 개의 음성 트랙을 입힌 것이며, MiniMax는 동일한 설정으로 프랑스어 버전과 내레이션 없는 버전도 제작했습니다.

hj7ZId3KOKk

소리를 켜세요. 영어 음성 버전: 먼지 색 오렌지 행성의 우주비행사 클로즈업. 내레이션과 음악이 화면과 함께 도착합니다. 예고편 작업도 동일한 세 가지 프롬프트 필드에 사운드스케이프만 바꾸면 됩니다.

Hv62FGyBNPM

소리를 켜세요. 일본어 버전. 프레임 하나까지 동일한 예고편입니다. 다시 더빙하지 않았고 별도의 VO 녹음 세션도 없었습니다.

이미 보유한 훅으로 노래 만들기. 무료 입력 오디오가 더 이상 각주가 아닌 이유가 바로 여기입니다. 기존 훅이나 인스트루멘탈을 15초 이하로 refers에 넣고, 연기를 설명하면 캐릭터가 그에 맞춰 연기합니다. 가져온 음악에 대해서는 비용을 내지 않습니다.

zui3Zw_UWnY

소리를 켜세요. 레트로 캠코더 룩의 밴드 컷, 백스테이지에서 공연으로 이어지며 트랙과 화면이 함께 도착합니다. 대부분의 뮤직비디오 작업이 실제로 원하는 형태입니다.

두 사람 대화는 한 사람보다 훨씬 어렵습니다. 클로즈업에서 단일 화자는 쉬운 케이스이며, 그래서 이 글에서도 그 케이스를 사용했습니다. 두 캐릭터 간의 대화에서는 MiniMax 공식 예시처럼 각 <d> 줄에 <Subject 1> (S1)<Subject 2> (S2)를 명시적으로 붙이고, 모델이 순서나 발화 주체를 틀렸을 때 다시 생성할 것을 감안하세요. 두 명이 대화하는 장면당 실행 2회를 예산에 넣으세요.

말없이 앰비언스만. overall_soundscape는 독립적인 필드이며 대화 없이도 작동합니다. 유리창에 내리는 빗소리, 의자 삐걱거리는 소리, 냉장고 윙윙거리는 소리, 공간 자체의 소리. 이는 동일한 엔드포인트를 정식 ASMR 및 앰비언스 도구로 만들어 주며, 입이 전혀 중요하지 않은 유일한 용도입니다.

제 두 테이크에서 얻은 솔직한 한계 하나: 동일 패스 생성은 입과 음성이 일치한다는 뜻이지, 프레임의 모든 물리적 디테일이 사운드와 일치한다는 뜻은 아닙니다. 짧은 길이에 긴 대사를 억지로 채우거나, 연기 지시가 모호하거나, 여러 화자가 등장하는 장면은 결과물의 품질을 떨어뜨립니다. 실제 배우의 테이크를 확인하듯, 배포 전에 클립을 반드시 확인하세요.

MiniMax H3 립싱크 및 오디오의 실제 비용

아래 모든 수치는 실제 계정에 부과된 실제 요금이며, 실행 이후에 조회한 결과입니다. 예측의 price 필드는 늦게 채워지므로 completed가 될 때까지 폴링해도 값이 반환되지 않는 경우가 많습니다. ID를 다시 조회하면 숫자를 얻을 수 있습니다.

단계모델실행 내용청구 금액
1openai/gpt-image-2/text-to-image베이스 프레임 1장, 품질 high, 2048x1152$0.1745(Run 버튼에 표시)
2minimax/speech-2.6-hd99자, 6.19초 참조 음성$0.01
3minimax/h3/reference-to-video테이크 B, 10초 2K, refers에 이미지 + 오디오$1.40
4minimax/h3/reference-to-video테이크 A, 10초 2K, 이미지만$1.40
5minimax/h3/reference-to-video오디오 단독 요청, 23ms에 실패$0.00
전체 실험, 두 테이크 모두약 $2.98

정직함이 각주보다 싸기 때문에 회계 관련 참고 사항 두 가지를 추가합니다. 3단계의 잘못된 audio/mpeg 데이터 URL도 제출 시 400을 반환했으므로 비용이 들지 않았습니다. 거부는 무료이지만, 형식은 올바른데 입력이 깨진 요청은 무료가 아닙니다. 조용히 404를 반환하는 참조 URL도 전체 요금이 청구됩니다. 그리고 3단계 스크린샷의 플레이그라운드 캡처는 패널 기본값인 8초로 실행된 세 번째 H3 실행이며, 표 위에 $1.12가 추가로 청구되었습니다. 그 실행은 이 글을 위한 것이지 실험을 위한 것이 아닙니다.

위 표에서 가격을 매긴 기존 체인은 10초 샷 하나에 약 $3.49에 수동 정렬 작업 시간이 추가로 들었습니다. 이번 실험은 사운드를 갖춘 10초 샷 두 개, 통제된 A/B 테스트, 의도적으로 실패시킨 요청 두 개를 모두 포함해 그보다 적은 비용이 들었습니다.

그렇다고 해서 H3가 모든 작업에 적합한 것은 아닙니다. 사람들이 H3에 맡기려 할 몇 가지 작업에는 오히려 다른 모델이 적합하며, 가격도 더 저렴합니다.

실제로 원하는 것적합한 모델가격이유
초상화 한 장 + 기존 오디오 파일 하나로 토킹 헤드 만들기bytedance/avatar-omni-human-v1.5$0.12/s오디오-투-비디오 전용 모델이며, 출력 길이가 오디오 길이를 따릅니다
완성된 클립의 입이 새 언어로 말해야 할 때sync/lipsync-v3$0.22/sH3는 기존 렌더링을 수정하지 않으며, 패칭은 이 모델의 전문 분야입니다
토킹 헤드의 입을 최대한 저렴하게 고치는 방법veed/lipsync$0.013/s약 10배 저렴하며, 입 부분만 건드리고 연기는 건드리지 않습니다
음색, 앰비언스, 음악이 함께 담긴 연출된 풀 샷minimax/h3/reference-to-video$0.14/s화면과 사운드가 단일 패스에서 나오므로, 연기를 수리하는 것이 아니라 설계합니다

오디오가 아니라 캐릭터 작업 측면에서 H3와 가장 가까운 경쟁 모델을 비교하고 싶다면, Seedance 2.5 비교 글을 읽어보시길 권합니다. 그리고 오픈 가중치 덕분에 무료로 쓸 수 있는지 궁금하다면, 무료가 빠르다는 뜻은 아닙니다. 2K는 여전히 API 측에서 처리되며, 커뮤니티 보고에 따르면 10초짜리 480p 로컬 렌더링은 소비자용 GPU에서 수 초가 아니라 수 분이 걸립니다.

목소리, 음악, 권리에 대한 솔직한 참고 사항

업로드가 무료라는 것은 사용이 무료라는 뜻이 아닙니다. 직접 작곡하지 않은 음악과 내 것이 아닌 목소리는 서로 다른 두 가지 권한이며, 업로드 요금을 받지 않는 API가 그 권한을 부여하지도 않습니다. 직접 녹음한 파일, 라이선스 음악, 또는 직접 생성한 합성 음성을 사용하세요. 2단계가 정확히 그렇게 합니다.

또한 커뮤니티 가중치는 현재 EU, 영국, 한국, 미국을 포함하지 않는 지역 제한이 있으며, 대신 공식 라이선스 채널이 열려 있습니다. 이는 더 긴 이야기이며, MiniMax H3 오픈 가중치 가이드에서 다룹니다.

MiniMax H3 립싱크 및 오디오: 자주 묻는 질문

MiniMax H3 립싱크 및 오디오는 정말 동일한 패스에서 사운드를 생성하나요, 아니면 나중에 더빙되나요?

동일한 패스에서 생성합니다. 텍스트는 H3-Encoder를 통과하고, 비주얼은 H3-Encoder와 H3-VisualVAE를 통과하며, 오디오는 독립형 H3-AudioVAE를 통과합니다. H3-Omni-Transformer가 비디오와 오디오 잠재 변수를 공동으로 예측한 뒤, 각각 화면과 32kHz 스테레오 오디오로 별도 디코딩합니다. 이후에 어떤 것도 덧입히지 않으므로, 입, 호흡, 룸톤이 동일한 테이크에 속합니다.

내 노래나 목소리를 MiniMax H3 립싱크 및 오디오에 넣을 수 있나요? 추가 비용이 드나요?

네, 넣을 수 있고 추가 비용은 없습니다. MiniMax의 종량제 테이블은 H3 오디오 입력을 무료로 명시합니다. 주의할 비대칭성은 비디오입니다. 입력 비디오는 출력 요율로 실행 시간만큼 청구되며, 2K 기준 초당 $0.13입니다. 따라서 참조 비디오 15초는 약 $1.95, 참조 오디오 15초는 $0입니다.

오디오만 있는 요청을 MiniMax H3 립싱크 및 오디오가 거부하는 이유는 무엇인가요?

오디오는 단독으로 사용할 수 없는 유일한 참조 유형이기 때문입니다. 반드시 이미지나 비디오가 최소 하나 이상 함께해야 합니다. H3-Base-Ref2VA 스펙에 따른 나머지 제한 사항은 다음과 같습니다: 이미지 최대 9개, 비디오 최대 3개, 오디오 클립 최대 3개, 각 비디오 또는 오디오 클립은 2~15초, 유형별 총 15초, 한 요청에 모든 유형을 합쳐 최대 12개 파일.

MiniMax H3 립싱크 및 오디오는 클립 전체에서 유지되나요, 아니면 첫 대사에서만 동작하나요?

호흡할 여유가 있는 단일 화자의 경우, 한 줄에만 맞추고 흐트러지는 것이 아니라 클립 전체에서 유지됩니다. 세 가지가 이를 깨뜨립니다: 짧은 길이에 긴 대본을 억지로 채우는 경우, 모호하거나 누락된 연기 지시, 그리고 모델이 누가 언제 말하는지 결정해야 하는 다중 화자 장면입니다. 각 대사에 화자 라벨을 붙이고 말할 수 있는 충분한 시간을 주세요.

MiniMax H3 립싱크 및 오디오는 다른 언어로 바꿀 때 다시 더빙해야 하나요?

아니요. 대화 마크업 안의 언어 태그를 <d>[English] ...</d>에서 <d>[Japanese] ...</d>로 바꾸고 동일한 프롬프트를 다시 실행하면 됩니다. 입은 새 음성과 함께 생성되므로 이전 언어가 아닌 새 언어에 맞춰집니다. 모델 카드는 11개 언어에 대한 안정적인 대화 지원을 명시합니다.

MiniMax H3 립싱크 및 오디오를 로컬에서 실행하는 것이 더 저렴한가요?

클립당 비용은 더 저렴하지만, 다른 모든 측면에서는 비쌉니다. 가중치는 공개되어 있지만, 16GB 소비자용 GPU에서 로컬 실행하는 커뮤니티 보고에 따르면 10초짜리 480p 생성이 수 분이 걸리고, 셀프 호스팅은 768 숏 사이드로 렌더링되며, 2K는 여전히 API 측 재생성 단계를 거쳐야 합니다. 커뮤니티 라이선스의 지역 제한까지 고려하면, 완성된 작업을 위해서는 API가 여전히 실용적인 경로입니다.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색