Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

MiniMax H3 참조 영상: 하나의 캐릭터, 두 개의 샷, 그리고 조용히 당신의 돈을 가져가는 규칙

모든 가이드는 9/3/3 사양서를 반복합니다. 이 가이드는 이를 실행합니다: 이미지, 비디오 및 오디오 참조로부터의 투샷 장면을 하나의 MiniMax H3 참조 영상 통화에서.

이 모델에 관한 모든 글은 같은 라인에서 멈춥니다. 이미지 9개, 비디오 클립 3개, 오디오 클립 3개, 총 12개 파일. 마치 보증서처럼 읽힙니다.

그래서 저는 보증서처럼 다루었습니다. 캐릭터를 만들고, 소품을 만들고, 야간 장면을 생성한 후, 그 야간 장면을 다시 참조 비디오로 입력하고, 8초 분량의 재즈를 참조 오디오 트랙으로 잘라낸 다음, 세 가지 참조 유형을 모두 하나의 요청에 담아 보냈습니다. 그런 다음 의도적으로 규칙을 어기기 시작했고, API가 실제로 어떤 규칙을 방어하는지 확인했습니다.

그중 네 가지는 예상한 방식으로 방어되지 않았습니다. 하나는 요청하지 않은 비디오에 대해 여전히 정가를 청구하고, 당신이 기대했던 오류 메시지는 절대 도착하지 않습니다. 그것이 바로 끝까지 읽을 가치가 있는 부분입니다.

핵심 요약

  • 세 가지 참조 유형, 하나의 배열. 최대 이미지 9개, 비디오 클립 3개, 오디오 클립 3개, 총 12개 파일. 모두 동일한 refers 필드에 들어가며, type은 선택 사항입니다. API가 파일 확장자에서 유형을 추론하기 때문입니다.
  • 오디오는 단독으로 사용할 수 없습니다. 오디오만 있는 요청은 명명된 오류와 함께 거부됩니다. 최소한 하나의 이미지 또는 하나의 비디오와 함께 사용해야 합니다.
  • 비디오 참조와 이미지-비디오는 상호 배타적이지만, 이를 알려주는 정보는 없습니다. 첫 프레임 imagerefers와 함께 보내면 작업이 그냥 완료됩니다. 두 개의 입력 중 하나가 조용히 무시되며, 정가가 청구됩니다. 2026년 8월 12일에 두 엔드포인트 모두에서 확인 완료.
  • 제출 시점에는 아무것도 검증되지 않습니다. 이 글의 모든 잘못된 요청은 HTTP 200과 ID를 반환했습니다. 실제 판결은 2~3분 후 생성 단계에서 내려집니다. 그곳에서의 거부는 무료이며, 완료는 유료입니다.
  • 추가 참조 파일은 무료입니다. 참조 이미지 1개와 참조 이미지 10개는 동일한 클립 길이에 대해 정확히 같은 금액으로 청구됩니다. 가격은 입력 개수가 아닌 출력 시간을 따릅니다.

반대편에서 나온 결과는 다음과 같습니다. 두 개의 샷, 하나의 얼굴, 완전히 다른 두 장소, 그리고 두 번째 샷은 이미지, 비디오, 오디오 파일을 동시에 사용하여 만들어졌습니다.

샷 A (비, 밤, 네온 골목) 그 다음 샷 B (다음 날 아침의 빈 지붕 덮인 시장), 연결 외에는 아무것도 추가하지 않고 잘라서 붙였습니다. 같은 여성, 같은 오른쪽 눈썹 위의 흉터, 같은 쪽빛 재킷, 같은 수건. 샷 B는 세 가지 참조(그녀의 초상화, 샷 A 클립 자체, 8초 분량의 재즈 조각)를 한 번에 사용하여 생성되었습니다. 두 샷 모두 2K, 2560x1440, 24fps의 minimax/h3/reference-to-video이며, 기본 32kHz 스테레오 트랙이 포함되어 있습니다. 두 번째 절반에서 그녀가 대사를 말할 때 소리를 켤 가치가 있습니다.

MiniMax H3 Reference to Video가 당신이 쓸 수 있는 어떤 프롬프트보다 나은 이유

프롬프트는 사람을 설명합니다. 참조는 _그 사람_입니다. 이 차이가 이 엔드포인트가 존재하는 전부이며, 이것이 MiniMax H3가 현재 비디오 편집 순위표 1위(Elo 1,125, 10,280표 기준, Artificial Analysis, 2026년 8월)에 있는 이유입니다. 하지만 그 숫자에 대해 정확히 할 필요가 있습니다. 같은 표에서 순위 범위가 1에서 2까지이며, Google Gemini Omni Flash(1,122)와 통계적으로 동률입니다. 1위, 하지만 공유하는 신뢰 구간 안에 있습니다. H3가 텍스트-비디오와 이미지-비디오 모두에서 상위 3위 안에 든다는 관련 주장도 같은 연구소의 발표 게시물(Artificial Analysis on X, 2026년 8월)에서 나온 것입니다.

순위는 싸구려입니다. 다음은 실제 동작입니다. 동일한 프롬프트, 세 가지 수준의 참조, 다른 모든 것은 동일합니다.

let's say

동일한 프롬프트에 대한 세 가지 MiniMax H3 reference to video 실행: 참조 없음, 캐릭터 참조 이미지 1개, 참조 이미지 2개

동일한 프롬프트, 동일한 768P 4s 설정, 왼쪽에서 오른쪽으로: 참조 없음(텍스트-비디오), 캐릭터 참조 이미지 1개, 참조 이미지 2개(캐릭터 + 라면 그릇). 프롬프트는 세 가지 모두에서 "참조 이미지의 여성"이라고 말합니다. 왼쪽 패널에서 이 구문은 아무도 가리키지 않으므로 모델이 낯선 사람을 만들어냅니다. minimax/h3/text-to-video 및 minimax/h3/reference-to-video로 생성.

그 스트립에 대한 두 가지 정직한 해석. 패널 1에서 패널 2로의 도약은 엄청납니다. 참조 없이 "참조 이미지의 여성"은 아무것도 가리키지 않는 구문이며, 모델은 조용히 그 구멍을 프로젝트와 관련 없는 사람으로 채웁니다. 패널 2에서 패널 3으로의 도약은 훨씬 작습니다. 제 프롬프트가 그릇을 단어로도 설명했고, H3가 텍스트만으로 크레인이 그려진 적당한 감색 그릇을 그려냈기 때문입니다. 이것이 유용한 부분입니다. 참조 이미지와 좋은 명사구는 같은 작업을 두고 경쟁하므로, 언어로 확정할 수 없는 것(특정 얼굴, 특정 제품, 특정 로고)에 참조 슬롯을 사용하십시오.

이 글의 거의 모든 실패 뒤에 있는 패턴은 패널 1과 같습니다. 요청의 일부가 허공에 떨어졌다는 경고는 없습니다.

참조가 실제로 고정하는 것과 그렇지 않은 것. 참조 이미지는 정체성(얼굴 구조, 머리카락, 식별 표시, 의복)을 고정합니다. 조명은 고정하지 않으며, 이것이 가장 흔한 놀라움입니다. 또한 참조 사진의 빛을 함께 끌고 오기 때문에, 분위기 있는 환경에서 찍은 캐릭터 시트는 장면 변경을 견딜 수 없는 캐릭터를 만듭니다. 참조를 평평하고 중립적으로 촬영하십시오. 참조 비디오는 움직임, 그레이딩 및 그레인을 고정하며, 정체성은 고정하지 않습니다. 참조 오디오는 오디오 베드 자체를 고정합니다. 일련의 장면에서 같은 목소리로 대사를 읽는 같은 얼굴이 필요하다면, 참조 스택은 세 가지 다른 작업을 수행하고 있으며 어떤 것이 무엇인지 지정해야 합니다. 실무자 가이드는 프롬프트에서 위치적으로 이름을 지정하는 것("이미지 1은 캐릭터, 이미지 2는 제품")으로 수렴하며, 이 규칙을 채택할 가치가 있습니다. 아래의 제 프롬프트는 대신 일반 설명 이름을 사용하며, 참조가 시각적으로 모호하지 않을 때도 작동합니다.

첫 번째 호출이 대개 실망스러운 이유. 2026년 8월 12일에 측정된 네 가지 사항:

  1. 제출 엔드포인트는 아무것도 검증하지 않습니다. 잘못된 MIME, 164초 오디오, 죽은 URL, 상호 배타적 필드: 모두 HTTP 200과 예측 ID를 반환합니다. 나중에 알게 됩니다.
  2. ratio는 기본적으로 adaptive이며, "모델이 선택하도록 함"으로 문서화되어 있습니다. 16:9 참조를 사용하면 adaptive로 두든 16:9로 강제하든 768P에서 1344x768을 얻었으므로, 입력이 이미 일치할 때 기본값은 무해합니다. 입력이 일치하지 않을 때는 동전 던지기이며, 이것이 결정을 모델로부터 빼앗을 수 있는 유일한 H3 엔드포인트입니다.
  3. 첫 프레임 이미지와 참조를 함께 사용해도 오류가 발생하지 않습니다. 둘 중 하나를 조용히 버리고 청구합니다.
  4. 모델이 붙잡을 구체적인 것이 없으면, 자신 있게 구멍을 채우며, 자신 있는 잘못된 얼굴은 성공적인 실행과 똑같이 보입니다.

프롬프트 작성 측면에서는 MiniMax H3 프롬프트 가이드가 여기서 다룰 수 있는 것보다 더 깊이 들어갑니다.

MiniMax H3 Reference to Video 규칙집: 세 가지 유형, 하나의 요청

세 가지 참조 유형 모두 하나의 배열을 공유합니다. 다음은 게시된 계약과 제가 실제로 밀어붙였을 때 엔드포인트가 실제로 한 일입니다.

표 1: 세 가지 참조 유형

참조 이미지참조 비디오참조 오디오
최대 파일 수93개 클립3개 클립
결합 상한세 유형 모두 합쳐 12개 파일
파일당 길이해당 없음2~15초2~15초
총 길이해당 없음15초15초
형식png, jpeg, jpg, webpmp4, movmp3, wav
단독 사용 가능?아니오, 이미지 또는 비디오 필요
고정하는 것정체성, 의복, 제품, 스타일움직임, 카메라, 그레이딩, 그레인오디오 베드 자체
고정하지 않는 것새 장면의 조명샷에 있는 사람정확한 트랙 (6단계 참조)
전달 방식공개 URL 또는 base64 데이터 URL공개 URL 또는 base64 데이터 URLaudio/mp3로 선언해야 함, audio/mpeg 아님
강제됨?이미지 10개도 정상 통과1개 클립을 넘어 테스트되지 않음클립당 창은 강제됨, 15초 총합은 강제되지 않음

파일 수와 길이 창은 MiniMax의 게시된 제한 사항(Hailuo, 2026년 8월)이며, 2~15초 각각 및 총 15초의 동일한 참조 비디오 창을 나열한 출시 글(MarkTechPost, 2026년 8월)과 교차 확인되었습니다. 마지막 세 행은 모두 제가 측정한 것입니다.

사양 시트가 알려주지 않는 두 가지가 있습니다. 첫째, 각 항목의 type 필드는 선택 사항이며 URL 확장자에서 추론됩니다. 즉, base64 데이터 URL 또는 확장자가 없는 링크는 반드시 유형을 선언해야 하며, 그렇지 않으면 요청이 잘못 추측합니다. 둘째, 브라우저 업로더는 MiniMax 자체 12개보다 적은 9개 파일로 제한됩니다(Reference Materials (2/9), 아래 5단계 스크린샷의 MAX:9). 어쨌든 API를 통해 10개의 참조 이미지를 보냈고 작업이 정상적으로 완료되었으므로, 9개는 모델 제한이 아닌 UI 제한입니다.

표 2: reference-to-video vs image-to-video vs text-to-video

reference-to-videoimage-to-videotext-to-video
참조(refers) 허용예, 필수, 최소 1개아니요(조용히 무시됨)아니요
이미지 첫 프레임 허용아니요(조용히 무시됨)예, 필수아니요
end_image 마지막 프레임 허용아니요아니요
ratio 옵션7개 모두, 16:9, 9:16, 21:9 포함adaptive만7개 모두
해상도768P 또는 2K, 기본값 2K동일동일
길이4~15초 정수, 기본값 8동일동일
다른 엔드포인트의 입력 혼합작업 완료, 입력 무시됨, 전액 청구작업 완료, 참조 무시됨, 전액 청구해당 없음

네 번째 행이 아무도 언급하지 않는 차이점입니다. image-to-video에서는 종횡비 열거형에 정확히 하나의 값(adaptive)만 포함되는데, 첫 프레임이 모양을 결정하기 때문입니다. reference-to-video에서는 7개 모두를 얻을 수 있으므로, 캐릭터를 고정하면서 프레임 모양을 강제할 수 있는 유일한 H3 엔드포인트입니다. 이 작업을 위해 계층을 선택하는 경우, MiniMax H3의 2K vs 768P에서 추가 픽셀이 무엇을 제공하는지 다룹니다.

마지막 행이 비용이 많이 드는 행입니다. 문서는 두 엔드포인트를 상호 배타적으로 설명하며, 실제로도 그렇습니다. 오직 하나의 입력 경로만 존중된다는 의미에서입니다. 그러나 오류는 없습니다. 2026년 8월 12일에 양방향으로 실행했습니다. 첫 프레임 image를 포함한 reference-to-video 호출은 115초 만에 완료되어 $0.40이 청구되었고, refers를 포함한 image-to-video 호출은 167초 만에 완료되어 $0.40이 청구되었습니다. 둘 다 비디오를 생성했습니다. 둘 다 내가 보낸 것의 절반을 버렸으며, 응답의 어떤 필드도 어느 절반인지 알려주지 않습니다.

표 3: 이 워크플로우가 사용하는 모델

아래 모든 것은 Atlas Cloud의 단일 브라우저 탭에서 실행되며, 가격과 스크린샷도 여기서 가져왔습니다. 요금은 2026년 8월 12일 기준입니다.

단계모델요금실행 횟수비용
캐릭터 + 소품 참조openai/gpt-image-2/text-to-image$0.009부터; 2048x1152 고품질 측정 시 $0.17452$0.35
참조 오디오minimax/music-2.6트랙당 $0.151$0.15
샷 A 및 샷 Bminimax/h3/reference-to-video768P에서 $0.10/초, 2K에서 $0.14/초2 x 8초, 2K$2.24
참조 사다리동일, plus minimax/h3/text-to-video768P에서 $0.10/초3 x 4초, 768P$1.20

이번 달에는 세 H3 엔드포인트 모두에 할인이 적용되지 않습니다. 참조 스틸 이미지만 만드는 경우 지금 두 개의 이웃 모델이 더 저렴합니다. gpt-image-2-developer/text-to-image는 50% 할인되어 2026년 8월 기준 $0.009에서 $0.004로 인하되었습니다. 전체 초당 분석은 MiniMax H3 API 요금 가이드에 있습니다.

MiniMax H3 Reference to Video, 단계별

장면: 라면 포장마차를 운영하는 여성. 샷 A는 비 내리는 네온 골목 밤. 샷 B는 다음 날 아침 같은 여성이 빈 지붕 덮인 시장에 있는 모습, 다른 장소, 다른 시간대, 다른 렌즈. 두 호출 사이에 참조 외에는 아무것도 전달되지 않으며, 이것이 테스트의 핵심입니다.

1단계: 캐릭터 참조 제작, 의도적으로 평평한 조명

이 단계가 사람들이 잘못하는 부분입니다. 캐릭터 참조는 캐릭터의 멋진 사진이 아니라, 얼굴의 _측정_입니다. 중립적인 조명, 평범한 배경, 장면이나 분위기 없음. H3는 얼굴과 함께 빛도 학습하므로, 분위기 있는 참조는 그 분위기에 고정된 캐릭터를 만듭니다.

모델: openai/gpt-image-2/text-to-image. 설정: 품질 high, 크기 2048x1152 (16:9), 형식 png.

text
1Editorial photograph of a woman in her early thirties, a street-food chef. Close three-quarter portrait, neutral expression, direct eye contact with camera. Short black hair tucked behind one ear, a small scar above the right eyebrow, warm olive skin. She wears a faded indigo work jacket with the sleeves rolled to the elbow and a folded white towel over the left shoulder. Plain light grey studio background, soft even key light, no props, sharp focus on the face, natural skin texture, no retouching. Photorealistic, 50mm lens.
2

AI 이미지 생성기 스크린샷: 입력 프롬프트와 생성된 초상화

Atlas Cloud의 GPT Image 2 플레이그라운드: 캐릭터 참조 프롬프트가 로드되고 출력 패널에 완성된 초상화

Atlas Cloud의 GPT Image 2: 품질을 high로 설정, 16:9, 오른쪽에 렌더링된 캐릭터 시트.

파란색 작업복을 입고 어깨에 수건을 두른 여성

MiniMax H3 reference to video용 캐릭터 참조 이미지: 오른쪽 눈썹 위에 흉터가 있는 라면 요리사의 중립적인 스튜디오 초상화

참조 이미지 1. 오른쪽 눈썹 위의 흉터와 접힌 흰 수건은 의도적인 것입니다. 이는 이후 모든 프레임에서 확인할 수 있는 저렴하고 명확한 정체성 표시입니다.

2단계: 소품 참조 제작

두 번째 참조 슬롯, 두 번째 작업. 물체는 얼굴보다 여기서 더 잘 작동하므로, 독특한 소품이 참조가 적용되었음을 증명하는 가장 쉬운 방법입니다. 동일한 모델, 동일한 설정.

text
1Product photograph of a single dark navy ceramic ramen bowl with a hand-painted white crane on the side, chipped at the rim, filled with steaming shoyu ramen. Straight-on view, plain light grey background, soft even light, sharp focus, photorealistic, 50mm lens.
2

돼지고기, (5) 계란, (6) 그리고 (7) 파 (8) (9)

소품 참조 이미지: 손으로 그린 흰 두루미와 가장자리가 깨진 짙은 감색 라면 그릇

참조 이미지 2. 손으로 그린 두루미와 그릇 가장자리의 흠집이 신호입니다. 비디오에 그대로 살아 있다면 참조가 읽힌 것입니다.

3단계: 샷 A, 두 개의 이미지를 MiniMax H3 reference to video에 입력

두 개의 참조 이미지, 둘 다 type: "image", refers에 넣습니다. 비율을 명시적으로 설정합니다. adaptive가 기본값이며 참조가 이미 16:9일 때 대개 올바른 작업을 수행하지만, 결정을 모델에 맡기는 것이며 이 엔드포인트에서는 그렇게 할 필요가 없습니다.

모델: minimax/h3/reference-to-video. 설정: 해상도 2K, 길이 8, 비율 16:9.

text
1Wide establishing shot. Heavy rain at night in a narrow neon-lit alley. The woman from the reference image works alone behind a small steaming ramen stall under a plastic awning, ladling broth into the navy bowl with the white crane from the reference image. Steam rises through pink and green neon reflections on the wet pavement. Slow push-in on the stall. Ambient sound: rain on plastic, boiling broth, distant traffic. No dialogue.
2

이 호출의 출력은 맨 위의 쇼케이스 클립의 전반부입니다. URL을 보관하십시오. 5단계의 입력입니다.

4단계: 8초 분량의 참조 오디오 자르기

참조 오디오는 사운드트랙 슬롯이 아닙니다. 모델이 자체 믹스를 일치시키는 베드이며, 엔드포인트에서 가장 까다로운 입력입니다. 트랙을 생성한 다음 잘라냅니다. 전체 곡은 거부되기 때문입니다.

모델: minimax/music-2.6, is_instrumental: trueformat: "mp3" 사용.

text
1Sparse late-night jazz, brushed snare, upright bass, one muted trumpet, melancholic, 70 BPM, instrumental.
2

그런 다음 약 8초를 잘라내어 data:audio/mp3 URL로 인코딩합니다. 여기서 처음에 잘못한 세 가지가 있으며, 모두 정확한 오류 텍스트가 있습니다.

  • MIME 문자열이 바이트보다 중요합니다. data:audio/mpeg로 선언하면 파일이 완벽히 평범한 MP3임에도 불구하고 audio format ".mpeg" not allowed 오류와 함께 참조가 거부됩니다. audio/mp3로 작성하십시오.
  • 클립당 2~15초가 적용됩니다. 생성된 트랙은 164초였습니다. invalid param: audio duration 164258 ms, expected [2000, 15000] ms 오류가 반환되었습니다. 8.05초로 자르니 해결되었습니다. 두 거부 모두 비용이 들지 않았습니다.
  • 15초 결합 상한은 문서화되었지만 적용되지는 않습니다. 동일한 요청에 각각 8초 클립 2개(총 16.1초)를 보내 거부를 예상했습니다. 작업이 정상적으로 완료되고 청구되었습니다. 이에 의존하지 마십시오. 이는 제한 사항으로 게시되었으며 언제든지 실제 제한처럼 작동할 수 있습니다.

AI 음악 생성기 인터페이스: 텍스트 프롬프트와 생성된 오디오 파형

Atlas Cloud의 MiniMax Music 2.6 플레이그라운드: 재즈 프롬프트와 출력 패널의 완성된 트랙

Atlas Cloud의 MiniMax Music 2.6, 실행당 $0.15, 오른쪽에 완성된 트랙. 이 스크린샷에서 복사할 한 가지와 복사하지 말아야 할 한 가지: 가격과 mp3 형식은 옳지만, Is Instrumental이 여전히 꺼져 있고 페이지의 데모 가사가 여전히 상자에 있으므로, 이 특정 실행은 보컬이 포함된 1:35 노래로 반환되었습니다. 실행하기 전에 해당 토글을 켜고 Lyrics 필드를 지우십시오. 그렇지 않으면 누군가 노래하는 참조 베드를 자르게 될 것입니다. isinstrumental: true를 사용한 내 API 실행은 209초 만에 2:44 길이의 기악곡을 반환했습니다.

5단계: 샷 B, 세 가지 유형을 모두 사용한 단일 MiniMax H3 reference to video 호출

이것이 키워드가 실제로 의미하는 호출입니다. 세 가지 참조 유형, 세 가지 다른 작업, 하나의 배열:

  1. 1단계의 캐릭터 초상화, type: "image", 얼굴 유지
  2. 3단계의 샷 A mp4, type: "video", 컷 전반에 걸쳐 그레이딩과 그레인 전달
  3. 4단계의 8초 재즈 조각, type: "audio", 베드로 사용

플랫폼의 다른 생성물에서 나온 출력 URL은 비디오 참조로 refers에 바로 넣을 수 있으며, 이것이 실제 멀티샷 연속성 메커니즘입니다. "H3가 캐릭터를 기억한다"는 의미가 아닙니다. 이전 샷을 다시 넘겨주는 것입니다.

모델: minimax/h3/reference-to-video. 설정: 해상도 2K, 길이 8, 비율 16:9.

text
1The same woman from the reference image, the next morning. Bright empty covered market, cold clean daylight through a skylight, shutters still down behind her. Medium close-up, static camera. She wipes the counter with the folded white towel, looks up at the camera and says one line, then goes back to work. Keep her face, hair, scar and indigo jacket identical to the reference. Carry the grade and grain of the reference clip. Use the reference audio as the underscore.
2

AI 비디오 생성기 인터페이스: 입력 프롬프트 및 생성된 비디오

Atlas Cloud의 MiniMax H3 reference to video 플레이그라운드: 이미지 및 오디오 참조가 로드되고 출력 패널에 생성된 클립

2K 및 8초의 MiniMax H3 Reference-to-Video 플레이그라운드에서 동일한 호출. Reference Materials (2/9)에 두 개의 서로 다른 유형의 참조 슬롯이 표시됩니다. 슬롯 1은 ref-audio-8s.mp3, 슬롯 2는 그녀의 초상화입니다. 비디오 참조는 "Add via link"(해당 패널의 오른쪽 상단) 또는 API를 통해 전달됩니다. 디스크가 아닌 URL에 있기 때문입니다. 이 패널에서 읽을 세 가지: 업로더는 MiniMax 자체 상한인 12개임에도 MAX:9라고 표시하고, Aspect Ratio는 변경하지 않으면 adaptive로 유지되며, 2K 8초 실행 가격은 $1.12로, 이는 초당 $0.14 계층입니다.

6단계: 참조가 실제로 적용되었는지 확인

완료된 작업이 성공적인 작업은 아닙니다. 두 가지 확인, 둘 다 저렴합니다.

얼굴 확인. 각 샷에서 프레임을 추출하여 나란히 놓습니다. 심은 표시(흉터, 헤어라인, 재킷, 수건)를 찾으십시오.

네온 밤과 아침 시장 조명 속 여성 비교

샷 A의 프레임과 샷 B의 프레임 비교: 두 개의 다른 장면에서 동일한 MiniMax H3 reference to video 캐릭터

왼쪽: 샷 A, 밤, 네온, 와이드. 오른쪽: 샷 B, 지붕 덮인 시장, 다음 날 아침, 미디엄 클로즈업. 참조만 공유한 채 장면과 프레이밍 변경을 가로질러 동일한 얼굴, 오른쪽 눈썹 위의 동일한 흉터, 동일한 재킷과 수건.

한 가지는 프롬프트가 작성한 대로 진행되지 않았습니다. "밝고 빈 지붕 덮인 시장, 차갑고 깨끗한 햇빛"을 요청함과 동시에 "참조 클립의 그레이딩과 그레인을 유지"하도록 요청했으며, 참조 클립이 이겼습니다. 샷 B는 분명히 아침이고 분명히 다른 장소이지만, "밝다"는 의미보다 훨씬 더 분위기 있습니다. 밤의 그레이딩이 비디오 참조와 함께 넘어왔기 때문입니다. 하나의 호출에 동일한 룩과 반대되는 조명을 동시에 요청할 수는 없습니다. 조명을 변경해야 한다면 그레이딩 지시를 버리거나, 비디오 참조를 버리고 이미지만으로 정체성을 유지하십시오.

오디오 확인. 업로드한 8초 조각의 파형을 mp4 내부에서 반환된 트랙 옆에 플롯하고, 오디오 참조 없이 생성된 클립(대조군)을 추가하십시오.

세 개의 쌓인 오디오 파형: 업로드된 트랙, 반환된 트랙, 대조군 트랙

업로드된 8초 참조 오디오, 생성된 클립 내부에서 반환된 오디오 트랙, 오디오 참조 없는 대조군의 파형

위: 참조로 보낸 8.05초 재즈 조각. 중간: 반환된 샷 B mp4에서 추출한 트랙, 약 5.5초 지점의 대사에 의해 지배됨. 아래: 샷 A, 동일한 워크플로우, 오디오 참조 없음.

여기서 제가 처음에 믿었던 것을 바로잡아야 합니다. 참조 오디오는 그대로 반환되지 않습니다. 내 조각과 반환된 트랙 사이의 엔벨로프 상관관계는 0.25이고, 대조군의 경우 -0.05이므로 둘은 관련이 있지만 동일하지는 않으며, 반환된 형태는 내 파일 위에 무언가가 덧씌워진 것이 아니라 명확히 자체적인 믹스입니다. 참조가 분명히 한 일은 그 아래에 무언가를 넣은 것입니다. 샷 B의 베드는 대사가 시작되기 전 처음 5초 동안 오디오 참조 없는 대조군보다 약 7dB 더 큽니다. 참조 오디오를 음악 슬롯이 아닌 믹스에 대한 방향키로 읽으십시오. 영상 아래에 정확한 트랙이 필요하면 나중에 덧입히십시오.

오디오 측면에서 이 작업을 구축하는 경우, MiniMax H3 립싱크 및 오디오MiniMax H3 뮤직 비디오 연습이 모두 동일한 참조 오디오 동작에서 시작됩니다. 이 모든 것에 대한 폴링 및 재시도 코드는 MiniMax H3 튜토리얼에 루프가 있습니다.

가져올 만한 네 가지 더 많은 MiniMax H3 Reference to Video 설정

이미 소유한 클립의 스타일 변경. 완성된 클립을 이미지 없이 비디오 참조로 refers에 넣고 다른 매체를 요청하십시오. 움직임, 프레이밍, 푸시인, 소품은 유지되고 표면만 변경됩니다. 이것이 H3의 비디오 편집 순위 뒤에 있는 메커니즘이며, MiniMax H3 vs Veo 3.1 for anime의 애니메이션 작업 뒤에 있는 것과 동일합니다.

네온 골목에서 푸드 트럭에서 요리하는 여성

샷 A 클립을 MiniMax H3 reference to video 참조로 사용하여 생성된 애니메이션 스타일 변경

유일한 참조로 다시 제출된 샷 A 골목, 셀 음영 애니메이션 프롬프트 사용. 동일한 포장마차, 동일한 국자, 동일한 두루미 그릇, 동일한 푸시인, 다시 그려짐. 알아둘 가치가 있는 한 가지 세부 사항: 변환은 첫 프레임에서 가장 약하고 카메라가 움직임에 전념할 때 가장 강력합니다. 무음 GIF로 표시. minimax/h3/reference-to-video, 768P, 4초, $0.40으로 생성.

사진을 노래하게 만들기. 하나의 초상화와 하나의 보컬 클립(2~15초 창 내)을 프롬프트 성능과 함께 사용하십시오. 립싱크 파이프라인보다 저렴합니다. 단일 호출이기 때문입니다.

제품을 모든 장면에 고정. 참조 이미지는 얼굴보다 물체를 더 강하게 고정하므로, 실제 제품 샷과 장면 프롬프트는 이 엔드포인트에서 가장 안정적인 것입니다. 광고에 사용하기 전에 결과로 무엇을 할 수 있는지 확인하십시오.

클립이 아닌 시리즈 구축. 체인으로 연결하십시오. 샷 N의 출력은 샷 N+1의 비디오 참조가 됩니다. 각 호출은 여전히 최대 15초이므로, 연속성은 모델의 일이 아니라 사용자의 몫입니다. MiniMax H3 비디오 길이에서 이 한계가 어디서 부딪히는지 다룹니다.

시리즈를 하나에 맡기기 전에 엔진을 비교하고 싶으신가요? Seedance 2.5 vs MiniMax H3 및 MiniMax H3 대안을 읽어보십시오.

2샷 MiniMax H3 Reference to Video 장면의 실제 비용

아래 각 줄은 2026년 8월 12일의 실제 작업이며, 금액은 각 완료된 예측에 대해 API가 반환하는 price 필드에서 가져왔습니다.

표 4: 실제 청구서

작업모델설정결과청구액
캐릭터 참조gpt-image-2high, 2048x1152완료$0.1745
소품 참조gpt-image-2high, 2048x1152완료$0.1745
참조 오디오music-2.6instrumental, mp3완료, 164초 트랙, 209초 대기$0.15
샷 Ah3/reference-to-video2K, 8초, 이미지 참조 2개309초 만에 완료$1.12
샷 Bh3/reference-to-video2K, 8초, 이미지 + 비디오 + 오디오 참조557초 만에 완료$1.12
사다리, 참조 없음h3/text-to-video768P, 4초154초 만에 완료$0.40
사다리, 이미지 참조 1개h3/reference-to-video768P, 4초119초 만에 완료$0.40
사다리, 이미지 참조 2개h3/reference-to-video768P, 4초128초 만에 완료$0.40
애니메이션 스타일 변경h3/reference-to-video768P, 4초, 비디오 참조 1개239초 만에 완료$0.40
5단계 플레이그라운드 재실행h3/reference-to-video2K, 8초, 이미지 + 오디오 참조완료$1.12
대조군: 이미지 참조 10개h3/reference-to-video768P, 4초150초 만에 완료$0.40
대조군: 첫 프레임 이미지 + 참조h3/reference-to-video768P, 4초완료, 입력 하나 무시됨$0.40
대조군: image-to-video에 참조 사용h3/image-to-video768P, 4초완료, 참조 무시됨$0.40
대조군: 참조 오디오 16.1초h3/reference-to-video768P, 4초문서화된 제한 초과 완료$0.40
대조군: 비율 생략, 그 다음 비율 adaptiveh3/reference-to-video768P, 4초, 두 번둘 다 완료, 동일한 1344x768$0.80
1단계 및 4단계 스크린샷 재실행gpt-image-2, music-2.6위와 동일완료$0.32
대조군: 오디오 참조 단독h3/reference-to-video768P, 4초7ms 만에 실패$0.00
대조군: 164초 참조 오디오h3/reference-to-video768P, 4초16초 만에 실패$0.00
대조군: audio/mpeg MIMEh3/reference-to-video768P, 4초17초 만에 실패$0.00
대조군: 죽은 참조 URLh3/reference-to-video768P, 4초21초 만에 실패$0.00
총계$8.18

그 총계를 정직하게 나누십시오. 이 글의 맨 위에 있는 완성된 2샷 장면(참조 및 오디오 포함)은 그중 $2.74입니다. 나머지 $5.44는 조사(대조군, 의도적 손상, 스크린샷을 위한 브라우저 단계 재실행) 비용입니다. 이미 규칙을 알고 있다면, 2K의 16초 2샷 시퀀스는 샌드위치 가격보다 저렴합니다.

그 표에서 세 가지가 드러납니다.

참조는 무료입니다. 10개 이미지 대조군은 동일한 길이와 해상도에서 1개 이미지 사다리 실행과 정확히 동일한 $0.40의 비용이 들었습니다. 이 플랫폼에서 미터는 출력 시간과 해상도만 추적하며, 다른 것은 없습니다. 한 가지 모순을 지적할 가치가 있습니다. MiniMax 자체의 플랫폼 규칙은 입력 비디오가 출력 요율로 청구된다고 설명하며, OpenRouter의 통합 스키마에는 별도의 reference_images 항목이 포함되어 있습니다. 둘 다 여기 내 청구서에는 나타나지 않았습니다. 다른 곳에서 예산을 책정한다면 가정하지 말고 직접 가격을 확인하십시오.

실패는 무료이며, 늦게 옵니다. 네 번의 거부 모두 비용이 들지 않았습니다. 이것이 좋은 소식입니다. 나쁜 소식은 그것들이 도착하는 시점입니다. 오디오 단독 규칙의 경우 7밀리초, 오디오 길이, 잘못된 MIME 및 죽은 URL의 경우 16~21초, 그리고 제출 시점에는 아무것도 없습니다. 이 글의 모든 잘못된 요청은 먼저 HTTP 200과 예측 ID를 받았으므로, 제출 응답을 영수증으로 취급하고 검증으로 취급하지 말고, status 필드를 폴링하여 무언가를 믿기 전에 확인하십시오.

조용한 성공이 비용이 많이 드는 실패입니다. 두 가지 혼합 대조군은 각각 전체 $0.40을 청구했으며 내 입력의 절반으로 구축된 완벽하게 유효한 비디오를 반환했습니다. 오류, 경고 필드, 응답에서 무언가가 폐기되었음을 알 수 있는 방법이 없습니다. 이것이 표에서 돈이 계좌에서 나갔고 내가 원하는 것을 전혀 얻지 못한 유일한 줄입니다.

마지막 요점에 대한 한 가지 정직한 수정. 글을 쓰는 동안 변경되었기 때문입니다. 8월 초에는 404를 반환하는 참조 URL도 동일하게 작동했습니다. 작업이 완료되고 참조가 조용히 무시되었으며 전액이 청구되었습니다. 2026년 8월 12일에 다시 실행했을 때, 엔드포인트는 이제 도달 가능성을 확인하고 명명된 오류(content[1].image_url: media not found (HTTP 404))와 함께 작업을 무료로 실패시킵니다. 그 특정 구멍은 막혔습니다. 상호 배타적 입력 구멍은 막히지 않았습니다. 클립당 크레딧 계산에 대해서는 MiniMax H3 비디오당 크레딧에 표가 있습니다.

누구의 얼굴, 누구의 목소리: 참조를 업로드하기 전에 확인하십시오

이 엔드포인트는 텍스트-비디오와 한 가지 법적으로 관련된 방식에서 다릅니다. 유사성을 제공하는 것입니다. 실제 사람의 참조 이미지, 누군가의 영화에서 가져온 참조 클립, 알아볼 수 있는 목소리의 참조 보컬, 이 모든 것은 사용 권리를 주장하는 자료입니다. 그 위에 모델 측 콘텐츠 규칙이 여전히 적용되며, 실제 사람에 대해 더 엄격합니다. 클라이언트가 출력을 보기 전에 읽을 가치가 있는 두 가지 가이드: MiniMax H3 콘텐츠 제한상업적 사용 및 라이선스 분석. 후자는 MiniMax 이용 약관의 지역 제외 사항도 다룹니다.

MiniMax H3 Reference to Video: 자주 묻는 질문

MiniMax H3 reference to video가 두 개의 다른 샷에서 동일한 캐릭터를 유지할 수 있나요?

예, 위의 2샷 테스트는 완전한 밤-아침 조명 반전에서도 유지됩니다. 그러나 캐릭터 이미지만으로는 충분하지 않습니다. 신뢰할 수 있는 패턴은 이전 샷의 출력 URL을 캐릭터 이미지와 함께 참조 비디오로 다시 전달하여 두 번째 호출이 정체성뿐만 아니라 그레이딩과 그레인도 상속받도록 하는 것입니다.

동일한 MiniMax H3 reference to video 호출에서 첫 프레임 이미지와 참조를 함께 사용할 수 있나요?

아니요, 그리고 실패 모드가 문제입니다. imagerefers를 모두 보내도 오류가 발생하지 않습니다. 2026년 8월 12일에 테스트한 결과, 작업이 115초 만에 완료되고 $0.40이 청구되었으며 두 입력 중 하나를 조용히 버렸습니다. image-to-video 엔드포인트에서도 역방향으로 동일한 일이 발생합니다. 호출당 하나의 경로를 선택하십시오.

MiniMax H3 reference to video 참조로 오디오 파일만 단독으로 보낼 수 있나요?

아니요. 오디오는 최소한 하나의 참조 이미지 또는 비디오와 함께 제공되어야 하며, 엔드포인트는 명시적인 오류(reference-to-video requires at least one reference image or video)로 이를 적용합니다. 오류는 제출 시점이 아닌 생성 단계에서 발생하며, 거부된 작업은 무료입니다. 오디오 참조는 또한 2~15초(결합 15초) 내에 있어야 하며 audio/mpeg가 아닌 audio/mp3로 선언되어야 합니다.

MiniMax H3 reference to video는 각 참조 파일에 대해 추가 요금을 부과하나요?

Atlas Cloud에서는 그렇지 않습니다. 참조 이미지 10개를 사용한 실행과 1개를 사용한 실행이 768P 및 4초에서 동일한 $0.40으로 청구되었으므로, 미터는 출력 시간과 해상도만 추적합니다. 그러나 모순에 유의하십시오. MiniMax 자체 규칙은 입력 비디오가 출력 요율로 측정된다고 언급하고, 다른 플랫폼은 별도의 참조 이미지 항목을 노출합니다. 청구되는 표면에서 직접 확인하십시오.

MiniMax H3 reference to video URL 중 하나가 끊어지면 어떻게 되나요?

2026년 8월 12일 기준으로 엔드포인트는 도달 가능성을 검증하고 약 21초 후에 content[1].image_url: media not found (HTTP 404)와 함께 전체 작업을 무료로 실패시킵니다. 이는 변경된 사항입니다. 8월 초에는 동일한 요청이 완료되고 누락된 참조를 조용히 무시하며 전액을 청구했습니다. 이전 동작 보고가 여전히 유효하다고 가정하지 말고, 제출 시 200이 의미하는 바를 가정하기보다는 status 필드를 확인하십시오.

MiniMax H3 reference to video가 실제로 이에 가장 적합한 모델인가요?

이를 측정하는 유일한 공개 맞대결에서 예, 좁게는 그렇습니다. MiniMax H3는 10,280표 기준 Elo 1,125로 비디오 편집 순위표를 선도하지만, 순위 범위는 1~2로 나열되며 Gemini Omni Flash가 3 Elo 포인트 뒤에 겹치는 구간으로 있습니다. "공동 최고"로 취급하고 나머지 워크플로우에서 선택하십시오. 동률이 중요하다면 MiniMax H3 대안을 읽어보십시오.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색