아래 클립으로 스크롤하기 전에 헤드폰을 착용하세요. 이 카테고리에서는 실제로 중요합니다.
칼이 루비 유리로 조각된 석류 위로 내려옵니다. 껍질이 갈라지고, 수정 같은 균열음이 난 뒤, 수십 개의 유리 씨앗이 젖은 슬레이트 위로 굴러 떨어집니다. 올해 당신이 스쳐 지나갔을 거의 모든 AI ASMR 클립과 다른 점은 바로 이것입니다. 아무도 그 소리를 덧붙이지 않았습니다. 사운드 라이브러리도, 편집자도, 타임라인도 없었습니다. 영상과 오디오가 하나의 생성에서, 한 번의 호출로 나왔습니다.
지난 1년 동안 AI ASMR은 보기에는 만족스러웠지만 소리는 어딘가 어긋나 있었습니다. 이유는 결코 비주얼이 아니었습니다. 파이프라인의 마지막 단계 때문이었습니다. 무음 클립에 오디오를 붙이는 일은 매번 사람이 손으로 해야 하는 수작업이었습니다. 이 빈틈을 중심으로 카테고리가 너무 빠르게 성장한 나머지, 스티칭 자동화만을 위해 전용 AI ASMR 생성기 사이트라는 작은 산업까지 생겨났고, 그중 하나는 홈페이지에서 바로 "binaural 3D audio"를 핵심 기능으로 내세웁니다. 수요는 오래전에 입증됐습니다. 다만 조립식으로 충족되고 있었을 뿐입니다.
그래서 제대로 돌려봤습니다. 재현 가능한 워크플로 하나, 클립 여섯 개, 그리고 이 카테고리에서 아무도 하지 않는 단계까지 진행했습니다. ffmpeg로 좌우 채널을 분리해 측정한 것입니다. 예상했던 것 중 일부는 틀렸고, 바로 그 점이 이 글에서 가장 유용한 부분이 됐습니다.
핵심 요약
- H3는 24 fps 영상과 32 kHz AAC 스테레오 트랙을 같은 패스에서 렌더링합니다. 오디오는 나중에 더빙된 것이 아니라 생성된 것입니다.
- 스테레오는 진짜 스테레오입니다. 스테레오처럼 포장한 듀얼 모노가 아닙니다. 하지만 팬을 프롬프트로 제어할 수는 없습니다. 강한 좌우 이동을 요청했지만 차이는 1.9 dB였고, 이는 사실상 아무것도 아닙니다.
- 스테레오 폭은 문구가 아니라 콘텐츠에서 나옵니다. 방향을 전혀 요청하지 않았던 빗소리 클립은 실제로 넓은 음장을 보여줬습니다.
- 첫 프레임을 고정하면 해상도가 달라도 샷은 유지되지만, 768P와 2K는 여전히 서로 다른 테이크입니다. 드래프트는 룩과 사운드 사양을 미리 보여줄 뿐, 정확한 안무를 보여주지는 않습니다.
- 5초짜리 768P 클립은 $0.50이 청구됩니다. 같은 클립을 2K로 만들면 $0.70입니다. 이 글 전체 비용은 $4.27이었습니다.
먼저 들어보세요: 한 번의 패스로 만든 MiniMax H3 ASMR 비디오
5초, 2K, 24 fps, 32 kHz 스테레오, 한 번의 생성, $0.70. 소리를 켜세요. 날이 파고들 때의 삐걱거림, 균열음, 그리고 씨앗들. 어느 것도 나중에 추가하지 않았습니다. minimax/h3/image-to-video로 생성.
프롬프트 하나. 모델 하나. 호출 한 번. 아래에서는 이 클립을 어떻게 만들었는지, 비용은 얼마였는지, 그리고 마케팅 문구 중 어떤 부분이 파형 앞에서도 살아남는지 살펴봅니다.
AI ASMR은 왜 폭발적으로 성장했으며, 왜 대부분은 헤드폰 테스트를 통과하지 못할까
이 트렌드에는 생일이 있습니다. AI ASMR은 Veo 3가 공개된 직후인 2025년 6월부터 퍼지기 시작했고, 며칠 만에 폭발했습니다. @asmraiworks의 용암 먹방은 일주일 만에 조회수 1,130만 회를 넘겼고, 유리 자르기 클립은 11일 만에 530만 회를 기록했습니다(Know Your Meme, 2025). 언론도 이를 흥미로운 현상으로 다뤘고, 초현실적인 비주얼과 젓가락으로 녹은 용암을 먹는 장면이 대부분의 주목을 끌었습니다(The Express Tribune, 2025).
그러다 사람들이 헤드폰을 쓰기 시작했고, 분위기가 달라졌습니다. TechRadar 필자는 바이럴 클립들을 여럿 본 뒤, 인공적인 광택 같은 느낌이 있으며 "인간이 만든 ASMR의 특징인 실수와 부정확성이 부족하다"고 묘사했습니다(TechRadar, 2025년 6월). 그 글에 인용된 팬들은 tingles를 유발하는 요소가 기술적으로는 존재하지만 여전히 같지는 않다고 말했습니다.
여기에는 기계적인 이유가 있고, 신비로운 문제가 아닙니다. ASMR은 콘텐츠 그 자체가 소리인 유일한 카테고리입니다. 다른 모든 곳에서 오디오는 곁들임입니다. 여기서는 제품입니다. 그리고 지배적인 워크플로는 이랬습니다.
- 비디오 모델로 무음 클립을 생성한다,
- 사운드 라이브러리에서 균열음, 바삭거림, 빗소리 베드를 찾는다,
- 편집기에서 소리를 영상에 맞춘다,
- 신경 쓴다면 손으로 팬과 믹스를 조정한다. 대량 제작에서는 거의 아무도 하지 않지만,
- 내보낸다.
3단계에서 모든 것이 무너집니다. 두 프레임 늦게 재생되는 기성 균열음은 왜 그런지 설명하기도 전에 가짜처럼 들립니다. 여기에 매일 게시 일정을 곱하면 오류는 누적됩니다. 정렬 작업을 매번 사람이 다시 하고 있기 때문입니다.
그 빈틈 때문에 AI ASMR 생성기 사이트라는 소규모 산업 전체가 존재합니다. 적어도 세 곳이 활발히 마케팅 중이며, 한 곳은 binaural 3D audio를 헤드라인 기능으로 내세웁니다. 이들은 가짜 문제를 해결하는 것이 아닙니다. 진짜 구멍을 메우고 있습니다. 그 아래에 있는 비디오 모델들이 소리를 만들지 못하기 때문입니다.
그래서 한 리더보드의 분리가 눈여겨볼 만합니다. Artificial Analysis의 비디오 편집 보드 중 오디오 포함 점수를 매기는 곳에서 MiniMax H3는 Elo 1,126으로 1위에 올라 있으며, Gemini Omni Flash의 1,119를 앞서고 Dreamina Seedance 2.0의 1,027보다 약 100점 높습니다(Artificial Analysis, 2026년 8월). 오디오가 점수에 포함되지 않는 image-to-video 보드에서는 이들 모델 여러 개가 몇 점 차이 안에 모여 있습니다. 소리가 계산되기 시작하면 격차가 벌어집니다. ASMR에서는 소리가 전부입니다.
MiniMax H3 ASMR 비디오 워크플로와 각 단계의 비용
엔드포인트 세 개, 브라우저 탭 하나. 이 글의 모든 작업은 Atlas Cloud에서 실행했기 때문에 아래 모든 수치는 요금표가 아니라 실제 청구서에서 가져온 것입니다.
| 이 글에서의 작업 | Model | 요금 |
|---|---|---|
| 쇼케이스용 첫 프레임 | OpenAI GPT Image 2 (text-to-image) | $0.009/image부터 표시, high 및 2048x1152에서 $0.1745 청구 |
| 드래프트와 최종본 | MiniMax H3 Image-to-Video | 768P에서 $0.10/s, 2K에서 $0.14/s |
| 실제 녹음 입력 | MiniMax H3 Reference-to-Video | 동일한 두 티어 |
| 세 가지 템플릿 | MiniMax H3 Text-to-Video | 동일한 두 티어 |
| 기존 방식, 오디오 절반만 | ByteDance Seed Audio 1.0 | $0.143/min |
목록에는 세 H3 엔드포인트 모두에 "From $0.1/SEC"라고 표시됩니다. 이것이 768P 기준 최저가입니다. 2K는 $0.14/s로 청구되며, 이 숫자는 청구서 외에는 어디에도 나타나지 않으므로 실제로 요청하는 티어를 기준으로 계획해야 합니다.
표 1: 한 번의 패스와 스티칭 파이프라인 비교.
| MiniMax H3, 네이티브 오디오 | 무음 모델 + 후반 오디오 | |
|---|---|---|
| 완성 클립까지의 단계 | 1 | 4~5 |
| 관련 도구 | 1 | 비디오 모델 + 사운드 라이브러리 + 편집기 + 내보내기 |
| 영상과 소리의 동기 유지 방식 | 같은 생성, 같은 타임라인 | 맞아 보일 때까지 직접 끌어다 놓기 |
| 믹스와 팬 담당 | 없음, 모델이 주는 그대로 사용 | 소리마다 직접 처리 |
| 클립당 사람의 시간 | 프롬프트 이후 거의 0 | 솔직히 15~40분 |
| 5초 클립당 컴퓨트 비용 | 768P에서 $0.50 | 비디오 모델 + 오디오 생성 $0.143/min |
경쟁 비디오 플랫폼의 초당 요금은 의도적으로 인용하지 않겠습니다. 차이는 컴퓨트 비용에 있지 않기 때문입니다. 오디오 생성은 분당 $0.143로, 몇 센트 수준입니다. 스티칭 파이프라인의 진짜 비용은 클립당 20분의 사람 집중력이며, 이 비용은 규모가 커져도 줄어들지 않습니다. 오히려 곱해집니다. 매일 게시하는 얼굴 없는 계정이야말로 클립당 20분이 조용히 전체 비즈니스 모델을 갉아먹는 곳입니다.
정직하게 덧붙이면, 손으로 스티칭하면 제어권을 얻습니다. 원하는 소리를 스테레오 필드 어디에든 배치하고 프레임 단위로 다듬을 수 있습니다. H3는 동기화를 공짜로 주지만, 아래 측정에서 보듯 그 제어권을 돌려주지는 않습니다.
표 2: 세 가지 H3 엔드포인트와 실제로 중요한 파라미터.
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| 주요 입력 | image (첫 프레임) | 프롬프트만 | refers[] |
| resolution | 768P / 2K, 기본값 2K | 동일 | 동일 |
| duration | 4~15초 사이의 정수 초, 기본값 8 | 동일 | 동일 |
| ratio | 첫 프레임이 결정 | 명시적으로 설정해야 하며 adaptive는 거부됨 | 참조 자료가 결정 |
| refers 제한 | image와 함께 사용하지 않음 | 사용하지 않음 | 이미지 최대 9개, 비디오 3개, 오디오 3개 |
| 전달된 16:9 출력 | 768P에서 1344x768, 2K에서 2560x1440 | 동일 | 동일 |
| 오디오 트랙 | 24 fps 비디오 위의 AAC 스테레오 32 kHz | 동일 | 동일 |
손등에 적어둘 만한 파라미터 함정 두 가지가 있습니다. 파라미터 이름은 aspect_ratio가 아니라 ratio이며, 잘못된 키를 쓰면 설정되지 않은 상태가 되어 text-to-video 요청이 거부됩니다. 그리고 같은 호출에서 image와 refers를 함께 넣어도 오류가 나지 않습니다. 완료되고 전액 청구되며, 두 입력 중 하나를 조용히 버립니다.
MiniMax H3 ASMR 비디오 튜토리얼: 유리 석류 자르기
유리 과일 자르기는 모두가 알아보는 형식이어서, 독자는 즉시 무엇을 보고 있는지 이해합니다. 하지만 유리 사과와 유리 망고는 이미 너무 많이 쓰였습니다. 석류가 더 나은 이유는 하나입니다. 껍질이 갈라질 때 수백 개의 유리 씨앗이 쏟아져 굴러가기 때문에, 소리가 중심에 찍히는 한 번의 충격에 그치지 않고 지속성과 구조를 갖습니다. 모델이 오디오를 속이고 있다면, 흩어지는 장면에서 드러납니다.
Step 1: GPT Image 2로 베이스 프레임 만들기
비디오에 돈을 쓰기 전에 구도를 고정하세요. 설정: quality: high, size: 2048x1152 (16:9), output_format: png.
Plain1Extreme close-up macro photograph of a whole pomegranate carved entirely from thick 2translucent ruby-red glass, resting on a wet black slate slab. The glass shell is 8mm 3thick with visible internal bubbles and chipped facets; hundreds of tiny glass seeds 4glow inside like garnet crystals. A polished Japanese santoku knife lies at the left 5edge of the frame, blade tip just touching the glass skin. One hard key light from the 6upper right rakes across the slab and throws sharp red caustics onto the wet stone. 7100mm macro, f/2.8, shallow depth of field, dark moody background. 8No hands, no text, no watermark, no logo.

Atlas Cloud의 GPT Image 2 플레이그라운드. 품질은 high, 크기는 16:9 2048x1152로 설정했고, OUTPUT 패널에 유리 석류가 렌더링되어 있다
실제 실행 화면. 2048x1152에서 Quality high 이며, 페이지에는 $0.1745가 표시됩니다. 이후 청구서에도 같은 금액이 찍혔습니다.

생성된 베이스 프레임: 젖은 검은 슬레이트 위, 두꺼운 루비 유리로 조각된 석류와 왼쪽 가장자리에서 들어오는 산토쿠 칼
H3에 넘긴 프레임. openai/gpt-image-2/text-to-image로 생성.
Step 2: MiniMax H3 ASMR 비디오 프롬프트의 사운드 절반 작성하기
대부분의 사람은 ASMR 프롬프트를 그림 설명처럼 쓰고 앞에 "ASMR"이라는 단어만 붙인 뒤, 왜 모델이 로파이 피아노를 깔아주는지 의아해합니다. H3는 오디오 지시를 주면 꽤 진지하게 받아들입니다. 오디오 절반을 다섯 슬롯으로 구성하세요.
- 재료. 무엇이 소리를 내는지. 유리, 왁스, 녹은 암석, 유리 위의 물. 두께와 젖은 정도를 구체적으로 쓰세요. 음색이 달라집니다.
- 동작과 시간상의 형태. 단순히 "자른다"가 아니라 "한 번의 느리고 연속적인 스트로크로 눌러 내려간다"처럼 쓰세요. 모델은 이를 사용해 이벤트를 배치합니다.
- 마이크 관점.
close-mic,intimate, 녹음 거리 단서. 소리가 얼마나 건조하고 가까운지 설정하며, 잘 작동합니다. - 의성어 시퀀스. 소리 이벤트를 순서대로 적으세요. 삐걱거림, 그다음 균열음, 그다음 수십 개의 작은 충격, 그다음 침묵. 가장 많은 일을 하는 슬롯입니다.
- 네거티브.
no music, no voice, no narration, no room reverb, no ambience bed. 이것이 없으면 H3는 친절하게 음악을 추가합니다. 학습 데이터의 대부분 비디오에는 음악이 있기 때문입니다.
저는 4번 슬롯에 채널 방향도 적었습니다. 균열음은 왼쪽 채널, 씨앗은 왼쪽에서 오른쪽으로 굴러가게 요청했습니다. 실제로 무엇이 나왔는지는 계속 읽어보세요.
Step 3: 768P 드래프트 실행하기
드래프트는 768P로 만드세요. 오디오 트랙 사양은 두 티어에서 동일하므로, ASMR에서 곧 청취 판단인 전체 크리에이티브 판단을 저렴한 요금으로 할 수 있습니다.
minimax/h3/image-to-video 설정: image = Step 1 출력, resolution: 768P, duration: 5. 비율은 첫 프레임에서 오므로 그대로 두면 됩니다.
Plain1The santoku blade enters from the left and presses down through the glass pomegranate 2in one slow continuous stroke, travelling left to right across the frame. The shell 3splits with a bright crystalline crack and a spray of tiny glass seeds tumbles onto the 4wet slate, scattering toward the right edge. Camera locked off, macro, single take, no cuts. 5 6Audio: ASMR, close-mic, intimate, no music, no voice, no narration, no room reverb. 7A dry sustained glass squeak as the edge bites in, then one sharp high crack panned to 8the LEFT channel, followed by dozens of small tinkling seed impacts rolling from the 9LEFT channel across to the RIGHT channel as they scatter. A faint blade-on-stone scrape 10at the very end, then silence. No ambience bed, no hum, no background music.

Atlas Cloud의 MiniMax H3 image-to-video 플레이그라운드. 베이스 프레임이 로드되어 있고, duration은 5이며, OUTPUT 패널에는 완료된 클립이 있다
image-to-video 실행 화면: 첫 프레임 로드, duration 5, OUTPUT 완료. Resolution 선택 항목이 페이지 기본값 인 2K에 놓여 있다는 점에 주의하세요. 드래프트에서는 768P로 바꾸세요. 아래 클립은 그렇게 렌더링했습니다.
768P 드래프트, $0.50. 히어로 클립보다 영상은 부드럽지만 오디오 사양은 같습니다. 모든 결정은 이 테이크로 했습니다.
Step 4: 믿기 전에 스테레오를 측정하기
소리에 대해 제 말도, 모델의 말도 그대로 믿지 마세요. 채널을 분리해 직접 보세요. 로컬 ffmpeg이며, API 호출도 비용도 없습니다.
Bash1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

유리 석류 클립과 빗소리 클립을 비교한 4패널 파형 분석. 각 클립의 좌우 채널과 사이드 채널을 보여준다
두 클립의 왼쪽 채널과 오른쪽 채널, 그리고 그 아래에 매칭된 게인의 사이드 채널(왼쪽 빼기 오른쪽)을 배치했습니다. 이 한 장이 전체 논증입니다.
결과는 다음과 같았고, 일부는 예상과 달랐습니다.
스테레오는 진짜입니다. 제가 생성한 어떤 클립에서도 사이드 채널은 비어 있지 않았습니다. 듀얼 모노 파일을 스테레오처럼 꾸몄다면 거기에는 아무것도 나타나지 않았을 것입니다. 이 파일에는 내용이 있습니다.
하지만 팬은 프롬프트로 제어할 수 없습니다. 저는 균열음을 LEFT 채널에, 씨앗이 LEFT에서 RIGHT로 굴러가도록 대문자로 요청했습니다. 측정 결과: 채널 상관도 0.97, 사이드 채널은 미드보다 17.7 dB 낮았고, 0.25초 구간 어디에서도 좌우 레벨 차이의 최대값은 1.9 dB였습니다. 이것은 팬이 아닙니다. 약간의 자연스러운 폭이 있는 중앙 이미지입니다. 칼은 프레임을 가로질러 움직이지만, 소리는 제자리에 머뭅니다.
폭은 문구가 아니라 콘텐츠에서 나옵니다. 다음 섹션의 빗소리 클립은 방향을 전혀 요청하지 않았는데도 상관도 0.32, 사이드 채널은 미드보다 2.9 dB 낮은 수준으로 돌아왔습니다. 실제로 넓고 디코릴레이션된 음장입니다. 확산된 앰비언스는 자동으로 폭을 얻습니다. 개별 충격음은 무엇을 쓰든 중앙 근처에 머뭅니다.
따라서 이 모델에 대해 정직하게 주장할 수 있는 것은 공간성이 아닙니다. 시간성입니다. 소리가 영상과 함께 생성되어 자신이 속한 프레임에 맞춰 들어옵니다. 무료로, 계속, 편집기 없이 말입니다. 포맷에 강한 팬이 정말 필요하다면 여전히 후반 작업에서 직접 해야 하며, 채널 이름을 프롬프트에 쓰는 일은 아무 효과가 없으니 그만두는 것이 좋습니다.
이제 최종본을 다시 실행합니다. 같은 엔드포인트, 같은 첫 프레임, 같은 프롬프트에서 한 필드만 resolution: 2K로 바꾸세요. 드래프트가 미리보기라고 가정하기 전에 알아둘 점이 하나 더 있습니다.

같은 타임스탬프에서 768P와 2K 실행을 비교한 두 줄의 다섯 프레임. 프레임 0은 동일하지만 약 2.5초부터 달라진다
같은 첫 프레임, 같은 프롬프트, 두 티어. 프레임 0은 정확히 일치합니다. 2.5초가 지나면 껍질이 다르게 깨지고 두 클립은 서로 다른 테이크가 됩니다.
첫 프레임을 고정하면 두 티어에서 구도, 프레이밍, 조명, 색이 유지됩니다. 그래서 이 작업에는 text-to-video가 아니라 항상 image-to-video를 써야 합니다. 하지만 같은 테이크를 주지는 않습니다. 2K 실행은 동작을 다시 굴립니다. 드래프트는 룩과 사운드의 미리보기로 취급하세요. 정확한 안무의 미리보기가 아닙니다.
Step 5: 실제 녹음을 MiniMax H3 ASMR 비디오 참조로 추가하기
정말 원하는 소리가 있다면 그대로 넘기면 됩니다. reference-to-video는 이미지 최대 9개, 비디오 3개, 오디오 클립 3개를 받으며, 오디오 참조에서 음색과 공간 특성을 가져와 새로 지어내는 대신 반영합니다. 저는 Wikimedia Commons에 있는 Gravity Sound의 공개 도메인 친화적인 유리 깨짐 녹음(CC BY 4.0)을 사용했고, 세 테이크를 이어 붙여 4.5초로 만들었습니다.
규칙은 세 가지입니다. 마지막 두 개는 요청이 거부되면서 어렵게 알아냈습니다.
- 오디오는 단독으로 사용할 수 없습니다. 엔드포인트가 명시합니다. 최소 하나의 이미지 또는 비디오가 필요하며, 오디오만으로는 허용되지 않습니다. 프레임과 함께 넣으세요.
- 오디오 참조는 2~15초여야 합니다. 첫 시도는 1.49초 클립이었고
audio duration 1486 ms, expected [2000, 15000] ms라는 응답을 받았습니다. 이 범위는 모델 페이지에 없습니다. - 파일 형식을 검사합니다.
audio/mpeg로 선언한 base64 payload는audio format ".mpeg" not allowed로 거부됐습니다..wavpayload는 통과했습니다. 거부된 요청은 청구되지 않지만 왕복 시간은 듭니다.
설정: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5.
Plain1Same locked-off macro shot: the blade slices the glass pomegranate from left to right 2and the seeds scatter. Match the timbre, brightness and room character of the reference 3audio, same recording distance, same dryness. ASMR close-mic, no music, no voice.

Atlas Cloud의 MiniMax H3 reference-to-video 플레이그라운드. 두 개의 참조 자료가 로드되어 있으며, 슬롯 1에는 오디오 파일, 슬롯 2에는 베이스 프레임이 있다
Reference Materials에 오디오 파일과 이미지가 함께 들어가 있으며, 9개 중 2개를 사용했습니다. 이미지를 빼면 요청은 아예 실행되지 않습니다.
참조 기반 테이크, $0.50. 같은 샷이지만 음색은 프롬프트에서 발명된 것이 아니라 실제 녹음으로 조정됐습니다. 오디오 참조: Glass breaking by Gravity Sound, CC BY 4.0.
세 가지 MiniMax H3 ASMR 비디오 템플릿: 자르기, 씹기, 비
이 카테고리에서 성과가 나는 대부분의 형식은 세 가지로 포괄할 수 있습니다. 각각은 설정과 생성된 클립을 포함한 전체 붙여넣기 실행용 프롬프트입니다. 아래에는 의도적으로 유리, 빨강, 슬레이트를 전혀 넣지 않았습니다. 계정의 모든 클립이 똑같아 보이면 알고리즘은 그것을 같은 클립으로 취급합니다.
표 3: 같은 다섯 슬롯, 세 가지 다른 작업.
| 슬롯 | 템플릿 1, The Cut | 템플릿 2, The Chew | 템플릿 3, The Rain |
|---|---|---|---|
| 재료 | 꿀이 떨어지는 벌집, 뜨거운 강철 칼날 | 빛나는 녹은 암석, 돌그릇 | 자동차 창유리에 내리는 비 |
| 동작 형태 | 칼날이 앞에서 뒤로 들어가고, 꿀이 아래로 늘어짐 | 젓가락이 들어 올린 뒤 두 번 베어 문다 | 주체 동작 없음, 물방울만 |
| 마이크 관점 | close-mic, 매우 건조, 공간감 없음 | 극도로 가까움, intimate | 유리 바깥, 실내는 먹먹함 |
| 소리 시퀀스 | 왁스 균열음, 꿀 늘어남, 접시에 떨어지는 방울 | 녹은 듯한 지글거림, 젖은 씹는 소리, 유리 같은 바삭임, 숨 내쉼 | 일정한 빗소리 베드, 물방울 충격, 먼 타이어 마찰음 |
| 네거티브 | no music, no voice, no room reverb | no words, no music, no narration | no music, no thunder, no voice, no wipers |
Template 1, The Cut. 벌집, 앰버와 골드, 9:16, 768P, 6초, ratio: "9:16".
Plain1Extreme macro, locked-off overhead shot of a thick slab of golden honeycomb on a pale 2ceramic plate, honey already pooling around it. A hot steel blade lowers into the wax 3and sinks through it front to back in one slow continuous press; the cut faces slump 4and a heavy thread of honey stretches and drips onto the plate. Warm amber key light 5from the left, shallow depth of field, single take, no cuts, no hands in frame. 6 7Audio: ASMR, close-mic, very dry, no room reverb, no music, no voice, no narration. 8A soft crackling of wax splitting under the blade, then a thick low stretching pull as 9the honey lengthens, then two heavy wet drips landing on the ceramic plate. Nothing else.
Template 1, $0.60. 왁스 균열음, 꿀 늘어남, 물방울. minimax/h3/text-to-video로 생성.
Template 2, The Chew. 일주일 만에 조회수 1,130만 회를 끌어낸 형식인 용암 먹방, 9:16, 768P, 8초, ratio: "9:16".
Plain1Vertical close-up: a pair of black lacquer chopsticks lifts a glowing clump of molten 2orange lava out of a dark stone bowl and carries it toward the camera, out of frame at 3the bottom. The lava is self-illuminating, casting orange light on everything around it; 4the rest of the room is almost black. Steam curls off the surface. Locked-off camera, 5single take, no cuts. 6 7Audio: ASMR, extremely close-mic, intimate, no words, no music, no narration, no room tone. 8A low molten sizzle and bubbling as the lava is lifted, then a soft wet chew, then a 9brighter glassy crunch on the second bite, then one slow satisfied exhale. No speech.
Template 2, $0.80. 지글거림, 씹는 소리, 바삭임, 숨 내쉼, 그리고 단어 하나 없음. minimax/h3/text-to-video로 생성.
Template 3, The Rain. 밤의 자동차 창문, 차가운 파랑과 네온, 16:9, 768P, 10초, ratio: "16:9".
이 세 가지 중 주체 동작이 없는 유일한 클립이며, 네거티브에 대해 가장 많은 것을 알려줍니다. 화면에서 아무 일도 일어나지 않으면 H3는 명시적으로 금지하지 않는 한 음악 베드를 넣으려 합니다. 또한 요청하지 않았는데도 가장 넓은 스테레오 필드로 돌아온 클립이기도 합니다. 수면 지향 콘텐츠는 길이가 필요하므로, 유용한 duration 범위의 상단에 가깝게 실행했습니다.
Plain1Macro shot through the inside of a car window at night, heavy rain running down the 2outside of the glass. Individual droplets hit, hesitate, then streak downward and merge. 3Beyond the glass, out-of-focus neon signage breaks into cold blue and magenta bokeh. 4No wipers, no people, no movement inside the car. Camera locked off, single continuous 5take, shallow depth of field, no cuts. 6 7Audio: ASMR, close-mic on the outside of the glass, cabin slightly muffled. 8A steady even rain bed with clearly separated individual droplet impacts on the glass, 9plus a faint distant hiss of tyres on a wet road. No music, no thunder, no voice, 10no narration, no wiper noise.
Template 3, $1.00. 순수한 앰비언스 10초. 프롬프트에서 금지했기 때문에 사운드트랙은 없습니다. minimax/h3/text-to-video로 생성.
MiniMax H3 ASMR 비디오의 실제 비용
추정이 아니라 이 글의 영수증입니다.
| 항목 | 수량 | 청구액 |
|---|---|---|
| GPT Image 2 베이스 프레임, high, 2048x1152 | 1 | $0.17 |
| 2K 최종본, 5초, image-to-video | 1 | $0.70 |
| 768P 드래프트, 5초, image-to-video | 1 | $0.50 |
| 768P reference-to-video, 5초 | 1 | $0.50 |
| 768P 템플릿 클립, 6초 + 8초 + 10초 | 3 | $2.40 |
| 거부된 참조 요청 | 2 | $0.00 |
| 합계 | $4.27 |
게시 가능한 클립 여섯 개와 베이스 프레임 하나입니다. 일정으로 환산해보겠습니다. 8초짜리 세로 클립을 매일 하나씩 768P로 만들면 $0.80이므로, 매일 게시하는 얼굴 없는 계정의 컴퓨트 비용은 대략 월 $24입니다. 편집기에서 1분을 쓰기 전의 비용입니다.
청구 관련 메모 두 가지. GPT Image 2에 표시된 $0.009는 토큰 티어의 최저가입니다. 고품질 2048x1152 렌더는 $0.1745로 거의 20배에 달하므로 실제로 사용하는 티어를 기준으로 예산을 잡으세요. 그리고 H3의 price 필드는 지연되어 채워집니다. status가 completed가 될 때까지 폴링해도 흔히 undefined 상태입니다. 실제 금액을 얻으려면 잠시 뒤 prediction id를 다시 폴링하세요. 이 두 번째 폴링이 추측이 아니라 이런 영수증을 만들 수 있는 유일한 방법입니다.
ASMR 오디오와 권리에 대한 솔직한 메모
다른 사람의 ASMR 녹음을 refers 오디오 파일로 업로드하지 마세요. 참조는 실제로 음색을 출력으로 옮기며, 녹음을 모델에 통과시킨다고 소유자가 바뀌지는 않습니다. 여기서 사용한 참조는 CC BY 4.0이며 위에서 출처를 밝혔습니다. 찾는 데는 약 2분 걸렸습니다.
알아볼 수 있는 실제 인물의 목소리를 중심으로 ASMR을 만들지 마세요. 이 글의 모든 템플릿은 의도적으로 무음성입니다. 이는 장르 관습이기도 하고 가장 덜 복잡한 경로이기도 합니다.
API를 통해 H3를 호출하는 것은 오픈 가중치에 붙은 커뮤니티 라이선스의 영향을 받지 않습니다. self-hosting을 다루는 그 라이선스는 현재 EU, UK, Korea, US를 제외하고 있으며, 해당 지역을 위한 공식 라이선스 채널이 열려 있습니다. 알아둘 가치는 있지만 엔드포인트를 호출하는 경우 걱정할 필요는 없습니다.
MiniMax H3 ASMR 비디오: 자주 묻는 질문
MiniMax H3 ASMR 비디오는 자체적으로 소리를 생성하나요, 아니면 나중에 추가해야 하나요?
모델이 생성합니다. 영상과 오디오는 같은 패스에서 나옵니다. 전달되는 파일에는 24 fps 비디오와 32 kHz AAC 스테레오 트랙이 들어 있습니다. 별도 오디오 단계도, 사운드 라이브러리도, 정렬 작업도 없습니다. 바로 이 점 때문에 이 엔드포인트가 ASMR에 특히 흥미롭습니다.
MiniMax H3 ASMR 비디오를 왼쪽에서 오른쪽으로 팬하게 만들 수 있나요?
요청만으로는 안 됩니다. 프롬프트에 명시적인 채널 방향을 썼고 결과를 측정했습니다. 채널 간 상관도는 0.97, 0.25초 구간 어디에서도 최대 레벨 차이는 1.9 dB였으며, 이는 전혀 팬이 아닙니다. 트랙은 실제 스테레오이고 비처럼 확산된 콘텐츠는 넓은 음장으로 돌아오지만, 개별 충격음은 문구와 관계없이 중앙에 머뭅니다. 포맷에 강한 팬이 필요하다면 후반 작업에서 처리하세요.
제 녹음을 MiniMax H3 ASMR 비디오 참조로 업로드할 수 있나요?
네, reference-to-video를 통해 가능합니다. 이미지 최대 9개, 비디오 3개와 함께 오디오 참조를 최대 3개까지 받을 수 있습니다. 오디오는 단독으로 제출할 수 없으므로 최소 하나의 이미지 또는 비디오와 함께 넣어야 합니다. 또한 오디오는 2~15초여야 하며 형식도 검증됩니다. audio/mpeg가 거부된 반면 .wav payload는 작동했습니다. 거부된 요청은 청구되지 않습니다.
768P MiniMax H3 ASMR 비디오의 오디오는 2K보다 나쁜가요?
아니요. 두 티어 모두 동일한 AAC 스테레오 32 kHz 사양을 제공합니다. 바뀌는 것은 영상뿐이며, 차이는 큽니다. 16:9는 768P에서 1344x768, 2K에서 2560x1440으로 나옵니다. ASMR에서 크리에이티브 판단은 청취 판단이므로 $0.10/s로 드래프트를 만들고, 최종본은 $0.14/s로 다시 실행하세요. 단, 2K 실행은 드래프트의 업스케일이 아니라 새로운 테이크라는 점을 기억해야 합니다.
MiniMax H3 ASMR 비디오는 얼마나 길어야 하며, 화면비는 어떻게 해야 하나요?
duration은 415 사이의 정수 초를 받습니다. 자르기와 씹기 클립은 보상이 하나의 이벤트이므로 58초가 잘 맞습니다. 수면 지향 앰비언스는 10초 이상이 좋습니다. Shorts, Reels, TikTok에는 9:16을 사용하고, text-to-video에서는 ratio를 명시적으로 설정해야 하며 adaptive는 거부된다는 점을 기억하세요. image-to-video에서는 첫 프레임이 형태를 결정합니다.
MiniMax H3 ASMR 비디오 하나의 비용은 얼마인가요?
5초 클립은 768P에서 $0.50, 2K에서 $0.70이 청구됩니다. 8초짜리 세로 클립은 768P에서 $0.80입니다. 그런 클립을 하루에 하나 게시하면 컴퓨트 비용은 월 약 $24이며, 이는 스티칭 워크플로에서 편집자가 클립마다 쓰게 될 20분과 비교해야 할 숫자입니다.
요청하지 않은 배경음악이 MiniMax H3 ASMR 비디오에 들어가는 이유는 무엇인가요?
금지하지 않았기 때문입니다. 어떤 모델이든 학습 데이터의 대부분 비디오에는 음악 베드가 있으므로, 특히 화면에서 아무 일도 일어나지 않을 때 기본 동작은 음악을 추가하는 쪽입니다. 프롬프트의 오디오 절반에 네거티브를 명시적으로 넣으세요. no music, no voice, no narration, no room reverb, no ambience bed. 앰비언트 템플릿은 액션 템플릿보다 이것이 더 필요합니다.






