여름 내내 내 피드는 같은 영상이 반복 재생됐다. 월드컵 선수들을 소년만화 주인공으로 재해석한 영상들. 독재자, 해적 선장, 마지막 4초에 등장하는 투박한 멘토. 게시물당 수백만 뷰, 그리고 거의 매 경기마다 스토리가 업데이트된다.
그 영상들을 만드는 사람들은 벤치마크 게시글을 쓰지 않는다. 모델을 고르고, 크레딧을 소모하며, 다음 경기 시작 전에 결과물을 내놓는다.
그래서 나는 애니메이션 키프레임 하나와 프롬프트 하나를 가져와, MiniMax H3를 애니메이션 영상 생성기로 Veo 3.1과 비교 테스트했다. 동일한 입력에 두 모델 모두 최대 설정으로 밀어붙였다.
가장 먼저 깨진 것은 이미지 품질이 아니었다. 드롭다운이었다. Veo 3.1은 8초에서 멈추고 정확히 두 가지 화면비만 제공한다. 얼굴을 잡는 샷, 공과 함께 패닝, 그리고 타이틀 카드를 띄우는 장면은 8초 안에 들어가지 않는다. 처음부터 품질에서 실패할 기회조차 없었다.
핵심 요점
- Veo 3.1의
duration열거형은[4, 6, 8]이고aspect_ratio열거형은[16:9, 9:16]이다. MiniMax H3는 4초에서 15초까지 모든 정수 초를 지원하며21:9, 16:9, 4:3, 1:1, 3:4, 9:16을 제공한다. Veo에 4:3이 없으면 레트로 OVA 프레이밍은 아예 불가능하다. - H3의 모델 카드에는 11개의 기본적으로 안정적인 대화 언어가 나열되어 있으며 일본어가 포함되어 있다. 오디오와 영상은 함께 32kHz 스테레오로 생성되며, 이후에 더빙되지 않는다.
- 레퍼런스 팩은 차이가 크다: H3는 최대 9개의 이미지와 최대 3개의 영상, 3개의 오디오 클립(최대 12개 파일)을 받는다. Veo 3.1의 레퍼런스 엔드포인트는 3개의 이미지를 받으며, 사용하는 순간
duration이[8]로만 축소된다. - 테스트를 조용히 망치는 두 가지 함정: Veo의 API는
generate_audio를 기본적으로false로,resolution을720p로 설정하며, H3의 텍스트-투-비디오ratio기본값은1:1이다. 그것들을 그대로 두면 무성의 720p 클립과 정사각형 클립을 비교하는 꼴이 된다. - Veo 3.1은 H3에는 전혀 없는 두 가지를 유지한다:
seed와negative_prompt. 2D 애니메이션의 경우 두 번째 요소가 실제로 중요하며, 그 이유를 보여주겠다.
MiniMax H3 애니메이션 영상 생성기 vs Veo 3.1, 동일한 프레임을 연속으로 비교
하나의 오리지널 캐릭터. 하나의 키프레임. 하나의 프롬프트, 문자 그대로 두 모델에 복사하여 붙여넣었다. 나머지는 각 측에서 모두 최대로 설정했다.
MiniMax H3, 이미지-투-비디오, 2K, 8초, 네이티브 오디오. 소리를 켜라: 관중 소음, 공 타격음, 일본어 외침이 영상과 동시에 생성된다. Atlas Cloud에서 minimax/h3/image-to-video로 생성.
Veo 3.1, 이미지-투-비디오, 1080p, 8초, generateaudio 를 수동으로 켜고, 선화를 평평하게 유지하는 negativeprompt 를 추가. 동일한 첫 프레임, 동일한 단어. Atlas Cloud에서 google/veo3.1/image-to-video로 생성.
둘 다 아름답게 그린다. Veo의 타격 장면 와이드 샷, 손으로 그린 임팩트 라인과 공중에 떠 있는 만화 효과음은 정말 멋지다. 이것이 솔직한 시작점이며, 이 기사의 나머지 부분이 '분위기'가 아닌 매개변수와 명령 수행에 초점을 맞추는 이유다.
대부분의 MiniMax H3 애니메이션 영상 생성기 vs Veo 3.1 테스트가 잘못되는 이유
이번 여름에 두 가지 일이 동시에 일어났다.
애니메이션은 AI 영상에서 가장 높은 볼륨의 형식이 되었다. 2026년 월드컵은 소년 토너먼트로 재구성되었으며, 선수들은 독재자, 해적 선장, 해병대 장군, 멘토로 캐스팅되었고, "거의 매 경기마다 진화하는" 스토리라인이 TikTok, Instagram, X, YouTube 전반에 퍼졌다(Complex, 2026년 7월).
그리고 MiniMax H3가 오픈 웨이트로 출시되었다. 0일차 ComfyUI 스레드는 330포인트와 95개의 댓글을 기록했으며, 사람들은 몇 시간 만에 실제 로컬 수치를 게시했다(Hacker News, 2026년 8월).
이 두 가지를 합치면 수많은 애니메이션 비교가 쏟아질 것으로 예상된다. 하지만 거의 없는데, 그 이유는 대부분의 테스트가 다음 네 가지 방식 중 하나로 잘못 구축되기 때문이다.
그림을 비교하는 것이지, 제약 조건을 비교하는 것이 아니다. 애니메이션 샷은 타이밍이다. 휩 팬에서 타이틀 카드로의 전환은 렌더링 문제이기 전에 지속 시간 문제다.
Veo의 API가 기본적으로 무음이라는 점을 잊는다. API에서 generate_audio는 false이고 resolution은 720p다. "Veo는 애니메이션에 오디오가 없다"는 게시글의 대부분은 불리언 값을 전환하지 않은 사람의 것이다.
H3의 텍스트-투-비디오가 기본적으로 정사각형이라는 점을 잊는다. ratio 기본값은 16:9가 아니라 1:1이다. t2v 애니메이션 프롬프트를 설정하지 않고 실행하면 정사각형 클립을 얻고 혼란스러운 결론을 내리게 된다.
포토리얼 프롬프트로 테스트한다. "영화적, 볼륨감 있는 조명, 얕은 심도"는 정확히 2D 모델을 3D 렌더 쉐이딩으로 끌어들이는 어휘다. 애니메이션의 실패 모드는 흐림이 아니다. 플라스틱 질감이다.
실행 버튼을 누르기 전에 애니메이션 테스트를 결정하는 세 가지 설정
무엇보다 먼저, 양쪽에서 이 설정들을 지정하지 않으면 비교가 무효다.
| 설정 | MiniMax H3 | Veo 3.1 | 건너뛰면 발생하는 일 |
|---|---|---|---|
| 오디오 | 영상과 함께 생성, 항상 켜짐 | generate_audio 기본값 false | Veo가 무성 클립을 반환하며 실제보다 나빠 보임 |
| 프레임 형태 | 텍스트-투-비디오에서 ratio 기본값 1:1 | aspect_ratio 기본값 16:9 | H3가 사용할 수 없는 정사각형 애니메이션 컷을 제공 |
| 해상도 | 기본값 2K | 기본값 720p | 2K와 720p를 비교하며 품질 차이라고 부름 |
MiniMax H3 vs Veo 3.1 애니메이션 사양표: 길이, 비율, 오디오, 레퍼런스
출시 게시물을 신뢰하지 않고 두 모델의 라이브 입력 스키마를 직접 가져왔다. 아래의 모든 값은 인상이 아니라 직접 확인할 수 있는 열거형이다.
표 1: MiniMax H3 vs Veo 3.1, 애니메이션 샷을 결정하는 매개변수
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 지속 시간 | 4~15, 모든 정수 초 (기본값 8) | 4, 6, 8 (기본값 8) |
| 화면비 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 비율 기본값 (텍스트-투-비디오) | 1:01 | 16:09 |
| 해상도 | 768P, 2K (기본값 2K) | 720p, 1080p, 4k (기본값 720p) |
| 오디오 | 공동 생성, 32kHz 스테레오 | generate_audio, 기본값 false |
| 네이티브 대화 언어 | 11개 안정, 일본어 포함 | 안정적인 목록으로 공개되지 않음 |
| 레퍼런스 팩 | 최대 9개 이미지, 3개 영상, 3개 오디오 클립, 총 12개 파일 | 3개 이미지 |
| 레퍼런스 사용 시 지속 시간 | 여전히 4~15 | 8로만 축소 |
| seed | 사용 불가 | 사용 가능 |
| negative_prompt | 사용 불가 | 사용 가능 |
| 가중치 | 다운로드 가능 | 비공개 |
지속 시간, 비율, 해상도, 오디오 및 레퍼런스 제한은 MiniMax H3 이미지-투-비디오, H3 텍스트-투-비디오, H3 레퍼런스-투-비디오, Veo 3.1 이미지-투-비디오 및 Veo 3.1 레퍼런스-투-비디오 페이지의 라이브 스키마에서 읽어왔다. 9개 이미지 및 12개 파일 레퍼런스 상한과 11개 언어 대화 목록은 MiniMax H3 모델 카드 (Hugging Face, 2026년 8월)에서 가져왔다.
이제 스코어보드다. 사양표와는 다른 이야기를 하며, 둘 다 중요하다.
표 2: 크라우드 투표 Elo 및 분당 가격, 2026년 8월 7일 스냅샷
| 모델 | 텍스트-투-비디오 (오디오 포함) | 이미지-투-비디오 (오디오 포함) | $/분 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 상위 10위권에 없음 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 상위 10위권에 없음 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 상위 10위권에 없음 | $4.80 |
Elo 및 가격 수치는 Artificial Analysis Video Arena (Artificial Analysis, 2026년 8월)에서 가져왔다. 이는 롤링 크라우드 투표이며 변동될 수 있다. $/분 열은 정규화된 모델 추정치이지 실제 청구서가 아니다.
145포인트 Elo 차이는 크지만, 이는 일반 목적 투표이지 애니메이션 전용 투표가 아니다. 그리고 여기 솔직히 말해야 할 부분이 있다: MiniMax는 H3를 애니메이션 모델로 마케팅하지 않는다. 내부 1차 피드백에 따르면 영화, 애니메이션 및 코믹 드라마는 H3가 목표로 하지 않는 영역이다. 따라서 흥미로운 질문은 "어느 것이 애니메이션 모델인가"가 아니다. 애니메이션으로 자체 판매하지 않는 모델이 왜 샷에서 승리하는지, 그리고 Google이 여전히 라운드를 가져가는 부분이 어디인지다.
튜토리얼 전에 한 가지 실용적인 참고사항. 아래의 모든 모델은 동일한 콘솔과 동일한 API 키를 통해 실행된다. 이것이 매개변수를 비교할 수 있는 유일한 이유다. 동일한 대기열, 동일한 인증, 하나의 청구서. 한 서비스에 GPT Image 2를 설정하고 다른 서비스에 Veo를 설정하면 발견하는 차이점의 절반은 모델이 아닌 배관 문제일 것이다.
샷 만들기: MiniMax H3 vs Veo 3.1, 단계별
하나의 실행 예제, 처음부터 끝까지. "라스트 휘슬": 오리지널 십대 스트라이커, 빨간 머리, 흰색과 남색 9번 유니폼, 플러드라이트, 타격 순간의 휩 팬, 그리고 마지막 2초에 안정적으로 떠야 하는 일본어 타이틀 카드.
실제 선수 없음, 공식 캐릭터 없음, 기존 애니메이션 IP 없음. 스타일과 오마주만. 그 이유는 잠시 후에.
1단계: GPT Image 2로 애니메이션 키프레임 디자인
키프레임은 아트 디렉션을 전달하므로 비디오 모델이 이를 새로 발명할 필요가 없다. 왼쪽 1/3의 네거티브 공간에 주목하라: 의도적이다. 비디오 모델이 그곳에 타이틀 카드를 작성하며, 이것이 텍스트 안정성 테스트다.
Plain1현대적인 소년 스포츠 애니메이션의 한 프레임. 셀 쉐이딩 2D 애니메이션, 손으로 그린 2일관된 선 두께의 잉크 라인, 플랫 컬러 채우기, 하드 에지 그래픽 섀도우, 33D 쉐이딩이나 포토리얼 피부는 절대 없음. 오리지널 십대 스트라이커의 클로즈업: 4지저분한 짙은 빨간 머리, 흰색과 남색 유니폼에 9번, 한쪽 뺨에 땀과 잔디 자국, 5지친 결의로 가득 찬 눈, 소리 지르며 입을 벌린 모습. 그 뒤로 경기장 플러드라이트가 6흐릿한 관중 색상의 벽으로 번져나감; 화면 중앙에서 방사형 속도선이 폭발; 7공중에 잔디 한 조각이 얼어붙어 있음. 채도 높은 팔레트, 깊은 청록색 그림자, 따뜻한 8오렌지 림 라이트. 16:9 구성, 캐릭터는 중앙 오른쪽에 배치, 왼쪽 1/3은 깨끗한 9네거티브 공간. 이미지에 텍스트 없음.
설정: 모델 openai/gpt-image-2/text-to-image, 품질 high, 크기 16:9 (2048x1152). 그 외에는 없음.

Atlas Cloud의 GPT Image 2 플레이그라운드, 라스트 휘슬 키프레임 프롬프트와 출력 패널의 완성된 애니메이션 프레임
Atlas Cloud의 GPT Image 2: 품질을 high로 설정, 오른쪽에 완성된 키프레임.

기본 애니메이션 키프레임: 경기장 플러드라이트 아래에서 소리 지르는 오리지널 빨간 머리 스트라이커, 플랫 컬러와 속도선이 있는 셀 쉐이딩
두 모델이 받는 키프레임. 플랫 컬러, 하드 섀도우, 타이틀 카드를 기다리는 빈 왼쪽 1/3.
2단계: MiniMax H3 이미지-투-비디오, 모든 설정 최대
동일한 사진 입력, 2K 출력. 여기서는 H3를 Veo의 상한과 맞추기 위해 8초로 제한했다. 이것이 H3의 한계는 아니며, 4단계에서 제한을 해제할 것이다.
Plain1셀 쉐이딩 2D 애니메이션, 손으로 그린 선 두께, 플랫 컬러, 3D 쉐이딩 없음. 스트라이커의 2얼굴을 한 박자 동안 잡고, 그가 공을 차면서 격렬한 휩 팬을 따라가며, 팬이 프레임을 3번져 사쿠가 모션 트레일을 만듦. 임팩트 순간 완전한 침묵의 한 프레임. 마지막 2초 동안, 4굵은 흰색 일본어 타이틀 문자 'ラストホイッスル'가 왼쪽 1/3에 등장하여 완전히 5고정되며, 왜곡, 깜박임, 떨림 없음. 스트라이커가 일본어로 한 줄 외침: 「まだ終わってない!」 6오디오: 경기장 함성, 날카로운 공 타격음 하나, 타이틀 카드 아래 낮은 태고 비트.
설정: 모델 minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (이미지-투-비디오는 입력 이미지의 프레임 모양을 따름), image = 1단계 출력.
텍스트-투-비디오로 분기하는 경우 한 가지 경고: ratio: 16:9를 명시적으로 작성하라. 기본값은 1:1이며, 기꺼이 정사각형 애니메이션 컷을 제공할 것이다.

Atlas Cloud의 MiniMax H3 이미지-투-비디오 플레이그라운드, 라스트 휘슬 프롬프트, 키프레임 로드 및 출력 패널의 완성된 클립
Atlas Cloud의 MiniMax H3 이미지-투-비디오: 왼쪽에 1단계 키프레임 로드, 오른쪽에 완성된 클립 재생.
3단계: Veo 3.1 이미지-투-비디오, 오디오 수동으로 켜기
프롬프트는 동일하며, 단어 그대로다. 형용사 하나라도 바꾸면 더 이상 비교가 아니다. 달라지는 것은 Veo가 제공하고 H3에는 없는 추가 필드다.
negative_prompt, 2D 애니메이션의 경우 이 목록에서 가장 유용한 컨트롤이다:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
설정: 모델 google/veo3.1/image-to-video, resolution: 1080p (변경 필요, 기본값은 720p), duration: 8 (최대값), aspect_ratio: 16:9, generate_audio: true (API 기본값은 false, 이것이 무성 클립 함정), seed: 20260807, image = 동일한 1단계 출력.

Atlas Cloud의 Veo 3.1 이미지-투-비디오 플레이그라운드, generate audio 활성화, 애니메이션 키프레임 로드 및 출력 패널의 완성된 클립
Atlas Cloud의 Veo 3.1 이미지-투-비디오, Generate Audio가 켜져 있고 오른쪽에 완성된 클립.
4단계: 5가지 애니메이션 특화 축으로 평가
여기서 생성할 것은 없다. 그냥 보고, 애니메이션이 실제로 깨지는 부분에서 판단하라. 두 클립 모두 이 기사 상단 근처에 포함되어 있으므로 내 말을 믿지 않고 직접 평가할 수 있다.

두 클립의 마지막 프레임 나란히: 왼쪽 MiniMax H3는 깨끗한 일본어 타이틀 문자, 오른쪽 Veo 3.1은 왜곡된 세로 문자
각 클립의 마지막 프레임. 왼쪽, H3는 ラストホイッスル, 8개의 가타카나 모두 정확하고 완전히 고정됨. 오른쪽, Veo 3.1은 요청된 단어도 아니고 단어를 형성하지도 않는 세 개의 문자를 생성.
타이틀 카드가 라운드를 결정했으며, 가까웠지 않았다. H3는 요청된 가타카나를 정확하게, 하드 에지로 안정적으로, 골문의 번진 팬 위에 렌더링했다. Veo 3.1은 요청된 단어도 아니고 단어도 아닌 세 개의 문자의 세로 스택을 생성했다. 같은 프레임에서 캐릭터를 화면 밖으로 떨어뜨리고 배경이 준포토리얼 경기장 플레이트 쪽으로 미끄러지도록 놔두었으며, photorealistic skin과 3D render가 네거티브 프롬프트에 있었음에도 불구하고.
표 3: 애니메이션 컷을 결정하는 5가지 축, 이 두 실행에서
| 축 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 키프레임에서 캐릭터 연속성 | 전체 8초 동안 정확한 얼굴, 머리카락 및 유니폼 유지 | 새로운 와이드 샷으로 캐릭터 재그림, 모델은 맞지만 다른 그림 |
| 선 두께와 플랫 셀 쉐이딩 | 유지, 3D로의 변이 없음 | 미드 샷에서는 유지, 끝날 무렵 사진 같은 경기장 플레이트로 변이 |
| 일본어 타이틀 카드 | ラストホイッスル 정확하게 렌더링되고 안정적으로 유지 | 세 개의 문자, 요청된 단어 아님, 단어도 아님 |
| 전달된 오디오 트랙 | 32kHz 스테레오, 모델 카드에 명시된 대로 정확히 | 48kHz 스테레오, 내가 generate_audio를 직접 설정했기 때문에만 존재 |
| 휩 팬과 사쿠가 스미어 | 타이틀로 번지면서 팬 실행 | 새로운 설정으로 하드 컷으로 대체 |
마지막 행은 지금까지 H3에 대한 가장 큰 공개 비판이며, 이것이 바로 내가 두 프롬프트에 모두 작성한 이유다. 0일차 ComfyUI 스레드에서 사용자 fwip은 공식 데모 프롬프트조차 무시된다고 불평했다: "지붕에서 떨어지는 격렬한 WHIP PAN이 떠 있는 단어를 함께 번지게 하고, 모션-스트릭. 그런데 비디오는 그 전환을 전혀 수행하지 않고, 그냥 컷으로 대체했다."
이번 실행에서는 Veo가 팬을 컷으로 교체했고, H3가 번짐을 실행했다. 각각 한 번씩의 시도는 판결이 아니며, 그렇게 주장하지 않는다. 그러나 비판이 H3에 국한되지 않는다는 것을 의미한다: 휩 팬은 이 테스트 전체에서 양쪽 모두에서 가장 신뢰할 수 없는 명령이다. 스토리보드가 휩 팬에 의존한다면, 그것을 통해 스토리보드하기보다는 우회하여 스토리보드하라.
5단계: Veo 3.1이 구조적으로 출력할 수 없는 4:3 레트로 OVA 컷
이것은 품질 선호도가 아니다. 벽이다. Veo의 aspect_ratio 열거형은 두 가지 값이며 4:3이 없고, duration 열거형에는 12가 없다. 90년대 OVA 룩은 단순히 도달할 수 없다.
Plain11990년대 OVA 애니메이션 컷, 4:3 풀프레임. 손으로 그린 배경 아트, 브러시 질감이 2보이는 셀 페인트 캐릭터, 두껍고 고르지 않은 잉크 라인, 플러드라이트 주변의 강한 3할레이션 글로우, 16mm 필름 그레인과 희미한 게이트 위브. 같은 빨간 머리 스트라이커가 4흰색과 남색 9번 유니폼을 입고 비에 젖은 경기장을 걸어 나가며 관중 소음이 단일 5울림 톤으로 사라짐. 카메라가 그의 얼굴에 천천히 접근. 그는 조용히 일본어로 말함: 6「次は、勝つ」. 레트로 팔레트: 음소거 청록, 먼지 앰버, 진한 적갈색 그림자. 7오디오: 먼 비, 단일 아날로그 신스 패드, 먼 거리에서 하나의 리버브가 강한 휘슬.
설정: 모델 minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. 비율을 수동으로 설정하고, 기본값을 기억하라.

Atlas Cloud의 MiniMax H3 텍스트-투-비디오 플레이그라운드, OVA 프롬프트 입력 및 완성된 레트로 클립
Atlas Cloud의 MiniMax H3 텍스트-투-비디오, OVA 프롬프트 입력, 클립 완료. 솔직히 말하면, 이 특정 실행은 Aspect Ratio를 16:9로, Duration을 8로 두었으므로, 오른쪽에 보이는 것은 와이드스크린 단축 버전이다. 아래의 4:3 12초 컷은 ratio: 4:3 및 duration: 12를 명시적으로 설정한 API 호출에서 나왔다.

4:3 레트로 OVA 컷: 90년대 애니메이션 스타일로 비에 젖은 경기장을 걸어 나가는 같은 스트라이커
H3 텍스트-투-비디오, 4:3, 12초. 전달된 파일은 1920x1440(픽셀 단위로 4:3)과 32kHz 스테레오 트랙으로 반환되었다. 여기서는 페이지를 가볍게 유지하기 위해 저해상도 GIF로 표시. Atlas Cloud에서 minimax/h3/text-to-video로 생성.
6단계: 9개의 레퍼런스 이미지, 하나의 캐릭터, 네 개의 컷
교차 샷 캐릭터 일관성은 AI 애니메이션에서 가장 어려운 문제이며, 레퍼런스 볼륨으로 해결된다. 먼저 팩을 구축하라: 1단계 프롬프트를 프레이밍을 정면, 3/4, 전체 프로필, 후면, 웃는 모습, 악물고 있는 모습, 전신 포즈, 유니폼 디테일, 부츠 디테일로 바꿔서 다시 실행. 9개의 이미지, 총 약 8센트.

레퍼런스 팩으로 생성된 동일한 오리지널 스트라이커 캐릭터의 네 각도, 2x2 그리드로 배열
9개의 레퍼런스 각도 중 네 개. H3는 하나의 레퍼런스 팩에 최대 9개의 이미지와 추가로 비디오 및 오디오 레퍼런스를 수용한다.
Plain1셀 쉐이딩 2D 애니메이션, 일관된 손으로 그린 선 두께, 플랫 컬러, 3D 쉐이딩 없음. 참조된 2스트라이커의 얼굴, 머리 실루엣 및 9번 유니폼을 모든 컷에서 동일하게 유지. 하나의 연속 3테이크에서 네 개의 컷: (1) 그의 부츠가 잔디에 닿는 로우앵글 푸시인, (2) 그의 눈의 4타이트한 클로즈업으로 휩 팬 업, (3) 흐릿한 실루엣으로 그려진 세 명의 수비수를 지나 5그가 전력 질주하는 와이드 샷, (4) 공중 헤더에서 프리즈, 속도선이 바깥으로 폭발. 6오디오: 관중 함성, 숨소리, 부츠가 잔디에 닿는 소리, 프리즈에서 하나의 태고 비트.
설정: 모델 minimax/h3/reference-to-video, refers = type: image로 이미지 설정, resolution: 2K, duration: 8 이상, ratio: adaptive 또는 16:9.
Veo 3.1의 동등한 설정은 이러한 설정으로 실행할 수 없으며, 이유를 알기 위해 시도할 필요도 없다. 레퍼런스 엔드포인트는 최대 3개의 이미지를 허용하며, 해당 엔드포인트를 선택하면 duration이 단일 법적 값인 8로 축소된다. 9개 이미지 팩과 10초 테이크는 모두 범위를 벗어난다.

Atlas Cloud의 MiniMax H3 레퍼런스-투-비디오 플레이그라운드, 4/9의 레퍼런스 카운터 및 출력 패널의 첫 번째 컷
Atlas Cloud의 MiniMax H3 레퍼런스-투-비디오. 카운터는 Reference Materials (4/9)로 표시되고 아래에 MAX:9가 있으며, 이는 사양표가 아닌 인터페이스의 상한이다. 출력은 첫 번째 컷, 부츠의 로우앵글 푸시인.
추가로 실행할 가치가 있는 네 가지 MiniMax H3 애니메이션 영상 생성기 실행
라스트 휘슬 샷은 네 가지 차이점만 강조한다. 이 네 가지는 나머지를 강조한다. 모두 H3에서 실행되며, Veo 3.1이 일치할 수 있는 것은 노트에 표시되어 있다.
- 울트라와이드 사쿠가 격투,
21:9, 10초. Veo는 21:9를 전혀 출력할 수 없다.
Plain1셀 쉐이딩 2D 애니메이션 액션, 두껍고 가늘어지는 잉크 라인, 플랫 컬러, 하드 에지 2섀도우, 3D 쉐이딩 없음. 황혼의 바람이 부는 사원 지붕 위의 두 오리지널 가면 검투사. 3칼날 충돌, 프레임이 떨리고, 두 전투기가 손으로 그린 임팩트 프레임과 방사형 속도선의 4폭발로 분리됨. 카메라: 로우앵글 푸시인, 측면 트랙, 오렌지 하늘을 배경으로 와이드 5실루엣으로 스냅. 오디오: 두 개의 날카로운 금속 충돌, 천 스냅, 마지막 프리즈에서 6낮은 태고 비트, 음악 없음.
- 비트 동기화 AMV 컷, 오디오 레퍼런스가 있는 레퍼런스-투-비디오. H3는 최대 3개의 오디오 클립을 레퍼런스 입력으로 받는다. Veo 3.1에는 오디오 입력이 전혀 없으며, 오디오 출력만 있다.
Plain1참조된 오디오 트랙에 맞춰진 셀 쉐이딩 2D 애니메이션 몽타주. 다섯 개의 짧은 비트: 2창문에 비, 손이 붕대를 조이는 모습, 기차 창문을 지나치는 도시 스카이라인, 스프린트 3시작, 뻗은 손에 프리즈. 모든 컷이 참조된 오디오의 다운비트에 정확히 맞춰짐. 플랫 4컬러, 두꺼운 잉크 라인, 깊은 인디고와 네온 마젠타의 고대비 야간 팔레트.
- 두 줄 일본어 대화 장면, 12초. 이것은 립싱크 스트레스 테스트이며, 12초는 이미 Veo의 범위 밖이다.
Plain1셀 쉐이딩 2D 애니메이션, 플랫 컬러, 3D 쉐이딩 없음. 골든 아워의 옥상에 있는 두 2오리지널 캐릭터, 샷 리버스 샷. 첫 번째가 일본어로 말함:「本当に行くの?」. 두 번째가 3반쯤 웃으며 일본어로 대답:「もう決めた」. 입이 모든 음절과 일치. 따뜻한 림 라이트, 4긴 그림자, 머리카락을 스치는 부드러운 바람. 오디오: 두 개의 뚜렷한 일본어 목소리, 5먼 교통 소음, 매미 한 마리.
- 세로 소년 단편,
9:16, 8초. 두 모델 모두 세로를 할 수 있으므로, 추정하지 말고 실제로 A/B 테스트할 수 있는 유일한 지점이다.
Plain1셀 쉐이딩 2D 애니메이션, 세로 구성. 오리지널 십대 주자가 종이 배너를 슬로우 모션으로 2뚫고 나간 후, 그녀가 경기장 직선 주로를 가속하면서 프레임이 전속력으로 스냅백. 3속도선, 플랫 컬러, 하드 섀도우, 굵은 그래픽 하늘. 카메라: 로우앵글 추적 샷, 그녀의 4얼굴로 휩 업. 오디오: 배너 찢어짐, 관중 파도, 한 번의 숨 참음 후 방출.
이면의 프롬프트 문법이 궁금하다면, MiniMax H3 프롬프트 가이드에서 H3가 카메라 및 오디오 명령을 구문 분석하는 방법에 대해 여기서보다 더 깊이 다룬다.
MiniMax H3 vs Veo 3.1에서 60초 애니메이션 오프닝 비용
표준 애니메이션 OP는 대략 90초다. 8초 샷 8개, 완성된 비디오 64초, 샷당 키프레임 1개(각 $0.009)로 계산해보자.
알려야 할 실제 가격 차이가 있으며, 내가 감추려고 하지 않는다. Atlas Cloud 카탈로그는 MiniMax H3를 초당 $0.10 플랫으로 나열하는 반면, 모델 리드미는 2K에서 $0.14/s, 768P에서 $0.10/s로 분류한다. Veo 3.1은 초당 $0.20으로 나열되지만, 리드미는 오디오 포함 $0.40/s, 오디오 미포함 $0.20/s로 구분한다.
내 스크린샷의 실행 버튼이 이를 해결한다. H3 레퍼런스-투-비디오, 8초 2K, Run $1.12로 표시되며, 이는 정확히 초당 $0.14이다. Veo 3.1 이미지-투-비디오, 8초 1080p 오디오 켜짐, Run $3.2로 표시되며, 이는 정확히 초당 $0.40이다. 따라서 리드미 요금이 청구되는 요금이며, 카탈로그 헤드라인은 입문 티어다. 어쨌든 아래에 두 수치를 모두 표시했다. 이는 2026년 8월 기준 정가다.
표 4: 8초 샷 8개, 키프레임 포함
| 설정 | 비디오 비용 (카탈로그 요금) | 비디오 비용 (리드미 요금) | 키프레임 | 총 범위 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 ~ $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 오디오 포함 | $12.80 | $25.60 | $0.07 | $12.87 ~ $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
가격은 표 1에 링크된 Atlas Cloud 모델 페이지에서 가져옴, 2026년 8월. 이 네 가지 중 현재 할인되는 것은 없다.
표에 포함되지 않은 두 가지 사항이 있으며, 둘 다 초당 요금보다 더 큰 영향을 미친다.
재시도. 아무도 애니메이션 샷의 첫 번째 테이크를 출시하지 않는다. 어떤 승수를 가정하든, 두 열에 동일하게 적용하면 차이가 같은 비율로 벌어진다.
실시간, 그리고 이것은 반대 방향으로 간다. 2026년 8월 7일에 처음부터 끝까지 시간을 측정: 8초 2K H3는 447초, 약 7.5분이 걸렸다. 12초 2K H3 텍스트-투-비디오는 334초가 걸렸다. 8초 1080p 오디오 포함 Veo 3.1은 152초, 3분 미만이 걸렸다. Veo는 여기서 첫 번째 테이크까지 약 3배 더 빠르며, 오전 2시에 샷을 반복하고 있다면 이는 실제 돈 가치가 있다. 대기열은 변동되므로, 이를 사양이 아닌 어느 날 오후의 스냅샷으로 취급하라. 하지만 "2~3분"을 H3 2K로 인용하는 사람은 대기열이 아닌 리드미를 인용하는 것이다. 2K 대 768P 분석에서는 더 높은 티어가 추가 시간을 들일 가치가 있는 경우를 다룬다.
애니메이션 스타일, 오마주 및 실제로 게시할 수 있는 것
이 기사의 모든 것은 스타일과 오마주다. 오리지널 캐릭터, 오리지널 유니폼, 오리지널 타이틀. 공식 애니메이션 캐릭터는 생성되거나 요청되지 않았으며, 실제 축구 선수의 이름이나 초상도 사용되지 않았다. 월드컵 트렌드는 _형식_으로 참조되었으며, 그것이 유용한 이유이기 때문이다.
그 구분은 장식이 아니다. 애니메이션 스타일의 콘텐츠를 상업적으로 제작하는 경우, "90년대 OVA 스타일"과 "이 특정 캐릭터, 이 특정 쇼"는 법적으로 다른 대상이며, 그중 하나만 비즈니스에 해당한다.
오픈 웨이트에 관해: H3는 실제로 다운로드 가능하며, 사람들은 0일차에 실행했다. 한 댓글러는 16GB의 4070 Ti Super에서 10초 480p 클립에 10분이 걸렸다고 보고했고, 다른 사람들은 5080에서 3분, RTX 6000 Pro에서 68초를 게시했다. 하지만 자체 호스팅은 768 short edge에서 실행되며, 2K를 생성하는 Context-IR 및 Regenerate-2K 단계는 API 측에 남아 있다.
라이선스에는 실제 함정이 있다. 커뮤니티 라이선스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으며, "현재 AI 관련 규정을 개발 또는 시행 중인" 지역을 언급한다. 공식 라이선스 요청 채널이 열려 있으며, 한 HN 댓글러는 "디즈니를 화나게 하지 않겠다고 약속하기만 하면 라이선스를 보내줄 것"이라고 요약했다. 재미있으면서도, 이 네 지역 중 하나에 있다면 건너뛸 수 없는 규정 준수 단계다. 오픈 웨이트 글에 전체 지역 목록이 있다.
자주 묻는 질문
MiniMax H3는 Veo 3.1과 비교하여 좋은 애니메이션 영상 생성기인가요?
대부분의 애니메이션 작업에서 H3는, 주로 렌더링이 아닌 이유로 그렇다. 4~15초를 실행하는 반면 Veo는 4, 6, 8초, 4:3과 21:9를 포함한 6가지 화면비를 제공하는 반면 Veo는 두 가지, 11개의 기본적으로 안정적인 대화 언어 중 일본어를 나열하며, 9개의 레퍼런스 이미지를 받는 반면 Veo는 3개다. Veo 3.1은 한 가지 특정 상황에서 승리한다: 재현 가능한 재촬영을 위한 seed 또는 샷이 3D 렌더 쉐이딩으로 변이하는 것을 막기 위한 negative_prompt가 필요할 때다. H3에는 두 매개변수 모두 없다. 파이프라인이 둘 중 하나에 의존한다면, 그것이 Veo를 고수해야 하는 진정한 이유다.
Veo 3.1은 4:3 또는 15초 클립으로 애니메이션을 생성할 수 있나요?
아니요, 스타일적인 이유가 아니다. Veo 3.1의 aspect_ratio 열거형은 정확히 16:9와 9:16만 포함하며, duration 열거형은 정확히 4, 6, 8만 포함한다. 선택할 수 있는 4:3 값이 없으며 12초나 15초를 요청할 방법도 없다. 레퍼런스가 90년대 TV 애니메이션 또는 OVA라면, Veo로는 프레이밍이 불가능하고 H3에서 가능하다.
내 Veo 3.1 애니메이션 클립이 왜 무성으로 돌아왔나요?
generate_audio가 API에서 기본적으로 false로 설정되어 있기 때문이다. 플레이그라운드 토글은 일반적으로 이미 켜져 있으므로, API를 직접 호출하는 사람들만 문제를 겪는다. generate_audio: true를 명시적으로 설정하라. 그곳에 있을 때 resolution도 설정하라, 기본값이 720p이므로, 아마 의도한 1080p 또는 4k가 아니다.
MiniMax H3는 애니메이션용 일본어 대화와 립싱크를 지원하나요?
그렇다. 모델 카드는 안정적인 대화를 지원하는 11개 언어를 나열한다: 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어. 오디오는 영상과 함께 32kHz 스테레오로 생성되며, 이후에 더빙되지 않으므로 입 타이밍이 처음 몇 음절 대신 전체 라인에 걸쳐 유지된다. 일본어 라인을 프롬프트에 일본어로 직접 작성하라.
애니메이션 캐릭터의 일관성을 유지하기 위해 몇 개의 레퍼런스 이미지를 사용할 수 있나요?
MiniMax H3는 최대 9개의 이미지, 최대 3개의 비디오 클립 및 최대 3개의 오디오 클립을 허용하며, 모든 유형에 걸쳐 하드 상한은 12개 파일이다. Veo 3.1의 레퍼런스-투-비디오 엔드포인트는 1~3개의 이미지를 허용하며, 선택하면 duration이 유일한 법적 값인 8로 축소된다. 시리즈 전반에 걸쳐 반복되는 애니메이션 캐릭터의 경우, 그 차이가 모든 것을 결정한다.
MiniMax H3는 오픈 웨이트를 가지고 있으므로, 내 애니메이션 파이프라인을 로컬에서 무료로 실행할 수 있나요?
다운로드하여 실행할 수 있지만, 세 가지 주의사항이 있다. 자체 호스팅 추론은 768 short edge에서 실행되며, 2K 출력을 생성하는 Context-IR 및 Regenerate-2K 단계는 API 측에 남아 있다. 실제 로컬 속도는 카드에 따라 크게 다르다: 4070 Ti Super에서 10초 480p 클립에 약 10분, 5080에서 약 3분, RTX 6000 Pro에서 약 68초 (0일차 ComfyUI 스레드 기준). 그리고 커뮤니티 라이선스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으므로, 해당 지역 중 하나에 있다면 상업적 사용 전에 공식 라이선스가 필요하다.






