올여름 내내 내 피드는 같은 영상이 반복 재생되고 있었다. 월드컵 선수들을 소년 만화 주인공으로 재탄생시킨 영상. 독재자. 해적 선장. 마지막 4초에 등장하는 거친 멘토. 게시물당 수백만 뷰, 그리고 거의 매 경기마다 이야기가 업데이트된다.
그 영상들을 만드는 사람들은 벤치마크 게시글을 쓰고 있지 않다. 그들은 모델을 선택하고, 크레딧을 소모하며, 다음 킥오프 전에 결과물을 내놓는다.
그래서 나는 애니메이션 키프레임 하나와 프롬프트 하나를 가져와, MiniMax H3를 애니메이션 영상 생성기로 Veo 3.1과 비교 테스트했다. 두 모델 모두 동일한 입력에 대해 최대 설정으로 밀어붙였다.
처음으로 문제가 생긴 것은 이미지 품질이 아니었다. 드롭다운이었다. Veo 3.1은 8초에서 멈추고 정확히 두 가지 화면비만 제공한다. 얼굴을 잡는 샷, 공을 따라 빠르게 패닝하고, 타이틀 카드가 떨어지는 장면은 8초 안에 들어맞지 않는다. 품질에서 실패할 기회조차 없었다.
핵심 요점
- Veo 3.1의
duration열거형은[4, 6, 8]이고aspect_ratio열거형은[16:9, 9:16]이다. MiniMax H3는 4초에서 15초까지 모든 정수 초를 지원하며21:9, 16:9, 4:3, 1:1, 3:4, 9:16을 제공한다. Veo에 4:3이 없으면 레트로 OVA 프레이밍이 전혀 불가능하다. - H3의 모델 카드는 11개의 기본적으로 안정적인 대화 언어를 나열하며 일본어가 그중 하나이다. 오디오와 영상이 함께 생성되며(32kHz 스테레오), 이후에 더빙되지 않는다.
- 참조 팩은 차이가 크다: H3는 최대 9개의 이미지와 최대 3개의 비디오 및 3개의 오디오 클립(최대 12개 파일)을 허용한다. Veo 3.1의 참조 엔드포인트는 3개의 이미지만 허용하며, 이를 사용하면
duration이[8]로만 축소된다. - 테스트를 조용히 망치는 두 가지 함정: Veo의 API는
generate_audio가 기본값false이고resolution이 기본값720p이며, H3의 텍스트-비디오ratio기본값은1:1이다. 이들을 그대로 두면 무음 720p 클립과 정사각형 클립을 비교하는 꼴이 된다. - Veo 3.1은 H3가 전혀 가지고 있지 않은 두 가지를 유지한다:
seed와negative_prompt. 2D 애니메이션에서 후자는 정말 중요하며, 이후에 설명하겠다.
MiniMax H3 애니메이션 영상 생성기 vs Veo 3.1, 동일한 프레임을 연속으로 비교
오리지널 캐릭터 하나. 키프레임 하나. 프롬프트 하나를 문자 그대로 두 모델에 복사. 나머지는 각각 최대로 설정.
MiniMax H3, 이미지-비디오, 2K, 8초, 네이티브 오디오. 소리를 켜라: 관중 소음, 공을 차는 소리, 일본어 외침이 영상과 동시에 생성된다. Atlas Cloud에서 minimax/h3/image-to-video로 생성.
Veo 3.1, 이미지-비디오, 1080p, 8초, generateaudio 수동으로 켜고, 라인 아트를 평평하게 유지하는 negativeprompt 추가. 동일한 첫 프레임, 동일한 단어. Atlas Cloud에서 google/veo3.1/image-to-video로 생성.
둘 다 아름답게 그린다. Veo의 넓은 샷, 손으로 그린 충격선과 공중에 떠 있는 만화 효과음이 정말 훌륭하다. 이것이 솔직한 출발점이며, 이 기사의 나머지 부분이 '분위기'가 아닌 매개변수와 명령 수행에 관한 이유이기도 하다.
대부분의 MiniMax H3 애니메이션 영상 생성기 vs Veo 3.1 테스트가 잘못되는 이유
올여름 두 가지 일이 동시에 일어났다.
애니메이션이 AI 영상에서 가장 높은 볼륨의 형식이 되었다. 2026년 월드컵은 소년 만화 토너먼트로 재구성되었으며, 선수들은 독재자, 해적 선장, 해병대 장군, 멘토로 캐스팅되었고, TikTok, Instagram, X, YouTube 전반에서 "거의 매 경기마다 진화하는" 스토리라인을 만들었다(Complex, 2026년 7월).
그리고 MiniMax H3가 오픈 웨이트로 출시되었다. 출시 당일 ComfyUI 스레드는 330포인트와 95개의 댓글을 기록했으며, 사람들은 몇 시간 내에 실제 로컬 수치를 게시했다(Hacker News, 2026년 8월).
이 두 가지를 합치면 애니메이션 비교가 쏟아져 나올 것 같지만, 거의 없다. 대부분의 테스트가 다음 네 가지 방식 중 하나로 잘못 구성되었기 때문이다.
그림을 비교하는 것이지 제약 조건을 비교하는 것이 아니다. 애니메이션 샷은 타이밍이다. 휘팬에서 타이틀 카드로 이어지는 것은 렌더링 문제 이전에 지속 시간 문제이다.
Veo의 API가 기본적으로 무음임을 잊는다. API에서 generate_audio는 false이고 resolution은 720p이다. "Veo에는 애니메이션 오디오가 없다"는 많은 게시물은 단순히 불리언을 켜지 않은 사람의 것이다.
H3의 텍스트-비디오가 기본적으로 정사각형임을 잊는다. ratio 기본값은 16:9가 아닌 1:1이다. 설정하지 않고 t2v 애니메이션 프롬프트를 실행하면 정사각형 클립과 혼란스러운 결론만 얻는다.
포토리얼 프롬프트로 테스트한다. "영화적, 볼류메트릭 라이트, 얕은 심도"는 정확히 2D 모델을 3D 렌더 쉐이딩으로 끌어당기는 용어이다. 애니메이션에서의 실패 모드는 블러가 아니라 플라스틱 느낌이다.
실행 전에 애니메이션 테스트를 결정하는 세 가지 설정
무엇보다 먼저, 양쪽에서 이 설정들을 지정하지 않으면 비교는 무효다.
| 설정 | MiniMax H3 | Veo 3.1 | 건너뛰면 발생하는 일 |
|---|---|---|---|
| 오디오 | 영상과 함께 항상 생성됨 | generate_audio 기본값 false | Veo가 무음 클립을 반환하여 실제보다 나빠 보임 |
| 프레임 형태 | 텍스트-비디오에서 ratio 기본값 1:1 | aspect_ratio 기본값 16:9 | H3가 사용할 수 없는 정사각형 애니메이션 컷을 반환 |
| 해상도 | 기본값 2K | 기본값 720p | 2K와 720p를 비교하며 품질 차이라고 부름 |
MiniMax H3 vs Veo 3.1 애니메이션 사양표: 길이, 비율, 오디오, 참조
출시 게시글이 아닌 두 모델의 실제 입력 스키마를 가져왔다. 아래 모든 값은 직접 읽을 수 있는 열거형이며, 인상이 아니다.
표 1: MiniMax H3 vs Veo 3.1, 애니메이션 샷을 결정하는 매개변수
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 지속 시간 | 4초~15초, 모든 정수 초 (기본 8) | 4, 6, 8 (기본 8) |
| 화면비 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 비율 기본값 (텍스트-비디오) | 1:01 | 16:09 |
| 해상도 | 768P, 2K (기본 2K) | 720p, 1080p, 4k (기본 720p) |
| 오디오 | 공동 생성, 32kHz 스테레오 | generate_audio, 기본 false |
| 네이티브 대화 언어 | 11개 안정, 일본어 포함 | 안정적인 목록 공개되지 않음 |
| 참조 팩 | 최대 9개 이미지, 3개 비디오, 3개 오디오 클립, 총 12개 파일 | 3개 이미지 |
| 참조 사용 시 지속 시간 | 여전히 4~15초 | 8초로만 축소 |
| seed | 사용 불가 | 사용 가능 |
| negative_prompt | 사용 불가 | 사용 가능 |
| 가중치 | 다운로드 가능 | 비공개 |
지속 시간, 비율, 해상도, 오디오 및 참조 제한은 MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video 및 Veo 3.1 reference-to-video 페이지의 라이브 스키마에서 읽었다. 9개 이미지와 12개 파일 참조 상한, 11개 언어 대화 목록은 MiniMax H3 모델 카드 (Hugging Face, 2026년 8월)에서 가져왔다.
이제 점수판을 보자. 사양표와는 다른 이야기를 하며 둘 다 중요하다.
표 2: 군중 투표 Elo 및 분당 가격, 2026년 8월 7일 스냅샷
| 모델 | 텍스트-비디오 (오디오 포함) | 이미지-비디오 (오디오 포함) | $/분 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 상위 10위권 밖 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 상위 10위권 밖 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 상위 10위권 밖 | $4.80 |
Elo 및 가격 수치는 Artificial Analysis Video Arena (Artificial Analysis, 2026년 8월)에서 가져왔다. 이는 변동하는 군중 투표이며, 달라질 수 있다. $/분 열은 정규화된 모델 추정치이며, 실제 청구서가 아니다.
145점의 Elo 차이는 크지만, 이는 일반적인 투표이지 애니메이션 전용 투표가 아니다. 그리고 솔직히 말해야 할 부분이 있다: MiniMax는 H3를 애니메이션 모델로 마케팅하지 않는다. 내부 1차 피드백은 영화, 애니메이션, 코믹 드라마를 H3가 목표로 하지 않는 영역으로 나열한다. 따라서 흥미로운 질문은 "어느 쪽이 애니메이션 모델인가"가 아니라, 애니메이션을 판매 포인트로 삼지 않는 모델이 왜 샷에서 이기고, Google이 여전히 라운드를 가져가는 지점이 어디인가이다.
튜토리얼 전에 실용적인 참고사항 하나. 아래의 모든 모델은 동일한 콘솔과 동일한 API 키를 통해 실행되며, 이것이 매개변수를 비교 가능하게 만드는 유일한 이유이다. 동일한 대기열, 동일한 인증, 하나의 청구서. GPT Image 2를 한 서비스에, Veo를 다른 서비스에 설정하면, 발견하는 차이의 절반은 모델 자체가 아니라 배관 문제일 것이다.
샷 만들기: MiniMax H3 vs Veo 3.1, 단계별
하나의 실행 예제, 처음부터 끝까지. "라스트 호이슬": 오리지널 10대 스트라이커, 빨간 머리, 흰색과 남색 9번 유니폼, 플러드라이트, 슛에 대한 휘팬, 그리고 마지막 2초에 안정적으로 떠야 하는 일본어 타이틀 카드.
실제 선수 없음, 공식 캐릭터 없음, 기존 애니메이션 IP 없음. 스타일과 오마주만. 이유는 잠시 후에 설명.
1단계: GPT Image 2로 애니메이션 키프레임 디자인
키프레임은 비디오 모델이 발명할 필요 없도록 아트 방향을 전달한다. 왼쪽 1/3의 네거티브 공간에 주목하라: 의도적이다. 타이틀 카드가 비디오 모델에 의해 그곳에 쓰여지며, 이것이 텍스트 안정성 테스트이다.
Plain1현대 소년 스포츠 애니메이션의 단일 프레임. 셀 쉐이딩 2D 애니메이션, 일관된 선 굵기의 2핸드 잉크 라인 아트, 플랫 컬러 채움, 경계가 뚜렷한 그래픽 섀도우, 3D 쉐이딩이나 3포토리얼 피부는 절대 없음. 오리지널 10대 스트라이커의 클로즈업: 헝클어진 짙은 빨간 머리, 4흰색과 남색 유니폼에 9번, 땀과 잔디 자국이 한쪽 뺨에, 지친 결의를 담은 커다란 눈, 5소리 지르며 입을 벌린 상태. 그 뒤로 경기장 플러드라이트가 흐릿한 관중 색상의 벽으로 6타오르고, 방사형 스피드 라인이 프레임 중앙에서 터져 나옴; 공중에 얼어붙은 잔디 한 잎. 7채도 높은 팔레트, 깊은 시안 섀도우, 따뜻한 오렌지 림 라이트. 16:9 구성, 캐릭터는 8프레임 오른쪽에 배치, 왼쪽 1/3은 깨끗한 네거티브 공간. 이미지 내 텍스트 없음.
설정: 모델 openai/gpt-image-2/text-to-image, 품질 high, 크기 16:9 (2048x1152). 그 외는 없음.

Atlas Cloud의 GPT Image 2 플레이그라운드, Last Whistle 키프레임 프롬프트와 출력 패널의 완성된 애니메이션 프레임
Atlas Cloud의 GPT Image 2: 품질을 high로 설정, 오른쪽에 완성된 키프레임.

기본 애니메이션 키프레임: 경기장 플러드라이트 아래에서 소리 지르는 오리지널 빨간 머리 스트라이커, 셀 쉐이딩, 플랫 컬러, 스피드 라인
두 모델이 받는 키프레임. 플랫 컬러, 하드 섀도우, 타이틀 카드를 기다리는 빈 왼쪽 1/3.
2단계: MiniMax H3 이미지-비디오, 모든 것을 최대로
동일한 사진 입력, 2K 출력. 여기서는 H3를 8초로 제한했는데, 이는 Veo의 상한과 맞추기 위해서이다. 이것이 H3의 한계는 아니며, 4단계에서 제한을 해제한다.
Plain1셀 쉐이딩 2D 애니메이션, 핸드 잉크 선 굵기, 플랫 컬러, 3D 쉐이딩 없음. 스트라이커의 2얼굴에 한 박자 머문 후, 그가 공을 차면서 격렬한 휘팬이 공을 따라가며, 패닝이 프레임을 3사쿠가 모션 트레일로 번지게 함. 충격 순간 한 프레임의 완전한 침묵. 마지막 2초 동안, 4굵은 흰색 일본어 타이틀 문자 ラストホイッスル이 프레임 왼쪽 1/3에 강하게 등장하고 5바위처럼 안정적으로 유지됨, 뒤틀림, 깜빡임, 밀림 없음. 스트라이커가 일본어로 한 줄 6외침: 「まだ終わってない!」. 오디오: 경기장 함성, 하나의 날카로운 공 타격음, 타이틀 7카드 아래 낮은 다이코 히트.
설정: 모델 minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (이미지-비디오는 입력 이미지에서 프레임 모양을 가져옴), image = 1단계 출력.
텍스트-비디오로 분기하는 경우 한 가지 경고: ratio: 16:9를 명시적으로 작성하라. 기본값은 1:1이며, 기꺼이 정사각형 애니메이션 컷을 제공할 것이다.

Atlas Cloud의 MiniMax H3 이미지-비디오 플레이그라운드, Last Whistle 프롬프트, 키프레임 로드 및 출력 패널의 완성된 클립
Atlas Cloud의 MiniMax H3 이미지-비디오: 왼쪽에 로드된 1단계 키프레임, 오른쪽에 재생 중인 완성된 클립.
3단계: Veo 3.1 이미지-비디오, 오디오 수동으로 켜기
프롬프트는 동일하며, 단어 하나하나 같다. 하나의 형용사를 바꾸면 더 이상 비교가 아니다. 달라지는 것은 Veo가 제공하고 H3는 제공하지 않는 추가 필드이다.
negative_prompt: 2D 애니메이션에서 이 목록에서 가장 유용한 제어 항목이다.
Plain13D 렌더, CGI, 플라스틱 쉐이딩, 포토리얼 피부, 실사 영상, 모션 블러 수프, 왜곡된 문자, 2횡설수설 텍스트, 추가 손가락, 자막 바
설정: 모델 google/veo3.1/image-to-video, resolution: 1080p (변경하라, 기본값은 720p), duration: 8 (이것이 상한), aspect_ratio: 16:9, generate_audio: true (API 기본값은 false, 이것이 무음 클립 함정), seed: 20260807, image = 동일한 1단계 출력.

Atlas Cloud의 Veo 3.1 이미지-비디오 플레이그라운드, 오디오 생성 활성화, 애니메이션 키프레임 로드 및 출력 패널의 완성된 클립
Atlas Cloud의 Veo 3.1 이미지-비디오, Generate Audio 켜짐, 오른쪽에 완성된 클립.
4단계: 5가지 애니메이션 특화 축으로 평가
여기서 생성할 것은 없다. 애니메이션이 실제로 실패하는 항목을 살펴보기만 하면 된다. 두 클립 모두 이 기사 상단 근처에 포함되어 있으므로, 내 말을 믿지 않고 직접 평가할 수 있다.

두 클립의 마지막 프레임 나란히 비교: 왼쪽 MiniMax H3는 깨끗한 일본어 타이틀 문자, 오른쪽 Veo 3.1은 횡설수설한 세로 문자
각 클립의 마지막 프레임. 왼쪽, H3는 ラストホイッスル을 8개의 가타카나 모두 정확하고 안정적으로 썼다. 오른쪽, Veo 3.1은 요청된 단어도 아니고 단어를 형성하지도 않는 세 개의 문자를 썼다.
타이틀 카드가 라운드를 결정한 지점이며, 근접하지도 않았다. H3는 요청된 가타카나를 정확히, 경계가 선명하고 안정적으로, 골문의 번진 패닝 위에 렌더링했다. Veo 3.1은 요청된 단어도 아니고 단어도 아닌 세 개의 문자의 수직 스택을 생성했다. 동일한 프레임에서 캐릭터를 샷 밖으로 떨어뜨리고 배경이 세미 포토리얼 경기장 플레이트로 미끄러지도록 두었으며, photorealistic skin과 3D render가 네거티브 프롬프트에 있었음에도 불구하고.
표 3: 애니메이션 컷을 결정하는 5가지 축, 이 두 실행에서
| 축 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 키프레임에서 캐릭터 연속성 | 8초 동안 정확한 얼굴, 머리, 유니폼 유지 | 캐릭터를 새로운 와이드 샷으로 다시 그림, 모델은 유지했지만 다른 그림 |
| 선 굵기 및 플랫 셀 쉐이딩 | 유지, 3D로의 드리프트 없음 | 중간 샷에서는 유지, 끝에 가서 사진 같은 경기장 플레이트로 드리프트 |
| 일본어 타이틀 카드 | ラストホイッスル 정확하게 렌더링되어 안정적으로 유지 | 세 개의 문자, 요청된 단어도 아니고 단어도 아님 |
| 전달된 오디오 트랙 | 32kHz 스테레오, 모델 카드에 명시된 대로 정확함 | 48kHz 스테레오, 내가 generate_audio를 직접 설정했기 때문에만 존재 |
| 휘팬 및 사쿠가 스미어 | 번진 팬으로 실행되어 타이틀로 이어짐 | 새로운 설정으로의 하드 컷으로 대체됨 |
마지막 행은 지금까지 H3에 대한 가장 큰 공개 비판이며, 이것이 바로 내가 두 프롬프트에 모두 포함시킨 이유이다. 출시 당일 ComfyUI 스레드에서 사용자 fwip는 공식 데모 프롬프트조차 무시되었다고 불평했다: "지붕에서 격렬한 휘팬이 떠다니는 단어를 함께 번지게 하고, 모션 스트릭을 남기는데, 비디오는 그 전환을 전혀 수행하지 않고 컷으로 대체했다."
이번 실행에서는 Veo가 팬을 컷으로 교체했고, H3가 스미어를 실행했다. 각각 한 번의 실행이 판결은 아니며, 그렇게 주장하지도 않는다. 그러나 비판이 H3에 국한된 것은 아님을 의미한다: 휘팬은 이 테스트 전체에서 양쪽 모두 가장 신뢰할 수 없는 명령이다. 스토리보드가 휘팬에 의존한다면, 그것을 통해 작업하기보다는 스토리보드를 우회하라.
5단계: Veo 3.1이 구조적으로 출력할 수 없는 4:3 레트로 OVA 컷
이것은 품질 선호도가 아니다. 벽이다. Veo의 aspect_ratio 열거형에는 두 개의 값이 있으며 4:3은 없고, duration 열거형에는 12가 없다. 90년대 OVA 룩은 단순히 접근할 수 없다.
Plain11990년대 OVA 애니메이션 컷, 4:3 풀프레임. 눈에 보이는 붓 질감의 손으로 그린 배경 2아트, 두껍고 고르지 않은 잉크 라인의 셀 페인트 캐릭터, 플러드라이트 주변의 무거운 3헐레이션 글로우, 16mm 필름 그레인과 희미한 게이트 위브. 흰색과 남색 9번 유니폼의 4같은 빨간 머리 스트라이커가 관중 소음이 단일 울림 톤으로 사라지는 비에 젖은 5경기장을 걸어 나간다. 카메라가 그의 얼굴을 천천히 밀어 넣는다. 그는 조용히 일본어로 6말한다: 「次は、勝つ」. 레트로 팔레트: 음소거 틸, 먼지 앰버, 진한 마룬 섀도우. 7오디오: 먼 비, 외로운 아날로그 신스 패드, 먼 거리의 잔향이 많은 호루라기 하나.
설정: 모델 minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. 비율을 수동으로 설정하라, 기본값을 기억하라.

Atlas Cloud의 MiniMax H3 텍스트-비디오 플레이그라운드, OVA 프롬프트 입력 및 출력 패널의 완성된 레트로 클립
Atlas Cloud의 MiniMax H3 텍스트-비디오, OVA 프롬프트 입력, 클립 완료. 솔직히 말하면, 이 특정 실행은 Aspect Ratio를 16:9로, Duration을 8로 남겨두었으므로, 오른쪽에 보이는 것은 와이드스크린 짧은 버전이다. 아래의 4:3 12초 컷은 ratio: 4:3 및 duration: 12를 명시적으로 설정한 API 호출에서 나왔다.

4:3 레트로 OVA 컷: 90년대 애니메이션 스타일로 비에 젖은 경기장을 걸어 나가는 같은 스트라이커
H3 텍스트-비디오, 4:3, 12초. 전달된 파일은 1920x1440(픽셀 단위로 4:3)으로 돌아왔으며, 32kHz 스테레오 트랙이 포함되었다. 페이지를 가볍게 유지하기 위해 축소된 프레임 속도의 무음 GIF로 표시. Atlas Cloud에서 minimax/h3/text-to-video로 생성.
6단계: 9개의 참조 이미지, 하나의 캐릭터, 4개의 컷
교차 샷 캐릭터 일관성은 AI 애니메이션에서 가장 어려운 문제이며, 참조 볼륨으로 해결한다. 먼저 팩을 만든다: 1단계 프롬프트를 프레이밍을 정면, 쓰리쿼터, 전체 프로필, 뒤, 웃는 모습, 악문 이빨, 전신 자세, 유니폼 디테일, 부츠 디테일로 바꿔 재실행한다. 9개의 이미지, 총 약 8센트.

참조 팩으로 생성된 동일한 오리지널 스트라이커 캐릭터의 네 가지 각도, 2x2 그리드로 배열
9개의 참조 각도 중 네 가지. H3는 하나의 참조 팩에 최대 9개의 이미지를 허용하며, 그 위에 비디오 및 오디오 참조도 추가할 수 있다.
Plain1셀 쉐이딩 2D 애니메이션, 일관된 핸드 잉크 선 굵기, 플랫 컬러, 3D 쉐이딩 없음. 참조된 2스트라이커의 얼굴, 머리 실루엣, 9번 유니폼을 모든 컷에서 동일하게 유지. 하나의 연속 3테이크에서 네 개의 컷: (1) 그의 부츠가 잔디에 닿는 로우 앵글 푸시인, (2) 그의 눈의 4타이트 클로즈업으로 휘팬 업, (3) 그가 흐릿한 실루엣으로 그려진 세 명의 수비수를 5지나쳐 달리는 와이드 샷, (4) 공중 헤더에서 프리즈, 스피드 라인이 바깥으로 폭발. 6오디오: 관중 함성, 숨, 부츠-잔디 충돌, 프리즈에서 다이코 히트 하나.
설정: 모델 minimax/h3/reference-to-video, refers = 이미지들 (type: image), resolution: 2K, duration: 8 이상, ratio: adaptive 또는 16:9.
Veo 3.1의 동등한 설정은 이러한 설정으로 실행될 수 없으며, 이유를 알기 위해 시도할 필요도 없다. 참조 엔드포인트는 최대 3개의 이미지만 허용하며, 해당 엔드포인트를 선택하면 duration이 단일 합법 값인 8로 축소된다. 9개의 이미지 팩과 10초 테이크는 모두 범위를 벗어난다.

Atlas Cloud의 MiniMax H3 참조-비디오 플레이그라운드, 참조 카운터가 4/9로 표시되고 출력 패널에 첫 번째 컷
Atlas Cloud의 MiniMax H3 참조-비디오. 카운터는 Reference Materials (4/9)로 표시되며, 아래에 MAX:9가 있다. 이는 사양표의 주장이 아닌 인터페이스의 상한이다. 출력은 첫 번째 컷, 부츠의 로우 앵글 푸시인.
실행해 볼 가치가 있는 추가 MiniMax H3 애니메이션 영상 생성기 4회
Last Whistle 샷은 네 가지 차이점만 강조한다. 이 네 가지는 나머지를 강조한다. 모두 H3에서 실행된다; Veo 3.1이 일치시킬 수 있는 것에 대한 참고 사항이 포함되어 있다.
- 울트라와이드 사쿠가 격투,
21:9, 10초. Veo는 21:9를 전혀 출력할 수 없다.
Plain1셀 쉐이딩 2D 애니메이션 액션, 두껍고 가늘어지는 잉크 라인, 플랫 컬러, 경계선이 뚜렷한 2섀도우, 3D 쉐이딩 없음. 황혼에 바람이 부는 사원 지붕 위의 두 오리지널 가면 검투사. 3칼날 충돌, 프레임이 떨리고, 두 전투기가 손으로 그린 임팩트 프레임과 방사형 스피드 4라인의 폭발 속에서 갈라짐. 카메라: 로우 앵글 푸시인, 이어서 측면 트랙, 그 후 오렌지 5하늘을 배경으로 실루엣의 와이드 샷으로 스냅. 오디오: 두 개의 날카로운 금속 충돌, 6천 스냅, 최종 프리즈에서 낮은 다이코 히트, 음악 없음.
- 비트 동기화 AMV 컷, 오디오 참조를 사용한 참조-비디오. H3는 최대 3개의 오디오 클립을 참조 입력으로 받는다. Veo 3.1에는 오디오 입력이 전혀 없으며 오디오 출력만 있다.
Plain1참조된 오디오 트랙에 맞춰진 셀 쉐이딩 2D 애니메이션 몽타주. 다섯 개의 짧은 비트: 2창문에 비, 손이 붕대를 조임, 기차 창문을 스쳐 지나가는 도시 스카이라인, 스프린트 3시작, 뻗은 손에 프리즈. 모든 컷이 참조된 오디오의 다운비트에 정확히 떨어짐. 플랫 4컬러, 두꺼운 잉크 라인, 깊은 인디고와 네온 마젠타의 고대비 나이트 팔레트.
- 두 줄 일본어 대화 장면, 12초. 이것이 립싱크 스트레스 테스트이며, 12초는 이미 Veo의 범위를 벗어난다.
Plain1셀 쉐이딩 2D 애니메이션, 플랫 컬러, 3D 쉐이딩 없음. 골든 아워에 옥상 위의 두 오리지널 2캐릭터, 샷 리버스 샷. 첫 번째가 일본어로 말함: 「本当に行くの?」. 두 번째가 반쯤 3미소 지으며 일본어로 대답: 「もう決めた」. 입이 모든 음절과 일치함. 따뜻한 림 라이트, 4긴 그림자, 머리카락에 부드러운 바람. 오디오: 두 개의 뚜렷한 일본어 목소리, 먼 교통 5소음, 매미 한 마리.
- 세로 소년 만화 단편,
9:16, 8초. 두 모델 모두 세로를 할 수 있으므로, 이것이 가정하지 않고 실제로 A/B 테스트할 수 있는 유일한 지점이다.
Plain1셀 쉐이딩 2D 애니메이션, 세로 구성. 오리지널 10대 주자가 슬로우 모션으로 종이 배너를 2뚫고 나온 후, 그녀가 경기장 직선 주로를 가속하면서 프레임이 풀 스피드로 스냅됨. 3스피드 라인, 플랫 컬러, 하드 섀도우, 대담한 그래픽 하늘. 카메라: 로우 앵글 추적 샷, 4그 다음 그녀의 얼굴로 휘팬. 오디오: 배너 찢어짐, 관중 파도, 한 번의 숨 참음 후 방출.
이러한 프롬프트 뒤에 있는 프롬프트 문법을 원한다면, MiniMax H3 프롬프트 가이드에서 H3가 카메라 및 오디오 명령을 구문 분석하는 방법을 여기서 다룰 수 있는 것보다 더 자세히 다룬다.
MiniMax H3 vs Veo 3.1에서 60초 애니메이션 오프닝 비용
표준 애니메이션 OP는 약 90초이다. 8초 샷 8개, 완성된 비디오 64초, 각 샷당 키프레임 하나($0.009)로 계산해보자.
알아야 할 실제 가격 불일치가 있다. Atlas Cloud 카탈로그는 MiniMax H3를 초당 $0.10 고정으로 나열하지만, 모델 리드미는 2K에서 초당 $0.14, 768P에서 초당 $0.10으로 세분화한다. Veo 3.1은 초당 $0.20으로 나열되지만, 리드미는 오디오 포함 시 초당 $0.40, 오디오 없이 초당 $0.20으로 구분한다.
내 스크린샷의 실행 버튼이 이를 해결한다. H3 참조-비디오, 8초 2K, Run $1.12로 표시되며, 이는 정확히 초당 $0.14이다. Veo 3.1 이미지-비디오, 8초 1080p 오디오 켜짐, Run $3.2로 표시되며, 이는 정확히 초당 $0.40이다. 따라서 리드미 요금이 청구되는 요금이고, 카탈로그 헤드라인은 입문 티어이다. 어쨌든 아래에 두 수치를 모두 표시했다. 이는 2026년 8월 기준 공시 가격이다.
표 4: 8초 샷 8개, 키프레임 포함
| 설정 | 비디오 비용 (카탈로그 요금) | 비디오 비용 (리드미 요금) | 키프레임 | 총 범위 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 ~ $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 오디오 포함 | $12.80 | $25.60 | $0.07 | $12.87 ~ $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
가격은 표 1에 링크된 Atlas Cloud 모델 페이지에서 가져옴, 2026년 8월. 이 네 가지 중 현재 할인되는 것은 없다.
표에 포함되지 않은 두 가지 사항이 있으며, 둘 다 초당 요금보다 더 큰 영향을 미친다.
재시도. 아무도 애니메이션 샷의 첫 번째 테이크를 출시하지 않는다. 어떤 승수를 가정하든, 두 열에 동일하게 적용하면 차이가 같은 비율로 벌어진다.
실시간 소요 시간, 그리고 이것은 반대 방향으로 간다. 2026년 8월 7일에 종단 간 시간 측정: H3 2K 8초는 447초(약 7.5분)가 걸렸다. H3 텍스트-비디오 2K 12초는 334초가 걸렸다. Veo 3.1 1080p 8초 오디오 포함은 152초(약 3분 미만)가 걸렸다. Veo는 여기서 첫 번째 테이크까지 약 3배 더 빠르며, 오전 2시에 샷을 반복하는 경우 이는 실제 돈의 가치가 있다. 대기열은 변동하므로, 이를 사양이 아닌 어느 날 오후의 스냅샷으로 취급하라. 그러나 H3 2K에 대해 "2~3분"을 인용하는 사람은 대기열이 아닌 리드미를 인용하는 것이다. 2K vs 768P 분석에서는 더 높은 티어가 추가 시간을 투자할 가치가 있는 경우를 다룬다.
애니메이션 스타일, 오마주, 그리고 실제로 게시할 수 있는 것
이 기사의 모든 것은 스타일과 오마주이다. 오리지널 캐릭터, 오리지널 유니폼, 오리지널 타이틀. 공식 애니메이션 캐릭터는 생성되거나 요청되지 않았으며, 실제 축구 선수의 이름이나 초상도 사용되지 않았다. 월드컵 트렌드는 _형식_으로 참조되었으며, 이것이 유용한 이유이다.
그 구분은 장식이 아니다. 상업적으로 애니메이션 스타일 콘텐츠를 제작하는 경우, "90년대 OVA 스타일"과 "이 특정 쇼의 이 특정 캐릭터"는 다른 법적 대상이며, 그중 하나만 비즈니스이다.
오픈 웨이트에 관해서: H3는 실제로 다운로드 가능하며, 사람들은 출시일에 실행했다. 한 댓글 작성자는 4070 Ti Super 16GB에서 10초 480p 클립에 10분이 걸렸다고 보고했으며, 다른 사람들은 5080에서 3분, RTX 6000 Pro에서 68초를 게시했다. 그러나 자체 호스팅은 768 숏 엣지에서 실행되며, 2K를 생성하는 Context-IR 및 Regenerate-2K 단계는 API 측에 남아 있다.
라이센스에는 실제 함정이 있다. 커뮤니티 라이센스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으며, "현재 AI 관련 규정을 개발 중이거나 시행하는" 지역을 이유로 든다. 공식 라이센싱 요청 채널이 열려 있으며, 한 HN 댓글 작성자는 "디즈니를 화나게 하지 않겠다고 약속만 하면 라이센스를 보내준다"고 요약했다. 재미있지만, 또한 해당 4개 지역 중 하나에 있다면 건너뛸 수 없는 규정 준수 단계이기도 하다. 오픈 웨이트 글에는 전체 지역 목록이 있다.
자주 묻는 질문
MiniMax H3는 Veo 3.1과 비교하여 좋은 애니메이션 영상 생성기인가요?
대부분의 애니메이션 작업에서 H3는 주로 렌더링과 관련 없는 이유로 더 좋습니다. Veo의 4, 6, 8초에 비해 4~15초를 실행하고, Veo의 두 가지에 비해 4:3 및 21:9를 포함한 여섯 가지 화면비를 제공하며, 11개의 기본적으로 안정적인 대화 언어 중 일본어를 포함하고, Veo의 세 개에 비해 아홉 개의 참조 이미지를 허용합니다. Veo 3.1은 특정 상황에서 이깁니다: 재현 가능한 재시도를 위한 seed가 필요하거나, 샷이 3D 렌더 쉐이딩으로 표류하는 것을 막기 위한 negative_prompt가 필요할 때입니다. H3에는 두 매개변수가 모두 없습니다. 파이프라인이 둘 중 하나에 의존한다면, 그것은 진정한 이유로 전환을 고려해야 할 사항입니다.
Veo 3.1이 4:3 또는 15초 클립으로 애니메이션을 생성할 수 있나요?
아니요, 스타일적 이유 때문이 아닙니다. Veo 3.1의 aspect_ratio 열거형에는 정확히 16:9와 9:16만 포함되며, duration 열거형에는 정확히 4, 6, 8만 포함됩니다. 선택할 수 있는 4:3 값이 없고 12초 또는 15초를 요청할 방법이 없습니다. 참조가 90년대 TV 애니메이션이나 OVA라면, 프레이밍은 Veo에서 접근할 수 없고 H3에서 가능합니다.
내 Veo 3.1 애니메이션 클립이 왜 무음으로 돌아왔나요?
API에서 generate_audio가 기본값 false이기 때문입니다. 플레이그라운드 토글은 일반적으로 이미 켜져 있으므로, 이는 API를 직접 호출하는 사람들만 문제가 됩니다. generate_audio: true를 명시적으로 설정하십시오. 그곳에 있을 때 resolution도 설정하십시오. 기본값이 720p이므로, 아마도 의도한 1080p 또는 4k가 아닙니다.
MiniMax H3가 애니메이션의 일본어 대화와 립싱크를 지원하나요?
네. 모델 카드는 안정적인 대화 지원이 있는 11개 언어를 나열합니다: 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어. 오디오는 영상과 함께 32kHz 스테레오로 생성되며 이후에 더빙되지 않으므로, 입 타이밍이 처음 몇 음절 대신 전체 대사에 걸쳐 유지됩니다. 일본어 대사를 프롬프트에 일본어로 직접 작성하십시오.
애니메이션 캐릭터 일관성을 유지하기 위해 얼마나 많은 참조 이미지를 사용할 수 있나요?
MiniMax H3는 최대 9개의 이미지, 최대 3개의 비디오 클립, 최대 3개의 오디오 클립을 허용하며, 모든 유형을 통틀어 최대 12개 파일의 하드 상한이 있습니다. Veo 3.1의 참조-비디오 엔드포인트는 1~3개의 이미지를 허용하며, 선택하면 duration이 유일한 합법적 값인 8로 축소됩니다. 시리즈 전반에 걸쳐 반복되는 애니메이션 캐릭터의 경우, 그 차이가 모든 것을 결정합니다.
MiniMax H3에는 오픈 웨이트가 있으므로, 내 애니메이션 파이프라인을 로컬에서 무료로 실행할 수 있나요?
다운로드하여 실행할 수 있지만, 세 가지 주의사항이 있습니다. 자체 호스팅 추론은 768 숏 엣지에서 실행되며, 2K 출력을 생성하는 Context-IR 및 Regenerate-2K 단계는 API 측에 남아 있습니다. 실제 로컬 속도는 카드에 따라 크게 다릅니다: 4070 Ti Super에서 10초 480p 클립에 약 10분, 5080에서 약 3분, RTX 6000 Pro에서 약 68초(출시 당일 ComfyUI 스레드 기준). 그리고 커뮤니티 라이센스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으므로, 해당 지역에 있다면 상업적 사용 전에 공식 라이센스가 필요합니다.






