올여름 내내 내 피드는 같은 영상이 반복 재생됐다. 월드컵 선수들이 소년만화 주인공으로 그려진 영상. 독재자. 해적 선장. 마지막 4초에 등장하는 거친 멘토. 게시물당 수백만 뷰, 그리고 거의 매 경기마다 스토리가 업데이트된다.
그런 영상을 만드는 사람들은 벤치마크 게시글을 쓰지 않는다. 모델을 고르고, 크레딧을 소진하며, 다음 킥오프 전에 영상을 내보낸다.
그래서 나는 애니메이션 키프레임 하나와 프롬프트 하나를 가지고 MiniMax H3를 애니메이션 비디오 생성기로 Veo 3.1과 비교 테스트했다. 두 모델 모두 동일한 입력에 대해 최대 설정으로 밀어붙였다.
처음으로 깨진 것은 이미지 품질이 아니었다. 드롭다운이었다. Veo 3.1은 8초에서 멈추고 정확히 두 가지 화면비만 제공한다. 얼굴을 잡는 샷, 공을 따라가는 휩 팬, 그리고 타이틀 카드가 나타나는 장면은 8초 안에 들어가지 않는다. 품질에서 실패할 기회조차 없었다.
핵심 요점
- Veo 3.1의
duration열거형은[4, 6, 8]이고aspect_ratio열거형은[16:9, 9:16]이다. MiniMax H3은 4초에서 15초까지 모든 정수 초를 지원하며21:9, 16:9, 4:3, 1:1, 3:4, 9:16을 제공한다. Veo에 4:3이 없으면 레트로 OVA 프레이밍이 전혀 불가능하다. - H3의 모델 카드는 기본적으로 안정적인 11개 언어 대화를 지원하며 일본어가 포함되어 있다. 오디오와 영상이 함께 생성되며, 32kHz 스테레오로 추후 더빙되지 않는다.
- 참조 팩은 차이가 크다: H3는 최대 9개의 이미지, 최대 3개의 비디오와 3개의 오디오 클립(최대 12개 파일)을 받는다. Veo 3.1의 참조 엔드포인트는 3개의 이미지만 받으며, 사용하는 순간
duration이[8]로만 축소된다. - 테스트를 조용히 망치는 두 가지 함정: Veo의 API는
generate_audio가 기본값false이고resolution이720p이며, H3의 텍스트-투-비디오ratio기본값은1:1이다. 이것들을 그대로 두면 무음 720p 클립과 정사각형 클립을 비교하는 꼴이 된다. - Veo 3.1에는 H3에 전혀 없는 두 가지 기능이 있다:
seed와negative_prompt. 2D 애니메이션에서는 후자가 정말 중요하며, 그 이유를 보여드리겠다.
MiniMax H3 애니메이션 비디오 생성기 vs Veo 3.1, 동일한 프레임을 연속으로 비교
하나의 오리지널 캐릭터. 하나의 키프레임. 하나의 프롬프트, 문자 그대로 두 모델에 동일하게 복사. 각 측에서 나머지 모든 설정은 최대로.
MiniMax H3, 이미지-투-비디오, 2K, 8초, 네이티브 오디오. 소리를 켜 보세요: 관중 함성, 공을 차는 소리, 일본어 외침이 영상과 동시에 생성됩니다. Atlas Cloud의 minimax/h3/image-to-video로 생성.
Veo 3.1, 이미지-투-비디오, 1080p, 8초, generate_audio 를 수동으로 켜고, negative_prompt 로 라인 아트를 평평하게 유지. 동일한 첫 프레임, 동일한 단어. Atlas Cloud의 google/veo3.1/image-to-video로 생성.
둘 다 아름답게 그린다. Veo의 넓은 샷에서 수작업 임팩트 라인과 공중에 떠 있는 만화 효과음이 있는 킥 장면은 정말 훌륭하다. 이것이 정직한 출발점이며, 이 글의 나머지 부분이 분위기보다는 파라미터와 명령 수행에 관한 이유이기도 하다.
대부분의 MiniMax H3 애니메이션 비디오 생성기 vs Veo 3.1 테스트가 잘못되는 이유
올여름 두 가지 일이 동시에 일어났다.
애니메이션이 AI 비디오에서 가장 높은 볼륨의 형식이 되었다. 2026년 월드컵이 소년만화 토너먼트로 재구성되어, 선수들이 독재자, 해적 선장, 해군 장군, 멘토로 캐스팅되었고, 스토리는 TikTok, Instagram, X, YouTube에서 "거의 모든 경기 후에 진화"했다 (Complex, 2026년 7월).
그리고 MiniMax H3가 오픈 웨이트로 출시되었다. D-0 ComfyUI 스레드는 330 포인트와 95개의 댓글을 기록했으며, 사람들은 몇 시간 안에 실제 로컬 수치를 게시했다 (Hacker News, 2026년 8월).
이 두 가지를 합치면 애니메이션 비교 자료가 많을 것이라고 예상할 수 있다. 거의 없는데, 대부분의 테스트가 다음 네 가지 방식 중 하나로 잘못 구성되었기 때문이다.
그림을 비교하는 것이지 제약 조건을 비교하는 것이 아니다. 애니메이션 샷은 타이밍이다. 타이틀 카드로 이어지는 휩 팬은 렌더링 문제이기 전에 지속 시간 문제이다.
Veo의 API가 기본적으로 무음이라는 것을 잊는다. API에서 generate_audio는 false이고 resolution은 720p이다. "Veo는 애니메이션에 오디오가 없다"는 게시글 중 상당수는 부울 값을 한 번도 켜지 않은 사람의 글이다.
H3의 텍스트-투-비디오가 기본적으로 정사각형이라는 것을 잊는다. ratio 기본값은 1:1이지 16:9가 아니다. 설정하지 않고 t2v 애니메이션 프롬프트를 실행하면 정사각형 클립과 혼란스러운 결론을 얻게 된다.
포토리얼 프롬프트로 테스트한다. "Cinematic, volumetric light, shallow depth of field"는 정확히 2D 모델을 3D 렌더 쉐이딩으로 끌어당기는 어휘이다. 애니메이션에서의 실패 모드는 블러가 아니라 플라스틱 느낌이다.
실행을 누르기 전에 애니메이션 테스트를 결정하는 세 가지 설정
무엇보다도, 양쪽에서 이 설정들을 먼저 조정하지 않으면 비교는 무효다.
| 설정 | MiniMax H3 | Veo 3.1 | 생략 시 결과 |
|---|---|---|---|
| 오디오 | 영상과 함께 생성, 항상 켜짐 | generate_audio 기본값 false | Veo가 무음 클립을 반환하며 실제보다 나빠 보임 |
| 프레임 모양 | 텍스트-투-비디오에서 ratio 기본값 1:1 | aspect_ratio 기본값 16:9 | H3가 사용할 수 없는 정사각형 애니메이션 컷을 제공 |
| 해상도 | 기본값 2K | 기본값 720p | 2K와 720p를 비교하며 품질 차이라고 부름 |
MiniMax H3와 Veo 3.1을 동일한 애니메이션 프롬프트로 직접 테스트하고 싶으신가요? Atlas Cloud의 모델 비교에서 한 번에 나란히 실행합니다 — 동일한 프롬프트와 설정, 생성 전에 비용이 표시됩니다.

Atlas Cloud 모델 비교에서 동일한 애니메이션 프롬프트의 MiniMax H3와 Veo 3.1 — 동일 설정, 생성 전에 가격 표시. model-explorer에서 실시간 캡처.
MiniMax H3 vs Veo 3.1 애니메이션 사양표: 길이, 비율, 오디오, 참조
출시 게시글을 신뢰하지 않고 두 모델의 실제 입력 스키마를 가져왔다. 아래 모든 값은 모델 페이지에서 직접 읽을 수 있는 열거형이며, 인상이 아니다.
표 1: MiniMax H3 vs Veo 3.1, 애니메이션 샷을 결정하는 파라미터
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 지속 시간 | 4~15초, 모든 정수 초 (기본값 8) | 4, 6, 8 (기본값 8) |
| 화면비 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 비율 기본값 (텍스트-투-비디오) | 1:01 | 16:09 |
| 해상도 | 768P, 2K (기본값 2K) | 720p, 1080p, 4k (기본값 720p) |
| 오디오 | 공동 생성, 32kHz 스테레오 | generate_audio, 기본값 false |
| 네이티브 대화 언어 | 11개 안정, 일본어 포함 | 안정적인 목록으로 공개되지 않음 |
| 참조 팩 | 최대 9개 이미지, 3개 비디오, 3개 오디오 클립, 총 12개 파일 | 3개 이미지 |
| 참조 사용 시 지속 시간 | 여전히 4~15초 | 8초만으로 축소 |
| seed | 사용 불가 | 사용 가능 |
| negative_prompt | 사용 불가 | 사용 가능 |
| 가중치 | 다운로드 가능 | 비공개 |
지속 시간, 비율, 해상도, 오디오 및 참조 제한은 MiniMax H3 이미지-투-비디오, H3 텍스트-투-비디오, H3 참조-투-비디오, Veo 3.1 이미지-투-비디오 및 Veo 3.1 참조-투-비디오 페이지의 라이브 스키마에서 읽었습니다. 9개 이미지 및 12개 파일 참조 상한과 11개 언어 대화 목록은 MiniMax H3 모델 카드 (Hugging Face, 2026년 8월)에서 가져왔습니다.
이제 점수판입니다. 사양표와 다른 점을 말해주며 둘 다 중요합니다.
표 2: 군중 투표 Elo 및 분당 가격, 2026년 8월 7일 스냅샷
| 모델 | 텍스트-투-비디오 (오디오 포함) | 이미지-투-비디오 (오디오 포함) | $/분 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 상위 10위에 없음 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 상위 10위에 없음 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 상위 10위에 없음 | $4.80 |
Elo 및 가격 수치는 Artificial Analysis Video Arena (Artificial Analysis, 2026년 8월)에서 가져왔습니다. 이는 롤링 군중 투표이며 변동됩니다. $/분 열은 정규화된 모델 추정치이며 실제 청구서가 아닙니다.
145포인트 Elo 차이는 크지만, 이는 일반 목적 투표이지 애니메이션 투표가 아닙니다. 그리고 여기서 솔직히 말해야 할 부분이 있습니다: MiniMax는 H3를 애니메이션 모델로 마케팅하지 않습니다. 내부 1차 피드백에는 영화, 애니메이션 및 코미디 드라마가 H3가 목표로 하지 않는 영역으로 나열됩니다. 따라서 흥미로운 질문은 "어느 것이 애니메이션 모델인가"가 아닙니다. 자체적으로 애니메이션을 판매하지 않는 모델이 여전히 샷에서 승리하는 이유와 Google이 여전히 라운드를 가져가는 이유입니다.
튜토리얼 전에 실용적인 참고 사항 하나. 아래의 모든 모델은 동일한 콘솔과 동일한 API 키를 통해 실행되며, 이것이 파라미터를 비교할 수 있는 유일한 이유입니다. 동일한 대기열, 동일한 인증, 하나의 청구서. GPT Image 2를 한 서비스에 설정하고 Veo를 다른 서비스에 설정하면, 발견하는 차이의 절반은 모델 자체보다는 인프라 차이일 것입니다.
샷 구성하기: MiniMax H3 vs Veo 3.1, 단계별
하나의 실행 예제, 처음부터 끝까지. "라스트 휘슬": 오리지널 십대 스트라이커, 빨간 머리, 흰색과 네이비 9번 유니폼, 조명탄, 슛에 따른 휩 팬, 그리고 마지막 2초 동안 안정적으로 유지되어야 하는 일본어 타이틀 카드.
실제 선수 없음, 공식 캐릭터 없음, 기존 애니메이션 IP 없음. 스타일과 오마주만. 이유는 잠시 후에 설명합니다.
1단계: GPT Image 2로 애니메이션 키프레임 디자인
키프레임은 아트 방향을 전달하여 비디오 모델이 직접 발명할 필요가 없도록 합니다. 왼쪽 1/3의 네거티브 공간에 주목하세요: 의도적입니다. 타이틀 카드가 비디오 모델에 의해 그곳에 쓰여지며, 이것이 텍스트 안정성 테스트입니다.
Plain1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked 2line art with consistent line weight, flat colour fills, hard-edged graphic shadows, 3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker: 4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across 5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him, 6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst 7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette, 8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of 9centre, clean negative space on the left third. No text anywhere in the image.
설정: 모델 openai/gpt-image-2/text-to-image, 품질 high, 크기 16:9 (2048x1152). 다른 것은 없음.

Atlas Cloud의 GPT Image 2 플레이그라운드, Last Whistle 키프레임 프롬프트와 출력 패널의 완성된 애니메이션 프레임
Atlas Cloud의 GPT Image 2: 품질을 높음으로 설정, 오른쪽에 완성된 키프레임.

기본 애니메이션 키프레임: 스타디움 조명 아래에서 외치는 오리지널 빨간 머리 스트라이커, 플랫 컬러와 스피드 라인이 있는 셀 쉐이딩
두 모델이 받는 키프레임. 플랫 컬러, 하드 섀도우, 타이틀 카드를 기다리는 빈 왼쪽 1/3.
2단계: MiniMax H3 이미지-투-비디오, 모든 설정 최대
동일한 사진 입력, 2K 출력. 여기서는 H3를 8초로 제한했는데, 이는 Veo의 상한과 일치시키기 위해서입니다. 이것이 H3의 한계는 아니며, 4단계에서 제한을 해제합니다.
Plain1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the 2striker's face for one beat, then a violent whip pan follows the ball as he strikes it, 3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence 4at impact. Over the final two seconds, bold white Japanese title lettering reading 5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping, 6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」 7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the 8title card.
설정: 모델 minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (이미지-투-비디오는 입력 이미지에서 프레임 모양을 가져옴), image = 1단계 출력.
텍스트-투-비디오로 전환하는 경우 한 가지 경고: ratio: 16:9를 명시적으로 작성하세요. 기본값은 1:1이며, 기꺼이 정사각형 애니메이션 컷을 제공합니다.

Atlas Cloud의 MiniMax H3 이미지-투-비디오 플레이그라운드, Last Whistle 프롬프트, 로드된 키프레임 및 출력 패널의 완성된 클립
Atlas Cloud의 MiniMax H3 이미지-투-비디오: 왼쪽에 로드된 1단계 키프레임, 오른쪽에 재생 중인 완성된 클립.
3단계: Veo 3.1 이미지-투-비디오, 오디오 수동으로 켜기
프롬프트는 동일합니다, 단어 그대로. 형용사 하나를 바꾸면 더 이상 비교가 아닙니다. 변경되는 것은 Veo가 제공하고 H3가 제공하지 않는 추가 필드입니다.
negative_prompt, 2D 애니메이션의 경우 이 목록에서 가장 유용한 제어입니다:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
설정: 모델 google/veo3.1/image-to-video, resolution: 1080p (변경 필수, 기본값은 720p), duration: 8 (이것이 상한), aspect_ratio: 16:9, generate_audio: true (API 기본값은 false, 이것이 무음 클립 함정), seed: 20260807, image = 동일한 1단계 출력.

Atlas Cloud의 Veo 3.1 이미지-투-비디오 플레이그라운드, generate audio 활성화, 로드된 애니메이션 키프레임 및 출력 패널의 완성된 클립
Atlas Cloud의 Veo 3.1 이미지-투-비디오, Generate Audio 켜짐, 오른쪽에 완성된 클립.
4단계: 5가지 애니메이션 특화 축으로 평가
생성할 것은 없습니다. 애니메이션이 실제로 망가지는 부분을 보기만 하면 됩니다. 두 클립 모두 이 글 상단에 임베드되어 있으므로 제 말을 믿지 않고 직접 점수를 매길 수 있습니다.

두 클립의 마지막 프레임 나란히: 왼쪽 MiniMax H3는 깨끗한 일본어 타이틀 문자, 오른쪽 Veo 3.1은 왜곡된 세로 문자
각 클립의 마지막 프레임. 왼쪽, H3는 ラストホイッスル을 렌더링했으며, 8개의 가타카나가 모두 정확하고 안정적입니다. 오른쪽, Veo 3.1은 요청된 단어가 아닌 세 개의 문자를 생성했으며, 단어를 형성하지도 않습니다.
타이틀 카드가 라운드를 결정지었으며, 가까운 경기가 아니었습니다. H3는 요청된 가타카나를 정확히, 딱딱한 가장자리와 안정적으로, 골문의 스트리크 팬 위에 렌더링했습니다. Veo 3.1은 요청된 단어도 아니고 단어도 아닌 세 개의 문자를 세로로 쌓아 올렸습니다. 같은 프레임에서 캐릭터를 화면 밖으로 떨어뜨리고 배경을 photorealistic skin과 3D render가 네거티브 프롬프트에 있음에도 불구하고 반 사실적인 스타디움 플레이트 쪽으로 미끄러지게 했습니다.
표 3: 애니메이션 컷을 결정하는 5가지 축, 이 두 실행에서
| 축 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 키프레임에서의 캐릭터 연속성 | 8초 내내 정확한 얼굴, 머리카락, 유니폼 유지 | 새로운 와이드 샷으로 캐릭터 재구성, 모델링은 맞지만 다른 그림 |
| 선 두께와 플랫 셀 쉐이딩 | 유지, 3D로의 이탈 없음 | 미드 샷에서는 유지, 끝으로 갈수록 사진 같은 스타디움 플레이트로 이탈 |
| 일본어 타이틀 카드 | ラストホイッスル 정확히 렌더링되어 안정적으로 유지 | 세 개의 문자, 요청된 단어 아님, 단어도 아님 |
| 전달된 오디오 트랙 | 32kHz 스테레오, 모델 카드에 명시된 대로 | 48kHz 스테레오, 내가 직접 generate_audio를 설정했기에만 존재 |
| 휩 팬과 사쿠가 스미어 | 스미어 팬으로 타이틀까지 실행 | 하드 컷으로 새로운 설정으로 대체 |
마지막 행은 지금까지 H3에 대한 가장 큰 공개 비판이며, 이것이 바로 두 프롬프트에 모두 포함시킨 이유입니다. D-0 ComfyUI 스레드에서 사용자 fwip는 공식 데모 프롬프트조차 무시되었다고 불평했습니다: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."
이번 실행에서는 Veo가 팬을 컷으로 대체했고 H3가 스미어를 실행했습니다. 각각 한 번의 실행이 최종 판결은 아니며, 그렇게 주장하지 않습니다. 그러나 이는 비판이 H3 특화적이지 않다는 것을 의미합니다: 휩 팬은 이 테스트 전체에서 양쪽 모두 가장 신뢰할 수 없는 명령입니다. 스토리보드가 휩 팬에 의존한다면, 그것을 통해 작업하기보다는 우회하여 스토리보드를 구성하세요.
5단계: Veo 3.1이 구조적으로 출력할 수 없는 4:3 레트로 OVA 컷
이것은 품질 선호도가 아닙니다. 벽입니다. Veo의 aspect_ratio 열거형에는 두 개의 값만 있으며 4:3은 없고, duration 열거형에는 12가 없습니다. 90년대 OVA 룩은 단순히 접근할 수 없습니다.
Plain1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush 2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the 3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a 4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a 5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese: 6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio: 7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.
설정: 모델 minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. 비율을 수동으로 설정하세요, 기본값을 기억하세요.

Atlas Cloud의 MiniMax H3 텍스트-투-비디오 플레이그라운드, OVA 프롬프트 입력 및 출력 패널의 완성된 레트로 클립
Atlas Cloud의 MiniMax H3 텍스트-투-비디오, OVA 프롬프트 입력, 클립 완료. 솔직히 말하면, 이 특정 실행은 Aspect Ratio를 16:9, Duration을 8로 남겨두었습니다. 따라서 오른쪽에 보이는 것은 와이드스크린 짧은 버전입니다. 아래의 4:3 12초 컷은 ratio: 4:3 및 duration: 12 를 명시적으로 설정한 API 호출에서 나왔습니다.

4:3 레트로 OVA 컷: 90년대 애니메이션 스타일로 빗물에 젖은 경기장에서 걸어 나가는 같은 스트라이커
H3 텍스트-투-비디오, 4:3, 12초. 전달된 파일은 1920x1440으로 픽셀 단위로 4:3이며, 32kHz 스테레오 트랙이 있습니다. 페이지를 가볍게 유지하기 위해 축소된 프레임 속도의 무음 GIF로 표시. Atlas Cloud의 minimax/h3/text-to-video로 생성.
6단계: 9개의 참조 이미지, 하나의 캐릭터, 4개의 컷
교차 샷 캐릭터 일관성은 AI 애니메이션에서 가장 어려운 문제이며, 참조 볼륨으로 해결됩니다. 먼저 팩을 구성하세요: 1단계 프롬프트를 정면, 3/4, 정면 프로필, 뒷면, 웃음, 악물, 전신 자세, 유니폼 디테일, 부츠 디테일로 프레이밍을 바꿔 다시 실행하세요. 아홉 개의 이미지, 총 약 8센트.

참조 팩으로 생성된 동일한 오리지널 스트라이커 캐릭터의 네 가지 각도, 2x2 그리드로 배열
9개의 참조 각도 중 네 개. H3는 하나의 참조 팩에 최대 9개의 이미지를 허용하며, 추가로 비디오 및 오디오 참조도 허용합니다.
Plain1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep 2the referenced striker's face, hair silhouette and number 9 kit identical across every cut. 3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf, 4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three 5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines 6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the 7freeze.
설정: 모델 minimax/h3/reference-to-video, refers = type: image인 이미지, resolution: 2K, duration: 8 이상, ratio: adaptive 또는 16:9.
Veo 3.1의 동등한 설정은 이러한 설정으로 실행할 수 없으며, 이유를 알기 위해 시도할 필요도 없습니다. 참조 엔드포인트는 최대 3개의 이미지만 허용하며, 해당 엔드포인트를 선택하면 duration이 단일 법적 값인 8로 축소됩니다. 9개 이미지 팩과 10초 테이크는 모두 범위를 벗어납니다.

Atlas Cloud의 MiniMax H3 참조-투-비디오 플레이그라운드, 참조 카운터가 4/9로 표시되고 출력 패널에 첫 번째 컷이 표시됨
Atlas Cloud의 MiniMax H3 참조-투-비디오. 카운터는 Reference Materials (4/9) 로 표시되며 아래에 MAX:9 가 있는데, 이는 사양표의 주장이 아니라 인터페이스의 상한입니다. 출력은 첫 번째 컷, 부츠의 로우 앵글 푸시인입니다.
추가로 실행할 가치가 있는 네 가지 MiniMax H3 애니메이션 비디오 생성기 실행
Last Whistle 샷은 네 가지 차이점만 강조합니다. 다음 네 가지는 나머지를 강조합니다. 모두 H3에서 실행됩니다; Veo 3.1이 일치할 수 있는 것은 주석에 표시되어 있습니다.
- 울트라와이드 사쿠가 전투,
21:9, 10초. Veo는 21:9를 전혀 출력할 수 없습니다.
Plain1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows, 2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade 3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact 4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a 5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth 6snap, a low taiko hit on the final freeze, no music.
- 비트 싱크 AMV 컷, 오디오 참조를 사용한 참조-투-비디오. H3는 최대 3개의 오디오 클립을 참조 입력으로 받습니다. Veo 3.1에는 오디오 입력이 전혀 없으며, 오디오 출력만 있습니다.
Plain1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on 2a window, a hand tightening a bandage, a city skyline flashing past a train window, a 3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of 4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep 5indigo and neon magenta.
- 두 줄의 일본어 대화 장면, 12초. 이것이 립싱크 스트레스 테스트이며, 12초는 이미 Veo의 범위를 벗어납니다.
Plain1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at 2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second 3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim 4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant 5traffic, one cicada.
- 세로형 소년만화 단편,
9:16, 8초. 두 모델 모두 세로형을 할 수 있으므로, 여기가 추측하지 말고 실제로 A/B 테스트할 유일한 곳입니다.
Plain1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a 2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates 3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky. 4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd 5surge, one breath held then released.
이러한 프롬프트 뒤에 있는 문법이 궁금하다면, MiniMax H3 프롬프트 가이드에서 H3가 카메라 및 오디오 명령을 구문 분석하는 방법을 여기서 다룰 수 있는 것보다 더 자세히 설명합니다.
MiniMax H3 vs Veo 3.1에서 60초 애니메이션 오프닝 비용
표준 애니메이션 OP는 대략 90초입니다. 8초 샷 8개, 완성된 비디오 64초, 각 샷당 키프레임 하나씩, 각각 $0.009.
여기에는 실제 가격 차이가 있으며, 여러분이 알아야 할 것을 제가 감추지 않고 말씀드리겠습니다. Atlas Cloud 카탈로그는 MiniMax H3를 초당 $0.10 고정으로 나열하는 반면, 모델 readme는 2K에서 $0.14/s, 768P에서 $0.10/s로 세분화합니다. Veo 3.1은 초당 $0.20로 나열되며, readme는 오디오 포함 시 $0.40/s, 오디오 미포함 시 $0.20/s로 구분합니다.
제 스크린샷의 실행 버튼이 이를 확정합니다. H3 참조-투-비디오, 8초 2K, Run $1.12로 표시되며, 이는 정확히 초당 $0.14입니다. Veo 3.1 이미지-투-비디오, 8초 1080p 오디오 켜짐, Run $3.2로 표시되며, 이는 정확히 초당 $0.40입니다. 따라서 readme 요금이 청구되는 요금이며, 카탈로그 헤드라인은 입문 계층입니다. 어쨌든 두 가지 수치를 모두 아래에 표시했습니다. 이는 2026년 8월 기준 정가입니다.
표 4: 8초 샷 8개, 키프레임 포함
| 설정 | 비디오 비용 (카탈로그 요금) | 비디오 비용 (readme 요금) | 키프레임 | 총 범위 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 ~ $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 오디오 포함 | $12.80 | $25.60 | $0.07 | $12.87 ~ $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
표 1에 링크된 Atlas Cloud 모델 페이지에서 가져온 가격, 2026년 8월. 이 네 가지 중 현재 할인된 것은 없습니다.
표에 포함되지 않은 두 가지 사항이 있으며, 둘 다 초당 요금보다 더 큰 영향을 미칩니다.
재시도. 애니메이션 샷의 첫 테이크를 출시하는 사람은 아무도 없습니다. 어떤 승수를 가정하든, 두 열에 동일하게 적용하면 차이가 같은 비율로 벌어집니다.
실제 소요 시간, 이것은 반대 방향으로 작용합니다. 2026년 8월 7일 종단간 측정: H3 2K 8초는 447초, 약 7.5분. H3 텍스트-투-비디오 2K 12초는 334초. Veo 3.1 1080p 8초 오디오 포함은 152초, 3분 미만. Veo는 여기서 첫 테이크까지 약 3배 빠르며, 오전 2시에 샷을 반복하는 경우 이는 실제 돈 가치가 있습니다. 대기열은 움직이므로, 이것을 하나의 오후 스냅샷으로 취급하고 사양으로 간주하지 마십시오. 그러나 H3 2K에 대해 "2~3분"을 인용하는 사람은 readme를 인용하는 것이지 대기열을 인용하는 것이 아닙니다. 2K 대 768P 분석에서는 더 높은 계층이 추가 시간을 투자할 가치가 있는 경우를 다룹니다.
애니메이션 스타일, 오마주, 그리고 실제로 게시할 수 있는 것
이 글의 모든 것은 스타일과 오마주입니다. 오리지널 캐릭터, 오리지널 유니폼, 오리지널 타이틀. 공식 애니메이션 캐릭터가 생성되거나 요청되지 않았으며, 실제 축구 선수의 이름이나 초상이 사용되지 않았습니다. 월드컵 트렌드는 형식 으로 참조되었으며, 그것이 유용한 이유이기 때문입니다.
그 구분은 장식이 아닙니다. 상업적으로 애니메이션 스타일 콘텐츠를 제작하는 경우, "90년대 OVA 스타일"과 "이 특정 쇼의 이 특정 캐릭터"는 다른 법적 대상이며, 둘 중 하나만 비즈니스가 가능합니다.
오픈 웨이트에 관하여: H3는 실제로 다운로드 가능하며, 사람들은 첫날 실행했습니다. 한 댓글 작성자는 4070 Ti Super 16GB에서 10초 480p 클립에 10분이 걸렸다고 보고했고, 다른 사람들은 5080에서 3분, RTX 6000 Pro에서 68초를 게시했습니다. 그러나 자체 호스팅은 768 짧은 에지에서 실행되며, 2K를 생성하는 Context-IR 및 Regenerate-2K 단계는 API 측에 남아 있습니다.
라이선스에는 실제 함정이 있습니다. 커뮤니티 라이선스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으며, "AI 관련 규정을 개발하거나 시행 중인 지역"을 이유로 듭니다. 공식 라이선스 요청 채널이 열려 있으며, 한 HN 댓글 작성자는 "디즈니를 화나게 하지 않겠다고 약속만 하면 라이선스를 보내준다"고 요약했습니다. 재미있으면서도, 이 네 지역 중 하나에 있다면 건너뛸 수 없는 규정 준수 단계입니다. 오픈 웨이트 글에는 전체 지역 목록이 있습니다.
자주 묻는 질문
MiniMax H3는 Veo 3.1과 비교하여 좋은 애니메이션 비디오 생성기인가요?
대부분의 애니메이션 작업에서 H3가 더 나으며, 주로 렌더링이 아닌 이유 때문입니다. 4~15초를 지원하는 반면 Veo는 4, 6, 8초, 6개의 화면비(4:3 및 21:9 포함)를 제공하는 반면 Veo는 2개, 일본어를 11개 네이티브 안정 대화 언어 중 하나로 나열하며, 9개의 참조 이미지를 받는 반면 Veo는 3개입니다. Veo 3.1은 한 가지 특정 상황에서 승리합니다: 재현 가능한 재테이크를 위해 seed가 필요하거나, 샷이 3D 렌더 쉐이딩으로 빠지는 것을 막기 위해 negative_prompt가 필요할 때입니다. H3에는 두 파라미터가 모두 없습니다. 파이프라인이 둘 중 하나에 의존한다면, 그것은 Veo를 고수해야 할 진정한 이유입니다.
Veo 3.1이 4:3 또는 15초 클립으로 애니메이션을 생성할 수 있나요?
아니요, 스타일적인 이유가 아닙니다. Veo 3.1의 aspect_ratio 열거형에는 정확히 16:9와 9:16만 있으며, duration 열거형에는 정확히 4, 6, 8만 있습니다. 선택할 수 있는 4:3 값이 없으며 12초 또는 15초를 요청할 방법이 없습니다. 참조가 90년대 TV 애니메이션 또는 OVA라면, 프레이밍이 Veo에서는 도달할 수 없고 H3에서는 가능합니다.
내 Veo 3.1 애니메이션 클립이 왜 무음으로 돌아왔나요?
generate_audio가 API에서 기본값 false이기 때문입니다. 플레이그라운드 토글은 일반적으로 이미 켜져 있으므로, 이는 API를 직접 호출하는 사람들에게만 문제가 됩니다. generate_audio: true를 명시적으로 설정하세요. 그곳에서 resolution도 설정하세요. 기본값이 720p이므로 여러분이 의도했을 1080p 또는 4k가 아닙니다.
MiniMax H3가 애니메이션에서 일본어 대화와 립싱크를 지원하나요?
네. 모델 카드는 안정적인 대화 지원을 제공하는 11개 언어를 나열합니다: 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어. 오디오는 영상과 함께 32kHz 스테레오로 생성되며, 이후에 더빙되지 않으므로 입 타이밍이 첫 몇 음절 대신 전체 대사에 걸쳐 유지됩니다. 일본어 대사를 프롬프트에 일본어로 직접 작성하세요.
애니메이션 캐릭터 일관성을 유지하기 위해 얼마나 많은 참조 이미지를 사용할 수 있나요?
MiniMax H3는 최대 9개의 이미지, 최대 3개의 비디오 클립, 최대 3개의 오디오 클립을 허용하며, 모든 유형을 합쳐 최대 12개 파일의 하드 상한이 있습니다. Veo 3.1의 참조-투-비디오 엔드포인트는 1~3개의 이미지만 허용하며, 선택하면 duration이 유일한 법적 값인 8로 축소됩니다. 시리즈 전반에 걸쳐 반복되는 애니메이션 캐릭터의 경우, 이 차이가 전체 게임의 승패를 좌우합니다.
MiniMax H3는 오픈 웨이트를 제공하므로, 내 애니메이션 파이프라인을 로컬에서 무료로 실행할 수 있나요?
다운로드하여 실행할 수 있지만, 세 가지 주의사항이 있습니다. 자체 호스팅 추론은 768 짧은 에지에서 실행되며, 2K 출력을 생성하는 Context-IR 및 Regenerate-2K 단계는 API 측에 남아 있습니다. 실제 로컬 속도는 카드에 따라 크게 다릅니다: 4070 Ti Super에서 10초 480p 클립에 약 10분, 5080에서 약 3분, RTX 6000 Pro에서 약 68초 (D-0 ComfyUI 스레드 기준). 그리고 커뮤니티 라이선스는 현재 EU, 영국, 한국, 미국을 포함하지 않으므로, 해당 지역에 있다면 상업적 사용 전에 공식 라이선스가 필요합니다.






