저는 10분 동안 세 개의 Artificial Analysis 리더보드를 응시하며 실제로 누가 이겼는지 알아내려고 했습니다.
텍스트-투-비디오: Gemini Omni Flash가 5점 차. 이미지-투-비디오: Gemini가 2점 차. 비디오 편집: MiniMax H3가 9점 차.
그런 다음 신뢰 구간 열을 봤습니다. 플러스 마이너스 7. 플러스 마이너스 9. 플러스 마이너스 10.
세 개의 보드, 세 개의 격차, 모두 각각의 오차 막대 안에 있었습니다. 블라인드 투표에서 이 두 모델은 사실상 같은 모델입니다.
그래서 리더보드를 닫고 대신 드롭다운을 열었습니다. 그 격차는 5점이 아닙니다. 그 격차는 완전히 다른 해상도 등급입니다.
주요 시사점
- 세 개의 Artificial Analysis 격차(+5, +2, +9, 2026년 8월 6일 스냅샷) 모두 ±7~±10 신뢰 구간 안에 있습니다. 원시 품질로 보면 무승부이지 승리가 아닙니다.
- H3는 2K, 최대 15초, 6가지 화면비를 제공합니다. Gemini Omni Flash의 API는 720p, 10초, 2가지 화면비로 제한됩니다. 이는 의견이 아닌 열거형 값입니다.
- H3는 오디오를 입력으로 받습니다. Gemini는 그렇지 않습니다. Gemini는
seed와thinking_level을 제공합니다. H3는 둘 다 없습니다. - Gemini에는 소스 클립을 변형하는 전용
video-edit엔드포인트가 있습니다. H3의 리비전 경로는reference-to-video로, 클립을 참조로 사용하여 재생성합니다. 이는 동일한 작업이 아니며, 라운드 2에서 이를 보여줍니다. - 다운로드 가능한 가중치를 보유한 모델은 단 하나이며, 구글 모델이 아닙니다.

MiniMax H3 대 Gemini Omni Flash 테스트 1라운드, 두 모델이 동일한 첫 프레임을 애니메이션으로 구현한 결과를 나란히 표시
1라운드: 동일한 첫 프레임, 동일한 프롬프트, 동일한 길이. 왼쪽 MiniMax H3 (2K), 오른쪽 Gemini Omni Flash (720p). 무음 GIF로 표시되었으며, 두 파일 모두 기본 오디오를 포함하며 아래에서 재생 가능한 비디오로 삽입되어 있습니다. 이것이 문제입니다. 둘 다 훌륭합니다.
MiniMax H3 대 Gemini Omni Flash 리더보드 격차가 잘못 해석되는 이유
당신이 찾을 수 있는 거의 모든 MiniMax H3 대 Gemini Omni Flash 게시물은 하나의 리더보드와 하나의 가격을 인용합니다. 두 습관 모두 잘못된 답을 낳습니다.
다음은 세 개의 모든 Artificial Analysis 보드와, 모두가 생략하는 열입니다.
표 A: 세 가지 Artificial Analysis 리더보드에서의 MiniMax H3 대 Gemini Omni Flash (오디오 포함), 2026년 8월 6일 스냅샷
| 리더보드 | Gemini Omni Flash | MiniMax H3 | 격차 | 오차 막대 내에 있는가? |
|---|---|---|---|---|
| 텍스트-투-비디오 | 1,243 (#1) ±7, 11,842표 | 1,238 (#2) ±9, 6,830표 | Gemini +5 | 예 |
| 이미지-투-비디오 | 1,191 (#2) ±9, 6,506표 | 1,189 (#3) ±10, 5,545표 | Gemini +2 | 예 |
| 비디오 편집 | 1,123 (#2) ±5, 11,706표 | 1,132 (#1) ±6, 9,128표 | H3 +9 | 예, 간신히 |
MiniMax H3는 Atlas Cloud 모델 비교에서 동일한 프롬프트로 나란히 실행할 수 있는 30개 이상의 비디오 모델 중 하나입니다. 생성하기 전에 초당 비용이 표시됩니다.
Elo 수치는 Artificial Analysis 비디오 아레나 (Artificial Analysis, 2026년 8월)에서 가져왔습니다. 이미지-투-비디오는 Dreamina Seedance 2.0 720p (1,197점)가 선두이므로, 이 두 모델 중 어느 것도 그 왕관을 차지하지 않습니다. 이는 변동하는 군중 투표 점수이며 움직입니다. 이것이 바로 5점 차이가 평결이 아닌 이유입니다.
±9 간격의 5점 리드는 순위가 다음 주에 투표 노이즈만으로도 뒤집힐 수 있음을 의미합니다. 이것은 "Gemini가 텍스트-투-비디오에서 더 낫다"가 아닙니다. 이것은 점수판이 달린 동전 던지기입니다.
사람들이 틀리는 세 가지 더:
달러-퍼-미닛 열은 실제 지불 금액이 아닙니다. Artificial Analysis는 Gemini에 대해 $6.00/분, H3에 대해 $7.80/분을 나열합니다. 해당 열은 기본 설정에서 1080p 1분 비용으로 정규화한 것입니다. Gemini Omni Flash는 1080p를 전혀 생성할 수 없습니다. 따라서 이 숫자는 인보이스가 아닌 모델링 추정치입니다. 비교할 것은 초가 아닌 최종 결과물입니다.
하나의 보드가 모델을 대표하지 않습니다. H3는 세 보드에서 각각 2위, 3위, 1위를 차지합니다. Gemini는 1위, 2위, 2위를 차지합니다. 둘 중 하나만 인용하면 당신이 이미 믿고 있던 것을 증명할 수 있습니다.
"Omni"가 "무엇이든 먹는다"는 의미는 아닙니다. 좋은 이름이면서 오해를 불러일으키는 이름입니다. 이 두 모델 중 하나는 오디오 파일을 입력으로 받습니다. 이름에 "omni"가 있는 모델이 아닙니다.
아무도 인쇄하지 않는 MiniMax H3 대 Gemini Omni Flash 사양표
Elo 점수가 이들을 구분할 수 없다면, 제약 조건 표가 그 역할을 합니다. 런칭 게시물을 신뢰하는 대신 두 모델의 라이브 입력 스키마를 직접 가져왔으며, 그 차이는 미묘하지 않습니다.
표 B: MiniMax H3 대 Gemini Omni Flash 하드 제약 조건, 2026년 8월 6일 라이브 API 스키마에서 읽음
| 제약 조건 | MiniMax H3 | Gemini Omni Flash |
|---|---|---|
| 해상도 | 768P 또는 2K | 720p, 그리고 그것이 열거형의 유일한 값입니다. |
| 길이 | 4 ~ 15초 | 3 ~ 10초 |
| 화면비 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9 및 9:16만 |
| 리비전 경로 | reference-to-video (참조로 재생성) | 전용 video-edit 엔드포인트 (소스 변형) |
| 마지막 프레임 제어 | end_image 지원 | 사용 불가 |
| 참조 제한 | 이미지 ≤9개, 비디오 ≤3개, 오디오 ≤3개, 총 12개 파일 | 이미지 1~10개 |
| 오디오 입력 | 예 | 아니요 |
| 시드 재현성 | 아니요 | 예 |
| thinking_level | 아니요 | 예 (기본 / 높음 / 낮음) |
| 오픈 가중치 | 예, Hugging Face에서 | 아니요 |
그 표를 정직하게 읽으면 Gemini가 세 행에서 확실히 승리합니다. 동일한 프레임을 두 번 렌더링해야 하는 파이프라인을 구축하는 경우 재현 가능한 시드가 중요합니다. 실제 video-edit 엔드포인트는 참조 조건부 재생성과는 본질적으로 다른 도구입니다. 그리고 thinking_level은 H3가 노출하지 않는 품질 다이얼을 제공합니다.
H3는 다섯 행에서 승리하며, 이는 클라이언트가 요청한 파일을 전달할 수 있는지 여부를 결정하는 행입니다.
아래의 모든 것은 Atlas Cloud에서 실행했습니다. 두 모델 모두 동일한 /api/v1/model/generateVideo 엔드포인트 뒤에 있기 때문에, 전체 테스트에 대해 하나의 폴링 루프와 하나의 인증 헤더만 있으면 됩니다. 모델 변경은 model 문자열만 바꾸면 되었습니다. 이 세부 사항이 "둘 다 사용"이 회피책이 아닌 현실적인 답이 되는 이유입니다.
표 C: 이 테스트에서 각 엔드포인트의 비용, 2026년 8월 6일 라이브 가격표에서 확인
| 엔드포인트 | 가격 | 이 테스트의 10초 클립 |
|---|---|---|
| openai/gpt-image-2/text-to-image | $0.009 / 이미지 | $0.01 |
| minimax/h3/image-to-video | $0.14 / 초 | $1.40 |
| minimax/h3/reference-to-video | $0.14 / 초 | $1.40 |
| google/gemini-omni-flash/image-to-video | $0.13 / 초 | $1.30 |
| google/gemini-omni-flash/video-edit | $0.14 / 초 | $1.40 |
| google/gemini-omni-flash/text-to-video | $0.125 / 초 | 사용 안 함 |
| minimax/h3/text-to-video | $0.14 / 초 | 사용 안 함 |
이번 달 두 모델 모두 할인 혜택이 없습니다. Gemini는 또한 더 저렴한 개발자 티어(텍스트-투-비디오 및 이미지-투-비디오 $0.112/초, 참조-투-비디오 $0.12/초)를 제공합니다. H3는 이에 상응하는 티어가 없습니다.
Gemini Omni Flash가 넘을 수 없는 오픈 가중치 선. H3의 가중치는 Hugging Face (MiniMax, 2026년 8월)에 게시되어 있습니다: 33B 덴스 단일 스트림 Omni Transformer, Qwen3-VL-32B 텍스트 인코더, 비주얼 VAE 및 오디오 VAE. 다운로드 크기보다 더 중요한 두 가지 주의사항이 있습니다. 첫째, 자체 호스팅하는 것은 768픽셀 짧은 변에서 실행됩니다. Context-IR 전처리 단계와 Regenerate-2K 모듈은 릴리스에 포함되지 않았으며, 2K 출력은 이 두 가지에서 비롯됩니다. 둘째, 커뮤니티 라이선스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으며, 해당 지역에 대해서는 별도의 신청 양식이 있습니다. 제품을 구축하기 전에 읽어보십시오. Gemini Omni Flash는 이에 상응하는 논의가 없습니다. 다운로드할 파일이 없기 때문입니다.
이러한 오픈 가중치 입장은 공격적인 가격 책정과 결합하여 출시의 전체적인 전략적 스토리입니다 (South China Morning Post, 2026년 8월).
MiniMax H3 대 Gemini Omni Flash 리비전 테스트 직접 실행하기
여기 아무도 실행하지 않은 부분이 있습니다. 모두가 첫 번째 생성을 벤치마킹합니다. 아무도 두 번째 생성을 벤치마킹하지 않습니다.
실제 작업은 하나의 프롬프트가 아닙니다. 실제 작업은 이미 마음에 드는 클립에 클라이언트가 "좋아요, 간판에 24H라고 써주고 그녀의 앞치마를 빨간색으로 바꿔줄 수 있나요?"라고 답장하는 것입니다. 이 한 문장이 이 두 모델이 더 이상 서로 바꿔 쓸 수 없게 되는 지점이며, 비디오 편집 리더보드가 측정하는 바로 그 작업입니다.
장면은 의도적으로 잔혹합니다: 비에 젖은 야간 국수 포장마차, 판매자가 렌즈를 똑바로 응시하고, 그 뒤에 손으로 쓴 읽을 수 있는 단어가 있는 간판, 육수 위로 피어오르는 증기, 차양에 내리는 비. 립싱크, 화면 속 텍스트 안정성, 부드러운 움직임, 그리고 다층적인 주변 오디오를 동시에 요구하는 하나의 프레임입니다.
두 모델 모두 동일한 첫 프레임, 동일한 프롬프트, 동일한 리비전 지시를 받습니다. 아래의 모든 실행은 10초이며, 이는 Gemini Omni Flash의 상한선이자 H3의 범위 내에 있습니다.
1단계: GPT Image 2로 첫 프레임 고정
두 모델 모두 동일한 이미지에서 시작해야 합니다. 그렇지 않으면 1라운드는 모델이 아닌 구성의 운을 측정하게 됩니다. GPT Image 2 플레이그라운드를 열고, 품질을 높음, 비율을 16:9로 설정한 후 다음을 붙여넣습니다:
Plain1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

Atlas Cloud의 GPT Image 2 플레이그라운드: 왼쪽에 국수 포장마차 프롬프트, 출력 패널에 생성된 첫 프레임
GPT Image 2 on Atlas Cloud: 왼쪽의 프롬프트, OUTPUT의 공유 첫 프레임. 이 단계 비용: $0.009.

생성된 첫 프레임: 비 오는 밤, 김이 모락모락 나는 국수 카운터 뒤에 선 쪽빛 앞치마를 입은 여성, 그 뒤에 손으로 그린 OPEN LATE 간판이 빛나고 있음
두 모델이 받은 단일 입력. 리비전이 목표로 할 두 가지, 즉 "OPEN LATE" 간판과 쪽빛 앞치마에 주목하십시오. openai/gpt-image-2/text-to-image로 생성됨.
2단계: MiniMax H3에서 1라운드
MiniMax H3 플레이그라운드로 이동하여 image-to-video 작업을 선택하고, 1단계 프레임을 업로드한 후 resolution을 2K, duration을 10, ratio를 adaptive(이미지-투-비디오 열거형은 adaptive만 제공)로 설정합니다. 프롬프트:
Plain1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

Atlas Cloud의 MiniMax H3 이미지-투-비디오 플레이그라운드: 2K 해상도 선택, 출력 패널에서 완성된 클립 재생 중
Atlas Cloud의 MiniMax H3 이미지-투-비디오: 2K 선택, OUTPUT의 완성된 클립. 이 캡처는 플레이그라운드의 기본 8초로 실행되었으며 $1.12가 청구되었습니다. 비교에 사용된 10초 버전은 아래에 삽입되어 있으며 $1.40가 청구되었습니다.
MiniMax H3, 1라운드, 2K, 10초. 소리 켜기: 대화, 빗소리, 육수 끓는 소리가 모두 동일 패스에서 생성되었으며, 이후에 레이어링되지 않았습니다.
3단계: Gemini Omni Flash에서 1라운드, 동일한 프레임, 동일한 단어
Gemini Omni Flash 플레이그라운드를 열고, image-to-video를 선택한 후 동일한 1단계 프레임을 업로드하고 2단계 프롬프트를 문자 하나도 변경하지 않고 붙여넣습니다. 설정: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.
해당 양식에 있는 동안 주목해야 할 두 가지 사항이 있습니다. 이는 이 기사의 축소판이기 때문입니다. resolution 드롭다운에는 정확히 하나의 옵션이 포함되어 있습니다. duration 필드는 10에서 멈춥니다. 더 나은 무언가보다 720p를 선택한 것이 아닙니다. 선택할 수 있는 다른 것이 없습니다.
여기서 빠진 것에 대한 참고: Gemini 단계에 대해 실행 완료된 플레이그라운드 스크린샷을 캡처할 수 없었습니다. 제가 스크린샷을 찍는 스테이징 환경이 Google 측에서 세 번의 시도 모두에서 403 PERMISSION_DENIED를 반환했기 때문에, 제가 가진 유일한 Gemini 캡처는 실패한 OUTPUT 패널을 보여주며, 성공적인 실행으로 위장하지 않을 것입니다. 아래 클립은 실제이며, 위에 나열된 설정으로 프로덕션 API를 통해 생성되었습니다. 두 개의 H3 단계는 깔끔하게 캡처되었으며 해당 스크린샷은 진짜입니다.
Gemini Omni Flash, 1라운드, 720p, 10초, 동일한 입력. 이 클립을 위의 H3 클립 바로 뒤에 재생하고 오디오를 직접 판단하십시오.
4단계: 2라운드, Gemini Omni Flash로 리비전 보내기
이것이 중요한 라운드입니다. 동일한 Gemini 모델 페이지에서 video-edit 작업으로 전환하고, 3단계에서 Gemini 자체가 생성한 클립을 video 입력으로 업로드한 후 resolution 720p, thinking_level high(두 부분으로 구성된 편집 명령은 이 다이얼이 정확히 처리하도록 설계된 복잡한 경우입니다)로 설정합니다. 클라이언트가 보내는 것과 똑같이 다음 지시를 붙여넣습니다:
Plain1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.
Gemini Omni Flash, 리비전 지시 후. 간판을 확인한 다음 앞치마를 확인하고, 프레임의 다른 것이 이동했는지 확인하십시오.
5단계: 2라운드, MiniMax H3로 동일한 리비전 보내기
여기 정직한 구조적 차이가 있으며, 결과를 읽기 전에 알아야 합니다. H3에는 비디오 편집 엔드포인트가 없습니다. 리비전 경로는 reference-to-video입니다. 원본 클립을 참조로 제공하면 해당 참조에 조건화된 새 비디오를 생성합니다. 파일을 편집하는 것이 아니라, 파일처럼 보이도록 새 파일을 만드는 것입니다.
MiniMax H3 페이지에서 reference-to-video 작업을 선택하고, 2단계에서 H3가 생성한 클립을 refers에 비디오 참조로 추가한 다음 resolution 2K, duration 10, ratio adaptive로 설정합니다. 4단계 프롬프트를 전혀 수정하지 않고 붙여넣습니다.
이 단계에도 플레이그라운드 스크린샷이 없습니다. 그 이유는 다르고 더 지루합니다. 제가 캡처하는 데 사용하는 헤드리스 브라우저가 비디오 참조를 로드하는 동안 참조 업로더에서 세 번 충돌했기 때문입니다. 실행 자체는 API를 통해 문제없이 진행되었습니다.
MiniMax H3, 동일한 리비전 지시 후, 2K에서 reference-to-video를 통해.

2라운드 나란히 비교: Gemini Omni Flash video-edit 결과와 MiniMax H3 reference-to-video 결과, 동일한 리비전 지시문에서
2라운드 나란히, 무음 GIF. 왼쪽 Gemini Omni Flash (video-edit), 오른쪽 MiniMax H3 (reference-to-video). 둘 다 동일한 문장으로 작업해야 했습니다.
2라운드에서 실제로 일어난 일. 저는 H3가 여기서 질 것이라고 예상하고 들어갔습니다. 참조 조건부 재생성은 실제 편집 엔드포인트보다 더 둔한 도구이며, "전체 클립을 재생성하고 같은 위치에 도달하기를 바라는 것"은 정확히 다른 얼굴, 떠도는 카메라, 그리고 클라이언트가 "샷에 무슨 일이 일어난 거죠?"라고 묻게 만드는 방법입니다.
하지만 그렇게 나오지 않았습니다. 두 모델 모두 작업을 수행했으며, 둘 다 깔끔하게 수행했습니다.
Gemini의 video-edit은 정확히 광고된 대로 작동했습니다. 간판은 동일한 손글씨체, 동일한 호박색 빛, 동일한 주름진 철판으로 "OPEN 24H"라고 읽힙니다. 앞치마는 진홍색입니다. 다른 모든 것은 그대로입니다: 동일한 얼굴, 동일한 표정, 동일한 국자 각도, 동일한 증기 모양, 동일한 비, 배경의 동일한 미등. 본질적으로 원본 파일에 픽셀 깊이의 두 가지 수정을 가한 것으로 읽힙니다.
H3의 reference-to-video는 동일한 두 가지 변경 사항을 생성했으며, 아키텍처가 암시하는 것보다 훨씬 더 잘 샷을 유지했습니다. 간판이 변경되고, 앞치마가 변경되었으며, 10초 전체에 걸쳐 프레이밍, 국자에서 흘러내리는 육수, 증기 기둥, 그녀의 얼굴이 1라운드 클립에 대해 일관성을 유지했습니다. 여기에 드리프트가 있다면, 프레임을 하나씩 넘겨보면서 찾을 수 없었습니다.
따라서 2라운드는 세 번째 통계적 무승부이며, 더 깔끔한 이야기를 만들기 위해 그렇지 않은 척 하지 않겠습니다. 두 출력을 구분하는 것은 편집 품질이 아닙니다. H3가 2560x1440 해상도에 32kHz 스테레오 트랙을 반환한 반면, Gemini는 1280x720을 반환했다는 것입니다. 동일한 지시, 동일한 성공, 다른 결과물.
방법론에 대한 한 가지 정직한 주의사항: 이것은 단일 샷에 대한 단일 리비전이며, 통제된 연구가 아닙니다. 간판과 의복에 대한 두 부분으로 구성된 변경은 상당히 쉬운 편집입니다. 더 어려운 경우(카메라가 지나쳐 가는 물체 제거, 피사체가 가리는 무언가 변경, 서로 쌓인 네 라운드의 노트)는 전용 편집 엔드포인트가 앞서 나가야 하며, 재생성이 흔들리기 시작해야 하는 곳입니다. 결정하기 전에 직접 실행해 보십시오.
테스트할 가치가 있는 세 가지 추가 MiniMax H3 대 Gemini Omni Flash 차이점
2라운드는 납품을 바꾸는 차이점입니다. 세 가지 더 많은 분야가 여러분의 크레딧 20분을 투자할 가치가 있습니다.
오디오 파일을 입력으로 제공하십시오. H3의 reference-to-video는 최대 3개의 오디오 클립(각 2~15초)을 허용하며, 단 하나의 이미지 또는 비디오 참조가 함께 제공되어야 합니다. 즉, 실제 음성 녹음 파일을 제공하고 캐릭터가 이를 연기하도록 할 수 있습니다. Gemini Omni Flash는 네 개의 엔드포인트 중 어느 것에도 오디오 입력 필드가 없으므로 이 비교는 전혀 실행할 수 없습니다. 이는 Google의 점수 손실이 아닙니다. 단순히 존재하지 않는 기능입니다.
21:9를 요청하십시오. H3의 reference-to-video 비율 열거형에는 21:9, 16:9, 4:3, 1:1, 3:4 및 9:16이 포함됩니다. Gemini의 aspect_ratio 열거형에는 16:9 및 9:16이 포함됩니다. 결과물이 와이드스크린 타이틀 시퀀스 또는 1:1 소셜 컷인 경우, 이 두 모델 중 하나는 논의 대상이 아닙니다.
시드를 고정하고 다시 실행하십시오. 이것은 반대 방향입니다. Gemini는 seed를 노출합니다. H3는 어떤 엔드포인트에서도 이를 노출하지 않습니다. 동일한 요청이 화요일에 반환한 것과 동일한 프레임을 월요일에 반환해야 하는 파이프라인을 구축하는 경우, Gemini는 핸들을 제공하고 H3는 아무것도 제공하지 않습니다. 회귀 테스트, A/B 카피 변형 또는 자동화된 렌더 팜의 경우 이는 실질적인 이점이며 Google 측의 장부에 속합니다.
MiniMax H3 대 Gemini Omni Flash 테스트의 실제 비용
위의 전체 실험(4개의 비디오 생성과 1개의 이미지)은 약 $5.51에 달했습니다. 첫 프레임 $0.009, 두 개의 10초 1라운드 클립 각각 $1.40 및 $1.30, 두 개의 10초 2라운드 클립 각각 $1.40입니다.
초당 비용은 Gemini가 더 저렴합니다: $0.125~$0.14 대 H3의 고정 $0.14로, 엔드포인트에 따라 약 7~11% 더 저렴합니다. 그 숫자는 사실이지만 그 자체로는 거의 쓸모가 없습니다.
이유는 다음과 같습니다. 결과물이 2K의 15초 21:9 시네마틱 오프너라고 가정해 보겠습니다. H3는 하나의 클립으로 렌더링합니다. Gemini는 전혀 렌더링할 수 없습니다: 해상도, 길이, 화면비 모두 해당되지 않습니다. 10초짜리와 5초짜리 16:9 클립을 이어붙이고, 자르기로 와이드스크린을 흉내내고, 720p로 배송해야 합니다. 전달할 수 없는 것의 초당 가격은 절약이 아닙니다.
반대로 생각해 보겠습니다. 결과물이 16:9 소셜 컷이며, 클라이언트 수정 요청을 네 번 거치고, 법무팀이 3주 후에 다시 렌더링을 요청할 때 바이트 단위로 동일하게 반환되어야 한다고 가정해 보겠습니다. Gemini의 video-edit과 seed는 정확히 그 루프를 위해 만들어졌으며, 초당 비용도 더 저렴합니다.
표 D: MiniMax H3 대 Gemini Omni Flash 작업별 할당
| 당면한 작업 | 보낼 곳 |
|---|---|
| 2K 납품 | MiniMax H3 |
| 10초를 초과하는 단일 샷 | MiniMax H3 |
| 21:9, 4:3, 1:1 또는 3:4 프레이밍 | MiniMax H3 |
| 실제 오디오 트랙 입력 | MiniMax H3 |
| 자체 GPU에서 자체 호스팅 | MiniMax H3 |
| 특정 마지막 프레임에 도달 | MiniMax H3 |
| 대화형 다중 라운드 리비전 | Gemini Omni Flash |
| 클립의 수정되지 않은 부분 보존 | Gemini Omni Flash |
| 시드를 통한 재현 가능한 렌더링 | Gemini Omni Flash |
| 최저 초당 비용의 일반 16:9 숏폼 | Gemini Omni Flash |
이 기사의 결론은 점수가 아닌 바로 그 표입니다. 벤치마크가 두 모델을 자체 오차 막대보다 더 많이 분리할 수 없다면, 벤치마크는 알고 있는 모든 것을 말한 것이며, 그 시점부터 사양표가 역할을 인계받습니다.
H3가 다른 모델들과 비교하여 어디에 위치하는지 더 넓은 관점을 보려면, MiniMax H3 대안 분석에서 H3가 선두를 차지하지 않은 보드에서 이를 능가하는 모델들을 다룹니다.
자주 묻는 질문
MiniMax H3가 Gemini Omni Flash보다 더 낫나요?
블라인드 투표로는 이들을 구분할 수 없습니다. 세 개의 Artificial Analysis 리더보드에서 격차는 5, 2, 9 Elo 점수이며, 모든 것이 ±7~±10 신뢰 구간 안에 있습니다. 순위가 아닌 사양으로 선택하십시오. 해상도 상한선, 길이 제한, 화면비 목록이 결과물을 바꿀 것입니다. 5 Elo 점수는 그렇지 않습니다.
MiniMax H3와 Gemini Omni Flash 중 어느 것이 더 저렴한가요?
초당 비용은 Gemini입니다. Atlas Cloud에서 $0.125~$0.14/초이고 H3는 고정 $0.14/초이며, H3에는 없는 개발자 티어($0.112/초)도 있습니다. 그러나 Gemini는 720p, 10초, 두 가지 화면비로 제한되므로, 많은 납품물의 경우 동일한 제품을 비교하는 것이 아닙니다. 초가 아닌 완성된 컷의 가격을 책정하십시오.
Gemini Omni Flash가 1080p, 2K 또는 15초 비디오를 생성할 수 있나요?
아니요. API의 resolution 매개변수에는 하나의 유효한 값인 720p만 있으며, duration은 310초를 허용합니다. MiniMax H3는 15초를 제공합니다. 이는 2026년 8월 6일 라이브 스키마에서 읽은 열거형 제약 조건이며, 편집자의 의견이 아닙니다. Google이 나중에 이를 해제할 수도 있습니다.768P 또는 2K와 4
MiniMax H3를 자체 호스팅할 수 있는 것처럼 Gemini Omni Flash를 자체 호스팅할 수 있나요?
아니요. H3의 가중치는 Hugging Face에 있으며 768픽셀 짧은 변에서 로컬로 실행됩니다. 2K 출력을 생성하는 Context-IR 단계와 Regenerate-2K 모듈은 릴리스에 포함되지 않으며 API 측에 남아 있습니다. 또한 라이선스를 확인하십시오. 현재 EU, 영국, 한국 또는 미국은 별도 신청 없이는 포함되지 않습니다.
하나만 선택해야 하나요?
아니요, 위의 작업별 분할 표가 더 나은 답입니다. 두 모델 모두 Atlas Cloud에서 동일한 generateVideo 엔드포인트 뒤에 있으므로, 둘 다 실행한다는 것은 하나의 폴링 루프와 다른 model 문자열을 의미하며, 두 개의 통합이 아닙니다. 결과물별로 라우팅하는 것이 매주 움직이는 리더보드에 베팅하는 것보다 낫습니다.






