MiniMax H3 vs Gemini Omni Flash: 구글이 5점 차로 보드에서 승리한다. 그러자 클라이언트가 변경을 요청한다.

MiniMax H3와 Gemini Omni Flash를 세 개의 리더보드에서 비교했는데, 세 가지 차이 모두 오차 범위 내에 있었습니다. 그래서 두 모델에 각각 한 번의 샷을 실행한 후, 동일한 수정 노트를 다시 보냈습니다.

저는 세 개의 Artificial Analysis 리더보드를 10분 동안 쳐다보며 누가 진짜 이겼는지 알아내려고 했습니다.

텍스트-비디오: Gemini Omni Flash가 5점 차. 이미지-비디오: Gemini가 2점 차. 비디오 편집: MiniMax H3가 9점 차.

그리고 나서 신뢰 구간 열을 봤습니다. ±7, ±9, ±10.

세 개의 리더보드, 세 개의 격차, 모두 각각의 오차 범위 안에 들어있습니다. 블라인드 투표에서 이 두 모델은 같은 모델입니다.

그래서 리더보드를 닫고 대신 드롭다운을 열었습니다. 그 격차는 5점이 아닙니다. 그 격차는 전체 해상도 계층이었습니다.

주요 시사점

  • 세 개의 Artificial Analysis 격차(+5, +2, +9, 2026년 8월 6일 스냅샷)는 모두 ±7~±10 신뢰 구간 내에 있습니다. 원시 품질로는 승리가 아니라 동점입니다.
  • H3는 2K, 최대 15초, 6가지 화면비를 제공합니다. Gemini Omni Flash의 API는 720p, 10초, 2가지 화면비로 제한됩니다. 이들은 의견이 아니라 열거형 값입니다.
  • H3는 오디오를 입력으로 받습니다. Gemini는 그렇지 않습니다. Gemini에는 seedthinking_level이 있습니다. H3에는 둘 다 없습니다.
  • Gemini에는 소스 클립을 변형하는 전용 video-edit 엔드포인트가 있습니다. H3의 수정 경로는 reference-to-video로, 클립을 참조로 사용하여 재생성합니다. 이들은 동일한 작업이 아니며, 두 번째 라운드에서 그 차이가 드러납니다.
  • 둘 중 하나만 다운로드 가능한 가중치를 가지고 있으며, 그것은 Google 것이 아닙니다.

서로 다른 해상도의 야간 포장마차 장면을 나란히 비교한 이미지

MiniMax H3 대 Gemini Omni Flash 테스트 1라운드, 두 모델이 동일한 첫 프레임을 애니메이션으로 구현한 모습을 나란히 보여줍니다.

1라운드: 동일한 첫 프레임, 동일한 프롬프트, 동일한 길이. 왼쪽 MiniMax H3(2K), 오른쪽 Gemini Omni Flash(720p). 여기서는 무음 GIF로 표시되었지만, 두 파일 모두 기본 오디오를 포함하고 있으며 아래에서 재생 가능한 비디오로 삽입되어 있습니다. 이것이 문제입니다. 둘 다 좋습니다.


MiniMax H3 대 Gemini Omni Flash 리더보드 격차가 잘못 읽히는 이유

여러분이 찾을 수 있는 거의 모든 MiniMax H3 대 Gemini Omni Flash 게시물은 하나의 리더보드와 하나의 가격만 인용합니다. 두 습관 모두 잘못된 답을 낳습니다.

여기 모든 사람이 건너뛰는 열이 포함된 세 개의 Artificial Analysis 리더보드가 있습니다.

표 A: 세 개의 Artificial Analysis 리더보드(오디오 포함)에서의 MiniMax H3 대 Gemini Omni Flash, 2026년 8월 6일 스냅샷

리더보드Gemini Omni FlashMiniMax H3격차오차 범위 내?
텍스트-비디오1,243 (#1) ±7, 11,842표1,238 (#2) ±9, 6,830표Gemini +5
이미지-비디오1,191 (#2) ±9, 6,506표1,189 (#3) ±10, 5,545표Gemini +2
비디오 편집1,123 (#2) ±5, 11,706표1,132 (#1) ±6, 9,128표H3 +9예, 간신히

Elo 점수는 Artificial Analysis Video Arena (Artificial Analysis, 2026년 8월)에서 가져왔습니다. 이미지-비디오 부문은 Dreamina Seedance 2.0 720p가 1,197점으로 1위이므로, 이 두 모델 중 어느 것도 그 부문의 왕좌를 차지하지 않습니다. 이들은 변동하는 군중 투표 점수이며 계속 움직입니다. 이것이 바로 5점 차이가 평결이 아닌 이유입니다.

±9 구간이 있는 5점 리드는 순전한 투표 노이즈로 인해 다음 주에 순위가 뒤집힐 수 있음을 의미합니다. 그것은 "Gemini가 텍스트-비디오에서 더 낫다"는 것이 아닙니다. 그것은 점수판이 붙은 동전 던지기입니다.

사람들이 잘못 알고 있는 세 가지가 더 있습니다:

달러-퍼-미닛 열은 실제 지불 금액이 아닙니다. Artificial Analysis는 Gemini에 대해 $6.00/min, H3에 대해 $7.80/min을 나열합니다. 해당 열은 기본 설정에서 1080p 1분 비용으로 정규화한 것입니다. Gemini Omni Flash는 1080p를 전혀 생성할 수 없습니다. 따라서 숫자는 모델링 추정치일 뿐 청구서가 아닙니다. 완성된 결과물을 비교하세요, 초 단위가 아닙니다.

하나의 리더보드는 모델이 아닙니다. H3는 세 개의 리더보드에서 각각 2위, 3위, 1위를 차지합니다. Gemini는 1위, 2위, 2위를 차지합니다. 둘 중 하나만 인용하면 이미 믿고 있는 것을 증명할 수 있습니다.

"Omni"가 "무엇이든 먹는다"는 뜻은 아닙니다. 좋은 이름이지만 오해의 소지가 있습니다. 이 두 모델 중 하나는 오디오 파일을 입력으로 받습니다. 이름에 "omni"가 있는 모델이 아닙니다.

아무도 출력하지 않는 MiniMax H3 대 Gemini Omni Flash 사양표

Elo 점수가 이들을 분리할 수 없다면, 제약 조건 표가 분리할 수 있습니다. 출시 게시물을 신뢰하는 대신 두 모델의 라이브 입력 스키마를 가져왔으며, 그 차이는 미묘하지 않습니다.

표 B: 라이브 API 스키마(2026년 8월 6일)에서 읽은 MiniMax H3 대 Gemini Omni Flash 하드 제약 조건

제약 조건MiniMax H3Gemini Omni Flash
해상도768P 또는 2K720p, 그리고 열거형의 유일한 값입니다.
길이4~15초3~10초
화면비21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9와 9:16만
수정 경로reference-to-video (참조로 재생성)전용 video-edit 엔드포인트 (소스 변형)
마지막 프레임 제어end_image 지원사용 불가
참조 제한이미지 ≤9개, 비디오 ≤3개, 오디오 ≤3개, 총 12개 파일이미지 1~10개
오디오 입력아니요
seed 재현성아니요
thinking_level아니요예 (default / high / low)
오픈 가중치예, Hugging Face아니요

그 표를 정직하게 읽으면 Gemini가 세 개의 행에서 확실히 승리합니다. 재현 가능한 시드는 동일한 프레임을 두 번 렌더링해야 하는 파이프라인을 구축하는 경우 중요합니다. 실제 video-edit 엔드포인트는 참조 조건부 재생성과는 완전히 다른 도구입니다. 그리고 thinking_level은 H3가 노출하지 않는 품질 다이얼을 제공합니다.

H3는 다섯 개의 행에서 승리하며, 그 행들은 클라이언트가 요청한 파일을 전달할 수 있는지 여부를 결정하는 행들입니다.

아래의 모든 것은 Atlas Cloud에서 실행했습니다. 두 모델 모두 동일한 /api/v1/model/generateVideo 엔드포인트 뒤에 있기 때문에 전체 테스트에 대해 하나의 폴링 루프와 하나의 인증 헤더만 있으면 되었습니다. 모델을 전환하는 것은 model 문자열만 변경하면 되는 일이었습니다. 이 세부 사항이 "둘 다 사용"이 회피가 아닌 현실적인 답변인 이유입니다.

표 C: 이 테스트의 각 엔드포인트 비용, 2026년 8월 6일 라이브 가격표에서 확인

엔드포인트가격이 테스트의 10초 클립 비용
openai/gpt-image-2/text-to-image$0.009 / 이미지$0.01
minimax/h3/image-to-video$0.14 / 초$1.40
minimax/h3/reference-to-video$0.14 / 초$1.40
google/gemini-omni-flash/image-to-video$0.13 / 초$1.30
google/gemini-omni-flash/video-edit$0.14 / 초$1.40
google/gemini-omni-flash/text-to-video$0.125 / 초사용 안 함
minimax/h3/text-to-video$0.14 / 초사용 안 함

이번 달에는 두 모델 모두 할인을 제공하지 않습니다. Gemini는 또한 더 저렴한 개발자 등급(텍스트-비디오 및 이미지-비디오의 경우 $0.112/초, reference-to-video의 경우 $0.12/초)을 제공합니다. H3에는 이에 상응하는 등급이 없습니다.

Gemini Omni Flash가 넘을 수 없는 오픈 가중치 라인. H3의 가중치는 Hugging Face (MiniMax, 2026년 8월)에 게시되어 있습니다: 33B 밀집 단일 스트림 Omni Transformer, Qwen3-VL-32B 텍스트 인코더, 시각적 VAE 및 오디오 VAE. 다운로드 크기보다 더 중요한 두 가지 주의 사항이 있습니다. 첫째, 자체 호스팅하는 것은 768픽셀 짧은 쪽으로 실행됩니다. Context-IR 전처리 단계와 Regenerate-2K 모듈은 릴리스에 포함되어 있지 않으며, 2K 출력은 이 두 가지에서 비롯됩니다. 둘째, 커뮤니티 라이선스는 현재 EU, 영국, 한국 또는 미국을 포함하지 않으며, 해당 지역에 대한 별도의 신청 양식이 있습니다. 제품을 구축하기 전에 읽어보십시오. Gemini Omni Flash에는 다운로드할 파일이 없기 때문에 이에 상응하는 논의가 없습니다.

이러한 오픈 가중치 위치는 공격적인 가격 책정과 함께 출시의 전체 전략적 스토리입니다 (South China Morning Post, 2026년 8월).

직접 MiniMax H3 대 Gemini Omni Flash 수정 테스트 실행하기

여기 아무도 실행하지 않은 부분이 있습니다. 모두가 첫 번째 생성물을 벤치마킹합니다. 아무도 두 번째 생성물을 벤치마킹하지 않습니다.

실제 작업은 하나의 프롬프트가 아닙니다. 실제 작업은 이미 마음에 드는 클립에 클라이언트가 "좋아요, 간판에 24H라고 써주고 그녀의 앞치마를 빨간색으로 바꿔주실 수 있나요?"라고 답하는 것입니다. 이 한 문장이 바로 이 두 모델이 더 이상 서로 대체 불가능해지는 지점이며, 비디오 편집 리더보드가 측정하는 바로 그 작업입니다.

장면은 의도적으로 잔인합니다: 비에 젖은 야간 국수 포장마자, 주인이 렌즈를 똑바로 응시하며 말하고, 그녀 뒤에 읽을 수 있는 단어가 있는 손으로 칠한 간판, 육수 위로 피어오르는 증기, 차양에 내리는 비. 립싱크, 화면 내 텍스트 안정성, 유체 움직임 및 다층 주변 오디오를 모두 한 번에 테스트하는 하나의 프레임입니다.

두 모델 모두 동일한 첫 번째 프레임, 동일한 프롬프트, 동일한 수정 지시를 받습니다. 아래의 모든 실행은 10초이며, 이는 Gemini Omni Flash의 최대치이고 H3의 범위 내에 충분히 있습니다.

1단계: GPT Image 2로 첫 프레임 고정

두 모델 모두 동일한 이미지에서 시작해야 합니다. 그렇지 않으면 1라운드는 모델이 아닌 구성 운을 측정하게 됩니다. GPT Image 2 플레이그라운드를 열고 품질을 high로, 비율을 16:9로 설정한 후 다음을 붙여넣으세요:

Plain
1폭우 속의 사실적인 야간 길거리 음식 포장마차, 35mm 렌즈 f/2.0으로 촬영. 30대 후반의 여성이 인디고 캔버스 앞치마를 입고 김이 모락모락 나는 국수 카운터 뒤에 서서 렌즈를 똑바로 응시하며 말하고 있습니다. 그녀 뒤에는 손으로 칠한 양철 라이트박스 간판이 "OPEN LATE"라는 깔끔한 굵은 산세리프 대문자로 따뜻한 호박색 빛을 내고 있습니다. 비가 나트륨 가로등 불빛을 타고 흐르고, 국물 냄비에서 증기가 피어오르고, 젖은 아스팔트는 길 건너편의 빨간색과 녹색 네온 불빛을 반사합니다. 얕은 심도, 실용적인 조명만 사용, 약간의 렌즈 헤이즈, 자연스러운 피부 질감, 프레임 내 다른 곳에는 텍스트가 없습니다. 16:9.

AI 이미지 생성기 인터페이스가 프롬프트와 생성된 이미지를 보여주는 모습

Atlas Cloud의 GPT Image 2 플레이그라운드, 왼쪽에 포장마차 프롬프트, 출력 패널에 생성된 첫 프레임

Atlas Cloud의 GPT Image 2: 왼쪽 프롬프트, OUTPUT의 공유 첫 프레임. 이 단계 비용: $0.009.

한 여성이 밤에 김이 모락모락 나는 길거리 음식 포장마차에 서 있는 모습

생성된 첫 프레임: 인디고 앞치마를 입은 여성이 비 오는 밤에 김이 나는 국수 카운터 뒤에 서 있으며, 뒤에 손으로 칠한 OPEN LATE 간판이 빛나고 있습니다.

두 모델이 받은 단일 입력. 수정이 대상으로 할 두 가지 사항에 주목하세요: "OPEN LATE" 간판과 인디고 앞치마. openai/gpt-image-2/text-to-image로 생성.

2단계: MiniMax H3 1라운드

MiniMax H3 플레이그라운드로 이동하여 image-to-video 작업을 선택하고 1단계 프레임을 업로드한 후, resolution2K, duration10, ratioadaptive로 설정합니다(이미지-비디오 열거형은 adaptive만 제공). 프롬프트:

Plain
1주인이 렌즈를 바라보며 따뜻하고 지친 목소리로 말합니다: "국물은 오늘 새벽 4시부터 끓였어요. 앉으세요, 아직도 비가 오네요." 그녀는 말하면서 국자를 듭니다. 증기가 프레임 전체에 피어오릅니다. 비는 그녀 뒤의 차양에 계속 내립니다. 카메라는 고정되어 있고, 밀거나 패닝이 없습니다. 주변 오디오: 캔버스에 떨어지는 빗소리, 끓는 국물 소리, 먼 교통 소리, 그녀의 목소리는 가깝고 건조합니다.

AI 비디오 생성 인터페이스가 텍스트 프롬프트 입력과 비디오 출력을 보여주는 모습

Atlas Cloud의 MiniMax H3 이미지-비디오 플레이그라운드, 2K 해상도 선택, 출력 패널에서 완성된 클립 재생 중

Atlas Cloud의 MiniMax H3 이미지-비디오: 2K 선택, OUTPUT의 완성된 클립. 이 캡처는 플레이그라운드의 기본 8초로 실행되어 $1.12로 책정되었습니다. 비교에 사용된 10초 버전은 아래에 삽입되어 있으며 $1.40입니다.

MiniMax H3, 1라운드, 2K, 10초. 사운드 켜기: 대화, 빗소리, 국물 소리는 모두 동일 패스에서 생성되었으며, 나중에 레이어링되지 않았습니다.

3단계: Gemini Omni Flash 1라운드, 동일한 프레임, 동일한 단어

Gemini Omni Flash 플레이그라운드를 열고 image-to-video를 선택한 후 동일한 1단계 프레임을 업로드하고 2단계 프롬프트를 문자 하나 바꾸지 않고 붙여넣으세요. 설정: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.

해당 양식에 있는 동안 주목해야 할 두 가지 사항이 있습니다. 이는 이 기사의 축소판이기 때문입니다. resolution 드롭다운에는 정확히 하나의 옵션만 있습니다. duration 필드는 10에서 멈춥니다. 더 나은 옵션 대신 720p를 선택한 것이 아닙니다. 선택할 수 있는 다른 것이 없습니다.

여기서 빠진 것에 대한 참고: Gemini 단계에 대해 실행 완료된 플레이그라운드 스크린샷을 캡처할 수 없었습니다. 제가 스크린샷을 찍는 스테이징 환경이 세 번 모두 Google 측에서 403 PERMISSION_DENIED를 반환했습니다. 따라서 제가 가진 유일한 Gemini 캡처는 실패한 OUTPUT 패널을 보여주며, 성공적인 실행으로 위장하지 않겠습니다. 아래 클립은 실제이며 위에 나열된 설정으로 프로덕션 API를 통해 생성되었습니다. 두 H3 단계는 깔끔하게 캡처되었으며 해당 스크린샷은 진짜입니다.

Gemini Omni Flash, 1라운드, 720p, 10초, 동일한 입력. 위의 H3 클립 바로 다음에 재생하고 오디오를 직접 판단해 보세요.

4단계: 2라운드, 수정본을 Gemini Omni Flash로 보내기

이것이 중요한 라운드입니다. 동일한 Gemini 모델 페이지에서 video-edit 작업으로 전환하고, Gemini가 3단계에서 생성한 클립video 입력으로 업로드한 후, resolution 720p, thinking_level high로 설정합니다(두 부분으로 구성된 편집 지시는 이 다이얼을 위한 정확한 복잡한 경우입니다). 클라이언트가 보내는 것과 똑같이 이 메모를 정확히 붙여넣으세요:

Plain
1이 정확한 샷을 유지: 동일한 카메라 위치, 동일한 여성, 동일한 얼굴, 동일한 비, 동일한 조명, 동일한 오디오. 손으로 칠한 간판이 "OPEN LATE" 대신 "OPEN 24H"로 읽히도록 변경하고, 동일한 페인트 스타일과 동일한 호박색 빛을 유지하세요. 그녀의 앞치마를 인디고 블루에서 진한 크림슨으로 변경하세요. 프레임의 다른 어떤 것도 변경하지 마세요.

수정 지시 후 Gemini Omni Flash. 간판을 본 다음 앞치마를 확인하고, 다른 것이 움직였는지 확인하세요.

5단계: 2라운드, 동일한 수정본을 MiniMax H3로 보내기

여기에 정직한 구조적 차이가 있으며, 결과를 읽기 전에 알아야 합니다. H3에는 video-edit 엔드포인트가 없습니다. 수정 경로는 reference-to-video입니다. 원본 클립을 참조로 제공하면 해당 참조를 조건으로 새로운 비디오를 생성합니다. 파일을 편집하는 것이 아닙니다. 여러분의 파일처럼 보이도록 새 파일을 만드는 것입니다.

MiniMax H3 페이지에서 reference-to-video 작업을 선택하고, 2단계에서 H3가 생성한 클립을 비디오 참조로 refers에 추가한 후, resolution 2K, duration 10, ratio adaptive로 설정합니다. 4단계 프롬프트를 전혀 수정하지 않고 붙여넣으세요.

이 단계에도 플레이그라운드 스크린샷은 없습니다. 그 이유는 더 지루합니다. 제가 캡처하는 데 사용하는 헤드리스 브라우저가 비디오 참조를 로드하는 동안 참조 업로더에서 세 번 충돌했습니다. 실행 자체는 API를 통해 불만 없이 진행되었습니다.

동일한 수정 지시 후 MiniMax H3, 2K에서 reference-to-video를 통해.

비오는 야간 음식 포장마차에서 요리하는 여성 비교

2라운드 나란히 비교: 동일한 수정 지시에서 나온 Gemini Omni Flash video-edit 결과와 MiniMax H3 reference-to-video 결과

2라운드 나란히, 무음 GIF. 왼쪽 Gemini Omni Flash (video-edit), 오른쪽 MiniMax H3 (reference-to-video). 둘 다 동일한 문장으로 작업해야 했습니다.

2라운드에서 실제로 일어난 일. 저는 H3가 이번 라운드에서 질 것이라고 예상하고 들어갔습니다. 참조 조건부 재생성은 실제 편집 엔드포인트보다 더 둔탁한 도구이며, "전체 클립을 재생성하고 동일한 위치에 도달하기를 바라는 것"은 정확히 다른 얼굴, 움직이는 카메라 및 샷에 무슨 일이 일어났는지 묻는 클라이언트를 얻는 방법입니다.

그러나 그렇게 나오지 않았습니다. 두 모델 모두 작업을 수행했으며, 둘 다 깔끔하게 수행했습니다.

Gemini의 video-edit은 정확히 광고된 대로 작동했습니다. 간판은 동일한 손으로 칠한 글씨체, 동일한 호박색 빛, 동일한 양철 노후화로 OPEN 24H라고 읽힙니다. 앞치마는 진한 크림슨입니다. 다른 모든 것은 그대로입니다: 동일한 얼굴, 동일한 표정, 동일한 국자 각도, 동일한 증기 모양, 동일한 비, 배경의 동일한 미등. 본질적으로 두 개의 픽셀 깊이 수정이 있는 원본 파일로 읽힙니다.

H3의 reference-to-video는 동일한 두 가지 변경 사항을 생성했으며, 아키텍처가 암시하는 것보다 훨씬 더 잘 샷을 유지했습니다. 간판이 변경되고 앞치마가 변경되었으며, 10초 전체에 걸쳐 프레이밍, 국자에서 부어지는 국물의 흐름, 증기 기둥 및 그녀의 얼굴이 1라운드 클립과 일관되게 유지되었습니다. 여기에 드리프트가 있다면, 프레임을 단계별로 살펴보아도 찾을 수 없었습니다.

따라서 2라운드는 세 번째 통계적 동점이며, 더 깔끔한 이야기를 만들기 위해 그렇지 않은 척하지 않겠습니다. 두 출력을 구분하는 것은 편집 품질이 아닙니다. H3가 2560x1440 및 32kHz 스테레오 트랙을 반환한 반면 Gemini는 1280x720을 반환했다는 것입니다. 동일한 지시, 동일한 성공, 다른 결과물.

방법에 대한 한 가지 정직한 주의 사항: 이것은 단일 샷에 대한 단일 수정이며 통제된 연구가 아닙니다. 간판과 의복에 대한 두 부분으로 구성된 변경은 상당히 쉬운 편집입니다. 더 어려운 경우(카메라가 지나가는 물체 제거, 피사체가 가리는 것을 변경, 서로 누적된 네 라운드의 메모)는 전용 편집 엔드포인트가 앞서 나가야 하고 재생성이 흔들리기 시작해야 하는 곳입니다. 결정을 내리기 전에 직접 실행해 보십시오.

테스트할 가치가 있는 세 가지 더 많은 MiniMax H3 대 Gemini Omni Flash 차이점

2라운드는 납품을 변경하는 차이점입니다. 세 가지 더 많은 차이점을 테스트하는 데 20분의 크레딧을 투자할 가치가 있습니다.

오디오 파일을 제공하세요. H3의 reference-to-video는 최대 3개의 오디오 클립(각각 2~15초)을 허용하며, 단, 최소 하나의 이미지 또는 비디오 참조가 함께 제공되어야 합니다. 즉, 실제 음성 녹음을 제공하고 캐릭터가 이를 수행하도록 할 수 있습니다. Gemini Omni Flash는 네 개의 엔드포인트 중 어느 것에도 오디오 입력 필드가 없으므로 이 비교를 전혀 실행할 수 없습니다. Google의 점수 손실이 아닙니다. 단순히 존재하지 않는 기능입니다.

21:9를 요청하세요. H3의 reference-to-video 비율 열거형에는 21:9, 16:9, 4:3, 1:1, 3:4 및 9:16이 포함됩니다. Gemini의 aspect_ratio 열거형에는 16:9와 9:16이 포함됩니다. 납품이 와이드스크린 타이틀 시퀀스 또는 1:1 소셜 컷인 경우 이 두 모델 중 하나는 논의 대상이 아닙니다.

시드를 고정하고 다시 실행하세요. 이번에는 반대입니다. Gemini는 seed를 노출합니다. H3는 어떤 엔드포인트에서도 이를 노출하지 않습니다. 동일한 요청이 화요일에 반환된 것과 동일한 프레임을 수요일에 반환해야 하는 파이프라인을 구축하는 경우 Gemini는 핸들을 제공하고 H3는 아무것도 제공하지 않습니다. 회귀 테스트, A/B 복사 변형 또는 자동화된 렌더 팜의 경우 이는 실제 이점이며 Google 측의 장부에 속합니다.

MiniMax H3 대 Gemini Omni Flash 테스트의 실제 비용

위의 전체 실험(4개의 비디오 생성과 1개의 이미지)은 약 $5.51이 들었습니다. 첫 번째 프레임 $0.009, 10초 1라운드 클립 2개($1.40 및 $1.30), 10초 2라운드 클립 2개(각각 $1.40)입니다.

초당 비용은 Gemini가 더 저렴합니다: $0.125~$0.14 대 H3의 고정 $0.14, 따라서 엔드포인트에 따라 약 7~11% 적습니다. 그 숫자는 사실이지만 그 자체로는 거의 쓸모가 없습니다.

그 이유는 다음과 같습니다. 납품이 2K의 15초 21:9 시네마틱 오프너라고 가정해 보십시오. H3는 하나의 클립으로 렌더링합니다. Gemini는 전혀 렌더링할 수 없습니다: 해상도, 길이, 화면비 모두 해당되지 않습니다. 10초 클립과 5초 16:9 클립을 이어붙이고, 와이드스크린을 가짜로 만들기 위해 자르고, 720p로 납품해야 할 것입니다. 납품할 수 없는 것의 초당 가격은 절약이 아닙니다.

반대로 생각해 보십시오. 납품이 16:9 소셜 컷이고, 네 번의 클라이언트 수정을 거쳐야 하며, 법무팀이 3주 후에 다시 렌더링하도록 요청할 때 동일하게 반환되어야 한다고 가정해 보십시오. Gemini의 video-editseed는 정확히 그 루프를 위해 구축되었으며, 그렇게 하면서 초당 비용이 더 저렴합니다.

표 D: 각 MiniMax H3 대 Gemini Omni Flash 작업이 어디로 가는지

당면한 작업보낼 곳
2K 납품MiniMax H3
10초보다 긴 단일 샷MiniMax H3
21:9, 4:3, 1:1 또는 3:4 프레이밍MiniMax H3
실제 오디오 트랙 입력MiniMax H3
자체 GPU에서 자체 호스팅MiniMax H3
특정 마지막 프레임에 도달MiniMax H3
대화형 다중 라운드 수정Gemini Omni Flash
클립의 수정되지 않은 부분 보존Gemini Omni Flash
시드를 통한 재현 가능한 렌더링Gemini Omni Flash
가장 낮은 초당 비용의 일반 16:9 단편Gemini Omni Flash

이 기사의 결론은 점수가 아니라 해당 표입니다. 벤치마크가 자체 오차 막대보다 더 많이 두 모델을 분리할 수 없다면, 벤치마크는 알고 있는 모든 것을 말한 것이며 사양표가 그 다음을 대신합니다.

H3가 나머지 분야와 비교하여 어디에 위치하는지 더 넓은 관점을 보려면 MiniMax H3 대안 분석에서 H3가 선두를 달리지 않는 보드에서 이를 능가하는 모델을 다룹니다.

자주 묻는 질문

MiniMax H3가 Gemini Omni Flash보다 나은가요?

블라인드 투표로는 이들을 구분할 수 없습니다. 세 개의 Artificial Analysis 리더보드에서 격차는 5, 2, 9 Elo 점수이며, 각각 ±7~±10 신뢰 구간 내에 있습니다. 순위가 아닌 사양으로 선택하십시오. 해상도 상한, 길이 제한 및 화면비 목록이 납품을 변경합니다. 5 Elo 점수는 그렇지 않습니다.

MiniMax H3와 Gemini Omni Flash 중 어느 것이 더 저렴한가요?

초당 비용은 Gemini입니다. Atlas Cloud에서 Gemini는 $0.125~$0.14/초이며 H3의 고정 $0.14/초와 비교됩니다. H3에는 없는 개발자 등급($0.112/초)도 있습니다. 그러나 Gemini는 720p, 10초 및 두 가지 화면비로 제한되므로 많은 납품의 경우 동일한 제품을 비교하는 것이 아닙니다. 초가 아닌 완성된 컷의 가격을 책정하십시오.

Gemini Omni Flash가 1080p, 2K 또는 15초 비디오를 생성할 수 있나요?

아니요. API resolution 매개변수에는 하나의 법적 값인 720p만 있으며, duration은 310초를 허용합니다. MiniMax H3는 768P 또는 2K와 415초를 제공합니다. 이는 2026년 8월 6일 라이브 스키마에서 읽은 열거형 제약 조건이며 편집 의견이 아닙니다. Google이 나중에 이를 해제할 수 있습니다.

MiniMax H3를 자체 호스팅할 수 있는 것처럼 Gemini Omni Flash를 자체 호스팅할 수 있나요?

아니요. H3의 가중치는 Hugging Face에 있으며 768픽셀 짧은 쪽에서 로컬로 실행됩니다. 2K 출력을 생성하는 Context-IR 단계와 Regenerate-2K 모듈은 릴리스에 포함되어 있지 않으며 API 측에 유지됩니다. 또한 라이선스를 확인하십시오. 현재 EU, 영국, 한국 또는 미국을 별도의 신청 없이는 포함하지 않습니다.

하나만 선택해야 하나요?

아니요. 위의 작업별 분할 표가 더 나은 답변입니다. 두 모델 모두 Atlas Cloud에서 동일한 generateVideo 엔드포인트 뒤에 있으므로 둘 다 실행한다는 것은 하나의 폴링 루프와 다른 model 문자열을 의미하며 두 개의 통합이 아닙니다. 매주 움직이는 리더보드에 베팅하는 것보다 납품별로 라우팅하는 것이 더 낫습니다.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색