MiniMax가 금요일에 H3를 출시했습니다. 24시간 안에 Seedance 2.5가 사람들 손에 들어왔고, 타임라인은 하나의 대화로 붕괴되었습니다: 30초, 네이티브 4K, 50개의 참조 입력. H3의 출시 게시글은 그 아래 조용히 자리 잡았고, 거의 아무도 실제 테스트를 돌리지 않았습니다.
이유를 압니다. 30초는 훌륭한 숫자입니다. 헤드라인에 딱 들어맞죠.
하지만 실제로 세로형 숏 드라마를 만든다면, 밤을 망치는 것은 30초가 아니라는 것을 압니다. 바로 4번째 샷입니다. 남자 주인공의 턱선이 0.5cm 움찔하고, 그의 크라바트 주름이 하나 사라지며, 시청자는 훅이 걸리기 전에 손가락으로 쓸어 넘깁니다. 클립이 15초 대신 30초라서 이탈하는 사람은 없습니다. 클로즈업에 있는 남자가 와이드 샷의 남자가 아니기 때문에 이탈하는 것입니다.
그래서 저는 사양표 대결을 건너뛰었습니다. 하나의 캐릭터 턴어라운드 시트, 하나의 6패널 로케이션 보드를 만들고, 15초 고딕 숏 드라마 프롬프트 하나를 작성한 다음 동일한 패키지를 양쪽에 보냈습니다. 그리고 나서 얼굴을 응시했습니다.
핵심 요점
- 둘 다 실제이지만, 접근성은 동일하지 않습니다. H3의 세 엔드포인트(텍스트, 이미지 및 참조-투-비디오)는 현재 라이브 상태이며 호출 가능합니다. Seedance 2.5의 API는 ByteDance에서 나왔지만, 제가 모든 것을 실행한 멀티 모델 플랫폼에서는 아직 Day-0 페이지 상태이므로, 제 head-to-head에서 Seedance 측은 Seedance 2.0 참조-투-비디오입니다. 중요한 부분마다 이를 표시하겠습니다.
- 사양이 명확히 갈라집니다. Seedance 2.5 = 한 번 생성에 최대 30초, 네이티브 4K, 최대 50개의 멀티모달 참조, 영역 수준 편집. H3 = 5~15초, 24fps에서 네이티브 2K, 이미지 9개 + 비디오 3개 + 오디오 클립 3개(최대 12개 파일), 모든 출력에 스테레오 오디오, 전체 클립 명령 편집.
- 캐릭터 안정성은 패키징 문제이지 모델 생성 문제가 아닙니다. 하나의 합성 턴어라운드 시트와 하나의 조명 보드로 두 모델 모두 동일한 얼굴과 동일한 의상을 유지했습니다. 어떤 생성 횟수도 샷을 구하거나 망치지 않았습니다. 패키지가 그 일을 했습니다.
- 아무도 테스트하지 않은 모델이 이미 3위에 올랐습니다. Artificial Analysis 이미지-투-비디오 아레나에서 H3는 Seedance 2.0의 1,196 Elo 뒤에 1,185 Elo로 자리 잡고 있습니다. Seedance 2.5는 아직 보드에 없습니다.
- 둘 다 자체 오디오를 생성합니다. H3는 또한 최대 3개의 오디오 참조를 받아 캐릭터에 음성을 고정할 수 있으며, 이는 숏 드라마 파이프라인에서 TTS 및 동기화 단계 전체를 제거합니다.
- 초당 픽셀이 아니라 프레임당 픽셀을 물어보세요. 동일한 참조 팩, 동일한 런타임: H3의 참조-투-비디오는 1440p를 반환하고, Seedance 2.0의 참조-투-비디오는 720p를 반환합니다. 이는 전체 비용 문제를 재구성합니다.
Seedance 2.5의 자체 페어링된 숫자는 아직 나오지 않았습니다. 엔드포인트가 제가 테스트하는 곳에서 열리는 날 추가하겠습니다.
Seedance 2.5 vs MiniMax H3 결과, 이론보다 먼저
이론보다 먼저, 워크플로가 생성하는 결과물을 보여드리겠습니다. 완성된 15초 세로형 클립에서 추출하여 타일 배열한 4개의 샷입니다. MiniMax 자체 H3 참조 실행으로, 1단계와 2단계에서 보게 될 캐릭터 시트와 로케이션 보드에서 정확히 제작되었으며, 네이티브 1440x2560 해상도입니다. 동일한 팩의 제 자체 실행은 튜토리얼 뒷부분에서 플레이그라운드 상태를 볼 수 있게 제시됩니다.
XSnfiquLLMk
그녀는 로케이션 보드의 패널 4인 조각된 문에 도달하고, 복도 대치, 그 다음 그의 타이트 클로즈업, 그리고 투샷이 이어집니다. 그의 헤어라인은 프로필과 클로즈업에서 동일하게 갈라집니다. 그녀의 하프 업 브레이디드 크라운은 풀페이스 클로즈업에서도 살아남는데, 이는 대부분의 모델이 조용히 얼굴을 재구성하는 바로 그 지점입니다. 크림 레이스 보디스는 첫 프레임부터 마지막 프레임까지 동일한 네크라인과 소매 커프스를 유지합니다.
이것이 전체 테스트입니다. 30초가 아닌, 4개의 샷과 턱선입니다.
왜 Seedance 2.5 vs MiniMax H3가 같은 주에 출시되었는가, 그리고 대부분의 캐릭터 테스트가 쓸모없는 이유
MiniMax는 7월 30일에 H3를 출시했습니다. 텍스트, 이미지, 비디오 및 오디오를 하나의 컨텍스트로 읽고 최대 2K, 네이티브 스테레오 사운드로 5~15초 클립을 반환하는 범용 멀티모달 비디오 모델입니다. 또한 기존 영상을 편집하고 한 클립에서 다른 클립으로 모션을 전송할 수 있으며, MiniMax는 가중치가 며칠 내로 공개될 것이라고 밝혔습니다(Reuters, 2026년 7월).
Seedance 2.5는 더 큰 숫자와 함께 같은 기간에 등장했습니다: 한 번 생성에 30초, 네이티브 4K, 한 작업에 최대 50개의 멀티모달 참조 입력(The Next Web, 2026년 7월). API는 이미 개발자 손에 있으며, 성능, 조명 및 카메라 동작은 그대로 유지하면서 프레임 일부를 다시 그리는 지역화된 편집, 그린스크린 플레이트나 3D 화이트 모델 블록아웃을 받아들이는 참조-투-비디오, 11개 언어, 180초에 도달하는 실험적 장편 비디오 모드를 포함합니다(CineD, 2026년 7월).
9HprrI3lQK4
관심 격차가 흥미로운 부분입니다. 제가 찾을 수 있는 거의 모든 게시물은 2.5 클립이었습니다. 한편 공개 아레나 숫자는 다른 것을 말합니다: Artificial Analysis 이미지-투-비디오 리더보드에서 720p의 Seedance 2.0이 1,196 Elo로 선두, Gemini Omni Flash가 1,195로 뒤따르며, MiniMax H3는 출시 4일 만에 이미 1,185 Elo로 3위입니다. Seedance 2.5는 아직 거기에 평가가 없습니다(Artificial Analysis, 2026년 7월). 가장 적은 화제를 모은 모델이 점수 대비 관심 비율이 가장 높은 모델입니다.
이제 출력을 실제로 결정하는 부분입니다. 로고 선택과는 거의 관련이 없기 때문입니다.
대부분의 캐릭터 일관성 테스트는 모델이 개입되기도 전에 실패합니다. 네 가지 실패 모드가 있으며, 모두 당신이 고쳐야 할 부분입니다:
| 실패 모드 | 출력에서 보이는 현상 | 해결 방법 |
|---|---|---|
| 다중 뷰 참조를 별도 파일로 보냄 | 모든 샷의 얼굴이 "거의 맞지만" 서로 일치하지 않음 | 뷰를 하나의 이미지로 합성한 후 프롬프트에서 역할 할당 ("왼쪽의 남자", "오른쪽의 여자") |
| 샷마다 캐릭터 설명을 다시 작성 | 샷마다 의상과 액세서리가 달라짐 | 정체성 블록을 한 번 작성하고 그대로 재사용; 샷마다 카메라와 동작만 변경 |
| 조명이 장면과 함께 움직이도록 방치 | 새로운 조명에서 얼굴이 구조적으로 재구성됨 | 조명 방향, 안개 및 바닥 반사를 고정하는 별도의 로케이션 보드를 구축하여 참조로 제공 |
| 최대 지속 시간을 품질 지표로 취급 | 30초 내의 한 번의 드리프트가 전체 30초를 망침 | 재시도 가능한 세분성으로 자르고, 그런 다음 길이에 대해 논의 |
첫 번째 행이 사람들이 가장 많이 틀리는 부분입니다. 6개의 단일 뷰 이미지를 보내면 모델은 이를 6명의 후보 인물로 취급하고 평균을 냅니다. 하나의 깔끔한 합성을 보내면 세 면에서 본 한 사람으로 취급합니다. 같은 픽셀, 완전히 다른 결과.
2jp1CC7nfUM
Seedance 2.5 vs MiniMax H3 사양표, 그리고 오늘 실제로 호출 가능한 것
기능과 가용성을 분리하면 긴장이 명확해집니다. 원시 기능 측면에서 Seedance 2.5는 지속 시간, 해상도 상한, 참조 수 및 편집 세분성에서 앞섭니다. 가용성 측면에서 H3는 이번 주에 범용 모델 플랫폼에서 세 개의 라이브 엔드포인트를 가진 모델입니다. 2026년 계획을 위한 AI 비디오 모델 비교를 한다면, 두 번째 열이 첫 번째 열만큼 중요합니다.
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 Ref-to-Video (내가 실행한 것) | |
|---|---|---|---|
| 한 번 생성의 최대 길이 | 5~15초 | 최대 30초, 스티칭 없음 (베타 모드 180초, 실험적) | 숏클립 메뉴, 모델 페이지 참조 |
| 해상도 | 네이티브 2K, 16:9~9:16에서 짧은 쪽 1440p; 768p 계층 출시 예정 | 네이티브 4K, 10비트 컬러 | 이 엔드포인트에서 최대 720p |
| 프레임 속도 | 24fps | 별도로 공개되지 않음 | 별도로 공개되지 않음 |
| 참조 입력 | 이미지 9개 + 비디오 3개 + 오디오 3개, 총 12개 파일 | 최대 50개 멀티모달 참조 | 이미지 9개 + 비디오 3개 + 오디오 3개 |
| 네이티브 오디오 | 예, 모든 출력, 스테레오 | 예, 11개 자막 및 음성 언어 추가 | 예 |
| 편집 세분성 | 전체 클립 명령 편집 (캐릭터, 배경, 조명, 대화 교체) | 프레임 일부를 다시 그리는 영역 수준 편집 | 전체 클립 명령 편집 |
| 프롬프트 한도 | 7,000자 | 공개되지 않음 | 공개되지 않음 |
| 오픈 가중치 | 출시 후 며칠 내 공개 예정 | 공개되지 않음 | 공개되지 않음 |
| Artificial Analysis I2V Elo, 2026.7.31 | 1,185 (3위) | 아직 평가되지 않음 | 1,196 (1위, Dreamina 720p 항목) |
| 내가 테스트한 플랫폼에서 호출 가능 | 예, 3개 엔드포인트 | 아직, Day-0 페이지 | 예 |
테스트 설정에 대한 완전한 공개. 이 글을 실행할 당시 Seedance 2.5는 내 플랫폼에서 열리지 않았으므로, Seedance 측은 Seedance 2.0 Reference-to-Video로, 동일한 패밀리의 현재 출하 중인 멤버이자 동일한 4중 모달 참조 시스템을 갖추고 있습니다. 2.5가 답을 바꾸는 경우에는 그렇게 말하겠습니다. Seedance 2.5 페이지는 현재 Day-0 공지입니다.
아래 모든 내용은 하나의 브라우저 탭, 하나의 키, 총 3개 모델로 실행됩니다:
| 단계 | 모델 | 생성물 | 주요 설정 | 비용 결정 요인 |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 Text-to-Image | 캐릭터 턴어라운드 시트 | quality high, 16:9 | 이미지당, 사용한 만큼 지불, 현재 요금은 모델 페이지 참조 |
| 2 | 동일 모델, 두 번째 실행 | 6패널 로케이션 및 조명 보드 | quality high, 16:9 | 이미지당, 사용한 만큼 지불 |
| 3 | MiniMax H3 Reference-to-Video | 네이티브 오디오가 포함된 9:16 클립 | 9:16, 2K, 테스트용 5초, 실제 컷용 15초 | 초 x 해상도, 초당 청구 |
| 4 | Seedance 2.0 Reference-to-Video | 제어 실행, 동일한 입력 | 9:16, 사용 가능한 최고 해상도, 동일 지속 시간 | 초 x 해상도, 초당 청구 |
| 5 | H3 Reference-to-Video, 클립을 입력으로 사용 | 전체 재시도 없이 하나의 고정 샷 수정 | 동일 해상도, 짧은 지속 시간 | 초 x 해상도, 초당 청구 |
H3에는 순수 텍스트 기준선이나 첫 번째 및 마지막 프레임 제어를 원하는 경우 text-to-video 및 image-to-video 항목도 있습니다.
배치를 계획하기 전에 알아두면 좋은 한 가지 더: 화면 속 텍스트. 이 15초 H3 타이틀 시퀀스는 8번의 하드 컷을 통해 영어 크레딧을 단 한 번의 오타 없이 유지하는데, 이는 생성된 비디오에서 유지하기 가장 어려운 것 중 하나입니다.
hwooYYPRW5o
Seedance 2.5 vs MiniMax H3 숏 드라마 워크플로, 단계별
5단계. 프롬프트를 정확히 작성된 그대로 복사하세요. 못생긴 부분도 포함해서요. 저는 기사를 위해 정리하지 않았으며, 여러분도 모델을 위해 정리해서는 안 됩니다.
1단계: GPT Image 2로 캐릭터 시트 제작
비디오를 만들기 전에 참조 팩을 만드세요. 하나의 이미지, 두 캐릭터, 각각 세 뷰, 순수한 흰색 심리스 배경, 균일한 스튜디오 조명. 이렇게 하면 당신이 신경 쓰는 유일한 모호성, 즉 이 사람이 어떻게 생겼는지 외에는 모든 모호성이 제거됩니다.
plaintext1순수한 흰색 심리스 배경 위에 전신 캐릭터 턴어라운드 참조 시트, 두 캐릭터가 나란히, 총 6개의 인물, 균일한 중립 스튜디오 조명, 바닥에 그림자 없음, 텍스트 없음, 레이블 없음, 워터마크 없음. 2 3왼쪽 절반, 남성 주인공, 세 개의 뷰가 일렬로: 정면, 오른쪽 프로필, 후면. 20대 후반, 창백한 피부, 어두운 웨이브 미디엄 길이 머리, 날카로운 턱선. 바닥까지 오는 검은 벨벳 프록 코트, 라펠과 소맷부리에 미묘한 톤온톤 자수, 검은 브로케이드 조끼, 검은 실크 크라바트, 일자형 검은 바지, 광택 처리된 검은 가죽 더비 슈즈 착용. 팔은 옆구리에 자연스럽게 내리고, 중립 표정. 4 5오른쪽 절반, 여성 주인공, 세 개의 뷰가 일렬로: 정면, 오른쪽 프로필, 후면. 20대 초반, 공정한 피부, 긴 웨이브 밤나무색 머리, 하프 업 브레이디드 크라운. 크림색 빅토리아 시대 코튼 레이스 드레스, 레이스 커프스가 있는 긴 소매, 작은 단추가 달린 피티드 보디스, 발목까지 오는 풀 스커트, 크림색 발목 스트랩 로우힐 신발 착용. 팔은 옆구리에 자연스럽게 내리고, 중립 표정. 6 7사진 사실주의, 여섯 인물 간 일관된 스케일, 발이 동일한 기준선에 정렬, 가장자리까지 선명한 초점.
설정: 모델 OpenAI GPT Image 2 Text-to-Image, Quality high, Aspect ratio 16:9, 나머지는 기본값.
Atlas Cloud의 GPT Image 2 Text-to-Image, 실행 완료: 왼쪽의 턴어라운드 프롬프트, OUTPUT 패널의 흰색 시트 위 여섯 인물.
이것이 목표 형태입니다. 여섯 인물, 하나의 기준선, 배경에 논쟁할 것이 없음:
데모 클립을 구동한 참조 팩: 검은 벨벳의 남성 주인공, 크림색 빅토리아 레이스의 여성 주인공, 각각 세 뷰, 하나의 파일.
위 참조와 비교하기 위한 내 GPT Image 2의 1단계 프롬프트 실행 결과.
2단계: 6패널 장면 보드로 로케이션 고정
얼굴은 고정했습니다. 하지만 조명은 여전히 당신을 배신할 것입니다. 두 번째 참조 이미지는 6개의 카메라 위치, 달빛의 방향, 공기 중의 안개 양, 바닥의 젖은 정도를 고정합니다. 이 영화에는 정확히 하나의 조명 설정이 있다는 것을 모델에 알리는 것입니다.
plaintext16패널 시네마틱 로케이션 보드, 2행 3열, 패널 사이 얇은 검은 여백, 각 패널 하단에 작고 우아한 흰색 대문자 자간 조정된 타입으로 캡션. 주제: 밤의 버려진 고딕 성 내부. 차가운 푸른 달빛, 낮게 떠도는 안개, 젖고 반사되는 돌 바닥, 높은 스테인드글라스 창문, 작은 따뜻한 불꽃이 있는 철제 촛대, 깊고 채도 낮은 검은색, 무거운 벨벳 커튼. 모든 패널에 사람 없음. 2 3패널 1, 캡션 "WIDE ESTABLISHING VIEW - CORRIDOR": 불이 켜진 스테인드글라스 창문으로 이어지는 긴 기둥 복도. 4패널 2, 캡션 "LOW ANGLE - MOONLIGHT ACROSS FLOOR": 낮은 카메라, 젖은 돌판 위를 비스듬히 비추는 달빛. 5패널 3, 캡션 "DOORWAY & STAIRCASE COMPOSITION": 곡선형 돌 계단을 감싸는 아치형 출입구. 6패널 4, 캡션 "CLOSE DETAIL - CARVED DOOR": 철제 손잡이가 달린 무거운 조각 나무 문의 타이트 샷. 7패널 5, 캡션 "WINDOW-SIDE VIEW - FOG & CURTAINS": 높은 창문, 안개 밀려옴, 전경의 커튼 가장자리. 8패널 6, 캡션 "FINAL POSTER FRAME - EMPTY HALL": 대칭적인 빈 홀, 무늬가 있는 러너 깔개가 창문으로 이어짐. 9 10사진적, 시네마틱, 필름 그레인, 6개 패널 모두 일관된 컬러 그레이드.
설정: 동일 모델, Quality high, Aspect ratio 16:9.
데모 클립을 구동한 로케이션 보드: 여섯 개의 고딕 성 내부, 하나의 컬러 그레이드, 읽을 수 있는 캡션.
내 GPT Image 2의 2단계 보드 프롬프트 실행 결과.
3단계: MiniMax H3 참조-투-비디오로 샷 생성
두 개의 참조 이미지와 카메라 위치 및 오디오 방향을 담은 하나의 프롬프트. 사운드는 동일 패스에서 생성되므로 별도의 음성 또는 음악 단계가 없습니다. 튜닝 중에는 지속 시간을 짧게 유지하고, 실제 컷에서는 15초로 늘리세요.
plaintext1참조 이미지 1은 캐릭터 시트입니다: 왼쪽의 남자는 남성 주인공, 오른쪽의 여자는 여성 주인공입니다. 두 정체성을 정확히 표시된 대로 유지: 그의 턱선, 어두운 웨이브 머리, 검은 벨벳 프록 코트, 검은 브로케이드 조끼, 검은 실크 크라바트; 그녀의 밤나무색 하프 업 브레이디드 머리와 크림색 빅토리아 레이스 드레스. 참조 이미지 2는 로케이션 및 조명 보드입니다: 차가운 푸른 달빛, 떠도는 안개, 젖고 반사되는 돌 바닥, 채도 낮은 검은 톤을 일치시킵니다. 2 39:16 세로형, 프리미엄 실사 숏드라마 룩, 얕은 피사계 심도, 시네마틱 대비, 자막 없음, 화면 텍스트 없음, 워터마크 없음. 4 5샷 1: 미디엄 클로즈업, 카메라가 천천히 안으로 밀고 들어옵니다. 여성 주인공이 달빛이 비치는 복도에 서서 얕게 숨 쉬며, 시선은 프레임 오른쪽 밖의 무언가에 고정되어 있습니다. 안개가 무릎 높이로 그녀를 스쳐 지나갑니다. 6샷 2: 하드 컷. 그녀 뒤에서 어깨 너머로, 남성 주인공이 어두운 아치형 출입구에서 달빛 속으로 나오며, 코트가 빛을 받고, 표정은 차갑고 호기심 가득합니다. 7샷 3: 그의 얼굴 타이트 클로즈업, 창문에 의해 반쯤 비춰지고, 그녀가 시선을 돌리지 않는 모습의 매칭 클로즈업이 이어집니다. 8 9오디오: 낮은 지속 베이스 드론, 먼 돌 울림, 그녀의 불안정한 숨소리, 그가 빛 속으로 들어서는 한 번의 무거운 발소리, 마지막 컷에서 하나의 부드러운 현악기 스웰.
설정: 모델 MiniMax H3 Reference-to-Video, 해상도 2K, 지속 시간 8 (슬라이더 기본값; 실제 컷은 15로 밀어 올리기), 종횡비 adaptive, 두 파일 모두 참조 자료에. 패널은 이를 9개 중 2개로 계산하므로, 나중에 의상이나 소품 플레이트를 추가할 여유가 충분합니다.
종횡비에서 발생한 일을 언급할 가치가 있습니다. 종횡비를 adaptive로 두고 프롬프트 안에만 "9:16 vertical"이라고 썼습니다. H3는 어쨌든 세로로 나왔으므로, 양식 필드가 아니라 텍스트에서 프레이밍을 읽은 것입니다.
Atlas Cloud의 MiniMax H3 Reference-to-Video, 실행 완료: 두 참조 파일이 9개 중 2개로 로드됨, 해상도 2K, OUTPUT 패널에서 생성된 세로 클립 재생 중.
첫 프레임은 크림 레이스 보디스의 여성 주인공이 보드 패널 1의 복도에 서 있고, 무릎 높이의 안개와 보드가 정확히 놓은 위치의 젖은 바닥에 부딪히는 달빛이 있습니다. 두 참조 이미지 모두 작동했습니다.
4단계: 동일한 팩으로 Seedance 2.5 vs MiniMax H3 제어 실행
한 단어도 바꾸지 마십시오. 동일한 두 참조 이미지, 동일한 프롬프트, 다른 모델. 각 페이지의 자체 지속 시간 기본값을 강제로 일치시키기보다는 그대로 두었고, 각각이 반환한 내용을 아래에 말하겠습니다. 다른 모델을 위해 프롬프트를 "다시 작성"하는 것은 비교가 거짓말을 시작하는 정확한 방법입니다.
plaintext13단계와 동일한 프롬프트, 그대로. 다른 모델을 위해 다시 작성하지 마십시오.
설정: 모델 Seedance 2.0 Reference-to-Video, 해상도 720p, 참조 이미지에 동일한 두 참조 이미지 (다시 9개 중 2개, 최대 3개의 참조 비디오 및 3개의 참조 오디오 파일을 위한 별도 슬롯 있음). 지속 시간은 페이지 기본값으로 두었으며, 10초 클립으로 반환되었습니다.
Atlas Cloud의 Seedance 2.0 Reference-to-Video, 3단계의 동일한 참조 팩 및 프롬프트로 실행 완료, OUTPUT 패널에 10초 결과.
두 OUTPUT 패널이 실제로 보여준 것은 다음과 같으며, 승자를 고르기보다는 있는 그대로 보고합니다.
두 실행 모두 캐릭터를 유지했습니다. 동일한 크림 레이스 드레스, 동일한 네크라인과 소매 커프스, 동일한 밤나무색 머리, 보드에서 가져온 동일한 안개와 달빛 복도. 어느 쪽도 다른 여성을 발명하지 않았습니다. 참조 팩이 양쪽에서 그 작업을 수행했으며, 이것이 제가 가장 관심을 갖는 결과입니다.
차이점은 얼굴이 아닌 형식에 관한 것이었습니다. 이 Seedance 엔드포인트는 720p를 제공했습니다. H3는 동일한 입력에서 2K를 제공했습니다. 그리고 프레이밍이 갈라졌습니다: H3는 프롬프트 텍스트에서 "9:16 vertical"을 바로 읽고 세로로 반환한 반면, Seedance 실행은 16:9로 반환되었는데, 이는 해당 페이지가 자체 종횡비 제어를 가지고 있고 프롬프트 텍스트만으로는 그것을 재정의하지 않았기 때문입니다. TikTok용으로 컷팅한다면, 이 차이는 양식 필드를 처음 잊었을 때 한 번의 실행 비용을 초래할 것입니다. Seedance 2.5는 해상도 부분을 변경하고 영역 수준 재시도를 추가할 가능성이 높지만, 제가 그것을 측정한 척하지는 않겠습니다.
5단계: 전체 클립을 재시도하지 않고 하나의 샷 수정
숏 드라마의 실제 비용은 첫 번째 생성이 아닙니다. 일곱 번째 수정입니다. H3는 기존 클립을 입력으로 받아들이고 지시에 따라 편집하며, 언급하지 않은 것은 유지합니다. Seedance 2.5의 여기서의 강점은 더 세밀합니다: 프레임의 영역을 다시 그리고 성능, 조명, 카메라는 그대로 둡니다.
plaintext1제공된 클립 사용: 두 캐릭터, 그들의 의상, 카메라 움직임 및 컷팅 리듬을 정확히 그대로 유지합니다. 환경만 변경하십시오. 달빛이 비치는 돌 복도를 같은 성의 볼룸, 높은 아치형 창문, 불이 켜진 샹들리에, 따뜻한 촛불 조명으로 교체하고, 두 캐릭터의 키 라이트가 창문 대신 프레임 왼쪽의 샹들리에에서 오도록 다시 조명하십시오. 그녀의 유일한 대사 줄을 "당신은 한 번도 잠들지 않았군요."로 다시 작성하십시오. 그녀의 연기 타이밍을 같은 비트에 유지하십시오.
설정: MiniMax H3 Reference-to-Video, 3단계 클립을 참조 입력으로 사용, 지속 시간 5, 해상도 2K.
zAxBQmHOR5I
Seedance 2.5 vs MiniMax H3 테스트 너머: 참조 팩을 활용하는 네 가지 방법
동일 캐릭터, 다음 에피소드. 1단계 시트를 에셋으로 저장하고 프롬프트의 샷 목록과 스토리 블록만 변경하세요. 정체성은 파일에서 오며, 지난주에 어떻게 표현했는지에 대한 기억에서 오지 않습니다.
oH2bSNhK0mY
음성도 고정하세요. H3는 최대 3개의 오디오 참조(각 2~15초)를 받을 수 있으며, 이미지 또는 비디오 입력과 함께 제출되어야 합니다. 음성 샘플을 제공하면 캐릭터가 그 음색으로 말하므로, 에피소드 사이에 성우를 다시 캐스팅할 필요가 없습니다.
plQ9q6xxoVE
렌더링 비용을 지불하기 전에 카메라를 블로킹하세요. Seedance 2.5의 참조-투-비디오는 3D 화이트 모델 블록아웃과 그린스크린 플레이트를 받아들이므로, 회색 지오메트리로 프레이밍을 고정한 후에야 완성된 룩에 투입할 수 있습니다. 이 예제는 Seedance 2.1(패밀리의 이전 멤버)에서 실행되었지만, 워크플로의 형태는 동일합니다.
6RKQROBa9a0
마스터 컷 하나를 재촬영하지 않고 현지화하세요. 영역 수준 교체는 카메라, 타이밍 및 립 지속 시간은 그대로 유지하면서 얼굴, 제품 또는 음성 언어를 교체합니다. 여기서 하나의 마스터 뷰티 컷이 스페인어, 한국어 및 힌디어로 재캐스팅되고 재음성화되며, 방, 프레이밍 및 립 지속 시간은 고정됩니다.
IcR9nWHqLnU
그리고 누군가가 당신이 분별력을 잃었을 때 모션 전송이 어떻게 보이는지 물을 것이기 때문에: 세 명의 정장 차림의 남성이 세 마리의 사실적인 카피바라로 교체되어, 원본 클립의 모션 경로를 비트 단위로 따라가다가 피라미드로 쌓입니다.
pzG58od4W1c
또한 이 모든 것의 평범한 버전, 아무도 게시하지 않는 버전이 있습니다: 정적 포스터가 움직이는 포스터가 되고 레이아웃이 유지됩니다.
정적 소스 포스터. "프레임, 팔레트 및 레이아웃을 유지하고, 타입을 애니메이션화하십시오"와 함께 참조-투-비디오에 제공하면 동일한 디자인의 움직이는 버전을 얻을 수 있습니다.
Seedance 2.5 vs MiniMax H3 숏 필름의 실제 비용
여기에는 숫자가 없습니다. 숫자는 움직이고 구조는 그렇지 않기 때문입니다. 두 패밀리 모두 초당 청구, 사용한 만큼 지불, 좌석이나 구독 없음. 이는 세 가지 변수를 남깁니다: 초, 해상도 계층, 재시도 횟수.
세 번째가 전체 청구서입니다. 첫 번째 시도에 성공하는 15초 클립은 한 번 청구됩니다. 일곱 번째 시도의 동일한 클립은 일곱 번 청구됩니다. 따라서 비용 절감 방법은 초당 더 저렴한 모델을 선택하는 것이 아니라, 아무것도 생성하기 전에 참조 팩을 올바르게 만드는 것입니다. 1단계와 2단계의 두 이미지 호출은 전체 파이프라인에서 가장 저렴한 라인이며, 동시에 얼마나 많은 비디오 호출을 할지 결정합니다. 전체 체인에서 투자 대비 수익이 가장 높은 부분입니다.
그런 다음 초당 본능을 수정하십시오. 동일한 참조 팩, 동일한 런타임: H3의 참조-투-비디오는 1440p를 반환하고, 이 Seedance 참조-투-비디오 엔드포인트는 720p를 반환합니다. 초당은 잘못된 단위입니다. 프레임당 픽셀, 그리고 이후 별도의 업스케일 패스 비용을 지불해야 하는지 여부가 올바른 단위입니다.
오디오도 산술에 포함되어야 합니다. 양쪽 모두 동일한 패스에서 네이티브 동기화 사운드를 생성합니다. 현재 파이프라인이 비디오 모델 + TTS + 트랙을 정렬하는 편집자라면, 절약하는 것은 두 번의 API 호출과 한 사람의 오후이며, 그 절약은 어느 가격표에도 나타나지 않습니다.
어떤 작업에 어느 것을 선택할까:
| 작업 | 선택 | 이유 | 주의사항 |
|---|---|---|---|
| 세로형 숏 드라마, 9:16, TikTok 또는 ReelShort | MiniMax H3 | 네이티브 스테레오로 1440p 세로, 지금 호출 가능, 15초면 완전한 훅 | 15초에서 컷팅하므로, 비트에 맞게 계획 |
| 30초 연속 브랜드 필름 하나 | Seedance 2.5 | 단일 생성, 스티칭 없음, 네이티브 4K | 먼저 플랫폼에서 가용성 확인 |
| 승인된 컷 내에서 하나의 샷 수정 | Seedance 2.5 | 영역 수준 다시 그리기로 나머지는 그대로 둠 | H3 전체 클립 편집이 오늘날 대부분의 경우 충분함 |
| 제품 및 전자상거래 컷다운 | 둘 중 하나 | 둘 다 화면 텍스트와 브랜드 마크를 잘 유지 | 출시하는 해상도에서 텍스트 확인 |
| 게임 또는 인터페이스 데모 | MiniMax H3 | 2K에서 UI 및 타이포그래피 안정성이 강함 | 단일 패스에 15초 제한 |
| 하나의 마스터의 다국어 버전 | Seedance 2.5 | 영역 교체 + 다국어 음성 | 현지화 품질은 여전히 원어민 확인 필요 |
| 오늘 밤 출시 | MiniMax H3 | 3개 엔드포인트 라이브, Seedance 2.0 전체도 포함 | Seedance 2.5 접근은 플랫폼에 따라 다름 |
출시 전에. MiniMax는 H3의 가중치가 출시 후 며칠 내로 공개될 것이라고 밝혔지만, 오픈 가중치가 상업용 라이선스와 동일한 것은 아니므로, 자체 호스팅 전에 이용 약관을 읽으십시오. 워터마크 및 상업적 사용 정책도 소비자 앱과 API 액세스 간에 양쪽에서 다르며, 이 글을 쓰는 동안 기본 약관 페이지에서 어느 쪽도 확인할 수 없었으므로, 제 말을 그대로 받아들이기보다는 제공자의 약관을 확인하십시오. 그리고 어떤 모델 라이선스도 초상권이나 상표권을 포함하지 않습니다. 실제 인물, 실제 브랜드 또는 타인의 IP가 참조 팩에 있다면, 이는 별도의 법적 문제이며 모델의 약관이 답해주지 않을 것입니다.
위 표의 모든 모델은 동일한 키로 실행되며, 모델 페이지에는 현재 요금과 복사-붙여넣기 코드는 물론, 이번 주 Seedance 라인에서 진행 중인 프로모션이 무엇이든 포함되어 있습니다.
자주 묻는 질문
캐릭터 일관성을 위해 Seedance 2.5가 MiniMax H3보다 더 나은가요?
이론상으로는 그래야 합니다. H3의 12개 파일 대비 최대 50개의 멀티모달 참조와 영역 수준 재시도를 제공하기 때문입니다. 하지만 2026년 7월 31일 현재, 제가 지적할 수 있는 페어링된 공개 테스트는 없으며, Seedance 2.5는 아직 아레나 평가가 없습니다. 제가 실제로 실행할 수 있었던 실행에서, 정체성 안정성을 결정한 변수는 모델 생성이 아니라 참조 팩 구조였습니다: 하나의 합성 턴어라운드 시트와 하나의 조명 보드로 양쪽 모두 캐릭터를 유지했습니다. 모델을 쇼핑하는 데 시간을 쓰기 전에 팩을 올바르게 만드십시오.
지금 Seedance 2.5를 사용할 수 있나요, 아니면 기다려야 하나요?
API는 ByteDance에서 라이브입니다. 타사 모델 플랫폼에서의 가용성은 고르지 않으며, 제가 테스트한 곳에서는 여전히 Day-0 공지입니다. 오늘 밤 결과물이 필요하다면, 호출 가능한 옵션은 MiniMax H3의 세 엔드포인트와 전체 출하 중인 Seedance 2.0 라인입니다.
MiniMax H3가 정말 30초 비디오를 생성하나요?
아니요. 사양은 24fps에서 생성당 5~15초입니다. 그 이상은 확장 또는 스티칭으로, 드리프트 위험이 다른 별개의 것입니다. 30초 단일 생성은 Seedance 2.5에 속합니다. 두 주장을 혼동하지 마십시오.
두 모델 모두 오디오를 생성하나요, 그리고 에피소드 전반에 걸쳐 하나의 음성을 유지할 수 있나요?
둘 다 동일 패스에서 네이티브 동기화 오디오를 생성하며, H3는 모든 결과에 스테레오를 출력합니다. 지속적인 음성의 경우, H3는 각각 2~15초의 최대 3개 오디오 참조를 받아들이며, 이는 자체적으로가 아니라 이미지 또는 비디오 입력과 함께 제출되어야 합니다.
실제로 몇 개의 참조 이미지를 보내야 하나요?
생각보다 적게, 생각보다 잘 구조화해서 보내십시오. 하나의 잘 구성된 합성이 일반적으로 6개의 느슨한 크롭보다 더 낫습니다. 별도의 파일은 모델이 존재하지 않는 사람으로 평균 내도록 초대하기 때문입니다. 정체성과 조명이라는 두 가지 명확한 작업을 주고, 서로 싸우는 스타일 샘플을 포함하지 마십시오.
TikTok 또는 ReelShort 스타일의 세로형 숏 드라마에는 어떤 모델을 사용해야 하나요?
이번 주에 출하되는, 9:16, 고해상도, 사운드가 이미 믹스된 상태: MiniMax H3. 30초 연속 장면을 계획 중이고 전체 클립이 아닌 단일 영역을 재시도할 것으로 예상된다면: Seedance 2.5용으로 구축하고 플랫폼이 열리는 시기를 확인하십시오.






