단 2주 한정 | Seedream 5.0 Pro 20% 할인!

MiniMax H3 프롬프트 가이드: 공식 프롬프트 45개를 모두 읽은 다음, This Is Fine Dog에 불을 지폈다

MiniMax H3 프롬프트 가이드 - MiniMax의 45개 예시 프롬프트에서 추출한 6블록 구조, end_image 트릭, 네이티브 오디오 큐, 깨진 텍스트 수정 방법

당신은 이미 비디오 모델을 프롬프트하는 방법을 알고 있습니다. "영화 같은 조명, 느린 푸시 인, 4K." 그 어휘는 2년 동안 당신을 버텨왔습니다.

그런 다음 그것을 MiniMax H3에 붙여넣으면 자체 사운드트랙이 함께 제공되는 2K 클립이 나옵니다. 화면은 멋져 보입니다. 템포는 엉망입니다. 제목의 두 글자가 철자가 틀렸습니다. 오디오는 모델이 당신을 위해 선택한 방의 분위기입니다.

모델이 문제가 아닙니다. 당신은 문장 하나를 건넸습니다. 모델은 일정을 원했습니다.

그래서 저는 MiniMax가 H3와 함께 제공한 45개의 공식 프롬프트 예제를 모두 읽고, 함께 제공된 완성된 클립을 보고 프레임을 분석했습니다. 공식 프롬프트는 설명이 아닙니다. 좋은 프롬프트는 뒤에 음악 큐 시트가 붙은 샷 목록입니다. 아래는 구조, 현재 실제로 노출된 매개변수, 그리고 약 20분 안에 재현할 수 있는 데모 하나입니다.

핵심 요점

  • H3 프롬프트는 설명이 아닌 타임라인입니다. 가장 강력한 공식 예제는 문자 그대로 [0s-2s], [2s-4s] 마커로 클립을 나누며, 완성된 영화는 모든 비트를 정확히 맞춥니다.
  • 사운드와 화면은 동일한 패스에서 나오므로 오디오는 프롬프트 본문 안에 있어야 합니다. 공식 프롬프트는 "재즈 베이스 그루브가 6초에 들어옴"까지 자체 블록을 제공합니다.
  • 철자를 써 준 텍스트는 깨끗하게 돌아옵니다. 철자를 써 주지 않은 텍스트는 글자 모양의 노이즈로 돌아옵니다. 단일 공식 클립에서 두 가지를 모두 증명하는 프레임 크롭이 있습니다.
  • image-to-video는 end_image 를 허용합니다. 첫 번째 프레임과 마지막 프레임을 제공하면 계산 시간을 1초도 소모하기 전에 감정적 호가 고정됩니다.
  • 프롬프트 길이는 미덕이 아닙니다. 참조 이미지가 설명을 수행할 때는 짧은 공식 프롬프트가 잘 작동합니다. 길이는 얼마나 많은 작업을 참조에 맡기지 않았는지를 나타냅니다.

This Is Fine 개, 왼쪽에 그대로 있고 10초 만에 MiniMax H3 출력 오른쪽에서 불타고 있습니다.

양쪽 모두 같은 그림입니다. 왼쪽은 KC Green의 원본 패널, 손대지 않았습니다. 오른쪽은 하나의 image-to-video 호출 결과입니다: 첫 번째 프레임 입력, 마지막 프레임 입력, 10초 출력, 그리고 불길이 타오르는 소리와 평평한 "this is fine"은 모델 자체의 오디오 트랙입니다. 아무도 점수를 매기지 않았습니다. 이 가이드의 모든 내용은 당신을 그 두 번째 절반으로 이끄는 것을 목표로 합니다.

MiniMax H3 프롬프트가 실제로 어떻게 생겼는지 (45개 모두 읽었습니다)

현재 검색 결과 첫 페이지에 있는 모든 "MiniMax H3 프롬프트 가이드"는 사양 시트입니다: 2K, 24fps, 5~15초, 네이티브 오디오. 그것은 모델 카드일 뿐입니다. 프롬프트가 아닙니다.

다음은 실제 예입니다. MiniMax의 느와르 타이틀 시퀀스 뒤에 있는 공식 프롬프트의 일부로, 중국어 원본을 번역했으며, 전체 길이의 약 1/3 정도입니다:

15초 16:9 라이트 서스펜스 범죄 영화 타이틀 시퀀스를 생성합니다. 전반적인 스타일은 다음 이미지의 시각적 언어를 참조합니다: 복고풍 일본 애니메이션 타이틀 카드, 날카로운 실루엣, 만화 콜라주, 비대칭 분할 화면, 강한 기하학적 색상 블록, 영어 크레딧 타이틀, 약간의 일본어 가타카나 장식, 재즈-범죄 느낌. 분위기는 60% 서스펜스, 40% 재즈: 신비롭고, 쿨하고, 민첩하고, 도시 범죄, 공포가 아니고, 무겁지 않으며, 쾌활한 재즈 MV로 만들지 마십시오.

[...] 영어 크레딧은 명확하게 읽을 수 있어야 합니다 [...] 중국어를 추가하지 말고, 깨진 텍스트를 생성하지 말고, 영어 철자를 틀리지 마십시오. 전체 작품에 대한 규칙: 모든 영어 크레딧과 직함은 정확히 한 번만 나타납니다. 직함을 반복하지 말고, 이름을 반복하지 말고, 한 사람에게 여러 직함을 부여하지 마십시오.

전환은 다양해야 합니다: 원형 비닐 레코드 마스크, 수직 자동차 도어 와이프, 화면을 가로지르는 긴 그림자, 빨간색 선 컷, 거대한 영어 문자 마스크, 분할 화면 프레임 재구성, 하드 컬러 블록 컷, 패널을 블록별로 붙여넣기. 모든 전환은 드럼 비트에 맞춰 떨어집니다: 선명하고, 서스펜스 있고, 민첩하고, 만화 콜라주 스타일. 부드러운 디졸브나 유동적인 전환은 없습니다.

BGM: 오리지널 15초 타이틀 음악, 60% 서스펜스, 40% 재즈. 지속되는 베이스 톤, 긴장된 피치카토 현, 차가운 신스 펄스, 킥 드럼, 드문 재즈 브러시, 워킹 베이스 조각, 짧은 바리톤 색소폰 프레이즈와 짧은 브라스 스탑으로 구성됩니다. 처음 2초는 저음과 하이햇으로 서스펜스를 설정하고, 3초에 저음 드럼이 들어오고, 6초에 재즈 베이스 그루브가 합류하고, 10초에 짧은 색소폰/브라스 리프가 나타나며, 마지막 2초는 긴장된 코드와 드럼 비트로 고정합니다.

단어가 어디에 쓰였는지 읽어보십시오. 거의 대부분이 "아름다운"이나 "영화 같은"에 사용되지 않았습니다. 부정 목록, 전환 목록, 초 단위 음악 큐 시트에 사용되었습니다. 그것이 작업의 형태입니다. 지하철 열차에 실루엣 캐릭터가 있는 느와르 애니메이션 배너 MiniMax H3 공식 느와르 타이틀 시퀀스: MIDNIGHT LINE, 깨끗한 STARRING 크레딧

해당 클립의 크레딧을 보십시오. MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS. 철자가 정확하고, 직함이 두 번 사용되지 않았으며, 가타카나 장식이 요청된 위치에 정확히 있습니다. 프롬프트는 "멋진 타이틀을 만들어라"고 말하지 않았습니다. 반복 금지, 철자 오류 금지, 중국어 금지를 말하고, 미학을 다섯 가지 다른 방식으로 명명했습니다. 파란색과 주황색의 실루엣 캐릭터가 있는 다섯 개의 영화 느와르 패널 느와르 타이틀 프롬프트와 함께 MiniMax H3에 제공된 5개의 스타일 참조 보드

그 다섯 개의 보드가 텍스트와 함께 들어갔습니다. 다섯 개의 이미지와 하나의 긴 브리핑, 하나의 생성. 이것이 지금 이 작업의 모습입니다.

그리고 45개의 프롬프트 중 많은 수가 짧은 이유는 바로 그 그림에 있습니다. 전체 세트에서 중간 프롬프트는 약 130자의 중국어 문자이지만, 가장 긴 두 개는 657자와 858자입니다. 짧은 프롬프트가 짧은 이유는 참조 보드가 설명을 대신하고 있기 때문입니다. 긴 프롬프트가 긴 이유는 다른 것이 그 설명을 대신할 수 없었기 때문입니다.

대부분의 MiniMax H3 프롬프트가 평범하게 나오는 이유와 깨진 텍스트 수정 방법

세 가지가 잘못되며, 모두 실수라기보다는 누락입니다.

타임라인이 없습니다. 10초를 요청했지만 한 순간만 설명했으므로, 하나의 느린 푸시 인이 10초에 걸쳐 늘어집니다. 모델은 7초에 할 일이 없었습니다.

오디오 블록이 없습니다. 사운드는 화면과 동일한 패스에서 생성됩니다. 아무 말도 하지 않으면 모델은 여전히 트랙을 제공합니다. 그냥 하나를 선택할 뿐입니다.

부정 목록이 없습니다. 내버려두면 모델은 부드러운 디졸브를 사용하고, 추가 화면 텍스트를 발명하며, 아무도 요청하지 않은 자막 스트립을 추가합니다.

가장 명확한 증거는 공식 게임 UI 프롬프트로, 6개의 타임스탬프 비트로 구성되어 있습니다: [0s-2s] 메뉴, [2s-4s] 오른팔 패널, [4s-7s] 무장 그리드, [7s-8.5s] 확인, [8.5s-10s] 로딩 바, [10s-15s] 세계 로드. 완성된 클립은 순서대로, 제시간에 6개 모두를 맞춥니다. 로봇 Phantom Grip 암 선택을 보여주는 게임 메뉴 MiniMax H3 게임 UI 클립: 메뉴, 장비 패널, 로딩 바, 세계 로드

이제 같은 클립의 정직한 절반, 전체 2560x1440 해상도입니다. 읽기 쉬운 게임 UI 텍스트와 깨진 AI 텍스트 비교 왼쪽: 프롬프트에 철자가 명시된 텍스트가 깨끗하게 렌더링됩니다. 오른쪽: 철자가 명시되지 않은 텍스트가 글자 모양의 노이즈로 렌더링됩니다.

왼쪽에는 프롬프트가 실제로 입력한 모든 문자열이 있습니다: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW. 선명하고, 정확하며, 실제 게임 메뉴처럼 커닝 처리되었습니다.

오른쪽에는 프롬프트가 "HUD 요소"라고만 부른 최종 거리 샷의 HUD가 있습니다. ETR METNO CITFEP로 읽힙니다. 장비 아이콘 위에는 프롬프트가 아무 말도 하지 않은 부분에 MNALEαIN IAMG가 나타납니다. 이것은 렌더링 버그가 아닙니다. 모델은 문자열이 주어지지 않았기 때문에 영어의 _텍스처_를 그리고 있는 것입니다.

따라서 수정 방법은 설정이 아니라 습관입니다:

읽을 수 있어야 하는 단어가 있다면, 단어를 입력하십시오. 그런 다음 부정 줄을 추가하십시오: 철자를 틀리지 말고, 다른 텍스트를 추가하지 말고, 자막을 추가하지 마십시오.

그리고 강력한 공식 프롬프트가 공유하는 6블록 형태는 다음과 같습니다.

블록내용공식 프롬프트 예시건너뛰면 얻는 결과
1. 스타일 계약매체, 질감, 팔레트, 시대, 잃어서는 안 될 외관"복고풍 일본 애니메이션 타이틀 카드, 날카로운 실루엣, 만화 콜라주, 강한 기하학적 색상 블록"6초가 지나면 표류하는 평범한 광택 렌더링
2. 타임라인각각에 작업이 포함된 문자 그대로의 시간 조각[2s-4s] 그녀의 오른팔로 부드럽게 줌. UI 패널이 오른쪽에서 슬라이드 인전체 지속 시간에 걸쳐 늘어진 하나의 아이디어
3. 카메라움직임, 또는 움직임에 대한 명시적 거부"고정, 정적 와이드 샷, 푸시 인 없음, 컷 없음"요청하지 않은 기본 느린 돌리
4. 오디오모든 소리와 그 소리가 들어오는 시점"6초에 재즈 베이스 그루브가 합류, 마지막 2초는 긴장된 코드로 고정"모델이 오늘 좋아하는 방 분위기
5. 텍스트, 철자 명시문자 그대로의 문자열, 따옴표 안에"THIS IS FINE." / CONFIRM CONFIG위와 같은 글자 모양의 노이즈
6. 부정 목록거부할 전환, 객체 및 클리셰"부드러운 디졸브 없음, 유동적인 전환 없음, 중국어 추가 금지, 직함 반복 금지"부드러운 디졸브, 발명된 텍스트, 불가사의한 표류

블록 5와 6은 공짜입니다. 생성하는 데 추가 비용이 들지 않으며, 품질의 대부분이 여기에 있습니다.

MiniMax H3 프롬프트 워크플로: 프롬프트가 속한 엔드포인트

동일한 키, 동일한 제출-폴링 형태, 세 개의 문. 어느 것을 선택하느냐에 따라 프롬프트가 여전히 해야 할 일이 결정됩니다.

엔드포인트제공하는 것고정하는 것알아둘 만한 매개변수사용 시기청구 방식
minimax/h3/text-to-video프롬프트만없음. 텍스트가 모든 것을 전달duration 5-10 (기본 8), resolution 2K, ratio는 명시적으로 설정해야 함커밋하기 전에 룩이나 사운드 디자인 테스트출력 초당 청구, 현재 요금은 모델 페이지 참조
minimax/h3/image-to-video프롬프트 + 이미지 (첫 번째 프레임), 선택적 end_image클립이 시작하는 위치, 그리고 선택적으로 끝나는 위치end_image, duration 5-10 (기본 8), ratio 기본적으로 적응형아트워크가 있고 다시 그리지 않고 움직이길 원할 때출력 초당 청구
minimax/h3/reference-to-video프롬프트 + refers[]당신이 만든 장면 전체에 걸친 주체 정체성과 스타일refers[] 혼합 배열, duration 5-15, ratio 최대 21:9같은 캐릭터나 제품, 새로운 환경출력 초당 청구

refers[]는 실제로 잘 문서화되지 않은 것이므로, 여기에 원하는 형태가 있습니다:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

각각 생성 낭비를 막아줄 네 가지 규칙:

  1. 오디오는 단독으로 올 수 없습니다. 배열에 적어도 하나의 이미지나 비디오가 있어야 합니다. 비트 트랙만으로는 거부됩니다.
  2. type은 선택 사항입니다. URL에서 유추되지만, 확장자가 모호할 때는 명시하십시오.
  3. 한도는 실제입니다. 최대 9개 이미지, 3개 비디오, 3개 오디오 클립, 총 12개 파일, 참조 비디오 및 오디오는 각각 2~15초입니다 (MiniMax API 문서, 2026년 7월).
  4. 프롬프트 텍스트 내에서 각 참조에 역할을 부여하십시오. 이것은 이 목록에서 가장 효율이 높은 습관입니다. 공식 프롬프트는 "이미지 1은 전체적인 분위기와 스타일 참조, 이미지 2는 주인공 참조"와 같은 줄로 시작합니다. 그 문장이 없으면 모델은 어떤 보드가 무엇을 의미하는지 추측해야 합니다. 미소 짓는 여성 위에 큰 검은 텍스트 BASS HITS MiniMax H3 다크-팝 뮤직 비디오: CUT BACK, ONE LOOK, DETONATE 타이포그래피 대담한 타이포그래피 포스터 옆에 있는 그런지 패션의 세 여성 다크-팝 클립 뒤에 있는 두 개의 타이포그래피 참조 보드

그 클립은 규칙 4의 주장입니다. 프롬프트는 단일 문자 형태를 결코 설명하지 않습니다. "텍스트 패키징 스타일과 질감은 이미지를 참조"라고 말하고 두 개의 보드를 제공합니다. 레이아웃은 설명이 아니라 보여주었기 때문에 도착했습니다.

모델 카드와 API가 현재 동일한 내용을 말하지 않고 있으며, 그 차이가 사람들이 오후를 낭비하는 곳이기 때문에 표를 하나 더 추가합니다.

항목MiniMax 자체 문서엔드포인트가 실제로 현재 허용하는 것프롬프트에 미치는 의미
지속 시간4~15초, 정수만text-to-video 및 image-to-video: 510, 기본 8. reference-to-video: 515, 기본 815초 샷 목록은 지금은 reference-to-video에만 맞습니다. 더 긴 보드를 10으로 다시 작성하십시오
해상도2Kresolution 기본값은 2K이며, 현재 실행되는 유일한 값입니다. 768p 작업은 MiniMax-H3가 해상도 768P를 지원하지 않는다는 메시지와 함께 반환되며, 지원되는 해상도는 2K입니다. 가격표에 768p가 나타나지만1440px 짧은 쪽을 위해 작성하십시오. 요청한 세부 사항이 실제로 살아남을 것입니다
종횡비일반적인 비율 또는 적응형image-to-video 및 reference-to-video는 기본적으로 적응형입니다. 텍스트 전용은 적응형을 거부하고 허용된 세트를 반환합니다: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9text-to-video에서 ratio를 명시적으로 설정하지 않으면 작업이 유효성 검사에 실패합니다
혼합 참조9개 이미지, 3개 비디오, 3개 오디오, 12개 파일, 오디오 단독 불가refers[]는 image, video 또는 audio 유형의 {url, type}을 사용하며, 적어도 하나의 이미지 또는 비디오가 필요합니다공급된 비트에 모션을 실제로 동기화할 수 있습니다. 단지 비트만 제공할 수는 없습니다
네이티브 오디오동일 패스의 스테레오 오디오제가 조사한 9개의 공식 클립 모두: 2560x1440, 24fps, AAC 스테레오 at 32kHz오디오 블록은 장식이 아닙니다. 결과물의 절반입니다

위의 모든 것은 Atlas Cloud에서 실행되었으며, 여기서 세 H3 엔드포인트 모두 하나의 키와 하나의 제출-폴링 루프 뒤에 있으므로 전환은 모델 문자열 변경 그 이상도 이하도 아닙니다.

MiniMax H3 프롬프트 튜토리얼: This Is Fine 개를 소리와 함께 불태우기

전체 과정을 처음부터 끝까지 보여드립니다. 농담은 개가 아무것도 하지 않기 때문에 작동합니다. 그 거부를 10초의 실제 시간으로 늘리고, 실제 불을 추가하고, 마지막 2초가 원래 만화가 실제로 갔던 곳으로 가게 하면, 더 재미있어지고 당신에게는 약간 더 나빠집니다. 대부분의 사람들은 처음 두 패널만 본 적이 있습니다.

1단계: 원본 만화를 다운로드하십시오. AI가 다시 그리게 하지 마십시오.

스트립은 6개 패널, 2열 3행, 600x887입니다. 패널 2와 패널 6만 원합니다.

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 panels, 2 cols x 3 rows
3
4# crop panel 2 (the "THIS IS FINE." panel):  x 302-584, y 20-293
5# crop panel 6 (the melting dog):            x 302-584, y 595-868
6# upscale each 4x with Lanczos  ->  1128x1092
7

분명히 말합니다: 이미지 모델에게 "This Is Fine처럼 보이는 개"를 그리라고 요청하지 마십시오. AI 재현은 0.5초 만에 가짜로 간주되고 농담은 즉시 죽습니다. 수채화 워시, 흔들리는 손글씨, 종이 질감이 전체 계약입니다. 4x Lanczos 업스케일은 282px의 소스가 얇기 때문에 존재합니다. 모델이 발명하지 않고 붙잡을 실제 픽셀을 제공합니다. 불 속에서 녹는 This is Fine 개의 두 패널 원본 만화의 패널 2와 패널 6, 첫 번째 프레임 및 종료 이미지 입력으로 표시됨

2단계: end_image와 함께 image-to-video에서 실행하십시오.

모델: minimax/h3/image-to-video. 설정: resolution 2K, image = 패널 2, end_image = 패널 6, ratio 1:1 (정사각형에 가까운 소스에 맞춤). duration을 10으로 설정하십시오. 슬라이더는 기본적으로 8에 있으므로 드래그하십시오.

text
1손으로 그린 2D 웹코믹 패널, 생생하게 구현합니다. 모든 프레임에서 원본 수채화
2질감, 보이는 잉크 윤곽선, 오프-레지스터 종이 질감 및 평면 만화 팔레트를
3유지하십시오. 부드럽게 하지 말고, 3D로 다시 렌더링하지 말고, 선 작업을
4정리하지 말고, 새 객체를 추가하지 말고, 새 텍스트를 추가하지 마십시오.
5
6[0s-3s] 거의 아무것도 움직이지 않습니다. 개는 완전히 가만히 앉아 머그잔을
7들고 눈은 정면을 응시합니다. 그 뒤의 불꽃만 움직입니다: 느린 주황색 혀가
8벽을 타고 올라가고, 하나의 불씨가 떠오릅니다. "THIS IS FINE."이라고 적힌
9말풍선은 정확히 그 자리에, 완전히 읽을 수 있고, 변경되지 않았으며, 손글씨로
10남아 있습니다.
11
12[3s-6s] 개가 머그잔을 들어 한 모금 작고 조용히 마십니다. 말풍선은 한 모금
13후에 사라집니다. 불이 밝아집니다. 그 뒤의 벽이 열기로 뒤틀리기 시작합니다.
14그의 모자 챙이 그을리기 시작합니다.
15
16[6s-8.5s] 열기가 그에게 닿습니다. 그의 귀가 축 처지고, 윤곽선이 부드러워지며
17젖은 페인트처럼 아래로 흐르기 시작합니다. 그는 여전히 눈을 움직이지 않습니다.
18머그잔은 그의 발에 남아 있습니다.
19
20[8.5s-10s] 완전히 녹습니다. 얼굴이 일그러지고, 한쪽 눈이 미끄러지며, 이빨이
21고정된 싱글벙글 웃음에 드러나고, 털이 빨갛고 주황색으로 흐릅니다. 그는 포즈를
22유지합니다. 마지막 0.5초 동안 최종 프레임을 유지합니다.
23
24카메라: 고정, 단일 정적 와이드 샷, 푸시 인 없음, 핸드헬드 없음, 컷 없음.
25프레임은 절대 움직이지 않습니다. 이것은 하나의 만화 패널 안에서의 단일 연속
26테이크입니다.
27
28오디오: 전체적으로 실내 화재의 방 분위기 - 낮은 타닥거림, 나무 타는 듯한
29이따금 펑 하는 소리, 희미한 구조적 삐걱거림. 3초에, 세라믹 머그잔이 이에
30닿고 작은 삼키는 소리. 차분하고, 평평하며, 무관심한 남성 목소리가 정확히
31말합니다: "This is fine." - 무표정, 감정 없음, 약간 너무 편안함. 6초부터
32타닥거림이 더 커지고 방 분위기가 두꺼워집니다. 마지막 2초는 낮은 서브베이스
33스웰을 추가합니다. 음악 없음, 웃음 트랙 없음, 이 목록에 없는 음향 효과 없음.
34
35자막을 추가하지 마십시오. 워터마크를 추가하지 마십시오. 이미지에 이미 있는
36단어 외에 다른 단어를 철자하지 마십시오. "THIS IS FINE."을 변경하지 마십시오.
37컷 어웨이하지 마십시오.
38

그 프롬프트는 살아있는 구조 테이블입니다. 첫 번째 단락은 스타일 계약입니다. 네 개의 대괄호로 묶인 조각은 타임라인입니다. 그 다음 카메라, 오디오, 부정 목록입니다. 그 안에 장식적인 것은 없습니다. This is fine 밈을 보여주는 AI 비디오 생성기 스크린샷 Atlas Cloud의 MiniMax H3 image-to-video: 첫 번째 프레임과 종료 이미지 로드됨, 2K에서 10초, 출력 패널의 완성된 클립

3단계: QA 패스처럼 출력을 읽으십시오.

네 가지 점검, 각각 프롬프트의 다른 블록을 테스트합니다.

  1. 말풍선 안의 THIS IS FINE.이 여전히 읽을 수 있고 철자가 맞습니까? 블록 5를 테스트합니다.
  2. 선 작업이 살아남았습니까, 아니면 무언가가 깨끗한 3D로 "개선"했습니까? 블록 1을 테스트합니다.
  3. 오디오에 나열된 소리만 포함되어 있습니까? 컨테이너를 조사하십시오: h264와 AAC 스테레오로 돌아와야 합니다.
  4. 최종 프레임이 패널 6의 포즈에 도달합니까? end_image를 테스트합니다.
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

제 것은 1472x1440, 24fps, h264 + AAC 스테레오, 10.13초로 나왔습니다. 주목할 점: ratio: 1:1을 요청했지만 1472x1440을 얻었으므로, image-to-video에서는 소스 프레임의 모양이 이깁니다. 원하는 모양에 두 패널을 일치시키십시오. 만화 개가 this is fine이라고 말한 다음 불 속에서 녹습니다 완성된 클립의 0초, 3초, 6.5초, 10초에서의 네 프레임, 프롬프트의 네 시간 조각과 일치

4단계: reference-to-video로 개를 새로운 곳으로 옮기십시오.

같은 캐릭터, 새로운 방. 모델: minimax/h3/reference-to-video. 설정: refers[] = 패널 2를 image로, duration 8, resolution 2K, ratio 16:9.

text
1이미지 1은 캐릭터 및 아트 스타일 참조입니다: 이 정확한 손으로 그린
22D 웹코믹 룩, 동일한 수채화 질감, 동일한 잉크 윤곽선 두께, 동일한 개,
3동일한 작은 모자, 동일한 머그잔을 유지하십시오. 그를 3D로 다시 그리지 말고,
4비율을 변경하지 말고, 선 작업을 정리하지 마십시오.
5
6그를 다른 방에 두고 그의 침착함을 유지하십시오. 밤에 좁은 오픈 플랜 사무실,
7형광등이 깜박이고, 모두 빨간색 오류 상태를 표시하는 모니터 벽, 프레임을 통해
8떠내려가는 프린터 용지, 구석의 작은 전기 화재. 그는 프레임 중앙의 사무실
9의자에 앉아, 발에 머그잔을 들고, 카메라를 똑바로 바라보며, 완전히 편안합니다.
10
11카메라: 고정, 정적 와이드 샷. 푸시 인 없음, 컷 없음.
12
13오디오: 형광등 윙윙거림, 프린터 갈리는 소리, 2초마다 반복되는 부드러운
14알람 짹짹 소리, 먼 전기 타닥거림, 4초에 한 번의 차분한 한 모금. 음악 없음.
15음성 없음.
16
17화면 텍스트를 추가하지 마십시오. 자막을 추가하지 마십시오. 다른 캐릭터를
18추가하지 마십시오.
19

전이 가능한 규칙: refers[]는 정체성과 스타일을 전달하고, 텍스트는 장면을 전달합니다. 그 분할이 캐릭터 일관성의 전체 비결이며, 프롬프트의 첫 번째 줄이 존재하는 이유입니다. 시도해보자: "커피 컵을 들고 빨간 화면과 타는 프린터 앞에 있는 만화 개" 같은 웹코믹 개가 밤에 타는 오픈 플랜 사무실로 이동, MiniMax H3 reference-to-video로 생성

같은 모자, 같은 머그잔, 같은 잉크 두께, 새로운 방. 하나의 참조 이미지가 그 모든 것을 해냈습니다.

도용할 가치가 있는 세 가지 더 많은 MiniMax H3 프롬프트 패턴

패턴 1: 모션 포스터, 레이아웃이 움직이면 안 됨. 단색 분홍 배경에 대해 앞으로 달리는 만화 캐릭터 MiniMax H3 모션 포스터: POPUP! 레이아웃이 애니메이션되지만 프레임과 타이포그래피는 고정됨 거대한 발톱을 뻗은 분홍 괴물 후드티를 입은 만화 소년 MiniMax H3에 제공된 원본 정적 포스터

전체 프롬프트는 두 줄입니다: 갤러리 흰색 프레임, 내부 프레임, 빨간색-흰색-검정 팔레트, 3D-피규어 느낌 및 레이아웃 구조를 변경하지 않고 유지하고, 텍스트 진입 아래에 민첩한 음향 효과를 넣습니다. 규칙: 살아남아야 하는 부분의 이름을 지정하십시오. "레이아웃 유지"는 스타일 노트가 아니라 제약 조건이며, 모델은 이를 하나로 취급합니다.

패턴 2: 인터페이스 데모, 동사가 형용사보다 낫습니다. 분홍색 그라데이션 밑창이 있는 민트 그린 Nike ZoomX 러닝화 MiniMax H3 랜딩 페이지 데모: 제품 페이지에서 스크롤, 호버, 색상 반전 녹색과 분홍색 악센트가 있는 하늘색 Nike 러닝화 랜딩 페이지 클립 뒤에 있는 단일 제품 참조 이미지

그 프롬프트는 아래로 페이지 스크롤, 호버 상태, 강한 확대 및 색상 반전을 요청합니다. 네 개의 동사. "현대적인" 또는 "세련된"이라고 말하지 않습니다. 상호작용은 행동이므로 행동으로 작성하십시오. 과장된 이탤릭체와 탄소 직조 배경은 형용사에서 왔습니다. 실제 페이지로 읽히게 만드는 것은 동사에서 왔습니다.

패턴 3: 실사와 손으로 그린 것의 결합, 거부에 의해 유지됨. 열린 손에서 자라는 애니메이션 빛나는 녹색 새싹 MiniMax H3 클립이 실사 주방 영상과 손으로 그린 빛나는 생명체를 융합함

이것은 전화로 촬영한 저녁 주방에 작은 빛나는 손으로 그린 생명체가 있는 장면이며, 공포 단편으로 변하지 않고 매력적으로 유지되는 이유는 금지 목록 덕분입니다: 큰 눈 없음, 갈라진 입 없음, 송곳니 없음, 위협적인 자세 없음, 돌진 없음, 갑작스러운 검은 화면으로의 전환 없음, 점프 스케어 없음. 부정 목록은 1차 스타일 제어지 패치가 아닙니다. 또한 취향을 인코딩하는 곳입니다. 어두운 터널에 있는 여성과 텍스트를 보여주는 네 개의 패널 공식 SF 예고편의 네 프레임: THE STARS WERE LISTENING The Stars Were Listening 포스터 및 캐릭터 디자인 시트 예고편 뒤에 있는 무드 보드 및 캐릭터 참조

위의 예고편은 두 아이디어를 모두 닫습니다. 프롬프트는 하나의 타이틀 THE STARS WERE LISTENING을 상세히 철자합니다: 매우 좁고, 굵고, 모두 대문자, 녹색이 섞인 진한 빨간색, 약간의 입자와 안개 낀 가장자리. 그것은 주문한 대로 정확히 돌아옵니다. 두 개의 참조 보드가 분위기와 주인공을 처리하므로 텍스트는 얼굴을 설명할 필요가 없습니다. 끝까지 노동 분업.

이 MiniMax H3 프롬프트를 실행하는 데 드는 비용

H3는 생성된 비디오 초당, 해상도에 따라 청구되므로 비용 모델은 상쾌할 정도로 단순합니다: 15초 테이크는 약 3번의 5초 시도 비용이 듭니다. 다른 모든 것은 그로부터 이어집니다.

  • 5초로 반복하고, 10초 또는 15초로 전달하십시오. 구성, 팔레트 및 사운드 디자인은 모두 5초에서 해결됩니다. 고정된 샷에 대해 전체 지속 시간이 잘못되었는지 알려줄 필요는 없습니다.
  • end_image는 창의적인 도구일 뿐만 아니라 비용 도구입니다. 대부분의 재실행은 엔딩이 표류했기 때문에 발생합니다. 마지막 프레임을 고정하면 비용을 지불하기 전에 그 실패 모드를 제거할 수 있습니다.
  • 부정 목록과 철자가 명시된 텍스트는 무료입니다. 그들은 초당 청구되고 토큰당 청구되지 않는 프롬프트에 문자를 추가합니다. 많이 사용하십시오.
  • 프롬프트를 작성하기 전에 duration을 엔드포인트에 일치시키십시오. 15초 샷 목록을 작성한 다음 엔드포인트가 10초로 제한된다는 것을 알게 되면 재실행뿐만 아니라 다시 작성해야 합니다.

아직 계획에 포함하지 말아야 할 한 가지: 가격표에는 더 저렴한 768p 계층이 나열되어 있지만, 이 글을 쓰는 시점에서 768p 작업은 완전히 거부되고 2K만 실행되는 유일한 해상도입니다. 모든 초가 2K 초인 것처럼 예산을 책정하십시오. 현재 초당 요금은 모델 페이지에 있으며, 768p 계층이 열리면 표시될 곳이기도 합니다.

MiniMax H3 프롬프트, 밈 및 저작권

개는 공개 도메인이 아닙니다. This Is Fine은 KC Green의 웹코믹 Gunshow #648에서 2013년 1월 9일에 게시되었으며, 처음 두 패널만 바이럴이 되었습니다 (Know Your Meme, 2013년 1월). Green은 이미지가 특히 자신이 정치를 공유하지 않는 사람들에 의해 영원히 재사용되는 것을 지켜보는 것에 대해 공개적으로, 그리고 꽤 지치게 이야기했습니다 (NPR, 2023년 1월).

이 워크스루는 해설 및 교육 목적이며, 스톡 라이브러리가 아닙니다. 상업적으로 무언가를 출시하려면 자신의 프레임을 그리거나 사용하는 프레임의 라이선스를 취득하십시오. 그리고 클라이언트 작업 전에 자체 정책 점검을 실행하십시오: H3는 인식 가능한 실제 인물과 잘 알려진 IP에 콘텐츠 규칙을 적용하며, 마감일 중간에 이를 알게 되는 것은 즐거운 일이 아닙니다.

자주 묻는 질문

MiniMax H3가 오디오를 생성합니까, 아니면 나중에 추가합니까?

동일한 패스입니다. 화면과 사운드가 함께 나오므로, 오디오를 나중에 덧붙이는 것이 아니라 프롬프트 본문에 작성해야 하는 이유가 바로 이것입니다. 자체 Audio: 블록을 제공하고 각 사운드가 들어오는 시점을 명시하십시오. 제가 조사한 9개의 공식 클립 모두 2560x1440, 24fps 비디오 스트림과 함께 AAC 스테레오 32kHz로 돌아왔습니다.

MiniMax H3 프롬프트의 길이는 얼마나 될 수 있습니까?

MiniMax 문서에 따르면 최대 7,000자입니다. 실제로 공식 예제는 중간값이 약 130자 중국어 문자이고 가장 긴 두 개가 657자와 858자로 넓은 범위를 보여줍니다. 참조 이미지가 설명을 대신할 때는 짧은 프롬프트가 잘 작동합니다. 참조가 없으면 샷 목록을 작성할 것으로 예상하십시오.

MiniMax H3 비디오에서 텍스트가 깨져 나오는 이유는 무엇입니까?

입력하지 않았기 때문입니다. 프롬프트에 문자 그대로 나타나는 문자열은 깨끗하게 렌더링됩니다. 일반적으로 가리키는 것("HUD 요소", "몇몇 레이블")은 글자 모양의 텍스처로 돌아옵니다. 읽을 수 있어야 하는 모든 단어의 철자를 쓴 다음, 철자를 틀리지 말고, 다른 텍스트를 추가하지 말고, 자막을 추가하지 마십시오를 추가하십시오.

하나의 MiniMax H3 프롬프트가 사용할 수 있는 참조 이미지, 비디오 및 오디오 클립의 수는?

9개 이미지, 3개 비디오, 3개 오디오 클립, 총 12개 파일, 참조 비디오 및 오디오는 각각 2~15초입니다. 오디오는 유일한 참조가 될 수 없습니다. 모델 기능과 특정 엔드포인트가 노출하는 것은 서로 다르므로 현재 입력 목록은 모델 페이지를 확인하십시오.

MiniMax H3 프롬프트가 클립이 시작하는 방법뿐만 아니라 끝나는 방법도 제어할 수 있습니까?

네, image-to-video에서 선택적 end_image 매개변수를 통해 가능합니다. 첫 번째 프레임과 마지막 프레임을 제공하면 클립이 그 사이를 보간합니다. 위의 데모가 바로 그 예입니다: 만화 패널 2 입력, 만화 패널 6 출력. 두 이미지를 유사한 종횡비로 유지하지 않으면 전환이 지저분해집니다.

지금 실제로 얻을 수 있는 지속 시간과 해상도는 무엇입니까?

2K, 그리고 2K만 가능합니다. 768p 작업은 현재 supported resolutions: 2K 메시지와 함께 거부됩니다. 가격표에 768p가 나타나 있음에도 불구하고 말입니다. 지속 시간은 엔드포인트에 따라 다릅니다: text-to-video 및 image-to-video는 510초(기본 8)를 허용하는 반면, reference-to-video는 515초를 허용합니다. 또 다른 함정: 텍스트 전용 생성에서는 API가 adaptive를 거부하고 명시적인 ratio를 요구합니다.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색