MiniMax H3 Lip Sync and Audio: 6초 분량의 목소리를 입력했더니 내 파이프라인에서 4개의 도구를 삭제했다
MiniMax H3 립싱크와 오디오가 내 6단계 더빙 체인을 하나의 API 호출로 대체했습니다. 두 번의 실제 테이크, 아무도 문서화하지 않은 참조 오디오 제한, 그리고 실제 청구서.
인물 사진 한 장과 오디오 파일 하나만 올리면 됩니다. 오디오를 영상으로 바꿔 주는 모델이 녹음에 맞춰 입과 표정을 움직이고, 완성된 영상은 바로 내려받을 수 있습니다.
몇 초짜리 표정 클립도, 10분짜리 설명 영상도 필요한 입력은 똑같이 두 가지뿐입니다.
정면을 본 인물 사진과 MP3 또는 WAV 파일을 올립니다. Avatar Omni Human 1.5는 그 사람이 트랙을 말하거나 노래하는 영상을 돌려주며, 립싱크와 표정, 제스처는 모두 오디오에서 바로 만들어집니다. 출력은 720p 또는 1080p입니다.
클립은 최대 60초이고, 15초 이하일 때 가장 또렷하게 나옵니다. 프롬프트를 덧붙여 장면이나 동작, 표정을 이끌 수도 있으며 중국어와 영어, 일본어, 한국어, 스페인어, 인도네시아어를 읽어 냅니다.
원고가 짧은 소셜 클립이 아니라 한 강의 전체라면, InfiniteTalk가 같은 인물 사진과 최대 10분짜리 오디오를 받습니다. 녹음이 끝날 때까지 립싱크가 음소 단위로 맞고, 얼굴과 헤어스타일, 옷, 배경도 내내 흔들리지 않습니다. 출력은 480p 또는 720p입니다.
내레이션은 오디오 탭에서 만들어 이곳으로 가져오고, 프롬프트로 표정과 자세를 조정하면 됩니다. 강의 한 차시나 제품 설명 영상을 카메라도 출연자도 섭외하지 않고 만들 수 있습니다.
길이에 따라 나뉜 두 모델. 1080p까지 지원하는 짧고 표정이 살아 있는 클립에는 Avatar Omni Human 1.5를, 오디오가 길 때는 InfiniteTalk를 고르세요.
한 사람이 정면을 본 선명한 사진을 씁니다. 배경이 단순하고 얼굴이 가려지지 않을수록 모델이 다루기 좋습니다.
MP3나 WAV를 붙입니다. 직접 녹음한 파일도, 오디오 탭에서 만든 음성도 괜찮습니다.
모델과 해상도를 고르고 생성한 뒤, 완성된 클립을 내려받습니다.
하는 일과 가장 가까운 탭을 열어 보면 말하는 아바타가 촬영을 대신할 수 있는 지점이 보입니다.
인물 사진은 한 장, 언어는 여러 개. 언어별로 원고를 녹음하거나 만들어 같은 얼굴로 모델을 돌리면, 캠페인이 어느 시장에서나 같은 진행자로 통일되고 사람을 현지로 보낼 필요도 없습니다.
10분짜리 강의 녹음을 InfiniteTalk로 영상으로 바꿉니다. 한 차시 내내 강사가 화면에 나오고, 내용을 업데이트할 때는 오디오만 바꾸면 되니 다시 촬영하지 않아도 됩니다.
상품마다 설명해 주는 사람을 붙일 수 있습니다. 오디오 탭에서 만든 상품 원고와 브랜드 이미지에 맞는 인물 사진을 짝지으면, 상품 페이지에도 UGC 스타일 광고에도 바로 쓸 수 있는 설명 영상이 나옵니다.
규정 안내는 오디오로 한 번만 녹음해 두고, 긴 녹음에서도 립싱크가 유지되는 InfiniteTalk로 늘 같은 진행자를 붙입니다. 절차가 바뀌면 오디오 파일만 교체하면 같은 얼굴이 새 내용을 전합니다.
AI 아바타 생성기는 오디오를 영상으로 바꿔 주는 AI로, 정지된 인물 사진이 주어진 오디오 트랙을 말하게 만듭니다. 사진 한 장과 오디오 파일 하나를 올리면 모델이 소리에서 입 모양과 표정, 제스처를 만들어 그 사람이 말하는 영상을 돌려줍니다.
Atlas Cloud는 바이트댄스의 Avatar Omni Human 1.5와 InfiniteTalk를 지원합니다. 둘 다 인물 사진과 오디오를 받고, 주된 차이는 클립 길이와 해상도입니다.
Avatar Omni Human 1.5는 최대 60초 클립을 만들고 15초 이하를 권장합니다. InfiniteTalk는 한 번에 최대 10분짜리 오디오를 받습니다.
Avatar Omni Human 1.5는 720p 또는 1080p로, InfiniteTalk는 480p 또는 720p로 출력합니다.
한 사람이 정면을 보고 얼굴이 또렷하게 보이는 사진입니다. 두 모델 모두 클립 하나에 말하는 사람 한 명을 전제로 만들어졌습니다.
맞춥니다. Avatar Omni Human 1.5는 말하기와 노래하기를 모두 염두에 두고 만들어졌고, 제스처와 표정도 원고가 아니라 오디오에서 만들어 냅니다.
Avatar Omni Human 1.5는 다룰 수 있는 언어로 중국어와 영어, 일본어, 한국어, 스페인어, 인도네시아어를 밝히고 있습니다. 립싱크는 오디오 자체를 따라가므로 중요한 것은 녹음된 언어입니다.
가능합니다. 텍스트 음성 변환 모델로 내레이션을 만들고 파일을 내려받아, 여기에서 오디오 입력으로 붙이면 됩니다. 만들어진 음성에도 녹음과 똑같이 립싱크가 맞습니다.
있습니다. 두 모델 모두 Atlas Cloud API로 쓸 수 있고 인증 방식도 이미지·영상 API와 같습니다. 아바타 모델 페이지를 둘러보고 개발을 시작해 보세요.
인물 사진 준비, 오디오 길이, 언어 테스트.