
Grok Imagine Video를 통해 개발자는 클립을 생성하고, 애니메이션을 적용하고, 확장하고, 편집할 수 있는 xAI의 비디오 제품군을 이용할 수 있습니다. 프롬프트로 1~15초 길이의 비디오를 생성하고, 최대 7개의 참조 이미지로 인물, 사물 또는 스타일을 지정할 수 있으며, 480p 또는 720p로 작업할 수 있습니다. Atlas Cloud는 투명한 사용량 기반 요금제로 OpenAI 호환 엔드포인트를 통해 이러한 기능을 한곳에서 제공합니다. 지금 바로 개발을 시작해 보세요.
Grok Imagine Video은(는) xAI에서 개발한 모델입니다. Atlas Cloud(운영: Atlas Cloud AI LLC)는 해당 모델에 대한 액세스를 제공할 뿐이며 이를 소유하지 않습니다. 모든 상표는 각 소유자에게 귀속됩니다.
소스 에셋, 원하는 변환 방식, 제작 워크플로에 맞는 Grok Imagine Video endpoint를 선택하세요.
| 모달리티 | 설명 |
|---|---|
| Grok Imagine Video T2V API (텍스트에서 비디오로) | 자연어 프롬프트를 사용해 480p 또는 720p 해상도의 1~15초 비디오를 생성합니다. 소스 미디어 없이 콘셉트를 시각화하거나 소셜 클립 및 장면을 제작하는 데 적합한 endpoint입니다. |
| Grok Imagine Video I2V API (이미지에서 비디오로) | 제공된 이미지에서 시작해 자연어 모션 프롬프트를 적용하여 480p 또는 720p 비디오를 생성합니다. 아트워크, 제품 이미지, 캐릭터 프레임 또는 캠페인 비주얼에 애니메이션을 적용할 때 사용하세요. |
| Grok Imagine Video R2V API (참조 이미지에서 비디오로) | 사람, 사물 또는 시각적 스타일을 나타내는 1~7개의 참조 이미지로 비디오 생성을 안내합니다. 최대 10초 길이의 480p 또는 720p 출력을 지원하여 참조 기반 크리에이티브 제작에 활용할 수 있습니다. |
| Grok Imagine Video Extend API (비디오 확장) | 기존 2~15초 MP4를 프롬프트로 지정한 2~10초 길이의 확장 영상으로 이어 붙입니다. 출력은 입력 형식과 일치하며 최대 720p로 제한되므로, 완성된 샷의 길이를 늘리는 데 유용합니다. |
| Grok Imagine Video Edit API (비디오 편집) | MP4와 자연어 지침을 제공하여 원본 재생 시간을 유지하면서 시각적 콘텐츠를 수정합니다. 출력은 최대 8.7초로 제한되어 짧은 영상의 특정 부분을 수정하거나 프롬프트 기반 변환을 수행하는 데 적합합니다. |
Grok Imagine Video는 텍스트, 시작 프레임, 최대 7개의 레퍼런스를 짧은 클립으로 변환하고, Atlas Cloud의 통합 종량제 API를 통해 기존 MP4 영상을 확장하거나 편집합니다.
자연어 프롬프트를 작성해 480p 또는 720p의 1~15초 클립을 생성하세요. 16:9, 1:1, 9:16을 포함한 7가지 화면비를 지원하므로 각 장면을 의도한 캔버스에 맞출 수 있습니다. 프롬프트에서 피사체, 동작, 카메라 움직임, 분위기를 직접 제어하세요. 스토리 전개, 캠페인 콘셉트, 소셜 동영상의 유연한 출발점으로 활용할 수 있습니다.
제공한 시작 프레임 이미지를 480p 또는 720p의 1~15초 동영상으로 변환하세요. 이미지는 시작 구도를 설정하고, 자연어 모션 프롬프트는 움직임과 장면 전개를 지정합니다. 다른 출력 형태가 필요할 때는 7가지 화면비 중에서 선택할 수 있습니다. 시작 프레임을 다시 제작하지 않고 움직임을 더해야 하는 제품 이미지, 일러스트 장면, 아트 디렉션 기반 콘셉트에 적합한 워크플로입니다.
사람, 사물 또는 시각적 스타일을 나타내는 1~7개의 레퍼런스 이미지로 동영상을 유도하세요. 프롬프트에서 개별 입력을 참조한 다음, 7가지 지원 화면비로 480p 또는 720p의 최대 10초 동영상을 생성할 수 있습니다. 레퍼런스가 단순히 시작 프레임으로만 사용되지 않고 장면의 형태를 결정하므로, 반복적으로 등장하는 시각 요소를 더욱 세밀하게 제어할 수 있습니다. 캐릭터 중심 장면, 제품 스토리텔링, 스타일을 고려한 캠페인에 활용하세요.
기존 2~15초 MP4에 프롬프트 기반 확장 구간을 추가해 2~10초 더 이어가세요. Grok Imagine Video는 마지막 프레임부터 이어서 생성하고, 최대 720p까지 입력 해상도를 유지하면서 원본 클립과 새 구간을 함께 반환합니다. 다음 동작, 공개 장면, 카메라 이동을 자연어로 설명하세요. 갑작스럽게 끝나는 영상을 완결된 내러티브 장면으로 발전시키기 쉬워집니다.
MP4와 자연어 지시를 Grok Imagine Video에 제공해 원본 재생 시간을 유지하면서 영상을 변환하세요. 입력 영상은 최대 8.7초까지 지원하며, 과금은 입력 동영상 길이를 기준으로 이루어집니다. 클립을 처음부터 다시 만들지 않고 시각적 변화, 분위기 전환, 장면 단위 수정 등을 요청할 수 있습니다. 짧은 크리에이티브 변형과 정밀한 생성 후 보정에 적합합니다.
하나의 통합 API를 통해 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스 기반 생성, 확장, 편집 작업을 오갈 수 있습니다. 사용 가능한 소스 자료에 맞는 엔드포인트를 선택하고 각 작업을 비동기 prediction 흐름으로 제출하세요. 워크플로 전반에서 인증 및 통합 패턴을 일관되게 유지할 수 있습니다. 종량제 방식으로 실험과 반복 가능한 프로덕션 파이프라인을 지원합니다. 개발자는 통합 부담을 줄이면서 더 폭넓은 동영상 도구를 구축할 수 있습니다.
동일한 프롬프트를 Grok Imagine Video와 두 가지 주요 대안이 움직임, 연속성, 카메라 제어, 조명, 시각적 스토리텔링 측면에서 어떻게 해석하는지 확인해 보세요.
폭우가 쏟아진 직후, 에메랄드빛 협곡을 배경으로 한 8–10초 분량의 초현실적 야외 어드벤처 영화. 코발트 블루 방수복과 오렌지 레드 구명조끼를 착용한 카약 선수가 첫 프레임부터 마지막 프레임까지 거센 급류를 가르며 돌진한다. 패들 블레이드가 물살을 가르며 렌즈 위로 선명한 물보라를 튀기는 순간, 카약 옆을 질주하는 초저수면 추적 숏으로 시작한다. 카약이 가파른 파도마루를 타고 솟구쳐 공중으로 날아오르면, 휩 팬으로 카약 선수가 쓰러진 나무 아래에서 배를 옆으로 기울여 구르는 장면의 1인칭 POV로 전환한다. 카약은 반투명한 물의 장막을 뚫고 지나가며, 젖은 울퉁불퉁한 바위를 아슬아슬하게 비껴간다. 물보라와 순간적인 가림이 발생하는 동안에도 손, 패들, 코발트색 선수 부분은 물리적으로 일관되게 유지된다. 카약 선수는 패들을 물살에 버티고 협곡 벽을 타이트한 반동 턴으로 깎아 돌며 다시 급류 속으로 떨어진다. 절정에서는 절벽 위에서 빠르게 하강하며 착수하는 카약 선수를 선회하는 드론의 급강하 숏으로 전환한다. 선수 부분이 떠 있는 나무 상자와 설득력 있게 충돌해 상자를 깨뜨리면, 갑작스럽고 유쾌한 반전으로 완벽하게 온전한 형형색색 종이등이 연결된 줄이 튀어나와 펼쳐지고, 차갑게 흐르는 물 위에서 따뜻한 빛을 내며 둥실거리는 동안 카약은 계속 앞으로 질주한다. 모든 장애물 뒤에서도 해부학적으로 정확한 움직임, 사실적인 카약 관성, 패들 저항, 충돌, 난류 유체 역학, 천의 움직임, 물방울, 렌즈에 튀는 물, 변함없는 피사체 정체성을 유지한다. 슬로 모션, 비어 있는 설정 숏, 화면·인터페이스·대시보드·진행률 표시줄·차트·캡션·로고·설명 텍스트로의 전환은 없다. 흐린 차가운 시안색 주광, 비에 어두워진 에메랄드색 암벽, 선명한 오렌지 레드 구명조끼, 따뜻한 다색 종이등의 빛, 속도를 강조하는 영화적 와이드스크린 대각선 구도, 높은 대비, 자연스러운 모션 블러, 몰입감 있는 사실적 액션 스포츠 촬영. 동기화된 오디오: 포효하는 급류, 날카로운 패들 충격음, 나무가 갈라지는 소리, 거친 숨소리, 선체를 때리는 물소리, 그리고 종이등이 터져 나오는 순간의 밝고 경쾌한 타악기 음악 악센트. 16:9 화면비.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
폭우가 쏟아지기 직전의 야외 야시장, 8–10초 분량의 연속 액션 영화적 시퀀스. 눈을 가린 라멘 장인이 두 손 사이로 은백색 면발 리본을 계속 늘어뜨리며, 사람들로 붐비는 음식 가판대 미로를 자신 있게 질주한다. 완벽하게 수직인 조감도에서 시작한 뒤, 첫 굵은 빗방울이 차양과 젖은 포장도로를 때리는 순간 위에서 네온빛 시장 미로 속으로 빠르게 급강하한다. 날아다니는 면발 리본에 고정한 채, 빛나는 숯 화로, 놀란 손님들, 지글거리는 그릴, 바람에 펼쳐지는 우산들 옆을 불과 몇 인치 간격으로 질주한다. 끊김 없는 인간 움직임, 설득력 있는 탄성 면발 물리, 복잡한 전경 가림, 튀는 빗물, 불꽃, 짙은 수증기를 유지한다. 휩 팬으로 셰프가 보폭을 흐트러뜨리지 않고 낮은 상자를 뛰어넘는 장면으로 전환한 뒤, 셰프가 몸을 비틀며 정확한 운동량으로 면발을 뒤쪽으로 풀어내는 순간 그를 중심으로 빠른 360도 선회를 실행한다. 면발 리본은 그의 뒤에서 세차게 끓는 구리 솥 안으로 깔끔하게 휘어져 들어간다. 승리의 순간과 정확히 동시에 장난기 많은 오렌지색 얼룩고양이가 가판대 아래에서 뛰쳐나와 입으로 늘어진 면발의 절반을 낚아채 달아난다. 셰프는 이를 눈치채지 못한 채 계속 달리며, 선명한 시각적 펀치라인을 만든다. 네온 누아르풍 사실주의, 비에 젖은 지면 위로 번지는 시안 그린과 마젠타 반사광, 리듬감 있는 시각적 악센트로 활용되는 따뜻한 용광로 오렌지색 불빛, 촉감이 느껴지는 수증기와 빗물, 안정적인 안무, 선명한 영화적 디테일, 박진감 있는 실시간 진행. 슬로 모션과 공간적·캐릭터 연속성을 깨뜨리는 전환은 없다. 오디오: 점점 커지는 천둥소리, 시장의 소음, 쿵쿵 울리는 발걸음, 우산이 펼쳐지는 소리, 지글거리는 숯불, 끓는 물, 카메라 움직임과 동기화된 면발이 휘몰아치는 소리, 마지막에는 밝고 코믹한 고양이 울음소리와 구리 솥에 물이 튀는 소리. 화면, 사용자 인터페이스, 대시보드, 진행률 표시줄, 차트, 캡션, 자막, 로고, 워터마크, 설명 텍스트는 없다. 16:9 화면비.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video는 프롬프트, 스틸 이미지, 레퍼런스, 기존 MP4 파일을 소셜 클립, 제품 비주얼, 브랜드 스토리, 더 긴 시퀀스, 정밀 편집, 크리에이터 도구로 이어지는 실용적인 워크플로로 전환합니다.
Grok Imagine Video는 자연어 프롬프트를 480p 또는 720p의 짧은 클립으로 변환합니다. 사전에 소스 영상을 준비하지 않아도 소셜 티저, 캠페인 콘셉트, 빠른 비주얼 초안을 제작할 수 있습니다.
제품 이미지에서 시작해 image to video 엔드포인트가 480p 또는 720p에서 프롬프트로 지정한 모션을 추가합니다. 브랜드는 카탈로그 스틸 이미지를 제품 공개 영상, 출시용 에셋, 마켓플레이스 비주얼로 전환할 수 있습니다.
1~7개의 이미지를 사용하면 reference to video가 사람, 사물 또는 스타일을 새로운 클립으로 구성합니다. 크리에이티브 팀은 제공된 비주얼을 기반으로 브랜드 스토리, 캐릭터 콘셉트, 제품 장면을 개발할 수 있습니다.
기존 MP4를 2~10초 길이의 프롬프트 기반 확장 영상으로 이어 붙이면서 입력 해상도를 최대 720p까지 유지합니다. 승인된 영상에서 더 긴 스토리보드 장면, 에피소드 전환, 후속 시퀀스를 제작할 수 있습니다.
자연어 지시로 MP4를 편집하면서 원본 재생 시간을 유지하고, 출력 길이는 최대 8.7초로 제한됩니다. 팀은 대체 룩, 현지화된 캠페인 변형, 수정된 비주얼 스타일을 만들 수 있습니다.
생성, 애니메이션, 레퍼런스, 확장, 편집을 지원하는 5가지 Grok Imagine Video 모드를 중심으로 프롬프트 기반 비디오 도구를 구축하세요. 개발자는 480p 또는 720p 출력을 선택하면서 하나의 제품군으로 크리에이터 워크플로를 지원할 수 있습니다.
입력 방식, 클립 길이, 최대 해상도 및 표준 가격을 기준으로 Grok Imagine Video 워크플로를 엄선한 Atlas Cloud 대안과 비교합니다.
| 모델 | 입력 워크플로 | 클립 또는 세그먼트 길이 | 최대 해상도 | 표준 가격 |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | 텍스트 프롬프트 | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | 시작 이미지 + 텍스트 프롬프트 | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 참조 이미지 1–7개 + 텍스트 프롬프트 | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | 2–15s MP4 + 텍스트 프롬프트 | 2–10s 연장 | 입력과 동일하며 최대 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + 텍스트 지시문 | 입력과 동일하며 최대 8.7s | - | $0.07/input sec |
| MiniMax H3 Text-to-Video | 텍스트 프롬프트 | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | 시작 이미지 + 텍스트, 마지막 프레임 선택 사항 | 4–15s | 네이티브 4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 참조 이미지 1–4개 + 텍스트 프롬프트 | 1–16s | 1440p SR, 네이티브 최대 1080p | $0.125/run |
| Wan-2.7 Video-edit | 소스 비디오 + 텍스트, 이미지 또는 오디오 선택 사항 | - | 1080p | $0.10/run |
몇 분 만에 시작하세요 — 간단한 단계를 따라 Atlas Cloud 플랫폼을 통해 모델을 통합하고 배포하세요.
atlascloud.ai에서 가입하고 인증을 완료하세요. 신규 사용자는 플랫폼 탐색과 모델 테스트를 위한 무료 크레딧을 받습니다.
고급 Grok Imagine Video 모델과 Atlas Cloud의 GPU 가속 플랫폼을 결합하여 비교할 수 없는 성능, 확장성 및 개발자 경험을 제공합니다.
낮은 지연 시간:
실시간 추론을 위한 GPU 최적화 추론.
통합 API:
하나의 통합으로 Grok Imagine Video, GPT, Gemini 및 DeepSeek를 실행합니다.
투명한 가격:
Serverless 옵션을 포함한 예측 가능한 token당 청구.
개발자 경험:
SDK, 분석, 파인튜닝 도구 및 템플릿.
신뢰성:
99.99% 가동 시간, RBAC 및 규정 준수 로깅.
보안 및 규정 준수:
SOC 2 Type II, HIPAA 준수, 미국 내 데이터 주권.
Grok Imagine Video는 짧은 클립을 생성하고, 애니메이션을 적용하고, 확장하고, 편집할 수 있는 xAI의 동영상 생성 모델 제품군입니다. Atlas Cloud는 텍스트, 이미지, 참조 이미지, 확장, 편집 워크플로를 위한 별도의 API 엔드포인트를 제공합니다.
Grok Imagine Video는 텍스트에서 클립을 생성하거나, 시작 이미지를 애니메이션으로 만들거나, 최대 7개의 참조 이미지를 사용해 인물, 사물, 스타일을 안내할 수 있습니다. 별도의 엔드포인트를 사용하면 기존 클립을 이어서 생성하거나 자연어 지시로 MP4를 편집할 수 있습니다.
Atlas Cloud API 키를 생성한 다음 /api/v1/model/generateVideo로 인증된 POST 요청을 보내세요. 해당 라우트에서 요구하는 모델 ID, 프롬프트, 이미지 또는 동영상 입력을 지정해야 합니다. 응답에는 요청 ID, 상태, 출력 필드가 포함됩니다.
장면이 프롬프트에서 시작되면 text-to-video를 선택하고, 제공한 이미지가 시작 프레임이 되어야 하면 image-to-video를 선택하세요. reference-to-video는 여러 이미지로 더 폭넓은 가이드를 제공하며, extend-video와 edit-video는 기존 MP4 파일을 대상으로 작업합니다.
text-to-video와 image-to-video는 480p 또는 720p에서 1초부터 15초까지의 클립을 지원합니다. reference-to-video는 동일한 해상도에서 1초부터 10초까지 지원하며, 일반적으로 사용되는 화면 비율은 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3입니다. 확장 및 편집 라우트에는 각각 고유한 입력 제한이 적용됩니다.
예. xAI는 Grok Imagine 동영상 워크플로의 일부로 네이티브 오디오 생성을 지원한다고 설명하며, 사운드와 영상을 함께 생성할 수 있습니다. Atlas Cloud가 이 라우트에 공개한 스키마에는 별도의 오디오 토글이 없습니다.
reference-to-video 엔드포인트를 통해 1개에서 7개 사이의 공개 HTTPS 이미지 URL 또는 base64 data URI를 제공하세요. <IMAGE_0>과 같은 태그를 사용하면 프롬프트에 설명된 인물, 사물, 스타일에 개별 참조 이미지를 연결할 수 있습니다. 이 라우트는 480p 또는 720p에서 최대 10초 길이의 클립을 반환합니다.
extend-video를 사용해 2초에서 15초 길이의 MP4를 입력하고, 프롬프트로 지정한 동작을 2초에서 10초 추가하도록 요청하세요. 특정 부분을 변경하려면 8.7초 이하의 MP4를 edit-video에 입력할 수 있으며, 동영상 길이는 그대로 유지됩니다. 두 라우트 모두 출력 해상도는 최대 720p로 제한됩니다.
Atlas Cloud의 표준 요금은 text-to-video, image-to-video, reference-to-video의 경우 초당 $0.05입니다. extend-video와 edit-video에는 초당 $0.07의 표준 요금이 적용됩니다. 편집 결과물은 입력 동영상과 동일한 길이를 유지하므로 입력 동영상의 길이를 기준으로 요금이 부과됩니다.
먼저 선택한 엔드포인트가 입력 유형과 일치하는지, 필요한 프롬프트와 이미지 URL 또는 동영상 URL이 모두 포함되어 있는지 확인하세요. 다시 제출하기 전에 해당 라우트의 길이, 해상도, 화면 비율, 참조 이미지 개수, MP4 제한을 점검하세요. 요청은 성공했지만 장면이 부정확하다면 피사체의 움직임, 카메라 이동, 진행 속도, 시각적 세부 사항을 명확히 포함하도록 프롬프트를 다시 작성하세요.
Atlas Cloud를 최대한 활용할 수 있는 가이드, 튜토리얼, 제품 업데이트.