MiniMax H3 Developer 출시 — 60% 할인, 초당 $0.02부터 시작
Hero background 1Hero background 2Hero background 3
Grok Imagine API for 15 Second Video

Grok Imagine API for 15 Second Video

Grok Imagine API는 Image 2.0에서 Video 1.5 및 xAI TTS v1에 이르는 xAI의 이미지, 비디오, 음성 모델을 지원합니다. 14가지 화면비로 1K 또는 2K 스틸을 렌더링하고, 장면을 15초 1080p 동영상으로 변환하며, 최대 7개의 참조 이미지로 샷을 조정하거나 20개 언어로 나레이션할 수 있습니다. Atlas Cloud는 모든 기능을 하나의 엔드포인트에서 제공하며, 이미지당 $0.02, 초당 $0.05의 종량제 요금이 적용됩니다. 오늘부터 구축을 시작하세요.

Grok Imagine은(는) xAI에서 개발한 모델입니다. Atlas Cloud(운영: Atlas Cloud AI LLC)는 해당 모델에 대한 액세스를 제공할 뿐이며 이를 소유하지 않습니다. 모든 상표는 각 소유자에게 귀속됩니다.

주요 모델 탐색

Atlas Cloud는 업계 최고의 최신 크리에이티브 모델을 제공합니다.

Grok Imagine API의 모든 엔드포인트, 정지 이미지부터 음성까지

입력 유형, 출력 길이, 해상도 및 호출당 가격에 맞는 Grok Imagine API 모델을 선택하세요.

모달리티설명
Grok Imagine Image 2.0 T2I API (Text to Image)최대 8,000자의 프롬프트를 입력하면 이 엔드포인트는 1K 또는 2K 해상도로 1~4개의 이미지를 반환합니다. 낮음 또는 중간 품질 옵션으로 렌더링 시간과 처리 속도를 조절할 수 있으며, 이미지당 $0.04입니다. 개념 탐색, 소셜 콘텐츠 제작 및 대규모 이미지 생성에 적합합니다.
Grok Imagine Image 2.0 Edit API (Image to Image)최대 3개의 참조 이미지와 텍스트 지시사항을 엔드포인트에 전달하면, 편집된 결과가 설정한 종횡비 또는 자동 종횡비로 1K 또는 2K로 반환됩니다. 동일한 낮음 및 중간 품질 옵션이 적용되며, 이미지당 $0.04입니다. 제품 스타일 변경, 배경 교체 및 빠른 디자인 변형이 모두 하나의 호출로 처리됩니다.
Grok Imagine Image Quality T2I API (Text to Image)세밀한 디테일이 중요한 경우, 이 엔드포인트는 텍스트 프롬프트를 1K 또는 2K의 고품질 정지 이미지로 변환하고 요청당 최대 4개의 변형을 이미지당 $0.05로 반환합니다. 종횡비는 정사각형, 초상화, 가로 및 초와이드 형식을 포함합니다. 주요 이미지, 광고 콘텐츠 및 브랜드급 제품 렌더링에 사용하세요.
Grok Imagine Image Quality Edit API (Image to Image)1~8개의 원본 이미지와 편집 지시사항을 전달하면 1K 또는 2K로 수정된 버전을 이미지당 $0.05로 받을 수 있습니다. 다중 이미지 참조는 <IMAGE_0>, <IMAGE_1> 등으로 인라인으로 지정되므로 피사체와 스타일을 단일 지시사항으로 결합할 수 있습니다. 캠페인 갱신, 스타일 변환 및 합성 편집이 주요 용도입니다.
Grok Imagine Image T2I API (Text to Image)원본 텍스트-이미지 엔드포인트는 1K 및 2K 출력과 4개 이미지 배칭을 계열에서 가장 낮은 이미지당 $0.02 가격으로 유지합니다. 이는 대량 파이프라인, 썸네일 생성 및 빠른 프롬프트 테스트를 위한 실질적인 기본값입니다.
Grok Imagine Image Edit API (Image to Image)대규모로 경량 편집이 필요하신가요? 이 엔드포인트는 1~8개의 이미지와 텍스트 지시사항을 수용하고 1K 또는 2K로 최대 4개의 편집된 결과를 이미지당 $0.02로 반환합니다. 카탈로그 정리, 계절 변형 및 반복적인 디자인 패스가 저렴하게 유지됩니다.
Grok Imagine Video v1.5 T2V API (Text to Video)프롬프트만으로 7가지 종횡비에서 480p, 720p 또는 1080p의 기본 동기화 오디오를 포함한 1~15초의 비디오를 생성합니다. 청구는 출력 초당 $0.08입니다. 트레일러, 소셜 콘텐츠 및 사운드가 포함되어야 하는 내러티브 장면에 가장 적합합니다.
Grok Imagine Video v1.5 I2V API (Image to Video)시작 프레임과 모션 프롬프트를 제공하면 v1.5가 1080p에 도달하는 해상도에서 최대 15초 동안 애니메이션을 생성하고 같은 패스에서 오디오를 생성합니다. 비용은 초당 $0.08입니다. 제품 스핀, 초상화 애니메이션 및 정지-모션 변환 캠페인 자산에 적합합니다.
Grok Imagine Video v1.5 R2V API (Reference to Video)1~7개의 참조 이미지가 화면의 캐릭터, 객체 및 스타일을 정의하고, 26개 사전 설정 중에서 선택한 최대 3개의 음성이 음성 오디오를 구동합니다. 480p 또는 720p에서 최대 15초, 청구는 초당 $0.08입니다. 캐릭터 일관성 스토리텔링, 가상 피팅 및 브랜드 마스코트에 이상적입니다.
Grok Imagine Video T2V API (Text to Video)텍스트 프롬프트는 480p 또는 720p에서 1~15초의 클립이 되며, 7가지 종횡비가 가로, 정사각형 및 세로 전달을 포함합니다. 초당 $0.05의 가격으로 소셜 콘텐츠 및 빠른 개념 보드를 위한 가성비 좋은 선택지입니다.
Grok Imagine Video I2V API (Image to Video)정지 이미지를 첫 프레임으로 설정하고 원하는 모션을 설명하면 클립이 480p 또는 720p에서 15초로 확장됩니다. 초당 $0.05의 가격으로 제품 사진 및 초상화의 대량 애니메이션을 저렴하게 유지합니다.
Grok Imagine Video R2V API (Reference to Video)1~7개의 참조 이미지가 고정된 오프닝 프레임 없이 화면에 나타나는 대상을 정의합니다. 클립은 480p 또는 720p에서 최대 10초까지 실행되며 초당 $0.05입니다. 아이덴티티와 스타일이 샷에서 샷으로 일관되어야 할 때 사용하세요.
Grok Imagine Video Extend API (Video Extension)2~15초의 기존 mp4 파일을 추가 2~10초로 계속할 수 있으며, 다음에 일어날 일을 설정하는 프롬프트로 가이드됩니다. 출력은 소스 비디오와 일치하고 720p로 제한되며 초당 $0.07으로 청구됩니다. 짧은 클립을 필요한 광고 길이로 확장하는 데 유용합니다.
Grok Imagine Video Edit API (Video to Video)자연어 지시사항으로 기존 mp4를 편집하면서 원본 장면, 모션 및 프레이밍이 유지됩니다. 출력은 소스 길이를 유지하며 최대 8.7초로 제한되고 청구는 입력 비디오를 초당 $0.07로 따릅니다. 소품 추가, 의상 변경 및 스타일 변경이 촬영 없이 가능합니다.
xAI TTS v1 API (Text to Speech)최대 15,000자의 텍스트가 20개 언어 전체에서 자동 언어 감지를 지원하며 1초 미만의 지연으로 자연스러운 음성이 됩니다. 전달은 조정 가능합니다: 0.7배~1.5배의 재생 속도, mp3, wav, pcm을 포함한 코덱, 최대 48kHz의 샘플 레이트. 음성 오버, IVR 프롬프트 및 인앱 내레이션에 이상적입니다.

Grok Imagine API의 주요 기능

다국어 텍스트를 활용한 2K 이미지 생성부터 네이티브 동기화 오디오 및 크리에이티브 모드를 갖춘 멀티모달 비디오에 이르기까지, Grok Imagine API가 제공하는 기능을 살펴보세요.

Grok Imagine 이미지 품질 API를 사용한 초고해상도 렌더링

Grok Imagine 이미지 품질 API를 사용한 초고해상도 렌더링

Grok Imagine Image Quality API는 최대 2K 해상도의 이미지 생성을 제공하며 모든 출력물에서 매우 선명한 디테일을 보장합니다. 확대 시에도 섬세한 텍스처와 복잡한 구도를 유지함으로써, 사용자는 초대형 포맷으로 표시될 때도 선명함을 유지하는 시각 자료를 제작할 수 있습니다. 이는 히어로 이미지, 광고 크리에이티브 및 브랜드급 제품 렌더링을 위한 궁극의 솔루션입니다.

다국어 텍스트 렌더링

다국어 텍스트 렌더링

Grok Imagine Image Quality API는 생성된 이미지 내에서 직접 다국어에 대한 동급 최고의 텍스트 렌더링을 제공합니다. 모든 언어의 타이포그래피, 스크립트 및 문자를 정확하게 재현함으로써 사용자는 수동 후편집 없이 시각적 결과물에 읽을 수 있는 문구를 포함할 수 있습니다. 광고 크리에이티브, 현지화된 마케팅 캠페인 및 브랜드 수준의 시각적 결과물을 위한 궁극적인 솔루션입니다.

실사 이미지 생성

실사 이미지 생성

Grok Imagine API는 모든 장면에 자연스러운 조명, 풍부한 텍스처 및 사실적인 물리 효과가 특징인 실사 수준의 결과물을 생성합니다. 현실 세계의 광학 및 재질의 동작을 시뮬레이션함으로써 사용자는 전문 사진과 시각적으로 구별할 수 없는 이미지를 제작할 수 있습니다. 이는 제품 렌더링, 히어로 이미지 및 고급 브랜드 시각물을 위한 궁극적인 솔루션입니다.

정밀한 프롬프트 제어 및 참조 기반 편집

정밀한 프롬프트 제어 및 참조 기반 편집

Grok Imagine Image Quality API는 레퍼런스 입력 기반의 고급 이미지 편집과 함께 더욱 엄격한 프롬프트 준수를 지원합니다. 세부 지침을 해석하고 업로드된 레퍼런스의 스타일 요소를 일치시킴으로써 사용자는 극도의 정밀도로 시각 자료를 다듬고 스타일을 재구성할 수 있습니다. 이는 광고 크리에이티브, 제품 렌더링 및 일관된 브랜드 수준의 시각 자료를 위한 궁극적인 솔루션입니다.

네이티브 오디오 및 비디오 생성

네이티브 오디오 및 비디오 생성

각 클립에 동기화된 음악, 사운드 이펙트 및 대화형 음성을 자동으로 생성하여 단 한 번의 처리로 오디오와 모션이 정렬된 상태를 유지합니다. 클립은 별도의 오디오 작업이 필요하지 않으며 즉시 사용할 수 있는 상태로 제공됩니다.

멀티모달 비디오 생성

멀티모달 비디오 생성

단일 스위트 내에서 텍스트-비디오, 이미지-비디오, 참조-비디오 생성 및 비디오 편집을 모두 지원합니다. 모델이나 통합 환경을 전환할 필요 없이 생성 및 편집 작업을 자유롭게 이동할 수 있습니다.

모션 제어 및 일관성

모션 제어 및 일관성

Grok Imagine Video API는 프레임 전반에 걸쳐 안정적인 물리 효과와 일관된 피사체를 유지하며 자연스러운 움직임을 생성합니다. 이는 긴 클립에서 발생하는 깜박임과 아티팩트를 줄여주며, 캐릭터와 장면을 처음부터 끝까지 일관성 있게 유지합니다.

하나의 프롬프트, 세 가지 모델: Grok Imagine API 비교

각 행은 동일한 프롬프트를 Grok Imagine API와 두 개의 경쟁 모델에 Atlas Cloud에서 실행하여, 모션, 오디오 싱크, 디테일, 타이포그래피를 동등한 기준으로 비교·평가할 수 있습니다.

프롬프트

라이브 액션 시네마틱 나이트 마켓 장면, 약 10초. 낮은 앵글의 트래킹 샷으로 시작해 김이 모락모락 나는 노점들을 지나치며, 젖은 민소매 옷을 입은 젊은wok 요리사가 국수를 던지고, wok에서 불꽃 기둥이 치솟아 그의 얼굴을 주황색으로 밝힌다. 카메라가 오른쪽으로 위프 팬되며 오일에서 새우가 익으며 구부러지는 극단적 마크로 샷으로 전환되고, 기름 방울이 튀는 모습이 포착된 후, 요리사가 회전하는 wok을 받아 한 번의 연속 동작으로 국수를 접시에 담는 동안 카운터 위로 크레인업하며 후퇴한다. 마지막 비트: 거친 털을 가진 마켓 고양이가 카운터 위로 뛰어올라 새우를 낚아채어 군중 속으로 사라지고, 요리사는 웃으며 몸을 돌리며, 카메라는 고양이를 뒤쫓는 빠른 핸드헬드 체이스로 전환된다. 붉은 등불빛이 반사되는 젖은 아스팔트, drifting steam, 얕은 피사계 심도, 미세한 입자가 있는 거친 다큐멘터리 필름 톤. 오디오: roaring 가스 버너, 기름이 튀기 소리, 마켓 소음과 후루룩 소리, 고양이의 도약과 정확히 맞춰지는 상승하는 드럼 패턴. 16:9 종횡비.

Generated with Grok Imagine Video v1.5 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Grok Imagine Video on Atlas Cloud

프롬프트

Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

Grok Imagine API로 이미지, 비디오, 오디오를 넘어 구축하세요

아래 모든 워크플로우는 하나의 OpenAI 호환 키로 실행되므로, 팀은 스택 변경 없이 Grok Imagine API 이미지 초안, 레퍼런스 편집, 동기화된 오디오가 포함된 비디오, 현지화된 내레이션으로 개념을 구현할 수 있습니다.

Grok Imagine API로 빠른 컨셉 반복

Image 2.0은 저품질 티어에서 약 10초 만에 1K 초안을 반환하며, 호출당 최대 4개의 변형을 생성합니다. 디자인 팀은 초기에 다양한 방향을 빠르게 탐색한 후, 최종 선택안을 2K로 다시 렌더링합니다.

다중 레퍼런스 제품 합성

Grok Imagine Image 2.0 Edit에 최대 3장의 레퍼런스 이미지를 입력하고 자연어로 변경 사항을 설명하세요. 이커머스 팀은 배경을 교체하고 패키지를 재디자인하며, 카탈로그 전체에서 단일 제품을 일관되게 유지합니다.

다국어 보이스오버 및 내레이션

xAI TTS v1은 천 분율의 지연 시간으로 20개 언어, 80개 이상의 음성으로 대본을 표현력 있는 음성으로 변환합니다. 제품 팀은 이를 생성된 비디오와 결합하여 현지화된 광고, 튜토리얼, 인앱 내레이션에 활용합니다.

네이티브 오디오 지원 Grok Imagine API 비디오

Grok Imagine Video v1.5는 1080p로 최대 15초 클립에서 음악, 효과음, 대사를 화면과 동기화하여 생성합니다. 마케터는 별도의 오디오 세션 없이 한 번에 완성된 영상을 얻을 수 있습니다.

Grok Imagine API 기반 캐릭터 일관성 스토리텔링

모든 샷에서 동일한 캐릭터가 필요하신가요? Reference-to-video는 1~7장의 레퍼런스 이미지와 선택적 레퍼런스 음성을 받아들이므로, 시리즈 제작자는 15초 클립 전반에 걸쳐 캐릭터의 정체성과 음성을 일관되게 유지할 수 있습니다.

재촬영 없는 포스트프로덕션

기존 영상은 자연어 편집으로 스타일을 재작성하거나 소스와 일치하는 2~10초 확장으로 이어갈 수 있습니다. 포스트 팀은 촬영지로 돌아가지 않고 소품, 의상, 호흡을 수정할 수 있습니다.

모델 비교

다양한 프로바이더의 모델 비교 — 성능, 가격, 고유한 강점을 비교하여 현명한 선택을 하세요.

모델참조 이미지 제한출력 수해상도종횡비
Grok Imagine Image Quality81~42K, 1KAuto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1
Nano Banana 21414K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Nano Banana Pro1014K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Seedream 5.0 Lite141~152K~4K+1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Qwen-Image31~6512P~2KWidth[512, 2048]px, Height[512, 2048]px

Atlas Cloud에서 Grok Imagine 사용하는 방법

몇 분 만에 시작하세요 — 간단한 단계를 따라 Atlas Cloud 플랫폼을 통해 모델을 통합하고 배포하세요.

Atlas Cloud 계정 생성

atlascloud.ai에서 가입하고 인증을 완료하세요. 신규 사용자는 플랫폼 탐색과 모델 테스트를 위한 무료 크레딧을 받습니다.

Atlas Cloud에서 Grok Imagine을(를) 사용하는 이유

고급 Grok Imagine 모델과 Atlas Cloud의 GPU 가속 플랫폼을 결합하여 비교할 수 없는 성능, 확장성 및 개발자 경험을 제공합니다.

성능 및 유연성

낮은 지연 시간:
실시간 추론을 위한 GPU 최적화 추론.

통합 API:
하나의 통합으로 Grok Imagine, GPT, Gemini 및 DeepSeek를 실행합니다.

투명한 가격:
Serverless 옵션을 포함한 예측 가능한 token당 청구.

엔터프라이즈 및 확장

개발자 경험:
SDK, 분석, 파인튜닝 도구 및 템플릿.

신뢰성:
99.99% 가동 시간, RBAC 및 규정 준수 로깅.

보안 및 규정 준수:
SOC 2 Type II, HIPAA 준수, 미국 내 데이터 주권.

개발자들이 Grok Imagine API에 대해 묻는 질문

Grok Imagine API는 Atlas Cloud가 제공하는 xAI의 Grok Imagine 생성 스택에 대한 통합 접근점으로, 이미지 생성, 이미지 편집, 비디오, 음성 기능을 모두 다룹니다. 한 번의 API 호출로 최신 Grok Imagine Image 2.0 Text-to-Image 및 Grok Imagine Image 2.0 Edit 모델을 포함한 모든 모드를 사용할 수 있습니다. 이 모델들은 2026년 8월 7일에 출시되었습니다. 과금은 성공적으로 완료된 생성 건당 종량제로, 구독 없이 호출 횟수만큼만 결제됩니다.

이미지 생성 모델 세 가지가 나란히 제공됩니다: Grok Imagine Image는 이미지당 $0.02, Grok Imagine Image Quality는 $0.05, Grok Imagine Image 2.0은 $0.04부터이며, 각 모델마다 전용 편집 엔드포인트가 있습니다. 비디오는 Grok Imagine Video(초당 $0.05)와 Grok Imagine Video v1.5(초당 $0.08)로 제공되며, 확장 및 편집 엔드포인트도 함께 제공됩니다. xAI TTS v1이 20개 언어 기준 80개 이상의 보이스로 제품군을 완성합니다.

Image 2.0은 디자이너처럼 타이포그래피와 레이아웃을 계획하므로, 복잡한 구도와 작은 텍스트도 질감으로 녹아들지 않고 선명하게 유지됩니다. 또한 선택 가능한 품질 티어를 노출하여 동일한 프롬프트에서 렌더 시간과 화질 간 트레이드오프를 직접 조절할 수 있는데, 기존 Image 및 Image Quality 모델에서는 이 기능을 지원하지 않습니다. Text-to-Image와 Edit 두 변형 모두 이 기능을 공유합니다.

과금은 성공적으로 완료된 생성 건당 적용되며 최소 사용 금액은 없습니다. Grok Imagine Image 2.0은 저화질 1K 기준 이미지당 $0.04, 저화질 2K 또는 중화질 1K 기준 $0.06, 중화질 2K 기준 $0.08이며, Edit 엔드포인트의 각 입력 이미지는 $0.01이 추가됩니다. 다른 이미지 모델은 Grok Imagine Image가 이미지당 $0.02, Grok Imagine Image Quality가 $0.05이며, 비디오는 초당 $0.05부터 시작됩니다.

Atlas Cloud API 키를 생성한 후, 프롬프트와 `xai/grok-imagine-image-2.0/text-to-image` 같은 모델 ID를 이미지 생성 엔드포인트에 POST하세요. 렌더링은 비동기로 동작하므로 호출 시 요청 ID가 반환되며, 상태가 processing에서 completed로 변경될 때까지 prediction 엔드포인트에서 폴링하면 됩니다. 모든 Grok Imagine 모델이 동일한 패턴을 따르므로, 나중에 비디오나 음성을 추가할 때는 한 줄의 문자열만 변경하면 됩니다. 오늘 바로 빌드를 시작하세요.

출력은 1K(1024x1024) 또는 2K(2048x2048) 해상도로 14가지 종횡비에서 렌더됩니다. 정사각형 1:1, 와이드스크린 16:9부터 세로형 9:20, 초광각 20:9 배너 형태까지 다양합니다. 단일 호출로 최대 4장의 이미지를 반환할 수 있으며, 프롬프트는 최대 8,000자까지 가능합니다. Edit 엔드포인트에서 종횡비는 기본값이 auto이며, 명시적으로 설정하지 않으면 첫 번째 입력 이미지의 비율을 따릅니다.

요청당 최대 3장의 소스 이미지를 public URL 또는 base64 데이터 URI 형식으로 받을 수 있습니다. 여러 장을 전달할 경우 프롬프트에 `<IMAGE_0>`, `<IMAGE_1>`, `<IMAGE_2>`로 참조하여 각 지시사항이 어떤 이미지에 적용되는지 모델이 인식하도록 합니다. 각 입력 이미지는 호출당 $0.01이 추가되며, 한 번에 1~4장의 편집 결과를 요청할 수 있습니다.

네. Grok Imagine Video v1.5는 영상과 동일한 패스에서 네이티브 동기화 오디오를 생성하므로, 음악, 효과음, 대사가 두 번째 파이프라인 없이도 움직임과 정확히 맞춰집니다. 레퍼런스-투-비디오 모드는 1~7장의 참조 이미지와 함께 선택적으로 레퍼런스 음성을 받을 수 있습니다. 클립은 최대 15초까지 지원하며, Text-to-Video와 Image-to-Video 모두 1080p까지 출력됩니다.

프레임에 타이포그래피, 레이아웃, 또는 하나로 유지되어야 할 다중 디테일이 포함되어 있거나, 속도와 화질 간 트레이드오프를 직접 제어하고 싶다면 Image 2.0을 선택하세요. Grok Imagine Image Quality는 1K와 2K 출력, 14가지 종횡비를 동일하게 지원하며 이미지당 $0.05의 단순 고정 요금제입니다. 양이 중요하고 미세한 텍스트 디테일이 덜 중요하다면 이미지당 $0.02인 기존 Grok Imagine Image가 가장 경제적입니다.

Medium은 기본 품질 티어로 1K 기준 약 84초가 소요되는데, 이는 모델의 최적 출력을 목표로 하기 때문입니다. quality를 low로 설정하면 1K 이미지 기준 $0.06에서 $0.04로 저렴해지면서 약 10초로 줄어들어 약 8배 빠릅니다. Low 품질로 초안과 반복 작업을 진행하고, 구도가 확정된 후 winning 프롬프트만 medium과 2K로 재실행하는 방식을 권장합니다.

더 많은 패밀리 탐색

Seedance 2.5

Seedance 2.5 API가 이제 Atlas Cloud에서 제공됩니다! 이를 통해 개발자는 ByteDance의 최신 비디오 모델을 사용할 수 있습니다. 텍스트, 단일 이미지 또는 최대 50개의 멀티모달 참조를 통해 동기화된 오디오 및 프레임 내 다국어 텍스트가 포함된 최대 30초 분량의 네이티브 비디오를 단일 패스로 생성합니다. Atlas Cloud에서는 단일 키를 통해 액세스할 수 있으며, 피사체 일관성과 향상된 물리 엔진으로 롱테이크의 일관성을 유지합니다.

패밀리 보기

Wan 3.0

Wan 3.0 API는 Alibaba의 Wan 비디오 제품군의 차세대 모델로, 롱폼 생성, 다중 참조 제어 및 시청각 품질을 새로운 차원으로 끌어올리도록 구축되었습니다. Atlas Cloud는 이미 Wan 2.7, 2.6 및 2.5를 호스팅하고 있으며, Wan 3.0은 별도의 설정 없이 동일한 통합 키로 실행됩니다. 지금 바로 구축을 시작해 보세요. 아래 쇼케이스로 스크롤하여 Wan 3.0이 무엇을 만들 수 있는지 확인해 보세요.

패밀리 보기

MiniMax H3

MiniMax H3 API는 텍스트, 이미지, 비디오, 오디오를 작업별로 따로 처리하는 대신 하나의 컨텍스트로 이해하는 MiniMax의 범용 멀티모달 비디오 모델을 제공합니다. 클립은 24 FPS로 5~15초 길이로 생성되며, 21:9부터 9:16까지 다양한 화면 비율을 지원합니다. 하나의 프롬프트로 캐릭터를 교체하고, 배경을 바꾸고, 대사를 다시 쓰거나 참조 클립에서 음성을 복제할 수 있습니다. Atlas Cloud는 이 모든 기능을 하나의 OpenAI-compatible endpoint를 통해 제공합니다. 지금 바로 구축을 시작하세요.

패밀리 보기

Seedream 5.0 Pro

Seedream 5.0 Pro API는 개발자에게 Atlas Cloud에서 ByteDance의 제어 가능한 이미지 편집 모델을 제공합니다. 앵커와 좌표로 편집을 정확하게 배치하고, 이미지를 편집 가능한 레이어로 분리하고, 여러 참조를 융합하며, 정확한 색상과 재질을 일치시키고, 2K 및 3K에서 다국어 텍스트를 지원합니다. Atlas Cloud에서는 단일 키로 액세스할 수 있습니다!

패밀리 보기

Seedance 2.0

Seedance 2.0 API는 쿼드 모달 입력(텍스트, 이미지, 비디오, 오디오) 및 샷 간의 구도, 카메라 움직임, 캐릭터 액션을 고정하는 업계 최고의 "Universal Reference" 시스템을 갖춘 ByteDance의 멀티모달 비디오 모델에 대한 프로덕션 액세스를 제공합니다. 단 한 번의 API 호출로 디렉터급 제어를 통합하고, 초당 $0.09의 고정 요금, 즉각적인 키 발급 및 대기자 명단 없이 이용할 수 있으며, 엔터프라이즈급 가동 시간과 규정 준수를 보장합니다. Seedance 2.0 Native 4K가 이제 출시되었습니다!

패밀리 보기

GPT Image 2

GPT Image 2 API는 개발자들에게 GPT Image 1.5의 후속 모델인 OpenAI의 최신 이미지 모델에 대한 액세스를 제공합니다. 이 모델은 라틴 및 CJK 스크립트 전반에 걸쳐 정확한 텍스트 렌더링으로 이미지를 생성 및 편집하며, 포스터, 목업, 인포그래픽을 위한 강력한 구도를 지원합니다. Atlas Cloud에서는 300개 이상의 모델과 함께 하나의 통합된 API를 통해 이에 접근할 수 있으며, 무료 크레딧, 99.99%의 가동 시간을 제공하고 OpenAI 조직 인증이 필요하지 않습니다.

패밀리 보기

Gemini Omni Flash

Gemini Omni API는 Google I/O 2026에서 공개된 Google DeepMind의 멀티모달 비디오 생성·편집 모델을 여러분의 스택으로 가져옵니다. Gemini Omni는 Gemini의 추론 엔진과 생성형 미디어를 결합해 텍스트, 이미지, 비디오, 오디오를 자유롭게 조합한 입력을 받아 일관되고 지식에 기반한 결과물을 만들어 냅니다. 자연스러운 대화로 결과를 다듬어 보세요. 물리 법칙과 캐릭터, 연속성은 그대로 유지한 채 오브젝트를 교체하고 장면을 다시 쓰고 스타일을 바꿀 수 있습니다. Atlas Cloud는 텍스트-투-비디오, 최대 7장의 참조 이미지를 지원하는 이미지-투-비디오, 참조-투-비디오까지 Gemini Omni Flash 전체 라인업을 하나의 통합 API로 제공하며, $0.112부터 시작하는 투명한 초당 과금에 구독도 필요 없습니다. 지금 바로 개발을 시작하세요.

패밀리 보기

Grok Imagine

Grok Imagine API는 Image 2.0에서 Video 1.5 및 xAI TTS v1에 이르는 xAI의 이미지, 비디오, 음성 모델을 지원합니다. 14가지 화면비로 1K 또는 2K 스틸을 렌더링하고, 장면을 15초 1080p 동영상으로 변환하며, 최대 7개의 참조 이미지로 샷을 조정하거나 20개 언어로 나레이션할 수 있습니다. Atlas Cloud는 모든 기능을 하나의 엔드포인트에서 제공하며, 이미지당 $0.02, 초당 $0.05의 종량제 요금이 적용됩니다. 오늘부터 구축을 시작하세요.

패밀리 보기

Google

Google의 가장 강력한 크리에이티브 모델은 모두 Atlas Cloud에서 사용할 수 있습니다. Veo 3.1은 영화 수준의 비디오 생성을 제공하고, Nano Banana 2는 고충실도 이미지 생성을 지원하며, Gemini는 모든 워크플로우에 멀티모달 인텔리전스를 제공합니다. Day-0 가용성과 종량제(pay-as-you-go) 요금제로 단일 API key를 통해 전체 Google 모델 제품군에 액세스하세요.

패밀리 보기

Seedance 2.0 Mini

Seedance 2.0 Mini는 속도와 비용이 가장 중요한 워크플로우에 ByteDance의 멀티모달 비디오 생성 기능을 제공합니다. 더 빠른 생성, 비디오당 더 낮은 비용, 그리고 이미 사용 중인 것과 동일한 API 통합 등 더 가벼운 풋프린트로 Seedance 2.0의 핵심 기능을 제공합니다. 대규모 파이프라인을 운영하거나 대규모 프로토타이핑을 수행하는 팀에게 Mini는 실용적인 기본 선택입니다.

패밀리 보기

ByteDance

시네마틱 비디오 생성부터 고해상도 이미지 제작까지, ByteDance의 가장 강력한 모델들이 현재 Atlas Cloud에 라이브로 제공됩니다. 가장 낮은 추론 가격과 인프라 오버헤드 없이 대규모로 Seedance와 Seedream을 실행해 보세요.

패밀리 보기

Alibaba

Atlas Cloud는 Alibaba의 전체 모델 라인업을 단일 API로 통합합니다. 언어 및 이미지 작업을 위한 Qwen, 최대 1080p 비디오 생성을 위한 Wan을 제공합니다. 구독 없이 사용한 만큼만 지불하는(pay-as-you-go) 방식으로 모든 모델에 액세스하세요. Alibaba API는 기존의 OpenAI 호환 클라이언트를 사용하여 단일 기본 URL(base URL)을 통해 사용할 수 있습니다.

패밀리 보기

하나의 API로 모든 미디어 AI를.

모든 모델 탐색