gemini omni API는 Gemini Omni 1.1 Flash를 비롯한 Google DeepMind의 네이티브 멀티모달 Gemini Omni Flash 제품군을 개발자에게 제공합니다. 동기화된 네이티브 오디오가 포함된 영화 같은 동영상을 만들고, 시작 및 종료 프레임을 정밀하게 제어해 정지 이미지를 애니메이션으로 변환하거나, 변경하지 않은 콘텐츠는 그대로 유지하면서 텍스트로 기존 영상을 편집할 수 있습니다. Atlas Cloud는 하나의 OpenAI 호환 키와 통합 액세스, 투명한 종량제 요금을 제공합니다. 지금 바로 개발을 시작하세요.
Gemini Omni Flash은(는) Google에서 개발한 모델입니다. Atlas Cloud(운영: Atlas Cloud AI LLC)는 해당 모델에 대한 액세스를 제공할 뿐이며 이를 소유하지 않습니다. 모든 상표는 각 소유자에게 귀속됩니다.
Atlas Cloud는 업계 최고의 최신 크리에이티브 모델을 제공합니다.
적절한 엔드포인트를 선택하기 전에 Gemini Omni Flash와 Gemini Omni 1.1 Flash의 텍스트, 이미지, 참조, 편집 및 확장 경로를 비교하세요.
| 모달리티 | 설명 |
|---|---|
| Gemini Omni Flash Reference-to-Video API (R2V) | 텍스트 프롬프트와 1~5개의 참조 이미지를 결합해 네이티브 사운드가 포함된 시네마틱 비디오를 생성합니다. 일관된 피사체, 장면 및 스타일을 유지하므로 브랜드 시퀀스와 반복 등장 캐릭터에 적합한 엔드포인트입니다. |
| Gemini Omni Flash Image-to-Video API (I2V) | 정지 이미지와 텍스트 프롬프트를 바탕으로 원본 피사체와 구도를 유지하면서 시네마틱 사운드 지원 비디오를 생성합니다. 제품 사진, 인물 사진 또는 시각적 콘셉트를 애니메이션으로 만드는 데 사용할 수 있습니다. |
| Gemini Omni Flash Video Edit API | 기존 비디오에 텍스트 지시와 선택적 참조 이미지를 제공해 네이티브 오디오를 유지하면서 장면의 일관성을 갖춘 변경 사항을 적용합니다. 수정하지 않은 영상은 그대로 보존되므로 집중적인 후반 작업 수정과 시각적 업데이트를 지원합니다. |
| Gemini Omni Flash Text-to-Video API (T2V) | 텍스트 프롬프트만으로 동기화된 네이티브 오디오와 물리 법칙에 기반한 움직임을 갖춘 시네마틱 비디오를 생성합니다. 제어 가능하고 빠른 생성 속도를 바탕으로 콘셉트 시각화, 스토리 개발 및 신속한 비디오 프로토타이핑에 적합합니다. |
| Gemini Omni Flash Reference-to-Video Developer API | 텍스트 프롬프트와 참조 이미지를 사용해 스타일 전이, 장면 편집 또는 캐릭터 삽입 방식으로 기존 비디오 클립을 변환합니다. 제공된 영상의 가이드된 변형이 필요한 크리에이티브 도구에 적합한 개발자용 엔드포인트입니다. |
| Gemini Omni Flash Image-to-Video Developer API | 시각적 정체성이 중요한 경우, 텍스트 프롬프트와 최대 7개의 참조 이미지를 결합해 피사체의 일관성이 유지되는 비디오를 생성합니다. 반복 등장 캐릭터, 카탈로그 시각 자료 및 통일된 캠페인 에셋을 지원하는 워크플로입니다. |
| Gemini Omni Flash Text-to-Video Developer API | 텍스트 프롬프트, 해상도, 화면 비율 및 길이를 지정해 제어 가능한 시네마틱 비디오를 생성합니다. 유연한 출력 설정을 통해 개발자는 플랫폼별 콘텐츠를 준비하고, 크리에이티브 방향을 테스트하며, 자동화된 생성 워크플로를 구축할 수 있습니다. |
| Gemini Omni 1.1 Flash Video Extend API | 기존 클립을 자연스럽게 이어지는 3~10초 길이의 확장 영상으로 계속 생성하면서 네이티브 오디오를 유지합니다. 확장을 연속으로 연결해 긴 장면이나 연속 동작에 사용할 수 있는 최대 40초 길이의 일관된 숏을 구성할 수 있습니다. |
| Gemini Omni 1.1 Flash Video Edit API | 기존 비디오와 텍스트 지시를 엔드포인트에 제공해 추가, 제거, 교체 또는 스타일 변경을 요청합니다. 명시하지 않은 콘텐츠와 네이티브 오디오는 보존하므로 전체 장면을 다시 만들지 않고도 정밀하게 수정할 수 있습니다. |
| Gemini Omni 1.1 Flash Reference-to-Video API (R2V) | 텍스트 프롬프트와 최대 10개의 참조 이미지 및 3개의 참조 비디오 클립을 제공해 네이티브 사운드가 포함된 시네마틱 비디오를 생성합니다. 캐릭터, 제품 및 아트 디렉션의 일관성을 바탕으로 연속 콘텐츠와 통합 캠페인을 지원합니다. |
| Gemini Omni 1.1 Flash Image-to-Video API (I2V) | 텍스트의 안내에 따라 정지 이미지를 네이티브 사운드가 포함된 시네마틱 클립으로 애니메이션화합니다. 선택적 마지막 프레임을 사용하면 숏의 끝부분을 정밀하게 제어할 수 있어 계획된 전환과 제품 공개에 유용한 엔드포인트입니다. |
| Gemini Omni 1.1 Flash Text-to-Video API (T2V) | 텍스트 프롬프트 하나를 동기화된 네이티브 오디오가 포함된 시네마틱 클립으로 변환하면서 길이, 화면 비율 및 해상도를 제어합니다. 하나의 엔드포인트에서 360p 초안부터 4K 출력까지 지원하므로 빠른 미리보기와 고해상도 제공이 모두 가능합니다. |
모든 Gemini Omni Flash API 요청은 텍스트, 이미지, 동영상, 오디오를 원하는 방식으로 조합해 입력하고, 동기화된 사운드를 생성하며, 실제 세계의 물리 법칙을 모델링하고, 대화를 통해 결과를 다듬을 수 있습니다.

자연어로 클립을 다듬으면 Gemini Omni Flash API가 장면의 나머지 부분은 유지한 채 변경 사항을 적용합니다. 상태를 유지하는 Interactions API가 각 대화 차례를 기억하므로 편집 작업이 서로 이어집니다.

Gemini Omni Flash API는 하나의 프롬프트에서 텍스트, 이미지, 동영상, 오디오를 원하는 방식으로 조합해 입력할 수 있습니다. 무엇이든 입력으로 사용할 수 있으므로 이미 보유한 어떤 소스 자료로도 생성을 시작할 수 있습니다.

한 번의 추론 과정에서 화면과 함께 사운드가 생성되므로 대사, 효과음, 주변음이 액션에 정확히 맞춰집니다. Gemini Omni Flash API는 이후에 별도의 오디오 처리 단계를 거칠 필요가 없습니다.

실제 세계의 물리 법칙을 모델링한 Gemini Omni Flash API는 사실적인 반사, 중력, 조명, 날씨를 렌더링합니다. 역동적인 장면에서도 장면이 시각적으로 일관되게 유지되며 아티팩트로 흐트러지지 않습니다.

최대 7개의 참조 이미지와 3개의 짧은 동영상 클립으로 생성을 안내하면 Gemini Omni Flash API가 피사체, 스타일, 장면의 일관성을 유지합니다. 따라서 편집과 장면 전환 전반에서 동일한 정체성을 안정적으로 유지할 수 있습니다.
Gemini Omni와 다른 주요 동영상 모델로 동일한 프롬프트를 생성한 결과: 멀티 샷 및 고급 상업 영화 스타일
3개 장면으로 이어지는 연속 동영상을 생성하세요: 장면 1: 비 오는 도쿄의 거리에서 여성이 네온 불빛 아래 서 있습니다. 젖은 지면에 반사된 빛, 영화 같은 피사계 심도, 핸드헬드 카메라 움직임을 표현하세요. 장면 2: 카메라가 천천히 클로즈업으로 전환됩니다. 여성은 제공된 음성과 정확히 동기화하여 부드럽게 말하며, 입 모양은 음성과 완벽하게 일치합니다. 배경의 차량 흐름은 자연스럽게 이어집니다. 장면 3: 여성이 지하철역으로 들어갑니다. 조명, 날씨, 분위기는 일관되게 유지됩니다. 카메라는 여성의 뒤를 따라가며 인물의 동일성을 유지합니다. 제약 조건: - 모든 장면에서 얼굴의 동일성을 유지할 것 - 조명의 연속성을 보존할 것(비, 네온 반사) - 물리적 사실성을 확보할 것(빗물과의 상호작용, 젖은 표면) - 음성 입력과 시청각 동기화를 보장할 것 - 전환 사이에 장면을 초기화하지 말고, 연속적인 세계 상태를 유지할 것 스타일: 고급 영화 같은 사실성, 필름 그레인, 아나모픽 렌즈, 얕은 피사계 심도, 4K 필름 룩
Gemini Omni
Wan 2.7
Kling v3.0
4개 장면으로 이어지는 연속 동영상을 생성하세요: 장면 1: 자정의 어두운 아파트에서 작은 흰색 로봇이 나무 책상 위에 움직이지 않고 앉아 있습니다. 창문을 통해 달빛이 들어옵니다. 로봇의 눈이 천천히 빛나기 시작하고, 희미한 기계음이 들리기 시작합니다. 장면 2: 로봇이 조심스럽게 책상에서 내려옵니다. 작은 금속 발이 나무 바닥을 디딜 때 부드러운 딸깍 소리가 납니다. 카메라는 낮은 앵글로 로봇을 따라가며 크기와 형태를 일관되게 유지합니다. 장면 3: 로봇이 주방으로 걸어 들어갑니다. 냉장고 문과 타일 바닥에 비친 반사광은 로봇의 움직임에 자연스럽게 반응합니다. 이전 장면의 동일한 달빛과 고요한 밤의 분위기가 계속 이어집니다. 장면 4: 로봇이 창가에 멈춰 서서 도시의 불빛을 바라봅니다. 카메라는 뒤에서 천천히 다가가며 로봇의 정체성, 재질, 크기, 조명, 사운드의 연속성을 보존합니다. 요구 사항: - 모든 장면에서 정확히 동일한 로봇 디자인을 유지할 것 - 장면을 초기화하지 않고 하나의 연속적인 아파트 구조를 보존할 것 - 방에서 방으로 이동해도 조명을 일관되게 유지할 것 - 발걸음 소리와 기계음을 로봇의 움직임에 맞출 것 - 물리적으로 사실적인 반사, 그림자, 사물 간 상호작용을 사용할 것 - 하나의 연속된 세계를 촬영하는 것처럼 장면 사이를 매끄럽게 전환할 것 스타일: 영화 같은 사실성, 고요한 SF 분위기, 부드러운 달빛, 디테일한 재질 표현, 사실적인 카메라 움직임, 얕은 피사계 심도, 고급 상업 영화 룩
Gemini Omni
Kling V3.0
Pixverse v6
제품 캠페인, 대화형 수정, 제어된 전환, 자연스러운 확장, 일관된 브랜드 세계관, 크리에이티브 도구 통합을 아우르는 Gemini Omni API는 첫 프레임부터 최종 편집본까지의 제작을 지원합니다.
동기화된 네이티브 오디오와 함께 제품 스틸 이미지를 영화 같은 영상으로 애니메이션화하고, 필요에 따라 마지막 프레임을 지정할 수 있습니다. 마케팅 팀은 승인된 사진을 출시 티저, 소셜 광고, 완성도 높은 제품 공개 영상으로 전환할 수 있습니다.
추가, 삭제, 교체 또는 스타일 변경을 설명하면 모델이 프롬프트에서 건드리지 않은 모든 요소는 그대로 유지하면서 기존 영상을 업데이트합니다. 편집자는 승인된 장면을 다시 제작하지 않고도 다양한 스타일의 버전과 클라이언트 수정본을 제공할 수 있습니다.
시작 이미지와 제공된 마지막 프레임을 설정하면 Gemini Omni 1.1 Flash가 그 사이의 움직임을 생성합니다. 디자이너는 캠페인 에셋에 활용할 수 있는 제어된 전환, 제품 공개 장면, 시각적 변환을 구현할 수 있습니다.
기존 클립을 3~10초 길이의 자연스럽게 이어지는 세그먼트로 확장하고, 여러 확장본을 연결해 하나의 일관된 시퀀스를 만들 수 있습니다. 영화 제작자와 스토리텔러는 움직임, 사운드, 시각적 연속성을 유지하면서 더 긴 장면을 구성할 수 있습니다.
프롬프트에 최대 10개의 참조 이미지와 3개의 비디오 클립을 결합해 캐릭터, 제품 또는 아트 디렉션을 안내할 수 있습니다. 스튜디오는 캠페인 장면과 에피소드형 콘텐츠 전반에서 인식 가능한 대상과 브랜드 미학을 일관되게 유지할 수 있습니다.
하나의 API 통합으로 텍스트 생성, 이미지 애니메이션, 참조 자료를 활용한 생성, 비디오 편집, 클립 확장 기능을 통합할 수 있습니다. 크리에이터 플랫폼은 별도의 비디오 및 오디오 파이프라인을 각각 구축하지 않고도 연결된 제작 작업 공간을 제공할 수 있습니다.
지원 입력, 참조 용량, 오디오 생성 및 일반 가격을 기준으로 Gemini Omni 1.1 Flash를 포함한 Gemini Omni API 참조 동영상 모델과 주요 대안을 비교합니다.
| 모델 | 허용 입력 | 참조 용량 | 오디오 생성 | 일반 가격 |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Reference-to-Video | 텍스트, 이미지, 동영상 클립 | 최대 이미지 10개 및 동영상 클립 3개 | √ | $0.041/초 |
| Gemini Omni Flash Reference-to-Video | 텍스트, 이미지 | 이미지 1~5개 | √ | $0.135/초 |
| Seedance 2.0 Reference-to-Video | 텍스트, 이미지, 동영상, 오디오 | 최대 이미지 9개, 동영상 3개 및 오디오 클립 3개 | √ | $0.112/초 |
| Wan-2.7 Reference-to-video | 텍스트, 이미지, 동영상, 오디오 | 이미지와 동영상을 합쳐 최대 5개, 선택적 피사체 음성 지원 | √ | $0.10/초 |
| Grok Imagine Video v1.5 Reference-to-Video | 텍스트, 이미지, 사전 설정 음성 | 최대 이미지 7개 및 사전 설정 음성 3개 | √ | $0.08/초 |
몇 분 만에 시작하세요 — 간단한 단계를 따라 Atlas Cloud 플랫폼을 통해 모델을 통합하고 배포하세요.
atlascloud.ai에서 가입하고 인증을 완료하세요. 신규 사용자는 플랫폼 탐색과 모델 테스트를 위한 무료 크레딧을 받습니다.
고급 Gemini Omni Flash 모델과 Atlas Cloud의 GPU 가속 플랫폼을 결합하여 비교할 수 없는 성능, 확장성 및 개발자 경험을 제공합니다.
낮은 지연 시간:
실시간 추론을 위한 GPU 최적화 추론.
통합 API:
하나의 통합으로 Gemini Omni Flash, GPT, Gemini 및 DeepSeek를 실행합니다.
투명한 가격:
Serverless 옵션을 포함한 예측 가능한 token당 청구.
개발자 경험:
SDK, 분석, 파인튜닝 도구 및 템플릿.
신뢰성:
99.99% 가동 시간, RBAC 및 규정 준수 로깅.
보안 및 규정 준수:
SOC 2 Type II, HIPAA 준수, 미국 내 데이터 주권.
Gemini Omni API를 사용하면 개발자가 Atlas Cloud를 통해 Google DeepMind의 네이티브 멀티모달 비디오 생성 및 편집 모델 제품군에 액세스할 수 있습니다. 선택한 endpoint에 따라 텍스트나 이미지로 비디오를 생성하고, 참조 미디어를 사용하며, 기존 영상을 편집하고, 동기화된 네이티브 오디오를 생성할 수 있습니다.
Gemini Omni 1.1 Flash에는 비디오 확장, 첫 프레임과 마지막 프레임 사이의 보간, 360p부터 4K까지의 출력 해상도, 확장된 참조 가이드 기능이 추가되었습니다. 확장 variant는 요청당 3~10초를 추가하며, 여러 요청을 연결해 최대 40초 길이의 일관된 비디오를 만들 수 있습니다.
Atlas Cloud 계정을 만들고 API 키는 서버에 보관한 다음, 워크플로에 맞는 model endpoint를 선택하세요. Atlas Cloud는 OpenAI 호환 키 하나를 제공하며, 각 endpoint에 게시된 schema에서 필요한 prompt, 미디어 입력 및 생성 설정을 정의합니다.
prompt에서 시작할 때는 text to video, 정지 이미지를 애니메이션화할 때는 image to video, 인물의 정체성과 스타일 가이드가 중요할 때는 reference to video를 선택하세요. 기존 영상을 수정하려면 video edit를 사용하고, 장면을 이어가려면 Gemini Omni 1.1 Flash video extend endpoint를 사용하세요.
참조 미디어 제한은 endpoint와 model version에 따라 다릅니다. Gemini Omni 1.1 Flash Reference to Video는 최대 10개의 참조 이미지와 3개의 참조 비디오 클립을 지원합니다. 이전 endpoint는 제한이 다를 수 있으므로 미디어를 제출하기 전에 선택한 endpoint schema를 확인하세요.
Gemini Omni 1.1 Flash는 24 FPS에서 3~10초 길이의 출력을 지원하며, 360p, 720p, 업스케일된 1080p 및 업스케일된 4K 해상도 옵션을 제공합니다. 지원되는 화면 비율은 16:9와 9:16이지만, 사용 가능한 제어 항목은 Atlas Cloud endpoint에 따라 다를 수 있습니다.
예. video edit variant는 텍스트 지시에 따라 요소를 추가, 제거, 교체하거나 스타일을 변경하면서 prompt에 언급되지 않은 영상 부분은 유지합니다. 반복적으로 변경할 때는 구체적인 지시와 선택한 워크플로에서 지원하는 interaction context를 사용하세요.
장면을 이어가려면 Gemini Omni 1.1 Flash video extend endpoint에 기존 클립을 제공하고 3~10초의 추가 분량을 요청하세요. 확장 결과는 총 40초까지 연결할 수 있으며, image to video variant는 제공된 첫 프레임과 마지막 프레임 사이를 보간할 수 있습니다.
Gemini Omni 1.1 Flash의 Atlas Cloud 표준 요금은 text to video, reference to video, video editing 및 video extension의 경우 초당 $0.041이며, image to video는 초당 $0.043입니다. 이전 Gemini Omni Flash endpoint는 사용량 기반 과금으로 초당 $0.112부터 시작하며 구독이 필요하지 않습니다.
생성된 모든 비디오에는 프로그래밍 방식으로 감지할 수 있는 보이지 않는 SynthID 워터마크가 포함됩니다. 안전 필터는 prompt와 생성된 출력 모두에 적용되며, 처리 시간은 길이, 해상도 및 서비스 부하에 따라 달라집니다. 전용 negative prompt, system instruction, temperature, top_p 및 stop sequence 제어는 지원되지 않으므로 제외할 내용은 기본 prompt에 작성하세요.
Atlas Cloud를 최대한 활용할 수 있는 가이드, 튜토리얼, 제품 업데이트.