


FLUX 3 API는 Black Forest Labs의 최신 파운데이션 모델을 기술 스택에 도입합니다. 이미지, 비디오, 오디오를 공동 학습한 단일 Self-Flow 아키텍처입니다. 한 번의 호출로 다국어 대화, 효과음, 앰비언스를 포함한 최대 20초 길이의 클립을 생성하거나, 정확한 타이포그래피가 적용된 text-to-image 작업을 렌더링할 수 있습니다. Atlas Cloud는 하나의 OpenAI 호환 키로 이를 제공하며, 호출별 종량제 요금과 Day-0 액세스를 지원합니다.
Atlas Cloud는 업계 최고의 최신 크리에이티브 모델을 제공합니다.
하나의 FLUX 3 API 표면 뒤에 5개의 비디오 엔드포인트가 있으며, 아래 표는 각 엔드포인트가 무엇을 입력으로 받고, 무엇을 반환하며, 초당 비용이 얼마인지 보여줍니다.
| 모달리티 | 설명 |
|---|---|
| FLUX 3 T2V API (Text to Video) | 텍스트 프롬프트를 5~20초 길이의 클립으로 변환하며, generate_audio가 기본적으로 활성화되어 있어 같은 패스에서 오디오도 함께 생성됩니다. 출력은 21:9부터 9:16까지 7가지 고정 화면비와 auto 옵션에서 720p 또는 1080p로 생성되며, seed 값을 사용하면 어떤 결과든 재현할 수 있습니다. 가격은 생성된 비디오 기준 초당 $0.17입니다. |
| FLUX 3 I2V API (Image to Video) | PNG, JPEG 또는 WebP 이미지 한 장을 제공하면 모델이 해당 프레임에서부터 앞으로 애니메이션을 생성하며, 프롬프트에서 움직임과 페이싱을 가져옵니다. 길이는 5~20초 사이에서 자유롭게 선택할 수 있어, 이미 보유한 아트워크를 기반으로 한 제품 샷, 캐릭터 인트로, 소셜용 짧은 편집본에 적합합니다. 과금은 생성된 비디오 기준 초당 $0.17입니다. |
| FLUX 3 Keyframes API (Keyframes to Video) | 샷이 특정 비트를 정확히 맞춰야 할 때, 최대 10개의 키프레임 이미지를 24 fps 타임라인의 정확한 프레임 위치에 고정할 수 있습니다. 각 frame_index는 duration에 24를 곱한 범위 안에 있어야 하므로, 스토리보드 및 프리비즈 팀이 무엇이 언제 나타나는지 직접 제어할 수 있습니다. 요금은 다른 생성 엔드포인트와 동일하게 생성된 비디오 기준 초당 $0.17입니다. |
| FLUX 3 FLF API (First and Last Frame to Video) | 클립이 정확한 마지막 이미지에 도달해야 하나요? start_image_url과 end_image_url을 전달하면 샷의 양끝을 고정하고, 모델이 그 사이의 움직임을 채웁니다. 로고 리빌, 변형 시퀀스, 주변 푸티지와 맞아야 하는 장면 전환에 모두 적합하며, 가격은 생성된 비디오 기준 초당 $0.17입니다. |
| FLUX 3 Extend API (Video Extension) | 이 엔드포인트에서는 기존 푸티지가 이야기를 이어갑니다. 50 MB 미만이고 15초보다 짧은 MP4가 프롬프트에 따라 마지막 프레임 이후로 연장됩니다. 오디오는 영상과 함께 계속 생성되며, 동일하게 720p 또는 1080p 출력과 5~20초 범위가 적용됩니다. 연장은 생성된 비디오 기준 초당 $0.41로 책정됩니다. |
Black Forest Labs가 하나의 멀티모달 백본 위에 구축한 FLUX 3 API는 같은 패스에서 대사, 효과음, 앰비언스까지 생성된 HD 또는 Full HD 영상 최대 20초를 반환하며, 진행 중 샷, 키프레임, 언어, 화면 내 텍스트에 대한 디렉션도 함께 반영합니다.
하나의 호출로 5초에서 20초 길이의 영상이 같은 패스 안에서 생성된 오디오와 함께 반환되며, 이후에 따로 더빙되지 않습니다. 대사, 효과음, 배경 음향은 이벤트가 발생한 정확한 프레임에 맞춰 들어가고, 출력은 720p HD 또는 1080p Full HD로 도착합니다. 그 타이밍 덕분에 웍이 확 타오르거나 문이 쾅 닫히는 장면도 조합한 것이 아니라 실제 촬영된 것처럼 보입니다.
컷을 요청하면 모델이 그대로 만들어냅니다. 같은 생성 안에서 장면과 카메라 앵글이 바뀌면서도, 캐릭터, 의상, 조명 로직은 모든 샷에 걸쳐 일관되게 유지됩니다. 더 긴 결과물은 agentic clip chaining으로 만들며, 별도의 생성 결과를 연결해 분 단위 시퀀스로 이어집니다. 예전에는 렌더 4번과 편집기가 필요했던 스토리보드도 이제는 하나의 연속된 결과물로 돌아옵니다.
텍스트만으로, 하나의 스틸컷으로, 첫 프레임과 마지막 프레임 쌍으로, 타임라인 전반에 배치된 키프레임으로, 또는 기존 클립을 이어서: 다섯 가지 진입 방식이 모두 지원됩니다. 키프레임은 무엇이 언제 일어나는지를 고정하고, continuation은 이미 보유한 영상에서 이어받습니다. 브랜드 스틸컷이나 반쯤 완성된 컷을 보관 중인 스튜디오는 모든 샷을 처음부터 설명하지 않고도 그 자산에서 바로 시작할 수 있습니다.
네이티브 대사는 영어 방언, 중국어, 스페인어, 프랑스어, 독일어, 일본어, 포르투갈어, 러시아어, 이탈리아어, 인도네시아어, 튀르키예어, 힌디어, 펀자브어 등으로 지원되며, 요청한 언어에 맞춰 입 모양도 일치합니다. 타이포그래피도 장면의 일부로 렌더링되므로, 표지판과 타이틀이 나중에 합성되는 것이 아니라 프레임 안에 그대로 들어갑니다. 따라서 하나의 프롬프트로 문구까지 이미 반영된 현지화 스팟을 바로 내보낼 수 있습니다.
Atlas Cloud는 나머지 카탈로그를 감싸는 동일한 통합 엔드포인트를 통해 FLUX 3를 제공하므로, 하나의 키로 video, image, language 모델에 두 번째 연동 없이 접근할 수 있습니다. 과금은 구독이나 좌석 요금 없이 pay as you go로 유지되며, 실제로 실행한 생성에 대해서만 비용을 지불합니다. 모델을 바꾸는 일은 문자열 하나를 바꾸는 것뿐입니다. 지금 바로 시작하세요.
아래 각 행은 동일한 단일 프롬프트를 Atlas Cloud의 FLUX 3 API와 다른 두 비디오 모델에 실행한 결과입니다. 선별된 데모가 아니라 같은 브리프를 기준으로 동작의 연속성, 샷 전환, 네이티브 오디오를 판단할 수 있습니다.
시네마틱 실사 스타일, 비에 젖어 번들거리는 밤의 도쿄 뒷골목. 작은 노란 우비를 입은 시바견이 스케이트보드를 타고 골목을 내려가며 물웅덩이와 증기 배출구 사이를 요리조리 빠져나간다. 보드 바로 뒤에서 젖은 포장도로를 스치듯 따라가는 로우 앵글 트래킹 샷으로 시작하고, 네온 반사가 길게 스쳐 지나간다. 개가 종이 등불 더미를 스치자 등불들이 공중으로 흩어지고, 휩 팬으로 빙글빙글 도는 등불 하나를 따라가며 라멘 가판대 쪽으로 굴러가는 모습을 보여준다. 드론 샷으로 컷해 위로 올라가며 뒤로 빠지는 동안, 시바견이 앞발을 세게 내리쳐 보드를 회전시켜 급정지하고, 웃고 있는 라멘 셰프에게 한 번 짖는다. 셰프가 차슈 한 조각을 튕겨 보내자 개가 공중에서 받아 문다. 차가운 네온과 대비되는 따뜻한 가판대 조명, 뒤에서 비춰지는 물보라. 오디오: 쉭쉭 내리는 빗소리, 돌바닥 위를 구르는 우레탄 바퀴의 rumble, 지글거리는 웍, 날카로운 짖음 한 번, 어딘가 위를 지나가는 기차 소리. 16:9 화면비.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
손으로 그린 애니메이션 스타일, 끝없는 구름 바다 위의 밝은 정오. 10대 하늘 낚시꾼이 나무 비행선 갑판에 버티고 서서 긴 낚싯줄을 구름 바다 아래로 던진다. 난간 너머 1인칭 POV로 시작해, 낚싯줄이 휙 날아가 하얀 구름 속으로 사라진다. 낚싯대가 팽팽하게 휘어지고, 카메라는 갑판을 빠르게 도는 오빗 샷으로 컷한다. 그녀는 판자 위로 끌려가고, 밧줄은 장갑 사이로 연기를 내며 미끄러지며, 한쪽 부츠가 rigging 코일에 걸린다. 그녀가 난간에 발을 딛고 힘껏 뒤로 당기는 순간, 고래만 한 잉어가 그녀 뒤편 구름을 뚫고 솟구치고, 비늘이 돛 위로 무지갯빛을 흩뿌린다. 승무원들이 환호성을 터뜨리고 구름 물보라가 프레임을 가로질러 떠다니는 로우 앵글 히어로 샷으로 마무리. 회화적인 cel shading, 따뜻한 rim light, 눈에 보이는 붓질 질감. 오디오: 세차게 몰아치는 바람, 삐걱이는 밧줄, 점점 고조되는 오케스트라 swell, 솟구치는 순간의 깊고 물기 어린 boom. 16:9 화면비.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
네이티브 오디오가 포함된 20초 분량의 소셜 클립이든, 키프레임 기반 스토리보드든, 현지화된 광고 컷이든, 최종 렌더링 전 빠른 초안 패스든, FLUX 3 API는 Atlas Cloud에서 종량제 요금과 Day-0 액세스로 모두 지원합니다.
하나의 텍스트 프롬프트로 최대 20초 분량의 비디오를 생성하고, 프레임과 함께 음성, 효과음, 앰비언스까지 제작합니다. 소셜 팀은 별도의 오디오 작업 없이 완성된 클립을 얻을 수 있습니다.
정렬된 키프레임을 사용하면 FLUX 3 API가 하나의 생성 과정 안에서 카메라 앵글과 설정을 전환하며 정의된 순간들을 따라 장면을 전개할 수 있습니다. 스토리보드 아티스트는 촬영을 예약하기 전에 전체 시퀀스를 미리 확인할 수 있습니다.
생성된 장면 안에서 타이포그래피가 정확하게 렌더링되며, 다국어 텍스트 처리도 이전 FLUX 세대보다 개선되었습니다. 패키징 목업, 타이틀 카드, 현지화된 배너를 단일 호출로 생성해 바로 검토할 수 있습니다.
여섯 개 시장에 같은 광고 영상이 필요하신가요? FLUX 3 API는 비디오와 동기화된 다국어 대사를 생성하므로, 더빙 단계 없이 각 컷에 자체 현지화 음성 트랙을 담을 수 있습니다.
기존 영상을 새로운 맥락으로 가져가거나, 어울리는 오디오로 확장하거나, 핵심 요소는 그대로 유지한 채 재구성할 수 있습니다. 에이전시는 추가 촬영을 의뢰하는 대신 오래된 캠페인 자산을 되살릴 수 있습니다.
초안 모드는 더 낮은 비용으로 빠른 HD 미리보기를 반환하며, 승인된 샷은 FLUX 3 API를 통해 HD 또는 FHD로 다시 렌더링할 수 있습니다. 콘셉트에 스무 번의 시도가 필요해도 반복 작업 비용을 부담 가능한 수준으로 유지할 수 있습니다.
클립 길이, 출력 해상도, 네이티브 오디오, 초당 비용을 비교해 FLUX 3 API가 앞서는 지점과 다른 Atlas Cloud 모델이 파이프라인에 더 적합할 수 있는 지점을 확인하세요.
| Model | 최대 클립 길이 | 최대 출력 해상도 | 네이티브 오디오 | 초당 가격 |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, 프레임당 최대 2 MP | √ 대화, SFX, 주변음 | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, 프레임당 최대 2 MP | √ 대화, SFX, 주변음 | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ 기본으로 켜짐 | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ 선택 사항, 기본 꺼짐 | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p 네이티브, 1440p-SR | √ SFX, 음악, 주변음 | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ 동기화된 오디오 | $0.20 |
몇 분 만에 시작하세요 — 간단한 단계를 따라 Atlas Cloud 플랫폼을 통해 모델을 통합하고 배포하세요.
atlascloud.ai에서 가입하고 인증을 완료하세요. 신규 사용자는 플랫폼 탐색과 모델 테스트를 위한 무료 크레딧을 받습니다.
고급 FLUX 3 모델과 Atlas Cloud의 GPU 가속 플랫폼을 결합하여 비교할 수 없는 성능, 확장성 및 개발자 경험을 제공합니다.
낮은 지연 시간:
실시간 추론을 위한 GPU 최적화 추론.
통합 API:
하나의 통합으로 FLUX 3, GPT, Gemini 및 DeepSeek를 실행합니다.
투명한 가격:
Serverless 옵션을 포함한 예측 가능한 token당 청구.
개발자 경험:
SDK, 분석, 파인튜닝 도구 및 템플릿.
신뢰성:
99.99% 가동 시간, RBAC 및 규정 준수 로깅.
보안 및 규정 준수:
SOC 2 Type II, HIPAA 준수, 미국 내 데이터 주권.
FLUX 3는 Black Forest Labs의 멀티모달 파운데이션 모델로, 이미지, 비디오, 오디오, 액션 예측을 서로 다른 시스템을 이어 붙이는 방식이 아니라 하나의 모델로 함께 학습했습니다. FLUX 3 API는 Atlas Cloud를 통해 이 모델을 제공하므로, 단일 요청으로 동기화된 오디오가 포함된 비디오를 반환합니다. 하나의 OpenAI-compatible 키로 카탈로그의 다른 모든 모델과 함께 사용할 수 있으며, 사용량 기준으로 과금됩니다.
현재 일반 제공되는 기능은 비디오입니다. 텍스트-투-비디오, 이미지-투-비디오, 키프레임 가이드 샷, 기존 클립의 이어 만들기를 지원하며, 각 항목에 선택적으로 네이티브 오디오를 붙일 수 있습니다. Black Forest Labs는 제품군을 단계적으로 공개하고 있으므로, FLUX 3 Image와 FLUX 3 Action은 비디오 엔드포인트와 함께 제공되는 것이 아니라 그 뒤를 잇습니다.
계정을 만들고 API 키를 생성한 다음, 기존 클라이언트를 FLUX 3 API 엔드포인트로 지정하면 됩니다. 요청 형식은 Atlas Cloud 카탈로그 전반에서 쓰이는 동일한 OpenAI-compatible 패턴을 따르므로, 별도의 SDK를 새로 익힐 필요도 없고 나중에 벤더 종속성을 풀어낼 걱정도 없습니다. 과금은 생성 단위 종량제이며, 먼저 구독에 가입할 필요가 없습니다. 오늘 바로 개발을 시작하세요.
네. 그리고 별도의 두 번째 모델이 아니라 동일한 생성 과정에서 처리되므로, 대사, 효과음, 앰비언스가 화면과 잘 맞습니다. FLUX 3는 영어, 중국어, 스페인어, 일본어, 힌디어를 포함한 12개가 넘는 언어에서 립싱크가 맞는 음성을 처리합니다. 무음 영상만 필요할 때는 요청별로 오디오를 끌 수 있습니다.
생성 길이는 5초에서 20초까지이며, 기본 출력은 HD 720p이고 디테일이 비용보다 중요할 때는 Full HD 1080p도 사용할 수 있습니다. 와이드스크린, 정사각형, 세로 구도를 모두 지원하므로 같은 프롬프트로 랜딩 페이지 히어로나 모바일 피드에 맞출 수 있습니다. 더 긴 스토리는 한 번에 과도하게 요청하기보다, 여러 개의 통제된 클립으로 구성하는 것이 가장 좋습니다.
시작 이미지를 제공하면 모델이 이를 애니메이션화하고, 샷이 정해진 순서의 특정 지점을 정확히 맞춰야 할 때는 키프레임을 고정할 수 있습니다. 기존 영상도 이어서 생성할 수 있으며, 입력 클립의 끝부분에서 모션과 구도를 그대로 이어받습니다. 연장을 거듭할수록 시각적 일관성이 조금씩 흔들릴 수 있으므로, 연속 이어 만들기는 필요한 만큼만 사용하는 것이 좋습니다.
Draft 모드는 저비용 HD 미리보기를 반환하므로, 최종 렌더링 비용을 지불하기 전에 구도, 템포, 오디오를 판단할 수 있습니다. 그곳에서 프롬프트를 반복 조정한 뒤, 요청 구조는 그대로 둔 채 성공한 프롬프트를 표준 HD 또는 Full HD로 다시 실행하면 됩니다. 여러 변형안을 빠르게 내보내는 팀일수록 이 반복 과정에서 가장 큰 가치를 얻습니다.
비디오는 출력 초 단위로 과금되므로, 짧은 클립은 긴 클립의 일부 비용만 들고 실제로 생성한 만큼만 지불하면 됩니다. 요금은 해상도에 따라 달라지며, Full HD는 표준 HD보다 높고 Draft 모드는 둘 다보다 낮습니다. Atlas Cloud는 여기에 구독료, 좌석당 요금, 최소 사용 금액을 추가로 붙이지 않습니다. 오늘 시작하세요.
아직은 아닙니다. 현재 출시된 것은 FLUX 3 Video이며, FLUX 3 Image는 단계적 배포 중이고 오픈 웨이트 FLUX 3 Dev 변형은 추후 공개 예정입니다. Atlas Cloud는 새 FLUX 3 엔드포인트가 출시되는 대로 추가하므로, 이미지 생성이 제공되더라도 같은 키를 계속 사용할 수 있습니다.
공동 모델은 이어 붙이는 단계를 없앱니다. 입 모양에 맞춰 음성을 다시 맞추는 두 번째 패스도, 완성된 컷 아래에 앰비언스를 덧씌우는 작업도 필요 없습니다. 이 차이는 특히 대화 장면에서 중요합니다. 트랙 간 어긋남이 시청자에게 바로 드러나기 때문입니다. 파이프라인은 여러 서비스에서 단일 호출로 줄어들고, 그만큼 모니터링해야 할 실패 지점도 줄어듭니다.
Atlas Cloud를 최대한 활용할 수 있는 가이드, 튜토리얼, 제품 업데이트.