


A FLUX 3 API traz o novo modelo de base da Black Forest Labs para a sua stack, uma única arquitetura Self-Flow treinada conjuntamente em imagens, vídeo e áudio. Gere clipes de até 20 segundos com diálogos multilíngues, efeitos sonoros e ambiência em uma única passagem, ou renderize tarefas de text-to-image com tipografia precisa. A Atlas Cloud o disponibiliza com uma única chave compatível com OpenAI, cobrança pay-as-you-go por chamada e acesso Day-0.
O Atlas Cloud oferece os modelos criativos mais avançados e inovadores do setor.
Cinco endpoints de vídeo estão reunidos numa única superfície da API FLUX 3, e a tabela abaixo mostra o que cada um recebe, o que devolve e quanto custa por segundo.
| Modalidade | Descrição |
|---|---|
| FLUX 3 T2V API (Texto para vídeo) | Prompts de texto transformam-se em clipes de 5 a 20 segundos com áudio gerado na mesma execução, já que generate_audio vem ativado por padrão. A saída é gerada em 720p ou 1080p em sete proporções fixas, de 21:9 a 9:16, além de uma opção automática, e um valor de seed torna qualquer resultado reproduzível. O preço é de $0.17 por segundo de vídeo gerado. |
| FLUX 3 I2V API (Imagem para vídeo) | Forneça uma única imagem PNG, JPEG ou WebP e o modelo anima a partir desse frame, usando o prompt para definir o movimento e o ritmo. A duração pode ser escolhida em qualquer valor entre 5 e 20 segundos, ideal para imagens de produto, introduções de personagens e versões curtas para redes sociais criadas a partir de arte que você já possui. A cobrança é de $0.17 por segundo de vídeo gerado. |
| FLUX 3 Keyframes API (Keyframes para vídeo) | Quando uma tomada precisa cumprir momentos específicos, é possível fixar até 10 imagens de keyframe em posições exatas de frame numa linha do tempo de 24 fps. Cada frame_index deve permanecer dentro de duration multiplicado por 24, dando às equipes de storyboard e previz controle direto sobre o que aparece e quando. A tarifa é igual à dos outros endpoints de geração: $0.17 por segundo de vídeo gerado. |
| FLUX 3 FLF API (Primeiro e último frame para vídeo) | Precisa que um clipe termine numa imagem final exata? Ao passar start_image_url e end_image_url, as duas pontas da tomada ficam fixas enquanto o modelo preenche o movimento entre elas. Revelações de logotipos, sequências de transformação e transições de cena que precisam corresponder ao material ao redor encaixam-se aqui, a $0.17 por segundo de vídeo gerado. |
| FLUX 3 Extend API (Extensão de vídeo) | Neste endpoint, o vídeo existente leva a história adiante: um MP4 com menos de 50 MB e menos de 15 segundos é continuado a partir de seus frames finais de acordo com o prompt. O áudio continua sendo gerado junto com a imagem, e a mesma saída em 720p ou 1080p e o intervalo de 5 a 20 segundos ainda se aplicam. A extensão custa $0.41 por segundo de vídeo gerado. |
Desenvolvido pela Black Forest Labs em uma única base multimodal, a API FLUX 3 retorna até vinte segundos de vídeo em HD ou Full HD com diálogos, efeitos sonoros e ambiência gerados no mesmo processo, e aceita direção de tomadas, keyframes, idiomas e texto na tela ao longo do caminho.
Uma única chamada devolve de 5 a 20 segundos de vídeo com áudio gerado no mesmo processo, nunca dublado depois. Diálogos, efeitos sonoros e bases de ambiência entram exatamente no frame em que o evento acontece, e a saída chega em 720p HD ou 1080p Full HD. Esse sincronismo é o que faz uma labareda numa wok ou uma porta batendo parecerem filmados, e não montados.
Peça um corte e o modelo entrega. Cenas e ângulos de câmera mudam dentro de uma única geração, enquanto o mesmo personagem, figurino e lógica de iluminação se mantêm em todas as tomadas. Trechos mais longos vêm do encadeamento agêntico de clipes, que liga gerações separadas em sequências que duram minutos. Storyboards que antes exigiam quatro renders e um editor agora voltam como uma peça contínua.
Só texto, uma única imagem estática, um par de primeiro e último frame, keyframes distribuídos ao longo da timeline ou um clipe existente para continuar: todos os cinco pontos de entrada são suportados. Os keyframes fixam o que acontece e quando, enquanto a continuação retoma a partir de imagens que você já tem. Estúdios com stills de marca ou cortes pela metade podem começar desses ativos em vez de descrever cada tomada do zero.
O diálogo nativo abrange variantes do inglês, chinês, espanhol, francês, alemão, japonês, português, russo, italiano, indonésio, turco, hindi, punjabi e outros, com movimento labial ajustado ao idioma que você solicitar. A tipografia também é renderizada como parte da cena, então sinalização e títulos ficam dentro do frame em vez de serem compostos depois. Assim, um único prompt pode entregar uma peça localizada com a tipografia já no lugar.
O Atlas Cloud oferece FLUX 3 pelo mesmo endpoint unificado que atende ao restante do catálogo, então uma única chave alcança modelos de vídeo, imagem e linguagem sem uma segunda integração. A cobrança continua no modelo pay as you go, sem assinatura e sem taxas por usuário, e você paga apenas pelas gerações que realmente executar. Trocar de modelo é só mudar uma string. Comece a construir hoje.
Cada linha abaixo executa um único prompt idêntico pela FLUX 3 API e por dois outros modelos de vídeo no Atlas Cloud, para que a continuidade do movimento, as mudanças de plano e o áudio nativo possam ser avaliados com base no mesmo brief, e não em demos escolhidas a dedo.
Imagem real cinematográfica, ruela de Tóquio à noite, com o chão molhado pela chuva. Um Shiba Inu com uma minúscula capa de chuva amarela anda de skate pelo beco, desviando de poças e saídas de vapor. Começar com um travelling em ângulo baixo, rente ao pavimento molhado, logo atrás da prancha, com reflexos de neon passando em rastros. O cachorro esbarra numa pilha de lanternas de papel e elas explodem no ar, e uma panorâmica rápida acompanha uma lanterna girando enquanto ela cai em direção a uma barraca de ramen. Cortar para um plano de drone subindo e recuando enquanto o Shiba bate uma pata no chão, gira o skate até uma parada brusca e late uma vez para o chef de ramen risonho, que lança uma fatia de chashu que o cachorro apanha no ar. Luz quente da barraca contra o neon frio, spray de água iluminado por trás. Áudio: chuva sibilante, rodas de uretano roncando sobre pedra, um wok chiando, um latido agudo, um trem passando em algum lugar acima. 16:9 aspect ratio.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Estilo anime pintado à mão, meio-dia luminoso acima de um mar infinito de nuvens. Uma adolescente pescadora do céu se firma no convés de uma aeronave de madeira e lança uma longa linha para baixo, dentro do mar de nuvens. Começar com um POV em primeira pessoa sobre o parapeito enquanto a linha chicoteia para fora e desaparece no branco. A vara fica subitamente esticada, e a câmera corta para uma órbita rápida ao redor do convés enquanto ela é arrastada pelas tábuas, a corda fumegando através das luvas, uma bota prendendo-se a uma espiral de cordame. Ela apoia um pé no parapeito e puxa com força no exato momento em que uma koi do tamanho de uma baleia rompe as nuvens atrás dela, com escamas lançando luz de arco-íris sobre as velas. Terminar com um hero shot em ângulo baixo enquanto a tripulação explode em vivas e a névoa das nuvens atravessa o quadro. Cel shading pictórico, luz de recorte quente, textura de pincel visível. Áudio: vento cortante, corda rangendo, um crescendo orquestral em ascensão, um estrondo aquático profundo no salto. 16:9 aspect ratio.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Seja o trabalho um clipe para redes sociais de vinte segundos com áudio nativo, um storyboard com keyframes, uma versão localizada de anúncio ou uma passagem rápida de rascunho antes da renderização final, a FLUX 3 API cobre tudo na Atlas Cloud, com preços pay-as-you-go e acesso Day-0.
Gere até vinte segundos de vídeo a partir de um único prompt de texto, com fala, efeitos e ambiência produzidos junto com os frames. As equipes de redes sociais recebem um clipe finalizado sem precisar de uma etapa separada de áudio.
Keyframes ordenados permitem que a FLUX 3 API conduza uma cena por momentos definidos, alterando ângulos de câmera e cenários dentro de uma única geração. Artistas de storyboard podem pré-visualizar uma sequência completa antes de qualquer filmagem ser agendada.
A tipografia é renderizada com precisão dentro das cenas geradas, e o processamento de texto multilíngue melhora o que as gerações anteriores do FLUX ofereciam. Mockups de embalagens, cartões de título e banners localizados saem de uma única chamada prontos para revisão.
Precisa do mesmo spot em seis mercados? A FLUX 3 API gera diálogos multilíngues sincronizados com o vídeo, para que cada versão tenha sua própria faixa de voz localizada sem uma etapa de dublagem.
Filmagens existentes podem ser levadas para novos contextos, estendidas com áudio correspondente ou remodeladas mantendo intactos seus elementos centrais. Agências revitalizam ativos de campanhas antigas em vez de encomendar outra filmagem.
O modo de rascunho retorna rapidamente uma prévia em HD a um custo menor, e as tomadas aprovadas são renderizadas novamente em HD ou FHD por meio da FLUX 3 API. A iteração continua acessível quando um conceito precisa de vinte tentativas.
Compare a duração do clipe, a resolução de saída, o áudio nativo e o custo por segundo para ver onde a FLUX 3 API sai na frente e onde outro modelo da Atlas Cloud pode se adequar melhor ao seu pipeline.
| Modelo | Duração Máxima do Clipe | Resolução Máxima de Saída | Áudio Nativo | Preço por Segundo |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, até 2 MP por frame | √ diálogo, SFX, ambiência | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, até 2 MP por frame | √ diálogo, SFX, ambiência | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ ativado por padrão | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ opcional, desativado por padrão | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p nativo, 1440p-SR | √ SFX, música, ambiência | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ áudio sincronizado | $0.20 |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de FLUX 3 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar FLUX 3, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
FLUX 3 é o modelo de base multimodal da Black Forest Labs, treinado conjuntamente em imagem, vídeo, áudio e previsão de ações, em vez de ser montado a partir de sistemas separados. A API FLUX 3 expõe esse modelo através da Atlas Cloud, para que uma única solicitação retorne vídeo com áudio sincronizado. Uma chave compatível com OpenAI cobre este e todos os outros modelos do catálogo, com cobrança por uso.
Vídeo é o recurso geralmente disponível, abrangendo texto para vídeo, imagem para vídeo, cenas guiadas por keyframes e continuação de um clipe existente, cada um com áudio nativo opcional. A Black Forest Labs está lançando a família em fases, portanto FLUX 3 Image e FLUX 3 Action vêm depois dos endpoints de vídeo, em vez de serem lançados junto com eles.
Crie uma conta, gere uma chave de API e aponte seu cliente existente para o endpoint da API FLUX 3. As solicitações seguem o mesmo padrão compatível com OpenAI usado em todo o catálogo da Atlas Cloud, então não há um SDK separado para aprender nem dependência de fornecedor para desfazer depois. A cobrança é pay-as-you-go por geração, sem assinatura para contratar antes. Comece a criar hoje.
Sim, e isso acontece na mesma passagem de geração, em vez de usar um segundo modelo, o que mantém diálogos, efeitos sonoros e ambiência alinhados à imagem. O FLUX 3 lida com fala com sincronização labial em mais de uma dúzia de idiomas, incluindo inglês, chinês, espanhol, japonês e hindi. O áudio pode ser desativado por solicitação quando você precisa apenas de imagens sem som.
As gerações vão de 5 a 20 segundos, com saída em HD 720p e Full HD 1080p disponível quando o detalhe importa mais do que o custo. Enquadramentos widescreen, quadrados e verticais são todos compatíveis, então o mesmo prompt pode ser direcionado ao hero de uma landing page ou a um feed mobile. Histórias mais longas funcionam melhor quando construídas a partir de vários clipes controlados, em vez de uma única solicitação grande demais.
Forneça uma imagem inicial e o modelo a anima, ou fixe keyframes quando uma cena precisa atingir momentos específicos em uma ordem definida. Filmagens existentes também podem ser continuadas, com movimento e enquadramento preservados a partir do final do clipe de entrada. Encadeie continuações com moderação, pois a consistência visual tende a se desviar à medida que cada extensão se baseia na anterior.
O modo Draft retorna uma prévia em HD de menor custo para que composição, ritmo e áudio possam ser avaliados antes de pagar por uma renderização final. Itere nos prompts ali e, em seguida, execute novamente o prompt vencedor em HD padrão ou Full HD sem alterar a estrutura da solicitação. Equipes que lançam muitas variantes extraem o maior valor desse ciclo.
Vídeo é cobrado por segundo de saída, então um clipe curto custa uma fração de um longo, e você paga apenas pelo que realmente gera. A resolução define a tarifa, com Full HD acima do HD padrão e o modo Draft abaixo de ambos. A Atlas Cloud não adiciona assinatura, taxa por usuário nem gasto mínimo. Comece hoje.
Ainda não. FLUX 3 Video é a parte já lançada da família, enquanto FLUX 3 Image está em implantação faseada e uma variante FLUX 3 Dev com pesos abertos foi anunciada para mais tarde. A Atlas Cloud adiciona cada novo endpoint FLUX 3 conforme ele é lançado, então a mesma chave continua funcionando quando a geração de imagens chegar.
Um modelo conjunto elimina a etapa de montagem: não há uma segunda passagem para sincronizar a voz com o movimento da boca nem para inserir ambiência sob um corte finalizado. Isso é mais importante em cenas com diálogo, nas quais qualquer desvio entre as faixas fica imediatamente visível para os espectadores. Os pipelines encolhem de vários serviços para uma única chamada, o que significa menos pontos de falha para monitorar.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.