


La FLUX 3 API porta nel tuo stack il più recente foundation model di Black Forest Labs, un’unica architettura Self-Flow addestrata congiuntamente su immagini, video e audio. Genera clip fino a 20 secondi con dialoghi multilingue, effetti sonori e ambiente in un solo passaggio, oppure esegui il rendering di lavori text-to-image con tipografia accurata. Atlas Cloud lo rende disponibile con un’unica chiave compatibile con OpenAI, prezzi pay-as-you-go per chiamata e accesso Day-0.
Atlas Cloud ti fornisce i più recenti modelli creativi leader del settore.
Cinque endpoint video sono disponibili tramite un’unica superficie API FLUX 3, e la tabella qui sotto mostra cosa accetta ciascuno, cosa restituisce e quanto costa al secondo.
| Modalità | Descrizione |
|---|---|
| FLUX 3 T2V API (da testo a video) | I prompt testuali diventano clip da 5 a 20 secondi con audio generato nello stesso passaggio, poiché generate_audio è abilitato per impostazione predefinita. L’output viene prodotto a 720p o 1080p in sette rapporti d’aspetto fissi, da 21:9 a 9:16, più un’opzione auto, e un valore seed rende qualsiasi risultato riproducibile. Il prezzo è di $0.17 per secondo di video generato. |
| FLUX 3 I2V API (da immagine a video) | Fornisci una singola immagine PNG, JPEG o WebP e il modello la anima a partire da quel frame, ricavando movimento e ritmo dal prompt. La durata è selezionabile ovunque tra 5 e 20 secondi, ideale per scatti di prodotto, introduzioni di personaggi e cutdown social basati su artwork già in tuo possesso. La fatturazione è di $0.17 per secondo di video generato. |
| FLUX 3 Keyframes API (da keyframe a video) | Quando una ripresa deve rispettare momenti precisi, è possibile fissare fino a 10 immagini keyframe in posizioni di frame esatte lungo una timeline a 24 fps. Ogni frame_index deve rientrare nella durata moltiplicata per 24, offrendo ai team di storyboard e previz un controllo diretto su cosa appare e quando. La tariffa è la stessa degli altri endpoint di generazione: $0.17 per secondo di video generato. |
| FLUX 3 FLF API (dal primo e ultimo frame a video) | Hai bisogno che una clip termini su un’immagine finale esatta? Passando start_image_url ed end_image_url si bloccano entrambe le estremità della ripresa mentre il modello genera il movimento tra le due. Reveal di loghi, sequenze di trasformazione e passaggi di scena che devono combaciare con il girato circostante sono tutti casi adatti, a $0.17 per secondo di video generato. |
| FLUX 3 Extend API (estensione video) | Con questo endpoint, il girato esistente porta avanti la storia: un MP4 sotto i 50 MB e più corto di 15 secondi viene continuato a partire dai suoi frame finali secondo il prompt. L’audio continua a essere generato insieme all’immagine, e si applicano ancora gli stessi output a 720p o 1080p e l’intervallo da 5 a 20 secondi. L’estensione costa $0.41 per secondo di video generato. |
Basata da Black Forest Labs su un unico backbone multimodale, l'API FLUX 3 restituisce fino a venti secondi di video HD o Full HD con dialoghi, effetti sonori e ambiente generati nello stesso passaggio, accettando anche indicazioni su inquadrature, keyframe, lingue e testo a schermo durante il processo.
Una singola chiamata restituisce da 5 a 20 secondi di video con audio generato nello stesso passaggio, mai doppiato in un secondo momento. Dialoghi, effetti sonori e tappeti ambientali arrivano esattamente sul frame in cui si verifica l'evento, e l'output è fornito a 720p HD o 1080p Full HD. È questa precisione temporale a far percepire una fiammata nel wok o una porta sbattuta come riprese reali, non come elementi assemblati.
Chiedi un taglio e il modello lo produce. Scene e angoli di camera cambiano all'interno di una sola generazione, mantenendo lo stesso personaggio, guardaroba e coerenza di illuminazione in ogni inquadratura. I contenuti più lunghi nascono dalla concatenazione agentica di clip, che collega generazioni separate in sequenze della durata di minuti. Storyboard che prima richiedevano quattro render e un montatore ora tornano come un unico pezzo continuo.
Solo testo, una singola immagine fissa, una coppia di primo e ultimo frame, keyframe posizionati lungo la timeline o una clip esistente da continuare: tutti e cinque i punti di ingresso sono supportati. I keyframe fissano cosa accade e quando, mentre la continuazione riprende dal materiale che hai già. Gli studi che dispongono di immagini di brand o montaggi parzialmente completati possono partire da quegli asset invece di descrivere ogni inquadratura da zero.
I dialoghi nativi coprono dialetti inglesi, cinese, spagnolo, francese, tedesco, giapponese, portoghese, russo, italiano, indonesiano, turco, hindi, punjabi e altre lingue, con il movimento delle labbra sincronizzato alla lingua richiesta. Anche la tipografia viene renderizzata come parte della scena, quindi insegne e titoli restano dentro il frame invece di essere compositati dopo. Un singolo prompt può quindi produrre uno spot localizzato con il lettering già al suo posto.
Atlas Cloud espone FLUX 3 tramite lo stesso endpoint unificato che serve il resto del catalogo, quindi una sola chiave consente di raggiungere modelli video, image e language senza una seconda integrazione. La fatturazione resta pay as you go, senza abbonamento né costi per seat, e paghi solo le generazioni che esegui davvero. Cambiare modello significa modificare una stringa. Inizia a sviluppare oggi.
Ogni riga qui sotto esegue un singolo prompt identico tramite FLUX 3 API e altri due modelli video su Atlas Cloud, così continuità del movimento, cambi di inquadratura e audio nativo possono essere valutati sullo stesso brief, invece che su demo selezionate ad arte.
Live action cinematografica, vicolo secondario di Tokyo di notte, lucido di pioggia. Uno Shiba Inu con un minuscolo impermeabile giallo sfreccia su uno skateboard lungo il vicolo, zigzagando tra pozzanghere e sfiati di vapore. Apertura con un tracking shot dal basso che sfiora il selciato bagnato appena dietro la tavola, mentre i riflessi al neon scorrono veloci. Il cane urta una pila di lanterne di carta, che esplodono in aria, e una whip pan segue una lanterna che gira su sé stessa mentre rotola verso un banco di ramen. Taglio su una ripresa da drone che sale e arretra mentre lo Shiba abbassa una zampa con forza, fa ruotare la tavola fino a un arresto secco e abbaia una volta al cuoco del ramen che ride, mentre gli lancia una fetta di chashu che il cane afferra al volo. Luce calda del banco contro neon freddi, spruzzi d'acqua illuminati in controluce. Audio: pioggia sibilante, ruote in uretano che rombano sulla pietra, un wok che sfrigola, un abbaio secco, un treno che passa da qualche parte sopra. Rapporto d'aspetto 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Stile anime dipinto a mano, mezzogiorno luminoso sopra un mare infinito di nuvole. Una giovane pescatrice del cielo si prepara sul ponte di un'aeronave di legno e lancia una lunga lenza giù nel mare di nuvole. Inizia con una POV in prima persona oltre la ringhiera mentre la lenza schiocca e scompare nel bianco. La canna si tende di colpo e la camera taglia su un'orbita veloce intorno al ponte mentre lei viene trascinata sulle assi, la corda che fuma attraverso i guanti, uno stivale agganciato a una spira del sartiame. Punta un piede sulla ringhiera e tira indietro proprio mentre una koi grande come una balena emerge dalle nuvole dietro di lei, le scaglie che proiettano luce arcobaleno sulle vele. Finale con una hero shot dal basso mentre l'equipaggio esplode in esultanza e spruzzi di nuvola attraversano l'inquadratura. Cel shading pittorico, luce di contorno calda, texture delle pennellate visibile. Audio: vento impetuoso, corde che scricchiolano, un crescendo orchestrale in aumento, un profondo boato acquatico quando emerge. Rapporto d'aspetto 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Che si tratti di una clip social di venti secondi con audio nativo, di uno storyboard con keyframe, di un taglio pubblicitario localizzato o di una bozza rapida prima del render finale, la FLUX 3 API lo gestisce su Atlas Cloud con prezzi pay-as-you-go e accesso Day-0.
Genera fino a venti secondi di video da un singolo prompt testuale, con parlato, effetti e ambiente prodotti insieme ai frame. I team social ottengono una clip finita senza un passaggio audio separato.
Keyframe ordinati consentono alla FLUX 3 API di far avanzare una scena attraverso momenti definiti, cambiando angolazioni di camera e ambientazioni all’interno di una singola generazione. Gli storyboard artist possono visualizzare in anteprima un’intera sequenza prima di programmare qualsiasi ripresa.
La tipografia viene renderizzata con precisione nelle scene generate, e la gestione del testo multilingue migliora rispetto a quanto offerto dalle precedenti generazioni FLUX. Mockup di packaging, title card e banner localizzati escono da una singola chiamata già pronti per la revisione.
Serve lo stesso spot in sei mercati? La FLUX 3 API genera dialoghi multilingue sincronizzati con il video, così ogni taglio ha la propria traccia vocale localizzata senza una fase di doppiaggio.
I filmati esistenti possono essere portati in nuovi contesti, estesi con audio coerente o rimodellati mantenendo intatti gli elementi centrali. Le agenzie riportano in vita vecchi asset di campagna invece di commissionare un’altra ripresa.
La modalità bozza restituisce rapidamente un’anteprima HD a costo inferiore, e le inquadrature approvate vengono renderizzate di nuovo in HD o FHD tramite la FLUX 3 API. L’iterazione resta sostenibile quando un concept richiede venti tentativi.
Confronta durata delle clip, risoluzione di output, audio nativo e costo al secondo per capire dove la FLUX 3 API è in vantaggio e dove un altro modello Atlas Cloud potrebbe adattarsi meglio alla tua pipeline.
| Modello | Durata massima della clip | Risoluzione massima di output | Audio nativo | Prezzo al secondo |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, fino a 2 MP per frame | √ dialoghi, SFX, ambiente | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, fino a 2 MP per frame | √ dialoghi, SFX, ambiente | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ attivo per impostazione predefinita | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ opzionale, disattivo per impostazione predefinita | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p nativo, 1440p-SR | √ SFX, musica, ambiente | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ audio sincronizzato | $0.20 |
Inizia in pochi minuti — segui questi semplici passaggi per integrare e distribuire i modelli tramite la piattaforma Atlas Cloud.
Registrati su atlascloud.ai e completa la verifica. I nuovi utenti ricevono crediti gratuiti per esplorare la piattaforma e testare i modelli.
Combinando i modelli avanzati di FLUX 3 con la piattaforma GPU-accelerata di Atlas Cloud, ottieni prestazioni, scalabilità ed esperienza di sviluppo senza pari.
Bassa Latenza:
Inferenza ottimizzata su GPU per elaborazione in tempo reale.
API Unificata:
Esegui FLUX 3, GPT, Gemini e DeepSeek con un'unica integrazione.
Prezzi Trasparenti:
Fatturazione prevedibile per token con opzioni Serverless.
Esperienza Sviluppatore:
SDK, analytics, strumenti di fine-tuning e template.
Affidabilità:
99,99% di uptime, RBAC e logging conforme alle normative.
Sicurezza e Conformità:
SOC 2 Type II, allineamento HIPAA, sovranità dei dati negli USA.
FLUX 3 è il modello di base multimodale di Black Forest Labs, addestrato congiuntamente su immagini, video, audio e previsione delle azioni invece di essere assemblato da sistemi separati. L’API FLUX 3 espone quel modello tramite Atlas Cloud, così una singola richiesta restituisce video con audio sincronizzato. Un’unica chiave OpenAI-compatible lo copre insieme a tutti gli altri modelli del catalogo, con fatturazione a consumo.
Il video è la capacità generalmente disponibile e copre da testo a video, da immagine a video, riprese guidate da keyframe e la continuazione di una clip esistente, ciascuna con audio nativo opzionale. Black Forest Labs sta rilasciando la famiglia a fasi, quindi FLUX 3 Image e FLUX 3 Action seguono gli endpoint video invece di arrivare insieme a essi.
Crea un account, genera una chiave API e punta il client che già utilizzi all’endpoint dell’API FLUX 3. Le richieste seguono lo stesso schema OpenAI-compatible usato in tutto il catalogo Atlas Cloud, quindi non c’è un SDK separato da imparare né un vendor lock-in da sciogliere in seguito. La fatturazione è pay-as-you-go per ogni generazione, senza dover prima sottoscrivere un abbonamento. Inizia a costruire oggi stesso.
Sì, e avviene nello stesso passaggio di generazione invece che tramite un secondo modello, così dialoghi, effetti sonori e atmosfera restano allineati all’immagine. FLUX 3 gestisce il parlato con sincronizzazione labiale in oltre una dozzina di lingue, tra cui italiano, cinese, spagnolo, giapponese e hindi. L’audio può essere disattivato per singola richiesta quando ti serve solo un filmato silenzioso.
Le generazioni vanno da 5 a 20 secondi, con output in HD 720p e Full HD 1080p disponibile quando il dettaglio conta più del costo. Sono supportati formati panoramico, quadrato e verticale, quindi lo stesso prompt può essere usato per l’hero di una landing page o per un feed mobile. Le storie più lunghe si costruiscono meglio con diverse clip controllate invece che con una singola richiesta troppo grande.
Fornisci un’immagine iniziale e il modello la anima, oppure fissa dei keyframe quando una ripresa deve centrare momenti specifici in un ordine prestabilito. Si può anche continuare un filmato esistente, mantenendo movimento e inquadratura dalla coda della clip di input. Collega le continuazioni con parsimonia, perché la coerenza visiva tende a scivolare man mano che ogni estensione si basa sulla precedente.
La modalità Draft restituisce un’anteprima HD a costo inferiore, così composizione, ritmo e audio possono essere valutati prima di pagare il rendering finale. Itera sui prompt lì, poi riesegui il prompt vincente in HD standard o Full HD senza cambiare la struttura della richiesta. I team che rilasciano molte varianti traggono il massimo valore da questo ciclo.
Il video viene fatturato al secondo di output, quindi una clip breve costa una frazione di una lunga e paghi solo per ciò che generi davvero. La risoluzione determina la tariffa, con Full HD sopra l’HD standard e la modalità Draft al di sotto di entrambe. Atlas Cloud non aggiunge abbonamenti, fee per postazione né spesa minima. Inizia oggi.
Non ancora. FLUX 3 Video è il componente della famiglia già rilasciato, mentre FLUX 3 Image è in rollout graduale e una variante open weights FLUX 3 Dev è stata annunciata per più avanti. Atlas Cloud aggiunge ogni nuovo endpoint FLUX 3 man mano che viene rilasciato, così la stessa chiave continua a funzionare quando arriva la generazione di immagini.
Un modello congiunto elimina la fase di assemblaggio: non serve un secondo passaggio per sincronizzare la voce con il movimento delle labbra o per sovrapporre l’atmosfera al montaggio finale. Questo conta soprattutto nelle scene dialogate, dove lo scostamento tra le tracce è subito visibile agli spettatori. Le pipeline passano da diversi servizi a una sola chiamata, quindi ci sono meno punti di guasto da monitorare.
Guide, tutorial e novità di prodotto per sfruttare al meglio Atlas Cloud.