Seedance 2.5 è ora live — In anteprima su Atlas Cloud
Hero background 1Hero background 2Hero background 3

FLUX 3 API: 20-Second Video With Native Audio

La FLUX 3 API porta nel tuo stack il più recente foundation model di Black Forest Labs, un’unica architettura Self-Flow addestrata congiuntamente su immagini, video e audio. Genera clip fino a 20 secondi con dialoghi multilingue, effetti sonori e ambiente in un solo passaggio, oppure esegui il rendering di lavori text-to-image con tipografia accurata. Atlas Cloud lo rende disponibile con un’unica chiave compatibile con OpenAI, prezzi pay-as-you-go per chiamata e accesso Day-0.

Esplora i Modelli di Punta

Atlas Cloud ti fornisce i più recenti modelli creativi leader del settore.

Tutti gli endpoint API FLUX 3, modalità per modalità

Cinque endpoint video sono disponibili tramite un’unica superficie API FLUX 3, e la tabella qui sotto mostra cosa accetta ciascuno, cosa restituisce e quanto costa al secondo.

ModalitàDescrizione
FLUX 3 T2V API (da testo a video)I prompt testuali diventano clip da 5 a 20 secondi con audio generato nello stesso passaggio, poiché generate_audio è abilitato per impostazione predefinita. L’output viene prodotto a 720p o 1080p in sette rapporti d’aspetto fissi, da 21:9 a 9:16, più un’opzione auto, e un valore seed rende qualsiasi risultato riproducibile. Il prezzo è di $0.17 per secondo di video generato.
FLUX 3 I2V API (da immagine a video)Fornisci una singola immagine PNG, JPEG o WebP e il modello la anima a partire da quel frame, ricavando movimento e ritmo dal prompt. La durata è selezionabile ovunque tra 5 e 20 secondi, ideale per scatti di prodotto, introduzioni di personaggi e cutdown social basati su artwork già in tuo possesso. La fatturazione è di $0.17 per secondo di video generato.
FLUX 3 Keyframes API (da keyframe a video)Quando una ripresa deve rispettare momenti precisi, è possibile fissare fino a 10 immagini keyframe in posizioni di frame esatte lungo una timeline a 24 fps. Ogni frame_index deve rientrare nella durata moltiplicata per 24, offrendo ai team di storyboard e previz un controllo diretto su cosa appare e quando. La tariffa è la stessa degli altri endpoint di generazione: $0.17 per secondo di video generato.
FLUX 3 FLF API (dal primo e ultimo frame a video)Hai bisogno che una clip termini su un’immagine finale esatta? Passando start_image_url ed end_image_url si bloccano entrambe le estremità della ripresa mentre il modello genera il movimento tra le due. Reveal di loghi, sequenze di trasformazione e passaggi di scena che devono combaciare con il girato circostante sono tutti casi adatti, a $0.17 per secondo di video generato.
FLUX 3 Extend API (estensione video)Con questo endpoint, il girato esistente porta avanti la storia: un MP4 sotto i 50 MB e più corto di 15 secondi viene continuato a partire dai suoi frame finali secondo il prompt. L’audio continua a essere generato insieme all’immagine, e si applicano ancora gli stessi output a 720p o 1080p e l’intervallo da 5 a 20 secondi. L’estensione costa $0.41 per secondo di video generato.

Video, audio e regia in una singola chiamata all'API FLUX 3

Basata da Black Forest Labs su un unico backbone multimodale, l'API FLUX 3 restituisce fino a venti secondi di video HD o Full HD con dialoghi, effetti sonori e ambiente generati nello stesso passaggio, accettando anche indicazioni su inquadrature, keyframe, lingue e testo a schermo durante il processo.

Venti secondi di immagini e audio in un solo passaggio

Una singola chiamata restituisce da 5 a 20 secondi di video con audio generato nello stesso passaggio, mai doppiato in un secondo momento. Dialoghi, effetti sonori e tappeti ambientali arrivano esattamente sul frame in cui si verifica l'evento, e l'output è fornito a 720p HD o 1080p Full HD. È questa precisione temporale a far percepire una fiammata nel wok o una porta sbattuta come riprese reali, non come elementi assemblati.

Cambi di scena e di camera in un'unica generazione

Chiedi un taglio e il modello lo produce. Scene e angoli di camera cambiano all'interno di una sola generazione, mantenendo lo stesso personaggio, guardaroba e coerenza di illuminazione in ogni inquadratura. I contenuti più lunghi nascono dalla concatenazione agentica di clip, che collega generazioni separate in sequenze della durata di minuti. Storyboard che prima richiedevano quattro render e un montatore ora tornano come un unico pezzo continuo.

Cinque modi per entrare nell'API FLUX 3

Solo testo, una singola immagine fissa, una coppia di primo e ultimo frame, keyframe posizionati lungo la timeline o una clip esistente da continuare: tutti e cinque i punti di ingresso sono supportati. I keyframe fissano cosa accade e quando, mentre la continuazione riprende dal materiale che hai già. Gli studi che dispongono di immagini di brand o montaggi parzialmente completati possono partire da quegli asset invece di descrivere ogni inquadratura da zero.

Dialoghi che funzionano in tredici lingue

I dialoghi nativi coprono dialetti inglesi, cinese, spagnolo, francese, tedesco, giapponese, portoghese, russo, italiano, indonesiano, turco, hindi, punjabi e altre lingue, con il movimento delle labbra sincronizzato alla lingua richiesta. Anche la tipografia viene renderizzata come parte della scena, quindi insegne e titoli restano dentro il frame invece di essere compositati dopo. Un singolo prompt può quindi produrre uno spot localizzato con il lettering già al suo posto.

L'API FLUX 3 dietro un'unica chiave Atlas Cloud

Atlas Cloud espone FLUX 3 tramite lo stesso endpoint unificato che serve il resto del catalogo, quindi una sola chiave consente di raggiungere modelli video, image e language senza una seconda integrazione. La fatturazione resta pay as you go, senza abbonamento né costi per seat, e paghi solo le generazioni che esegui davvero. Cambiare modello significa modificare una stringa. Inizia a sviluppare oggi.

Un prompt, tre modelli: FLUX 3 API fianco a fianco

Ogni riga qui sotto esegue un singolo prompt identico tramite FLUX 3 API e altri due modelli video su Atlas Cloud, così continuità del movimento, cambi di inquadratura e audio nativo possono essere valutati sullo stesso brief, invece che su demo selezionate ad arte.

Prompt

Live action cinematografica, vicolo secondario di Tokyo di notte, lucido di pioggia. Uno Shiba Inu con un minuscolo impermeabile giallo sfreccia su uno skateboard lungo il vicolo, zigzagando tra pozzanghere e sfiati di vapore. Apertura con un tracking shot dal basso che sfiora il selciato bagnato appena dietro la tavola, mentre i riflessi al neon scorrono veloci. Il cane urta una pila di lanterne di carta, che esplodono in aria, e una whip pan segue una lanterna che gira su sé stessa mentre rotola verso un banco di ramen. Taglio su una ripresa da drone che sale e arretra mentre lo Shiba abbassa una zampa con forza, fa ruotare la tavola fino a un arresto secco e abbaia una volta al cuoco del ramen che ride, mentre gli lancia una fetta di chashu che il cane afferra al volo. Luce calda del banco contro neon freddi, spruzzi d'acqua illuminati in controluce. Audio: pioggia sibilante, ruote in uretano che rombano sulla pietra, un wok che sfrigola, un abbaio secco, un treno che passa da qualche parte sopra. Rapporto d'aspetto 16:9.

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

Prompt

Stile anime dipinto a mano, mezzogiorno luminoso sopra un mare infinito di nuvole. Una giovane pescatrice del cielo si prepara sul ponte di un'aeronave di legno e lancia una lunga lenza giù nel mare di nuvole. Inizia con una POV in prima persona oltre la ringhiera mentre la lenza schiocca e scompare nel bianco. La canna si tende di colpo e la camera taglia su un'orbita veloce intorno al ponte mentre lei viene trascinata sulle assi, la corda che fuma attraverso i guanti, uno stivale agganciato a una spira del sartiame. Punta un piede sulla ringhiera e tira indietro proprio mentre una koi grande come una balena emerge dalle nuvole dietro di lei, le scaglie che proiettano luce arcobaleno sulle vele. Finale con una hero shot dal basso mentre l'equipaggio esplode in esultanza e spruzzi di nuvola attraversano l'inquadratura. Cel shading pittorico, luce di contorno calda, texture delle pennellate visibile. Audio: vento impetuoso, corde che scricchiolano, un crescendo orchestrale in aumento, un profondo boato acquatico quando emerge. Rapporto d'aspetto 16:9.

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

Dove i team mettono al lavoro la FLUX 3 API

Che si tratti di una clip social di venti secondi con audio nativo, di uno storyboard con keyframe, di un taglio pubblicitario localizzato o di una bozza rapida prima del render finale, la FLUX 3 API lo gestisce su Atlas Cloud con prezzi pay-as-you-go e accesso Day-0.

Clip social che arrivano con il proprio audio

Genera fino a venti secondi di video da un singolo prompt testuale, con parlato, effetti e ambiente prodotti insieme ai frame. I team social ottengono una clip finita senza un passaggio audio separato.

Storyboard multi-shot tramite la FLUX 3 API

Keyframe ordinati consentono alla FLUX 3 API di far avanzare una scena attraverso momenti definiti, cambiando angolazioni di camera e ambientazioni all’interno di una singola generazione. Gli storyboard artist possono visualizzare in anteprima un’intera sequenza prima di programmare qualsiasi ripresa.

Tipografia e testo all’interno del frame

La tipografia viene renderizzata con precisione nelle scene generate, e la gestione del testo multilingue migliora rispetto a quanto offerto dalle precedenti generazioni FLUX. Mockup di packaging, title card e banner localizzati escono da una singola chiamata già pronti per la revisione.

Tagli pubblicitari localizzati con la FLUX 3 API

Serve lo stesso spot in sei mercati? La FLUX 3 API genera dialoghi multilingue sincronizzati con il video, così ogni taglio ha la propria traccia vocale localizzata senza una fase di doppiaggio.

Una seconda vita per i filmati esistenti

I filmati esistenti possono essere portati in nuovi contesti, estesi con audio coerente o rimodellati mantenendo intatti gli elementi centrali. Le agenzie riportano in vita vecchi asset di campagna invece di commissionare un’altra ripresa.

Bozze economiche sulla FLUX 3 API

La modalità bozza restituisce rapidamente un’anteprima HD a costo inferiore, e le inquadrature approvate vengono renderizzate di nuovo in HD o FHD tramite la FLUX 3 API. L’iterazione resta sostenibile quando un concept richiede venti tentativi.

FLUX 3 API a confronto con altri modelli video su Atlas Cloud

Confronta durata delle clip, risoluzione di output, audio nativo e costo al secondo per capire dove la FLUX 3 API è in vantaggio e dove un altro modello Atlas Cloud potrebbe adattarsi meglio alla tua pipeline.

ModelloDurata massima della clipRisoluzione massima di outputAudio nativoPrezzo al secondo
FLUX 3 Video (Text-to-Video)20 sFHD, fino a 2 MP per frame√ dialoghi, SFX, ambiente$0.17 HD / $0.29 FHD
FLUX 3 Video (Video-to-Video)20 sFHD, fino a 2 MP per frame√ dialoghi, SFX, ambiente$0.41 HD / $0.53 FHD
Seedance 2.0 Text-to-Video15 s4K (3840 x 2160)√ attivo per impostazione predefinita$0.112
Kling V3.0 Turbo Text-to-Video15 s1080p√ opzionale, disattivo per impostazione predefinita$0.112
Wan-2.7 Text-to-video15 s1080p nativo, 1440p-SR√ SFX, musica, ambiente$0.10
Veo3.1 Text-to-video8 s1080p√ audio sincronizzato$0.20

Come Utilizzare FLUX 3 su Atlas Cloud

Inizia in pochi minuti — segui questi semplici passaggi per integrare e distribuire i modelli tramite la piattaforma Atlas Cloud.

Crea un Account Atlas Cloud

Registrati su atlascloud.ai e completa la verifica. I nuovi utenti ricevono crediti gratuiti per esplorare la piattaforma e testare i modelli.

Perché Usare FLUX 3 su Atlas Cloud

Combinando i modelli avanzati di FLUX 3 con la piattaforma GPU-accelerata di Atlas Cloud, ottieni prestazioni, scalabilità ed esperienza di sviluppo senza pari.

Prestazioni e Flessibilità

Bassa Latenza:
Inferenza ottimizzata su GPU per elaborazione in tempo reale.

API Unificata:
Esegui FLUX 3, GPT, Gemini e DeepSeek con un'unica integrazione.

Prezzi Trasparenti:
Fatturazione prevedibile per token con opzioni Serverless.

Enterprise e Scalabilità

Esperienza Sviluppatore:
SDK, analytics, strumenti di fine-tuning e template.

Affidabilità:
99,99% di uptime, RBAC e logging conforme alle normative.

Sicurezza e Conformità:
SOC 2 Type II, allineamento HIPAA, sovranità dei dati negli USA.

Domande sull’API FLUX 3, con risposte per sviluppatori

FLUX 3 è il modello di base multimodale di Black Forest Labs, addestrato congiuntamente su immagini, video, audio e previsione delle azioni invece di essere assemblato da sistemi separati. L’API FLUX 3 espone quel modello tramite Atlas Cloud, così una singola richiesta restituisce video con audio sincronizzato. Un’unica chiave OpenAI-compatible lo copre insieme a tutti gli altri modelli del catalogo, con fatturazione a consumo.

Il video è la capacità generalmente disponibile e copre da testo a video, da immagine a video, riprese guidate da keyframe e la continuazione di una clip esistente, ciascuna con audio nativo opzionale. Black Forest Labs sta rilasciando la famiglia a fasi, quindi FLUX 3 Image e FLUX 3 Action seguono gli endpoint video invece di arrivare insieme a essi.

Crea un account, genera una chiave API e punta il client che già utilizzi all’endpoint dell’API FLUX 3. Le richieste seguono lo stesso schema OpenAI-compatible usato in tutto il catalogo Atlas Cloud, quindi non c’è un SDK separato da imparare né un vendor lock-in da sciogliere in seguito. La fatturazione è pay-as-you-go per ogni generazione, senza dover prima sottoscrivere un abbonamento. Inizia a costruire oggi stesso.

Sì, e avviene nello stesso passaggio di generazione invece che tramite un secondo modello, così dialoghi, effetti sonori e atmosfera restano allineati all’immagine. FLUX 3 gestisce il parlato con sincronizzazione labiale in oltre una dozzina di lingue, tra cui italiano, cinese, spagnolo, giapponese e hindi. L’audio può essere disattivato per singola richiesta quando ti serve solo un filmato silenzioso.

Le generazioni vanno da 5 a 20 secondi, con output in HD 720p e Full HD 1080p disponibile quando il dettaglio conta più del costo. Sono supportati formati panoramico, quadrato e verticale, quindi lo stesso prompt può essere usato per l’hero di una landing page o per un feed mobile. Le storie più lunghe si costruiscono meglio con diverse clip controllate invece che con una singola richiesta troppo grande.

Fornisci un’immagine iniziale e il modello la anima, oppure fissa dei keyframe quando una ripresa deve centrare momenti specifici in un ordine prestabilito. Si può anche continuare un filmato esistente, mantenendo movimento e inquadratura dalla coda della clip di input. Collega le continuazioni con parsimonia, perché la coerenza visiva tende a scivolare man mano che ogni estensione si basa sulla precedente.

La modalità Draft restituisce un’anteprima HD a costo inferiore, così composizione, ritmo e audio possono essere valutati prima di pagare il rendering finale. Itera sui prompt lì, poi riesegui il prompt vincente in HD standard o Full HD senza cambiare la struttura della richiesta. I team che rilasciano molte varianti traggono il massimo valore da questo ciclo.

Il video viene fatturato al secondo di output, quindi una clip breve costa una frazione di una lunga e paghi solo per ciò che generi davvero. La risoluzione determina la tariffa, con Full HD sopra l’HD standard e la modalità Draft al di sotto di entrambe. Atlas Cloud non aggiunge abbonamenti, fee per postazione né spesa minima. Inizia oggi.

Non ancora. FLUX 3 Video è il componente della famiglia già rilasciato, mentre FLUX 3 Image è in rollout graduale e una variante open weights FLUX 3 Dev è stata annunciata per più avanti. Atlas Cloud aggiunge ogni nuovo endpoint FLUX 3 man mano che viene rilasciato, così la stessa chiave continua a funzionare quando arriva la generazione di immagini.

Un modello congiunto elimina la fase di assemblaggio: non serve un secondo passaggio per sincronizzare la voce con il movimento delle labbra o per sovrapporre l’atmosfera al montaggio finale. Questo conta soprattutto nelle scene dialogate, dove lo scostamento tra le tracce è subito visibile agli spettatori. Le pipeline passano da diversi servizi a una sola chiamata, quindi ci sono meno punti di guasto da monitorare.

Esplora Altre Famiglie

Seedance 2.5

L'API Seedance 2.5 è ora disponibile su Atlas Cloud! Offre agli sviluppatori il più recente modello video di ByteDance. Genera fino a 30 secondi di video nativo in un unico passaggio da testo, una singola immagine o fino a 50 riferimenti multimodali, con audio sincronizzato e testo multilingue nell'inquadratura. Su Atlas Cloud vi si accede tramite un'unica chiave, con la coerenza del soggetto e la fisica migliorata che mantengono coerenti le riprese lunghe.

Visualizza Famiglia

MiniMax H3

L’API MiniMax H3 rende disponibile il modello video multimodale generico di MiniMax, che interpreta testo, immagini, video e audio come un unico contesto, anziché come attività separate. I clip durano da 5 a 15 secondi a 24 FPS, con rapporti d’aspetto da 21:9 a 9:16, e un singolo prompt può sostituire personaggi, cambiare sfondi, riscrivere dialoghi o clonare una voce da una clip di riferimento. Atlas Cloud offre tutto tramite un unico endpoint compatibile con OpenAI. Inizia a sviluppare oggi stesso.

Visualizza Famiglia

Seedream 5.0 Pro

L'API Seedream 5.0 Pro offre agli sviluppatori il modello di editing delle immagini controllabile di ByteDance su Atlas Cloud. Posiziona le modifiche con precisione tramite ancore e coordinate, separa le immagini in livelli modificabili, fonde più riferimenti e abbina colori e materiali esatti, con testo multilingue a 2K e 3K. Su Atlas Cloud puoi accedervi tramite una sola chiave!

Visualizza Famiglia

Seedance 2.0

L'API Seedance 2.0 ti offre l'accesso in produzione al modello video multimodale di ByteDance: input quadrimodali (testo, immagine, video, audio) e un sistema "Universal Reference" leader del settore che blocca la composizione, i movimenti di macchina e le azioni dei personaggi tra le diverse inquadrature. Integra un controllo di livello registico con una sola chiamata API, una tariffa fissa di $0,09/s, chiave istantanea e nessuna lista d'attesa, il tutto supportato da uptime e conformità di livello enterprise. Seedance 2.0 Native 4K è ora disponibile!

Visualizza Famiglia

GPT Image 2

L'API GPT Image 2 offre agli sviluppatori l'accesso all'ultimo modello di immagini di OpenAI, il successore di GPT Image 1.5. Genera e modifica immagini con un rendering accurato del testo nei caratteri latini e CJK, oltre a una solida composizione per poster, mockup e infografiche. Su Atlas Cloud puoi accedervi tramite un'unica API unificata insieme a oltre 300 modelli, con crediti gratuiti, un tempo di attività del 99,99% e nessuna verifica dell'organizzazione OpenAI richiesta.

Visualizza Famiglia

Gemini Omni Flash

La Gemini Omni API porta nel tuo stack il modello multimodale di generazione ed editing video di Google DeepMind, presentato a Google I/O 2026. Gemini Omni fonde il motore di ragionamento di Gemini con i media generativi, accettando qualsiasi combinazione di testo, immagini, video e audio per produrre output coerenti e fondati sulla conoscenza. Perfeziona i risultati con una conversazione naturale: sostituisci oggetti, riscrivi scene e cambia stile, mentre fisica, personaggi e continuità restano intatti. Atlas Cloud offre l'intera gamma Gemini Omni Flash — text-to-video, image-to-video con fino a 7 immagini di riferimento e reference-to-video — tramite un'unica API unificata, con prezzi trasparenti al secondo a partire da $0.112 e senza abbonamento. Inizia a sviluppare oggi stesso.

Visualizza Famiglia

Grok Imagine

L'API Grok Imagine supporta i modelli di immagine, video e sintesi vocale di xAI, da Image 2.0 a Video 1.5 e xAI TTS v1. Genera immagini statiche 1K o 2K su 14 proporzioni d'aspetto, crea scene fino a 15 secondi di movimento 1080p, guida gli scatti con fino a 7 immagini di riferimento, o narrarli in 20 lingue. Atlas Cloud esegue ogni modalità su un singolo endpoint, con prezzi pay-as-you-go da $0,02 per immagine e $0,05 al secondo. Inizia a sviluppare oggi.

Visualizza Famiglia

Google

I modelli creativi più potenti di Google sono tutti disponibili su Atlas Cloud. Veo 3.1 offre la generazione di video cinematografici, Nano Banana 2 alimenta la creazione di immagini ad alta fedeltà e Gemini porta l'intelligenza multimodale in ogni flusso di lavoro. Accedi alla suite completa di modelli Google tramite una singola API key con disponibilità Day-0 e prezzi a consumo (pay-as-you-go).

Visualizza Famiglia

Seedance 2.0 Mini

Seedance 2.0 Mini porta la generazione video multimodale di ByteDance nei flussi di lavoro in cui velocità e costi sono fondamentali. Offre le capacità principali di Seedance 2.0 con un impatto minore: generazione più rapida, costi inferiori per video e la stessa integrazione API che utilizzi già. Per i team che gestiscono pipeline ad alto volume o prototipazione su larga scala, Mini è l'opzione predefinita pratica.

Visualizza Famiglia

ByteDance

Dalla generazione di video cinematografici alla creazione di immagini ad alta fedeltà, i modelli più potenti di ByteDance sono disponibili su Atlas Cloud. Esegui Seedance e Seedream su larga scala con i prezzi di inferenza più bassi e zero costi generali di infrastruttura.

Visualizza Famiglia

Alibaba

Atlas Cloud riunisce l'intera linea di modelli di Alibaba in un'unica API: Qwen per attività linguistiche e di immagine, Wan per la generazione di video fino a 1080p. Accedi a ogni modello in modalità pay-as-you-go senza abbonamenti. L'API di Alibaba è disponibile tramite una singola base URL utilizzando il tuo attuale client compatibile con OpenAI.

Visualizza Famiglia

OpenAI

Atlas Cloud ti offre l'accesso all'intera linea di API di OpenAI, da GPT Image 2 per la generazione di immagini a Sora 2 per i video. Ogni modello è disponibile in modalità pay-as-you-go senza alcun impegno mensile. Integralo con una semplice sostituzione dell'URL di base utilizzando l'API compatibile con OpenAI.

Visualizza Famiglia

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli