


Die FLUX 3 API bringt das neueste Foundation Model von Black Forest Labs in deinen Stack: eine einheitliche Self-Flow-Architektur, die gemeinsam auf Bilder, Video und Audio trainiert wurde. Erzeuge Clips von bis zu 20 Sekunden mit mehrsprachigen Dialogen, Soundeffekten und Atmosphäre in einem Durchlauf oder rendere Text-to-Image-Arbeiten mit präziser Typografie. Atlas Cloud stellt es über einen einzigen OpenAI-kompatiblen Schlüssel bereit, mit Pay-as-you-go-Preisen pro Aufruf und Day-0-Zugriff.
Atlas Cloud bietet Ihnen die neuesten branchenführenden kreativen Modelle.
Fünf Video-Endpunkte stecken hinter einer einzigen FLUX 3 API-Oberfläche, und die folgende Tabelle zeigt, was jeder aufnimmt, was er zurückgibt und was er pro Sekunde kostet.
| Modalität | Beschreibung |
|---|---|
| FLUX 3 T2V API (Text to Video) | Text-Prompts werden zu Clips von 5 bis 20 Sekunden, wobei Audio im selben Durchlauf generiert wird, da generate_audio standardmäßig aktiviert ist. Die Ausgabe erfolgt in 720p oder 1080p in sieben festen Seitenverhältnissen von 21:9 bis 9:16 plus einer auto-Option, und ein seed-Wert macht jedes Ergebnis reproduzierbar. Der Preis beträgt $0.17 pro Sekunde generierten Videos. |
| FLUX 3 I2V API (Image to Video) | Reichen Sie ein einzelnes PNG-, JPEG- oder WebP-Bild ein und das Modell animiert von diesem Frame aus weiter, wobei es Bewegung und Tempo aus dem Prompt ableitet. Die Dauer ist frei zwischen 5 und 20 Sekunden wählbar, was sich für Produktaufnahmen, Character-Intros und Social Cutdowns auf Basis von Material eignet, das Sie bereits besitzen. Abgerechnet wird mit $0.17 pro Sekunde generierten Videos. |
| FLUX 3 Keyframes API (Keyframes to Video) | Wenn ein Shot bestimmte Beats treffen muss, können bis zu 10 Keyframe-Bilder auf exakte Frame-Positionen entlang einer 24-fps-Timeline gesetzt werden. Jeder frame_index muss innerhalb von duration × 24 liegen, wodurch Storyboard- und Previz-Teams direkte Kontrolle darüber erhalten, was wann erscheint. Der Preis entspricht den anderen Generierungsendpunkten: $0.17 pro Sekunde generierten Videos. |
| FLUX 3 FLF API (First and Last Frame to Video) | Soll ein Clip auf einem exakten Schlussbild landen? Wenn Sie start_image_url und end_image_url übergeben, werden beide Enden des Shots fixiert, während das Modell die Bewegung dazwischen ausfüllt. Logo-Reveals, Transformationssequenzen und Szenenübergaben, die zum umgebenden Footage passen müssen, sind hier richtig aufgehoben – für $0.17 pro Sekunde generierten Videos. |
| FLUX 3 Extend API (Video Extension) | Vorhandenes Footage führt die Story an diesem Endpunkt fort: Eine MP4-Datei unter 50 MB und kürzer als 15 Sekunden wird anhand des Prompts von ihren letzten Frames aus fortgesetzt. Audio wird parallel zum Bild weiter generiert, und dieselbe Ausgabe in 720p oder 1080p sowie der Bereich von 5 bis 20 Sekunden gelten weiterhin. Die Erweiterung kostet $0.41 pro Sekunde generierten Videos. |
Die FLUX 3 API wurde von Black Forest Labs auf einem multimodalen Backbone entwickelt und liefert in einem Durchlauf bis zu zwanzig Sekunden HD- oder Full HD-Video mit Dialog, Soundeffekten und Atmosphäre. Dabei berücksichtigt sie Vorgaben zu Einstellungen, Keyframes, Sprachen und Bildschirmtext.
Ein einzelner Aufruf liefert 5 bis 20 Sekunden Video, wobei der Ton im selben Durchlauf erzeugt wird und nicht nachträglich synchronisiert wird. Dialoge, Soundeffekte und atmosphärische Klangflächen landen exakt auf dem Frame, in dem das Ereignis stattfindet, und die Ausgabe erfolgt in 720p HD oder 1080p Full HD. Genau dieses Timing lässt eine Stichflamme aus dem Wok oder eine zugeschlagene Tür wie gefilmt wirken, statt wie nachträglich zusammengesetzt.
Fordern Sie einen Schnitt an, und das Modell liefert ihn. Szenen und Kamerawinkel wechseln innerhalb einer einzigen Generation, während dieselbe Figur, Garderobe und Lichtlogik über alle Einstellungen hinweg erhalten bleiben. Längere Stücke entstehen durch agentisches Clip-Chaining, das separate Generationen zu minutenlangen Sequenzen verbindet. Storyboards, die früher vier Renderings und einen Editor brauchten, kommen jetzt als ein durchgehendes Stück zurück.
Nur Text, ein einzelnes Standbild, ein Paar aus erstem und letztem Frame, über die Timeline platzierte Keyframes oder ein vorhandener Clip zur Fortsetzung: Alle fünf Einstiegspunkte werden unterstützt. Keyframes legen fest, was wann passiert, während die Fortsetzung an Material anknüpft, das Sie bereits besitzen. Studios mit Marken-Standbildern oder halb fertigen Schnitten können mit diesen Assets starten, statt jede Einstellung von Grund auf zu beschreiben.
Native Dialoge umfassen englische Dialekte, Chinesisch, Spanisch, Französisch, Deutsch, Japanisch, Portugiesisch, Russisch, Italienisch, Indonesisch, Türkisch, Hindi, Punjabi und mehr, wobei die Lippenbewegungen auf die jeweils angeforderte Sprache abgestimmt werden. Typografie wird ebenfalls als Teil der Szene gerendert, sodass Beschilderungen und Titel im Frame sitzen, statt später composited zu werden. Ein einziger Prompt kann so einen lokalisierten Spot mit bereits integrierter Beschriftung ausgeben.
Atlas Cloud stellt FLUX 3 über denselben einheitlichen Endpoint bereit, der auch den restlichen Katalog zugänglich macht. So erreicht ein einziger Key Video-, Bild- und Sprachmodelle ohne zweite Integration. Die Abrechnung bleibt Pay-as-you-go, ohne Abonnement und ohne Seat-Gebühren, und Sie zahlen nur für die Generationen, die Sie tatsächlich ausführen. Modelle zu wechseln bedeutet, einen String zu ändern. Legen Sie noch heute los.
Jede Zeile unten führt einen einzigen identischen Prompt über die FLUX 3 API und zwei weitere Videomodelle auf Atlas Cloud aus, damit Bewegungskontinuität, Szenenwechsel und native Audio anhand desselben Briefings beurteilt werden können – statt anhand sorgfältig ausgewählter Demos.
Cinematic Live Action, regennasse Tokioter Hintergasse bei Nacht. Ein Shiba Inu in einem winzigen gelben Regenmantel fährt auf einem Skateboard die Gasse hinunter, schlängelt sich zwischen Pfützen und Dampfschächten hindurch. Beginn mit einer Low-Angle-Tracking-Shot, die direkt hinter dem Board knapp über den nassen Asphalt gleitet, während Neonreflexionen vorbeiziehen. Der Hund streift einen Stapel Papierlaternen, die in die Luft wirbeln, und ein Whip Pan folgt einer rotierenden Laterne, die auf einen Ramen-Stand zutorkelt. Schnitt zu einer Drohnenaufnahme, die nach oben und hinten wegzieht, während der Shiba eine Pfote aufsetzt, das Board in einen abrupten Stopp dreht und den lachenden Ramen-Koch einmal anbellt; dieser schnippt eine Scheibe Chashu, die der Hund in der Luft fängt. Warmes Standlicht gegen kaltes Neon, von hinten beleuchtete Wassergischt. Audio: zischender Regen, Urethanrollen, die über Stein rumpeln, ein brutzelnder Wok, ein scharfes Bellen, irgendwo darüber ein vorbeifahrender Zug. 16:9 aspect ratio.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Handgemalter Anime-Stil, heller Mittag über einem endlosen Wolkenmeer. Eine jugendliche Himmelsfischerin stemmt sich auf dem Deck eines hölzernen Luftschiffs ab und wirft eine lange Leine hinab ins Wolkenmeer. Beginn mit einer First-Person-POV über die Reling, während die Leine hinausschnellt und im Weiß verschwindet. Die Rute spannt sich ruckartig, und die Kamera schneidet in eine schnelle Umkreisung des Decks, während sie über die Planken gezogen wird, das Seil rauchend durch ihre Handschuhe läuft und ein Stiefel sich in einer Tauwerkrolle verhakt. Sie setzt einen Fuß auf die Reling und zieht mit aller Kraft zurück, genau als hinter ihr ein koi-großer Wal – ein Koi von der Größe eines Wals – durch die Wolken bricht und seine Schuppen Regenbogenlicht über die Segel werfen. Abschluss mit einer Low-Angle-Hero-Shot, während die Crew in Jubel ausbricht und Wolkengischt durchs Bild treibt. Malerisches Cel Shading, warmes Rim Light, sichtbare Pinselstruktur. Audio: rauschender Wind, knarrendes Seil, ein anschwellender orchestraler Klang, ein tiefer, wässriger Donner beim Durchbruch. 16:9 aspect ratio.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Ob es um einen Social Clip mit zwanzig Sekunden Laufzeit und nativem Audio geht, ein Storyboard mit Keyframes, einen lokalisierten Werbe-Cut oder einen schnellen Entwurfsdurchlauf vor dem finalen Rendern: Die FLUX 3 API deckt das auf Atlas Cloud mit Pay-as-you-go-Preisen und Day-0-Zugriff ab.
Generieren Sie bis zu zwanzig Sekunden Video aus einem einzigen Text-Prompt, wobei Sprache, Effekte und Atmosphäre zusammen mit den Frames erzeugt werden. Social-Teams erhalten einen fertigen Clip ohne separaten Audio-Durchlauf.
Geordnete Keyframes ermöglichen es der FLUX 3 API, eine Szene durch definierte Momente zu führen und dabei Kamerawinkel und Settings innerhalb einer einzigen Generierung zu wechseln. Storyboard-Artists können eine vollständige Sequenz vorab prüfen, bevor ein Dreh gebucht wird.
Typografie wird in generierten Szenen präzise gerendert, und die Verarbeitung mehrsprachiger Texte verbessert das, was frühere FLUX Generationen geliefert haben. Packaging-Mockups, Title Cards und lokalisierte Banner kommen aus einem einzigen Call bereit zur Prüfung heraus.
Sie brauchen denselben Spot für sechs Märkte? Die FLUX 3 API generiert synchronisierte mehrsprachige Dialoge zusammen mit dem Video, sodass jeder Cut seine eigene lokalisierte Sprachspur erhält – ganz ohne Dubbing-Schritt.
Vorhandenes Footage kann in neue Kontexte übertragen, mit passendem Audio erweitert oder umgestaltet werden, während seine zentralen Elemente erhalten bleiben. Agenturen reaktivieren alte Kampagnen-Assets, statt einen weiteren Dreh zu beauftragen.
Der Draft mode liefert eine schnelle HD-Vorschau zu geringeren Kosten, und freigegebene Shots werden anschließend über die FLUX 3 API erneut in HD oder FHD gerendert. Iterationen bleiben bezahlbar, wenn ein Konzept zwanzig Anläufe braucht.
Vergleichen Sie Clip-Länge, Ausgabeauflösung, natives Audio und Kosten pro Sekunde, um zu sehen, wo die FLUX 3 API die Nase vorn hat und wo ein anderes Atlas Cloud-Modell besser zu Ihrer Pipeline passt.
| Modell | Maximale Clip-Länge | Maximale Ausgabeauflösung | Natives Audio | Preis pro Sekunde |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, bis zu 2 MP pro Frame | √ Dialoge, SFX, Umgebungsgeräusche | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, bis zu 2 MP pro Frame | √ Dialoge, SFX, Umgebungsgeräusche | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ standardmäßig aktiviert | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ optional, standardmäßig deaktiviert | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p nativ, 1440p-SR | √ SFX, Musik, Umgebungsgeräusche | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ synchronisiertes Audio | $0.20 |
In wenigen Minuten startklar — folgen Sie diesen einfachen Schritten, um Modelle über die Plattform von Atlas Cloud zu integrieren und bereitzustellen.
Registrieren Sie sich auf atlascloud.ai und schließen Sie die Verifizierung ab. Neue Nutzer erhalten kostenlose Credits zum Erkunden der Plattform und Testen von Modellen.
Die Kombination der fortschrittlichen FLUX 3-Modelle mit der GPU-beschleunigten Plattform von Atlas Cloud bietet unübertroffene Leistung, Skalierbarkeit und Entwicklererfahrung.
Niedrige Latenz:
GPU-optimierte Inferenz für Echtzeit-Reasoning.
Einheitliche API:
Führen Sie FLUX 3, GPT, Gemini und DeepSeek mit einer Integration aus.
Transparente Preisgestaltung:
Vorhersehbare Token-basierte Abrechnung mit serverlosen Optionen.
Entwicklererfahrung:
SDKs, Analysen, Fine-Tuning-Tools und Vorlagen.
Zuverlässigkeit:
99,99% Verfügbarkeit, RBAC und compliance-bereite Protokollierung.
Sicherheit & Compliance:
SOC 2 Type II, HIPAA-Ausrichtung, Datensouveränität in den USA.
FLUX 3 ist das multimodale Foundation-Model von Black Forest Labs, das gemeinsam über Bild, Video, Audio und Aktionsvorhersage trainiert wurde, statt aus separaten Systemen zusammengesetzt zu werden. Die FLUX 3 API stellt dieses Modell über Atlas Cloud bereit, sodass eine einzelne Anfrage Video mit synchronisiertem Audio zurückgibt. Ein OpenAI-kompatibler Schlüssel deckt es zusammen mit allen anderen Modellen im Katalog ab, abgerechnet nach Nutzung.
Video ist die allgemein verfügbare Fähigkeit und umfasst Text-zu-Video, Bild-zu-Video, Keyframe-gesteuerte Shots und das Fortsetzen eines vorhandenen Clips, jeweils optional mit nativem Audio. Black Forest Labs bringt die Familie schrittweise heraus, daher folgen FLUX 3 Image und FLUX 3 Action den Video-Endpunkten, statt gemeinsam mit ihnen zu erscheinen.
Konto anlegen, API-Schlüssel erzeugen und deinen bestehenden Client auf den FLUX 3 API-Endpunkt konfigurieren. Requests folgen demselben OpenAI-kompatiblen Muster, das im gesamten Atlas-Cloud-Katalog verwendet wird, sodass du kein separates SDK lernen und später keinen Vendor-Lock-in auflösen musst. Die Abrechnung erfolgt nutzungsbasiert pro Generierung, ganz ohne vorher ein Abo abzuschließen. Starte noch heute mit dem Bauen.
Ja, und zwar im selben Generierungslauf statt über ein zweites Modell, wodurch Dialog, Soundeffekte und Atmosphäre mit dem Bild synchron bleiben. FLUX 3 verarbeitet Sprache mit Lippen-Synchronisation in mehr als einem Dutzend Sprachen, darunter Englisch, Chinesisch, Spanisch, Japanisch und Hindi. Audio kann pro Anfrage deaktiviert werden, wenn du nur stummes Material brauchst.
Generierungen laufen von 5 bis 20 Sekunden und werden in HD 720p ausgegeben; Full HD 1080p ist verfügbar, wenn Details wichtiger sind als Kosten. Breitbild-, Quadrat- und Hochformat-Layouts werden alle unterstützt, sodass derselbe Prompt auf ein Hero-Element einer Landingpage oder einen mobilen Feed ausgerichtet werden kann. Längere Geschichten lassen sich am besten aus mehreren kontrollierten Clips aufbauen, statt aus einer übergroßen Anfrage.
Gib ein Startbild vor, und das Modell animiert es, oder setze Keyframes, wenn eine Einstellung bestimmte Momente in einer festen Reihenfolge treffen muss. Vorhandenes Footage kann ebenfalls fortgesetzt werden, wobei Bewegung und Bildausschnitt vom Ende des Eingabeclips übernommen werden. Verkettete Fortsetzungen sollte man sparsam einsetzen, da die visuelle Konsistenz mit jeder Erweiterung etwas driftet.
Der Draft-Modus liefert eine günstigere HD-Vorschau, sodass Komposition, Timing und Audio beurteilt werden können, bevor für ein finales Rendering bezahlt wird. Iteriere dort an Prompts und führe den Gewinner-Prompt anschließend erneut in standardmäßigem HD oder Full HD aus, ohne die Anfragestruktur zu ändern. Teams, die viele Varianten ausliefern, ziehen aus diesem Loop den größten Nutzen.
Video wird pro Ausgabesekunde abgerechnet, daher kostet ein kurzer Clip nur einen Bruchteil eines langen, und du zahlst nur für das, was du tatsächlich erzeugst. Die Auflösung bestimmt den Tarif: Full HD liegt über standardmäßigem HD, und Draft-Modus darunter. Atlas Cloud erhebt darüber hinaus kein Abo, keine Gebühr pro Sitzplatz und keinen Mindestumsatz. Starte noch heute.
Noch nicht. FLUX 3 Video ist der veröffentlichte Teil der Familie, während FLUX 3 Image schrittweise ausgerollt wird und eine Open-Weights-Variante von FLUX 3 Dev für später angekündigt wurde. Atlas Cloud ergänzt jeden neuen FLUX 3-Endpunkt, sobald er live geht, sodass derselbe Schlüssel weiter funktioniert, wenn die Bilderzeugung verfügbar wird.
Ein gemeinsames Modell macht das Zusammensetzen überflüssig: Es gibt keinen zweiten Durchlauf, um Sprache mit Lippenbewegungen zu synchronisieren oder Atmosphäre unter einen fertigen Schnitt zu legen. Das ist besonders bei Dialogszenen wichtig, wo ein Drift zwischen den Spuren für Zuschauer sofort sichtbar ist. Pipelines schrumpfen von mehreren Diensten auf einen einzigen Aufruf, also mit weniger Fehlerquellen, die überwacht werden müssen.
Anleitungen, Tutorials und Produkt-Updates, mit denen Sie das Beste aus Atlas Cloud herausholen.