


La API de FLUX 3 lleva el modelo fundacional más reciente de Black Forest Labs a tu stack: una única arquitectura Self-Flow entrenada conjuntamente con imágenes, video y audio. Genera clips de hasta 20 segundos con diálogo multilingüe, efectos de sonido y ambiente en una sola pasada, o renderiza trabajos de text-to-image con tipografía precisa. Atlas Cloud lo ofrece con una única clave compatible con OpenAI, precios de pago por uso por llamada y acceso Day-0.
Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.
Cinco endpoints de vídeo están disponibles bajo una única interfaz de la API FLUX 3, y la tabla siguiente muestra qué recibe cada uno, qué devuelve y cuánto cuesta por segundo.
| Modalidad | Descripción |
|---|---|
| FLUX 3 T2V API (Texto a vídeo) | Los prompts de texto se convierten en clips de 5 a 20 segundos con audio generado en la misma pasada, ya que generate_audio está habilitado de forma predeterminada. La salida se genera en 720p o 1080p con siete relaciones de aspecto fijas, desde 21:9 hasta 9:16, además de una opción automática, y un valor de seed permite reproducir cualquier resultado. El precio es de $0.17 por segundo de vídeo generado. |
| FLUX 3 I2V API (Imagen a vídeo) | Proporciona una sola imagen PNG, JPEG o WebP y el modelo la anima hacia delante a partir de ese fotograma, tomando del prompt el movimiento y el ritmo. La duración se puede elegir entre 5 y 20 segundos, lo que encaja con tomas de producto, presentaciones de personajes y versiones recortadas para redes sociales creadas a partir de material gráfico que ya posees. La facturación es de $0.17 por segundo de vídeo generado. |
| FLUX 3 Keyframes API (Fotogramas clave a vídeo) | Cuando una toma debe ajustarse a momentos concretos, se pueden fijar hasta 10 imágenes de fotogramas clave en posiciones exactas de fotograma dentro de una línea de tiempo de 24 fps. Cada frame_index debe mantenerse dentro de la duración multiplicada por 24, lo que da a los equipos de storyboard y previz control directo sobre qué aparece y cuándo. La tarifa coincide con la de los demás endpoints de generación: $0.17 por segundo de vídeo generado. |
| FLUX 3 FLF API (Primer y último fotograma a vídeo) | ¿Necesitas que un clip termine en una imagen de cierre exacta? Al pasar start_image_url y end_image_url, se bloquean ambos extremos de la toma mientras el modelo rellena el movimiento entre ellos. Revelados de logotipos, secuencias de transformación y transiciones entre escenas que deben encajar con el metraje circundante funcionan muy bien aquí, a $0.17 por segundo de vídeo generado. |
| FLUX 3 Extend API (Extensión de vídeo) | El metraje existente continúa la historia en este endpoint: un MP4 de menos de 50 MB y de menos de 15 segundos se prolonga desde sus fotogramas finales según el prompt. El audio se sigue generando junto con la imagen, y se mantienen la misma salida en 720p o 1080p y el rango de 5 a 20 segundos. La extensión tiene un precio de $0.41 por segundo de vídeo generado. |
Creada por Black Forest Labs sobre un único backbone multimodal, la API de FLUX 3 ofrece hasta veinte segundos de video en HD o Full HD con diálogo, efectos de sonido y ambiente generados en la misma pasada, y acepta dirección sobre planos, fotogramas clave, idiomas y texto en pantalla a lo largo del proceso.
Una sola llamada devuelve de 5 a 20 segundos de video con audio generado dentro de la misma pasada, nunca doblado después. El diálogo, los efectos de sonido y las bases ambientales caen en el fotograma exacto en que ocurre el evento, y la salida llega en 720p HD o 1080p Full HD. Esa sincronía es lo que hace que un golpe de wok o una puerta azotada se perciban como rodados y no como montados.
Pide un corte y el modelo lo entrega. Las escenas y los ángulos de cámara cambian dentro de una sola generación mientras el mismo personaje, vestuario y lógica de iluminación se mantienen en todos los planos. Las piezas más largas salen del encadenado agentivo de clips, que enlaza generaciones separadas en secuencias que duran minutos. Los storyboards que antes requerían cuatro renderizados y un editor ahora regresan como una pieza continua.
Texto solo, un único fotograma, un par de primer y último fotograma, fotogramas clave colocados a lo largo de la línea de tiempo o un clip existente para continuar: se admiten los cinco puntos de entrada. Los fotogramas clave fijan qué ocurre y cuándo, mientras que la continuación retoma el metraje que ya tienes. Los estudios que tienen imágenes fijas de marca o cortes a medio terminar pueden partir de esos activos en lugar de describir cada plano desde cero.
El diálogo nativo abarca dialectos del inglés, chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi, punyabí y más, con el movimiento de labios ajustado al idioma que pidas. La tipografía también se renderiza como parte de la escena, así que la señalética y los títulos quedan dentro del encuadre en lugar de componerse después. Un solo prompt puede entregar así un spot localizado con su rotulación ya colocada.
Atlas Cloud ofrece FLUX 3 a través del mismo endpoint unificado que da acceso al resto de su catálogo, así que una sola clave llega a video, imagen y modelos de lenguaje sin una segunda integración. La facturación sigue siendo de pago por uso, sin suscripción ni cargos por puesto, y solo pagas por las generaciones que realmente ejecutes. Cambiar de modelo es cambiar una cadena. Empieza a construir hoy.
Cada fila de abajo ejecuta un único prompt idéntico mediante FLUX 3 API y otros dos modelos de vídeo en Atlas Cloud, para que la continuidad del movimiento, los cambios de plano y el audio nativo puedan evaluarse con el mismo brief, en lugar de con demos seleccionadas a dedo.
Acción real cinematográfica, una callejuela de Tokyo mojada por la lluvia de noche. Un Shiba Inu con un diminuto impermeable amarillo baja por el callejón en skateboard, zigzagueando entre charcos y salidas de vapor. Abrir con un plano de seguimiento en ángulo bajo que roza el pavimento mojado justo detrás de la tabla, con reflejos de neón pasando a toda velocidad. El perro roza una pila de farolillos de papel y estos salen disparados por el aire, y un barrido rápido sigue a uno de los farolillos girando mientras cae hacia un puesto de ramen. Cortar a un plano de dron que se eleva y retrocede mientras el Shiba golpea la tabla con una pata, la hace girar hasta detenerse en seco y ladra una vez al chef de ramen que se ríe, quien lanza una loncha de chashu que el perro atrapa en el aire. Luz cálida del puesto contra neón frío, salpicaduras de agua iluminadas desde atrás. Audio: lluvia siseante, ruedas de uretano retumbando sobre piedra, un wok chisporroteando, un ladrido seco, un tren pasando en algún lugar por encima. Relación de aspecto 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Estilo anime pintado a mano, mediodía luminoso sobre un mar infinito de nubes. Una pescadora del cielo adolescente se afirma en la cubierta de un dirigible de madera y lanza una larga línea hacia el mar de nubes. Comenzar con un POV en primera persona sobre la barandilla mientras la línea sale disparada y desaparece en el blanco. La caña se tensa de golpe, y la cámara corta a una órbita rápida alrededor de la cubierta mientras ella es arrastrada por los tablones, la cuerda humeando entre sus guantes, con una bota enganchada a una espiral de aparejos. Planta un pie en la barandilla y tira con fuerza justo cuando un koi del tamaño de una ballena irrumpe entre las nubes detrás de ella, sus escamas proyectando luz de arcoíris sobre las velas. Terminar con un plano heroico en ángulo bajo mientras la tripulación estalla en vítores y la espuma de las nubes cruza el encuadre. Sombreado cel pictórico, cálida luz de contraluz, textura de pincel visible. Audio: viento impetuoso, cuerda crujiendo, un crescendo orquestal en ascenso, un profundo estruendo acuático cuando emerge. Relación de aspecto 16:9.
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
Ya sea un clip social de veinte segundos con audio nativo, un storyboard con keyframes, un corte publicitario localizado o una pasada rápida de borrador antes del render final, la FLUX 3 API lo cubre en Atlas Cloud con precios pay-as-you-go y acceso Day-0.
Genera hasta veinte segundos de video a partir de un solo prompt de texto, con voz, efectos y ambiente producidos junto con los fotogramas. Los equipos de social obtienen un clip terminado sin una pasada de audio aparte.
Los keyframes ordenados permiten que la FLUX 3 API lleve una escena a través de momentos definidos, cambiando ángulos de cámara y entornos dentro de una sola generación. Los artistas de storyboard pueden previsualizar una secuencia completa antes de reservar cualquier rodaje.
La tipografía se renderiza con precisión dentro de las escenas generadas, y el manejo de texto multilingüe mejora lo que ofrecían generaciones anteriores de FLUX. Los mockups de empaques, las tarjetas de título y los banners localizados salen de una sola llamada listos para revisión.
¿Necesitas el mismo anuncio en seis mercados? La FLUX 3 API genera diálogos multilingües sincronizados con el video, así que cada corte lleva su propia pista de voz localizada sin necesidad de una cabina de doblaje.
El metraje existente puede llevarse a nuevos contextos, ampliarse con audio coincidente o reconfigurarse sin que sus elementos centrales cambien. Las agencias reviven activos antiguos de campañas en lugar de encargar otro rodaje.
El modo borrador devuelve una previsualización HD rápida a menor costo, y los planos aprobados se renderizan de nuevo en HD o FHD a través de la FLUX 3 API. La iteración sigue siendo asequible cuando un concepto necesita veinte intentos.
Compara la duración del clip, la resolución de salida, el audio nativo y el coste por segundo para ver dónde destaca FLUX 3 API y dónde otro modelo de Atlas Cloud puede encajar mejor en tu pipeline.
| Modelo | Duración máxima del clip | Resolución máxima de salida | Audio nativo | Precio por segundo |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD, hasta 2 MP por fotograma | √ diálogos, SFX, ambiente | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD, hasta 2 MP por fotograma | √ diálogos, SFX, ambiente | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ activado de forma predeterminada | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ opcional, desactivado de forma predeterminada | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p nativo, 1440p-SR | √ SFX, música, ambiente | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ audio sincronizado | $0.20 |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de FLUX 3 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a FLUX 3, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
FLUX 3 es el modelo fundacional multimodal de Black Forest Labs, entrenado de forma conjunta con imágenes, video, audio y predicción de acciones, en lugar de estar ensamblado a partir de sistemas separados. La API de FLUX 3 expone ese modelo a través de Atlas Cloud, de modo que una sola solicitud devuelve video con audio sincronizado. Una única clave compatible con OpenAI lo cubre junto con todos los demás modelos del catálogo, con facturación por uso.
El video es la capacidad disponible de forma general, e incluye texto a video, imagen a video, tomas guiadas por fotogramas clave y continuación de un clip existente, cada una con audio nativo opcional. Black Forest Labs está lanzando la familia por fases, por lo que FLUX 3 Image y FLUX 3 Action llegan después de los endpoints de video, en lugar de publicarse junto con ellos.
Crea una cuenta, genera una clave de API y apunta tu cliente existente al endpoint de la API de FLUX 3. Las solicitudes siguen el mismo patrón compatible con OpenAI que se usa en todo el catálogo de Atlas Cloud, así que no hay que aprender un SDK separado ni deshacer más adelante una dependencia de un proveedor. La facturación es de pago por uso por generación, sin suscripción previa. Empieza a crear hoy mismo.
Sí, y ocurre en la misma pasada de generación en lugar de mediante un segundo modelo, lo que mantiene los diálogos, los efectos de sonido y el ambiente alineados con la imagen. FLUX 3 gestiona voz con sincronización labial en más de una docena de idiomas, incluidos inglés, chino, español, japonés e hindi. El audio puede desactivarse en cada solicitud cuando solo necesitas metraje silencioso.
Las generaciones van de 5 a 20 segundos, con salida en HD 720p y Full HD 1080p disponible cuando el detalle importa más que el coste. Se admiten encuadres panorámicos, cuadrados y verticales, de modo que el mismo prompt puede orientarse a un hero de una landing page o a un feed móvil. Para historias más largas, es mejor construirlas a partir de varios clips controlados en lugar de una única solicitud sobredimensionada.
Proporciona una imagen inicial y el modelo la anima, o fija fotogramas clave cuando una toma debe alcanzar momentos concretos en un orden determinado. También se puede continuar metraje existente, manteniendo el movimiento y el encuadre desde el final del clip de entrada. Encadena continuaciones con moderación, ya que la coherencia visual deriva a medida que cada extensión se basa en la anterior.
Draft mode devuelve una previsualización HD de menor coste para evaluar composición, ritmo y audio antes de pagar por el render final. Itera ahí sobre los prompts y luego vuelve a ejecutar el prompt ganador en HD estándar o Full HD sin cambiar la estructura de la solicitud. Los equipos que lanzan muchas variantes son los que más valor obtienen de este ciclo.
El video se factura por segundo de salida, por lo que un clip corto cuesta una fracción de uno largo y solo pagas por lo que realmente generas. La resolución determina la tarifa, con Full HD por encima de HD estándar y Draft mode por debajo de ambas. Atlas Cloud no añade suscripción, tarifa por puesto ni gasto mínimo. Empieza hoy.
Todavía no. FLUX 3 Video es la parte de la familia que ya se ha lanzado, mientras que FLUX 3 Image está en despliegue por fases y se ha anunciado para más adelante una variante FLUX 3 Dev de pesos abiertos. Atlas Cloud añade cada nuevo endpoint de FLUX 3 a medida que se publica, así que la misma clave seguirá funcionando cuando llegue la generación de imágenes.
Un modelo conjunto elimina el paso de ensamblaje: no hay una segunda pasada para sincronizar la voz con el movimiento de la boca ni para superponer ambiente bajo un montaje ya terminado. Esto importa sobre todo en escenas con diálogo, donde cualquier deriva entre pistas resulta inmediatamente visible para los espectadores. Los pipelines se reducen de varios servicios a una sola llamada, lo que implica menos puntos de fallo que supervisar.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.