Seedance 2.5 ya está disponible — Primero en Atlas Cloud
Hero background 1Hero background 2Hero background 3

FLUX 3 API: 20-Second Video With Native Audio

La API de FLUX 3 lleva el modelo fundacional más reciente de Black Forest Labs a tu stack: una única arquitectura Self-Flow entrenada conjuntamente con imágenes, video y audio. Genera clips de hasta 20 segundos con diálogo multilingüe, efectos de sonido y ambiente en una sola pasada, o renderiza trabajos de text-to-image con tipografía precisa. Atlas Cloud lo ofrece con una única clave compatible con OpenAI, precios de pago por uso por llamada y acceso Day-0.

Explorar Modelos Líderes

Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.

Todos los endpoints de la API FLUX 3, modalidad por modalidad

Cinco endpoints de vídeo están disponibles bajo una única interfaz de la API FLUX 3, y la tabla siguiente muestra qué recibe cada uno, qué devuelve y cuánto cuesta por segundo.

ModalidadDescripción
FLUX 3 T2V API (Texto a vídeo)Los prompts de texto se convierten en clips de 5 a 20 segundos con audio generado en la misma pasada, ya que generate_audio está habilitado de forma predeterminada. La salida se genera en 720p o 1080p con siete relaciones de aspecto fijas, desde 21:9 hasta 9:16, además de una opción automática, y un valor de seed permite reproducir cualquier resultado. El precio es de $0.17 por segundo de vídeo generado.
FLUX 3 I2V API (Imagen a vídeo)Proporciona una sola imagen PNG, JPEG o WebP y el modelo la anima hacia delante a partir de ese fotograma, tomando del prompt el movimiento y el ritmo. La duración se puede elegir entre 5 y 20 segundos, lo que encaja con tomas de producto, presentaciones de personajes y versiones recortadas para redes sociales creadas a partir de material gráfico que ya posees. La facturación es de $0.17 por segundo de vídeo generado.
FLUX 3 Keyframes API (Fotogramas clave a vídeo)Cuando una toma debe ajustarse a momentos concretos, se pueden fijar hasta 10 imágenes de fotogramas clave en posiciones exactas de fotograma dentro de una línea de tiempo de 24 fps. Cada frame_index debe mantenerse dentro de la duración multiplicada por 24, lo que da a los equipos de storyboard y previz control directo sobre qué aparece y cuándo. La tarifa coincide con la de los demás endpoints de generación: $0.17 por segundo de vídeo generado.
FLUX 3 FLF API (Primer y último fotograma a vídeo)¿Necesitas que un clip termine en una imagen de cierre exacta? Al pasar start_image_url y end_image_url, se bloquean ambos extremos de la toma mientras el modelo rellena el movimiento entre ellos. Revelados de logotipos, secuencias de transformación y transiciones entre escenas que deben encajar con el metraje circundante funcionan muy bien aquí, a $0.17 por segundo de vídeo generado.
FLUX 3 Extend API (Extensión de vídeo)El metraje existente continúa la historia en este endpoint: un MP4 de menos de 50 MB y de menos de 15 segundos se prolonga desde sus fotogramas finales según el prompt. El audio se sigue generando junto con la imagen, y se mantienen la misma salida en 720p o 1080p y el rango de 5 a 20 segundos. La extensión tiene un precio de $0.41 por segundo de vídeo generado.

Video, audio y dirección en una sola llamada a la API de FLUX 3

Creada por Black Forest Labs sobre un único backbone multimodal, la API de FLUX 3 ofrece hasta veinte segundos de video en HD o Full HD con diálogo, efectos de sonido y ambiente generados en la misma pasada, y acepta dirección sobre planos, fotogramas clave, idiomas y texto en pantalla a lo largo del proceso.

Veinte segundos de imagen y sonido en una sola pasada

Una sola llamada devuelve de 5 a 20 segundos de video con audio generado dentro de la misma pasada, nunca doblado después. El diálogo, los efectos de sonido y las bases ambientales caen en el fotograma exacto en que ocurre el evento, y la salida llega en 720p HD o 1080p Full HD. Esa sincronía es lo que hace que un golpe de wok o una puerta azotada se perciban como rodados y no como montados.

Cambios de escena y cámara dentro de una sola generación

Pide un corte y el modelo lo entrega. Las escenas y los ángulos de cámara cambian dentro de una sola generación mientras el mismo personaje, vestuario y lógica de iluminación se mantienen en todos los planos. Las piezas más largas salen del encadenado agentivo de clips, que enlaza generaciones separadas en secuencias que duran minutos. Los storyboards que antes requerían cuatro renderizados y un editor ahora regresan como una pieza continua.

Cinco formas de entrar a la API de FLUX 3

Texto solo, un único fotograma, un par de primer y último fotograma, fotogramas clave colocados a lo largo de la línea de tiempo o un clip existente para continuar: se admiten los cinco puntos de entrada. Los fotogramas clave fijan qué ocurre y cuándo, mientras que la continuación retoma el metraje que ya tienes. Los estudios que tienen imágenes fijas de marca o cortes a medio terminar pueden partir de esos activos en lugar de describir cada plano desde cero.

Diálogo que encaja en trece idiomas

El diálogo nativo abarca dialectos del inglés, chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi, punyabí y más, con el movimiento de labios ajustado al idioma que pidas. La tipografía también se renderiza como parte de la escena, así que la señalética y los títulos quedan dentro del encuadre en lugar de componerse después. Un solo prompt puede entregar así un spot localizado con su rotulación ya colocada.

La API de FLUX 3 detrás de una sola clave de Atlas Cloud

Atlas Cloud ofrece FLUX 3 a través del mismo endpoint unificado que da acceso al resto de su catálogo, así que una sola clave llega a video, imagen y modelos de lenguaje sin una segunda integración. La facturación sigue siendo de pago por uso, sin suscripción ni cargos por puesto, y solo pagas por las generaciones que realmente ejecutes. Cambiar de modelo es cambiar una cadena. Empieza a construir hoy.

Un prompt, tres modelos: FLUX 3 API en paralelo

Cada fila de abajo ejecuta un único prompt idéntico mediante FLUX 3 API y otros dos modelos de vídeo en Atlas Cloud, para que la continuidad del movimiento, los cambios de plano y el audio nativo puedan evaluarse con el mismo brief, en lugar de con demos seleccionadas a dedo.

Prompt

Acción real cinematográfica, una callejuela de Tokyo mojada por la lluvia de noche. Un Shiba Inu con un diminuto impermeable amarillo baja por el callejón en skateboard, zigzagueando entre charcos y salidas de vapor. Abrir con un plano de seguimiento en ángulo bajo que roza el pavimento mojado justo detrás de la tabla, con reflejos de neón pasando a toda velocidad. El perro roza una pila de farolillos de papel y estos salen disparados por el aire, y un barrido rápido sigue a uno de los farolillos girando mientras cae hacia un puesto de ramen. Cortar a un plano de dron que se eleva y retrocede mientras el Shiba golpea la tabla con una pata, la hace girar hasta detenerse en seco y ladra una vez al chef de ramen que se ríe, quien lanza una loncha de chashu que el perro atrapa en el aire. Luz cálida del puesto contra neón frío, salpicaduras de agua iluminadas desde atrás. Audio: lluvia siseante, ruedas de uretano retumbando sobre piedra, un wok chisporroteando, un ladrido seco, un tren pasando en algún lugar por encima. Relación de aspecto 16:9.

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

Prompt

Estilo anime pintado a mano, mediodía luminoso sobre un mar infinito de nubes. Una pescadora del cielo adolescente se afirma en la cubierta de un dirigible de madera y lanza una larga línea hacia el mar de nubes. Comenzar con un POV en primera persona sobre la barandilla mientras la línea sale disparada y desaparece en el blanco. La caña se tensa de golpe, y la cámara corta a una órbita rápida alrededor de la cubierta mientras ella es arrastrada por los tablones, la cuerda humeando entre sus guantes, con una bota enganchada a una espiral de aparejos. Planta un pie en la barandilla y tira con fuerza justo cuando un koi del tamaño de una ballena irrumpe entre las nubes detrás de ella, sus escamas proyectando luz de arcoíris sobre las velas. Terminar con un plano heroico en ángulo bajo mientras la tripulación estalla en vítores y la espuma de las nubes cruza el encuadre. Sombreado cel pictórico, cálida luz de contraluz, textura de pincel visible. Audio: viento impetuoso, cuerda crujiendo, un crescendo orquestal en ascenso, un profundo estruendo acuático cuando emerge. Relación de aspecto 16:9.

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

Dónde los equipos ponen la FLUX 3 API a trabajar

Ya sea un clip social de veinte segundos con audio nativo, un storyboard con keyframes, un corte publicitario localizado o una pasada rápida de borrador antes del render final, la FLUX 3 API lo cubre en Atlas Cloud con precios pay-as-you-go y acceso Day-0.

Clips sociales que llegan con su propio sonido

Genera hasta veinte segundos de video a partir de un solo prompt de texto, con voz, efectos y ambiente producidos junto con los fotogramas. Los equipos de social obtienen un clip terminado sin una pasada de audio aparte.

Storyboards multiescena a través de la FLUX 3 API

Los keyframes ordenados permiten que la FLUX 3 API lleve una escena a través de momentos definidos, cambiando ángulos de cámara y entornos dentro de una sola generación. Los artistas de storyboard pueden previsualizar una secuencia completa antes de reservar cualquier rodaje.

Tipografía y texto dentro del cuadro

La tipografía se renderiza con precisión dentro de las escenas generadas, y el manejo de texto multilingüe mejora lo que ofrecían generaciones anteriores de FLUX. Los mockups de empaques, las tarjetas de título y los banners localizados salen de una sola llamada listos para revisión.

Cortes publicitarios localizados con la FLUX 3 API

¿Necesitas el mismo anuncio en seis mercados? La FLUX 3 API genera diálogos multilingües sincronizados con el video, así que cada corte lleva su propia pista de voz localizada sin necesidad de una cabina de doblaje.

Una segunda vida para el metraje existente

El metraje existente puede llevarse a nuevos contextos, ampliarse con audio coincidente o reconfigurarse sin que sus elementos centrales cambien. Las agencias reviven activos antiguos de campañas en lugar de encargar otro rodaje.

Pasadas de borrador baratas en la FLUX 3 API

El modo borrador devuelve una previsualización HD rápida a menor costo, y los planos aprobados se renderizan de nuevo en HD o FHD a través de la FLUX 3 API. La iteración sigue siendo asequible cuando un concepto necesita veinte intentos.

FLUX 3 API en comparación directa con otros modelos de vídeo en Atlas Cloud

Compara la duración del clip, la resolución de salida, el audio nativo y el coste por segundo para ver dónde destaca FLUX 3 API y dónde otro modelo de Atlas Cloud puede encajar mejor en tu pipeline.

ModeloDuración máxima del clipResolución máxima de salidaAudio nativoPrecio por segundo
FLUX 3 Video (Text-to-Video)20 sFHD, hasta 2 MP por fotograma√ diálogos, SFX, ambiente$0.17 HD / $0.29 FHD
FLUX 3 Video (Video-to-Video)20 sFHD, hasta 2 MP por fotograma√ diálogos, SFX, ambiente$0.41 HD / $0.53 FHD
Seedance 2.0 Text-to-Video15 s4K (3840 x 2160)√ activado de forma predeterminada$0.112
Kling V3.0 Turbo Text-to-Video15 s1080p√ opcional, desactivado de forma predeterminada$0.112
Wan-2.7 Text-to-video15 s1080p nativo, 1440p-SR√ SFX, música, ambiente$0.10
Veo3.1 Text-to-video8 s1080p√ audio sincronizado$0.20

Cómo usar FLUX 3 en Atlas Cloud

Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.

Crea una cuenta en Atlas Cloud

Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.

Por Qué Usar FLUX 3 en Atlas Cloud

Combina modelos avanzados de FLUX 3 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.

Rendimiento y Flexibilidad

Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.

API Unificada:
Una sola integración para acceder a FLUX 3, GPT, Gemini y DeepSeek.

Precios Transparentes:
Facturación por Token, soporta modo Serverless.

Empresa y Escala

Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.

Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.

Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.

Preguntas sobre la API de FLUX 3, respondidas para desarrolladores

FLUX 3 es el modelo fundacional multimodal de Black Forest Labs, entrenado de forma conjunta con imágenes, video, audio y predicción de acciones, en lugar de estar ensamblado a partir de sistemas separados. La API de FLUX 3 expone ese modelo a través de Atlas Cloud, de modo que una sola solicitud devuelve video con audio sincronizado. Una única clave compatible con OpenAI lo cubre junto con todos los demás modelos del catálogo, con facturación por uso.

El video es la capacidad disponible de forma general, e incluye texto a video, imagen a video, tomas guiadas por fotogramas clave y continuación de un clip existente, cada una con audio nativo opcional. Black Forest Labs está lanzando la familia por fases, por lo que FLUX 3 Image y FLUX 3 Action llegan después de los endpoints de video, en lugar de publicarse junto con ellos.

Crea una cuenta, genera una clave de API y apunta tu cliente existente al endpoint de la API de FLUX 3. Las solicitudes siguen el mismo patrón compatible con OpenAI que se usa en todo el catálogo de Atlas Cloud, así que no hay que aprender un SDK separado ni deshacer más adelante una dependencia de un proveedor. La facturación es de pago por uso por generación, sin suscripción previa. Empieza a crear hoy mismo.

Sí, y ocurre en la misma pasada de generación en lugar de mediante un segundo modelo, lo que mantiene los diálogos, los efectos de sonido y el ambiente alineados con la imagen. FLUX 3 gestiona voz con sincronización labial en más de una docena de idiomas, incluidos inglés, chino, español, japonés e hindi. El audio puede desactivarse en cada solicitud cuando solo necesitas metraje silencioso.

Las generaciones van de 5 a 20 segundos, con salida en HD 720p y Full HD 1080p disponible cuando el detalle importa más que el coste. Se admiten encuadres panorámicos, cuadrados y verticales, de modo que el mismo prompt puede orientarse a un hero de una landing page o a un feed móvil. Para historias más largas, es mejor construirlas a partir de varios clips controlados en lugar de una única solicitud sobredimensionada.

Proporciona una imagen inicial y el modelo la anima, o fija fotogramas clave cuando una toma debe alcanzar momentos concretos en un orden determinado. También se puede continuar metraje existente, manteniendo el movimiento y el encuadre desde el final del clip de entrada. Encadena continuaciones con moderación, ya que la coherencia visual deriva a medida que cada extensión se basa en la anterior.

Draft mode devuelve una previsualización HD de menor coste para evaluar composición, ritmo y audio antes de pagar por el render final. Itera ahí sobre los prompts y luego vuelve a ejecutar el prompt ganador en HD estándar o Full HD sin cambiar la estructura de la solicitud. Los equipos que lanzan muchas variantes son los que más valor obtienen de este ciclo.

El video se factura por segundo de salida, por lo que un clip corto cuesta una fracción de uno largo y solo pagas por lo que realmente generas. La resolución determina la tarifa, con Full HD por encima de HD estándar y Draft mode por debajo de ambas. Atlas Cloud no añade suscripción, tarifa por puesto ni gasto mínimo. Empieza hoy.

Todavía no. FLUX 3 Video es la parte de la familia que ya se ha lanzado, mientras que FLUX 3 Image está en despliegue por fases y se ha anunciado para más adelante una variante FLUX 3 Dev de pesos abiertos. Atlas Cloud añade cada nuevo endpoint de FLUX 3 a medida que se publica, así que la misma clave seguirá funcionando cuando llegue la generación de imágenes.

Un modelo conjunto elimina el paso de ensamblaje: no hay una segunda pasada para sincronizar la voz con el movimiento de la boca ni para superponer ambiente bajo un montaje ya terminado. Esto importa sobre todo en escenas con diálogo, donde cualquier deriva entre pistas resulta inmediatamente visible para los espectadores. Los pipelines se reducen de varios servicios a una sola llamada, lo que implica menos puntos de fallo que supervisar.

Explorar Más Series

Seedance 2.5

¡La API de Seedance 2.5 ya está disponible en Atlas Cloud! Ofrece a los desarrolladores el modelo de video más reciente de ByteDance. Genera hasta 30 segundos de video nativo en una sola pasada a partir de texto, una sola imagen o hasta 50 referencias multimodales, con audio sincronizado y texto multilingüe en el encuadre. En Atlas Cloud puede acceder a él mediante una única clave, con consistencia del sujeto y físicas mejoradas que mantienen la coherencia en las tomas largas.

Ver Serie

MiniMax H3

La API de MiniMax H3 abre el acceso al modelo de video multimodal de propósito general de MiniMax, que procesa texto, imágenes, video y audio como un único contexto en lugar de una tarea a la vez. Los clips duran de 5 a 15 segundos a 24 FPS, con relaciones de aspecto de 21:9 a 9:16, y un solo prompt puede cambiar personajes, reemplazar fondos, reescribir diálogos o clonar una voz a partir de un clip de referencia. Atlas Cloud lo ofrece todo a través de un único endpoint compatible con OpenAI. Empieza a crear hoy mismo.

Ver Serie

Seedream 5.0 Pro

La API de Seedream 5.0 Pro ofrece a los desarrolladores el modelo de edición de imágenes controlable de ByteDance en Atlas Cloud. Sitúa las ediciones con precisión mediante anclajes y coordenadas, separa las imágenes en capas editables, fusiona múltiples referencias y empareja colores y materiales exactos, con texto multilingüe a 2K y 3K. ¡En Atlas Cloud puede acceder a él mediante una sola clave!

Ver Serie

Seedance 2.0

La API de Seedance 2.0 le ofrece acceso de producción al modelo de video multimodal de ByteDance: entradas cuatrimodales (texto, imagen, video, audio) y un sistema "Universal Reference" líder en la industria que bloquea la composición, el movimiento de la cámara y las acciones de los personajes en diferentes tomas. Integre un control de nivel de director con una sola llamada a la API, una tarifa fija de $0.09/s, clave instantánea y sin lista de espera, todo respaldado por un tiempo de actividad y cumplimiento de nivel empresarial. ¡Seedance 2.0 Native 4K ya está disponible!

Ver Serie

GPT Image 2

La API de GPT Image 2 ofrece a los desarrolladores acceso al último modelo de imágenes de OpenAI, el sucesor de GPT Image 1.5. Genera y edita imágenes con una representación de texto precisa en caracteres latinos y CJK, además de una sólida composición para carteles, maquetas e infografías. En Atlas Cloud, puede acceder a ella a través de una API unificada junto con más de 300 modelos, con créditos gratuitos, un tiempo de actividad del 99,99% y sin necesidad de verificación de organización de OpenAI.

Ver Serie

Gemini Omni Flash

La Gemini Omni API lleva a tu stack el modelo multimodal de generación y edición de vídeo de Google DeepMind, presentado en Google I/O 2026. Gemini Omni fusiona el motor de razonamiento de Gemini con los medios generativos y acepta cualquier combinación de texto, imágenes, vídeo y audio para producir resultados coherentes y fundamentados en conocimiento. Refina los resultados mediante conversación natural: sustituye objetos, reescribe escenas y cambia de estilo mientras la física, los personajes y la continuidad permanecen intactos. Atlas Cloud ofrece toda la gama Gemini Omni Flash —texto a vídeo, imagen a vídeo con hasta 7 imágenes de referencia y referencia a vídeo— a través de una única API unificada, con precios transparentes por segundo desde $0.112 y sin suscripción. Empieza a construir hoy mismo.

Ver Serie

Grok Imagine

La API Grok Imagine cubre los modelos de imagen, video y voz de xAI, desde Image 2.0 hasta Video 1.5 y xAI TTS v1. Genera imágenes de 1K o 2K en 14 relaciones de aspecto, expande una escena a 15 segundos de movimiento en 1080p, controla tomas con hasta 7 imágenes de referencia, o nárralas en 20 idiomas. Atlas Cloud ejecuta todos los modos en un endpoint, con precios de pago por uso desde $0.02 por imagen y $0.05 por segundo. Empieza a construir hoy.

Ver Serie

Google

Los modelos creativos más potentes de Google están todos disponibles en Atlas Cloud. Veo 3.1 ofrece generación de video cinematográfico, Nano Banana 2 impulsa la creación de imágenes de alta fidelidad y Gemini aporta inteligencia multimodal a cada flujo de trabajo. Acceda a la suite completa de modelos de Google a través de una sola API key con disponibilidad Day-0 y precios de pago por uso (pay-as-you-go).

Ver Serie

Seedance 2.0 Mini

Seedance 2.0 Mini lleva la generación de video multimodal de ByteDance a los flujos de trabajo donde la velocidad y el costo son más importantes. Ofrece las capacidades principales de Seedance 2.0 con un menor consumo de recursos: generación más rápida, menor costo por video y la misma integración de API que ya utiliza. Para los equipos que ejecutan pipelines de alto volumen o crean prototipos a escala, Mini es la opción predeterminada práctica.

Ver Serie

ByteDance

Desde la generación de video cinematográfico hasta la creación de imágenes de alta fidelidad, los modelos más potentes de ByteDance están disponibles en Atlas Cloud. Ejecute Seedance y Seedream a gran escala con los precios de inferencia más bajos y cero gastos generales de infraestructura.

Ver Serie

Alibaba

Atlas Cloud reúne toda la línea de modelos de Alibaba bajo una sola API: Qwen para tareas de lenguaje e imagen, y Wan para la generación de video hasta 1080p. Acceda a cada modelo con pago por uso sin suscripciones. La API de Alibaba está disponible a través de una única URL base utilizando su cliente compatible con OpenAI existente.

Ver Serie

OpenAI

Atlas Cloud le ofrece acceso a la línea completa de la API de OpenAI, desde GPT Image 2 para la generación de imágenes hasta Sora 2 para video. Cada modelo está disponible bajo la modalidad de pago por uso sin compromiso mensual. Intégrelo cambiando simplemente la URL base mediante la API compatible con OpenAI.

Ver Serie

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos