Seedance 2.5 现已上线 — 首发 Atlas Cloud
Hero background 1Hero background 2Hero background 3

FLUX 3 API: 20-Second Video With Native Audio

FLUX 3 API 将 Black Forest Labs 的最新基础模型引入你的技术栈,这是一套统一的 Self-Flow 架构,联合训练于图像、视频和音频。一次生成最长 20 秒的片段,支持多语言对白、音效和环境声;也可以生成文字转图像内容,并实现准确的排版效果。Atlas Cloud 通过一个兼容 OpenAI 的密钥提供服务,按次调用按量付费,并支持 Day-0 访问。

探索领先模型

Atlas Cloud 为您提供最新的行业领先创意模型。

按模态梳理每个 FLUX 3 API 端点

五个视频端点统一位于 FLUX 3 API 表层之下;下表展示了每个端点的输入、输出以及按秒计费的价格。

模态描述
FLUX 3 T2V API(文本转视频)文本提示词可生成 5 到 20 秒的视频片段,并且由于默认启用 generate_audio,音频会在同一次生成流程中一并生成。输出支持 720p 或 1080p,涵盖从 21:9 到 9:16 的七种固定宽高比,另有 auto 选项;seed 值可让任意结果复现。价格为每秒生成视频 $0.17。
FLUX 3 I2V API(图像转视频)提供单张 PNG、JPEG 或 WebP 图像,模型会从该帧开始向前生成动画,并根据提示词确定运动和节奏。时长可在 5 到 20 秒之间任意选择,适合基于你已有素材制作产品展示、角色开场和社交媒体短剪。计费为每秒生成视频 $0.17。
FLUX 3 Keyframes API(关键帧转视频)当镜头需要精准命中特定节拍时,最多可将 10 张关键帧图像固定到 24 fps 时间线上的确切帧位置。每个 frame_index 必须位于 duration 乘以 24 的范围内,让分镜和 previz 团队能直接控制画面出现的内容和时间。费率与其他生成端点一致,为每秒生成视频 $0.17。
FLUX 3 FLF API(首尾帧转视频)需要让片段落在精确的结尾画面上?传入 start_image_url 和 end_image_url 即可锁定镜头两端,由模型补全其中的运动过程。Logo 展示、变形序列,以及必须与前后素材匹配的场景衔接都适用于此端点,价格为每秒生成视频 $0.17。
FLUX 3 Extend API(视频扩展)此端点可让现有素材继续推进叙事:传入小于 50 MB 且短于 15 秒的 MP4,模型会根据提示词从其最后几帧继续生成。音频会随画面同步继续生成,并且同样适用 720p 或 1080p 输出以及 5 到 20 秒的时长范围。扩展功能的价格为每秒生成视频 $0.41。

在一次 FLUX 3 API 调用中生成视频、音频与导演指令

FLUX 3 API 由 Black Forest Labs 基于统一的多模态骨干构建,可在同一次生成过程中返回最长 20 秒的 HD 或 Full HD 视频,并同步生成对白、音效与环境声;同时还能按需控制镜头、关键帧、语言和画面文字。

一次生成,输出 20 秒画面与声音

单次调用即可返回 5 到 20 秒视频,音频在同一流程中生成,而不是事后配音。对白、音效和环境声会精准落在事件发生的对应帧上,输出支持 720p HD 或 1080p Full HD。正是这种时序同步,让炒锅起火或摔门声看起来像是真实拍摄,而不是后期拼接。

一次生成内完成场景与机位切换

只要提出剪切需求,模型就会按要求完成。场景和摄像机角度可在同一次生成中变化,同时同一角色、服装和灯光逻辑会贯穿每个镜头。更长的作品可通过 agentic clip chaining 实现,将多个独立生成片段连接成持续数分钟的序列。过去需要四次渲染再交给剪辑师处理的分镜,现在可以直接返回为一段连续成片。

接入 FLUX 3 API 的五种方式

仅文本、单张静帧、首尾帧组合、沿时间轴放置的关键帧,或用于续写的现有片段:这五种入口全部支持。关键帧用于锁定发生的内容与时间点,续写则可从你已有的素材继续生成。拥有品牌静帧或半成品剪辑的工作室,可以直接从这些资产开始,而不必从零描述每个镜头。

支持 13 种语言且口型精准的对白

原生对白覆盖英语方言、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语等,并可根据你指定的语言匹配口型。排版文字也会作为场景的一部分渲染,因此标牌和标题会直接出现在画面中,而不是后期合成。这样,一个 prompt 就能交付一条本地化广告片,并且画面文字已就位。

通过一个 Atlas Cloud Key 调用 FLUX 3 API

Atlas Cloud 通过同一个统一 endpoint 提供 FLUX 3,并与其余模型目录共用入口,因此一个 key 就能访问视频、图像和语言模型,无需第二套集成。计费采用按用量付费,无订阅费、无席位费,你只为实际运行的生成任务付费。切换模型只需改一个字符串。今天就开始构建。

一个提示词,三个模型:FLUX 3 API 并排对比

下面每一行都会将同一个提示词分别通过 FLUX 3 API 以及 Atlas Cloud 上的另外两个视频模型运行,因此可以基于同一份简述来评估运动连续性、镜头切换和原生音频,而不是依赖精挑细选的演示。

提示词

电影感真人实拍,夜晚被雨水浸亮的东京后街。一只穿着迷你黄色雨衣的柴犬踩着滑板沿小巷滑行,在水洼和蒸汽口之间穿梭。开场为低机位跟拍镜头,贴近湿漉漉的路面,从滑板后方掠过,霓虹倒影飞速划过。狗撞到一摞纸灯笼,灯笼飞散到空中,随后一个快速甩镜跟随其中一盏旋转的灯笼,朝拉面摊翻滚而去。切到无人机镜头向上并后拉,同时柴犬一爪猛按地面,将滑板旋转至急停,并对着大笑的拉面师傅吠叫一声;师傅弹出一片叉烧,狗在半空中接住。温暖的摊位灯光对比冷色霓虹,水花被逆光照亮。音频:嘶嘶作响的雨声、聚氨酯滑板轮碾过石面的隆隆声、炒锅滋滋作响、一声尖锐犬吠、头顶某处驶过的列车声。16:9 宽高比。

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

提示词

手绘动画风格,明亮正午,无尽云海上空。一名少女空中渔手站在木制飞艇甲板上稳住身形,将长长的钓线抛入云海。开场为第一人称视角,从栏杆上方看去,钓线呼啸甩出并消失在白茫茫之中。鱼竿猛然绷紧,镜头切换为围绕甲板的快速环绕拍摄;她被拖着横穿木板,绳索在手套间摩擦冒烟,一只靴子勾住一圈索具。她一脚踏上栏杆向后猛拉,正当此时,一条鲸鱼般巨大的锦鲤从她身后的云层中破出,鳞片将彩虹般的光洒满船帆。结尾为低机位英雄镜头,船员们爆发出欢呼,云雾水花飘过画面。绘画感赛璐璐着色,温暖轮廓光,可见笔触纹理。音频:呼啸的风声、吱呀作响的绳索、逐渐高涨的管弦乐、一声深沉如水的破云轰鸣。16:9 宽高比。

Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Kling v3.0 on Atlas Cloud

团队如何将 FLUX 3 API 用于实际生产

无论是带原生音频、时长二十秒的社交短片,带关键帧的分镜脚本,本地化广告剪辑,还是最终渲染前的快速草稿迭代,FLUX 3 API 都能在 Atlas Cloud 上以按量付费和 Day-0 访问的方式支持。

自带音轨的社交短片

只需一条文本提示,就能生成最长二十秒的视频,并同步生成语音、音效和环境音。社交团队无需单独做音频处理,就能拿到成片。

通过 FLUX 3 API 制作多镜头分镜

有序关键帧让 FLUX 3 API 能在一次生成中推动场景经历预设的各个瞬间,切换镜头角度和场景设定。分镜师可以在正式拍摄排期前预览完整序列。

画面内的排版与文字

生成场景中的排版表现准确,多语言文字处理也比早期 FLUX 版本更进一步。包装样机、标题卡和本地化横幅都能通过一次调用直接产出,随时可审阅。

使用 FLUX 3 API 制作本地化广告剪辑

需要同一支广告覆盖六个市场?FLUX 3 API 会随视频生成同步的多语言对白,因此每个剪辑都自带本地化配音轨,无需单独录音棚配音。

现有素材的二次利用

现有素材可以被带入新场景、在匹配音频的基础上延长,或者在保留核心元素不变的情况下重新构造。代理商不用再另起一场拍摄,就能让旧的活动资产焕发新生。

FLUX 3 API 上的低成本草稿迭代

草稿模式会以更低成本快速返回 HD 预览,获批镜头则可通过 FLUX 3 API 再次渲染为 HD 或 FHD。即使一个概念要反复打磨二十次,迭代成本也依然可控。

FLUX 3 API 与 Atlas Cloud 上其他视频模型的并排对比

对比片段长度、输出分辨率、原生音频和每秒成本,了解 FLUX 3 API 在哪些方面更胜一筹,以及 Atlas Cloud 上的其他模型何时可能更适合你的流水线。

模型最大片段长度最大输出分辨率原生音频每秒价格
FLUX 3 Video (Text-to-Video)20 sFHD,每帧最高 2 MP√ 对话、SFX、环境声$0.17 HD / $0.29 FHD
FLUX 3 Video (Video-to-Video)20 sFHD,每帧最高 2 MP√ 对话、SFX、环境声$0.41 HD / $0.53 FHD
Seedance 2.0 Text-to-Video15 s4K (3840 x 2160)√ 默认开启$0.112
Kling V3.0 Turbo Text-to-Video15 s1080p√ 可选,默认关闭$0.112
Wan-2.7 Text-to-video15 s1080p 原生,1440p-SR√ SFX、音乐、环境声$0.10
Veo3.1 Text-to-video8 s1080p√ 同步音频$0.20

如何在 Atlas Cloud 上使用 FLUX 3

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 FLUX 3

将先进的 FLUX 3 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 FLUX 3、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

面向开发者的 FLUX 3 API 常见问题解答

FLUX 3 是 Black Forest Labs 的多模态基础模型,并非由多个独立系统拼接而成,而是在图像、视频、音频和动作预测上进行联合训练。FLUX 3 API 通过 Atlas Cloud 暴露该模型,因此一次请求即可返回带同步音频的视频。一个 OpenAI 兼容密钥即可访问目录中的所有其他模型,并按使用量计费。

目前已正式可用的能力是视频生成,涵盖文本到视频、图像到视频、关键帧引导镜头,以及对现有片段的续写,每种方式都可选择原生音频。Black Forest Labs 正在分阶段发布这一模型家族,因此 FLUX 3 Image 和 FLUX 3 Action 会在视频端点之后推出,而不是与其同时发布。

创建账户,生成 API 密钥,然后将现有客户端指向 FLUX 3 API 端点即可。请求遵循 Atlas Cloud 目录中通用的 OpenAI 兼容模式,因此无需学习单独的 SDK,也不用日后再处理供应商锁定问题。计费按生成量即用即付,无需先订阅。今天就开始构建。

会,而且音频是在同一次生成过程中完成的,而不是通过第二个模型生成,这能让对白、音效和环境声与画面保持对齐。FLUX 3 支持十多种语言的语音口型同步,包括 English、Chinese、Spanish、Japanese 和 Hindi。当你只需要无声素材时,也可以在每次请求中关闭音频。

生成时长为 5 到 20 秒,输出为 HD 720p;当细节比成本更重要时,也可使用 Full HD 1080p。宽屏、方形和竖屏构图均受支持,因此同一个提示词既可以用于落地页首屏,也可以用于移动端信息流。较长的故事更适合由多个受控片段组合完成,而不是一次提交过大的请求。

提供一张起始图像,模型就能将其动画化;如果镜头必须按指定顺序命中特定时刻,也可以固定关键帧。现有视频素材也可以继续生成,并从输入片段的末尾延续运动和构图。请谨慎串联多次续写,因为每次扩展都会基于上一次结果继续生成,视觉一致性会逐渐漂移。

Draft 模式会返回成本更低的 HD 预览,方便在支付最终渲染费用前评估构图、节奏和音频。你可以先在该模式下迭代提示词,然后用胜出的提示词以标准 HD 或 Full HD 重新运行,无需更改请求结构。需要交付大量变体的团队最能从这一流程中获益。

视频按输出秒数计费,因此短片段的成本只是长片段的一小部分,你只需为实际生成的内容付费。分辨率决定费率,Full HD 高于标准 HD,Draft 模式则低于二者。Atlas Cloud 不额外收取订阅费、席位费或最低消费。今天就开始使用。

还没有。FLUX 3 Video 是该家族中已发布的部分,FLUX 3 Image 正在分阶段推出,开放权重的 FLUX 3 Dev 变体也已宣布将在后续发布。Atlas Cloud 会在每个新的 FLUX 3 端点发布时加入支持,因此图像生成上线后,同一个密钥仍可继续使用。

联合模型省去了拼接步骤:不需要第二轮处理来让声音与口型对齐,也不需要在成片下方再叠加环境声。这一点在对白场景中尤其重要,因为音轨之间的漂移会立刻被观众察觉。流水线从多个服务缩减为一次调用,也意味着需要监控的故障点更少。

探索更多系列

Seedance 2.5

Seedance 2.5 API 现已在 Atlas Cloud 上线!它为开发者提供了 ByteDance 最新的视频模型。该模型可通过文本、单张图像或多达 50 个多模态参考,一次性生成长达 30 秒的原生视频,并包含同步音频和画面内的多语言文本。在 Atlas Cloud 上,您可以通过单个密钥访问它,其主体一致性和改进的物理特性能够保持长镜头的连贯性。

查看系列

MiniMax H3

The MiniMax H3 API opens MiniMax's general purpose multimodal video model, which reads text, images, video and audio as one context instead of one task at a time. Clips run 5 to 15 seconds at 24 FPS across aspect ratios from 21:9 to 9:16, and one prompt can swap characters, replace backgrounds, rewrite dialogue or clone a voice from a reference clip. Atlas Cloud serves it all through one OpenAI-compatible endpoint. Start building today.

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

Seedance 2.0

Seedance 2.0 API 为您提供 ByteDance 多模态视频模型的生产级访问权限——支持四模态输入(文本、图像、视频、音频),以及行业领先的“Universal Reference”(通用参考)系统,可在不同镜头间锁定构图、运镜和角色动作。只需一次 API 调用即可集成导演级控制,固定费率为 $0.09/秒,即时获取密钥,无需排队——由企业级正常运行时间和合规性提供保障。Seedance 2.0 原生 4K 现已上线!

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Gemini Omni Flash

Gemini Omni API 将 Google DeepMind 在 Google I/O 2026 上发布的多模态视频生成与编辑模型带入你的技术栈。Gemini Omni 将 Gemini 的推理引擎与生成式媒体融合,可接受文本、图像、视频和音频的任意组合输入,生成一致且以知识为依据的输出。通过自然对话不断打磨结果:替换物体、重写场景、切换风格,同时保持物理规律、角色形象和画面连贯性不变。Atlas Cloud 通过统一的 API 提供完整的 Gemini Omni Flash 系列——文生视频、支持最多 7 张参考图的图生视频,以及参考图生视频——按秒计费、价格透明,低至 $0.112 起,且无需订阅。立即开始构建。

查看系列

Grok Imagine

Grok Imagine API 涵盖 xAI 的图像、视频和语音模型,包括 Image 2.0、Video 1.5 和 xAI TTS v1。支持生成跨 14 种宽高比的 1K 或 2K 静帧、生成最长 15 秒的 1080p 视频、通过最多 7 张参考图像引导镜头、或用 20 种语言进行配音。Atlas Cloud 在单一端点上运行所有功能,采用按量计费,起价为每张图像 $0.02、每秒 $0.05。立即开始使用。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

Alibaba

Atlas Cloud 将 Alibaba 的全系模型阵容整合至同一个 API 中:Qwen 用于语言和图像任务,Wan 用于高达 1080p 的视频生成。所有模型均采用按需付费模式,无需订阅。您可以使用现有的 OpenAI 兼容客户端,通过单一的 base URL 访问 Alibaba API。

查看系列

OpenAI

Atlas Cloud 为您提供访问完整 OpenAI API 产品线的权限,从用于图像生成的 GPT Image 2 到用于视频的 Sora 2。每个模型均采用按需付费模式,无月度消费限制。使用兼容 OpenAI 的 API,只需简单替换基础 URL 即可轻松接入。

查看系列

一个 API,畅享全模态 AI。

探索全部模型