


FLUX 3 API 将 Black Forest Labs 的最新基础模型引入你的技术栈,这是一套统一的 Self-Flow 架构,联合训练于图像、视频和音频。一次生成最长 20 秒的片段,支持多语言对白、音效和环境声;也可以生成文字转图像内容,并实现准确的排版效果。Atlas Cloud 通过一个兼容 OpenAI 的密钥提供服务,按次调用按量付费,并支持 Day-0 访问。
Atlas Cloud 为您提供最新的行业领先创意模型。
五个视频端点统一位于 FLUX 3 API 表层之下;下表展示了每个端点的输入、输出以及按秒计费的价格。
| 模态 | 描述 |
|---|---|
| FLUX 3 T2V API(文本转视频) | 文本提示词可生成 5 到 20 秒的视频片段,并且由于默认启用 generate_audio,音频会在同一次生成流程中一并生成。输出支持 720p 或 1080p,涵盖从 21:9 到 9:16 的七种固定宽高比,另有 auto 选项;seed 值可让任意结果复现。价格为每秒生成视频 $0.17。 |
| FLUX 3 I2V API(图像转视频) | 提供单张 PNG、JPEG 或 WebP 图像,模型会从该帧开始向前生成动画,并根据提示词确定运动和节奏。时长可在 5 到 20 秒之间任意选择,适合基于你已有素材制作产品展示、角色开场和社交媒体短剪。计费为每秒生成视频 $0.17。 |
| FLUX 3 Keyframes API(关键帧转视频) | 当镜头需要精准命中特定节拍时,最多可将 10 张关键帧图像固定到 24 fps 时间线上的确切帧位置。每个 frame_index 必须位于 duration 乘以 24 的范围内,让分镜和 previz 团队能直接控制画面出现的内容和时间。费率与其他生成端点一致,为每秒生成视频 $0.17。 |
| FLUX 3 FLF API(首尾帧转视频) | 需要让片段落在精确的结尾画面上?传入 start_image_url 和 end_image_url 即可锁定镜头两端,由模型补全其中的运动过程。Logo 展示、变形序列,以及必须与前后素材匹配的场景衔接都适用于此端点,价格为每秒生成视频 $0.17。 |
| FLUX 3 Extend API(视频扩展) | 此端点可让现有素材继续推进叙事:传入小于 50 MB 且短于 15 秒的 MP4,模型会根据提示词从其最后几帧继续生成。音频会随画面同步继续生成,并且同样适用 720p 或 1080p 输出以及 5 到 20 秒的时长范围。扩展功能的价格为每秒生成视频 $0.41。 |
FLUX 3 API 由 Black Forest Labs 基于统一的多模态骨干构建,可在同一次生成过程中返回最长 20 秒的 HD 或 Full HD 视频,并同步生成对白、音效与环境声;同时还能按需控制镜头、关键帧、语言和画面文字。
单次调用即可返回 5 到 20 秒视频,音频在同一流程中生成,而不是事后配音。对白、音效和环境声会精准落在事件发生的对应帧上,输出支持 720p HD 或 1080p Full HD。正是这种时序同步,让炒锅起火或摔门声看起来像是真实拍摄,而不是后期拼接。
只要提出剪切需求,模型就会按要求完成。场景和摄像机角度可在同一次生成中变化,同时同一角色、服装和灯光逻辑会贯穿每个镜头。更长的作品可通过 agentic clip chaining 实现,将多个独立生成片段连接成持续数分钟的序列。过去需要四次渲染再交给剪辑师处理的分镜,现在可以直接返回为一段连续成片。
仅文本、单张静帧、首尾帧组合、沿时间轴放置的关键帧,或用于续写的现有片段:这五种入口全部支持。关键帧用于锁定发生的内容与时间点,续写则可从你已有的素材继续生成。拥有品牌静帧或半成品剪辑的工作室,可以直接从这些资产开始,而不必从零描述每个镜头。
原生对白覆盖英语方言、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语等,并可根据你指定的语言匹配口型。排版文字也会作为场景的一部分渲染,因此标牌和标题会直接出现在画面中,而不是后期合成。这样,一个 prompt 就能交付一条本地化广告片,并且画面文字已就位。
Atlas Cloud 通过同一个统一 endpoint 提供 FLUX 3,并与其余模型目录共用入口,因此一个 key 就能访问视频、图像和语言模型,无需第二套集成。计费采用按用量付费,无订阅费、无席位费,你只为实际运行的生成任务付费。切换模型只需改一个字符串。今天就开始构建。
下面每一行都会将同一个提示词分别通过 FLUX 3 API 以及 Atlas Cloud 上的另外两个视频模型运行,因此可以基于同一份简述来评估运动连续性、镜头切换和原生音频,而不是依赖精挑细选的演示。
电影感真人实拍,夜晚被雨水浸亮的东京后街。一只穿着迷你黄色雨衣的柴犬踩着滑板沿小巷滑行,在水洼和蒸汽口之间穿梭。开场为低机位跟拍镜头,贴近湿漉漉的路面,从滑板后方掠过,霓虹倒影飞速划过。狗撞到一摞纸灯笼,灯笼飞散到空中,随后一个快速甩镜跟随其中一盏旋转的灯笼,朝拉面摊翻滚而去。切到无人机镜头向上并后拉,同时柴犬一爪猛按地面,将滑板旋转至急停,并对着大笑的拉面师傅吠叫一声;师傅弹出一片叉烧,狗在半空中接住。温暖的摊位灯光对比冷色霓虹,水花被逆光照亮。音频:嘶嘶作响的雨声、聚氨酯滑板轮碾过石面的隆隆声、炒锅滋滋作响、一声尖锐犬吠、头顶某处驶过的列车声。16:9 宽高比。
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
手绘动画风格,明亮正午,无尽云海上空。一名少女空中渔手站在木制飞艇甲板上稳住身形,将长长的钓线抛入云海。开场为第一人称视角,从栏杆上方看去,钓线呼啸甩出并消失在白茫茫之中。鱼竿猛然绷紧,镜头切换为围绕甲板的快速环绕拍摄;她被拖着横穿木板,绳索在手套间摩擦冒烟,一只靴子勾住一圈索具。她一脚踏上栏杆向后猛拉,正当此时,一条鲸鱼般巨大的锦鲤从她身后的云层中破出,鳞片将彩虹般的光洒满船帆。结尾为低机位英雄镜头,船员们爆发出欢呼,云雾水花飘过画面。绘画感赛璐璐着色,温暖轮廓光,可见笔触纹理。音频:呼啸的风声、吱呀作响的绳索、逐渐高涨的管弦乐、一声深沉如水的破云轰鸣。16:9 宽高比。
Generated with BLACKFORESTLABS FLUX 3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Kling v3.0 on Atlas Cloud
无论是带原生音频、时长二十秒的社交短片,带关键帧的分镜脚本,本地化广告剪辑,还是最终渲染前的快速草稿迭代,FLUX 3 API 都能在 Atlas Cloud 上以按量付费和 Day-0 访问的方式支持。
只需一条文本提示,就能生成最长二十秒的视频,并同步生成语音、音效和环境音。社交团队无需单独做音频处理,就能拿到成片。
有序关键帧让 FLUX 3 API 能在一次生成中推动场景经历预设的各个瞬间,切换镜头角度和场景设定。分镜师可以在正式拍摄排期前预览完整序列。
生成场景中的排版表现准确,多语言文字处理也比早期 FLUX 版本更进一步。包装样机、标题卡和本地化横幅都能通过一次调用直接产出,随时可审阅。
需要同一支广告覆盖六个市场?FLUX 3 API 会随视频生成同步的多语言对白,因此每个剪辑都自带本地化配音轨,无需单独录音棚配音。
现有素材可以被带入新场景、在匹配音频的基础上延长,或者在保留核心元素不变的情况下重新构造。代理商不用再另起一场拍摄,就能让旧的活动资产焕发新生。
草稿模式会以更低成本快速返回 HD 预览,获批镜头则可通过 FLUX 3 API 再次渲染为 HD 或 FHD。即使一个概念要反复打磨二十次,迭代成本也依然可控。
对比片段长度、输出分辨率、原生音频和每秒成本,了解 FLUX 3 API 在哪些方面更胜一筹,以及 Atlas Cloud 上的其他模型何时可能更适合你的流水线。
| 模型 | 最大片段长度 | 最大输出分辨率 | 原生音频 | 每秒价格 |
|---|---|---|---|---|
| FLUX 3 Video (Text-to-Video) | 20 s | FHD,每帧最高 2 MP | √ 对话、SFX、环境声 | $0.17 HD / $0.29 FHD |
| FLUX 3 Video (Video-to-Video) | 20 s | FHD,每帧最高 2 MP | √ 对话、SFX、环境声 | $0.41 HD / $0.53 FHD |
| Seedance 2.0 Text-to-Video | 15 s | 4K (3840 x 2160) | √ 默认开启 | $0.112 |
| Kling V3.0 Turbo Text-to-Video | 15 s | 1080p | √ 可选,默认关闭 | $0.112 |
| Wan-2.7 Text-to-video | 15 s | 1080p 原生,1440p-SR | √ SFX、音乐、环境声 | $0.10 |
| Veo3.1 Text-to-video | 8 s | 1080p | √ 同步音频 | $0.20 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 FLUX 3 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 FLUX 3、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
FLUX 3 是 Black Forest Labs 的多模态基础模型,并非由多个独立系统拼接而成,而是在图像、视频、音频和动作预测上进行联合训练。FLUX 3 API 通过 Atlas Cloud 暴露该模型,因此一次请求即可返回带同步音频的视频。一个 OpenAI 兼容密钥即可访问目录中的所有其他模型,并按使用量计费。
目前已正式可用的能力是视频生成,涵盖文本到视频、图像到视频、关键帧引导镜头,以及对现有片段的续写,每种方式都可选择原生音频。Black Forest Labs 正在分阶段发布这一模型家族,因此 FLUX 3 Image 和 FLUX 3 Action 会在视频端点之后推出,而不是与其同时发布。
创建账户,生成 API 密钥,然后将现有客户端指向 FLUX 3 API 端点即可。请求遵循 Atlas Cloud 目录中通用的 OpenAI 兼容模式,因此无需学习单独的 SDK,也不用日后再处理供应商锁定问题。计费按生成量即用即付,无需先订阅。今天就开始构建。
会,而且音频是在同一次生成过程中完成的,而不是通过第二个模型生成,这能让对白、音效和环境声与画面保持对齐。FLUX 3 支持十多种语言的语音口型同步,包括 English、Chinese、Spanish、Japanese 和 Hindi。当你只需要无声素材时,也可以在每次请求中关闭音频。
生成时长为 5 到 20 秒,输出为 HD 720p;当细节比成本更重要时,也可使用 Full HD 1080p。宽屏、方形和竖屏构图均受支持,因此同一个提示词既可以用于落地页首屏,也可以用于移动端信息流。较长的故事更适合由多个受控片段组合完成,而不是一次提交过大的请求。
提供一张起始图像,模型就能将其动画化;如果镜头必须按指定顺序命中特定时刻,也可以固定关键帧。现有视频素材也可以继续生成,并从输入片段的末尾延续运动和构图。请谨慎串联多次续写,因为每次扩展都会基于上一次结果继续生成,视觉一致性会逐渐漂移。
Draft 模式会返回成本更低的 HD 预览,方便在支付最终渲染费用前评估构图、节奏和音频。你可以先在该模式下迭代提示词,然后用胜出的提示词以标准 HD 或 Full HD 重新运行,无需更改请求结构。需要交付大量变体的团队最能从这一流程中获益。
视频按输出秒数计费,因此短片段的成本只是长片段的一小部分,你只需为实际生成的内容付费。分辨率决定费率,Full HD 高于标准 HD,Draft 模式则低于二者。Atlas Cloud 不额外收取订阅费、席位费或最低消费。今天就开始使用。
还没有。FLUX 3 Video 是该家族中已发布的部分,FLUX 3 Image 正在分阶段推出,开放权重的 FLUX 3 Dev 变体也已宣布将在后续发布。Atlas Cloud 会在每个新的 FLUX 3 端点发布时加入支持,因此图像生成上线后,同一个密钥仍可继续使用。
联合模型省去了拼接步骤:不需要第二轮处理来让声音与口型对齐,也不需要在成片下方再叠加环境声。这一点在对白场景中尤其重要,因为音轨之间的漂移会立刻被观众察觉。流水线从多个服务缩减为一次调用,也意味着需要监控的故障点更少。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。