仅限两周 | Seedream 5.0 Pro 立享 8 折!
LTX-2 API for Synchronized Audio and Video

LTX-2 API for Synchronized Audio and Video

LTX-2 API 将 Lightricks 的开放权重视频系列带入生产环境,可一次性生成视频和同步音频。你可以通过文本提示词生成视频、为静态图像添加动画,或扩展现有片段;每个结果都配有匹配的唇形同步、拟音和环境声。在 Atlas Cloud 上,你可以通过一个 OpenAI 兼容密钥访问它,享受透明的按量付费定价和 Day-0 访问权限。立即开始构建。

探索领先模型

Atlas Cloud 为您提供最新的行业领先创意模型。

Ltx-2 API 端点并排对比:文本、图像和视频扩展

在一个视图中比较 Ltx-2 API 的所有模态,从基于提示词的生成,到让静态图像动起来,再到续写现有片段;每种方式都可选择同步音频。

模态说明
Ltx-2 T2V API(文本转视频)输入最多 2,000 个字符的文本提示词,Ltx-2 API 将返回一段完整渲染的视频;启用 generate_audio 时,还可生成可选的同步音频。片段长度可从 25 帧扩展到 257 帧,六种分辨率预设覆盖方形、竖屏 9:16 和横屏 16:9 输出。此端点适用于完全基于文字描述生成的广告创意、社交短视频和分镜预览,标准基础费率为 $0.002。
Ltx-2 I2V API(图像转视频)提供一张 jpg、png、webp、gif 或 avif 格式的静态图像,并搭配运动提示词,此端点即可将其动画化为一段动态片段,并可选择生成音频。同样支持 25 到 257 帧的范围和六种宽高比预设,因此单张源图可以生成横屏或竖屏视频。产品图、角色肖像和概念美术都是非常适合的输入,标准基础价格同样为 $0.002。
Ltx-2 Extend Video API当现有片段需要更长时长时,此端点可基于提供的 mp4、mov、webm、m4v 或 gif 源文件,向前或向后续写视频。它可将序列延展至最高 481 帧,通过 match_input_fps 保持原始节奏,并可叠加生成的音频。可用于延长 b-roll、循环场景或衔接剪辑,按相同的 $0.002 基础费率计费。

由 Ltx-2 API 同步生成音频与视频

Ltx-2 API 将文本、图像和扩展生成模式与原生同步音频、可控帧数以及六种宽高比预设相结合,全部可通过一个 OpenAI 兼容密钥调用,并采用透明的按量付费定价。

通过 Ltx-2 API 从文本生成完整场景

用最多 2,000 个字符描述一个场景,Ltx-2 API 即可将纯文本转换为带运动和声音的视频片段,无需任何参考素材。你的提示词会驱动主体、运动、光照和镜头行为,可选的 seed 则能锁定结果,便于可重复迭代。由于一切都从语言开始,它非常适合在只有想法、尚无素材时进行分镜设计、概念提案和快速创意探索。

让任意静态图像动起来

输入一张 jpg、png、webp、gif 或 avif 格式的静态图像,模型即可将其动画化为带匹配音频的视频。提示词用于引导画面如何运动,从缓慢推进到完整动作节拍都可以,同时保留原始构图。摄影师、设计师和产品团队常用它将一张主视觉图转化为可分享的动态内容,无需重新拍摄。

通过 Ltx-2 API 无缝扩展视频片段

上传现有片段后,Ltx-2 API 可以向前或向后延续它,最多生成 481 个额外帧,并继承原始风格和节奏。match_input_fps 选项会让新画面锁定到源视频帧率,从而保持拼接处自然无痕。这能把短镜头扩展成长序列,也能挽救那些结束得稍早了一拍的场景。

按你的需求控制帧数与宽高比

在文本和图像模式中,帧数可从 25 到 257 帧完全控制,并始终以 8 的倍数加 1 设置,以实现干净采样。六种分辨率预设覆盖 1024 by 1024 的方形 HD、512 方形、竖屏 3:4、竖屏 9:16、横屏 4:3 和横屏 16:9,因此一个模型即可服务于电影、社交内容和竖屏信息流。先选择画面形态,再通过一次请求返回正确裁切结果。

Ltx-2 API:一个密钥,可复现运行

每个请求都通过 Atlas Cloud 上的一个 OpenAI 兼容密钥发送,采用透明的按量付费定价,无需订阅。在相同提示词旁传入固定 seed,模型就会返回相同的视频片段,从而将不可预测的生成变成可控、可版本化的流程步骤。Day-0 访问意味着新的 Ltx-2 API 版本一经发布即可调用,团队因此能够标准化视频流水线,并在无需管理 GPU 的情况下进行扩展。

一个提示词,三个引擎:让 Ltx-2 API 正面对比

将同一个提示词发送给 Ltx-2 API 以及 Atlas Cloud 上两个最受欢迎的视频模型,然后比较它们如何根据完全相同的指令处理运动、同步音频和电影级细节。

提示词

一只好奇的猕猴在黄金时刻的马拉喀什香料市场中穿过拥挤人群,飞快冲过摊位,一把抢走商贩摊上的鲜红色非斯帽。它蹦跳着越过敞开的藏红花和辣椒粉麻袋,扬起旋转的橙色尘云,随后停在遮棚杆顶端,回头偷看,此时大笑的商贩正追赶而来。开场为低角度跟拍镜头,在人群中跟随猴子穿行,快速摇摄切到商贩惊讶的脸,然后升起为大幅度吊臂镜头,从摊位高空俯瞰,尘埃在温暖光线中闪烁。写实电影风格,浅景深,浓郁的大地色调调色。音频:热闹的市场交谈声、黄铜器皿碰撞声,以及有节奏的手鼓打击乐,随着追逐逐渐增强。16:9 aspect ratio。

Generated with Ltx 2.3 Quality on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

提示词

一位年轻的天空信使身披飘逸的深红斗篷,从漂浮石庙边缘纵身跃下,骑着一只机械纸鹤穿越峡谷云层,在漂浮的发光灯笼之间穿梭。她围绕一座嶙峋岩石尖塔急速压弯转向,从空中抓住一封闪烁的信件,随后收身进入陡峭俯冲,而一名对手滑翔者紧随其后冲破薄雾。开场为第一人称 POV 越肩视角,纸鹤起飞;切到无人机镜头,沿着俯冲轨迹并行疾驰;随后降至低角度仰拍镜头,她从下坠中拉起,冲入刺眼阳光。鲜活的 anime 风格,cel-shaded,明亮的魔法时刻调色。音频:呼啸的风声、纸翼扑动声,以及与拉起动作同步的高昂管弦弦乐渐强。16:9 aspect ratio。

Generated with Ltx 2.3 Quality on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

使用 Ltx-2 API 交付可用于生产的视频和音频

从文本和图像提示词,到加长剪辑和同步声音,Ltx-2 API 覆盖从初稿到 4K 交付的完整流程,适用于营销、电商和创意制作。

使用 Ltx-2 API 从提示词生成视频

只需一段文字提示词,Ltx-2 API 就能输出原生 4K 视频,并内联生成音频。工作室和广告团队无需摄像机或手动剪辑,就能将活动简报转化为成片级社交广告。

让静态图片动起来

上传一张静态图片,image-to-video 生成即可让画面动起来,在保留源图构图的同时加入逼真的镜头运动。电商卖家和插画师可以让静态商品目录和作品集焕发生机,打造让人停下滑动的内容流。

将短片扩展为更长场景

需要更长的镜头?extend-video endpoint 会为现有短片追加全新帧,同时保持运动、风格和音频连贯。创作者可以把短生成片段拼接成无缝叙事,突破单次请求的时长限制。

通过 Ltx-2 API 实现同步声音

当声音很关键时,Ltx-2 API 会在一次处理中随画面合成对白、拟音和环境音,并与运动精准同步。它适用于讲解视频、预告片,以及需要声音按点出现的场景。

来自 Ltx-2 API 的 4K 母版

面向最终交付,Ltx-2 API 渲染原生 4K 帧,呈现干净流畅的运动和清晰锐利的纹理,而不是放大后的预览。代理商和工作室可以直接从 endpoint 导出可用于播出的母版,接入自己的剪辑流程。

以实惠成本扩展批量生成

由于 LTX-2 是高效的开放模型,高容量任务可按透明的按量付费价格运行,同时你可以按请求在不同性能模式之间切换。产品团队可以低成本完成原型验证,再为发布提升保真度。

Ltx-2 API 与其他生产级视频模型对比

在 Atlas Cloud 上,从生成模式、分辨率、原生音频、片段长度和起始价格等方面,将 Ltx-2 API 与同类文本和图像驱动的视频模型进行比较。

模型生成模式最高分辨率同步音频最长片段长度起始价格
LTX-2.3 Quality 文本生成视频文本生成视频1024×1024 预设(默认 16:9)√(可选开关)最高 257 帧$0.002
LTX-2.3 Quality 图像生成视频图像生成视频、延展1024×1024 预设(默认 16:9)√(可选开关)最高 257 帧$0.002
Seedance 2.0 文本生成视频文本生成视频最高 2K√ 原生4 至 15 秒$0.112
Veo 3.1 文本生成视频文本生成视频最高 4K√ 原生8 秒(可延展)$0.2
Kling Video O3 4K 文本生成视频文本和图像生成视频原生 4K(3840×2160)√ 原生3 至 15 秒$0.42

如何在 Atlas Cloud 上使用 Ltx-2

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 Ltx-2

将先进的 Ltx-2 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 Ltx-2、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

Ltx-2 API:开发者常见问题解答

Ltx-2 API 让开发者能够以编程方式访问 Lightricks 的开放权重音视频基础模型 LTX-2。它可以在一次生成过程中将文本或图像提示词转换为同步的视频和音频;在 Atlas Cloud 上,你可以通过一个 OpenAI-compatible endpoint 访问它,并按用量付费。

LTX-2 支持 text-to-video、image-to-video 和 clip extension,因此你可以把文字场景转换成动态画面、让静态图像动起来,或延长已有镜头。每种模式都可以渲染配套音频,因此很适合短片、广告、产品演示和社交媒体内容。

会。音频和视频是在一次同步生成过程中产出的,而不是事后拼接在一起,涵盖对白口型同步、音效和环境音。在 Atlas Cloud 上,你可以通过 generate_audio 参数启用该功能;它默认关闭。

LTX-2 模型原生最高可达 4K resolution、最高 50 fps,片段最长可达 20 seconds,并支持 24、25、48 和 50 等帧率。在 Atlas Cloud 上,quality endpoints 允许你选择宽高比,并通过 25 到 257 frames 的帧数设置片段长度。

向 Atlas Cloud endpoint 发送标准请求,包含你的提示词、ltx-2.3-quality/text-to-video 等模型、宽高比、帧数,以及用于生成可复现结果的可选 seed。由于该 endpoint 兼容 OpenAI,一个密钥即可用于 Ltx-2 API 以及平台上的所有其他模型,因此集成通常只需几分钟。

当然可以。ltx-2.3-quality/extend-video 模型会在现有 LTX-2 片段的基础上继续生成,并在原始长度之后保持运动和音频的一致性。当单次生成的时长短于场景实际所需时,这会很有用。

LTX-2 提供开放权重,并且高效到可以在消费级 GPU 上运行,因此自行托管是一个切实可行的选择。如果你不想处理 GPU 配置、队列管理和扩缩容,托管 API 可以提供同一个模型,并且无需维护任何基础设施。

Atlas Cloud 对 Ltx-2 API 采用按用量付费模式,提供透明的按次调用定价,无订阅费或最低消费承诺。你只需为实际生成的内容付费,同一个密钥还可让你在 Day-0 访问新模型版本。立即开始构建。

LTX-2.3 是 LTX-2 系列的当前迭代版本,也是 Atlas Cloud 通过其 quality text-to-video、image-to-video 和 extend-video endpoints 提供的版本。它在原始版本基础上进行了优化,同时保留相同的同步音视频生成方式,因此你无需更改模型调用方式,就能获得最新质量。

探索更多系列

Seedance 2.0

Seedance 2.0 API 为您提供 ByteDance 多模态视频模型的生产级访问权限——支持四模态输入(文本、图像、视频、音频),以及行业领先的“Universal Reference”(通用参考)系统,可在不同镜头间锁定构图、运镜和角色动作。只需一次 API 调用即可集成导演级控制,固定费率为 $0.09/秒,即时获取密钥,无需排队——由企业级正常运行时间和合规性提供保障。Seedance 2.0 原生 4K 现已上线!

查看系列

Grok Imagine

Grok Imagine API 为开发者提供 xAI 的图像、视频和音频生成一站式套件。它可以生成分辨率高达 2K 且支持多语言文本渲染的图像,以及长达 15 秒且带有原生同步音频和基于参考图像编辑功能的视频。在 Atlas Cloud 上,只需一个密钥即可运行每个 Grok Imagine 模式,因此您可以在图像、视频和音频之间无缝切换,无需单独设置,每张图像 0.02 美元起,每秒 0.05 美元起。

查看系列

Gemini Omni Flash

Gemini Omni API 将 Google DeepMind 在 Google I/O 2026 上发布的多模态视频生成与编辑模型带入你的技术栈。Gemini Omni 将 Gemini 的推理引擎与生成式媒体融合,可接受文本、图像、视频和音频的任意组合输入,生成一致且以知识为依据的输出。通过自然对话不断打磨结果:替换物体、重写场景、切换风格,同时保持物理规律、角色形象和画面连贯性不变。Atlas Cloud 通过统一的 API 提供完整的 Gemini Omni Flash 系列——文生视频、支持最多 7 张参考图的图生视频,以及参考图生视频——按秒计费、价格透明,低至 $0.112 起,且无需订阅。立即开始构建。

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

Alibaba

Atlas Cloud 将 Alibaba 的全系模型阵容整合至同一个 API 中:Qwen 用于语言和图像任务,Wan 用于高达 1080p 的视频生成。所有模型均采用按需付费模式,无需订阅。您可以使用现有的 OpenAI 兼容客户端,通过单一的 base URL 访问 Alibaba API。

查看系列

OpenAI

Atlas Cloud 为您提供访问完整 OpenAI API 产品线的权限,从用于图像生成的 GPT Image 2 到用于视频的 Sora 2。每个模型均采用按需付费模式,无月度消费限制。使用兼容 OpenAI 的 API,只需简单替换基础 URL 即可轻松接入。

查看系列

xAI

在 Atlas Cloud 上使用 xAI API 构建完整的图像和视频处理工作流。以 2K 分辨率生成、使用参考图像进行编辑,并将图像动画化为音画同步的视频片段。

查看系列

Kwaivgi

Kwaivgi API 价格低于标准定价 15%。Atlas Cloud 提供对最新 Kling 版本的零日(Day-0)访问权限,采用按需付费定价且无席位限制。一个账户,一个密钥,畅享从标准版到大师版的所有 Kling 模型。

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

一个 API,畅享全模态 AI。

探索全部模型