Seedance 2.0 Mini & Fast API 全球最低价 —— 比官方定价最高低 68%
Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 是 xAI 面向开发者推出的视频生成系列,适合需要根据提示词和视觉输入实现可控运动效果的场景。使用自然语言运动指令为起始帧添加动画,在参考工作流中选择 480p 或 720p,并添加可选的参考语音来引导生成结果。通过一个兼容 OpenAI 的 Atlas Cloud 密钥访问受支持的模式,享受透明的按量付费定价。立即开始构建。

Grok Imagine Video 1.5 由 xAI 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。

比较 Grok Imagine Video 1.5 的输入模态

探索六个端点,了解如何在开发者和标准工作流中,将文本、起始帧或参考素材转换为视频。

模态描述
Grok Imagine Video 1.5 Developer Reference-to-Video API使用 1 至 7 张参考图像和可选的参考音频,生成带原生同步音频的视频。输出时长最长可达 15 秒,分辨率支持 480p 或 720p。此端点适用于参考图像驱动的场景,以及需要多张源图像的视觉概念创作。
Grok Imagine Video 1.5 Reference-to-Video API基于 1 至 7 张参考图像生成视频,并提供原生同步音频,同时支持可选的参考音频。支持生成最长 15 秒、分辨率为 480p 或 720p 的视频。适合多参考图像视频制作和音频引导的连续镜头。
Grok Imagine Video 1.5 Developer Text-to-Video API只需提供文本提示,即可通过此开发者端点生成带原生同步音频的视频。可创建最长 15 秒的片段,分辨率支持 480p、720p 或 1080p。适用于提示词驱动的创意、分镜脚本和短视频制作。
Grok Imagine Video 1.5 Text-to-Video API直接根据文本提示创建视频,同时原生生成同步音频。输出分辨率支持 480p、720p 和 1080p,最长时长为 15 秒。适用于脚本化场景、营销活动创意或社交媒体视频素材。
Grok Imagine Video 1.5 Developer Image-to-Video API以一张图像为起点,通过自然语言运动指令生成动画视频。分辨率支持 480p、720p 和 1080p。适用于为插画、产品视觉素材和准备好的开场帧添加动画效果。
Grok Imagine Video 1.5 Image-to-Video API通过自然语言描述所需动作,为起始帧图像添加动画效果。生成的视频支持 480p、720p 或 1080p 分辨率。此工作流适用于动作研究、视觉叙事和以图像为核心的创意制作。

深入了解 Grok Imagine Video 1.5 创作引擎

Grok Imagine Video 1.5 将文本、起始图像以及一至七张参考图工作流整合在一起,并原生支持同步音频、最高 1080p 输出,以及在文本或参考模式下最长 15 秒的片段;同时,Atlas Cloud 提供一个 API 和透明的按量付费定价。

Grok Imagine Video 1.5 文生视频

从文本提示词开始,生成最长 15 秒、分辨率为 480p、720p 或 1080p 的视频片段。原生同步音频会在生成过程中与视频一并输出。当没有源图像时,你可以完全通过文字指令塑造场景与动作。该路径适合概念影片、电影感实验,以及由提示词驱动的内容生产流程。

图像引导的动态效果

通过自然语言运动提示词,让单张起始画面转化为动态序列。选择 480p、720p 或 1080p 输出,同时由图像确定开场构图。在提示词中描述主体和场景的运动,再让模型从这一视觉锚点继续生成动画。它适合产品镜头、角色片段,以及需要动态效果的艺术指导静帧。

Grok Imagine Video 1.5 参考图引导

使用一至七张参考图以及可选的参考声音来引导 Grok Imagine Video 1.5。参考模式可生成最长 15 秒、分辨率为 480p 或 720p、带原生同步音频的视频片段。利用这些输入,让生成场景朝既定的视觉方向发展。该路径适合基于现有创意参考构建的营销活动和故事内容。

原生同步音频

视频和声音会一同生成,因此每个片段都可以包含原生同步音频,无需单独进行音频处理。围绕可见动作构建场景,并通过伴随音轨强化动作时序。对于重视同步效果的场景,这种联合生成路径减少了视觉创作与声音制作之间的交接环节。它尤其适合表演类和氛围感丰富的素材。

十五秒故事弧线

让一个完整的视觉节拍延展到最长 15 秒的文本或参考片段中,不必停留在短循环效果。可用时长足以在一个生成序列中完成铺垫、动作和明确的结果。结合变化的镜头视角与连贯动作,可以塑造更加完整的瞬间。这一时长非常适合短广告、叙事揭示和社交视频场景。

一个 API,六个端点

通过一个 Atlas Cloud API,在文本、起始图像和参考图生成之间灵活切换,并享受透明的按量付费定价。根据每项素材选择匹配的工作流,而不是强迫所有创意都使用同一种输入类型。同一套集成让开发者可以访问列出的全部六个 Grok Imagine Video v1.5 端点,包括 standard 和 Developer 路由。这让不同视频任务的实验与生产规划更加简单。

Grok Imagine Video 1.5 单提示词模型对决

看看 Grok Imagine Video 1.5 与两个 Atlas Cloud 替代方案如何解读相同提示词,呈现电影化动作与风格化奇幻场景。

提示词

一部时长 9 秒、单镜头拍摄的水下巴洛克奇幻电影,场景位于一座废弃且完全被水淹没的歌剧院内:一名头发飘逸、戴着发光珍珠面具的优雅自由潜水者,追逐一只叼着华丽黄铜钥匙、珊瑚红色鲜艳夺目的章鱼,穿行于漂浮的天鹅绒帷幕之间。开场从开裂的舞台地板内部开始,以戏剧性的低角度仰拍镜头展现她翻滚着头朝下穿过裂缝;随后切换为紧贴主体的横向跟拍,她在倾倒的剧院座椅之间穿梭,头发与服装随水流自然摆动,帷幕鼓起,气泡穿过层层拱门向上飘散;接着环绕她旋转并向上升起,此时水压将头顶的水晶吊灯扯落。高潮时,她在最后一刻侧身扭转,避开坠落的吊灯,水晶彼此碰撞并真实地四散飞落;与此同时,章鱼用复杂而卷曲的触手灵巧地接住翻滚的钥匙,庄重地停顿片刻,再将钥匙放回她摊开的手掌中。连续流畅的运动,清晰的起承转合:开场—追逐—收束;角色与珍珠面具保持一致;准确呈现水阻力、浮力、织物、头发、气泡、触手变形、撞击与碰撞规避等物理效果。破碎天窗投下的冷青色光束穿透幽暗的水下观众厅;珊瑚红是唯一高度饱和的色彩,引导视线穿过深处层叠的拱门、帷幕、悬浮碎屑与气泡。写实电影感水下摄影,带有 subtle 的油画质感,典雅宏伟的巴洛克气韵,体积光焦散,高细节,无文字,无界面,不要用静止画面伪装剪辑。沉浸式音效:低沉的水下轰鸣、湍急水流、织物 flutter、气泡声、水晶撞击声,以及紧张的管弦乐脉冲;当钥匙被归还时,音乐化解为一声 delicately 轻柔的竖琴音。画面宽高比 16:9。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

提示词

一支荒诞动作喜剧广告,场景设定在黎明时分一间细节极其丰富的 1950 年代理发店内。一只脾气暴躁、毛发蓬乱的古代英国牧羊犬浑身裹满厚厚的白色肥皂泡沫,猛地撞开店门,在店内横冲直撞,边跑边甩得到处都是泡沫;受惊的理发师跳上一把旋转椅,骑着它一路追赶,快速剪下狗狗飞扬的毛发,每一下清脆的剪刀声都与有力的爵士鼓点精准同步。开场采用极低机位跟拍镜头,贴着湿漉漉的爪子飞驰;爪子在光亮的黑白棋盘格地砖上打滑,将逼真的水滴与泡沫飞溅向镜头;随后快速向上甩镜,进入高速环绕跟拍,借助三面大镜子,通过复杂且准确的反射,持续展示并保持狗与理发师不断变化的位置关系;接着快速推近,最后一批飞扬的碎发翻滚、旋转,精准落在狗头上,形成夸张高耸的蓬巴杜发型。狗停下来,以一段 1 秒钟、近似定格的得意主角高光时刻摆出姿势;随后突然打了个喷嚏,泡沫与毛发爆炸般喷散,爵士乐以一记尖锐的喜剧边鼓声收尾。温暖的钨丝灯实景光穿过窗外清冷的青绿色晨雾;浓郁的酒红色、奶油色、抛光黄铜与深色木材构成复古色调;高端实拍广告电影摄影,连续无缝的高速编舞,角色与空间连续性保持一致,准确呈现湿毛、肥皂泡沫、散落毛发、反射、椅子旋转、惯性与碰撞等物理效果,触感逼真的写实细节,动作清晰锐利,无慢动作,无空洞的建立镜头,无屏幕,无软件界面,无仪表盘,无进度条,无图表,无字幕,无解释性文字,无标志,无水印,画面宽高比 16:9。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video 1.5 贯穿创意制作流程

Grok Imagine Video 1.5 可将提示词、源帧和最多七张参考图像转换为带同步音频的短视频,适用于营销活动、产品展示、角色故事、社交媒体内容和快速视觉原型设计。

Grok Imagine Video 1.5 产品宣传片

使用自然语言运动提示词和同步音频,让产品静态图像动起来。为店铺页面、营销活动页面、发布素材或付费社交媒体投放位创建最高 1080p 的短展示视频。

参考图像引导的角色故事

使用一到七张角色参考图像以及可选的参考音色来引导场景创作。此设置支持重复出场的角色阵容、对话片段,以及带原生同步音频的短叙事视频。

提示词优先的营销活动概念

从文本提示词开始,生成带原生同步音频的完整视频。营销团队无需准备源图像,即可探索活动概念、氛围短片和发布预告片。

Grok Imagine Video 1.5 社交媒体短视频

使用自然语言指令,将单张起始帧转换为动态视频,最高支持 1080p。为信息流、发布页面、活动公告、产品更新和创作者主导的帖子制作简洁的营销素材。

分镜帧动画

通过提示词指导的运动让已批准的分镜帧栩栩如生,同时保留其作为起始图像。导演和设计师可以创建带同步音频的短预演镜头,供审核使用。

Grok Imagine Video 1.5 品牌营销活动

组合产品视图、角色肖像、服装细节和场景参考,最多支持七张图像。品牌团队可以借助同步音频指导创作短宣传场景,并让每个请求都基于所提供的视觉素材。

Grok Imagine Video 1.5 在多模态视频领域中的表现

比较 Grok Imagine Video 1.5 与主流参考生视频模型在支持的输入类型、片段时长、分辨率、同步音频和标准每秒定价方面的表现。

模型输入类型片段时长最高分辨率原生音频标准价格
Grok Imagine Video v1.5文本、图像、参考图像、语音最长 15 秒1080p√$0.08/秒
Seedance 2.0 Reference-to-Video文本、图像、视频、音频4 至 15 秒4K√$0.112/秒
MiniMax H3 Reference-to-Video文本、图像、视频、音频4 至 15 秒2K√$0.038/秒
Wan-2.7 Reference-to-video文本、图像、视频、音频2 至 10 秒1080p√$0.10/秒

如何在 Atlas Cloud 上使用 Grok Imagine Video 1.5

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 Grok Imagine Video 1.5

将先进的 Grok Imagine Video 1.5 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 Grok Imagine Video 1.5、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

Grok Imagine Video 1.5 API 常见问题

Grok Imagine Video 1.5 是 xAI 的视频生成模型系列,可根据文本、起始图像或多张参考图像创建视频片段。通过 Atlas Cloud,开发者可以使用分别对应各生成模式的端点。

目前支持三种模式:文本生视频、图像生视频和参考图生视频。需要从零创建场景时选择文本模式;需要让起始帧动起来时选择图像模式;需要通过多张图像引导人物、物体和风格时选择参考图模式。

创建 Atlas Cloud API 密钥,并使用适当的模型 ID 向视频生成端点发送经过身份验证的请求。使用返回的任务 ID 查询生成状态,并获取已完成视频的 URL。

文本生视频需要自然语言提示词;图像生视频还需要一张起始帧图像;参考图生视频接受提示词和 1 到 7 张参考图像,并支持为生成的对白可选配预设 voice ID。

Atlas Cloud 提供的 schema 支持生成 1 到 15 秒的视频片段。文本生视频和图像生视频支持 480p、720p 或 1080p 输出;参考图生视频支持 480p 或 720p。

会。文本生视频会根据提示词生成原生同步音频;参考图生视频则可以将生成的音频与可选的预设 voice 结合,用于对白。

Atlas Cloud 为该系列页面涵盖的每个端点列出的标准基础价格为 $0.08。部署前请查看所选端点当前的计费详情,因为提供的价格记录未说明计费单位。

通过参考图生视频端点提供 1 到 7 张图像。在提示词中使用 <IMAGE_0> 和 <IMAGE_1> 等标签标识具体素材,以便模型将每张参考图与预期的人物、物体或场景元素对应起来。

现有的 Atlas Cloud schema 不包含专用的尾帧参数。图像生视频使用一张图像作为起始帧;参考图生视频则使用 1 到 7 张图像提供视觉引导,但不保证这些图像会分别作为首帧和尾帧。

当需要使用多张图像引导新场景中的人物、物体或视觉风格时,选择参考图生视频。当希望让一张现有图像成为开场画面,并使其运动遵循自然语言提示词时,选择图像生视频。

探索更多系列

Seedance 2.5

Seedance 2.5 API 现已在 Atlas Cloud 上线!它为开发者提供了 ByteDance 最新的视频模型。该模型可通过文本、单张图像或多达 50 个多模态参考,一次性生成长达 30 秒的原生视频,并包含同步音频和画面内的多语言文本。在 Atlas Cloud 上,您可以通过单个密钥访问它,其主体一致性和改进的物理特性能够保持长镜头的连贯性。

查看系列

Wan 3.0

Wan 3.0 API 是阿里巴巴 Wan 视频系列的下一代产品,旨在将长视频生成、多参考控制和音视频质量推向新的高度。Atlas Cloud 已经托管了 Wan 2.7、2.6 和 2.5,而 Wan 3.0 使用相同的统一密钥运行,无需额外设置。立即开始构建吧。向下滚动至展示区,查看 Wan 3.0 的创作能力。

查看系列

MiniMax H3

MiniMax H3 是 MiniMax 的多模态视频系列,支持文本、图像和参考内容引导创作。在支持的路由中,它能够保留参考媒体中的主体,提供灵活的宽高比,并通过 H3 Developer 将生成的声音与画面结合;输出配置则由 endpoint 选择。Atlas Cloud 通过一个 OpenAI 兼容密钥统一接入整个系列,并提供透明的按量付费定价,标准费率为每秒 $0.038。立即开始构建。

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

Seedance 2.0

Seedance 2.0 是 ByteDance 面向生产环境的视频模型,专用于精准镜头创作。将提示词转换为视频,使用首帧图像生成动画并可选用尾帧引导,或结合参考媒体和可选的联网搜索来塑造结果。Atlas Cloud 将这些工作流整合到统一的 API 中,提供透明的按量付费定价和一个兼容 OpenAI 的密钥。立即开始构建。

查看系列

GPT Image 2.5

OpenAI 的 gpt-image-2.5 系列为开发者提供 Flare 和 Sunburst 两种选择,满足生产级图像工作流需求。支持最高 3840x2160 的任意分辨率渲染,并提供包括 xhigh 和 max 在内的五档质量等级,以匹配特定的输出要求。Atlas Cloud 提供开箱即用的 REST 推理服务,无冷启动,每次生成起价 $0.004,采用标准定价。立即开始构建。

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Gemini Omni Flash

gemini omni API 将 Google DeepMind 原生多模态的 Gemini Omni Flash 系列(包括 Gemini Omni 1.1 Flash)带给开发者。创建带同步原生音频的电影级视频,使用精确的起始帧和结束帧控制为静态图像制作动画,或通过文本引导式编辑修改现有视频,同时保留未编辑的内容。Atlas Cloud 提供一个 OpenAI 兼容密钥、统一访问能力以及透明的按量付费定价。立即开始构建。

查看系列

Grok Imagine

Grok Imagine API 涵盖 xAI 的图像、视频和语音模型,包括 Image 2.0、Video 1.5 和 xAI TTS v1。支持生成跨 14 种宽高比的 1K 或 2K 静帧、生成最长 15 秒的 1080p 视频、通过最多 7 张参考图像引导镜头、或用 20 种语言进行配音。Atlas Cloud 在单一端点上运行所有功能,采用按量计费,起价为每张图像 $0.02、每秒 $0.05。立即开始使用。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

一个 API,畅享全模态 AI。

探索全部模型