Seedance 2.0 Mini & Fast API 全球最低价 —— 比官方定价最高低 68%
Grok Imagine Video with Reference Guidance

Grok Imagine Video with Reference Guidance

Grok Imagine Video 为开发者提供访问 xAI 视频模型家族的能力,用于创建、制作动画、延展和编辑视频片段。通过提示词生成 1 至 15 秒的视频,使用最多 7 张参考图像引导人物、物体或风格,并支持 480p 或 720p。Atlas Cloud 通过兼容 OpenAI 的端点整合这些能力,并提供透明的按需付费定价。立即开始构建。

Grok Imagine Video 由 xAI 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。

比较 Grok Imagine Video 的视频模式与工作流

选择与源素材、预期转换效果和制作流程相匹配的 Grok Imagine Video endpoint。

模态描述
Grok Imagine Video T2V API(Text To Video)将自然语言提示词转换为时长 1 至 15 秒、分辨率为 480p 或 720p 的视频。此 endpoint 适用于概念可视化、社交媒体短片,以及无需源媒体即可生成的场景。
Grok Imagine Video I2V API(Image To Video)以提供的图像为起点,根据自然语言运动提示词生成 480p 或 720p 视频。可用于为插画、产品图像、角色画面或营销活动视觉素材添加动画效果。
Grok Imagine Video R2V API(Reference To Video)使用 1 至 7 张代表人物、物体或视觉风格的参考图像来引导视频生成。输出视频最长可达 10 秒,分辨率为 480p 或 720p,支持基于参考素材的创意制作。
Grok Imagine Video Extend API(视频扩展)提供现有的 2 至 15 秒 MP4,并通过提示词定向扩展 2 至 10 秒。输出格式与输入一致,分辨率上限为 720p,适合延长已有镜头。
Grok Imagine Video Edit API(视频编辑)提供 MP4 和自然语言指令,在保留源视频时长的同时修改其视觉内容。输出时长上限为 8.7 秒,适合对短视频素材进行定向修订和基于提示词的转换。

Grok Imagine Video 覆盖五种创意工作流

Grok Imagine Video 可将文本、起始帧和最多七张参考图转换为短片段,并通过 Atlas Cloud 统一的按量付费 API 延长或编辑现有 MP4 素材。

使用文本生成 Grok Imagine Video

编写自然语言提示词,生成时长为 1 到 15 秒、分辨率为 480p 或 720p 的视频片段。七种画面比例(包括 16:9、1:1 和 9:16)可让每个镜头适配预期画布。直接在提示词中控制主体、动作、镜头运动和氛围。这是构思故事节点、营销活动创意和社交视频的灵活起点。

为起始帧添加动画

将提供的起始帧图像转换为时长 1 到 15 秒、分辨率为 480p 或 720p 的视频。图像确定开场构图,自然语言运动提示词则引导动作和场景发展。需要不同输出形状时,可从七种画面比例中进行选择。该工作流适用于产品镜头、插画场景和艺术指导概念,无需重新制作开场帧即可为其添加动态效果。

Grok Imagine Video 参考图控制

使用 1 到 7 张代表人物、物体或视觉风格的参考图来引导视频生成。在提示词中引用各个输入,然后以 480p 或 720p 生成最长 10 秒的视频,并支持七种画面比例。由于参考图用于塑造场景,而不只是作为起始帧,创作者可以更好地控制反复出现的视觉元素。适用于角色主导的场景、产品叙事或注重风格统一的营销活动。

延续故事线

通过提示词驱动的延展,为现有的 2 到 15 秒 MP4 追加一段时长 2 到 10 秒的视频。Grok Imagine Video 会从最后一帧继续生成,并返回原始片段和新增片段,同时保持输入分辨率,最高支持 720p。用自然语言描述接下来的动作、揭示内容或镜头运动。这样可以更轻松地将突兀的结尾转化为完整的叙事节点。

使用 Grok Imagine Video 编辑片段

向 Grok Imagine Video 提供 MP4 和自然语言指令,在保留源视频时长的同时转换素材。输入视频最长可达 8.7 秒,计费时长以输入视频长度为准。无需从头重建片段,即可要求修改画面、转换氛围或调整整个场景。它非常适合制作短视频创意变体,以及进行可控的生成后优化。

五种工作流,一个 API

通过一个统一 API,在文生视频、图生视频、参考图引导生成、视频延展和视频编辑之间灵活切换。根据可用的源素材选择相应端点,并通过异步预测流程提交每项任务。在整个工作流中保持一致的身份验证和集成模式。按量付费的访问方式支持实验和可重复的生产流水线。开发者可以用更低的集成成本构建更完善的视频工具。

一个提示词,三种视觉呈现:Grok Imagine Video 对比

了解 Grok Imagine Video 与两款领先替代方案如何通过运动、连续性、镜头控制、光照和视觉叙事,诠释完全相同的提示词。

提示词

一部时长 8–10 秒、超写实的户外冒险电影,场景设定在一场暴雨过后的翡翠色峡谷中。一个身穿钴蓝色防水服、橙红色救生衣的皮划艇运动员,从第一帧到最后一帧始终冲过狂暴的白水激流。开场采用极低机位的贴水跟拍镜头,镜头与皮划艇并行疾驰,桨叶劈入水流,在镜头前溅起清晰水花;皮划艇冲上陡峭的浪峰并腾空而起。随后快速甩镜切入运动员的第一人称 POV:船身在一棵倒下的树木下方侧翻滚过,冲穿半透明的水幕,并险险避开湿滑而尖利的岩石;即使经历水花冲击和短暂遮挡,运动员的双手、船桨和钴蓝色船头仍须保持物理一致性。运动员将桨抵住水流,贴着峡谷岩壁完成一次紧凑的反弹转向,重新落入激流。高潮时,镜头切换为从悬崖顶部俯冲而下的无人机镜头,快速下降并环绕运动员拍摄其落水过程;船头以令人信服的冲击力撞上一只漂浮的木箱,将其撞开——紧接着出现一个突然且俏皮的惊喜:一串彼此相连、完好无损的彩色纸灯笼从木箱中弹出,展开并在冰冷湍急的水面上温暖地摇曳漂流,而皮划艇继续向前疾驰。全程保持符合人体结构的连续运动、真实的皮划艇惯性、船桨阻力、碰撞效果、湍流流体动力学、织物运动、水滴、镜头水雾,以及每次遮挡后始终稳定的主体身份;不要慢动作,不要空洞的环境建立镜头,不要切换到屏幕、界面、仪表盘、进度条、图表、说明文字或 logo。阴冷的青色日光,雨水浸暗的翡翠色岩壁,鲜艳的橙红色救生衣,温暖的多彩灯笼光;采用电影宽银幕斜向构图突出速度感,高对比度,自然运动模糊,沉浸式写实动作运动摄影。同步音效:轰鸣的急流声、清脆的划桨撞击声、木材断裂声、急促的呼吸声、水流拍击船身的声音,以及灯笼挣脱飞出时响起的明亮打击乐点缀。16:9 宽高比。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

提示词

一段时长 8–10 秒、连续动作的电影感场景,地点是即将迎来暴雨的露天夜市:一位蒙着眼的拉面大师自信地穿梭奔跑在拥挤的食品摊位迷宫中,同时持续将一条银白色面带在双手之间拉伸。开场采用完全垂直的鸟瞰视角,随后从高空快速俯冲进入霓虹灯照亮的夜市迷宫,第一批沉重的雨滴正好砸在遮雨棚和湿润的地面上。锁定飞舞的面带,镜头紧贴其侧方疾驰,面带掠过发亮的炭火炉、受惊的食客、滋滋作响的烤架,以及在风中猛然撑开的雨伞;保持无缝的人体运动、可信的面条弹性物理、复杂的前景遮挡、飞溅的雨水、火星和浓密蒸汽。快速甩镜转向厨师,他在不减速的情况下跃过一只低矮木箱;随后以快速 360 度环绕镜头围绕他旋转,只见他扭身并以精准的动量将面条向后甩出。面带干净利落地划出弧线,落入他身后一只剧烈沸腾的铜锅中——就在胜利的瞬间,一只淘气的橙色虎斑猫从摊位下方跃出,用嘴叼走一半垂下的面条后飞奔而去,制造出清脆利落的视觉笑点,而厨师仍毫无察觉地继续奔跑。霓虹黑色电影风格的写实画面,青绿色与洋红色倒影铺洒在雨水湿润的地面上,温暖的炉火橙色作为富有节奏感的视觉点缀,具有触感的蒸汽与雨水,稳定的动作编排,锐利的电影级细节,充满活力的实时节奏;不要慢动作,不要破坏空间或人物连续性的剪辑。音效:逐渐增强的雷声、夜市喧闹声、沉重的脚步声、雨伞啪地撑开的声音、炭火滋滋声、沸水声,以及与镜头运动同步的面条呼啸声;最后以明亮滑稽的猫叫声和铜锅溅水声收尾。不要出现屏幕、用户界面、仪表盘、进度条、图表、说明文字、字幕、logo、水印或解释性文本。16:9 宽高比。

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video 覆盖每个创意阶段

Grok Imagine Video 可将提示词、静态图、参考素材和现有 MP4 文件转化为适用于社交短片、产品视觉、品牌故事、长序列、定向编辑和创作者工具的实用方案。

Grok Imagine Video 社交短片

Grok Imagine Video 可将自然语言提示词转换为 480p 或 720p 的短片。无需提前准备源素材,即可制作社交媒体预告片、营销活动概念稿和快速视觉草图。

让产品静态图动起来

从产品图片出发,image to video endpoint 可根据提示词驱动运动效果,并生成 480p 或 720p 视频。品牌可以将目录静态图转化为产品展示、发布素材和电商平台视觉内容。

参考素材引导的品牌故事

使用 1 到 7 张图片,reference to video 可将人物、物体或风格引导到全新视频片段中。创意团队可以基于提供的视觉素材,开发品牌故事、角色概念和产品场景。

Grok Imagine Video 故事延展

通过 2 到 10 秒的提示词驱动延展,继续生成现有 MP4 内容,同时保留输入分辨率,最高支持 720p。该功能适用于延长分镜节拍、制作连续剧式转场,以及基于已批准素材生成后续片段。

自然语言视频编辑

通过自然语言指令编辑 MP4,同时保留源视频时长,输出最长为 8.7 秒。团队可以创建不同视觉风格、本地化营销活动变体或调整后的视觉呈现。

使用 Grok Imagine Video 构建工具

围绕 Grok Imagine Video 的五种模式——生成、动画、参考、延展和编辑——构建提示词驱动的视频工具。开发者可以基于同一产品系列支持创作者工作流,并选择 480p 或 720p 输出。

Grok Imagine Video 在视频模型中的定位

从输入方式、片段时长、最高分辨率和标准价格等方面,对比 Grok Imagine Video 工作流与精选 Atlas Cloud 替代方案。

模型输入工作流片段或分段时长最高分辨率标准价格
Grok Imagine Video Text-to-Video文本提示词1–15s720p$0.05/sec
Grok Imagine Video Image-to-Video起始图像 + 文本提示词1–15s720p$0.05/sec
Grok Imagine Video Reference-to-Video1–7 张参考图像 + 文本提示词1–10s720p$0.05/sec
Grok Imagine Video Extend2–15s MP4 + 文本提示词延长 2–10s与输入一致,最高 720p$0.07/sec
Grok Imagine Video EditMP4 + 文本指令与输入一致,最长 8.7s-$0.07/input sec
MiniMax H3 Text-to-Video文本提示词4–15s2K$0.038/sec
Seedance 2.0 Image-to-Video起始图像 + 文本,可选末帧4–15s原生 4K$0.112/sec
Vidu Q3-Mix Reference to Video1–4 张参考图像 + 文本提示词1–16s1440p SR,原生最高 1080p$0.125/run
Wan-2.7 Video-edit源视频 + 文本,可选图像或音频-1080p$0.10/run

如何在 Atlas Cloud 上使用 Grok Imagine Video

几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。

创建 Atlas Cloud 账户

在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。

为何在 Atlas Cloud 使用 Grok Imagine Video

将先进的 Grok Imagine Video 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。

性能与灵活性

低延迟:
GPU 优化推理,实现实时响应。

统一 API:
一次集成,畅用 Grok Imagine Video、GPT、Gemini 和 DeepSeek。

透明定价:
按 Token 计费,支持 Serverless 模式。

企业与规模

开发者体验:
SDK、数据分析、微调工具和模板一应俱全。

可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。

安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。

Grok Imagine Video API 常见问题解答

Grok Imagine Video 是 xAI 的视频生成模型系列,用于创建、制作动画、延长和编辑短视频片段。Atlas Cloud 为文本、图像、参考图像、延长和编辑工作流提供独立的 API endpoint。

Grok Imagine Video 可以根据文本生成视频片段、让起始图像动起来,或使用最多七张参考图像来引导人物、物体和风格。独立的 endpoint 还可以延续现有视频片段,或通过自然语言指令编辑 MP4。

创建 Atlas Cloud API key,并向 /api/v1/model/generateVideo 发送经过身份验证的 POST 请求。指定所需的 model ID、prompt,以及该路由要求的图像或视频输入。响应中包含 request ID、状态和输出字段。

如果场景从 prompt 开始,请选择 text-to-video;如果需要将提供的图像作为起始帧,请选择 image-to-video。reference-to-video 可通过多张图像提供更广泛的引导,而 extend-video 和 edit-video 则用于处理现有 MP4 文件。

Text-to-video 和 image-to-video 支持时长为 1 到 15 秒、分辨率为 480p 或 720p 的视频片段。Reference-to-video 支持时长为 1 到 10 秒、分辨率为 480p 或 720p 的视频片段;常见宽高比包括 16:9、9:16、1:1、4:3、3:4、3:2 和 2:3。延长和编辑路由遵循各自的输入限制。

会。xAI 将原生音频生成作为 Grok Imagine 视频工作流的一部分,使声音和画面能够同步生成。Atlas Cloud 为这些路由发布的 schema 没有提供单独的音频开关。

通过 reference-to-video endpoint 提供 1 到 7 个公开的 HTTPS 图像 URL 或 base64 data URI。使用 <IMAGE_0> 等标签,可以将单张参考图像与 prompt 中描述的人物、物体或风格关联起来。该路由可返回时长最长 10 秒、分辨率为 480p 或 720p 的视频片段。

使用 extend-video 处理时长为 2 到 15 秒的 MP4,并请求增加 2 到 10 秒由 prompt 指定的动作。对于定向修改,edit-video 接受时长不超过 8.7 秒的 MP4,并保留原视频时长。两条路由的输出分辨率上限均为 720p。

Atlas Cloud 的标准价格为:text-to-video、image-to-video 和 reference-to-video 每秒 $0.05。Extend-video 和 edit-video 的标准价格为每秒 $0.07。编辑费用根据输入视频时长计算,因为输出会保留该时长。

首先确认所选 endpoint 与输入类型匹配,并确保所有必需的 prompt、图像 URL 或视频 URL 均已提供。重新提交前,检查该路由对时长、分辨率、宽高比、参考图像数量和 MP4 的限制。如果请求成功但场景不准确,请重写 prompt,明确说明主体运动、摄像机运动、节奏和视觉细节。

探索更多系列

Seedance 2.5

Seedance 2.5 API 现已在 Atlas Cloud 上线!它为开发者提供了 ByteDance 最新的视频模型。该模型可通过文本、单张图像或多达 50 个多模态参考,一次性生成长达 30 秒的原生视频,并包含同步音频和画面内的多语言文本。在 Atlas Cloud 上,您可以通过单个密钥访问它,其主体一致性和改进的物理特性能够保持长镜头的连贯性。

查看系列

Wan 3.0

Wan 3.0 API 是阿里巴巴 Wan 视频系列的下一代产品,旨在将长视频生成、多参考控制和音视频质量推向新的高度。Atlas Cloud 已经托管了 Wan 2.7、2.6 和 2.5,而 Wan 3.0 使用相同的统一密钥运行,无需额外设置。立即开始构建吧。向下滚动至展示区,查看 Wan 3.0 的创作能力。

查看系列

MiniMax H3

MiniMax H3 是 MiniMax 的多模态视频系列,支持文本、图像和参考内容引导创作。在支持的路由中,它能够保留参考媒体中的主体,提供灵活的宽高比,并通过 H3 Developer 将生成的声音与画面结合;输出配置则由 endpoint 选择。Atlas Cloud 通过一个 OpenAI 兼容密钥统一接入整个系列,并提供透明的按量付费定价,标准费率为每秒 $0.038。立即开始构建。

查看系列

Seedream 5.0 Pro

Seedream 5.0 Pro API 为开发者在 Atlas Cloud 上提供了字节跳动的可控图像编辑模型。它通过锚点和坐标精确定位编辑,将图像分离为可编辑图层,融合多个参考,并精准匹配颜色和材质,支持 2K 和 3K 分辨率的多语言文本。在 Atlas Cloud 上,您只需一个密钥即可访问!

查看系列

Seedance 2.0

Seedance 2.0 是 ByteDance 面向生产环境的视频模型,专用于精准镜头创作。将提示词转换为视频,使用首帧图像生成动画并可选用尾帧引导,或结合参考媒体和可选的联网搜索来塑造结果。Atlas Cloud 将这些工作流整合到统一的 API 中,提供透明的按量付费定价和一个兼容 OpenAI 的密钥。立即开始构建。

查看系列

GPT Image 2.5

OpenAI 的 gpt-image-2.5 系列为开发者提供 Flare 和 Sunburst 两种选择,满足生产级图像工作流需求。支持最高 3840x2160 的任意分辨率渲染,并提供包括 xhigh 和 max 在内的五档质量等级,以匹配特定的输出要求。Atlas Cloud 提供开箱即用的 REST 推理服务,无冷启动,每次生成起价 $0.004,采用标准定价。立即开始构建。

查看系列

GPT Image 2

GPT Image 2 API 为开发者提供了访问 OpenAI 最新图像模型的途径,它是 GPT Image 1.5 的继任者。该模型可生成和编辑图像,能够在拉丁和 CJK 文字上实现准确的文本渲染,并在海报、样机和信息图表方面具备强大的排版能力。在 Atlas Cloud 上,您可以通过一个统一的 API 与 300 多个模型一起访问它,并享受免费额度、99.99% 的正常运行时间,且无需 OpenAI 组织验证。

查看系列

Gemini Omni Flash

gemini omni API 将 Google DeepMind 原生多模态的 Gemini Omni Flash 系列(包括 Gemini Omni 1.1 Flash)带给开发者。创建带同步原生音频的电影级视频,使用精确的起始帧和结束帧控制为静态图像制作动画,或通过文本引导式编辑修改现有视频,同时保留未编辑的内容。Atlas Cloud 提供一个 OpenAI 兼容密钥、统一访问能力以及透明的按量付费定价。立即开始构建。

查看系列

Grok Imagine

Grok Imagine API 涵盖 xAI 的图像、视频和语音模型,包括 Image 2.0、Video 1.5 和 xAI TTS v1。支持生成跨 14 种宽高比的 1K 或 2K 静帧、生成最长 15 秒的 1080p 视频、通过最多 7 张参考图像引导镜头、或用 20 种语言进行配音。Atlas Cloud 在单一端点上运行所有功能,采用按量计费,起价为每张图像 $0.02、每秒 $0.05。立即开始使用。

查看系列

Google

Google最强大的创意模型现已在Atlas Cloud上全面可用。Veo 3.1提供电影级别的视频生成,Nano Banana 2支持高保真图像创建,而Gemini为每个工作流带来多模态智能。通过单一API key即可访问完整的Google模型套件,提供Day-0可用性和按需付费(pay-as-you-go)定价。

查看系列

Seedance 2.0 Mini

Seedance 2.0 Mini 将 ByteDance 的多模态视频生成技术引入到对速度和成本要求极高的工作流中。它以更轻量的占用空间提供 Seedance 2.0 的核心能力——更快的生成速度、更低的单条视频成本,并且使用您现有的同款 API 集成。对于运行高吞吐量流水线或进行大规模原型设计的团队来说,Mini 是最实用的默认选择。

查看系列

ByteDance

从电影级视频生成到高保真图像创建,ByteDance 最强大的模型现已在 Atlas Cloud 上线。以最低的推理定价和零基础设施开销,大规模运行 Seedance 和 Seedream。

查看系列

一个 API,畅享全模态 AI。

探索全部模型