
Grok Imagine Video 为开发者提供访问 xAI 视频模型家族的能力,用于创建、制作动画、延展和编辑视频片段。通过提示词生成 1 至 15 秒的视频,使用最多 7 张参考图像引导人物、物体或风格,并支持 480p 或 720p。Atlas Cloud 通过兼容 OpenAI 的端点整合这些能力,并提供透明的按需付费定价。立即开始构建。
Grok Imagine Video 由 xAI 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
选择与源素材、预期转换效果和制作流程相匹配的 Grok Imagine Video endpoint。
| 模态 | 描述 |
|---|---|
| Grok Imagine Video T2V API(Text To Video) | 将自然语言提示词转换为时长 1 至 15 秒、分辨率为 480p 或 720p 的视频。此 endpoint 适用于概念可视化、社交媒体短片,以及无需源媒体即可生成的场景。 |
| Grok Imagine Video I2V API(Image To Video) | 以提供的图像为起点,根据自然语言运动提示词生成 480p 或 720p 视频。可用于为插画、产品图像、角色画面或营销活动视觉素材添加动画效果。 |
| Grok Imagine Video R2V API(Reference To Video) | 使用 1 至 7 张代表人物、物体或视觉风格的参考图像来引导视频生成。输出视频最长可达 10 秒,分辨率为 480p 或 720p,支持基于参考素材的创意制作。 |
| Grok Imagine Video Extend API(视频扩展) | 提供现有的 2 至 15 秒 MP4,并通过提示词定向扩展 2 至 10 秒。输出格式与输入一致,分辨率上限为 720p,适合延长已有镜头。 |
| Grok Imagine Video Edit API(视频编辑) | 提供 MP4 和自然语言指令,在保留源视频时长的同时修改其视觉内容。输出时长上限为 8.7 秒,适合对短视频素材进行定向修订和基于提示词的转换。 |
Grok Imagine Video 可将文本、起始帧和最多七张参考图转换为短片段,并通过 Atlas Cloud 统一的按量付费 API 延长或编辑现有 MP4 素材。
编写自然语言提示词,生成时长为 1 到 15 秒、分辨率为 480p 或 720p 的视频片段。七种画面比例(包括 16:9、1:1 和 9:16)可让每个镜头适配预期画布。直接在提示词中控制主体、动作、镜头运动和氛围。这是构思故事节点、营销活动创意和社交视频的灵活起点。
将提供的起始帧图像转换为时长 1 到 15 秒、分辨率为 480p 或 720p 的视频。图像确定开场构图,自然语言运动提示词则引导动作和场景发展。需要不同输出形状时,可从七种画面比例中进行选择。该工作流适用于产品镜头、插画场景和艺术指导概念,无需重新制作开场帧即可为其添加动态效果。
使用 1 到 7 张代表人物、物体或视觉风格的参考图来引导视频生成。在提示词中引用各个输入,然后以 480p 或 720p 生成最长 10 秒的视频,并支持七种画面比例。由于参考图用于塑造场景,而不只是作为起始帧,创作者可以更好地控制反复出现的视觉元素。适用于角色主导的场景、产品叙事或注重风格统一的营销活动。
通过提示词驱动的延展,为现有的 2 到 15 秒 MP4 追加一段时长 2 到 10 秒的视频。Grok Imagine Video 会从最后一帧继续生成,并返回原始片段和新增片段,同时保持输入分辨率,最高支持 720p。用自然语言描述接下来的动作、揭示内容或镜头运动。这样可以更轻松地将突兀的结尾转化为完整的叙事节点。
向 Grok Imagine Video 提供 MP4 和自然语言指令,在保留源视频时长的同时转换素材。输入视频最长可达 8.7 秒,计费时长以输入视频长度为准。无需从头重建片段,即可要求修改画面、转换氛围或调整整个场景。它非常适合制作短视频创意变体,以及进行可控的生成后优化。
通过一个统一 API,在文生视频、图生视频、参考图引导生成、视频延展和视频编辑之间灵活切换。根据可用的源素材选择相应端点,并通过异步预测流程提交每项任务。在整个工作流中保持一致的身份验证和集成模式。按量付费的访问方式支持实验和可重复的生产流水线。开发者可以用更低的集成成本构建更完善的视频工具。
了解 Grok Imagine Video 与两款领先替代方案如何通过运动、连续性、镜头控制、光照和视觉叙事,诠释完全相同的提示词。
一部时长 8–10 秒、超写实的户外冒险电影,场景设定在一场暴雨过后的翡翠色峡谷中。一个身穿钴蓝色防水服、橙红色救生衣的皮划艇运动员,从第一帧到最后一帧始终冲过狂暴的白水激流。开场采用极低机位的贴水跟拍镜头,镜头与皮划艇并行疾驰,桨叶劈入水流,在镜头前溅起清晰水花;皮划艇冲上陡峭的浪峰并腾空而起。随后快速甩镜切入运动员的第一人称 POV:船身在一棵倒下的树木下方侧翻滚过,冲穿半透明的水幕,并险险避开湿滑而尖利的岩石;即使经历水花冲击和短暂遮挡,运动员的双手、船桨和钴蓝色船头仍须保持物理一致性。运动员将桨抵住水流,贴着峡谷岩壁完成一次紧凑的反弹转向,重新落入激流。高潮时,镜头切换为从悬崖顶部俯冲而下的无人机镜头,快速下降并环绕运动员拍摄其落水过程;船头以令人信服的冲击力撞上一只漂浮的木箱,将其撞开——紧接着出现一个突然且俏皮的惊喜:一串彼此相连、完好无损的彩色纸灯笼从木箱中弹出,展开并在冰冷湍急的水面上温暖地摇曳漂流,而皮划艇继续向前疾驰。全程保持符合人体结构的连续运动、真实的皮划艇惯性、船桨阻力、碰撞效果、湍流流体动力学、织物运动、水滴、镜头水雾,以及每次遮挡后始终稳定的主体身份;不要慢动作,不要空洞的环境建立镜头,不要切换到屏幕、界面、仪表盘、进度条、图表、说明文字或 logo。阴冷的青色日光,雨水浸暗的翡翠色岩壁,鲜艳的橙红色救生衣,温暖的多彩灯笼光;采用电影宽银幕斜向构图突出速度感,高对比度,自然运动模糊,沉浸式写实动作运动摄影。同步音效:轰鸣的急流声、清脆的划桨撞击声、木材断裂声、急促的呼吸声、水流拍击船身的声音,以及灯笼挣脱飞出时响起的明亮打击乐点缀。16:9 宽高比。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
一段时长 8–10 秒、连续动作的电影感场景,地点是即将迎来暴雨的露天夜市:一位蒙着眼的拉面大师自信地穿梭奔跑在拥挤的食品摊位迷宫中,同时持续将一条银白色面带在双手之间拉伸。开场采用完全垂直的鸟瞰视角,随后从高空快速俯冲进入霓虹灯照亮的夜市迷宫,第一批沉重的雨滴正好砸在遮雨棚和湿润的地面上。锁定飞舞的面带,镜头紧贴其侧方疾驰,面带掠过发亮的炭火炉、受惊的食客、滋滋作响的烤架,以及在风中猛然撑开的雨伞;保持无缝的人体运动、可信的面条弹性物理、复杂的前景遮挡、飞溅的雨水、火星和浓密蒸汽。快速甩镜转向厨师,他在不减速的情况下跃过一只低矮木箱;随后以快速 360 度环绕镜头围绕他旋转,只见他扭身并以精准的动量将面条向后甩出。面带干净利落地划出弧线,落入他身后一只剧烈沸腾的铜锅中——就在胜利的瞬间,一只淘气的橙色虎斑猫从摊位下方跃出,用嘴叼走一半垂下的面条后飞奔而去,制造出清脆利落的视觉笑点,而厨师仍毫无察觉地继续奔跑。霓虹黑色电影风格的写实画面,青绿色与洋红色倒影铺洒在雨水湿润的地面上,温暖的炉火橙色作为富有节奏感的视觉点缀,具有触感的蒸汽与雨水,稳定的动作编排,锐利的电影级细节,充满活力的实时节奏;不要慢动作,不要破坏空间或人物连续性的剪辑。音效:逐渐增强的雷声、夜市喧闹声、沉重的脚步声、雨伞啪地撑开的声音、炭火滋滋声、沸水声,以及与镜头运动同步的面条呼啸声;最后以明亮滑稽的猫叫声和铜锅溅水声收尾。不要出现屏幕、用户界面、仪表盘、进度条、图表、说明文字、字幕、logo、水印或解释性文本。16:9 宽高比。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 可将提示词、静态图、参考素材和现有 MP4 文件转化为适用于社交短片、产品视觉、品牌故事、长序列、定向编辑和创作者工具的实用方案。
Grok Imagine Video 可将自然语言提示词转换为 480p 或 720p 的短片。无需提前准备源素材,即可制作社交媒体预告片、营销活动概念稿和快速视觉草图。
从产品图片出发,image to video endpoint 可根据提示词驱动运动效果,并生成 480p 或 720p 视频。品牌可以将目录静态图转化为产品展示、发布素材和电商平台视觉内容。
使用 1 到 7 张图片,reference to video 可将人物、物体或风格引导到全新视频片段中。创意团队可以基于提供的视觉素材,开发品牌故事、角色概念和产品场景。
通过 2 到 10 秒的提示词驱动延展,继续生成现有 MP4 内容,同时保留输入分辨率,最高支持 720p。该功能适用于延长分镜节拍、制作连续剧式转场,以及基于已批准素材生成后续片段。
通过自然语言指令编辑 MP4,同时保留源视频时长,输出最长为 8.7 秒。团队可以创建不同视觉风格、本地化营销活动变体或调整后的视觉呈现。
围绕 Grok Imagine Video 的五种模式——生成、动画、参考、延展和编辑——构建提示词驱动的视频工具。开发者可以基于同一产品系列支持创作者工作流,并选择 480p 或 720p 输出。
从输入方式、片段时长、最高分辨率和标准价格等方面,对比 Grok Imagine Video 工作流与精选 Atlas Cloud 替代方案。
| 模型 | 输入工作流 | 片段或分段时长 | 最高分辨率 | 标准价格 |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | 文本提示词 | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | 起始图像 + 文本提示词 | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 张参考图像 + 文本提示词 | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | 2–15s MP4 + 文本提示词 | 延长 2–10s | 与输入一致,最高 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + 文本指令 | 与输入一致,最长 8.7s | - | $0.07/input sec |
| MiniMax H3 Text-to-Video | 文本提示词 | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | 起始图像 + 文本,可选末帧 | 4–15s | 原生 4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 张参考图像 + 文本提示词 | 1–16s | 1440p SR,原生最高 1080p | $0.125/run |
| Wan-2.7 Video-edit | 源视频 + 文本,可选图像或音频 | - | 1080p | $0.10/run |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Grok Imagine Video 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Grok Imagine Video、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
Grok Imagine Video 是 xAI 的视频生成模型系列,用于创建、制作动画、延长和编辑短视频片段。Atlas Cloud 为文本、图像、参考图像、延长和编辑工作流提供独立的 API endpoint。
Grok Imagine Video 可以根据文本生成视频片段、让起始图像动起来,或使用最多七张参考图像来引导人物、物体和风格。独立的 endpoint 还可以延续现有视频片段,或通过自然语言指令编辑 MP4。
创建 Atlas Cloud API key,并向 /api/v1/model/generateVideo 发送经过身份验证的 POST 请求。指定所需的 model ID、prompt,以及该路由要求的图像或视频输入。响应中包含 request ID、状态和输出字段。
如果场景从 prompt 开始,请选择 text-to-video;如果需要将提供的图像作为起始帧,请选择 image-to-video。reference-to-video 可通过多张图像提供更广泛的引导,而 extend-video 和 edit-video 则用于处理现有 MP4 文件。
Text-to-video 和 image-to-video 支持时长为 1 到 15 秒、分辨率为 480p 或 720p 的视频片段。Reference-to-video 支持时长为 1 到 10 秒、分辨率为 480p 或 720p 的视频片段;常见宽高比包括 16:9、9:16、1:1、4:3、3:4、3:2 和 2:3。延长和编辑路由遵循各自的输入限制。
会。xAI 将原生音频生成作为 Grok Imagine 视频工作流的一部分,使声音和画面能够同步生成。Atlas Cloud 为这些路由发布的 schema 没有提供单独的音频开关。
通过 reference-to-video endpoint 提供 1 到 7 个公开的 HTTPS 图像 URL 或 base64 data URI。使用 <IMAGE_0> 等标签,可以将单张参考图像与 prompt 中描述的人物、物体或风格关联起来。该路由可返回时长最长 10 秒、分辨率为 480p 或 720p 的视频片段。
使用 extend-video 处理时长为 2 到 15 秒的 MP4,并请求增加 2 到 10 秒由 prompt 指定的动作。对于定向修改,edit-video 接受时长不超过 8.7 秒的 MP4,并保留原视频时长。两条路由的输出分辨率上限均为 720p。
Atlas Cloud 的标准价格为:text-to-video、image-to-video 和 reference-to-video 每秒 $0.05。Extend-video 和 edit-video 的标准价格为每秒 $0.07。编辑费用根据输入视频时长计算,因为输出会保留该时长。
首先确认所选 endpoint 与输入类型匹配,并确保所有必需的 prompt、图像 URL 或视频 URL 均已提供。重新提交前,检查该路由对时长、分辨率、宽高比、参考图像数量和 MP4 的限制。如果请求成功但场景不准确,请重写 prompt,明确说明主体运动、摄像机运动、节奏和视觉细节。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。