
Grok Imagine Video 1.5 是 xAI 面向开发者推出的视频生成系列,适合需要根据提示词和视觉输入实现可控运动效果的场景。使用自然语言运动指令为起始帧添加动画,在参考工作流中选择 480p 或 720p,并添加可选的参考语音来引导生成结果。通过一个兼容 OpenAI 的 Atlas Cloud 密钥访问受支持的模式,享受透明的按量付费定价。立即开始构建。
Grok Imagine Video 1.5 由 xAI 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
探索六个端点,了解如何在开发者和标准工作流中,将文本、起始帧或参考素材转换为视频。
| 模态 | 描述 |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | 使用 1 至 7 张参考图像和可选的参考音频,生成带原生同步音频的视频。输出时长最长可达 15 秒,分辨率支持 480p 或 720p。此端点适用于参考图像驱动的场景,以及需要多张源图像的视觉概念创作。 |
| Grok Imagine Video 1.5 Reference-to-Video API | 基于 1 至 7 张参考图像生成视频,并提供原生同步音频,同时支持可选的参考音频。支持生成最长 15 秒、分辨率为 480p 或 720p 的视频。适合多参考图像视频制作和音频引导的连续镜头。 |
| Grok Imagine Video 1.5 Developer Text-to-Video API | 只需提供文本提示,即可通过此开发者端点生成带原生同步音频的视频。可创建最长 15 秒的片段,分辨率支持 480p、720p 或 1080p。适用于提示词驱动的创意、分镜脚本和短视频制作。 |
| Grok Imagine Video 1.5 Text-to-Video API | 直接根据文本提示创建视频,同时原生生成同步音频。输出分辨率支持 480p、720p 和 1080p,最长时长为 15 秒。适用于脚本化场景、营销活动创意或社交媒体视频素材。 |
| Grok Imagine Video 1.5 Developer Image-to-Video API | 以一张图像为起点,通过自然语言运动指令生成动画视频。分辨率支持 480p、720p 和 1080p。适用于为插画、产品视觉素材和准备好的开场帧添加动画效果。 |
| Grok Imagine Video 1.5 Image-to-Video API | 通过自然语言描述所需动作,为起始帧图像添加动画效果。生成的视频支持 480p、720p 或 1080p 分辨率。此工作流适用于动作研究、视觉叙事和以图像为核心的创意制作。 |
Grok Imagine Video 1.5 将文本、起始图像以及一至七张参考图工作流整合在一起,并原生支持同步音频、最高 1080p 输出,以及在文本或参考模式下最长 15 秒的片段;同时,Atlas Cloud 提供一个 API 和透明的按量付费定价。
从文本提示词开始,生成最长 15 秒、分辨率为 480p、720p 或 1080p 的视频片段。原生同步音频会在生成过程中与视频一并输出。当没有源图像时,你可以完全通过文字指令塑造场景与动作。该路径适合概念影片、电影感实验,以及由提示词驱动的内容生产流程。
通过自然语言运动提示词,让单张起始画面转化为动态序列。选择 480p、720p 或 1080p 输出,同时由图像确定开场构图。在提示词中描述主体和场景的运动,再让模型从这一视觉锚点继续生成动画。它适合产品镜头、角色片段,以及需要动态效果的艺术指导静帧。
使用一至七张参考图以及可选的参考声音来引导 Grok Imagine Video 1.5。参考模式可生成最长 15 秒、分辨率为 480p 或 720p、带原生同步音频的视频片段。利用这些输入,让生成场景朝既定的视觉方向发展。该路径适合基于现有创意参考构建的营销活动和故事内容。
视频和声音会一同生成,因此每个片段都可以包含原生同步音频,无需单独进行音频处理。围绕可见动作构建场景,并通过伴随音轨强化动作时序。对于重视同步效果的场景,这种联合生成路径减少了视觉创作与声音制作之间的交接环节。它尤其适合表演类和氛围感丰富的素材。
让一个完整的视觉节拍延展到最长 15 秒的文本或参考片段中,不必停留在短循环效果。可用时长足以在一个生成序列中完成铺垫、动作和明确的结果。结合变化的镜头视角与连贯动作,可以塑造更加完整的瞬间。这一时长非常适合短广告、叙事揭示和社交视频场景。
通过一个 Atlas Cloud API,在文本、起始图像和参考图生成之间灵活切换,并享受透明的按量付费定价。根据每项素材选择匹配的工作流,而不是强迫所有创意都使用同一种输入类型。同一套集成让开发者可以访问列出的全部六个 Grok Imagine Video v1.5 端点,包括 standard 和 Developer 路由。这让不同视频任务的实验与生产规划更加简单。
看看 Grok Imagine Video 1.5 与两个 Atlas Cloud 替代方案如何解读相同提示词,呈现电影化动作与风格化奇幻场景。
一部时长 9 秒、单镜头拍摄的水下巴洛克奇幻电影,场景位于一座废弃且完全被水淹没的歌剧院内:一名头发飘逸、戴着发光珍珠面具的优雅自由潜水者,追逐一只叼着华丽黄铜钥匙、珊瑚红色鲜艳夺目的章鱼,穿行于漂浮的天鹅绒帷幕之间。开场从开裂的舞台地板内部开始,以戏剧性的低角度仰拍镜头展现她翻滚着头朝下穿过裂缝;随后切换为紧贴主体的横向跟拍,她在倾倒的剧院座椅之间穿梭,头发与服装随水流自然摆动,帷幕鼓起,气泡穿过层层拱门向上飘散;接着环绕她旋转并向上升起,此时水压将头顶的水晶吊灯扯落。高潮时,她在最后一刻侧身扭转,避开坠落的吊灯,水晶彼此碰撞并真实地四散飞落;与此同时,章鱼用复杂而卷曲的触手灵巧地接住翻滚的钥匙,庄重地停顿片刻,再将钥匙放回她摊开的手掌中。连续流畅的运动,清晰的起承转合:开场—追逐—收束;角色与珍珠面具保持一致;准确呈现水阻力、浮力、织物、头发、气泡、触手变形、撞击与碰撞规避等物理效果。破碎天窗投下的冷青色光束穿透幽暗的水下观众厅;珊瑚红是唯一高度饱和的色彩,引导视线穿过深处层叠的拱门、帷幕、悬浮碎屑与气泡。写实电影感水下摄影,带有 subtle 的油画质感,典雅宏伟的巴洛克气韵,体积光焦散,高细节,无文字,无界面,不要用静止画面伪装剪辑。沉浸式音效:低沉的水下轰鸣、湍急水流、织物 flutter、气泡声、水晶撞击声,以及紧张的管弦乐脉冲;当钥匙被归还时,音乐化解为一声 delicately 轻柔的竖琴音。画面宽高比 16:9。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
一支荒诞动作喜剧广告,场景设定在黎明时分一间细节极其丰富的 1950 年代理发店内。一只脾气暴躁、毛发蓬乱的古代英国牧羊犬浑身裹满厚厚的白色肥皂泡沫,猛地撞开店门,在店内横冲直撞,边跑边甩得到处都是泡沫;受惊的理发师跳上一把旋转椅,骑着它一路追赶,快速剪下狗狗飞扬的毛发,每一下清脆的剪刀声都与有力的爵士鼓点精准同步。开场采用极低机位跟拍镜头,贴着湿漉漉的爪子飞驰;爪子在光亮的黑白棋盘格地砖上打滑,将逼真的水滴与泡沫飞溅向镜头;随后快速向上甩镜,进入高速环绕跟拍,借助三面大镜子,通过复杂且准确的反射,持续展示并保持狗与理发师不断变化的位置关系;接着快速推近,最后一批飞扬的碎发翻滚、旋转,精准落在狗头上,形成夸张高耸的蓬巴杜发型。狗停下来,以一段 1 秒钟、近似定格的得意主角高光时刻摆出姿势;随后突然打了个喷嚏,泡沫与毛发爆炸般喷散,爵士乐以一记尖锐的喜剧边鼓声收尾。温暖的钨丝灯实景光穿过窗外清冷的青绿色晨雾;浓郁的酒红色、奶油色、抛光黄铜与深色木材构成复古色调;高端实拍广告电影摄影,连续无缝的高速编舞,角色与空间连续性保持一致,准确呈现湿毛、肥皂泡沫、散落毛发、反射、椅子旋转、惯性与碰撞等物理效果,触感逼真的写实细节,动作清晰锐利,无慢动作,无空洞的建立镜头,无屏幕,无软件界面,无仪表盘,无进度条,无图表,无字幕,无解释性文字,无标志,无水印,画面宽高比 16:9。
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 可将提示词、源帧和最多七张参考图像转换为带同步音频的短视频,适用于营销活动、产品展示、角色故事、社交媒体内容和快速视觉原型设计。
使用自然语言运动提示词和同步音频,让产品静态图像动起来。为店铺页面、营销活动页面、发布素材或付费社交媒体投放位创建最高 1080p 的短展示视频。
使用一到七张角色参考图像以及可选的参考音色来引导场景创作。此设置支持重复出场的角色阵容、对话片段,以及带原生同步音频的短叙事视频。
从文本提示词开始,生成带原生同步音频的完整视频。营销团队无需准备源图像,即可探索活动概念、氛围短片和发布预告片。
使用自然语言指令,将单张起始帧转换为动态视频,最高支持 1080p。为信息流、发布页面、活动公告、产品更新和创作者主导的帖子制作简洁的营销素材。
通过提示词指导的运动让已批准的分镜帧栩栩如生,同时保留其作为起始图像。导演和设计师可以创建带同步音频的短预演镜头,供审核使用。
组合产品视图、角色肖像、服装细节和场景参考,最多支持七张图像。品牌团队可以借助同步音频指导创作短宣传场景,并让每个请求都基于所提供的视觉素材。
比较 Grok Imagine Video 1.5 与主流参考生视频模型在支持的输入类型、片段时长、分辨率、同步音频和标准每秒定价方面的表现。
| 模型 | 输入类型 | 片段时长 | 最高分辨率 | 原生音频 | 标准价格 |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | 文本、图像、参考图像、语音 | 最长 15 秒 | 1080p | √ | $0.08/秒 |
| Seedance 2.0 Reference-to-Video | 文本、图像、视频、音频 | 4 至 15 秒 | 4K | √ | $0.112/秒 |
| MiniMax H3 Reference-to-Video | 文本、图像、视频、音频 | 4 至 15 秒 | 2K | √ | $0.038/秒 |
| Wan-2.7 Reference-to-video | 文本、图像、视频、音频 | 2 至 10 秒 | 1080p | √ | $0.10/秒 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Grok Imagine Video 1.5 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Grok Imagine Video 1.5、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
Grok Imagine Video 1.5 是 xAI 的视频生成模型系列,可根据文本、起始图像或多张参考图像创建视频片段。通过 Atlas Cloud,开发者可以使用分别对应各生成模式的端点。
目前支持三种模式:文本生视频、图像生视频和参考图生视频。需要从零创建场景时选择文本模式;需要让起始帧动起来时选择图像模式;需要通过多张图像引导人物、物体和风格时选择参考图模式。
创建 Atlas Cloud API 密钥,并使用适当的模型 ID 向视频生成端点发送经过身份验证的请求。使用返回的任务 ID 查询生成状态,并获取已完成视频的 URL。
文本生视频需要自然语言提示词;图像生视频还需要一张起始帧图像;参考图生视频接受提示词和 1 到 7 张参考图像,并支持为生成的对白可选配预设 voice ID。
Atlas Cloud 提供的 schema 支持生成 1 到 15 秒的视频片段。文本生视频和图像生视频支持 480p、720p 或 1080p 输出;参考图生视频支持 480p 或 720p。
会。文本生视频会根据提示词生成原生同步音频;参考图生视频则可以将生成的音频与可选的预设 voice 结合,用于对白。
Atlas Cloud 为该系列页面涵盖的每个端点列出的标准基础价格为 $0.08。部署前请查看所选端点当前的计费详情,因为提供的价格记录未说明计费单位。
通过参考图生视频端点提供 1 到 7 张图像。在提示词中使用 <IMAGE_0> 和 <IMAGE_1> 等标签标识具体素材,以便模型将每张参考图与预期的人物、物体或场景元素对应起来。
现有的 Atlas Cloud schema 不包含专用的尾帧参数。图像生视频使用一张图像作为起始帧;参考图生视频则使用 1 到 7 张图像提供视觉引导,但不保证这些图像会分别作为首帧和尾帧。
当需要使用多张图像引导新场景中的人物、物体或视觉风格时,选择参考图生视频。当希望让一张现有图像成为开场画面,并使其运动遵循自然语言提示词时,选择图像生视频。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。