


Gemini Omni 1.1 Flash 是 Google DeepMind 推出的原生多模态视频系列,适用于灵活的生产工作流。通过文本指令编辑现有素材,借助最多 10 张参考图像和 3 段视频片段保持视觉一致性,或以可串联的片段延长镜头,最长可达 40 秒。在 Atlas Cloud 上使用一个 OpenAI-compatible API key 即可访问所有工作流,按量付费,并支持 Day-0 上线。立即开始构建。
Gemini Omni 1.1 Flash 由 Google 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
Atlas Cloud 为您提供最新的行业领先创意模型。
按输入工作流、输出能力和生产使用场景,对比五种 Gemini Omni 1.1 Flash 端点。
| 模态 | 描述 |
|---|---|
| Gemini Omni 1.1 Flash Video Extend API | 将现有视频片段无缝延长 3 到 10 秒,并保留原生音频。可串联多次延长,将其构建为一个连贯的视频镜头,总时长最长可达 40 秒。 |
| Gemini Omni 1.1 Flash Video Edit API | 需要修改现有素材,但不想重建整个场景?使用文本指令添加、移除、替换或重新设计视频元素,同时保留原生音频,并保持提示词未提及的内容不变。 |
| Gemini Omni 1.1 Flash Reference-to-Video API | 提供文本提示词,以及最多 10 张参考图片和 3 个参考视频片段,生成带原生声音的电影感视频。此端点适合需要在多次生成中保持角色、产品或艺术指导一致性的项目。 |
| Gemini Omni 1.1 Flash Image-to-Video API | 根据文本提示词,将静态图片制作成带声音的电影感视频片段。可选的结束帧能够精确控制生成镜头的起始和结束位置。 |
| Gemini Omni 1.1 Flash Text-to-Video API | 从一条文本提示词开始,此端点可生成带同步原生音频的电影感视频。可调整时长、宽高比和输出分辨率,输出范围从快速生成的 360p 草稿到 4K 成片。 |
Gemini Omni 1.1 Flash 将视频生成、原生音频、基于参考内容的连续性、精准帧控制、基于指令的编辑和可链式扩展整合到一个灵活的 Atlas Cloud 工作流中。
从文本提示词开始,生成带同步原生音频的电影感片段。Gemini Omni 1.1 Flash 支持控制时长、宽高比和输出分辨率,覆盖从 360p 草稿到 4K 的范围。在一次请求中描述动作、镜头方向、对白、音乐和环境声。这套工作流适用于预告片、社交媒体短片和需要同时设计画面与声音的故事段落。
为现有片段无缝衔接一段 3 至 10 秒的内容,并通过链式扩展将时长延长至最多 40 秒。模型会延续视觉上下文和原生音频,让新增动作自然属于同一镜头。当叙事需要更多空间时,无需重新开始序列,即可构建更长的揭示、追逐或产品故事。
提供一条文本提示词,以及最多 10 张参考图像和 3 段参考视频片段,引导模型生成一段连贯且带原生音频的内容。图像可用于确定角色、产品、地点或艺术方向,而视频参考则用于引导运动和镜头表现。当广告素材、系列场景或品牌内容需要保持可复现的身份特征和视觉语言时,可使用这一路径。
设定开场画面,并可选择提供尾帧来控制镜头的落点。Gemini Omni 1.1 Flash 会将静态画面制作成带原生声音的电影感片段,并向指定终点进行插帧过渡。这种起始与结束结构适合产品展示、无缝转场、匹配剪辑,以及必须在精准构图上完成收束的预设镜头运动。
通过直接的文本指令修改现有视频,同时保留提示词未提及的所有内容。你可以添加、移除、替换或重新设计元素,并在编辑结果中保留原生音频。当一个出色的镜头只需要加入新物体、环境或视觉处理时,这种聚焦式工作流可以保留其余成果,避免从头重建场景。
借助 Atlas Cloud 和一个 API 密钥,在文本生成视频、图像生成视频、参考内容生成、编辑和扩展之间自由切换。透明的按量付费计费方式让实验过程无需绑定订阅或最低承诺。开发者可以使用 360p 进行初稿制作,并在最终细节至关重要时请求最高 4K 的输出。这条整合式路径让开发者更容易将完整的模型系列接入生产工作流。
看看 Gemini Omni 1.1 Flash、Seedance 2.5 和上一代 Gemini Omni Flash 如何演绎同样的两条电影感提示词。
一部时长 8–10 秒的奇幻微电影,场景设在一间烧黑斑驳的手工玻璃吹制工坊内:开场从极致微距推进镜头开始,聚焦吹管末端高速旋转的一团炽红熔融玻璃;黏稠的表面不断翻卷、发光,并折射熔炉火焰,一名陶土制成的工匠持续滚动吹管;镜头紧贴工匠移动的前臂环绕拍摄,金属钳随着节拍敲击并夹捏熔融玻璃——镜头不切换,炽热的玻璃团无缝拉伸、冷却,最终变形成一只透明的玻璃蜂鸟,体内仿佛燃烧着一颗火热的心脏。快速甩镜切入高速跟拍,蜂鸟扇动晶莹剔透的翅膀,掠过敞开的颜料罐,将孔雀蓝与洋红色粉末卷入空中形成湍流轨迹;每次振翅都会散落粒子,粒子彼此碰撞、旋转,在其折射出的轮廓中闪烁。蜂鸟猛然转向一颗漂浮的玻璃气泡,并在最后一次音乐重击时精准啄破气泡;切至戏剧性的俯拍镜头,气泡向外爆裂,锋利的薄片持续变形为柔软的半透明花瓣,盘旋着掠过整个工坊。精致的陶土定格动画融合发光的半透明艺术玻璃质感,具备可触摸的手工瑕疵、可信的反射、折射、焦散、热浪扭曲、玻璃形变和粒子物理效果;开场以橙红色熔炉光为主光,辅以冷青色月光轮廓光,采用浓重的黑金色调,并在高潮处爆发为饱和的孔雀蓝与洋红色。镜头运动快速流畅,具备强烈的时间一致性和角色一致性,不要停顿或用慢动作填充。音频:熔炉轰鸣、旋转玻璃的嗡鸣、与每次夹捏和振翅同步的有节奏金属敲击声、粉末呼啸声、撞击瞬间清脆的晶体铃声,以及玻璃化为花瓣时明亮层叠的终曲;不要出现屏幕、界面、仪表盘、进度条、图表、字幕、标志或任何文字。16:9 宽高比。
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
一段时长 8–10 秒、超写实的微距自然纪录片片段,场景位于低潮时一处岩石潮池洞穴内:一只鲜艳珊瑚橙色的椰子章鱼即兴演奏打击乐,八条解剖结构一致的腕足彼此独立却自然地运动,用吸盘敲击珍珠贝壳、中空海胆壳和光滑的海玻璃,节奏逐渐变得更加密集,同时展现精准的形变、接触、回弹和物体重量感。开场采用贴近水面的微距横向跟拍,镜头沿章鱼一侧滑行,水滴在其富有纹理的皮肤上闪烁,每次撞击都让冰冷的青色海水泛起细小涟漪;切至极低机位,镜头在快速移动的腕足与乐器之间穿梭,同时保持清晰的肢体连续性和真实的遮挡关系。一只寄居蟹突然冲入,抓起领奏贝壳逃走;快速甩镜切入一场轻快的追逐,章鱼跃过并流畅穿行于湿滑不平的岩石表面,腕足以可信的摩擦力抓握、松开并推动身体,而寄居蟹的腿在卵石上发出哒哒的摩擦声。就在即将涌入的浪潮淹没洞穴之前,章鱼夺回贝壳,将其牢牢固定,并完成一次有力的最终重击;镜头快速升起,转为从上至下的俯视镜头,海浪在章鱼周围爆开,向外辐射的泡沫形成近乎完美的圆形构图。破碎阳光形成的水下舞动焦散,冷青绿色海水与珊瑚橙色主体形成对比,晶莹飞溅、水泡、悬浮沙粒、湿岩反射、浅微距景深、电影级 HDR、锐利清晰的自然纹理、流畅连续的运动,以及不使用慢动作的高速镜头转换。仅使用现场声音,并做到完美同步:清晰的贝壳敲击声、中空海胆壳的叩击声、明亮的玻璃脆响、吸盘松开的声音、寄居蟹钳子与腿的刮擦声、逐渐增强的海浪声,随后是与节奏精确对齐的最终重击和海浪撞击声;不要音乐、旁白、文字、字幕、标志、界面、仪表盘、图表、进度条、分屏、额外腕足、融合或重复的腕足、扭曲的解剖结构、漂浮物体、穿透或损坏的接触物理效果、橡胶般的运动、时间闪烁、跳切、不一致的贝壳位置或卡通风格。超写实电影感野生动物微距纪录片,16:9 宽高比。
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Gemini Omni 1.1 Flash 可将创意简报、静帧、参考媒体和现有片段转化为营销视频、角色一致的故事、可控转场、延展场景以及带原生音频、可直接用于生产的社交媒体素材。
现有片段可获得无缝衔接、时长为三到十秒的续接内容,串联延展后最长可达四十秒。电影制作人和系列内容团队无需重新构建每个场景,即可扩展连贯的单镜头画面。
需要更换产品、背景或视觉风格?只需通过文本指令进行编辑,同时保留未提及的元素,让营销团队无需每次从头重制源片段,即可快速生成针对性变体。
借助最多十张参考图像和三个视频片段,模型可以在多次生成中保持角色、产品或艺术指导的一致性。品牌工作室能够获得视觉识别更加统一的系列发布场景。
从一张静帧开始,并可选择提供最终帧,让模型在两个构图之间生成电影感运动路径。设计师可以精准控制开场和收尾,适用于揭示、循环和场景切换。
一份文本简报即可生成带同步原生音频的电影感片段,同时可选择时长、宽高比和输出分辨率。创作者能够针对不同发布格式打造广告和社交媒体故事。
测试镜头时,可先以 360p 进行原型制作,比较有潜力的方向,再将选中的概念提升至 4K 输出。导演和创意开发者可以在最终制作前验证运动、构图、声音和节奏。
从视频片段时长、最高分辨率、原生音频支持和输出帧率等方面,对比 Gemini Omni 1.1 Flash 与领先的文生视频模型。
| 模型 | 输出时长 | 最高分辨率 | 原生音频 | 帧率 |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Text-to-Video | 3–10 秒 | 4K | √ | 24 FPS |
| MiniMax H3 Text-to-Video | 4–15 秒 | 2K | √ | 24 FPS |
| Wan-3.0 Text-to-video | 2–30 秒 | 1080P | √ | 30 FPS |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Gemini Omni 1.1 Flash 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Gemini Omni 1.1 Flash、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
Gemini Omni 1.1 Flash 是 Google DeepMind 推出的原生多模态视频生成与编辑模型。在 Atlas Cloud 上,它支持五种面向特定任务的工作流,涵盖视频生成、参考引导创作、编辑和延展。生成的视频可以包含同步的原生音频。
它可以根据文本生成视频、将静态图像制作成动画、遵循视觉参考、根据文本指令编辑现有片段,或延续某个场景。Image to Video 还可以向提供的末帧进行插值,实现可控的镜头过渡。
创建 Atlas Cloud API 密钥,并选择与工作流匹配的 endpoint。根据该 endpoint 的参数结构,提交提示词以及所需的源图像、视频或参考媒体。建议先从一个描述清晰的镜头开始,再根据结果调整输入。
基于提示词生成时选择 Text to Video,为静态画面添加动画时选择 Image to Video。Reference to Video 适合引导主体身份或艺术方向,Video Edit 用于修改现有素材,Video Extend 用于延续已有镜头。
Text to Video 支持设置时长、宽高比和输出分辨率,范围从 360p 到 4K。Image to Video 接受起始图像,并可使用可选的末帧。Reference to Video 支持最多 10 张参考图像和 3 个参考视频片段。
是的,Atlas Cloud 的五种工作流都旨在生成带同步原生音频的视频。当音频对场景很重要时,请在提示词中清晰描述所需的对白、环境音、音乐或音效。
Atlas Cloud 提供按量付费的访问方式。Text to Video、Reference to Video、Video Edit 和 Video Extend 的标准基础价格为 $0.041,Image to Video 的标准基础价格为 $0.043。这些数值是标准后端价格,不是临时折扣价。
每次延展可增加 3 到 10 秒,多个延展可以串联,直到单个连贯镜头总时长达到 40 秒。模型会将现有片段作为上下文,同时延续画面和原生音频。
使用 Reference to Video,并提供清晰且相互兼容的参考素材,最多可包含 10 张图像和 3 个视频片段。制作图像动画时,请提供质量较高的起始画面;如需控制目标画面,还可以提供可选的末帧。生成结果仍可能出现偏移,因此请在每次生成或延展后检查主体身份、光照、运动和音频。
Google 将 1080p 和 4K 描述为升 upscale 输出选项,而不是原生生成分辨率。建议在草稿迭代阶段使用 360p,待构图和运动符合要求后,再选择更高分辨率。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。