


Veo 3.1 Lite 是 Google 面向开发者推出的视频模型系列,适用于构建可规模化的生产流水线。根据所使用的 endpoint,您可以选择灵活的时长选项,在指定的首帧和末帧之间生成 8 秒过渡视频,或以常见宽高比生成视频。Atlas Cloud 通过一个 OpenAI 兼容的密钥提供这些能力,采用透明的按需付费定价,并简化 API 访问流程。立即开始构建。
Veo 3.1 Lite 由 Google 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
Atlas Cloud 为您提供最新的行业领先创意模型。
选择与您的源素材、输出控制和生产工作流相匹配的 Veo 3.1 Lite endpoint。
| 模态 | 描述 |
|---|---|
| Veo 3.1 Lite T2V API(Text to Video) | 将文本提示词转换为 720p 或 1080p 视频,并支持同步音频和灵活的时长选项。该 endpoint 专为高性价比、大规模生成而设计,适用于自动化内容流水线、营销素材和快速概念制作。 |
| Veo 3.1 Lite Start-End Frame to Video API | 提供首帧和末帧,生成两帧之间包含动态和音频的 8 秒视频。该面向开发者的 endpoint 适用于受控转场、产品展示、视觉变换以及明确的场景结尾。 |
| Veo 3.1 Lite I2V API(Image to Video) | 将输入图像制作成 720p 或 1080p 视频,并支持同步音频和常见宽高比。高性价比的处理方式适用于可扩展的图像动画、社交媒体内容、广告创意和视觉叙事工作流。 |
Veo 3.1 Lite 将文本、单图以及首帧和尾帧生成整合到一个 Atlas Cloud API 中,并提供同步音频、720p 或 1080p 输出、灵活的片段时长、横屏和竖屏画幅、种子控制,以及透明的按量付费定价。
使用 Veo 3.1 Lite 将自然语言提示词转换为完整视频。它支持以 720p 渲染 4、6 或 8 秒片段,其中 1080p 适用于 8 秒输出。你可以在一条提示词中描述主体、场景、动作、镜头运动、光照和声音。这条路径适合快速概念影片、营销活动变体和大规模叙事工作流。
从一张最大 8MB 的图片开始,将其制作成 720p 的 4、6 或 8 秒视频,或 1080p 的 8 秒视频。运动提示词可引导主体行为、镜头运动、氛围和音频,同时由图片锚定开场构图。你可以用它将产品图、艺术作品、肖像或分镜画面转换为动态素材。
定义首帧和尾帧,两者大小均不得超过 8MB,然后让模型生成二者之间的运动过程。你可以选择 720p 下的 4、6 或 8 秒时长,也可以使用 8 秒生成 1080p 输出。添加基于提示词的动作和音频提示,以塑造衔接过程。这条可控路径适合变形效果、前后对比展示和分镜转场。
Veo 3.1 Lite 可在文本、图像以及首尾帧工作流中生成与视频同步的音频。在提示词中使用引号编写对白,并描述音效或环境声,让配乐和声音跟随场景变化。从与追逐动作同步的脚步声,到厨房中食物煎炒时的滋滋声,音频会作为生成片段的一部分一并输出,让叙事更加完整。
可选择 720p 或 1080p 输出、16:9 或 9:16 画幅,以及 4、6 或 8 秒时长。使用 1080p 时,请将时长设为 8 秒;不支持 4K 输出和视频延展。种子参数有助于进行可重复的实验,但不保证结果完全一致,让开发者能够更实际地控制原型、社交媒体素材和生产候选版本。
通过 Atlas Cloud API 使用 Veo 3.1 Lite 的全部三种生成模式,并享受透明的按量付费计费。每个列出的 Lite 端点均采用经过验证的标准基础价格 $0.05。在同一套集成中,灵活切换文本、单图以及首尾帧工作流。这种配置让大规模视频实验更易于预算规划和维护。
通过运动、镜头控制、视觉连续性和同步声音,对比 Veo 3.1 Lite 与 Atlas Cloud 的两个替代方案如何诠释同一条充满动作感的视频提示词。
一段时长 8–10 秒、高精度的复古科幻动画电影片段,场景设定在零重力轨道温室内:一名始终保持外观一致的复古宇航员,身穿带有铜质配件的奶油色压力服,正急切追逐一颗从透明培育舱中逃逸出来的发光蓝色种子。开场从一滴漂浮水珠内部进行极端微距拍摄,宇航员和种子透过水珠颤动的弧形表面产生清晰锐利的折射;随后快速拉远,他伸出的手臂撞击水珠,将其炸裂成数百颗物理表现精准、晶莹闪烁的水珠。转入动态 360 度环绕广角镜头,他穿过飘动的叶片与根系推进身体,但一根活藤突然缠住他的脚踝,将他猛地向后拽。动作保持连贯,他抓住一根旋转的铜质扶手,凭借可信的零重力惯性绕其摆动,挣脱藤蔓并朝观景窗发射而去。平滑翻转进入第一人称头盔 POV——戴着手套的双手在广阔的蓝色地球映衬下合拢包住种子——随后种子瞬间绽放成一顶微小而 radiant 的蓝色花冠。结尾快速推近花朵的晶莹花瓣,弧形地球在其中以精致细腻的细节映照出来。冰冷的青色地球光与脉动的琥珀色紧急照明交替出现,深海军蓝阴影、铜金色硬件、荧光蓝色生物发光效果、复杂的流体动力学、富有弹性的藤蔓运动、自然惯性、连续高密度动作、鲜明的主体与服装一致性、戏剧性的叙事反转、顶级手工打造的复古未来主义动画电影品质、清晰的电影级细节、细微的胶片颗粒。音频:闷响的宇航服呼吸声、金属扶手的震动声、轻微撞击声、散落的水珠敲击玻璃的叮咚声、逐渐增强的模拟合成器脉冲声,随后在揭示时响起精致的晶莹绽放声。不要出现屏幕、软件界面、仪表板、仪表、进度条、图表、字幕、文字、徽标或水印。16:9 画幅。
Generated with Veo 3.1 Lite Text-to-video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
一段写实感十足的复古闹剧追逐戏,以一个无缝衔接的 8–10 秒连续镜头展开:暴风雨之夜,在一家饱经岁月的 1950s 理发店内,一名表情丰富的理发师刚把顾客的脸涂满厚厚的剃须泡沫,顾客的鞋却意外踩下黄铜地板踏板,启动镀铬理发椅高速旋转,并让它穿过敞开的店门一路滚出,鲜红色披肩在身后啪地飘动,始终作为连续的视觉锚点。开场紧贴推进,穿过他们在布满雨痕的镜子中的高度一致倒影;机械装置咔哒作响时快速摇镜,随后降至贴地跟拍镜头,与嘎吱作响的脚轮并行,看着理发椅越过门槛,冲进狭窄、霓虹浸染的小巷。理发师保持步伐连续地追赶,单手安全地高举直剃刀,另一只手拿着冒热气的毛巾,躲避水坑、木箱和摇摆招牌;每次撞击都让雨水自然飞溅,湿透的红色披肩也随着可信的重量感和气流扭动。雷光闪现时,镜头快速环绕旋转的理发椅;理发师抓住一根下垂的晾衣绳,摆荡穿过小巷,在顾客身旁松手,配合理发椅的旋转节奏,精准地从下巴上刮掉最后一道窄窄的泡沫——以面孔、服装、倒影、道具位置、空间连续性以及雨水、布料、车轮和动量物理表现的一致性,完成令人兴奋的喜剧收尾。理发店散发的温暖钨丝灯琥珀色光线与青蓝色雨幕和洋红色霓虹交织,电影级宽银幕构图,质感丰富的时代美术设计,细微的胶片颗粒,清晰利落的动作,不要慢动作,不要字幕、文字、界面或图形。同步音频:踏板咔嗒声、逐渐加速的车轮 rattling 声、与最后一划精准同步的剃刀刮擦声、毛巾 flutter 声、溅水的脚步声、霓虹灯嗡鸣声,以及在落地瞬间以一道尖锐雷鸣声作点睛的效果;俏皮的铜管与军鼓追逐音乐逐渐增强,并在最后一拍达到高潮。16:9 画幅。
Generated with Veo 3.1 Lite Text-to-video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Veo 3.1 Lite 可将提示词、静态图像和成对关键帧转换为带同步音频的视频,适用于社交媒体营销、产品视觉素材、故事原型和规模化内容生产。
将文本提示词转换为带同步音频的 720p 或 1080p 视频。为社交媒体内容日历、创作者营销活动和需要跨渠道高效规模化产出的内容团队,持续生成可复用的短视频素材。
使用 text to video endpoint 将修改后的提示词转换为新视频,并灵活选择时长。营销团队可以在为付费和自然流量营销活动确定创意方案前,探索多种创意方向。
将产品图像制作成带同步音频的 720p 或 1080p 视频。为电商商品页、发布页面和视觉营销活动制作动态素材,同时保留所提供图像作为起始画面。
定义首帧和尾帧,再由模型生成带音频的衔接动作。该工作流时长为 8 秒,适用于动画分镜、场景转场、动作研究,以及需要控制起止画面的分镜序列。
从书面场景出发,在一个工作流中生成带同步声音的视频。导演、设计师和创意开发者可以在投入制作资源前,测试节奏、氛围和视觉方向。
如果已有获批的静态图像,可以直接将其制作成视频,无需从文本开始。编辑团队和内容制作人员可以将营销作品、插画或关键视觉素材转化为可重复使用的视频资产。
从输入方式、片段时长、分辨率、同步音频和标准按秒计费等方面,对比 Veo 3.1 Lite 与其他视频 API。
| 模型 | 输入方式 | 输出时长 | 分辨率选项 | 同步音频 | 标准价格 |
|---|---|---|---|---|---|
| Veo 3.1 Lite 文生视频 | 文本 | 4、6 或 8 秒 | 720p、1080p | √ | $0.05/秒 |
| Veo 3.1 Lite 首尾帧生视频 | 文本、首帧、尾帧 | 4、6 或 8 秒 | 720p、1080p | √ | $0.05/秒 |
| Veo 3.1 Lite 图生视频 | 文本、图像 | 4、6 或 8 秒 | 720p、1080p | √ | $0.05/秒 |
| Seedance 2.0 Mini 文生视频 | 文本 | 4 至 15 秒,或自动 | 480p、720p,最高 1440p-SR | √ | $0.056/秒 |
| Wan-3.0 文生视频 | 文本 | 2 至 30 秒,或智能时长 | 480p、720p、1080p;ESR 最高 4K | √ | $0.05/秒 |
| Kling V3.0 Turbo 文生视频 | 文本 | 3 至 15 秒 | 720p、1080p | √ | $0.112/秒 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Veo 3.1 Lite 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Veo 3.1 Lite、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
Veo 3.1 Lite 是 Google 面向成本敏感型、高吞吐量工作流推出的高效视频生成模型。它可以根据文本提示词、输入图像或指定的起始帧和结束帧,生成带同步音频的视频。
你可以选择文生视频,根据提示词创建视频;选择图生视频,为静态图像添加动态效果;或选择首尾帧生视频,引导两个帧之间的运动。Atlas Cloud 为每种工作流提供了专用 endpoint。
创建 Atlas Cloud API key,然后向视频生成 endpoint 发送 POST 请求,并提供相应的模型 ID 和必需输入。响应会包含一个 prediction ID,你可以轮询该 ID,直到输出准备就绪。
会。文生视频和图生视频 endpoint 会生成同步音频,而首尾帧工作流则会为所提供帧之间生成的运动添加音频。
已验证的三个 endpoint 均支持 720p 和 1080p 输出。此模型系列不支持 4K 生成。
已验证的标准基础价格为 Atlas Cloud 三个 endpoint 均每次 $0.05。计费方式为按量付费,这是标准价格,并非临时促销价。
提供起始帧、结束帧,以及描述两帧之间预期运动的提示词。已验证的 Atlas Cloud 后端配置显示,该工作流时长为 8 秒,支持音频,并可输出 720p 或 1080p 视频。
Lite 优先考虑可扩展视频工作负载的价格效率,同时保留同步音频以及 720p 或 1080p 输出。其主要限制是不支持 4K 输出和视频 Extension。
当视觉锚定很重要时,应使用图生视频,或同时提供起始帧和结束帧,而不是仅依赖文本。清晰描述主体运动、镜头行为、场景变化和音频提示,使请求包含更明确的约束。
首先确认 bearer authorization、准确的模型 ID、必需的 prompt 或 image 字段,以及受支持的分辨率设置。如果 prediction 进入 failed 状态,请先检查返回的错误信息,再修改 payload 或重新提交请求。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。