
在 Shengshu API 上构建视频制作管线:只需单次调用,Vidu Q3 即可生成带有原生音频和智能运镜的 16 秒电影级片段。
在 Atlas Cloud 上,借助最新的 AI 视频生成模型,从文本与图像生成电影级的高保真视频。
对比 ShengShu 全部模型的标准价、平台价与折扣。
| 模型 | 标准价 (USD) | 平台价 (USD) | 折扣 | |
|---|---|---|---|---|
| Vidu Q3-Mix Reference to Video | $0.125 | 低至$0.106/秒 视频 | -15% | 查看 |
| Vidu Q3 Reference to Video | $0.05 | 低至$0.042/秒 视频 | -15% | 查看 |
| Vidu Q3-Pro Start-end-to-video | $0.05 | 低至$0.042/秒 视频 | -15% | 查看 |
| Vidu Q3-Turbo Image-to-video | $0.04 | 低至$0.034/秒 视频 | -15% | 查看 |
| Vidu Q3-Turbo Start-end-to-video | $0.04 | 低至$0.034/秒 视频 | -15% | 查看 |
| Vidu Q3-Turbo Text-to-video | $0.04 | 低至$0.034/秒 视频 | -15% | 查看 |
Vidu Q3 的 16 秒片段、原生音频和多参考一致性,使其在以往需要制作团队才能完成的工作流中非常实用。各团队通过使用不同的 Q3 层级,无需切换供应商即可从快速迭代无缝推进至最终资产的交付。
工作室和独立创作者使用 Vidu Q3-Mix 来生成多集动画内容,确保角色在每个场景中看起来完全一致。通过上传角色参考表,每个新片段都能继承相同的面部特征、服装和视觉风格,而无需手动进行逐帧的一致性调整。Shengshu 在 SXSW 2026 上展示了这一工作流,作为动画剧集制作的首个 AI 解决方案。
营销团队只需上传一次品牌角色的参考图像,即可使用 Vidu Q3 Reference-to-Video 生成数十个用于 TikTok、Reels 和 YouTube Shorts 的短视频。该角色在所有输出中保持视觉上的一致,从而消除了逐个简报和审批每个资产的设计瓶颈。在 Atlas Cloud 上,每秒的费用为 0.042 美元,生成一批 10 秒短视频的单价不到一美元。
电商团队提供多角度的产品照片作为参考输入,并生成带有原生环境音的电影级动态产品营销短片。输出结果在同一次调用中附带同步音效,无需进行视频拍摄或音频编辑,即可直接用于广告和产品页面。首尾帧控制功能使团队能够精准主导产品在每个短片中的呈现方式。
导演使用 Vidu Q3-Pro 的镜头控制功能生成具有指定运镜的预演片段——向主体推进、扫过场景、跟随角色的跟踪镜头。原生16秒输出意味着可以通过一次调用预演一个完整的短场景。这用动作精准的参考资料取代了早期的分镜工作,供演职人员使用。
开发团队使用 Vidu Q3-Turbo 以每秒 0.034 美元的成本运行批量生成流水线,每小时可通过文本或图像输入制作数十个短片段。较低的每秒成本使其在选择使用 Q3-Pro 进行扩展之前,能够切实可行地生成并测试许多创意变体。这两种模型都在同一个 Atlas Cloud API 密钥下运行,只需在不同层级之间更改单个参数即可。
旅游局和旅行平台使用 Vidu Q3-Pro 文本生成视频功能,通过描述性文本提示词生成带有自然环境音的氛围感目的地视频片段。只需输入一段关于风景、地标或文化场景的书面描述,即可在一次调用中生成一段带有匹配音频的 16 秒电影级视频片段。这为能够激发预订意愿的内容创作提供了一种高性价比的实地拍摄替代方案。
Vidu Q3在单次API调用中可生成长达16秒的1080p、24fps连续视频。这是同级别领先视频模型中最长的单次生成窗口。在此时长上限内,每次调用的视频片段持续时间均可配置。
是的。Vidu Q3 在单次推理过程中,可与视频帧同时生成对话、音效、背景音乐以及唇形同步。无需后期制作配音或手动音频对齐步骤。音频时序与画面动作自动同步。
您可以直接在文本提示中描述镜头运动(如推镜头、摇镜头、跟移镜头),模型将从第一帧开始执行这些运动。不需要单独的参数或控制层。这适用于 Atlas Cloud 上的文本生成视频(text-to-video)和图像生成视频(image-to-video)端点。
Vidu Q3-Pro 在 Atlas Cloud 上的定价为每秒 0.042 美元,可提供动作流畅、细节丰富的电影级输出。Vidu Q3-Turbo 的生成速度更快,每秒成本更低,仅为 0.034 美元,适用于草稿和快速迭代。两者均具有相同的 1080p 输出分辨率并支持原生音频。
Vidu Q3 的 Reference-to-Video 端点每次调用接受 1 到 4 张参考图像。您可以在单次生成中结合来自不同图像的主体、环境、服装和视觉风格。这是在多个视频片段中保持角色和场景一致性的主要方式。
Vidu Q3-Mix 是 Vidu Q3 系列中最高级别的参考模型,在 Atlas Cloud 上的定价为每秒 0.106 美元。在一次生成中结合多个参考图像时,它能提供最强的多主体一致性。它专为动画剧集制作和品牌内容等工作流而设计,在这些工作流中,角色特征必须在众多片段中保持视觉上的完全一致。
是的。Vidu Q3-Pro 和 Q3-Turbo 在 Atlas Cloud 上均设有 Start-end-to-video 端点。您只需提供起始帧图像并描述所需的动作或结束状态,模型即可生成过渡效果。这为您提供了对每个场景开场与结尾的精确导演级控制。
Vidu Q3-Turbo 起价为每秒 0.034 美元。Vidu Q3-Pro 和 Reference-to-Video 端点为每秒 0.042 美元。Vidu Q3-Mix 是一致性最高的参考模型,价格为每秒 0.106 美元。所有层级的定价均比标准 Shengshu API 费率低 15%,并支持按需付费(即用即付)。