Seedance 2.0 Mini & Fast API 全球最低价 —— 比官方定价最高低 68%

AI 数字人生成器:让照片开口说你的话

上传一张人像和一个音频文件。音频驱动的数字人模型会让这张脸动起来,口型和表情跟着录音走,生成的口播视频可以直接下载。

一张人像,做出 AI 数字人视频

几秒的表情片段,还是十分钟的讲解视频,都只要这两样输入。

AI 口播数字人生成器

上传一张正面人像和一个 MP3 或 WAV 文件。Avatar Omni Human 1.5 会返回这个人说话或唱歌的视频,口型、表情和动作全部由音频直接生成。输出支持 720p 或 1080p。

片段最长 60 秒,15 秒以内效果最好。还可以加一句提示词来指定场景、动作或表情——中文、英语、日语、韩语、西班牙语和印尼语都读得懂。

长录音也能对准口型

文稿是一整节课而不是一条短视频时,InfiniteTalk 用同一张人像最长能处理 10 分钟音频。整段录音的口型都精确到音素级别,人脸、发型、衣着和背景也一直保持稳定。输出支持 480p 或 720p。

旁白可以在音频页签里生成好再拿过来,然后用提示词调整表情和姿态。一节课程或一段产品讲解,不用约摄影棚,也不用请出镜的人。

AI 数字人模型,都在这里

两个模型,对应不同时长。短小、表情丰富、要到 1080p 的片段选 Avatar Omni Human 1.5,音频比较长就选 InfiniteTalk。

三步做出 AI 数字人视频

1

上传人像

用一张清晰的单人正面照。背景简洁、脸部无遮挡,模型能发挥的空间最大。

2

加上音频

配上一个 MP3 或 WAV:可以是录音,也可以是你在音频页签里生成的语音。

3

生成,然后下载

选好模型和分辨率,生成,然后把成片下载下来。

数字人能帮你做什么?

挑一个最接近你工作的标签,看看数字人在哪些场景能省掉一次拍摄。

每个市场都有自己的 AI 代言人

一张人像,多种语言。每种语言各录一版或生成一版文稿,同一张脸跑一遍模型,整场活动在各地都是同一个出镜人,不用满世界飞。

不进摄影棚也能录出镜讲课

用 InfiniteTalk 把十分钟的讲课录音变成视频。整节课讲师都在画面里,要更新内容只需换掉音频,不用重拍。

AI 数字人商品讲解

让每件商品都有讲解人。把音频页签里生成的商品文案配上一张品牌形象人像,讲解视频就能直接放到商品页,或者做成 UGC 风格的广告。

改内容不用重拍的入职视频

制度讲解只需录一次音,再用 InfiniteTalk 配上固定的出镜人,它在长录音里也能一直对准口型。流程一变,换个音频文件,还是这张脸来讲新版本。

数字人周边的更多 Atlas Cloud AI 工具

常见问题

AI 数字人生成器是一种音频驱动视频的 AI:它让一张静态人像照着给定的音轨说话。你上传一张照片和一个音频文件,模型根据声音生成口型、表情和动作,最后返回这个人在说话的视频。

Atlas Cloud 已接入字节跳动的 Avatar Omni Human 1.5 和 InfiniteTalk。两个都接收人像加音频,主要差别在片段时长和分辨率。

Avatar Omni Human 1.5 生成最长 60 秒的片段,建议控制在 15 秒以内。InfiniteTalk 单次最长接收 10 分钟音频。

Avatar Omni Human 1.5 输出 720p 或 1080p,InfiniteTalk 输出 480p 或 720p。

单人正面人像,脸部清晰可见。两个模型都是按每条片子只有一个说话人来做的。

能。Avatar Omni Human 1.5 本来就同时支持说话和唱歌,动作和表情都是从音频里生成的,不依赖文稿。

Avatar Omni Human 1.5 列出的语言包括中文、英语、日语、韩语、西班牙语和印尼语。口型是跟着音频本身走的,所以关键在于录音是什么语言。

可以。用语音合成模型生成旁白,把文件下载下来,在这里作为音频输入传上去。数字人对生成语音的口型同步效果,和真人录音是一样的。

有。两个模型都能通过 Atlas Cloud API 调用,鉴权方式和图片、视频接口完全一样。逛逛数字人模型页面就能开始搭建。

先传一张人像,剩下的交给它去说。