AI 口播数字人生成器
上传一张正面人像和一个 MP3 或 WAV 文件。Avatar Omni Human 1.5 会返回这个人说话或唱歌的视频,口型、表情和动作全部由音频直接生成。输出支持 720p 或 1080p。
片段最长 60 秒,15 秒以内效果最好。还可以加一句提示词来指定场景、动作或表情——中文、英语、日语、韩语、西班牙语和印尼语都读得懂。
上传一张人像和一个音频文件。音频驱动的数字人模型会让这张脸动起来,口型和表情跟着录音走,生成的口播视频可以直接下载。
几秒的表情片段,还是十分钟的讲解视频,都只要这两样输入。
上传一张正面人像和一个 MP3 或 WAV 文件。Avatar Omni Human 1.5 会返回这个人说话或唱歌的视频,口型、表情和动作全部由音频直接生成。输出支持 720p 或 1080p。
片段最长 60 秒,15 秒以内效果最好。还可以加一句提示词来指定场景、动作或表情——中文、英语、日语、韩语、西班牙语和印尼语都读得懂。
文稿是一整节课而不是一条短视频时,InfiniteTalk 用同一张人像最长能处理 10 分钟音频。整段录音的口型都精确到音素级别,人脸、发型、衣着和背景也一直保持稳定。输出支持 480p 或 720p。
旁白可以在音频页签里生成好再拿过来,然后用提示词调整表情和姿态。一节课程或一段产品讲解,不用约摄影棚,也不用请出镜的人。
两个模型,对应不同时长。短小、表情丰富、要到 1080p 的片段选 Avatar Omni Human 1.5,音频比较长就选 InfiniteTalk。
用一张清晰的单人正面照。背景简洁、脸部无遮挡,模型能发挥的空间最大。
配上一个 MP3 或 WAV:可以是录音,也可以是你在音频页签里生成的语音。
选好模型和分辨率,生成,然后把成片下载下来。
挑一个最接近你工作的标签,看看数字人在哪些场景能省掉一次拍摄。
一张人像,多种语言。每种语言各录一版或生成一版文稿,同一张脸跑一遍模型,整场活动在各地都是同一个出镜人,不用满世界飞。
用 InfiniteTalk 把十分钟的讲课录音变成视频。整节课讲师都在画面里,要更新内容只需换掉音频,不用重拍。
让每件商品都有讲解人。把音频页签里生成的商品文案配上一张品牌形象人像,讲解视频就能直接放到商品页,或者做成 UGC 风格的广告。
制度讲解只需录一次音,再用 InfiniteTalk 配上固定的出镜人,它在长录音里也能一直对准口型。流程一变,换个音频文件,还是这张脸来讲新版本。
AI 数字人生成器是一种音频驱动视频的 AI:它让一张静态人像照着给定的音轨说话。你上传一张照片和一个音频文件,模型根据声音生成口型、表情和动作,最后返回这个人在说话的视频。
Atlas Cloud 已接入字节跳动的 Avatar Omni Human 1.5 和 InfiniteTalk。两个都接收人像加音频,主要差别在片段时长和分辨率。
Avatar Omni Human 1.5 生成最长 60 秒的片段,建议控制在 15 秒以内。InfiniteTalk 单次最长接收 10 分钟音频。
Avatar Omni Human 1.5 输出 720p 或 1080p,InfiniteTalk 输出 480p 或 720p。
单人正面人像,脸部清晰可见。两个模型都是按每条片子只有一个说话人来做的。
能。Avatar Omni Human 1.5 本来就同时支持说话和唱歌,动作和表情都是从音频里生成的,不依赖文稿。
Avatar Omni Human 1.5 列出的语言包括中文、英语、日语、韩语、西班牙语和印尼语。口型是跟着音频本身走的,所以关键在于录音是什么语言。
可以。用语音合成模型生成旁白,把文件下载下来,在这里作为音频输入传上去。数字人对生成语音的口型同步效果,和真人录音是一样的。
有。两个模型都能通过 Atlas Cloud API 调用,鉴权方式和图片、视频接口完全一样。逛逛数字人模型页面就能开始搭建。