Seedance 2.0 Mini & Fast APIを世界最安値で — 公式価格から最大68%オフ

写真に音声をしゃべらせるAIアバター生成

ポートレート1枚と音声ファイル1つをアップロードするだけ。音声から動画を生成するモデルが、録音に合わせて口元と表情を動かし、仕上がったトーキング動画をそのままダウンロードできます。

ポートレート1枚からAIアバター動画

数秒の表情豊かなクリップも、10分の解説動画も、必要な入力は同じ2つだけ。

AIトーキングアバター生成

正面のポートレートとMP3またはWAVをアップロードします。Avatar Omni Human 1.5は、その人物がトラックを話したり歌ったりする動画を返し、リップシンク、表情、身ぶりはすべて音声から直接生成されます。出力は720pまたは1080pです。

クリップは最長60秒で、15秒以内がいちばんシャープに仕上がります。任意のプロンプトでシーン、動作、表情を方向づけることもでき、中国語、英語、日本語、韓国語、スペイン語、インドネシア語を読み取ります。

長尺の録音に対応するリップシンクAI

原稿がSNS向けの短いクリップではなく授業1本まるごとの場合は、InfiniteTalkが同じポートレートと最長10分の音声を受け取ります。録音の最後までリップシンクが音素レベルで合い続け、顔、髪型、服装、背景も安定したままです。出力は480pまたは720pです。

ナレーションはオーディオタブで生成してからここに持ち込み、プロンプトで表情や姿勢を調整できます。講座の1モジュールも製品のウォークスルーも、カメラも出演者も手配せずにつくれます。

AIアバターモデルを、ここに集約

長さの違いに合わせた2つのモデル。1080pまでの短く表情豊かなクリップにはAvatar Omni Human 1.5を、音声が長いときはInfiniteTalkを選んでください。

3ステップでAIアバター動画をつくる

1

人物写真をアップロード

1人が正面を向いた、はっきり写っている写真を用意します。背景が無地で顔が隠れていないほど、モデルが扱いやすくなります。

2

音声を追加する

MP3またはWAVを添えます。録音でも、オーディオタブで生成した音声でもかまいません。

3

生成して、ダウンロード

モデルと解像度を選んで生成し、仕上がったクリップをダウンロードします。

トーキングアバターで何がつくれる?

自分の仕事にいちばん近いタブを開くと、トーキングアバターが撮影の代わりになる場面が見えてきます。

各市場向けのAIスポークスパーソン

ポートレートは1枚、言語はいくつでも。言語ごとに原稿を収録または生成して同じ顔をモデルに通せば、キャンペーンはどの国でも同じ出演者で揃い、人を現地に飛ばす必要もありません。

スタジオなしのトーキングヘッド講義

10分の講義録音を、InfiniteTalkで動画に変えます。モジュールのあいだ講師はずっと画面に映り、内容を更新するときは音声を差し替えるだけで、撮り直しは要りません。

AIアバターによる商品解説

どの商品にも解説役をつけられます。オーディオタブでつくった商品原稿とブランドの人物ポートレートを組み合わせれば、そのまま商品ページにも、UGC風の広告にも使えるウォークスルー動画ができます。

撮り直さずに更新できるオンボーディング動画

規程のウォークスルーは一度音声で録るだけ。長い録音でもリップシンクが崩れないInfiniteTalkで、決まった説明役をつけられます。手順が変わったら音声ファイルを差し替えれば、同じ顔が新しい内容を話します。

アバターまわりのAtlas Cloud AIツール

よくある質問

AIアバター生成は音声から動画をつくるAIで、静止したポートレートに指定の音声トラックをしゃべらせます。写真1枚と音声ファイル1つをアップロードすると、モデルが音から口の形、表情、身ぶりを生成し、その人物が話している動画が返ってきます。

Atlas CloudはByteDanceのAvatar Omni Human 1.5とInfiniteTalkに対応しています。どちらもポートレートと音声を受け取り、主な違いはクリップの長さと解像度です。

Avatar Omni Human 1.5は最長60秒のクリップを生成し、15秒以内が推奨です。InfiniteTalkは1回で最長10分の音声を受け取れます。

Avatar Omni Human 1.5は720pまたは1080p、InfiniteTalkは480pまたは720pで出力します。

1人が正面を向き、顔がはっきり見えるポートレートです。どちらのモデルも、1クリップにつき話者1人を前提につくられています。

対応します。Avatar Omni Human 1.5はもともと話すことにも歌うことにも対応しており、身ぶりや表情は原稿ではなく音声から生成されます。

Avatar Omni Human 1.5は、扱える言語として中国語、英語、日本語、韓国語、スペイン語、インドネシア語を挙げています。リップシンクは音声そのものに追従するため、重要なのは録音の言語です。

使えます。テキスト読み上げモデルでナレーションを生成し、ファイルをダウンロードして、ここで音声入力として添付してください。生成した音声でも、録音と同じようにリップシンクします。

あります。どちらのモデルもAtlas Cloud APIから利用でき、認証は画像・動画のAPIと同じです。アバターモデルのページから開発をはじめてください。

ポートレートを1枚。あとは、しゃべってもらいましょう。