AIトーキングアバター生成
正面のポートレートとMP3またはWAVをアップロードします。Avatar Omni Human 1.5は、その人物がトラックを話したり歌ったりする動画を返し、リップシンク、表情、身ぶりはすべて音声から直接生成されます。出力は720pまたは1080pです。
クリップは最長60秒で、15秒以内がいちばんシャープに仕上がります。任意のプロンプトでシーン、動作、表情を方向づけることもでき、中国語、英語、日本語、韓国語、スペイン語、インドネシア語を読み取ります。
ポートレート1枚と音声ファイル1つをアップロードするだけ。音声から動画を生成するモデルが、録音に合わせて口元と表情を動かし、仕上がったトーキング動画をそのままダウンロードできます。
数秒の表情豊かなクリップも、10分の解説動画も、必要な入力は同じ2つだけ。
正面のポートレートとMP3またはWAVをアップロードします。Avatar Omni Human 1.5は、その人物がトラックを話したり歌ったりする動画を返し、リップシンク、表情、身ぶりはすべて音声から直接生成されます。出力は720pまたは1080pです。
クリップは最長60秒で、15秒以内がいちばんシャープに仕上がります。任意のプロンプトでシーン、動作、表情を方向づけることもでき、中国語、英語、日本語、韓国語、スペイン語、インドネシア語を読み取ります。
原稿がSNS向けの短いクリップではなく授業1本まるごとの場合は、InfiniteTalkが同じポートレートと最長10分の音声を受け取ります。録音の最後までリップシンクが音素レベルで合い続け、顔、髪型、服装、背景も安定したままです。出力は480pまたは720pです。
ナレーションはオーディオタブで生成してからここに持ち込み、プロンプトで表情や姿勢を調整できます。講座の1モジュールも製品のウォークスルーも、カメラも出演者も手配せずにつくれます。
長さの違いに合わせた2つのモデル。1080pまでの短く表情豊かなクリップにはAvatar Omni Human 1.5を、音声が長いときはInfiniteTalkを選んでください。
1人が正面を向いた、はっきり写っている写真を用意します。背景が無地で顔が隠れていないほど、モデルが扱いやすくなります。
MP3またはWAVを添えます。録音でも、オーディオタブで生成した音声でもかまいません。
モデルと解像度を選んで生成し、仕上がったクリップをダウンロードします。
自分の仕事にいちばん近いタブを開くと、トーキングアバターが撮影の代わりになる場面が見えてきます。
ポートレートは1枚、言語はいくつでも。言語ごとに原稿を収録または生成して同じ顔をモデルに通せば、キャンペーンはどの国でも同じ出演者で揃い、人を現地に飛ばす必要もありません。
10分の講義録音を、InfiniteTalkで動画に変えます。モジュールのあいだ講師はずっと画面に映り、内容を更新するときは音声を差し替えるだけで、撮り直しは要りません。
どの商品にも解説役をつけられます。オーディオタブでつくった商品原稿とブランドの人物ポートレートを組み合わせれば、そのまま商品ページにも、UGC風の広告にも使えるウォークスルー動画ができます。
規程のウォークスルーは一度音声で録るだけ。長い録音でもリップシンクが崩れないInfiniteTalkで、決まった説明役をつけられます。手順が変わったら音声ファイルを差し替えれば、同じ顔が新しい内容を話します。
AIアバター生成は音声から動画をつくるAIで、静止したポートレートに指定の音声トラックをしゃべらせます。写真1枚と音声ファイル1つをアップロードすると、モデルが音から口の形、表情、身ぶりを生成し、その人物が話している動画が返ってきます。
Atlas CloudはByteDanceのAvatar Omni Human 1.5とInfiniteTalkに対応しています。どちらもポートレートと音声を受け取り、主な違いはクリップの長さと解像度です。
Avatar Omni Human 1.5は最長60秒のクリップを生成し、15秒以内が推奨です。InfiniteTalkは1回で最長10分の音声を受け取れます。
Avatar Omni Human 1.5は720pまたは1080p、InfiniteTalkは480pまたは720pで出力します。
1人が正面を向き、顔がはっきり見えるポートレートです。どちらのモデルも、1クリップにつき話者1人を前提につくられています。
対応します。Avatar Omni Human 1.5はもともと話すことにも歌うことにも対応しており、身ぶりや表情は原稿ではなく音声から生成されます。
Avatar Omni Human 1.5は、扱える言語として中国語、英語、日本語、韓国語、スペイン語、インドネシア語を挙げています。リップシンクは音声そのものに追従するため、重要なのは録音の言語です。
使えます。テキスト読み上げモデルでナレーションを生成し、ファイルをダウンロードして、ここで音声入力として添付してください。生成した音声でも、録音と同じようにリップシンクします。
あります。どちらのモデルもAtlas Cloud APIから利用でき、認証は画像・動画のAPIと同じです。アバターモデルのページから開発をはじめてください。