モデルカテゴリ

Lip Sync モデル — 15の方法で音声を 顔に合わせる

2つの入力モードにわたる9つの名前付きモデル — 音声から肖像画をアニメーション化するか、既存の動画の唇を同期し直します。全15モデル、コンテンツフィルターなし。

15 Lip Sync モデル9 2つの入力モードにわたる名前付きモデル数

リップシンクモデルは、音声トラックからトーキングビデオを生成します。静止画のポートレートをアニメーション化するか、既存のクリップの唇を同期し直します。このカテゴリは全15モデルを提供し、うち9モデルは画像ベースと動画ベースのモードに分かれた専用エンドポイントを持つ名前付きモデルです。このページではモデル自体をご紹介します。生成ワークフローについては Lip Sync Studio のページをご覧ください。

Lip Sync モデル

15のLip Syncモデルを1つのOpen Generative AIカタログで

以下の各モデルは、受け取る入力モード(ポートレート画像+音声、または既存の動画+音声)ごとにリストアップされています。生成ジョブの組み立て方については Lip Sync Studio のページでご確認いただけます。このページはモデルに焦点を当てています。

infinite-talk

ポートレート画像+音声 → トーキングビデオ、480p または 720p。

wan-2.2-speech-to-video

ポートレート画像+音声 → トーキングビデオ、480p または 720p。

ltx-2.3-lipsync

ポートレート画像+音声 → トーキングビデオ、最大1080p。

ltx-2-19b-lipsync

ポートレート画像+音声 → トーキングビデオ、最大1080p。

sync-lipsync

既存の動画の唇を新しい音声に同期し直します。

latentsync

動画+音声 → リップシンク動画。

creatify-lipsync

動画+音声 → リップシンク動画。

veed-lipsync

動画+音声 → リップシンク動画。

infinite-talk-v2v

動画+音声 → リップシンク動画、480p または 720p。

ホスト型 vs. ローカル実行

現在はホスト型のみ、ローカルのリップシンク経路はなし

Open Generative AI のローカル推論のドキュメントは画像・動画生成のみを対象としているため、これらのモデルはカタログの他モデルと同じホスト型 API で実行されます。

ホスト型

全15モデルのリップシンクモデル — うち9モデルは名前付きで、画像ベース・動画ベースの両モードにわたる — は、ローカルセットアップなしでホスト型 API により実行されます。

ローカル推論

ローカル推論(sd.cpp と Wan2GP)は画像・動画生成のみを対象としています。ソースプロジェクトはリップシンクのローカル実行経路を提供していないため、現時点ではホスト型でのみ実行されます。

比較

3つのLip Syncモデルを横並びで比較

カタログから代表的な3つのモデルを簡単に見比べましょう。入力モードごとに1つずつと、最高解像度のオプションです。

モデル入力モード解像度
Infinite Talkポートレート画像+音声480p、720p
LTX 2.3 Lipsyncポートレート画像+音声480p、720p、1080p
Sync Lipsync既存の動画+音声指定なし

スワイプで全表を表示

よくある質問

リップシンク モデル よくある質問

全15モデルです。うち9モデルは専用エンドポイントを持つ名前付きモデルで、画像ベース4モデルと動画ベース5モデルの2つの入力モードに分かれています。

もっと探す

その他の Open Generative AI モデルカテゴリ

リップシンクは以下のカテゴリと密接に関連しています。生成ワークフローそのもの(入力モードの選択、音声トラックの準備、ジョブの実行)については、Lip Sync Studio のページをご覧ください。

動画をリップシンクするなら Open Generative AI — 今すぐ無料

15のリップシンクモデル。コンテンツフィルターなし、サブスクリプション不要。お試しにアカウント登録は必要ありません。

無料で試す
Open Generative AIの画像と動画はAIによって生成されています。正確性や信頼性が求められる用途で使用する前に、結果をご確認ください。