ポートレート画像+音声 → トーキングビデオ、480p または 720p。
Lip Sync モデル — 15の方法で音声を 顔に合わせる
2つの入力モードにわたる9つの名前付きモデル — 音声から肖像画をアニメーション化するか、既存の動画の唇を同期し直します。全15モデル、コンテンツフィルターなし。
リップシンクモデルは、音声トラックからトーキングビデオを生成します。静止画のポートレートをアニメーション化するか、既存のクリップの唇を同期し直します。このカテゴリは全15モデルを提供し、うち9モデルは画像ベースと動画ベースのモードに分かれた専用エンドポイントを持つ名前付きモデルです。このページではモデル自体をご紹介します。生成ワークフローについては Lip Sync Studio のページをご覧ください。
15のLip Syncモデルを1つのOpen Generative AIカタログで
以下の各モデルは、受け取る入力モード(ポートレート画像+音声、または既存の動画+音声)ごとにリストアップされています。生成ジョブの組み立て方については Lip Sync Studio のページでご確認いただけます。このページはモデルに焦点を当てています。
ポートレート画像+音声 → トーキングビデオ、480p または 720p。
ポートレート画像+音声 → トーキングビデオ、最大1080p。
ポートレート画像+音声 → トーキングビデオ、最大1080p。
既存の動画の唇を新しい音声に同期し直します。
動画+音声 → リップシンク動画。
動画+音声 → リップシンク動画。
動画+音声 → リップシンク動画。
動画+音声 → リップシンク動画、480p または 720p。
現在はホスト型のみ、ローカルのリップシンク経路はなし
Open Generative AI のローカル推論のドキュメントは画像・動画生成のみを対象としているため、これらのモデルはカタログの他モデルと同じホスト型 API で実行されます。
ホスト型
全15モデルのリップシンクモデル — うち9モデルは名前付きで、画像ベース・動画ベースの両モードにわたる — は、ローカルセットアップなしでホスト型 API により実行されます。
ローカル推論
ローカル推論(sd.cpp と Wan2GP)は画像・動画生成のみを対象としています。ソースプロジェクトはリップシンクのローカル実行経路を提供していないため、現時点ではホスト型でのみ実行されます。
3つのLip Syncモデルを横並びで比較
カタログから代表的な3つのモデルを簡単に見比べましょう。入力モードごとに1つずつと、最高解像度のオプションです。
| モデル | 入力モード | 解像度 |
|---|---|---|
| Infinite Talk | ポートレート画像+音声 | 480p、720p |
| LTX 2.3 Lipsync | ポートレート画像+音声 | 480p、720p、1080p |
| Sync Lipsync | 既存の動画+音声 | 指定なし |
スワイプで全表を表示
リップシンク モデル よくある質問
その他の Open Generative AI モデルカテゴリ
リップシンクは以下のカテゴリと密接に関連しています。生成ワークフローそのもの(入力モードの選択、音声トラックの準備、ジョブの実行)については、Lip Sync Studio のページをご覧ください。
動画をリップシンクするなら Open Generative AI — 今すぐ無料
15のリップシンクモデル。コンテンツフィルターなし、サブスクリプション不要。お試しにアカウント登録は必要ありません。
無料で試す