超写実デジタルヒューマンの口形同期という壁:wav2lip、MuseTalk、LatentSyncの実測と断念
16GBの民生GPUで三つのオープンソース口形同期方式を検証した記録。測定方法、見えにくい障害、リアルタイム方式を断念した根拠をまとめる。
Abstract概要
写真級デジタル伴侶のため、ローカルのリアルタイム口形同期を評価した。RTX 5070 Ti(16GB)上でwav2lip256とMuseTalk v15のフレームレート、遅延、VRAM、口の運動量を測り、LatentSyncをオフラインで検証した。VRAMの暗黙フォールバック、座標順の不一致、複製フレームによる引っ掛かりなど、表面化しにくい七つの障害も記録する。結論は、超写実の表情と口形をリアルタイムで成立させるには、現時点で民生機を大きく超えるVRAMか、画質または遅延の質的な妥協が必要だということだった。本プロジェクトはリアルタイム口形を断念し、事前レンダリング映像と独立音声層へ転換した。数値は検証した版と機材だけに適用される。