# Minimax-H3-lipsync-mv 1枚のキャラクター参照画像と楽曲、またはテキスト原稿から、MiniMax-H3 Ref2VAを使って リップシンク付きMV/読み上げ動画を生成するローカルWebアプリケーションです。 TXTを入力した場合はAivisSpeech Engineで1文ずつ音声合成し、結合した読み上げ音声を Vocal Lockへ直接渡します。映像シナリオは入力原稿の内容を元に作成します。 ## 固定仕様 - MiniMax-H3 Ref2VA only - 横・縦の解像度プリセット(最大1344×768 / 768×1344)/ 24fps - TURBO ON - Vocal Lock ON - `96gb-int8` / GPU 0 - 同一参照画像のprefix cache ON - 31Bマルチモーダル解析で参照画像の顔・髪・服装・スタイルを固定 - 歌唱区間では正面または3/4向きのmedium close-upと可視口元を強制 - H3公式Ref2VAの6セクション記法(`subject_definitions` → `summary` → `retention_analysis` → `detailed_description` → `overall_soundscape` → `non_diegetic_music`)で各クリップのプロンプトを生成 - 参照画像はキーフレームではなく``の人物定義として使用し、Vocal Lock用の 分離ボーカルは`