Skip to main content
静止した肖像写真を、音声によって駆動されるトーキングビデオにアニメーション化します。sync.so の sync-3 モデルを使用します。出力の長さは音声の長さに一致し、コストは出力の長さに応じてスケールします。

入力

注記: speaker_xspeaker_y のパラメータは、speaker_selection"coordinates" に設定されている場合にのみ使用されます。auto_downscale が有効な場合、話者の座標はダウンスケールされた画像の寸法に合わせて自動的にスケールされます。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 21f722cdcc5ff017949887ed2252854feebb9b913034dc6a6c3ce196ad089468