Skip to main content
使用 sync.so 的 sync-3 模型,将静态人像动画化为由语音音频驱动的说话视频。输出时长与音频时长一致,费用随输出时长增加而增加。

输入

注意: speaker_xspeaker_y 参数仅在 speaker_selection 设置为 "coordinates" 时使用。启用 auto_downscale 时,说话者坐标会自动缩放以匹配降低后的图片尺寸。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): 21f722cdcc5ff017949887ed2252854feebb9b913034dc6a6c3ce196ad089468