Skip to main content
此节点使用 sync.so API 将视频中的口型动作与新的语音音频重新同步。它能自动处理特写、侧脸和遮挡情况,同时保留说话者的表情。费用按输出时长计算。

输入

model 参数是一个动态组合,包含以下子参数: 同步模式选项:
  • bounce:视频先正向播放再反向播放,直至音频结束(输出 = 音频长度)
  • loop:视频循环播放直至音频结束(输出 = 音频长度)
  • remap:视频进行时间拉伸以匹配音频(输出 = 音频长度)
  • cut_off:较长的轨道被裁剪(输出 = 较短长度)
  • silence:不裁剪任何内容;较短的轨道用静音填充(输出 = 较长长度)
说话者选择选项:
  • default:让模型自行决定唇形同步的面部
  • auto-detect:检测并跟随当前说话者
  • coordinates:定位 speaker_frame 所选帧中像素坐标(speaker_xspeaker_y)处的面部
限制条件:
  • 视频分辨率不得超过 4K(4096x2160)。超出此限制的视频将报错。
  • 音频时长不得超过 600 秒(10 分钟)。
  • speaker_framespeaker_xspeaker_y 参数仅在 speaker_selection 设置为 “coordinates” 时使用。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): b41f8c9bf0d55059f081a66af20636ec96462c3fd9caeb685cab10278f84678a