输入
model 参数是一个动态组合,包含以下子参数:
同步模式选项:
bounce:视频先正向播放再反向播放,直至音频结束(输出 = 音频长度)loop:视频循环播放直至音频结束(输出 = 音频长度)remap:视频进行时间拉伸以匹配音频(输出 = 音频长度)cut_off:较长的轨道被裁剪(输出 = 较短长度)silence:不裁剪任何内容;较短的轨道用静音填充(输出 = 较长长度)
default:让模型自行决定唇形同步的面部auto-detect:检测并跟随当前说话者coordinates:定位speaker_frame所选帧中像素坐标(speaker_x,speaker_y)处的面部
- 视频分辨率不得超过 4K(4096x2160)。超出此限制的视频将报错。
- 音频时长不得超过 600 秒(10 分钟)。
speaker_frame、speaker_x和speaker_y参数仅在speaker_selection设置为 “coordinates” 时使用。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
b41f8c9bf0d55059f081a66af20636ec96462c3fd9caeb685cab10278f84678a