Skip to main content
이 노드는 sync.so API를 사용하여 비디오의 입 움직임을 새로운 음성 오디오에 다시 동기화합니다. 클로즈업, 측면 및 장애물을 자동으로 처리하면서 화자의 표정을 유지합니다. 비용은 출력 길이에 따라 달라집니다.

입력

model 매개변수는 다음과 같은 하위 매개변수를 포함하는 동적 콤보입니다: 동기화 모드 옵션:
  • bounce: 비디오가 오디오가 끝날 때까지 앞뒤로 재생됩니다(출력 = 오디오 길이)
  • loop: 비디오가 오디오가 끝날 때까지 다시 시작됩니다(출력 = 오디오 길이)
  • remap: 비디오가 오디오와 일치하도록 시간이 늘어납니다(출력 = 오디오 길이)
  • cut_off: 더 긴 트랙이 잘립니다(출력 = 더 짧은 길이)
  • silence: 아무것도 잘리지 않으며, 더 짧은 트랙이 채워집니다(출력 = 더 긴 길이)
화자 선택 옵션:
  • default: 모델이 립싱크할 얼굴을 결정하도록 합니다
  • auto-detect: 활성 화자를 감지하고 추적합니다
  • coordinates: speaker_frame에서 선택한 프레임의 픽셀(speaker_x, speaker_y)에 있는 얼굴을 대상으로 합니다
제약 사항:
  • 비디오 해상도는 4K(4096x2160)를 초과할 수 없습니다. 이 제한을 초과하는 비디오는 오류가 발생합니다.
  • 오디오 길이는 600초(10분)를 초과할 수 없습니다.
  • speaker_frame, speaker_x, speaker_y 매개변수는 speaker_selection이 “coordinates”로 설정된 경우에만 사용됩니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): b41f8c9bf0d55059f081a66af20636ec96462c3fd9caeb685cab10278f84678a