Skip to main content
VOIDInpaintConditioning 노드는 CogVideoX 모델을 사용한 인페인팅에 필요한 컨디셔닝 데이터를 준비합니다. 소스 비디오와 전처리된 quadmask를 입력으로 받아 VAE를 통해 인코딩하고, 이를 모델이 마스킹된 영역을 채우는 데 사용하는 32채널 컨디셔닝 신호(마스크에서 온 16채널 + 마스킹된 비디오에서 온 16채널)로 결합합니다.

입력

참고: CogVideoX-Fun-V1.5는 patch_size_t=2를 사용하므로 인코딩된 잠재의 시간 차원이 짝수여야 합니다. length가 홀수 latent_t를 생성하는 경우, 노드는 자동으로 가장 가까운 유효한 값으로 내림하고 경고를 기록합니다. 홀수 latent_t를 사용하면 순환 패딩을 통해 마지막 프레임이 손상되며, 이로 인해 디코딩된 비디오 끝 부분에서 눈에 띄는 지터나 사라지는 피사체가 발생할 수 있습니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 885e462c0f17a3e9610146a05ba3b9c879db0112d3961c95a83f63ba2cd511f1