positive 및 negative 컨디셔닝 입력에 첨부할 수 있으며, 요청된 width, height, length, batch_size에 따라 크기가 지정된 0으로 채워진 잠재를 생성합니다.
입력
참고: 참조 이미지가 제공되면 배치의 첫 번째 이미지가 쌍선형 보간을 사용하여 요청된
width 및 height로 업스케일되고 VAE로 인코딩됩니다. 해당 참조 잠재는 긍정 컨디셔닝에 첨부되며, 동일한 형태의 0으로 채워진 잠재는 부정 컨디셔닝에 첨부됩니다. audio_encoder_output이 제공되면 오디오 임베딩이 보간되어 긍정 컨디셔닝에 첨부되며, 0으로 채워진 오디오 임베딩은 부정 컨디셔닝에 첨부됩니다. 선택적 입력 중 하나라도 생략되면 0으로 채워진 자리 표시자 텐서가 사용됩니다: 형태가 [batch_size, 16, 1, height // 8, width // 8]인 0으로 채워진 참조 잠재 및/또는 형태가 [batch_size, latent_t + 1, 8, 5, 1280]인 0으로 채워진 오디오 임베딩이 사용되며, 여기서 latent_t = ((length - 1) // 4) + 1입니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
db674a4a00729a8715988030083e2858f958cd21de73bbbe4ed6d76f5f539419