입력
참고:
start_image가 제공되면 이미지 시퀀스는 대상 width 및 height로 업스케일되고, VAE로 인코딩되며, 레이턴트의 처음 프레임에 배치됩니다. 해당 프레임의 노이즈 마스크는 0(보존됨)으로 설정되고, 나머지 프레임은 마스크 값이 1(디노이즈 대상)로 설정됩니다. 레이턴트는 항상 48개 채널, 공간 차원 height / 16 x width / 16, 시간 차원 ((length - 1) // 4) + 1을 가집니다. width와 height는 16으로 나누어져야 하며(32의 단계 값으로 강제됨), length는 4의 단계로 시간 차원을 증가시킵니다.
start_image가 제공되지 않으면 노이즈 마스크가 없는 완전히 빈 레이턴트가 반환되며, 해당 빈 레이턴트에는 batch_size 입력이 적용되지 않습니다.
출력
두 필드는 단일 LATENT 출력 안에 함께 반환됩니다.
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717