Skip to main content
Wan22ImageToVideoLatent는 이미지로부터 비디오 레이턴트 표현을 생성합니다. 지정된 너비, 높이, 프레임 길이 및 배치 크기로 빈 비디오 레이턴트 공간을 생성하며, 선택적으로 시작 이미지 시퀀스를 처음 프레임에 인코딩할 수 있습니다. 시작 이미지가 제공되면 노드는 이를 레이턴트 공간에 인코딩하고, 생성 중 디노이즈해야 할 영역을 표시하는 해당 노이즈 마스크를 생성합니다.

입력

참고: start_image가 제공되면 이미지 시퀀스는 대상 widthheight로 업스케일되고, VAE로 인코딩되며, 레이턴트의 처음 프레임에 배치됩니다. 해당 프레임의 노이즈 마스크는 0(보존됨)으로 설정되고, 나머지 프레임은 마스크 값이 1(디노이즈 대상)로 설정됩니다. 레이턴트는 항상 48개 채널, 공간 차원 height / 16 x width / 16, 시간 차원 ((length - 1) // 4) + 1을 가집니다. widthheight는 16으로 나누어져야 하며(32의 단계 값으로 강제됨), length는 4의 단계로 시간 차원을 증가시킵니다. start_image가 제공되지 않으면 노이즈 마스크가 없는 완전히 빈 레이턴트가 반환되며, 해당 빈 레이턴트에는 batch_size 입력이 적용되지 않습니다.

출력

두 필드는 단일 LATENT 출력 안에 함께 반환됩니다.
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717