Skip to main content
이 노드는 이미지와 텍스트를 인코딩하여 학습용 데이터를 준비합니다. 이미지 목록과 이에 대응하는 텍스트 캡션 목록을 입력받은 다음, VAE 모델을 사용해 이미지를 latent 표현으로 변환하고 CLIP 모델을 사용해 텍스트를 컨디셔닝 데이터로 변환합니다. 생성된 짝을 이룬 latent와 conditioning은 목록으로 출력되어 학습 워크플로에서 사용할 준비가 됩니다.

입력

매개변수 제약 사항:
  • 이 노드는 목록 입력을 사용합니다: imagestexts는 목록으로 처리되는 반면, vaeclip은 각각 단일 모델을 받습니다(제공된 목록의 첫 번째 항목이 사용됩니다).
  • texts 목록의 항목 수는 0, 1이거나 images 목록의 항목 수와 정확히 일치해야 합니다. 0이거나 생략된 경우 모든 이미지에 빈 문자열이 사용됩니다. 1인 경우 해당 단일 텍스트가 모든 이미지에 반복됩니다. 그 외의 길이는 오류를 발생시킵니다.
  • 출력 latentsconditioning 목록은 항상 images 목록과 동일한 수의 항목을 포함하므로, 각 latent는 해당 캡션에 대한 conditioning과 짝을 이룹니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 244adc98810a874cfe42f834e89f96da300d883faeb5791dff19607c13d0c0db