입력
참고:
clip_vision_output은 전체 히든 상태와 끝에서 두 번째 히든 상태를 제공하는 CLIP 비전 모델에서 가져와야 합니다. 이 노드는 끝에서 20번째, 끝에서 11번째, 끝에서 두 번째 히든 상태를 결합하여 스타일 임베딩을 만듭니다. model_patch는 이러한 이미지 특징을 스타일 임베딩으로 변환하는 투영 모델을 해당 model 속성을 통해 노출해야 합니다. 샘플링 중에 스타일 임베딩은 생성에 영향을 줄 수 있도록 텍스트 컨디셔닝 앞에 추가되며, 일치하는 0 위치 텍스트 ID가 텍스트 ID 앞에 추가되어 식별자 시퀀스가 확장된 컨디셔닝과 정렬된 상태로 유지됩니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
9033dddb76fafb388c67dcd09d96102a7ab3e5bc416cec61bf18d088da37a0f0