메인 콘텐츠로 건너뛰기
PixelDiT는 1024px 텍스트 기반 이미지 생성을 위한 NVIDIA의 픽셀 공간 확산 변환기입니다. 잠재 공간에서 작동하는 전통적인 확산 모델과 달리 PixelDiT는 패치 수준 DiT와 픽셀 수준 DiT를 결합한 이중 레벨 DiT 아키텍처를 사용해 직접 픽셀 공간에서 이미지를 생성하며, MM-DiT 융합을 통해 텍스트와 이미지 토큰 간의 공동 주의를 구현합니다. 모델 주요 특징:
  • VAE 없음 — 직접 픽셀 공간에서 생성; 전통적인 VAE 인코딩/디코딩 필요 없음
  • 이중 레벨 DiT — 패치 수준 DiT + 픽셀 수준 DiT로 고품질 생성
  • 다양한 종횡비 지원 — 기본 해상도 1024px, 여러 종횡비 지원
  • 약 13억 파라미터 — 소비자용 GPU에서도 충분히 효율적
  • 라이선스: NSCLv1 (비상업적 연구/평가 전용)
관련 링크:

PixelDiT 텍스트 기반 이미지 생성 워크플로우

PixelDiT 텍스트 기반 이미지 생성 워크플로우

워크플로우 다운로드

JSON을 다운로드하거나 템플릿 라이브러리에서 “PixelDiT”를 검색하세요
ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로우는 워크플로우 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다. (데스크톱 버전의 업데이트는 다소 지연될 수 있습니다)워크플로우를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(야간 빌드)을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함
워크플로우는 세 가지 주요 노드로 구성됩니다:
  1. ResolutionSelector — 원하는 출력 해상도 선택
  2. 텍스트 기반 이미지 생성 (PixelDiT) 서브그래프 — 프롬프트, 시드, 모델 선택 및 해상도 조정 가능한 핵심 생성 노드
  3. SaveImage — 생성된 이미지 저장

서브그래프 알아보기

이 워크플로우는 모듈식 처리를 위해 서브그래프 노드를 사용합니다. 서브그래프 문서를 확인하여 워크플로우를 맞춤화하고 확장하는 방법을 배워보세요.

워크플로우 컨트롤

텍스트 기반 이미지 생성 (PixelDiT) 서브그래프 노드에 노출된 컨트롤은 다음과 같습니다:

모델 다운로드

PixelDiT는 두 개의 모델 파일을 사용합니다: 텍스트 인코더와 확산 모델입니다.

텍스트 인코더

gemma_2_2b_it_elm_bf16.safetensors — Gemma-2-2B-IT 텍스트 인코더

확산 모델

pixeldit_1300m_1024px_bf16.safetensors — PixelDiT 1300M 1024px 확산 모델

모델 저장 위치