이 증류 체크포인트는 텍스트 to 비디오와 처음/마지막 프레임 이미지 to 비디오만 지원합니다. Ref2VA(멀티 레퍼런스 조건)는 증류되지 않았습니다. 레퍼런스 기반 생성에는 베이스 MiniMax H3 워크플로우를 사용하세요.
요구 사항
- ComfyUI 0.36.0 이상
- MiniMax H3 텍스트 인코더 및 VAE(베이스 모델과 공유, 아래 목록 참조)
FastH3 텍스트 to 비디오
텍스트 프롬프트에서 8스텝으로 동기화 오디오가 포함된 비디오를 생성합니다.워크플로우 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “FastVideo FastH3: Text to Video” 검색
프롬프트 팁
- 전체 장면 묘사: 먼저 전체 장면(장소, 캐릭터, 무슨 일이 일어나는지)을 설명한 뒤 시간 순서의 샷으로 나눕니다
- 샷, 카메라, 오디오: 샷, 카메라 움직임, 함께할 오디오(대사, 효과음, 음악)를 하나의 프롬프트 블록에 설명합니다
- 해상도: H3의 네이티브 캔버스는 짧은 변 768px, 최대 768x1344이며, 해상도는 32의 배수로 반올림됩니다
- 길이: 길이 입력은 24fps에서 모델의 17프레임/블록(17k+5) 그리드에 맞춰집니다
- 스텝 수는 8로 고정: 이 증류 체크포인트는 8스텝으로 학습되었습니다. 스케줄러의 스텝 수를 변경하면 품질이 저하됩니다
FastH3 이미지 to 비디오
정지 이미지를 동기화 오디오와 함께 움직이게 합니다. 처음/마지막 프레임 제어도 지원합니다.워크플로우 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “FastVideo FastH3: Image to Video” 검색
LoadImage 노드에 업로드하거나 직접 만든 이미지를 사용하세요:
red_line_barrier.png
이미지 to 비디오 워크플로우의 예시 첫 프레임
처음/마지막 프레임 모드
MiniMaxH3ImageToVideo 노드의 first_frame 및/또는 last_frame에 이미지를 연결하면 두 키프레임 사이의 모션을 생성합니다. 둘 다 연결하지 않으면 텍스트 to 비디오로 동작합니다.
프롬프트 팁
- 모션과 오디오 설명: 이미지가 외관을 담당하므로 프롬프트는 모션, 카메라, 함께할 오디오에 집중해야 합니다
- 길이: 길이 입력은 24fps에서 모델의 17프레임/블록(17k+5) 그리드에 맞춰집니다
- 스텝 수는 8로 고정: 스케줄러는 8스텝을 유지하세요. 체크포인트가 해당 스케줄로 증류되었습니다
모델 다운로드
확산 모델은 FastVideo 저장소에서 제공되며, 텍스트 인코더와 VAE는 베이스 MiniMax H3 모델과 공유됩니다.확산 모델: fastvideo_fasth3_8step_v2_pruned_int8_convrot
ComfyUI/models/diffusion_models/에 배치텍스트 인코더: qwen3vl_32b_minimax_h3_nvfp4_awq
ComfyUI/models/text_encoders/에 배치VAE: minimax_h3_video_vae_fp16
ComfyUI/models/vae/에 배치VAE: minimax_h3_audio_vae_fp32
ComfyUI/models/vae/에 배치모델 저장 위치
워크플로우 구조 노트
두 FastH3 워크플로우는 베이스 H3 구성과 다음 노드를 공유하며, 증류 관련 설정이 추가되어 있습니다:- BlockSparseAttention: Video Sparse Attention(VSA)을
keep_percent10으로, 스케줄의 20% 지점부터 실행하여 품질을 유지하면서 어텐션 비용을 줄입니다 - MiniMaxH3SigmaShift: 증류 스케줄에 맞는 H3 시그마 시프트(비디오 10, 오디오 3)를 적용합니다
- ComfyMathExpression: 길이 입력을 24fps의 17k+5 그리드에서 유효한 프레임
length로 변환합니다 - 샘플러:
res_multistep샘플러,simple스케줄러, 8스텝