- 오디오 기반 립 싱크: 입력 오디오에 맞는 자연스러운 입 움직임 생성
- 전신 모션: 정체성, 배경, 카메라 움직임을 유지하면서 동기화된 신체 모션 추가
- 듀얼 모드: 단일 캐릭터와 다중 캐릭터 시나리오 모두 지원
- ComfyUI 네이티브:
WanInfiniteTalkToVideo노드가 내장되어 있어 커스텀 노드가 필요하지 않습니다
서브그래프 알아보기
이 워크플로는 모듈식 처리를 위해 서브그래프 노드를 사용합니다. 워크플로를 사용자 정의하고 확장하는 방법은 서브그래프 문서를 확인하세요.
InfiniteTalk 이미지 기반 비디오 생성 워크플로
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “InfiniteTalk” 검색
모델 설치
다음 모델을 다운로드하여 올바른 디렉토리에 배치해야 합니다: diffusion_models text_encoders model_patches- wan2.1_infiniteTalk_single_fp16.safetensors: 단일 캐릭터 시나리오용
- wan2.1_infiniteTalk_multi_fp16.safetensors: 다중 캐릭터 시나리오용
모델 저장 위치
샘플 입력 파일
다음 샘플 입력 파일을 다운로드한 뒤 해당 노드로 드래그하세요:샘플 이미지 다운로드
캐릭터 참조 이미지
화자 1 오디오 다운로드
캐릭터 1용 오디오 트랙
화자 2 오디오 다운로드
캐릭터 2용 오디오 트랙
워크플로 단계
- 입력 이미지 로드: 캐릭터 참조 이미지를
Load Image노드로 드래그합니다. 다중 캐릭터 시나리오에서는 마스크 편집기를 사용해 각 캐릭터의 마스크를 그립니다. - 오디오 트랙 로드: 오디오 파일을
Load Audio노드에 연결합니다(캐릭터당 하나). - 확산 모델 로드:
Load Diffusion Model노드가Wan2_1-I2V-14B-480p_fp8_e4m3fn_scaled_KJ.safetensors를 사용하고 있는지 확인합니다. - 모델 패치 로드:
ModelPatchLoader노드를 통해 적절한 InfiniteTalk 패치(single또는multi변형)를 로드합니다. - InfiniteTalk 구성:
length(프레임 단위의 비디오 길이),motion_frame_count(모션 컨텍스트로 사용되는 이전 프레임),audio_scale등WanInfiniteTalkToVideo노드 파라미터를 조정합니다. - 생성: 워크플로를 실행합니다. 모델이 입력 오디오와 동기화된 전신 토킹 비디오를 생성합니다.
비디오 길이 연장
각 Video Extend 그룹은 비디오를 약 3.24초(25 fps 기준 81프레임) 연장합니다. 오디오가 더 길면 다음을 수행할 수 있습니다:- “Video Extend” 그룹을 상자 선택합니다
Ctrl-C(복사)를 누른 다음Ctrl-Shift-V(연결과 함께 붙여넣기)를 누릅니다- 이전
InfiniteTalk (Base Generation)노드의IMAGE출력을 새WanInfiniteTalkToVideo노드의previous_frames입력에 연결합니다 Batch Images노드의IMAGE출력을 새Batch Images노드의 이미지 입력에 연결합니다