Skip to main content
Wan2.1 InfiniteTalk은 MeiGen-AI가 개발한, Wan2.1을 기반으로 하는 오픈 소스 오디오 기반 비디오 생성 모델입니다. 단일 참조 이미지와 오디오 입력만으로 전신 토킹 비디오를 생성할 수 있습니다. 캐릭터의 입 움직임과 신체 동작은 제공된 오디오에 맞춰 자동으로 동기화됩니다. 주요 기능:
  • 오디오 기반 립 싱크: 입력 오디오에 맞는 자연스러운 입 움직임 생성
  • 전신 모션: 정체성, 배경, 카메라 움직임을 유지하면서 동기화된 신체 모션 추가
  • 듀얼 모드: 단일 캐릭터와 다중 캐릭터 시나리오 모두 지원
  • ComfyUI 네이티브: WanInfiniteTalkToVideo 노드가 내장되어 있어 커스텀 노드가 필요하지 않습니다
관련 링크:

서브그래프 알아보기

이 워크플로는 모듈식 처리를 위해 서브그래프 노드를 사용합니다. 워크플로를 사용자 정의하고 확장하는 방법은 서브그래프 문서를 확인하세요.

InfiniteTalk 이미지 기반 비디오 생성 워크플로

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON을 다운로드하거나 템플릿 라이브러리에서 “InfiniteTalk” 검색
Wan2.1 InfiniteTalk 워크플로 미리보기
ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

모델 설치

다음 모델을 다운로드하여 올바른 디렉토리에 배치해야 합니다: diffusion_models text_encoders model_patches audio_encoders vae loras

모델 저장 위치

샘플 입력 파일

다음 샘플 입력 파일을 다운로드한 뒤 해당 노드로 드래그하세요:

샘플 이미지 다운로드

캐릭터 참조 이미지

화자 1 오디오 다운로드

캐릭터 1용 오디오 트랙

화자 2 오디오 다운로드

캐릭터 2용 오디오 트랙

워크플로 단계

  1. 입력 이미지 로드: 캐릭터 참조 이미지를 Load Image 노드로 드래그합니다. 다중 캐릭터 시나리오에서는 마스크 편집기를 사용해 각 캐릭터의 마스크를 그립니다.
  2. 오디오 트랙 로드: 오디오 파일을 Load Audio 노드에 연결합니다(캐릭터당 하나).
  3. 확산 모델 로드: Load Diffusion Model 노드가 Wan2_1-I2V-14B-480p_fp8_e4m3fn_scaled_KJ.safetensors를 사용하고 있는지 확인합니다.
  4. 모델 패치 로드: ModelPatchLoader 노드를 통해 적절한 InfiniteTalk 패치(single 또는 multi 변형)를 로드합니다.
  5. InfiniteTalk 구성: length(프레임 단위의 비디오 길이), motion_frame_count(모션 컨텍스트로 사용되는 이전 프레임), audio_scale 등 WanInfiniteTalkToVideo 노드 파라미터를 조정합니다.
  6. 생성: 워크플로를 실행합니다. 모델이 입력 오디오와 동기화된 전신 토킹 비디오를 생성합니다.

비디오 길이 연장

각 Video Extend 그룹은 비디오를 약 3.24초(25 fps 기준 81프레임) 연장합니다. 오디오가 더 길면 다음을 수행할 수 있습니다:
  1. “Video Extend” 그룹을 상자 선택합니다
  2. Ctrl-C(복사)를 누른 다음 Ctrl-Shift-V(연결과 함께 붙여넣기)를 누릅니다
  3. 이전 InfiniteTalk (Base Generation) 노드의 IMAGE 출력을 새 WanInfiniteTalkToVideo 노드의 previous_frames 입력에 연결합니다
  4. Batch Images 노드의 IMAGE 출력을 새 Batch Images 노드의 이미지 입력에 연결합니다