SAM 3D Body: 비디오에서 3D 인간 메시 추출
사람의 비디오를 로드합니다. 포즈, 형태, 표정을 포함한 전신 3D 인간 메시를 추출하여 오버레이 비디오로 렌더링합니다.
Comfy Cloud에서 실행
이 워크플로를 Comfy Cloud에서 즉시 실행하세요
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “SAM 3D Body: 비디오에서 3D 인간 메시 추출”을 검색하세요
LoadVideo 노드에 업로드하세요:
woman_holding_water_glass.mp4
LoadVideo 노드 85 · woman_holding_water_glass.mp4작동 방식
- 비디오 추적: SAM3가 비디오 프레임 전체에서 인물을 추적합니다. 클립에 여러 명이 등장하는 경우 추적은 사실상 필수이며, 일반적으로 감지 정확도를 향상시킵니다.
- 인물 감지: RT-DETR이 텍스트 프롬프트(
person)를 기반으로 인물의 바운딩 박스를 감지합니다. - 메시 예측: SAM 3D Body는 추적된 프레임에서 전신 3D 메시를 예측하며, 선택적으로 MoGe 카메라 시야각을 사용하여 소스 비디오와 더 정확하게 정렬할 수 있습니다.
- 얼굴 표정: MediaPipe 기반 단계에서 얼굴 표정을 추가합니다. 베이스 모델은 이를 감지하지 못합니다.
- 스무딩: 메시 시퀀스를 시간에 따라 부드럽게 처리합니다.
- 렌더링: 포즈 파일(GLB)을 생성하고 메시를 비디오에 다시 렌더링한 다음 출력 비디오로 저장합니다.
실행 단계
- 비디오 로드:
LoadVideo노드를 사용하여 인물 비디오를 로드합니다. - 워크플로 실행 대기열에 추가: Ctrl(macOS에서는 Cmd) + Enter를 누릅니다.
- 파이프라인 대기: 추적, 감지, 메시 예측, 렌더링이 순서대로 실행됩니다.
- 결과 확인:
Preview3D노드에서 메시를 확인합니다. 오버레이 비디오는ComfyUI/output/video/SAM3D_body/에 저장됩니다.
모델 다운로드
SAM 3D Body 모델과 필요한 파일을 다운로드하여 해당models/ 하위 디렉터리에 배치합니다.
SAM3 multiplex 체크포인트
sam3.1_multiplex_fp16.safetensors: 비디오 트래킹용 SAM3 multiplex 체크포인트
SAM 3D Body 감지 모델
sam_3d_body_dinov3_bf16.safetensors: SAM 3D Body 감지 모델 (DINOv3 백본)
MoGe 지오메트리
moge_2_vitl_normal_fp16.safetensors: 선택 사항. 정렬용 카메라 FOV 추정
RT-DETR 사람 감지기
rt_detr_v4-x-hgnet_fp32.safetensors: RT-DETR 사람 감지 모델