SAM 3D Body:从视频中提取 3D 人体网格
加载一个人的视频。提取包含姿态、形状和面部表情的全身 3D 人体网格,并将其渲染为叠加视频。
在 Comfy Cloud 上运行
在 Comfy Cloud 上立即运行此工作流
下载工作流
下载 JSON,或在模板库中搜索“SAM 3D Body: 3D Human Mesh Extraction From Video”
LoadVideo 节点:
woman_holding_water_glass.mp4
LoadVideo 节点 85 · woman_holding_water_glass.mp4工作原理
- 视频跟踪:SAM3 会在视频帧之间跟踪人物。当片段中出现多个人物时,跟踪实际上是必需的,并且总体上能提高检测精度。
- 人物检测:RT-DETR 根据文本提示(
person)检测人物边界框。 - 网格预测:SAM 3D Body 根据跟踪帧预测全身 3D 网格,并可选使用 MoGe 相机视场,以便与来源视频更精确地对齐。
- 面部表情:基于 MediaPipe 的步骤会添加面部表情,而基础模型无法检测到这些表情。
- 平滑处理:网格序列会随时间进行平滑处理。
- 渲染:构建姿态文件(GLB),将网格渲染回视频中,然后保存为输出视频。
运行步骤
- 加载视频:使用
LoadVideo节点加载包含人物的视频 - 将工作流加入队列:按 Ctrl(macOS 上为 Cmd)+ Enter 键
- 等待流水线处理:跟踪、检测、网格预测和渲染依次运行
- 查看结果:在
Preview3D节点中检查网格。叠加视频保存到ComfyUI/output/video/SAM3D_body/
模型下载
下载 SAM 3D Body 模型和所需文件,放到对应的models/ 子目录中。
SAM3 multiplex checkpoint
sam3.1_multiplex_fp16.safetensors: 用于视频追踪的 SAM3 multiplex 检查点
SAM 3D Body 检测模型
sam_3d_body_dinov3_bf16.safetensors: SAM 3D Body 检测模型(DINOv3 主干)
MoGe 几何估计
moge_2_vitl_normal_fp16.safetensors: 可选,用于对齐的相机 FOV 估计
RT-DETR 人体检测器
rt_detr_v4-x-hgnet_fp32.safetensors: RT-DETR 人体检测模型