SAM 3D Body:ビデオからの3Dヒューマンメッシュ抽出
人物のビデオを読み込みます。ポーズ、形状、表情を含む全身の3Dヒューマンメッシュを抽出し、オーバーレイビデオとしてレンダリングします。
Comfy Cloud で実行
このワークフローを Comfy Cloud ですぐに実行
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで “SAM 3D Body: 3D Human Mesh Extraction From Video” を検索してください
LoadVideo ノードにアップロードします:
woman_holding_water_glass.mp4
LoadVideo ノード 85 · woman_holding_water_glass.mp4動作の仕組み
- ビデオ追跡: SAM3がビデオのフレーム全体で人物を追跡します。追跡は、クリップに複数の人物が写っている場合には実質的に必須であり、一般的に検出精度も向上させます
- 人物検出: RT-DETRがテキストプロンプト(
person)に基づいて人物のバウンディングボックスを検出します - メッシュ予測: SAM 3D Bodyが追跡されたフレームから全身の3Dメッシュを予測します。オプションのMoGeカメラ視野角(FOV)を使用すると、ソースビデオとの位置合わせをより正確に行えます
- 表情: MediaPipeベースのステップが表情を追加します。ベースモデルでは表情が検出されないためです
- スムージング: メッシュシーケンスを時間経過に沿って平滑化します
- レンダリング: ポーズファイル(GLB)を構築し、メッシュをビデオに再レンダリングして、出力ビデオとして保存します
実行手順
- ビデオを読み込む:
LoadVideoノードを使用して人物のビデオを読み込みます - ワークフローをキューに入れる: Ctrl(macOSではCmd)+ Enterキーを押します
- パイプラインの完了を待つ: トラッキング、検出、メッシュ予測、レンダリングが順番に実行されます
- 結果を確認する:
Preview3Dノードでメッシュを確認します。オーバーレイビデオはComfyUI/output/video/SAM3D_body/に保存されます
モデルのダウンロード
SAM 3D Body モデルと必要なファイルをダウンロードし、対応するmodels/ サブディレクトリに配置します。
SAM3 multiplex チェックポイント
sam3.1_multiplex_fp16.safetensors: 動画トラッキング用の SAM3 multiplex チェックポイント
SAM 3D Body 検出モデル
sam_3d_body_dinov3_bf16.safetensors: SAM 3D Body 検出モデル (DINOv3 バックボーン)
MoGe ジオメトリ
moge_2_vitl_normal_fp16.safetensors: オプション。位置合わせ用のカメラ FOV 推定
RT-DETR 人物検出器
rt_detr_v4-x-hgnet_fp32.safetensors: RT-DETR 人物検出モデル