ComfyUI Depth Anything 3 概要
Depth Anything 3 (DA3) は、ByteDance Seed が開発したビジョントランスフォーマーで、カメラポーズの有無にかかわらず、任意のビジュアル入力から空間的に一貫したジオメトリを復元します。単一の DINO エンコーダと統一された深度-レイ表現により、同一モデルファミリーで単眼深度、多視点深度、カメラポーズ推定、3D 再構築をカバーします。 主な機能:- 統一された単眼・多視点深度:単一または複数の画像から深度を推定
- カメラポーズ推定:順序なし画像セットからカメラ位置を復元
- 3D 再構築:多視点入力をサポート
- 動画深度推定:動画入力のフレームごとの深度シーケンスを生成
- 複数のモデルバリアント:Small、Base、Mono/Metric Large
モデルインストール
Depth Anything 3 チェックポイントをダウンロードし、対応する ComfyUI フォルダに保存します:- Small (depth_anything_3_small.safetensors) — 軽量で高速な推論
- Base (depth_anything_3_base.safetensors) — バランスの取れた性能
- Mono-Large (depth_anything_3_mono_large.safetensors) — 単眼深度に最適(空検出対応)
- Metric-Large (depth_anything_3_metric_large.safetensors) — メートル単位の物理深度(空検出対応)
サンプルワークフロー
Depth Anything 3: 画像深度推定
画像を1枚アップロードすると、Depth Anything 3 を使用して深度マップを生成できます。オリジナル画像と深度出力を並べて比較表示します。
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで「Depth Anything 3: Image Depth Estimation」を検索してください
LoadImage ノードにアップロードします:
retro_futuristic_home.png
LoadImage ノード85 · retro_futuristic_home.png
実行手順
- LoadImage: 入力画像を読み込む
- LoadDA3Model: Depth Anything 3 のバリアントを選択する
- Run: Queueをクリックするか、
Cmd+Enterを押します - ワークフローは、深度マップと並べて比較した結果を出力します
Subgraphについて学ぶ
このワークフローは、モジュール式の処理に Subgraph ノードを使用します。Subgraph ドキュメントを確認して、ワークフローのカスタマイズや拡張方法を学んでください。
Depth Anything 3: 動画深度推定
動画をアップロードすると、フレームごとの深度シーケンスを生成できます。サブグラフ内では、GetVideoComponents が入力動画をフレームに分割し、LoadDA3Model がモデルをロードし、SetVideoComponents が深度フレームをビデオ出力に再構成します。
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで「Depth Anything 3: Video Depth Estimation」を検索してください
LoadVideo ノードにアップロードします:
empty_room_assembly.mp4
LoadVideo ノード87 · empty_room_assembly.mp4実行手順
- LoadVideo: 入力動画を読み込む
- モデルを選択: Small、Base、Mono-Large、Metric-Large から選択します
- Run: Queueをクリックするか、
Cmd+Enterを押します - ワークフローは、フレームごとの深度マップを持つビデオを出力します
Subgraphについて学ぶ
このワークフローは、モジュール式の処理に Subgraph ノードを使用します。Subgraph ドキュメントを確認して、ワークフローのカスタマイズや拡張方法を学んでください。
モデルバリアント
- Small と Base は、
dualdptヘッドタイプを採用し、信頼度推定とカメラデコーダーサポートを備え、マルチビューアプリケーションに対応します。 - Mono-Large と Metric-Large は、
dptヘッドタイプを採用し、空の検出に対応します。Metric-Large は、メートル単位の生の深度を出力します。
コミュニティリソース
- Depth Anything 3 GitHub (ByteDance-Seed): 研究論文とコード
- Comfy-Org/Depth-Anything-3: 公式 ComfyUI モデルウェイト