Skip to main content

ComfyUI Depth Anything 3 简介

Depth Anything 3 (DA3) 来自字节跳动豆包团队,是一个视觉 Transformer,能够从任意视觉输入中恢复空间一致的几何信息,无论是否具有已知的相机位姿。单个 DINO 编码器和统一的深度-射线表示使得同一模型家族能够覆盖单目深度、多视角深度、相机位姿估计和 3D 重建。 主要能力:
  • 统一单目与多视角深度:从单张图像或多张图像估计深度
  • 相机位姿估计:从无序图像集合中恢复相机位置
  • 3D 重建:支持多视角输入
  • 视频深度估计:为视频输入生成逐帧深度序列
  • 多种模型变体:Small、Base、Mono/Metric Large
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。
ComfyUI 现已原生支持 Depth Anything 3 节点。开始前请确保已更新到最新版本的 ComfyUI

模型下载

下载 Depth Anything 3 的模型文件并将其保存到对应的 ComfyUI 文件夹:

示例工作流

Depth Anything 3:图像深度估计

上传一张图像,使用 Depth Anything 3 生成深度图。并排查看原始图像与深度输出的对比。 Depth Anything 3 图像深度估计工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“Depth Anything 3:图像深度估计”
输入素材 将此文件上传到对应的 LoadImage 节点:

retro_futuristic_home.png

LoadImage 节点 85 · retro_futuristic_home.png
输入图像

运行步骤

  1. LoadImage:加载输入图像
  2. LoadDA3Model:选择 Depth Anything 3 变体
  3. Run:点击 Queue 或使用 Cmd+Enter
  4. 工作流将输出深度图和并排对比图

了解 Subgraph

此工作流使用 Subgraph 节点进行模块化处理。查看 Subgraph 文档,了解如何自定义和扩展工作流。

Depth Anything 3:视频深度估计

上传视频,逐帧生成深度序列。在 Subgraph 内部,GetVideoComponents 将输入视频拆分为帧,LoadDA3Model 加载模型,SetVideoComponents 将深度帧重新组合为视频输出。 Depth Anything 3 视频深度估计工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“Depth Anything 3:视频深度估计”
输入素材 将此文件上传到对应的 LoadVideo 节点:

empty_room_assembly.mp4

LoadVideo 节点 87 · empty_room_assembly.mp4

运行步骤

  1. LoadVideo:加载输入视频
  2. Select Model:在 SmallBaseMono-LargeMetric-Large 之间选择
  3. Run:点击 Queue 或使用 Cmd+Enter
  4. 工作流将输出包含逐帧深度图的视频

了解 Subgraph

此工作流使用 Subgraph 节点进行模块化处理。查看 Subgraph 文档,了解如何自定义和扩展工作流。

模型变体

  • SmallBase 使用 dualdpt 头类型,支持置信度估计和相机解码器,适用于多视角应用。
  • Mono-LargeMetric-Large 使用 dpt 头类型,支持天空检测。Metric-Large 输出原始米级深度。

社区资源