ComfyUI Depth Anything 3 소개
Depth Anything 3 (DA3)는 ByteDance Seed의 비전 트랜스포머로, 카메라 포즈 유무와 관계없이 임의의 시각적 입력으로부터 공간적으로 일관된 기하학 정보를 복원합니다. 단일 DINO 인코더와 통합된 깊이-레이 표현을 통해 동일한 모델 패밀리로 단일 뷰 깊이, 다중 뷰 깊이, 카메라 포즈 추정 및 3D 재구성을 모두 처리합니다. 주요 기능:- 통합 단일/다중 뷰 깊이: 단일 이미지 또는 여러 뷰에서 깊이 추정
- 카메라 포즈 추정: 순서 없는 이미지 세트에서 카메라 위치 복원
- 3D 재구성: 다중 뷰 입력으로부터 재구성
- 비디오 깊이 추정: 비디오 입력에 대한 프레임별 깊이 시퀀스 생성
- 여러 모델 변형: Small, Base, Mono/Metric Large
모델 설치
Depth Anything 3 체크포인트를 다운로드하여 해당 ComfyUI 폴더에 저장합니다:- Small (depth_anything_3_small.safetensors) — 가볍고 빠른 추론
- Base (depth_anything_3_base.safetensors) — 균형 잡힌 성능
- Mono-Large (depth_anything_3_mono_large.safetensors) — 단일 뷰 깊이에 최적 (하늘 감지 포함)
- Metric-Large (depth_anything_3_metric_large.safetensors) — 미터 단위의 물리적 깊이 (하늘 감지 포함)
예제 워크플로
Depth Anything 3: 이미지 깊이 추정
이미지 하나를 업로드하고 Depth Anything 3로 깊이 맵을 생성합니다. 원본 이미지와 깊이 출력을 나란히 비교해 볼 수 있습니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “Depth Anything 3: Image Depth Estimation”을 검색하세요
LoadImage 노드에 업로드하세요:
retro_futuristic_home.png
LoadImage 노드 85 · retro_futuristic_home.png
실행 단계
- LoadImage: 입력 이미지를 로드합니다
- LoadDA3Model: Depth Anything 3 변형을 선택합니다
- 실행: Queue를 클릭하거나
Cmd+Enter를 사용하세요 - 워크플로가 깊이 맵과 나란히 비교한 결과를 출력합니다
Subgraph 정보
이 워크플로는 모듈식 처리를 위해 Subgraph 노드를 사용합니다. Subgraph 문서를 확인하여 워크플로를 사용자 정의하고 확장하는 방법을 알아보세요.
Depth Anything 3: 비디오 깊이 추정
비디오를 업로드하면 프레임별 깊이 시퀀스를 생성합니다. Subgraph 내부에서 GetVideoComponents가 입력 비디오를 프레임으로 분할하고, LoadDA3Model이 모델을 로드하며, SetVideoComponents가 깊이 프레임을 다시 비디오 출력으로 재구성합니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “Depth Anything 3: Video Depth Estimation”을 검색하세요
LoadVideo 노드에 업로드하세요:
empty_room_assembly.mp4
LoadVideo 노드 87 · empty_room_assembly.mp4실행 단계
- LoadVideo: 입력 비디오를 로드합니다
- 모델 선택: Small, Base, Mono-Large, Metric-Large 중에서 선택합니다
- 실행: Queue를 클릭하거나
Cmd+Enter를 사용하세요 - 워크플로가 프레임별 깊이 맵이 적용된 비디오를 출력합니다
Subgraph 정보
이 워크플로는 모듈식 처리를 위해 Subgraph 노드를 사용합니다. Subgraph 문서를 확인하여 워크플로를 사용자 정의하고 확장하는 방법을 알아보세요.
모델 변형
- Small과 Base는
dualdpthead 타입을 사용하며, 신뢰도 추정과 멀티뷰 애플리케이션을 위한 카메라 디코더를 지원합니다. - Mono-Large와 Metric-Large는 하늘 감지 기능이 있는
dpthead 타입을 사용합니다. Metric-Large는 미터 단위의 원시 깊이를 출력합니다.
커뮤니티 리소스
- Depth Anything 3 GitHub (ByteDance-Seed): 연구 논문 및 코드
- Comfy-Org/Depth-Anything-3: 공식 ComfyUI 모델 가중치