논문Hugging Face
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
논문 ID: 2608.2033564 추천
#4D Reconstruction#Diffusion Models#Gaussian Splatting#Computer Vision#Video
핵심 요약
단일 카메라 영상만으로 일관성 있는 다중 시점 영상을 생성하여 고품질 4D 인간 모델을 구축하는 프레임워크
상세 내용
기존의 카메라 제어 비디오 확산 모델은 다수의 타겟 뷰를 생성할 때 시점 간 일관성이 무너지는 문제가 있었습니다. 이는 참조 데이터가 늘어날수록 가이드가 약해지거나, 그룹화된 뷰 간 정보 교환이 되지 않는 '제한된 어텐션 컨텍락' 문제 때문입니다. 4DAnyone은 이를 해결하기 위해 참조 뷰를 고정 길이로 압축하는 RCP와 그룹 간 정보를 순환시키는 TCR 기법을 제안합니다. 이를 통해 생성된 일관된 다중 시점 영상을 4D Gaussian Splatting으로 변환하여 정교한 4D 재구성을 수행합니다. 실험 결과, 기존 방식보다 뛰어난 영상 품질과 4D 재구성 성능을 보이며 야외 영상에서도 강력한 일반화 성능을 입증했습니다.
주요 내용
- RCP(Reference Context Packing): 참조 뷰를 고정 길이 혼합 해상도 컨텍스트로 압축하여 O(1) 복잡도로 일관성 유지
- TCR(Target Context Routing): 디노이징 단계별로 타겟 뷰 그룹을 순환시켜 그룹 간 구조적 드리프트 방지
- 4DGS 연계: 생성된 일관성 있는 영상을 4D Gaussian Splatting으로 리프팅하여 고품질 4D 재구성 달성
실무에서 볼 만한 점
단일 카메라 영상만으로도 정교한 3D/4D 디지털 휴먼을 생성할 수 있어, 콘텐츠 제작 및 메타버스 환경의 자산 생성 비용을 획기적으로 낮출 수 있습니다.
참고할 행동
- 제공된 소스 코드를 활용하여 다양한 인물/동작 데이터셋에 대한 재구성 품질 테스트
- 생성된 다중 시점 영상이 4DGS로 변환될 때의 기하학적 정밀도 검증
- 실제 야외 영상(in-the-wild) 입력 시의 강건성 및 노이즈 영향도 분석