논문Hugging Face
ReferTrack: Referring Then Tracking for Embodied Visual Tracking
논문 ID: 2607.2006142 추천
#Embodied AI#Visual Tracking#Robotics#Computer Vision#Agent#Reasoning#Vision
핵심 요약
단일 카메라 환경에서 자연어 지시를 통해 대상을 식별하고 추적하는 로봇용 'Refer-then-Track' 패러다임 제안
상세 내용
로봇이 자연어 설명을 바탕으로 특정 대상을 지속적으로 추적하는 Embodied Visual Tracking(EVT) 연구가 중요해지고 있습니다. 기존 VLA 정책은 추상적인 공간 잠재 공간에서 추론하여 명시적인 객체 탐지와 정렬이 어렵다는 문제가 있었습니다. 이를 해결하기 위해 ReferTrack은 먼저 인덱싱된 바운딩 박스 중 대상을 선택한 후, 이 결정을 바탕으로 추적 웨이포인트를 생성하는 방식을 제안합니다. 또한, 과거의 바운딩 박스 기하학적 특징을 TVBI 토큰으로 주입하여 시간적 움직임 단서를 유지합니다. 실험 결과, 단일 카메라 환경에서 SOTA 성능을 달힘과 동시에 실제 로봇(Legged/Humanoid) 배포를 통해 강력한 Sim-to-Real 성능을 입증했습니다.
주요 내용
- 명시적 객체 탐지와 추적을 분리하여 정렬 문제를 해결한 'Refer-then-Track' 구조
- 과거 바운딩 박스 정보를 TVBI 토큰으로 변환하여 시간적 움직임 정보를 유지하는 메커니즘
- 자체 구축한 Refer-QA 데이터셋을 통한 타겟 식별 능력 강화
실무에서 볼 만한 점
복잡한 추상적 추론 대신 명시적인 객체 탐지 결과를 추적에 활용함으로써, 로봇 제어 시 발생할 수 있는 예측 불가능성을 줄이고 디버깅 가능한 추적 루프를 제공합니다.
참고할 행동
- 제공된 코드(GitHub)를 활용하여 단일 카메라 환경에서의 객체 식별 정확도 테스트
- 다양한 배경 노이즈가 있는 환경에서 TVBI 토큰의 시간적 일관성 검증
- 기존 VLA 모델과 ReferTrack의 웨이포인트 생성 방식 비교 실험