Beyond the Current Scene: Event-Referential Grasping with Active View Selection
과거 이벤트 맥락을 활용해 가려진 물체를 찾아내고 능동적으로 시점을 선택하여 잡는 제로샷 로봇 제어 시스템
논문이 다루는 내용
사람의 상호작용을 관찰한 로봇이 과거 이벤트의 역할을 기반으로 물체를 식별하고 잡아야 하는 상황을 가정합니다. 기존 방식은 물체의 이름이나 외형에 의존하거나, 물체가 가려졌을 때 식별하기 어렵다는 문제가 있습니다. 본 논문은 이벤트 맥락과 현재 장면을 결합하여 대상을 식별하고, 가려진 경우 최적의 시점을 선택하는 BeyondSCe 시스템을 제안합니다. 이 시스템은 사전 학습된 모델만을 사용하여 추가 학습 없이 동작하며, 이벤트 기록에서 복구된 사전 정보와 현재 기하 구조를 결합해 타겟을 노출할 수 있는 카메라 시점을 결정합니다. 실험 결과, 가려진 타겟에 대해서도 기존 베이스라인보다 높은 성공률을 기록하며 효율적인 능동 인식을 입증했습니다.
핵심 결과
-
이벤트 맥락(Event-referential)을 활용한 제로샷 물체 식별 및 로봇 파지 기술
-
가려진 타겟을 찾기 위해 과거 이벤트 정보와 현재 기하 구조를 결합한 능동적 시점 선택(Active View Selection)
-
추가적인 태스크별 학습 없이 사전 학습된 모델만 활용하는 효율적인 시스템 구조
실무에서 볼 만한 점
LLM/VLM 기반의 에이전트가 물리적 환경에서 '과거 맥락'을 어떻게 공간적 추론과 결합하여 실행(Action)으로 옮길 수 있는지에 대한 실전 사례를 제공합니다.
읽을 때 확인할 점
-
사전 학습된 VLM을 활용한 이벤트 기반 물체 식별 로직 구현 테스트
-
가려진 물체 추론을 위한 3D 기하 정보와 이벤트 히스토리 결합 알고리즘 검증
-
단일 카메라 환경에서의 능동적 시점 이동(Active Perception) 제어 루프 실험