In-Context Robot Learning with VLM Agents
VLM의 에이전트 능력을 활용하여 파라미터 업데이트 없이 데모와 피드백만으로 로봇 동작을 수행하는 In-Context 학습 프레임워크 제안
논문이 다루는 내용
로봇이 낯선 환경에 적응하기 위해서는 미지의 상황에서도 학습할 수 있는 In-Context Learning(ICL) 능력이 필수적입니다. 그러나 기존 로봇 정책은 데모나 피드백을 즉각적인 동작으로 변환하는 데 한계가 있었습니다. 본 논문은 VLM의 에이전트 역량을 활용한 일반화 프레임워크인 GPT-Policy를 제안합니다. 이 시스템은 작업 관련 시각적 변화를 보존하는 컨텍스트 컴파일러, 동작을 제안하는 VLM, 그리고 동작을 검증 및 실행하는 제어기를 통합합니다. 실험 결과, 인간의 비디오 데모만으로도 작업 성공률이 향상되었으며, 이는 파라미터 수정 없이도 로봇이 새로운 작업을 수행할 수 있는 가능성을 보여주었습니다.
핵심 결과
-
파라미터 업데이트 없는 In-Context Robot Learning 프레임워크(GPT-Policy) 개발
-
시각적 전이 보존(Context Compiler), 동작 제안(VLM), 검증 및 실행(Controller)의 통합 구조
-
라벨 없는 비디오 데모와 정렬된 액션 참조를 통한 로봇 적응 성능 입증
실무에서 볼 만한 점
모델 재학습(Fine-tuning) 없이 프롬프트와 데모만으로 로봇의 동작을 제어할 수 있는 새로운 워크플로우를 제시합니다.
읽을 때 확인할 점
-
제공된 비디오 데모의 프레임 추출 방식에 따른 성능 변화 테스트
-
VLM의 추론 속도가 실시간 로봇 제어 루프에 미치는 영향 분석
-
다양한 도구(Tool) 환경에서의 제어기(Controller) 제약 조건 설정 실험