RoboCoach: World Models as Active Coaches for Compositional Robot Skills
월드 모델의 상상된 실패를 활용해 최소한의 데이터로 로봇의 복합 작업 성공률을 극대화하는 능동적 코칭 프레임워크
논문이 다루는 내용
로봇의 장기 작업 수행 시 다양한 작업 조합에 맞춰 매번 새로운 데모를 확보하는 것은 비용이 매우 큽니다. 본 논문은 어떤 데모를 추가하고 어떤 전문가 모델을 업데이트할지 결정하는 효율적인 자가 개선 시스템을 제안합니다. 제안된 RIDI(Route-Imagine-Diagnose-Improve) 루프는 공유 월드 모델 내에서 숙련된 스킬 전문가들을 실행하며, 상상된 실패 지점을 식별하여 타겟팅된 데모 요청을 생성합니다. 실험 결과, 단 150개의 추가 데모만으로도 Franka와 AgileX 플랫폼에서 성공률을 대폭 향상시켰으며, 미학습 작업 조합에 대한 전이 성능도 입증했습니다. 결과적으로 월드 모델이 모듈형 정책 개선을 위한 능동적 코치 역할을 할 수 있음을 보여줍니다.
핵심 결과
-
RIDI(Route-Imagine-Diagnose-Improve) 루프를 통한 효율적인 데이터 수집 및 모델 업데이트 전략
-
공유 액션 조건부 월드 모델(COACHWORLD)을 활용한 상상된 실패 기반의 타겟팅된 감독
-
최소한의 데모 데이터로 복합 작업 성공률 및 미학습 작업에 대한 전이 성능 확보
실무에서 볼 만한 점
데이터 수집 비용이 큰 로봇 제어 분야에서, 어떤 데이터를 수집해야 모델 성능이 가장 크게 오를지 결정하는 '데이터 효율적 학습 전략'의 실무적 대안을 제시합니다.
읽을 때 확인할 점
-
기존 모듈형 로봇 정책에 월드 모델 기반의 실패 예측 루프를 결합하여 데이터 효율성 비교
-
특정 하위 작업(subtask) 실패 시점에 맞춘 데이터 수집 전략의 유효성 검증
-
학습된 전문가 모델 간의 간섭(interference) 현상과 RIDI 루프의 완충 효과 분석