EVO-WAM: Evolving World Action Models through Video-Action Verification
추가적인 전문가 데이터 없이 생성된 비디오-액션 궤적의 정합성을 검증하여 로봇 정책을 자가 학습시키는 프레임워크
논문이 다루는 내용
로봇 학습에서 새로운 작업에 대한 전문가 시연 데이터 없이 정책을 개선하는 것은 매우 어려운 과제입니다. 기존의 World Action Models(WAMs)는 비디오와 액션을 동시에 예측하여 새로운 작업 적응에 활용될 수 있지만, 생성된 비디오가 작업 완수를 반영하지 못하거나 액션과 비디오 간의 불일치가 발생하는 문제가 있습니다. 이를 해결하기 위해 EVO-WAM은 외부 환경 실행 없이 생성된 궤적 자체에서 신뢰할 수 있는 경험을 식별하여 학습하는 프레임워크를 제안합니다. 상태 예측과 앵커링된 컨텍스트를 통해 완전한 자기회귀 롤아웃을 가능하게 하며, VLM과 역역학 모델을 결합하여 작업 완수 여부와 비디오-액션 일관성을 검증합니다. 검증된 데이터를 바탕으로 모델을 반복적으로 학습시키는 과정을 통해 성능을 점진적으로 향상시킵니다. 실험 결과, RoboTwin 2.0 및 실제 환경의 장기 작업에서 기존 모델 대비 성공률을 대폭 향상시켰습니다.
핵심 결과
-
외부 환경 실행 없이 생성된 비디오-액션 궤적만으로 모델을 적응시키는 자가 학습 프레임워크 제안
-
VLM을 통한 작업 완수 여부 판단 및 역역학 모델(Inverse Dynamics Model)을 통한 비디오-액션 일관성 검증
-
상태 예측 및 앵커링된 컨텍스트를 활용하여 안정적인 자기회귀(Autoregressive) 롤아웃 구현
실무에서 볼 만한 점
데이터 수집 비용이 큰 로봇 분야에서 시뮬레이션이나 실제 실행 없이 생성 모델의 품질을 제어하며 정책을 고도화할 수 있는 방법론을 제시합니다.
읽을 때 확인할 점
-
VLM과 역역학 모델을 결합한 데이터 필터링 파이프라인의 효율성 테스트
-
생성된 비디오의 시각적 품질과 실제 로봇 제어 성능 간의 상관관계 분석
-
다양한 환경(Sim-to-Real)에서의 롤아웃 안정성 검증