PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

논문 ID: 2607.269914 추천
#VLA#Reinforcement Learning#Robotics#Inference-time Scaling#RAG#Vision#Benchmark#Inference
RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

핵심 요약

VLA 모델의 성능 저하를 방지하기 위해 실패 예측 시에만 RL 기반의 잠재 공간 제어를 적용하는 적응형 추론 프레임워크입니다.

상세 내용

최근 VLA 모델은 뛰어난 성능을 보이지만, 학습 데이터 범위를 벗어난 환경에서는 성능이 급격히 저하되는 문제가 있습니다. 기존의 테스트 타임 스티어링 방식은 행동 샘플이 특정 모드에 집중되어 실패 모드를 답습하거나, 성공 가능성이 높은 상황에서도 불필요한 개입을 하는 한계가 있었습니다. 이를 해결하기 위해 본 논문은 VLA의 잠재 공간(Latent)에서 오프라인 RL을 수행하는 RL^2 프레임워크를 제안합니다. RL^2는 VLA의 행동 우선순위와 RL의 다양성을 결합한 구성적 제어 전략을 사용하며, 실패가 예측될 때만 개입하여 정확도를 유지합니다. 실험 결과, SIMPLER 및 PolaRiS 벤치마크에서 OOD 환경 성능을 크게 향상시켰으며 실세계 로봇 실험에서도 성공적으로 전이됨을 입증했습니다.

주요 내용

  • VLA의 행동 잠재 공간(Latent)을 활용한 오프라인 RL 기반의 구성적 제어 전략 제안
  • 실패 가능성이 높은 시점에만 개입하는 적응형(Adaptive) 추론 스케일링 적용
  • 기존 모방 학습의 우선순위와 RL의 행동 다양성을 결합하여 OOD 성능 극대화

실무에서 볼 만한 점

모델 재학습 없이 추론 단계에서만 성능을 개선할 수 있어, 실무 환경의 로봇 배포 시 유연한 성능 튜닝이 가능합니다.

참고할 행동

  • 기존 VLA 모델의 잠재 공간(Latent) 추출 및 오프라인 RL 학습 환경 구축
  • 실패 예측 모델(Failure Predictor)과 제어 로직의 결합 실험
  • 시뮬레이션과 실세계 환경 간의 도메인 차이에 따른 제어 강도 테스트