논문Hugging Face
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
논문 ID: 2607.2378249 추천
#Robot-Control#Multimodal#Reinforcement-Learning#Tactile-Sensing#Vision#Benchmark#Distillation
핵심 요약
대규모 촉각 데이터를 활용하여 정밀한 접촉 제어와 오프라인 정책 개선을 동시에 달성한 시각-촉각-언어-행동(VTLA) 파운데이션 모델
상세 내용
기존의 시각 중심 로봇 모델은 정밀한 접촉이 필요한 조작 작업에서 한계를 보였습니다. 이를 해결하기 위해 시각, 촉각, 언어, 행동을 통합한 N_0-VTLA 모델을 제안합니다. 대규모 촉각 데이터셋인 NeoData를 활용한 사전 학습과, 학습된 접촉 패턴을 미세 동작으로 전이하는 예측적 촉각 경로(predictive tactile pathway)를 도입했습니다. 또한, 고정된 배포 데이터에서 이득(advantage)을 계산하여 정책을 개선하는 ALTER 알고리즘을 적용했습니다. 실험 결과, 실로봇 환경의 다양한 작업에서 기존 베이스라인을 크게 앞서며 정밀 조작 능력을 입증했습니다.
주요 내용
- 대규모 시각-촉각 데이터셋(NeoData)을 활용한 최초의 VTLA 파운데이션 모델 개발
- 사전 학습된 접촉 패턴을 미세 제어로 변환하는 예측적 촉각 경로(predictive tactile pathway) 설계
- 상대적 진행도와 궤적 이벤트를 이진 이득 라벨로 변환하는 ALTER 오프라인 강화학습 방법론 도입
실무에서 볼 만한 점
시각 정보만으로는 불가능한 변형 가능한 물체 조작이나 정밀한 접촉 제어가 필요한 로봇 제어 알고리즘 설계에 직접적인 영감을 제공합니다.
참고할 행동
- 제공된 NeoData와 유사한 형태의 멀티모달 데이터셋 구축 전략 분석
- 기존 시각 기반 정책에 촉각 피드백 경로를 결합하는 아키텍처 실험
- 오프라인 데이터셋을 활용한 이득 기반 정책 개선(RL) 적용 테스트