논문Hugging Face
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
논문 ID: 2607.27205118 추천
#Robotics#VLA#EdgeAI#RealTime#RAG#Vision#Inference
핵심 요약
LLM 중심의 무거운 VLA 구조를 탈피하여, 0.2B 파라미터만으로 RTX 4090에서 32Hz 실시간 제어를 구현한 초경량 VLA 모델
상세 내용
기존의 VLA 모델은 시각 정보를 LLM의 표현 공간으로 투영하는 LLM 중심의 구조를 사용하여 추론 시 막대한 연산량과 메모리 오버헤드를 발생시킵니다. 본 논문은 이러한 구조를 V+L에서 A로 직접 매핑하는 새로운 VLA 패러다임인 TurboVLA를 제안합니다. TurboVLA는 LLM을 중앙 인터페이스로 사용하는 대신, 시각과 언어를 독립적으로 인코딩한 후 경량 양방향 상호작용을 통해 정보를 교환하고 컴팩트한 디코더로 액션 청크를 예측합니다. 실험 결과, LIBERO 벤치마크에서 0.2B 파라미터만으로도 기존의 거대 모델에 필적하는 97.7%의 성공률을 달мат했습니다. 또한 RTX 4090 환경에서 31.2ms의 지연 시간과 0.9GB 미만의 VRAM만을 사용하여 실시간 로봇 제어 가능성을 입증했습니다.
주요 내용
- LLM 중심의 V-to-L-to-A 구조를 탈피한 직접적인 V+L-to-A 매핑 방식 도입
- 경량 양방향 시각-언어 상호작용 및 컴팩트한 디코더를 통한 연산 효율 극대화
- 0.2B 파라미터와 1GB 미만 VRAM으로 고성능 실시간 로봇 제어 달성
실무에서 볼 만한 점
고가의 서버급 GPU 없이 소비자용 GPU(RTX 4090 등)만으로도 실시간 로봇 제어 모델을 구동할 수 있는 실질적인 엔지니어링 가이드를 제공합니다.
참고할 행동
- 제공된 GitHub 코드를 활용하여 소비자용 GPU 환경에서 추론 속도 및 VRAM 점유율 벤치마크 수행
- LIBERO 외의 다른 로봇 조작 데이터셋에 대한 일반화 성능 테스트
- 더 작은 규모의 인코더/디코더 구성 시 성능 저하 임계점 확인