논문Hugging Face
GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
논문 ID: 2608.1587589 추천
#Embodied AI#VLA#Foundation Model#Robotics#Agent#Vision#Safety
핵심 요약
3단계 아키텍처와 대규모 데이터 스케일링을 통해 다양한 로봇 하드웨어에 범용적으로 적용 가능한 VLA 파운데이션 모델 개발
상세 내용
기존의 Vision-Language-Action(VLA) 모델은 복잡한 작업 수행 능력을 보여주었으나, 아키텍처 설계의 효율성과 대규모 이종 데이터로의 확장성, 그리고 다양한 로봇 형태에 대한 일반화 성능 측면에서 한계가 있었습니다. 본 논문에서는 이를 해결하기 위해 이해, 예측, 행동을 통합하는 3단계 시스템 아키텍처를 제안합니다. 37,000시간 이상의 대규모 이종 데이터를 활용한 사전 학습과 시각-언어 이해 및 다중 로봇 행동 생성을 동시에 최적화하는 단일 단계 정렬 학습을 도입했습니다. 실험 결과, GigaBrain-0.7은 이전 모델 및 최신 SOTA 모델 대비 제로샷 능력과 언어 지시 이행, 작업 성공률에서 대폭 향상된 성능을 보였습니다. 특히 가정용 및 산업용 시나리오 전반에서 강력한 적응력을 입증했습니다.
주요 내용
- 이해, 예측, 행동을 통합한 3단계 시스템 아키텍처 설계
- 37,000시간 이상의 대규모 이종(heterogeneous) 데이터 스케일링
- 시각-언어 이해와 다중 로봇 행동 생성을 결합한 단일 단계 정렬 학습 방식
실무에서 볼 만한 점
로봇 하드웨어가 바뀌더라도 모델을 새로 학습할 필요 없이 범용적으로 적용할 수 있는 VLA 모델의 확장 가능성을 제시합니다.
참고할 행동
- 제공될 모델 가중치를 활용하여 다양한 로봇 시뮬레이터 환경에서의 제로샷 성능 테스트
- 제안된 3단계 아키텍처를 기존 VLA 모델 구조와 비교 분석
- 특정 도메인(가정/산업) 데이터셋을 활용한 미세 조정(Fine-tuning) 실험