PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

논문 ID: 2607.25895123 추천
#Robot Learning#Data Collection#Imitation Learning#Computer Vision#Vision#Evaluation
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

핵심 요약

고정밀 로봇 없는(robot-free) 데이터 수집 시스템을 통해 실로봇 학습 없이도 즉시 배포 가능한 고성능 조작 정책을 구현함

상세 내용

로봇 조작 정책 학습은 고정밀 데이터와 확장성 사이의 트레이드오프 문제로 인해 어려움을 겪고 있습니다. 기존의 로봇 없는(robot-free) 데이터는 확장성은 좋지만 정밀도가 낮아 실로봇 학습 시 별도의 앵커 데이터가 필요했습니다. 본 논문은 데이터의 양보다 질(fidelity)을 높여 실로봇 데이터 없이도 배포 가능한 HiFi-UMI 시스템을 제안합니다. 이 시스템은 SLAM, 정밀한 상대 포즈 계산, 마이크로초 단위 동기화 및 광각 카메라를 결합하여 외부 인프라 없이 3mm 수준의 정밀도를 달성합니다. 실험 결과, HiFi-UMI 데이터로만 학습된 정책이 실로봇에서 즉시 성공적으로 작동하며 기존 텔레오퍼레이션 성능에 근접하는 성과를 보였습니다. 최종적으로 2,000시간 분량의 고정밀 데이터셋인 HiFi-UMI-2K를 공개하여 커뮤니티에 기여합니다.

주요 내용

  • 고정밀 로봇 없는(robot-free) 데이터 수집을 위한 하드웨어/소프트웨어 통합 시스템(HiFi-UMI) 개발
  • 실로봇 데이터 없이 고정밀 데이터만으로 즉시 배포 가능한(zero-robot post-training) 정책 학습 성공
  • 2,000시간 규모의 고정밀/광각 시각 데이터셋 HiFi-UMI-2K 공개

실무에서 볼 만한 점

고가의 로봇 하드웨어 없이도 정밀한 조작 데이터를 대량으로 수집할 수 있는 방법론을 제시하여 데이터 확보 비용을 획기적으로 낮춤

참고할 행동

  • 제공된 HiFi-UMI-2K 데이터셋을 활용하여 기존 VLA 모델의 Zero-shot 성능 테스트
  • 제안된 하드웨어 구성(SLAM, 동기화 방식)을 기존 데이터 수집 파이프라인에 적용 가능한지 검토
  • 데이터 정밀도 향상이 모델의 일반화 성능에 미치는 영향 분석