PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

논문 ID: 2608.0746822 추천
#Autonomous Driving#Video Generation#End-to-End#Flow Matching#Video#Inference
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

핵심 요약

비디오 생성 모델을 학습 신호로만 활용하여 추론 시 부하를 제거한 고성능 엔드투엔드 자율주행 플래너

상세 내용

기존의 World-Action Model(WAM)은 비디오 생성 능력을 활용해 주행 성능을 높이지만, 추론 시 미래 프레임을 생성해야 하는 높은 연산 비용이 문제였습니다. 본 논문은 비디오 생성을 오직 학습 신호로만 사용하는 SimWAM을 제안합니다. 사전 학습된 비디오 전문가와 경량 액션 전문가를 Flow Matching을 통해 공동 학습시키되, 격리된 어텐션 마스크를 사용하여 액션 예측이 미래 프레임에 의존하지 않도록 설계했습니다. 이를 통해 학습 후 비디오 브랜치를 제거할 수 있어 추론 속도를 획기적으로 높였습니다. 실험 결과, SimWAM은 낮은 지연 시간으로도 SOTA 성능을 달성했으며 nuScenes 데이터셋에서도 우수한 제로샷 전이 성능을 보였습니다.

주요 내용

  • 비디오 생성을 학습 시에만 사용하여 추론 시 연산 비용을 제거한 구조
  • Flow Matching 기반의 비디오-액션 전문가 공동 학습 방식
  • 격리된 어텐션 마스크를 통한 독립적인 액션 예측 및 모듈형 설계

실무에서 볼 만한 점

비디오 생성 모델의 강력한 표현력을 활용하면서도, 실제 차량 탑재 시 가장 중요한 실시간성(Low Latency) 문제를 구조적으로 해결한 점이 핵심입니다.

참고할 행동

  • 제공된 코드를 활용하여 다양한 비디오 백본 교체 실험 수행
  • 학습된 액션 전문가 모델의 경량화 및 추론 지연 시간 측정
  • RL(강화학습) 보상 함수를 변경하여 주행 스타일 변화 테스트