What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling
미래 예측 모델의 일반화 성능은 미래 프레임을 직접 생성하는 것이 아니라, 학습 시 미래 상태를 준비하는 과정에서 발생함을 규명하고 이를 효율화한 Simple-WAM 제안
논문이 다루는 내용
World Action Models(WAMs)는 학습 시 미래를 예측하여 일반화 성능을 높이지만, 추론 시 미래 생성 비용 문제로 인해 Latent WAM 방식이 대안으로 사용됩니다. 연구 결과, Latent WAM은 In-distribution 작업에서는 성능이 비슷하지만 환경 변화, 데이터 효율성, 태스크 일반화 측면에서 Explicit WAM보다 성능이 크게 떨어짐을 확인했습니다. 분석 결과, 일반화의 핵심은 미래를 생성하는 것 자체가 아니라 첫 번째 디노이징 단계에서 미래 상태를 준비하는 과정에 있음을 발견했습니다. 이를 바탕으로 제안된 Simple-WAM은 미래 모델링을 단일 포워드 패스로 단순화하고 노이즈 스케줄을 조정하여 효율성을 확보했습니다. 결과적으로 Simple-WAM은 Explicit WAM의 높은 일반화 성능과 Latent WAM의 효율성을 동시에 달성했습니다.
핵심 결과
-
Latent WAM이 미래 생성 과정을 생략할 경우 WAM 특유의 일반화 이점이 사라짐을 입증
-
일반화 성능의 핵심이 미래 생성(Generation)이 아닌 미래 상태 준비(Preparation)에 있음을 규명
-
Simple-WAM을 통해 효율적인 노이즈 스케줄링만으로 높은 일반화와 추론 속도를 동시에 확보
실무에서 볼 만한 점
로봇 제어 및 에이전트 학습 시, 추론 속도를 위해 미래 예측을 생략하는 것이 모델의 강건성(Robustness)을 해칠 수 있음을 시사합니다.
읽을 때 확인할 점
-
현재 사용 중인 Latent 기반 모델과 Explicit 기반 모델의 Out-of-distribution 성능 비교 실험
-
미래 상태를 명시적으로 생성하지 않고 노이즈 스케줄만 조정하는 방식의 프로토타입 구현
-
에이전트 학습 시 미래 예측 손실(Loss)이 일반화에 미치는 영향도 분석