Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
복합적인 목표 달성을 위한 1인칭 시점 비디오 생성 모델의 물리적 추론 및 계획 능력을 평가하는 벤치마크 제안
논문이 다루는 내용
비디오 생성 모델이 로봇 학습을 위한 월드 시뮬레이터로 활용되려면 단순한 시각적 품질을 넘어 목표 지향적 행동에 따른 환경 변화를 예측할 수 있어야 합니다. 그러나 기존 벤치마크는 단일 동작이나 단순 단계에 집중하여, 복잡한 다단계 물리적 추론이 필요한 1인칭 시점 환경을 충분히 평가하지 못합니다. 이를 해결하기 위해 110개의 실생활 작업과 2,640개의 영상을 포함한 목표 지향적 벤치마크인 Ego2Act를 도입합니다. 또한, 인간의 판단과 유사하게 작업 완료 여부와 물리적 타당성을 평가하는 참조 없는 평가 파이프라인인 Ego2ActJudge를 함께 제안합니다. 실험 결과, 현재 모델들은 중간 단계를 생략하거나 물리적 역학 관계를 정확히 유지하지 못해 최종 목표 달성에 실패하는 경향을 보였습니다.
핵심 결과
-
다단계 물리적 추론을 평가하는 1인칭 시점(Egocentric) 비디오 생성 벤치마크 Ego2Act 제안
-
인간의 판단과 높은 일치도를 보이는 참조 없는 평가 파이프라인 Ego2ActJudge 개발
-
현재 비디오 생성 모델이 복합 작업 수행 시 중간 단계 누락 및 물리적 역학 실패 문제를 겪음을 규명
실무에서 볼 만한 점
로봇 제어 및 Embodied AI를 위한 월드 모델 개발 시, 단순 시각적 품질이 아닌 '목표 달성 가능성'을 검증하는 데 중요한 기준을 제공합니다.
읽을 때 확인할 점
-
제안된 Ego2Act 데이터셋을 활용하여 현재 사용 중인 비디오 생성 모델의 계획 능력 테스트
-
Ego2ActJudge를 기존 평가 지표(FID 등)와 비교하여 물리적 타당성 측정 도구로 검토
-
다단계 작업 수행 시 발생하는 상태 의존성(State-dependency) 문제를 해결하기 위한 모델 구조 실험