ROWBench: Do Video Models Render What the Program Specifies?
프로그램 기반 월드 모델이 명시된 규칙과 이벤트를 시각적으로 얼마나 정확하게 구현하는지 검증하는 벤치마크 프레임워크 제안
논문이 다루는 내용
차세대 게임 엔진의 기반이 될 프로그래밍 가능한 월드 모델은 실행 가능한 역학(dynamics)과 시각적 생성을 분리하는 데 강점이 있습니다. 그러나 기존 벤치마크는 미세한 프로그램 규칙과 상호작용에 대한 시각적 충실도를 평가하는 데 한계가 있었습니다. 본 논문은 170개의 에피소드와 6항의 프록시 비디오를 포함하는 PROWBench를 제안합니다. 이 프레임워크는 프로그램 실행 기록(entity states, timestamped events)을 기반으로 생성된 비디오가 엔진의 기록과 일치하는지 검증할 수 있는 구조를 갖추고 있습니다. 이를 통해 엔티티 제어, 장기 기억, 그리고 논리적 렌더링 정렬(Logic-Render Alignment) 등을 종합적으로 평가합니다.
핵심 결과
-
프로그램 실행 기록과 시각적 결과 간의 정렬을 검증하는 PROWBench 프레임워크 개발
-
카메라 시야 밖의 이벤트와 엔티티 상태를 포함한 정밀한 월드 레코드 기반 평가 체계 구축
-
VLM을 활용한 Logic-Render Alignment 및 Interaction Success Rate 지표 도입
실무에서 볼 만한 점
시뮬레이션 환경에서 물리 법칙이나 논리 규칙이 시각적 생성 결과물에 정확히 반영되는지 정량적으로 측정할 수 있는 기준을 제공합니다.
읽을 때 확인할 점
-
기존 비디오 생성 모델을 PROWBench의 시나리오에 적용하여 논리적 일관성 테스트
-
VLM 기반의 새로운 평가 지표(Logic-Render Alignment)를 기존 벤치마크에 적용해보기
-
프로그램 기반 월드 모델의 시각적 충실도와 물리적 정확도 간의 상관관계 분석