논문Hugging Face
VGI-BENCH: Probing Visual Intelligence in Video Generation Models
논문 ID: 2608.19583134 추천
#Video Generation#Visual Reasoning#Benchmark#Computer Vision#Reasoning#Video#Evaluation
핵심 요약
비디오 생성 모델의 시각적 추론 능력을 정밀하게 평가하기 위한 벤치마크인 VGI-bench를 제안합니다.
상세 내용
최근 비디오 생성 모델이 프레임 생성을 통해 제로샷 시각적 추론 능력을 보여주지만, 이를 신뢰성 있게 평가하는 것은 여전히 어렵습니다. 기존 벤치마크는 모델의 시각적 사전 지식과 정렬되지 않거나, 과정보다 결과 위주의 평가에 치중하는 한계가 있습니다. 이를 해결하기 위해 27개 태스크와 810개 인스턴스로 구성된 정밀 평가 벤치마크인 VGI-bench를 도입합니다. 실험 결과, 최상위 모델조차 51.0%의 성능을 보이는 등 현재 모델들의 시각적 추론 능력이 아직 불완전함을 확인했습니다. 또한, 생성 과정에서의 자기 수정 능력 부족과 입력 조건 민감도 등 실패 모드를 심층 분석했습니다.
주요 내용
- 27개 태스크와 810개 인스턴스로 구성된 정밀 시각적 추론 벤치마크 VGI-bench 제안
- 단순 결과물이 아닌 과정 중심의 유효한 진화 과정을 요구하는 평가 체계 구축
- 현재 비디오 생성 모델의 시각적 추론 한계와 디노이징 과정에서의 자기 수정 능력 부족 규명
실무에서 볼 만한 점
비디오 생성 모델 개발 시 단순 화질 개선을 넘어, 논리적 일관성과 시각적 추론 능력을 검증할 수 있는 평가 지표를 제공합니다.
참고할 행동
- 보유 중인 비디오 생성 모델을 VGI-bench 데이터셋으로 벤치마킹하기
- 모델의 디노이징 단계별 추론 오류 수정 능력을 정성적으로 분석하기
- 제안된 태스크 도메인을 활용하여 모델의 취약한 시각적 추론 영역 식별하기