논문Hugging Face
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
논문 ID: 2608.17426151 추천
#Video Generation#Benchmark#VLM#Task Completion#Vision#Video#Evaluation
핵심 요약
결과 중심의 비디오 생성 성능을 측정하기 위해 제안된 새로운 벤치마크 및 평가 프로토콜
상세 내용
기존 비디오 생성 평가는 중간 과정이나 외형적 일관성에 치중하여 실제 작업 완수 여부를 측정하기 어려웠습니다. 본 논문은 의도된 결과 달성과 의미적 근거(Semantic Grounding)를 동시에 평가하는 'Semantic Task Completion' 과업을 제안합니다. 이를 위해 6개 도메인을 포함하는 데이터셋인 SemComp-Data와 VLM 기반의 평가 프로토콜인 SemComp-Bench를 구축했습니다. 실험 결과, 기존 모델들은 작업 결과물과 참조 이미지 간의 의미적 정합성을 유지하며 목표를 달성하는 데 어려움을 겪는 것으로 나타났습니다.
주요 내용
- 결과 중심(Outcome-oriented)의 새로운 비디오 생성 과업 정의
- 의미적 근거(Semantic Groundization)와 결과 달성(Outcome Achievement)을 결합한 평가 체계
- VLM을 활용한 구조화된 이진 질문 방식의 SemComp-Bench 프로토콜 도입
실무에서 볼 만한 점
단순히 '비디오가 자연스러운가'를 넘어, 사용자의 명령에 따라 '목표를 달성했는가'를 정량적으로 평가할 수 있는 기준을 제공합니다.
참고할 행동
- 기존 비디오 생성 모델(Sora, Gen-3 등)을 SemComp-Bench 프로토콜로 테스트해보기
- VLM 기반 평가 방식이 인간의 주관적 판단과 얼마나 일치하는지 상관관계 분석하기
- 제시된 4단계 큐레이션 파이프라인을 활용해 자체 데이터셋 구축해보기