WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
3D 환경 내 이상 현상 탐지를 위한 멀티모달 에이전트의 탐사 및 추론 능력을 평가하는 벤치마크 제안
논문이 다루는 내용
상호작용 가능한 3D 월드가 확산됨에 따라 시뮬레이션 내 이상 현상(floating objects, traversable walls 등)을 식별하는 자동화 파이프라인의 중요성이 커지고 있습니다. 기존의 VLM/VLA 모델은 시각적 추론과 탐사 행동을 결합하여 체계적으로 문제를 해결하는 능력이 아직 충분히 검증되지 않았습니다. 본 논문은 13개 환경과 213개 태스크로 구성된 3D 월드 감사 벤치마크인 WorldAuditBench를 제안합니다. 연구진은 VLA 기반 탐사 후 VLM 식별 방식과 엔드투엔드 VLM 에이전트 방식 두 가지 패러다임을 통해 최신 모델들을 평가했습니다. 실험 결과, 모델들의 성공률은 인간 성능에 비해 현저히 낮게 나타나 현재 멀티모달 에이전트의 한계를 확인했습니다.
핵심 결과
-
3D 환경의 이상 현상 탐지를 위한 213개 태스크 및 13개 환경 기반 벤치마크(WorldAuditBench) 구축
-
시각적 추론(Visual Reasoning)과 탐사 행동(Action)의 결합 능력을 평가하는 두 가지 패러다임 제시
-
현재 최신 모델들이 인간의 성능에 미치지 못하는 탐사 및 증거 수집 능력을 가짐을 입증
실무에서 볼 만한 점
3D 시뮬레이션 환경의 자동 검수 및 품질 관리(QA) 자동화를 위한 에이전트 설계 시 핵심적인 평가 지표를 제공합니다.
읽을 때 확인할 점
-
제시된 두 가지 패러다임(VLA-VLM vs End-to-end) 중 어떤 것이 탐사 효율성에 유리한지 비교 실험
-
제한된 탐사 예산(Exploration Budget) 내에서 에이전트의 경로 최적화 알고리즘 적용 테스트
-
시각적 추론 결과가 행동 선택에 미치는 피드백 루프 구조 설계 실험