Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
합성 데이터 기반의 공간 가이드형 자기 증류(Self-Distillation)를 통해 MLLM의 시각적 인지 능력을 향상시키는 방법론
논문이 다루는 내용
최근 MLLM의 성능 향상을 위해 특권 정보(privileged information)를 활용한 온폴리시 자기 증류 방식이 주목받고 있으나, 기존의 이미지 크롭 방식은 특정 작업에 국한되거나 수동 주석이 필요하다는 한계가 있습니다. 본 논문은 텍스트 기반의 공간 가이드를 교사 모델에 제공하여 질문과 관련된 시각적 요소를 식만하게 식별하도록 하는 새로운 자기 증류 방식을 제안합니다. 절차적 생성(procedural generation)을 통해 자동 생성된 합성 장면을 활용함으로써 주석 작업 없이 대규모 사후 학습이 가능하도록 설계했습니다. 교사 모델은 공간 가이드를 통해 여러 영역의 증거를 통합하고, 학생 모델은 이미지와 질문만으로 이 동작을 재현하도록 학습합니다. 실험 결과, 합성 데이터로 학습했음에도 불구하고 실제 세계의 다양한 시각 벤치마크에서 성능 향상이 나타나는 강력한 합성-실제 전이(synthetic-to-real transfer) 능력을 입증했습니다.
핵심 결과
-
공간 가이드 기반의 온폴리시 자기 증류(On-policy Self-Distillation) 프레임워크 제안
-
절차적 생성(Procedural Generation)을 통한 주석 없는 대규모 합성 데이터 학습 파이프라인 구축
-
합성 데이터 학습만으로 실제 세계의 시각적 인지 성능을 높이는 강력한 전이 능력 확보
실무에서 볼 만한 점
데이터 라벨링 비용 없이 합성 데이터만으로 MLLM의 정밀한 시각적 추론 능력을 높일 수 있는 효율적인 학습 전략을 제시합니다.
읽을 때 확인할 점
-
절차적 생성 도구를 활용하여 객체 좌표가 포함된 합성 데이터셋 구축 실험
-
기존 MLLM 모델에 공간 가이드를 포함한 교사 모델-학생 모델 구조 적용
-
학습된 모델의 실제 이미지(Real-world) 데이터에 대한 성능 전이도 측정