OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?
시각적 생성(Generation) 학습이 특정 시각적 이해(Understanding) 능력을 어떻게 향상시키는지 규명한 연구
논문이 다루는 내용
시각적 생성 학습이 지각 능력 향상에는 도움이 되지만, 이것이 시각적 이해 성능으로 어떻게 전이되는지는 명확하지 않았습니다. 본 연구는 동일한 문제를 다른 모달리티로 표현하는 I2I(이미지 생성)와 I2T(이미지 이해) 태스크 쌍을 연구했습니다. 이를 위해 19개의 생성 태스크와 25개의 이해 태스크를 아우르는 'OmniTaskonomy' 분류 체계를 도입했습니다. 실험 결과, 적절한 학습 레시피 하에서 생성 학습은 이해 성능을 향상시키며, 데이터 양이 많을수록 이 효과는 커졌습니다. 또한 태스크 간의 선택적 전이 패턴을 발견했으며, 이는 그래디언트 정렬(Gradient Alignment) 정도와 밀접한 관련이 있음을 확인했습니다.
핵심 결과
-
I2I(생성) 학습이 I2T(이해) 성능을 향상시키는 메커니즘 규명
-
19개 생성 태스크와 25개 이해 태스크를 결합한 'OmniTaskonomy' 벤치마크 제안
-
태스크 간의 선택적 전이 패턴 및 그래디언트 정렬을 통한 전이 효과 분석
실무에서 볼 만한 점
생성 모델을 단순히 콘텐츠 제작용이 아닌, 시각적 추론 능력을 강화하는 강력한 자기주도 학습(Self-supervised) 수단으로 활용할 수 있는 가이드를 제공합니다.
읽을 때 확인할 점
-
특정 시각 이해 태스크를 위해 어떤 생성 태스크를 사전 학습에 포함할지 매핑 실험 수행
-
생성 태스크와 이해 태스크 간의 그래디언트 정렬도를 측정하여 학습 효율성 예측
-
데이터 규모 확장에 따른 생성-이해 간 전이 효과의 상관관계 검증