Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces
이산적 토큰화 없이 언어와 이미지를 연속적 임베딩 공간에서 통합 모델링하는 새로운 생성 패러다임 제시
논문이 다루는 내용
기존의 멀티모달 모델은 이미지를 이산적 토큰으로 양자화하거나, 언어는 이산적이고 이미지는 연속적인 방식으로 처리하여 성능 병목과 복잡한 샘플링 문제를 겪었습니다. 이를 해결하기 위해 본 논문은 언어와 시각 정보를 모두 연속적 표현으로 다루는 'Multimodal Flow'를 제안합니다. 이 모델은 텍al 블록과 이미지를 순서 있는 연속적 하이퍼청크(hyperchunks)로 구성하고, Flow Matching을 통해 단일 벡터 필드를 학습하는 통합 아키텍처를 사용합니다. 실험 결과, 적은 데이터(150B 토큰)로도 기존의 하이브리드 및 이산 모델보다 우수한 성능을 보이며 효율적인 멀티모달 학습 가능성을 입증했습니다.
핵심 결과
-
이산적 양자화 병목을 제거한 완전 연속적(Fully Continuous) 생성 모델링
-
텍스트와 이미지를 순서 있는 하이퍼청크로 관리하는 통합 Flow Matching 아키텍처
-
모달리티별 FFN과 공동 어텐션을 결합하여 상호작용과 개별 특성을 동시에 확보
실무에서 볼 만한 점
이미지 양자화 손실 없이 텍스트와 이미지를 동일한 벡터 공간에서 다룰 수 있어, 더 정교한 멀티모달 생성 및 이해 작업이 가능해집니다.
읽을 때 확인할 점
-
제시된 하이퍼청크 기반의 연속적 임베딩 구조를 기존 VQ-VAE/Diffusion 구조와 비교 실험
-
Flow Matching 기반의 생성 속도와 샘플링 품질 간의 트레이드오프 분석
-
특정 도메인 데이터셋에 대한 하이퍼청크 크기(chunk size) 최적화 실험