Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence
잠재적 추론 과정에서 시각적 근거를 명확히 학습하도록 유도하여 MLLM의 시각적 추론 능력을 극대화하는 프레임워크 제안
논문이 다루는 내용
최근 MLLM은 텍스트 대신 연속적인 잠재 토큰을 활용하는 잠재적 시각 추론(LVR)을 통해 효율적인 중간 연산을 수행합니다. 그러나 잠재 토큰은 직접 관찰이 불가능하여 어떤 시각적 근거를 학습하는지 감독하기 어렵다는 문제가 있습니다. 연구진은 최종 정답 보상만으로는 잠재 토큰이 적절한 시각적 증거를 보존하거나 신용을 할당하는 데 한계가 있음을 발견했습니다. 이를 해결하기 위해 정답과 오답, 그리고 관련/불일치 시각 정보를 대조하여 잠재 궤적에 직접 감독을 부여하는 ReaLVR를 제안합니다. 실험 결과, ReaLVR는 다양한 모델 규모에서 기존 LVR 베이스라인을 상회하며 대규모 모델에서도 강력한 성능 향상을 입증했습니다.
핵심 결과
-
잠재 토큰이 시각적 변화에 약하게 반응하는 '잠재 증거-신용 격차(latent evidence-credit gap)' 현상 규명
-
정답/오답 및 관련/불일치 시각 정보를 대조하여 잠재 궤적에 직접 감독을 수행하는 ReaLVR 프레임워크 제안
-
최대 235B 규모의 프론티어 모델까지 확장 가능한 강력한 시각적 추론 스케일링 능력 입증
실무에서 볼 만한 점
텍스트 CoT를 넘어 모델 내부의 잠재 공간(Latent Space)에서 시각적 근거를 정교하게 제어하는 최신 추론 기법을 제시합니다.
읽을 때 확인할 점
-
Qwen2.5-VL 등 최신 VLM 모델에 ReaLVR의 대조 학습 로직 적용 실험
-
GRPO와 같은 강화학습 환경에서 시각적 증거 보존을 위한 보상 함수 설계 테스트
-
잠재 토큰의 어텐션 맵과 실제 시각적 객체 간의 정렬도 측정