It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them
VLM 평가 시 이미지가 내용과 무관하더라도 모델의 판단을 불안정하게 만드는 현상을 규명함
논문이 다루는 내용
최근 VLM이 인간 주석가를 대체하는 용도로 사용되면서, 평가 조건이 모델의 성능을 왜곡할 위험이 커졌습니다. 연구진은 문장의 의미가 이미지와 일치하거나, 반대되거나, 혹은 이미지가 없는 상황을 설계한 MIST(Misleading-Image Stress Test)를 제안했습니다. 실험 결과, 이미지가 일치하든 오도하든 상관없이 이미지가 존재한다는 사실 자체가 모델의 판단을 변화시키는 현상이 관찰되었습니다. 하지만 이러한 변화는 이미지의 내용(의미)을 따르기보다는 단순히 이미지의 존재에 반응하는 것이었습니다. 결과적으로 VLM을 평가할 때 이미지가 판단을 흔드는 '노이즈'로 작용하여 평가의 신뢰성을 저해할 수 있음을 보여줍니다.
핵심 결과
-
MIST(Misleading-Image Stress Test) 프레임워크를 통한 VLM 판단 안정성 테스트
-
이미지의 내용(의미)과 상관없이 이미지의 존재 자체가 모델의 레이블을 변화시킴
-
이미지가 판단을 유도하더라도, 그것이 반드시 이미지의 의미 방향으로 움직이지는 않음
실무에서 볼 만한 점
VLM을 평가 지표(Judge)로 사용할 때, 시각적 정보가 텍스트 판단을 왜곡하는 '간섭 효과'가 발생할 수 있음을 인지해야 합니다.
읽을 때 확인할 점
-
VLM 평가 시 텍스트 전용(No-image) 결과와 이미지 포함 결과의 일치도 비교
-
이미지 프롬프트가 모델의 판단을 무작위로 흔드는지 확인하는 스트레스 테스트 수행
-
시각적 정보가 텍스트의 논리적 판단을 방해하지 않는지 검증하는 벤치마크 구축