논문Hugging Face
Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
논문 ID: 2607.2902511 추천
#Image Editing#Reinforcement Learning#MLLM#Computer Vision#Reasoning#Multimodal#Vision#Evaluation
핵심 요약
MLLM의 추론과 검증을 결합한 EVR 보상 모델을 통해 다중 참조 이미지 편집의 일관성과 조화로움을 개선함
상세 내용
최근 이미지 편집 모델의 발전에도 불구하고, 여러 참조 이미지를 유지하며 시각적 일관성을 확보하는 다중 참조 편집은 여전히 어려운 과제입니다. 기존의 MLLM 기반 평가 방식은 환각 현상과 논리적 추론 능력 사이의 불균형으로 인해 신뢰할 수 있는 보상 신호를 생성하기 어려웠습니다. 본 논문은 평가(Evaluation)와 검증(Verification)을 분리한 EVR(Evaluation-Verification Reward) 프레임워크를 제안합니다. EVR은 MLLM이 가설을 생성하면 Verifier가 시각적 근거를 바탕 이를 검증하여 정교한 보상 신호를 생성합니다. 이 방식을 통해 기존 모델의 구조 변경 없이 RL 미세 조정을 수행할 수 있는 확장 가능한 데이터 파이프라인을 구축했습니다. 실험 결과, 제안 방법은 기존 Qwen-Image-Edit 대비 일관성과 조화 측면에서 성능을 크게 향상시켰습니다.
주요 내용
- 평가(Evaluator)와 검증(Verifier)을 분리하여 MLLM의 환각 문제를 해결하고 보상 신호의 신뢰도 확보
- 다중 참조 이미지 간의 관계적 제약 조건을 캡처할 수 있는 정교한 보상 모델 설계
- 모델 구조 변경 없이 RL(강화학습)을 통해 기존 편집 모델을 미세 조정할 수 있는 확장성 제공
실무에서 볼 만한 점
모델 구조를 건드리지 않고도 RL과 정교한 보상 설계를 통해 이미지 편집 성능을 높이는 실용적인 방법론을 제시합니다.
참고할 행동
- 제안된 EVR 프레임워크를 기존 Stable Diffusion 기반 편집 모델에 적용하여 보상 신호 변화 관찰
- 단일 참조 대비 다중 참조 환경에서의 일관성 유지 성능 비교 실험
- MLLM의 추론 깊이에 따른 보상 값의 변동성 및 안정성 테스트