논문
Think Before You Score: Thinking Reward Model for Visual Generation
사례별 맞춤형 평가 기준(Rubric)을 먼저 생성하여 시각적 생성 모델의 평가 정밀도와 RL 최적화 성능을 높인 연구
논문이 다루는 내용
기존의 시각적 보상 모델은 작업 조건과 결과물을 직접 스칼라 값으로 매핑하여 무엇이 중요한지에 대한 명시적 판단이 부족했습니다. 본 논문은 평가 전 무엇이 중요한지 먼저 결정하는 'Think Before You Score' 패러다임을 제안합니다. 이를 위해 사례 맞춤형 루브릭을 생성하고 이를 기반으로 세밀한 점수를 산출하는 Thinking Reward Model(TRM)을 도입했습니다. 또한, 쌍체 비교 최적화 시 발생하는 점수 양극화 문제를 해결하기 위해 PD-GRPO 알고리즘을 제안했습니다. 실험 결과, TRM은 오픈 소스 모델 중 SOTA를 달성했으며 RL 피드백을 통해 생성 모델의 성능을 효과적으로 개선했습니다.
핵심 결과
-
사례별 맞춤형 루브릭(Case-adaptive Rubrics)을 통한 명시적 평가 기준 수립
-
점수 양극화 문제를 해결하고 정밀한 점수 산출을 가능케 하는 PD-GRPO 알고리즘 도입
-
RL(강화학습) 환경에서 효과적인 최적화 신호를 제공하는 세밀한 보상 모델링
실무에서 볼 만한 점
단순한 점수 부여를 넘어 '왜 이 점수가 나왔는지'에 대한 논리적 근거를 확보함으로써, 생성 모델의 품질을 더 정교하게 제어할 수 있습니다.
읽을 때 확인할 점
-
기존 스칼라 보상 모델과 TRM의 점수 분포 및 변별력 비교 실험
-
생성 모델의 RL 피드백 루프에 TRM을 적용하여 품질 향상 폭 측정
-
다양한 도메인(이미지 생성 vs 편집)에서의 루브릭 생성 적합성 검증