Decompose Radicals, Then Reward: Fine-Grained Inspection for Accurate Chinese Text Rendering
부수(Radical) 단위의 세밀한 검증을 통해 텍스트-이미지 생성 모델의 중국어 렌더링 정확도를 높이는 방법론
논문이 다루는 내용
기존의 OCR 기반 강화학습은 중국어 글자를 하나의 원자적 단위로 취급하여 글자 내부 구조의 오류를 잡아내지 못하는 한계가 있었습니다. 본 논문은 글자의 구성 요소를 공간적 관계로 표현하는 IDS(Ideographic Description Sequences)를 활용합니다. 먼저 전문가급 IDS 인식기를 학습시킨 후, 이를 기반으로 타겟 기호와 생성된 이미지를 부수 단위로 정밀하게 비교하는 IDSpect를 제안합니다. 이 방식은 글자 내부의 구조적 일치 여부를 세밀하게 평가하면서도 생성 모델의 추론 비용을 증가시키지 않습니다. 실험 결과, Qwen-Image의 GRPO 사후 학습을 통해 구조적 품질과 의미적 정렬 성능을 크게 향상시켰습니다.
핵심 결과
-
글자를 원자적 단위가 아닌 부수(Radical)와 공간 관계로 분해하여 평가하는 IDSpect 제안
-
IDS(Ideographic Description Sequences)를 활용한 세밀한 구조적 피드백 제공
-
생성 모델의 추론 비용 증가 없이 강화학습(GRPO)을 통한 렌더링 품질 개선
실무에서 볼 만한 점
텍스트 생성 능력이 중요한 멀티모달 모델 개발 시, 단순 OCR 점수가 아닌 글자 구조의 정밀도를 높이는 학습 전략을 제공합니다.
읽을 때 확인할 점
-
IDS 기반의 데이터셋을 구축하여 기존 OCR 보상 체계와 성능 비교 실험 수행
-
GRPO와 같은 강화학습 프레임워크에 부수 단위 보상 함수 적용 테스트
-
한자 외에 구조적 복잡도가 높은 다른 언어(예: 일본어 등)로의 확장 가능성 검토