FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
가변 해상도 기술을 통해 토큰 효율성과 텍스트 가독성 사이의 트레이드오프를 해결한 고성능 시각적 텍스트 압축 기술
논문이 다루는 내용
LLM의 긴 컨텍스트 추론은 막대한 계산 비용을 발생시키며, 이를 해결하기 위한 시각적 텍스트 압축(VTC)은 해상도 설정에 따라 성능과 토큰 소모량 사이의 상충 관계가 발생합니다. 본 논문은 저해상도 글로벌 뷰와 선택적 영역 강화 기술을 결합한 FocusVTC를 제안합니다. 이를 위해 추론 과정과 위치 정보를 연결하는 29.4K의 REL-CoT 데이터셋을 구축하고, 멀티 해상도 SFT와 GRPO를 통해 모델이 필요한 영역만 선택적으로 강화하도록 학습시켰습니다. 실험 결과, FocusVTC는 기존 방식 대비 높은 압축률에서도 우수한 가독성과 추론 성능을 보였으며, 일반적인 멀티모달 능력 또한 유지했습니다. 또한, 추론 속도와 효율성을 동시에 확보하며 기존 텍스트 입력 방식보다 뛰어난 성능을 입증했습니다.
핵심 결과
-
저해상도 전체 뷰와 선택적 고해상도 영역 강화를 결합한 적응형 해상도 메커니즘 도입
-
추론 경로와 위치 정보를 연결하는 29.4K 규모의 REL-CoT 데이터셋 구축
-
GRPO를 활용하여 별도의 사전 학습 없이도 해상도 강화 시점과 방법을 학습하는 효율적 최적화
실무에서 볼 만한 점
문서 분석이나 UI 에이전트 개발 시, 토큰 비용을 획기적으로 줄이면서도 중요한 텍스트 정보를 놓치지 않는 효율적인 시각적 RAG/Agent 구현이 가능해집니다.
읽을 때 확인할 점
-
제공된 REL-CoT 데이터셋 형식을 활용하여 기존 멀티모달 모델의 로컬라이제이션 성능 테스트
-
다양한 DPI 설정 환경에서 모델의 가독성 유지 및 토큰 절감 효율성 벤치마킹
-
에이전트 워크플로우에 적응형 해상도 강화 로직을 통합하여 엔드투엔드 지연 시간 측정