When Does Dense Retrieval Need Asymmetric Geometry? A Bias-Variance Theory of Shared and Dual Projections
데이터 규모와 쿼리 특성에 따라 공유(Shared) 또는 이중(Dual) 프로젝션 중 최적의 기하학적 구조를 선택하는 이론적 프레임워크와 알고리즘을 제안합니다.
논문이 다루는 내용
Dense Retrieval은 RAG와 검색 시스템의 핵심이지만, 쿼리와 문서 간의 투영 방식(Shared vs Dual)을 결정하는 이론적 근거가 부족했습니다. 본 논문은 저차원 쌍선형 스코어링(low-rank bilinear scoring)에 대한 편향-분산 이론을 도입하여 두 방식의 근사 오차 차이를 규명했습니다. 연구 결과, 데이터 규모가 커질수록 이중 프로젝션(Dual)이 유리해지는 임계 경계가 존재함을 증명했습니다. 이를 바탕으로 데이터 크기와 신호 강도에 따라 최적의 구조를 선택하는 CARS 알고리즘을 제안합니다. 실험 결과, CARS는 기존 방식 대비 낮은 리그렛(regret)을 달성하며 데이터 규모에 따른 최적 구조 선택에서 높은 정확도를 보였습니다.
핵심 결과
-
공유(Shared)와 이중(Dual) 프로젝션 간의 편향-분산 트레이드오프 이론 정립
-
데이터 크기(n)와 쿼리 회전(asymmetry)에 따른 최적 기하학적 구조의 변화 증명
-
데이터 규모에 따라 최적의 구조를 자동 선택하는 CARS 알고리즘 제안
실무에서 볼 만한 점
학습 데이터 규모가 작을 때는 파라미터 효율적인 Shared 방식을, 데이터가 충분히 클 때는 표현력이 높은 Dual 방식을 선택하는 것이 성능 최적화의 핵심임을 알려줍니다.
읽을 때 확인할 점
-
현재 사용 중인 임베딩 모델의 학습 데이터 규모에 따른 성능 변화 측정
-
데이터 규모를 늘릴 때 Shared에서 Dual로 전환하는 시점(Threshold) 실험
-
CARS 알고리즘을 기존 검색 파이프라인에 적용하여 선택 정확도 검증