Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation
여러 전문 모델을 하나로 합칠 때 발생하는 피드백 불균형 문제를 해결하여, 특정 도메인(수학 등)의 성능 저하 없이 다중 전문 지식을 통합하는 기술
논문이 다루는 내용
강화학습을 통해 특정 분야에 특화된 여러 전문 모델(Specialists)을 만들 수 있지만, 이를 하나의 학생 모델로 통합하는 과정에서 성능 손실이 발생합니다. 기존의 다중 교사 온폴리시 증류(MOPD) 방식은 어떤 교사가 가르칠지는 결정하지만, 각 교사의 피드백이 학생에게 미치는 영향력을 조절하지 못합니다. 이로 인해 특정 도메인의 피드백이 지배적으로 작용하여 수학적 추론 능력 같은 특정 강점이 희석되는 문제가 발생합니다. 본 논문은 각 도메인 피드백의 분산(spread)을 측정하여 스케일을 조정하는 DN-MOPD 방식을 제안합니다. 실험 결과, DN-MOPD는 기존 MOPD 대비 모든 벤치마크에서 성능을 향상시켰으며 손실되었던 수학적 성능을 대부분 회복했습니다.
핵심 결과
-
MOPD 방식에서 발생하는 도메인 간 피드백 불균형 문제 식별
-
도메인별 피드백 분산(spread)을 기준으로 가중치를 재조정하는 DN-MOPD 제안
-
특정 도메인(지시 이행 등)의 과도한 피드백이 다른 전문 지식 습득을 방해하는 현상 해결
실무에서 볼 만한 점
여러 전문 모델(Coding, Math, Chat)을 하나의 범용 모델로 병합할 때, 특정 기능이 다른 기능을 압도하여 성능이 망가지는 문제를 방지할 수 있습니다.
읽을 때 확인할 점
-
기존 MOPD 프레임워크에 도메인별 피드백 스케일링 로직 적용 실험
-
학습 데이터셋의 도메인별 피드백 분산(variance) 측정 모듈 구현
-
다양한 도메인 조합에서 피드백 정규화 계수가 성능에 미치는 영향 분석