The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
RL로 인한 표현 변화 방향을 활용하여 학생 모델이 교사 모델을 능가하도록 만드는 효율적인 증류 기법
논문이 다루는 내용
On-policy distillation(OPD)은 학생 모델이 교사 모델의 분포를 따르도록 학습하여 성능을 높이지만, 출력 공간에서의 외삽(extrapolation)은 노이즈 증폭과 불안정한 학습 문제를 야기합니다. 연구진은 RL 학습이 모델의 내부 표현(representation)을 특정 방향으로 이동시킨다는 점에 주목했습니다. 이를 해결하기 위해 제안된 RIDE는 교사 모델과 사전 학습 체크포인트 사이의 잔차(residual)를 계산하여, 학생 모델의 은닉 상태를 이 방향으로 외삽합니다. 이 방식은 교사 모델을 기준으로 하되 RL로 유도된 방향성을 따라가도록 설계되어 학습 안정성을 확보합니다. 실험 결과, RIDE는 다양한 규모와 아키텍처에서 기존 출력 공간 외삽 방식보다 우수하며 교사 모델의 성능을 효과적으로 초과했습니다.
핵심 결과
-
RL로 인해 발생하는 모델 내부 표현의 방향성(direction)을 활용한 새로운 증류 방식 제안
-
출력(logit) 공간이 아닌 은닉 상태(representation) 공간에서 직접적인 외삽 수행
-
교사 모델의 성능을 유지하면서도 RL로 유도된 방향으로 학생 모델을 최적화
실무에서 볼 만한 점
모델 크기를 키우지 않고도 RL로 학습된 교사 모델의 성능을 학생 모델로 더 효과적으로 전이할 수 있는 방법론을 제시합니다.
읽을 때 확인할 점
-
기존 OPD 프레임워크에 RIDE의 잔차 계산 및 회귀 로직 적용 실험
-
모델 크기 변화에 따른 은닉 상태 잔차의 안정성 검증
-
RL 학습 전후의 레이어별 표현 변화량 측정 실험