논문
The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
On-policy distillation(OPD)은 학생 모델이 교사 모델의 분포를 따르도록 학습하여 성능을 높이지만, 출력 공간에서의 외삽(extrapolation)은 노이즈 증폭과 불안정한 학습 문제를 야기합니다. 연구진은 RL 학습이 모델의 내부 표현(representation)을 특정 방향으로 이동시킨다는 점에 주목했습니다. 이를 해결하기 위해 제안된 RIDE는 교사 모델과 사전 학습 체크포인트 사이의 잔차(residual)를 계산하여, 학생 모델의 은닉 상태를 이 방향으로 외삽합니다. 이 방식은 교사 모델을 기준으로 하되 RL로 유도된 방향성을 따라가도록 설계되어 학습 안정성을 확보합니다. 실험 결과, RIDE는 다양한 규모와 아키텍처에서 기존 출력 공간 외삽 방식보다 우수하며 교사 모델의 성능을 효과적으로 초과했습니다.