논문
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
기존에는 On-policy 학습이 파라미터 업데이트의 희소성을 높이고 일반화 성능을 개선한다고 알려져 왔으나, 기존 연구들은 여러 변수가 혼재되어 있어 Rollout policy의 순수 효과를 분리하기 어려웠습니다. 본 연구는 강력한 교사 모델에서 약한 학생 모델로의 증류(Distillation) 환경에서 Rollout policy, KL 방향, 학습률을 독립적으로 변화시키며 그 영향을 분석했습니다. 실험 결과, Rollout policy 자체보다는 토큰 수준의 KL 방향이 성능과 출력 범위를 결정하며, 학습률이 망각과 업데이트 희소성을 조절하는 핵심 요소임을 발견했습니다. 특히 Forward KL는 Rollout policy 변화에 강건한 반면, Reverse KL은 학생 모델의 생성 데이터(On-policy)에 더 민감하게 반응했습니다. 결론적으로 On-policy 학습의 이점은 목적 함수와 하이퍼파라미터 설정에 따라 달라질 수 있음을 보여줍니다.