Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation
모델 파라미터의 국소적 변형을 활용해 더 풍부한 지도 신호를 생성하는 새로운 자기 증류(Self-Distillation) 기법
논문이 다루는 내용
수학적 추론 모델 학습을 위해 정답을 아는 교사 모델이 학생의 샘플링된 접두사를 지도하는 OPSD 방식이 기존에 사용되었습니다. 그러나 기존 방식은 고정된 파라미터 설정만을 사용하여 주변 파라미터가 제공할 수 있는 추가적인 지도 정보를 놓치는 문제가 있었습니다. 본 논문은 파라미터의 국소적 섭동(perturbation)을 통해 정답 맥락 내에서 서로 보완적인 교정 신호를 얻는 N-OPSD를 제안합니다. 오프라인에서 그리디 선택 방식으로 전문가 풀을 구축하고, 온라인 라우팅을 통해 학생의 상태에 가장 적합한 전문가를 선택하여 학습합니다. 실험 결과, AIME 등 고난도 수학 벤치마크에서 기존 OPSD 대비 유의미한 성능 향상을 달성했습니다.
핵심 결과
-
파라미터 섭동을 통해 정답 맥락 내에서 보완적인 교정 신호를 생성하는 N-OPSD 제안
-
그리디 선택과 온라인 라우팅(MaxPeak 및 Quantile selection)을 결합한 효율적인 전문가 풀 관리
-
AIME 등 수학적 추론 벤치마크에서 기존 OPSD 대비 성능 향상 입증
실무에서 볼 만한 점
모델의 파라미터를 미세하게 조정하는 것만으로도 학습에 유용한 새로운 '전문가'를 생성할 수 있음을 보여주어, 데이터 부족 상황에서의 효율적인 증류 전략을 제시합니다.
읽을 때 확인할 점
-
기존 OPSD 프레임워크에 파라미터 섭동 기반의 전문가 풀 생성 로직 적용해보기
-
수학적 추론 태스크에서 파라미터 변동 폭에 따른 성능 변화 관찰하기
-
제안된 MaxPeak 및 Quantile selection 라우팅 방식의 효율성 검증하기