Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD
Direct-OPD의 불필요한 토큰 학습을 방지하기 위해 변화량이 큰 상태만 선택적으로 학습하는 효율적인 지식 증류 기법
논문이 다루는 내용
Direct-OPD는 RL 이후의 정책 변화를 토큰 단위 로그 비율로 계산하여 학생 모델에 전달하는 방식입니다. 그러나 이 방식은 확률 질량이 사라지는 상황에서도 로그 비율이 유지되어, 실제 정책 변화가 없는 상태에서도 불필요한 학습을 유도하는 문제가 있습니다. 연구진은 JSD(Jensen-Shannon Divergence)가 낮은 상태는 교사의 행동 변화가 적다는 점에 착안하여, 변화량이 큰 상위 10% 상태만 학습하는 S^2D-OPD를 제안합니다. 실험 결과, AIME 및 HMMT 벤치마크에서 추가 연산 없이도 기존 방식보다 우수한 성능을 보였습니다. 이는 모델 크기에 관계없이 효과적인 정책 전이가 가능함을 입증합니다.
핵심 결과
-
Direct-OPD의 로그 비율이 확률 질량이 낮은 상태에서도 잘못된 신호를 줄 수 있는 수학적 취약점 발견
-
JSD를 기준으로 변화량이 큰 상위 10% 상태만 선택적으로 학습하는 S^2D-OPD 제안
-
추가적인 포워드 패스(Forward Pass) 없이도 수학적 추론 성능(AIME, HMMT) 향상
실무에서 볼 만한 점
모델 크기를 키우는 대신, RL로 얻은 지식을 학생 모델에 주입할 때 어떤 데이터가 '진짜 유용한 변화'인지 선별하는 효율적인 전략을 제공합니다.
읽을 때 확인할 점
-
기존 Direct-OPD 학습 루프에 JSD 기반 마스킹 로직 적용 실험
-
학습 데이터의 상위 % 임계값(Threshold) 변화에 따른 성능 민감도 테스트
-
수학적 추론 외에 일반적인 대화형 모델에서의 성능 전이 효과 검증