Smaller Models, Better Rejects: Preference Distillation Scaling
더 작은 모델이 생성한 거절(Reject) 샘플이 학생 모델의 성능 향상에 더 효과적일 수 있음을 입증한 선호도 증류 기법 연구
논문이 다루는 내용
기존의 선호도 증류(Preference Distillation)는 학생 모델이 생성한 실패 사례를 거절 샘플로 사용하는 방식에 의존해 왔습니다. 하지만 이는 거절 샘플이 반드시 학생 모델만큼 커야 하거나, 자기 생성 실패가 가장 유용하다는 잘못된 가정을 전제로 합니다. 본 연구는 7B에서 72B 규모의 모델을 대상으로 실험하여, 더 작은 고정 모델(frozen models)이 생성한 거절 샘플이 오히려 더 강력한 학생 모델을 학습시킨다는 것을 발견했습니다. 이를 설명하기 위해 DPO의 유틸리티 경계(utility bound)를 이론적으로 도출하였으며, 거절 샘플의 분포와 태스크 구조의 중요성을 규명했습니다. 결과적으로 태스크 구조를 유지하면서 참조 정책(reference policy)과의 결합을 제한하는 것이 효과적인 거절 샘플의 핵심임을 보여주었습니다.
핵심 결과
-
학생 모델의 자기 생성 실패보다 더 작은 규모의 모델이 생성한 거절 샘플이 학습에 더 효과적임
-
DPO의 유틸리티 경계 분석을 통해 유용한 거절 샘플의 특성(태스크 구조 유지 및 낮은 likelihood 선택)을 규명
-
코드 생성 및 수학적 추론 태스크에서 저비용 고효율의 선호도 증류 가능성 확인
실무에서 볼 만한 점
모델 크기를 키우는 대신, 더 작은 모델을 활용해 효율적으로 고성능 학생 모델을 학습시키는 비용 절감 전략을 제공합니다.
읽을 때 확인할 점
-
학습 시 학생 모델의 생성물 대신 더 작은 모델의 결과물을 거절 샘플로 섞어서 실험해보기
-
거절 샘플 선택 시 참조 정책(reference policy)의 likelihood가 낮은 후보를 선택하는 전략 적용해보기
-
태스크 구조(코드/수학 등)를 유지하는 범위 내에서 거절 샘플의 변형 실험하기