논문Hugging Face
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
논문 ID: 2607.2920923 추천
#Reinforcement Learning#Knowledge Distillation#LLM Training#Optimization#RAG#Reasoning#Benchmark#Evaluation#Distillation
핵심 요약
RLVR과 OPD의 장점을 결합하면서도 학습 붕괴를 방지하는 안정적인 어드밴티지 융합 프레임워크(SAF) 제안
상세 내용
RLVR은 응답 단위의 보상을 제공하고, OPD는 토큰 단위의 밀집된 보상을 제공하여 서로 보완적인 관계에 있습니다. 그러나 두 방식을 고정 계수로 결합할 경우, 어드밴티지 크기 차이와 시간적 불일치로 인해 엔트로피 붕괴(Exploration 저하)가 발생하는 문제가 있습니다. 이를 해결하기 위해 제안된 SAF 프레임워크는 OPD 어드밴티지에 대해 '희소화 후 압축(Sparsify-then-compress)'과 '웜업 후 어닐링(Warm-up-then-anneal)'이라는 4단계 파이프라인을 적용합니다. 실험 결과, SAF는 기존 GRPO+OPD 방식보다 안정적인 학습을 유지하며 수학 및 코드 생성 벤치마크에서 성능 향상을 달성했습니다.
주요 내용
- RLVR(응답 단위)과 OPD(토큰 단위) 결합 시 발생하는 크기 및 시간적 미스매치 해결
- Sparsify-then-compress(크기 제어) 및 Warm-up-then-anneal(탐색 유지) 메커니즘 도입
- 고정 계수 방식 대비 엔트로피 붕괴를 방지하며 모델 성능을 안정적으로 향상
실무에서 볼 만한 점
강력한 교사 모델을 활용한 지식 증류(Distillation)와 강화학습(RL)을 결합할 때 발생하는 학습 불안정성을 해결하는 실전적인 방법론을 제시합니다.
참고할 행동
- 기존 GRPO 기반 RL 학습 시 OPD를 결합하여 엔트로피 붕괴 여부 모니터링하기
- 제안된 4단계 파이프라인(Sparsify/Compress/Warm-up/Anneal)을 현재 학습 스케줄에 적용해보기
- 학습 단계별로 OPD 어드밴티지의 비중을 동적으로 조절하는 실험 수행하기