논문Hugging Face
Enhancing Rubric-based RL via Self-Distillation
논문 ID: 2607.1808215 추천
#LLM#Reinforcement Learning#Self-Distillation#Optimization#RAG#Benchmark#Evaluation#Inference#Distillation
핵심 요약
Self-distillation을 통해 루브릭 기반 RL의 탐색 부족과 보상 집계 문제를 해결하여 학습 효율과 성능을 동시에 높인 방법론
상세 내용
최근 LLM의 오픈 엔드 작업 성능 향상을 위해 루브릭 기반 RL이 주목받고 있으나, 미충족 기준(UC)에 대한 탐색 부족과 보상 집계 과정에서 유효한 신호가 사라지는 억제된 기준(SC) 문제가 존재합니다. 기존 방식은 외부 가이드를 사용하여 학습-추론 간 불일치를 유발하거나, 특정 기준이 충족되었음에도 스칼라 보상에 의해 학습 신호가 소실되는 문제를 해결하지 못했습니다. 이를 해결하기 위해 제안된 CriPO는 온폴리시 자기 증류(Self-distillation) 방식을 사용합니다. UC 문제를 위해 크리테리온 주입 교사 모델을 구축하고 국소적 KL 손실을 적용하며, SC 문제를 위해 반사실적 교사 모델로 토큰 단위 이득을 조정합니다. 실험 결과, CriPO는 기존 방식보다 훨씬 적은 최적화 단계만으로도 더 높은 성능을 달성했습니다.
주요 내용
- UC(미충족 기준)와 SC(억제된 기준)라는 두 가지 핵심 실패 모드 식별 및 해결
- 학습-추론 불일치 없이 온폴리시 자기 증류를 활용하는 CriPO 프레임워크 제안
- 토큰 수준의 이득 조정을 통해 유효한 학습 신호가 소실되는 것을 방지
실무에서 볼 만한 점
복잡한 다중 기준(Multi-criteria)을 가진 RL 환경에서 보상 설계 시 발생하는 정보 손실 문제를 해결하는 실전적인 접근법을 제시합니다.
참고할 행동
- 다중 제약 조건이 있는 복잡한 태스크에서 기존 RL과 CriPO의 수렴 속도 비교 실험
- 스칼라 보상 집계 방식이 모델의 특정 능력을 억제하는지 확인하기 위한 ablation study
- 제안된 토큰 단위 이득 조정(Advantage flipping) 로직의 안정성 테스트