Sharpening Tax in Post-Training
RL 포스트 트레이닝이 모델의 해결 범위를 좁히고 특정 정답에만 집중하게 만드는 'Sharpening Tax' 현상을 규명하고 이를 완화하는 샘플링 기법을 제안함
논문이 다루는 내용
최근 LLM의 RL 포스트 트레이닝이 기존 능력을 정교화할 뿐, 해결 가능한 문제의 범위를 좁힌다는 가설이 제기되었습니다. 연구진은 에이전트 작업에서 포스트 트레이닝된 모델이 단일 정답률(pass@1)은 높지만, 다양한 해결책을 찾는 능력(pass@K)은 오히려 저하됨을 발견했습니다. 이를 측정하기 위해 테스트 시간 확장성 손실을 정량화하는 'Sharpening Tax' 지표를 제안했습니다. 또한, 프롬프트 난이도에 따라 온도를 조절하는 Bayesian 샘플러인 PTGS를 도입했습니다. 실험 결과, PTGS는 기존 고정 온도 방식보다 낮은 세금을 지불하며 더 넓은 문제 해결 범위를 확보했습니다.
핵심 결과
-
RL 포스트 트레이닝이 정답의 일관성은 높이지만 해결 가능한 솔루션 커버리지를 희생시키는 'Sharpening Tax' 현상 발견
-
에이전트 작업에서 포스트 트레인 모델이 베이스 모델보다 낮은 pass@K를 보이는 현상 분석
-
난이도에 따라 샘플링 온도를 적응적으로 조절하는 PTGS(Posterior-tempered Group Sampling) 제안
실무에서 볼 만한 점
모델의 성능 지표(pass@1)만 보고 최적화할 경우, 에이전트처럼 다양한 경로를 탐색해야 하는 작업에서 모델의 유연성이 급격히 떨어질 수 있음을 경고합니다.
읽을 때 확인할 점
-
모델 RL 학습 전후의 pass@1과 pass@K 비율 변화를 비교하여 'Sharpening Tax' 측정하기
-
에이전트 환경에서 고정 온도(Fixed Temperature) 대신 난이도 기반 가변 온도 적용 실험하기
-
학습된 모델이 특정 정답에만 매몰되지 않는지 다양한 샘플링 예산(Test-time budget) 하에서 검증하기