ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
과거의 RL 학습 데이터를 선별적 지도 학습(Selective Supervision)으로 재활용하여 추가 생성 비용 없이 모델 성능을 높이는 방법론
논문이 다루는 내용
LLM의 RL 학습 과정에서 생성된 과거의 롤아웃(Rollout) 데이터는 정책이 발전함에 따라 쓸모없는 데이터로 취급되어 버려지는 경우가 많습니다. 하지만 과거 데이터에는 현재 정책이 놓칠 수 있는 유용한 행동 패턴이 포함되어 있을 수 있습니다. 본 논문은 과거의 전체 궤적을 컨텍스트로 유지하되, 선택된 모델 생성 부분에만 손실(Loss)을 적용하는 ROSS 방식을 제안합니다. 실험 결과, ROSS는 수학, 코드 생성, 소프트웨어 엔지니어링 등 다양한 벤치마크에서 기존 베이스라인을 상회하는 성능 향상을 보였습니다. 이는 추가적인 롤아웃 생성 없이도 과거의 경험을 오프라인 SFT를 통해 효과적으로 재사용할 수 있음을 입증합니다.
핵심 결과
-
과거의 RL 롤아웃 데이터를 버리지 않고 재사용하는 효율적인 방법론 제안
-
전체 궤적을 컨텍스트로 활용하되, 선택적 감독(Selective Supervision)을 통해 오류와 중복을 방지
-
추가적인 온폴리시(On-policy) 데이터 생성 없이 오프라인 SFT만으로 성능 향상 달성
실무에서 볼 만한 점
모델 학습 시 발생하는 막대한 추론/생성 비용을 절감하면서, 이미 확보된 과거 데이터를 자산화하여 성능을 높일 수 있는 실무적인 전략을 제공합니다.
읽을 때 확인할 점
-
기존 RL 학습 로그를 활용하여 선별적 손실 함수(Selective Loss) 적용 실험
-
과거 데이터의 품질(정답 여부 등)에 따른 가중치 부여 실험
-
SFT와 RL 사이의 데이터 재사용 비율 최적화 테스트