Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
RLVR 학습 시 발생하는 데이터 부족 문제를 서로 다른 모델 간의 성공 궤적 교환을 통해 해결하는 프레임워크 제안
논문이 다루는 내용
RLVR(Reinforcement Learning with Verifiable Rewards) 방식은 성공적인 샘플링이 필수적이지만, 제한된 예산 내에서 모든 시도가 실패하는 'all-fail' 그룹이 발생하면 학습 신호가 사라지는 문제가 있습니다. 연구진은 서로 다른 모델들이 서로 보완적인 성공 궤적을 가질 수 있다는 점에 주목했습니다. 이를 위해 제안된 GRAFT 프레임워크는 실패한 그룹을 성공적인 피어(peer) 모델의 궤적으로 교체하는 오프-폴리시(off-policy) 기반 학습 방식을 사용합니다. 이 과정에서 시퀀스 호환성 가중치와 토큰 중요도 클리핑을 통해 모델 간 불일치 문제를 제어합니다. 실험 결과, GRAFT는 동일한 샘플링 예산 하에서 기존 GRPO 대비 수학적 추론 성능을 유의미하게 향상시켰습니다.
핵심 결과
-
GRAFT: 실패한 샘플 그룹을 성공적인 피어 모델의 궤적으로 교체하는 프레임워크 제안
-
이종 모델 간 상호 보완적 학습을 통해 데이터 부족 및 학습 신호 부재 문제 해결
-
시퀀스 수준의 호환성 가중치 및 토큰 수준의 중요도 클리핑을 통한 오프-폴리시 안정성 확보
실무에서 볼 만한 점
모델의 추론 성능을 높이기 위해 막대한 비용을 들여 추가 롤아웃을 하는 대신, 이미 확보된 다른 모델의 성공 데이터를 효율적으로 재사용할 수 있는 방법을 제시합니다.
읽을 때 확인할 점
-
동일한 태스크를 수행하는 서로 다른 크기/종류의 모델 쌍을 구성하여 성능 향상 폭 확인
-
GRAFT의 중요도 클리핑(Importance Ratio Clipping) 파라미터가 학습 안정성에 미치는 영향 테스트
-
저사양 모델이 고사양 모델의 성공 궤적을 학습할 때 발생하는 분포 차이(distribution shift) 분석