논문Hugging Face
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
논문 ID: 2607.2565973 추천
#RLHF#GRPO#LLM Training#Credit Assignment#RAG#Evaluation
핵심 요약
루브릭 기반 보상(Reward)을 토큰 단위로 정교하게 배분하여 GRPO의 학습 효율을 높이는 카운터팩추얼 리플레이 기법
상세 내용
루브릭 기반 강화학습은 명시적 기준에 따라 모델 출력을 평가하지만, 기존 GRPO 방식은 응답 전체에 단일 스칼라 보상을 부여하여 토큰별 기여도 차이를 반영하지 못합니다. 이로 인해 특정 기준이 특정 문구에만 해당하더라도 모든 토큰이 동일한 보상을 받는 문제가 발생합니다. 본 논문은 CoRT를 제안하여, 동일한 응답에 대해 루브릭이 있는 프롬프트와 없는 프롬프트를 대조하는 카운터팩추얼 리플레이 방식을 사용합니다. 이를 통해 얻은 토큰별 로그 우도 차이를 가중치로 변환하여 GRPO의 어드밴티지를 토큰 단위로 재분배합니다. 실험 결과, CoRT는 별도의 보상 모델 학습 없이도 기존 GRPO 대비 평균 4.4%p의 성능 향상을 달성했습니다.
주요 내용
- 카운터팩추얼 리플레이를 통한 토큰 단위 크레딧 할당(Credit Assignment) 메커니즘 제안
- 별도의 보상 모델(Auxiliary Scorer) 학습 없이 정책 내부의 로그 우도 차이만 활용
- 응답 수준의 보상을 토큰 수준의 가중치로 변환하여 GRPO의 안정성과 정교함 동시 확보
실무에서 볼 만한 점
모델이 특정 지시사항(Rubric)을 따를 때 어떤 토큰이 결정적인 역할을 했는지 수학적으로 분리하여 학습 효율을 극대화할 수 있습니다.
참고할 행동
- 기존 GRPO 파이프라인에 CoRT의 가중치 재분배 로직 적용 테스트
- 루브릭의 복잡도(포맷팅 vs 의미적 내용)에 따른 가중치 분포 변화 분석
- 데이터셋의 문장 길이에 따른 크레딧 분산 효과 검증