논문Hugging Face
Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
논문 ID: 2607.278882 추천
#LLM#Reinforcement Learning#Reasoning#Optimization#Vision#Benchmark#Distillation
핵심 요약
GRPO의 일괄적인 토큰 보상 할당 문제를 해결하기 위해, 정답에 민감하기만 한 토큰의 비중을 조절하는 CSCR 기법 제안
상세 내용
최근 LLM의 긴 추론(long-CoT) 성능 향상을 위해 GRPO와 같은 보상 기반 강화학습이 널리 사용되고 있습니다. 그러나 기존 방식은 응답 단위의 보상을 모든 토큰에 동일하게 배분하여, 정답에 결정적인 기여를 하는 토큰과 단순 표면적 토큰을 구분하지 못하는 문제가 있습니다. 본 논문은 특정 토큰이 정답 여부에 따라 과도하게 민감하게 반응하는 현상을 분석하여, 이러한 '반사실적 민감도'가 실제 추론 능력 향상과는 무관할 수 있음을 밝힙습니다. 이를 해결하기 위해 제안된 CSCR은 민감도가 높은 토큰의 크레딧을 줄이고 보상을 재정규화하여 최적화 신호의 신뢰도를 높입니다. 실험 결과, CSCR은 동일한 업데이트 횟수에서 GRPO보다 우수한 수학적 추론 성능을 보였습니다.
주요 내용
- GRPO의 토큰별 일괄 보상 할당 방식이 가진 비효율성 규명
- 정답 여부에 따라 과도하게 변동하는 '반사실적 민감도' 토큰의 문제점 식별
- 민감도 기반 크레딧 재할당(CSCR)을 통한 효율적인 토큰 레벨 최적화
실무에서 볼 만한 점
LLM의 추론 성능 향상을 위해 RL을 적용할 때, 단순히 보상을 배분하는 것을 넘어 토큰별 기여도를 정교하게 제어하는 것이 중요함을 시사합니다.
참고할 행동
- GRPO 학습 시 토큰별 보상 분산(variance)과 정답 기여도 간의 상관관계 분석
- 학습 과정에서 특정 토큰(예: 수식, 문장 부호)에 보상이 쏠리는 현상 모니터링
- 제안된 CSCR 로직을 기존 RLVR 파이프라인에 적용하여 성능 비교