Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
다중 보상 RL 학습 시 발생하는 보상 간 불균형 문제를 밀도 기반 가중치 조절로 해결하여 학습 속도를 대폭 개선한 연구
논문이 다루는 내용
LLM이 여러 행동 목표를 동시에 달형하도록 하는 다중 보상 강화학습(Multi-reward RL)에서는 각 보상 간의 학습 진척도 차이가 발생하는 문제가 있습니다. 연구진은 보상의 'Advantage Energy'가 활성 그룹 밀도(Active-group density)에 비례한다는 점을 발견하여, 보상 간 불균형이 발생하는 원인을 규명했습니다. 이를 해결하기 위해 보상 기여도를 교정하는 Density-Aware Reward Aggregation(DARA) 기법을 제안합니다. DARA는 배치 단위로 밀도를 계산하여 빈도가 낮은 보상에 더 높은 가중치를 부여하는 역 제곱근 보정 방식을 사용합니다. 실험 결과, DARA는 기존 GDPO 대비 도구 호출 및 수학적 추론 작업에서 훨씬 적은 학습 단계만으로도 목표 성능에 도달하는 효율성을 보였습니다.
핵심 결과
-
보상 간 학습 불균형이 활성 그룹 밀도(Active-group density)와 관련이 있음을 이론적으로 규명
-
밀도 기반 역 제곱근 보정(Inverse-square-root density correction)을 통한 DARA 알고리즘 제안
-
정책 최적화 목적 함수를 수정하지 않고 배치 단위 가중치 조절만으로 학습 효율 극대화
실무에서 볼 만한 점
여러 가지 제약 조건(포맷 준수, 길이 제한 등)을 동시에 만족해야 하는 LLM RL 학습 시, 특정 보상이 지배하여 다른 보상이 무시되는 현상을 방지할 수 있습니다.
읽을 때 확인할 점
-
기존 GDPO/PPO 기반 다중 보상 학습 코드에 DARA 가중치 계산 로직 적용 테스트
-
보상 간 스케일 차이가 큰 데이터셋(예: 수학 문제 + 코드 생성)에서 성능 향상 검증
-
학습 단계별 보상 밀도 변화에 따른 가중치 수렴성 모니터링