논문
BiasReducer: Adaptive Bias Mitigation for Reward Models
데이터 재학습 없이 보상 모델의 선형 헤드만 수정하여 답변 길이 및 확신도 편향을 제거하는 경량 프레임워크
논문이 다루는 내용
LLM 학습을 가이드하는 보상 모델(Reward Model)은 답변의 길이와 같은 표면적인 속성에 과도하게 점수를 주는 편향 문제를 가집니다. 기존 방식은 모델 전체를 재학습하거나 특정 편향을 미리 지정해야 하는 비용과 제약이 있었습니다. 본 논문은 Sparse Autoencoder(SAE) 스타일의 인코더를 사용하여 보상 모델이 민감하게 반응하는 속성을 학습하는 BiasReducer를 제안합니다. 이 프레임워크는 보상 헤드의 조정 방향과 강도를 결정하여 데이터셋에 맞는 최적의 편집을 수행합니다. 실험 결과, BiasReducer는 모델 재학습 없이도 편향에 대한 강건성을 높였으며, 답변의 불필요한 장황함과 아첨(sycophancy)을 줄이는 성과를 보였습니다.
핵심 결과
-
SAE 기반 인코더를 통한 보상 모델의 속성 민감도 학습
-
모델 전체 재학습 없이 선형 보상 헤드만 수정하는 경량 편집 방식
-
데이터셋별로 영향력이 큰 편향을 자동으로 식별하고 선택적 편집 수행
실무에서 볼 만한 점
RLHF 과정에서 발생하는 모델의 과도한 장황함이나 아첨 문제를 모델 전체를 다시 학습하지 않고도 효율적으로 제어할 수 있습니다.
읽을 때 확인할 점
-
기존 보상 모델의 헤드 파라미터에 BiasReducer 로직 적용 테스트
-
길이(length)와 품질(quality) 사이의 상관관계 변화 측정
-
다양한 데이터셋에 대한 편향 제거 성능 전이(transfer) 확인