A Zeroth-Order Paradigm for LLM Preference Alignment
기존의 미분 가능한 손실 함수 대신 비교 오라클을 활용하여 LLM의 선호도 정렬 효율을 높이는 새로운 제로차(Zeroth-order) 최적화 기법 제안
논문이 다루는 내용
LLM의 선호도 정렬을 위해 직접 선호도 최적화(DPO 등) 방식이 널리 쓰이지만, 확률 차이가 작은 데이터에서 발생하는 likelihood displacement 문제가 발생합니다. 본 논문은 비교 오라클을 기반으로 방향성 정보를 추출하는 ComPO(Comparison-based Preference Optimization)를 제안합니다. ComPO는 미분 가능한 손실 함수를 직접 최적화하는 대신 비교 결과로부터 정보를 추출하는 제로차 방식을 취합니다. 오프라인 및 온라인 스킴에 대한 수렴성 및 성능 보장을 이론적으로 입증하였으며, 실험을 통해 기존 방식보다 우수한 성능을 확인했습니다. 특히 모델의 길이 편향을 제어하면서도 높은 승률을 달성하는 데 성공했습니다.
핵심 결과
-
미분 가능한 손실 함수에 의존하지 않는 제로차(Zeroth-order) 방식의 ComPO 제안
-
Likelihood displacement 문제를 완화하여 데이터 간 미세한 확률 차이를 효과적으로 활용
-
오프라인 및 온라인(KL-divergence 제어 포함) 환경에서의 이론적 수렴성 및 성능 보장 확보
실무에서 볼 만한 점
DPO와 같은 기존 방식에서 나타나는 모델의 길이 편향이나 특정 패턴에 대한 과적합 문제를 해결할 수 있는 대안적 정렬 프레임워크를 제공합니다.
읽을 때 확인할 점
-
DPO/PPO와 ComPO의 결과물을 비교하여 모델의 응답 길이(Length) 편향 차이 측정
-
제공된 오라클(Comparison Oracle) 환경을 구축하여 소규모 모델에서의 정렬 성능 테스트
-
데이터셋의 Likelihood margin이 작은 경우 ComPO의 강점 검증