논문Hugging Face
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
논문 ID: 2608.0357330 추천
#LLM#Multi-Task Learning#Reinforcement Learning#Optimization#RAG#Reasoning
핵심 요약
SFT의 태스크 간 간섭 문제를 RL의 직교적 업데이트 특성을 이용해 해결하는 새로운 멀티태스크 학습 패러다임 제시
상세 내용
LLM의 멀티태스크 추론 능력 향상을 위해 SFT와 RL은 서로 다른 동작 양상을 보입니다. 기존 SFT 방식은 다중 태스크 학습 시 심각한 태스크 간 충돌(Conflict)이 발생하는 문제가 있었습니다. 연구진은 RL이 파라미터 수준에서 희소하고 직교에 가까운 업데이트를 유도하여 태스크 간 공존을 가능케 함을 발견했습니다. 이론적 분석 결과, SFT의 간섭은 그래디언트 크기에 비례하는 반면, RL은 어드밴티지 정규화로 인해 분산에 의해 제어되는 특성을 가집니다. 이를 바탕으로 태스크 학습을 분리하여 효율성을 높이는 Parallel-RL 패러다임을 제안합니다.
주요 내용
- SFT는 태스크 간 간섭이 크지만, RL은 태스크 간 직교적 업데이트를 통해 안정적인 공존이 가능함
- SFT의 간섭은 그래디언트 노름(Norm)에 의존하는 반면, RL은 어드밴티지 정규화로 인해 분산(Variance)에 의해 제어됨
- 분석된 이론을 바탕으로 효율적인 멀티태스크 학습을 위한 Parallel-RL 프레임워크 제안
실무에서 볼 만한 점
여러 태스크를 동시에 학습시킬 때 발생하는 성능 저하 문제를 RL의 특성을 이용해 해결할 수 있는 이론적 근거를 제공합니다.
참고할 행동
- SFT와 RL을 혼합하여 학습할 때 태스크 간 성능 변화를 비교 실험
- 어드밴티지 정규화 강도에 따른 그래디언트 직교성 변화 측정
- 제안된 Parallel-RL 프레임워크를 기존 멀티태스크 SFT 파이프라인에 적용