AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
고정된 거대 모델(Executor)을 효율적으로 제어하기 위해, 피드백 차이를 이용해 유의미한 조언만 선별 학습하는 Advisor 최적화 기법
논문이 다루는 내용
거대 언어 모델(LLM)을 실행기(Executor)로 사용하고 작은 모델을 조언자(Advisor)로 사용하는 구조에서, 조언자는 피드백을 통해 성능을 개선할 수 있습니다. 그러나 모든 피드백을 학습에 반영할 경우, 실행 결과에 변화를 주지 않는 사소한 수정이 오히려 모델의 학습 효율을 저해할 수 있다는 점을 이론적으로 증명했습니다. 이를 해결하기 위해 제안된 AdviSD는 조언이 결과에 미친 영향력을 측정하여, 조언 유무에 따른 점수 차이가 큰 데이터만을 선별적으로 학습하는 자기 증류(Self-Distillation) 방식을 사용합니다. 이 방법은 추가적인 실행 롤아웃이나 실행기 확률값 없이도 효과적인 조언 학습을 가능하게 합니다. 실험 결과, AdviSD는 BFCL-v3 및 EnvScaler 벤치마크에서 기존 RL 방식보다 우수한 성능을 보였으며, 다른 모델 제품군으로의 전이 학습 능력도 입증되었습니다.
핵심 결과
-
피드백의 영향력을 기반으로 학습 데이터를 선별하는 AdviSD 알고리즘 제안
-
실행기(Executor)의 추가 롤아웃이나 확률값 없이 조언자(Advisor)만 학습 가능
-
선별적 자기 증류를 통해 학습 효율을 높이고 도메인 외 일반화 성능 확보
실무에서 볼 만한 점
적은 비용의 작은 모델로도 강력한 거대 모델을 효과적으로 제어할 수 있는 효율적인 에이전트 아키텍처 설계 방식을 제시합니다.
읽을 때 확인할 점
-
작은 모델(Advisor)과 큰 모델(Executor) 간의 협업 구조 설계 시 적용
-
피드백 데이터 중 학습에 유의미한 샘플을 선별하는 필터링 로직 실험
-
학습된 Advisor를 다른 모델 제품군(예: GPT-4 -> Claude)으로 이식하는 전이 성능 테스트