DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
학생 모델의 정답 여부에 따라 교사 모델의 피드백 방식을 동적으로 조절하여 멀티태스크 성능을 극대화하는 온폴리시 증류 기법
논문이 다루는 내용
기존의 온폴리시 증류(OPD)는 학생 모델이 이미 정답을 맞힌 경우에도 교사 모델의 답변을 강제로 따르게 하여 성능을 저하시시키는 문제가 있었습니다. 또한 태스크마다 모델의 성공 확률이 다름에도 불구하고 일률적인 피드백 방식을 적용하는 한계가 있었습니다. 본 논문은 DuoOPD를 제안하여 학생의 정답 여부를 피드백 방향의 기준으로 삼고, 교사와 학생의 공동 결과에 따라 피드백 방식을 결정합니다. 교사만 성공했을 때는 정답을 컨텍스트로 활용하고, 학생만 성공했을 때는 가중치를 공유하여 정답을 강화하는 방식입니다. 실험 결과, DuoOPD는 Qwen과 Llama 모델군에서 기존 OPD 대비 유의미한 성능 향상을 보였으며 다양한 태스크 혼합 환경에서도 우수한 성능을 입증했습니다.
핵심 결과
-
학생의 정답 여부를 기준으로 피드백 방향을 설정하는 동적 가이딩 메커니즘 도입
-
교사-학생의 공동 결과(Joint Outcome)에 따른 4가지 시나리오 통합 규칙 설계
-
멀티태스크 환경에서 태스크별 성공률 차이를 극복하는 범용적 피드백 전략
실무에서 볼 만한 점
모델 크기가 작은 학생 모델을 특정 도메인이나 태스크에 맞춰 효율적으로 미세 조정(Fine-tuning)할 때, 교사 모델의 간섭을 최소화하며 성능을 끌어올릴 수 있습니다.
읽을 때 확인할 점
-
기존 OPD 프레임워크에 학생의 정답 여부를 판별하는 Gating 로직 구현
-
교사 모델의 정답이 학생의 오답을 교정하는 컨텍스트로 사용되는지 검증
-
다양한 난이도의 태스크 믹스 환경에서 성능 안정성 테스트