논문
Post-Training Leaves Behavioral Shadows on Unrelated Decisions
사후 학습은 특정 태스크 성능을 높이기 위해 수행되지만, 이 과정에서 발생하는 변화가 무관한 결정에 영향을 미치는 '행동 그림자(behavioral shadows)' 현상이 관찰됩니다. 기존의 잠재적 학습 연구는 주로 방대한 교사 모델의 출력을 활용하여 성향이나 선호도를 전이하는 데 집중해 왔습니다. 본 논문은 단 하나의 단어만을 사용하여 능력을 전이하는 Active Taskless Distillation(ATsD) 기법을 제안합니다. ATsD는 교사와 학생 모델이 공유하는 조상 모델이 두 단어 사이에서 거의 무차별적인 프롬프트를 선택하여 학습을 유도합니다. 실험 결과, 타겟 태스크 데이터 없이도 코딩(HumanEval+)을 포함한 과학적 지식, 상식 추론 등 다양한 영역에서 성능 향상을 달성했습니다. 이러한 학습된 능력은 결합 가능하며, 교사 모델의 업데이트 강도에 비례하여 나타납니다.