Persona Dosing: Calibrated Activation Steering for Graded Trait Control
사용자가 요청한 강도에 맞춰 모델의 페르소나를 정밀하게 조절하는 캘리브레이션 기반 활성화 스티어링 기법
논문이 다루는 내용
기존의 활성화 스티어링 방식은 개입 강도를 설정할 수 있지만, 특정 수준의 페르소나 표현을 요청하기 위한 행동 척도가 부족한 문제가 있었습니다. 본 논문은 트레이트 설명과 요청된 평균 강도를 통해 언어 모델을 제어하는 'PersonaDose'를 제안합니다. PersonaDose는 공유된 FLAS 컨트롤러를 페르소나 응답에 특화시킨 후, 측정된 트레이트 표현량에 맞춰 소식 시간(flow time)을 캘리브레이션합니다. 실험 결과, Llama-3.1, Qwen, Gemma 모델 모두에서 기존 대조적 활성화 방식보다 높은 핵심 트레이트 표현력을 달성했습니다. 또한, 캘리브레이션된 설정은 학습되지 않은 질문에서도 우수한 표현력을 유지하며 요청된 타겟 강도에 근접하는 결과를 보였습니다.
핵심 결과
-
트레이트 설명과 요청된 강도를 결합하여 페르소나를 제어하는 PersonaDose 프레임워크 제안
-
학습 데이터에 타겟 강도가 명시되지 않아도 캘리브레이션을 통해 정밀한 강도 조절 가능
-
기존 대조적 활성화 방식 대비 높은 트레이트 표현력 및 타겟팅 정확도 확보
실무에서 볼 만한 점
LLM의 성격이나 말투를 단순히 '강하게' 만드는 것을 넘어, 사용자 요구에 맞춰 정밀한 수치로 페르소나 강도를 조절할 수 있는 기술적 토대를 제공합니다.
읽을 때 확인할 점
-
제시된 FLAS 컨트롤러를 활용하여 특정 페르소나(예: 친절함, 전문성)의 강도 조절 실험
-
다양한 모델 크기(8B 이하)에서 캘리브레이션 설정이 일반화 성능에 미치는 영향 분석
-
특정 트레이트가 다른 트레이트와 충돌할 때의 캘리브레이션 안정성 테스트