Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?
에이전트가 외부 가이드라인의 신뢰도에 따라 유연하게 의존도를 조절하는 '선택적 신뢰' 역량을 강화하는 방법론 연구
논문이 다루는 내용
에이전트 워크플로우는 모델 성능을 높이지만, 잘못된 가이드가 모델의 능력을 제약하는 문제가 발생할 수 있습니다. 본 논문은 유용한 가이드는 따르되 잘못된 가이드는 무시하는 'Thinking Outside the Box' 능력을 정의합니다. 이를 측정하기 위해 워크플로우 신뢰도를 변수로 두는 Box^2-Bench를 제안합니다. 실험 결과, 최신 모델들은 신뢰할 수 있는 가이드에는 반응하지만 오정보에는 취약함을 보였습니다. 이를 해결하기 위해 반사실적 SFT와 결과 기반 RL을 통해 모델의 선택적 신뢰 능력을 학습시켰습니다. 결과적으로 모델은 외부 정보의 신뢰도에 따라 의존도를 조절하는 능력을 갖추게 되었습니다.
핵심 결과
-
Box^2-Bench: 워크플로우 신뢰도 변화에 따른 모델의 의존도 조절 능력을 측정하는 벤치마크 제안
-
선택적 신뢰(Selective Reliance): 유용한 가이드는 수용하고 잘못된 가이드는 거부하는 에이전트의 핵심 역량 정의
-
학습 전략: Counterfactual SFT와 Outcome-based RL을 통해 외부 정보의 신뢰도에 따른 유연한 대응 학습
실무에서 볼 만한 점
에이전트 시스템 구축 시 외부 API나 워크플로우가 오작동하더라도 모델이 스스로 판단하여 오류를 방지하는 강건한 시스템 설계의 근거를 제공합니다.
읽을 때 확인할 점
-
에이전트 워크플로우에 의도적으로 잘못된 가이드를 주입하여 모델의 취약점 테스트
-
SFT 단계에서 잘못된 가이드와 올바른 가이드를 대조하는 데이터셋 구성 실험
-
RL을 통해 결과(Outcome)에 따라 가이드 수용 여부를 결정하는 보상 체계 설계