The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
장기 과제 수행 시 최적의 의사결정 능력을 측정하고 학습시키는 새로운 벤치마크와 방법론 제안
논문이 다루는 내용
LLM 에이전트가 복잡한 장기 과제를 수행할 때, 중간 단계의 의사결정 품질이 최종 성패를 결정하는 핵심 요소가 되고 있습니다. 기존 벤치마크는 최종 성공 여부만 측정할 뿐, 과정 중의 판단력(Taste)을 측정하지 못하는 한계가 있습니다. 이를 해결하기 위해 에이전트의 작업 궤적에서 의사결정 분기점을 자동 추출하여 판단력을 평가하는 'Taste-Bench'를 구축했습니다. 실험 결과, 최신 모델들도 의사결정 분기점에서 높은 정답률을 보이지 못했으며, 결과가 나중에 나타나는 분기점일수록 난이도가 높았습니다. 최종적으로 결과(Outcome)를 알고 있는 교사 모델의 판단을 학생 모델에 증류(Distillation)함으로써, 에이전트의 판단력과 최종 작업 성공률을 모두 향상시킬 수 있음을 입증했습니다.
핵심 결과
-
의사결정 품질을 측정하는 새로운 벤치마크 'Taste-Bench' 개발
-
결과를 모르는 상태에서 최적의 방향을 선택하는 에이전트의 '판단력(Taste)' 정의 및 평가
-
교사 모델의 판단을 학생 모델로 증류하여 의사결정 능력과 최종 성공률을 높이는 학습 방법 제안
실무에서 볼 만한 점
에이전트가 단순히 코드를 짜는 것을 넘어, 어떤 방향이 더 효율적인지 판단하는 '전략적 의사결정' 능력을 높이는 데 실질적인 가이드를 제공합니다.
읽을 때 확인할 점
-
에이전트 작업 로그에서 의사결정 분기점(Decision Fork)을 추출하는 파이프라인 구축
-
결과를 알고 있는 모델의 판단을 기반으로 에이전트의 중간 선택지를 정제하는 데이터셋 생성
-
현재 사용 중인 에이전트 모델에 'Taste' 관점의 평가 지표 도입