논문
The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
LLM 에이전트가 복잡한 장기 과제를 수행할 때, 중간 단계의 의사결정 품질이 최종 성패를 결정하는 핵심 요소가 되고 있습니다. 기존 벤치마크는 최종 성공 여부만 측정할 뿐, 과정 중의 판단력(Taste)을 측정하지 못하는 한계가 있습니다. 이를 해결하기 위해 에이전트의 작업 궤적에서 의사결정 분기점을 자동 추출하여 판단력을 평가하는 'Taste-Bench'를 구축했습니다. 실험 결과, 최신 모델들도 의사결정 분기점에서 높은 정답률을 보이지 못했으며, 결과가 나중에 나타나는 분기점일수록 난이도가 높았습니다. 최종적으로 결과(Outcome)를 알고 있는 교사 모델의 판단을 학생 모델에 증류(Distillation)함으로써, 에이전트의 판단력과 최종 작업 성공률을 모두 향상시킬 수 있음을 입증했습니다.