ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization
에이전트의 프롬프트와 도구 인터페이스를 최적화할 때, 학습 시나리오를 동적으로 변화시켜 최적화 효율을 극대화하는 커리큘럼 학습 프레임워크입니다.
논문이 다루는 내용
LLM 에이전트의 성능을 높이기 위해 프롬프트와 제어 로직을 업데이트하는 하네스 최적화 연구가 활발히 진행되고 있습니다. 그러나 기존 방식은 고정된 시나리오를 사용하여 에이전트가 진화함에 따라 변화하는 학습 요구사항을 반영하지 못하는 한계가 있습니다. 본 논문은 하네스 최적화 과정에서 학습 시나리오를 동적으로 구성하는 커리큘럼 학습 문제를 제안하며, 이를 위해 ActiveSaddler를 도입합니다. ActiveSaddler는 실패 패턴을 재사용 가능한 옵션으로 추상화하고, 각 패턴의 학습 잠재력을 추정하여 탐색과 활용 사이의 균형을 맞춥니다. 실험 결과, GAIA2 및 Terminal-Bench 2.0에서 고정된 시나리오 방식보다 Pass@1 성능을 유의미하게 향상시켰습니다.
핵심 결과
-
하네스 최적화와 시나리오 구성을 결합한 동적 커리큘럼 학습 프레임워크 제안
-
실패 패턴을 추상화하여 재사용 가능한 밴딧(Bandit) 문제로 모델링
-
학습 진척도 추정을 통한 새로운 실패 패턴 발견과 기존 약점 보완의 동적 균형
실무에서 볼 만한 점
에이전트 성능 향상을 위해 단순히 프롬프트만 고치는 것이 아니라, 어떤 테스트 케이스를 학습에 사용할지가 성능의 핵심임을 시사합니다.
읽을 때 확인할 점
-
고정된 벤치마크 데이터셋 대신 에이전트의 실패를 기반으로 한 동적 데이터 생성 파이프라인 구축
-
실패 패턴을 클러스터링하여 학습 우선순위를 결정하는 로직 실험
-
에이전트 성능 향상과 시나리오 난이도 사이의 상관관계 분석