X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization
데이터에서 재사용 가능한 스킬 계층을 추출하여 에이전트의 일반화 성능을 높이는 X-Tree 학습 프레임워크
논문이 다루는 내용
기존의 멀티스텝 에이전트 학습은 평면적인 액션 스트림을 사용하여 반복되는 하위 절차나 계층적 구조를 충분히 활용하지 못하는 문제가 있습니다. 최근에는 컨텍스트 내 스킬 활용 방식이 제안되었으나, 이는 가중치에 반영되지 않아 일반화에 한계가 있습니다. 본 논문은 데이터 자체에서 계층 구조를 복구하는 X-Tree를 제안하며, 재사용 가능한 액션 스팬을 점수화하여 트리 구조로 병합합니다. 이를 오프라인 RL, 온라인 RLVR, 온폴리시 자기 증류(Self-distillation) 세 가지 설정에 통합하여 학습합니다. 실험 결과, WebArena 등 주요 벤치마크에서 기존 방식 대비 유의미한 성공률 향상을 달성했습니다.
핵심 결과
-
데이터 기반의 재사용 가능한 스킬 계층(X-Tree) 자동 추출 기술 개발
-
LLM 호출 없이 텍스트 토크나이저와 유사한 방식으로 스킬 구조를 학습 가중치에 반영
-
오프라인/온라인 RL 및 자기 증류 등 다양한 학습 환경에 적용 가능한 범용적 구조
실무에서 볼 만한 점
에이전트 학습 시 단순 데이터 증강을 넘어, 데이터 내에 숨겨진 '재사용 가능한 패턴'을 구조화하여 학습 효율을 극대화하는 방법을 제시합니다.
읽을 때 확인할 점
-
기존의 평면적 SFT 데이터셋에 X-Tree와 같은 계층적 구조를 적용하여 성능 변화 관찰
-
에이전트의 특정 작업(Task) 단위가 아닌, 하위 루틴(Sub-routine) 단위의 데이터 분할 실험
-
학습된 스킬 노드를 RL 보상 함수나 컨텍스트로 활용하는 파이프라인 구축