Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training
에이전트의 실패 경험을 진단 및 수정 데이터로 변환하여 성능을 높이는 5만 건 규모의 대규모 에이전트 오류 데이터셋과 학습 파이프라인 제안
논문이 다루는 내용
LLM 에이전트의 실패 과정에는 단순 보상값보다 더 풍부한 의사결정 정보가 포함되어 있지만, 이를 학습에 재사용하는 것은 여전히 어려운 과제입니다. 본 논문은 33개 환경과 23개 정책 모델을 아우르는 50,228개의 오류-진단 쌍을 포함하는 Agent Error Dataset(AED)을 소개합니다. 연구진은 실패를 수집하고, 진단 및 수정안을 생성하며, 이를 검증하는 5단계 AET(Agentic Error-to-Training) 파이프라인을 제안합니다. 실험 결과, 제안된 수정안을 통한 학습은 검증 통과율을 크게 향상시켰으며, 진단 중심의 미세 조정은 모델의 의사결정 일치도를 높였습니다. 최종적으로 에이전트의 실패 데이터를 체계적인 학습 데이터로 전환하는 효과적인 방법론을 입증했습니다.
핵심 결과
-
50,228개의 대규모 오류-진단 쌍을 포함하는 Agent Error Dataset(AED) 구축
-
실패 원인 분석부터 수정안 검증까지 이어지는 5단계 AET 파이프라인 제안
-
실패 경험을 활용한 진단(Diagnosis) 및 액터 복구(Actor Recovery) 학습 프레임워크 구축
실무에서 볼 만한 점
에이전트 개발 시 발생하는 실패 로그를 단순한 로그가 아닌, 모델의 성능을 개선할 수 있는 고품질 학습 데이터로 전환하는 실무적 방법론을 제공합니다.
읽을 때 확인할 점
-
에이전트 실행 로그에서 실패 시점의 관찰값과 액션을 추출하여 데이터셋화하기
-
실패 원인을 분석하는 '진단 모델'과 수정된 액션을 생성하는 '복구 모델'로 나누어 학습 실험하기
-
동일한 체크포인트에서 수정된 액션이 실제 환경에서 성공하는지 검증하는 루프 구축하기