논문
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
기업급 규모의 복잡한 데이터 환경에서 에이전트의 추론 및 실행 능력을 평가하기 위한 벤치마크 프레임워크 제안
논문이 다루는 내용
기존의 Text-to-SQL 벤치마크는 단일 테이블 중심의 단순 쿼리 생성에 치중되어 있어, 복잡한 기업용 워크플로우를 평가하기에 부족합니다. 본 논문은 235개의 테이블과 75억 개의 행을 포함하는 대규모 ERP 스키마 기반의 Argo-Bench를 소개합니다. 이 프레임워크는 단순 쿼리 생성을 넘어, 시뮬레이션된 경제 환경 내에서 계정 차단이나 예산 할당과 같은 실질적인 액션을 수행하도록 설계되었습니다. 실험 결과, 최신 모델들도 복잡한 데이터 탐색과 실행이 결합된 과제에서 낮은 성능을 보였습니다. 이는 에이전트가 실제 데이터 환경을 이해하고 행동하는 능력을 높이는 데 기여할 것입니다.
핵심 결과
-
235개 테이블, 75억 행 규모의 대규모 ERP 스키마 기반 시뮬레이션 환경 구축
-
단순 쿼리 생성을 넘어 시뮬레이터 내 결과(Consequences)로 성과를 측정하는 액션 중심 평가
-
데이터 탐색, 통계 분석, 의사결정 실행이 결합된 엔터프라이즈급 워크플로우 구현
실무에서 볼 만한 점
단순 SQL 생성을 넘어, 복잡한 스키마를 탐색하고 비즈니스 로직에 따라 액션을 수행해야 하는 실무형 AI 에이전트 개발의 기준을 제시합니다.
읽을 때 확인할 점
-
에이전트의 스키마 탐색 및 Fact Reconstruction 능력 테스트
-
복잡한 관계형 데이터베이스 환경에서의 멀티 스텝 추론 성능 비교
-
시뮬레이션 기반의 결과 중심(Outcome-based) 평가 루프 구축