논문Hugging Face
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
논문 ID: 2607.2895682 추천
#LLM-Agent#Benchmarking#E-commerce#Decision-Making#Agent#Benchmark#Evaluation#Inference
핵심 요약
장기적 의사결정 능력을 평가하기 위해 실제 이커머스 데이터를 기반으로 구축된 에이전트 벤치마크인 MerchantBench를 제안합니다.
상세 내용
최근 LLM 에이전트 평가가 단기적 작업 수행에 집중되어 있어, 장기적 일관성(Long-Term Coherence)을 측정하기 어렵다는 문제가 있습니다. 이를 해결하기 위해 의사결정이 미래의 선택을 제약하고 피드백이 지연되어 발생하는 복잡한 환경이 필요합니다. 본 논문은 98,843개의 실제 데이터를 기반으로 365일간의 주문 생애 주기를 시뮬레이션하는 MerchantBench를 도입합니다. 에이전트는 소싱, 가격 책정, 현금 소식 관리 등 상호 의존적인 과제를 수행하며 지연된 피드백에 적응해야 합니다. 실험 결과, 최신 LLM들은 인간 참가자 성과의 약 27.3% 수준에 머물며 장기적 의사결정 능력에서 큰 격차를 보였습니다.
주요 내용
- 실제 이커머스 데이터를 기반으로 한 365일 규모의 장기 시뮬레이션 환경 구축
- 지연된 피드백과 누적된 결과가 의사결정에 영향을 미치는 '장기적 일관성' 평가 프레임워크 제안
- 현존하는 최신 LLM 에이전트와 인간 사이의 의사결정 능력 격차 입증
실무에서 볼 만한 점
단순한 질의응답을 넘어, 시간이 내용에 따라 결과가 누적되는 복잡한 비즈니스 로직을 수행하는 에이전트 설계 시 필수적인 평가 기준을 제공합니다.
참고할 행동
- 제시된 26개 도구 환경에서 에이전트의 상태 관리(State Management) 전략 실험
- 지연된 피드백(Delayed Feedback) 상황에서의 에이전트 메모리 관리 기법 적용
- 장기적 목표 달성을 위한 계층적 의사결정(Hierarchical Decision-making) 구조 테스트