PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

논문 ID: 2607.2895682 추천
#LLM-Agent#Benchmarking#E-commerce#Decision-Making#Agent#Benchmark#Evaluation#Inference
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

핵심 요약

장기적 의사결정 능력을 평가하기 위해 실제 이커머스 데이터를 기반으로 구축된 에이전트 벤치마크인 MerchantBench를 제안합니다.

상세 내용

최근 LLM 에이전트 평가가 단기적 작업 수행에 집중되어 있어, 장기적 일관성(Long-Term Coherence)을 측정하기 어렵다는 문제가 있습니다. 이를 해결하기 위해 의사결정이 미래의 선택을 제약하고 피드백이 지연되어 발생하는 복잡한 환경이 필요합니다. 본 논문은 98,843개의 실제 데이터를 기반으로 365일간의 주문 생애 주기를 시뮬레이션하는 MerchantBench를 도입합니다. 에이전트는 소싱, 가격 책정, 현금 소식 관리 등 상호 의존적인 과제를 수행하며 지연된 피드백에 적응해야 합니다. 실험 결과, 최신 LLM들은 인간 참가자 성과의 약 27.3% 수준에 머물며 장기적 의사결정 능력에서 큰 격차를 보였습니다.

주요 내용

  • 실제 이커머스 데이터를 기반으로 한 365일 규모의 장기 시뮬레이션 환경 구축
  • 지연된 피드백과 누적된 결과가 의사결정에 영향을 미치는 '장기적 일관성' 평가 프레임워크 제안
  • 현존하는 최신 LLM 에이전트와 인간 사이의 의사결정 능력 격차 입증

실무에서 볼 만한 점

단순한 질의응답을 넘어, 시간이 내용에 따라 결과가 누적되는 복잡한 비즈니스 로직을 수행하는 에이전트 설계 시 필수적인 평가 기준을 제공합니다.

참고할 행동

  • 제시된 26개 도구 환경에서 에이전트의 상태 관리(State Management) 전략 실험
  • 지연된 피드백(Delayed Feedback) 상황에서의 에이전트 메모리 관리 기법 적용
  • 장기적 목표 달성을 위한 계층적 의사결정(Hierarchical Decision-making) 구조 테스트