논문Hugging Face
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
논문 ID: 2607.2967713 추천
#Agent#Document-Extraction#Benchmark#VLM#Evaluation
핵심 요약
기업용 문서 추출 성능을 정밀하게 측정하기 위해 정확도, 완전성, 근거(Grounding), 비용을 통합 평가하는 벤치마크인 ExtractBench를 제안합니다.
상세 내용
기업 워크플로우에서 스키마 기반 문서 추출 에이전트의 중요성이 커지고 있으나, 이를 종합적으로 평가할 기준이 부족했습니다. 본 논문은 값의 정확도, 레코드 완전성, 근거 제시 능력, 비용을 동시에 측정하는 ExtractBench를 제안합니다. 370개의 기업 문서와 4,869개 페이지를 포함한 대규모 데이터셋을 구축하여 다양한 비즈니스 도메인을 반영했습니다. 실험 결과, 상용 VLM은 긴 문서에서 데이터 누락 문제가 발생했으나, LlamaExtract Agentic Plus는 높은 정확도와 비용 효율성을 동시에 달며 우수한 성능을 보였습니다. 이 벤치마크는 스키마 기반 추출 에이전트의 성능을 검증하는 표준을 제공합니다.
주요 내용
- 정확도, 완전성, 근거(Grounding), 비용을 통합한 최초의 스키마 기반 추출 벤치마크 제안
- 다양한 도메인과 문서 유형을 포함한 4,869페이지 규모의 대규모 데이터셋 구축
- 단순 값 추출을 넘어 소스 추적성(Word/Page-level F1)을 포함한 정밀 평가 체계 도입
실무에서 볼 만한 점
LLM 기반 문서 추출 에이전트 구축 시, 단순 정확도를 넘어 비용 대비 효율성과 데이터 누락 문제를 실무적으로 검증할 수 있는 기준을 제공합니다.
참고할 행동
- 제공된 데이터셋을 활용하여 현재 사용 중인 VLM/Agent의 추출 성능 테스트
- 긴 문서 처리 시 발생하는 데이터 누락(Truncation) 현상에 대한 벤치마크 적용
- LlamaExtract와 같은 에이전트 방식과 일반 VLM 방식의 비용 대비 성능 비교 실험