논문Hugging Face
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
논문 ID: 2607.2046537 추천
#LLM#Data Engineering#Fine-tuning#Benchmark#Agent#Evaluation#Safety
핵심 요약
LLM을 활용한 학습 데이터 구축 및 품질 평가 능력을 통합적으로 측정하는 벤치마크 프레임워크 제안
상세 내용
LLM의 성능은 학습 데이터의 품질에 좌우되지만, 데이터 준비 과정을 통합적으로 평가할 벤치마크는 부족한 실정입니다. 본 논문은 데이터 구축(raw source -> supervised data)과 데이터 품질 평가(학습 가치 예측)를 동시에 측정하는 DataPrep-Bench를 제안합니다. 데이터 구축 능력은 생성된 데이터를 통한 모델 파인튜닝 성능으로, 품질 평가는 실제 다운스트림 성능과의 상관관계로 측정하는 하향식(downstream-grounded) 프로토콜을 적용했습니다. 실험 결과, 제안된 Data-Construction-Skill 에이전트와 DAS(Distributional Alignment Score) 지표는 기존 방식보다 뛰어난 성능을 보였습니다. 결과적으로 본 연구는 데이터 준비 과정을 LLM의 핵심 역량으로 정의하고 이를 측정할 수 있는 체계를 제공합니다.
주요 내용
- 데이터 구축(Construction)과 품질 평가(Evaluation)를 통합한 최초의 하향식 벤치마크 'DataPrep-Bench' 개발
- 데이터 생성 결과물을 실제 파인튜닝에 활용하여 성능 변화를 측정하는 실질적 평가 프로토콜 도입
- 분포 정렬 점수(DAS)를 통해 기존 휴리스틱 방식보다 뛰어난 데이터 품질 예측 성능 입증
실무에서 볼 만한 점
LLM을 이용해 학습 데이터를 자동 생성하거나 필터링할 때, 생성된 데이터가 실제 모델 성능 향상에 얼마나 기여할지 객관적으로 검증할 수 있는 기준을 제공합니다.
참고할 행동
- 자체 보유한 데이터셋에 DAS(Distributional Alignment Score)를 적용하여 데이터 품질 측정해보기
- LLM 기반 데이터 생성 파이프라인에 Data-Construction-Skill과 같은 에이전트 방식 도입 검토
- 생성된 데이터로 소규모 파인튜닝을 수행하여 벤치마크의 하향식 평가 방식 재현해보기