논문Hugging Face
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
논문 ID: 2608.09802115 추천
#AI Agent#Code Refactoring#Benchmark#Software Engineering#Agent#RAG#Evaluation
핵심 요약
기존 벤치마크의 테스트 결함과 데이터 오염 문제를 해결한 대규모 다국어 코드 리팩토링 벤치마크 제안
상세 내용
최근 AI 코딩 에이전트가 복잡한 작업을 수행함에 따라 기존 벤치마크의 테스트 품질 저하와 데이터 오염 문제가 심각해지고 있습니다. 특히 기존 벤치마크는 테스트가 너무 좁거나 넓어 정확한 평가가 어렵고, 모델이 학습 데이터를 그대로 복제하는 문제가 존재합니다. 이를 해결하기 위해 본 논문은 7개 언어를 지원하며 정교하게 큐레이션된 170개의 리팩토링 작업인 SWE-Bench ProMax를 도입합니다. 모든 인스턴스는 모호함을 제거하기 위해 이슈 설명이 새로 작성되었으며, 테스트 스위트 또한 수동 검토를 거쳐 정밀도를 높였습니다. 실험 결과, 최신 모델들의 해결률이 41.2%에 그쳐 기존 벤치마크보다 훨씬 도전적이고 유효한 평가 도구임을 입증했습니다.
주요 내용
- 실제 커밋 기반의 7개 프로그래밍 언어(Python, Java, TS, Go, C, C++, Rust) 지원
- 테스트 결함 및 모호한 요구사항을 제거하기 위한 엄격한 다단계 큐레이션 프로세스 적용
- 파일 간 협업이 필요한 대규모 리팩토링 작업(평균 11.4개 파일 수정) 중심의 고난도 과제 구성
실무에서 볼 만한 점
단순 코드 생성을 넘어, 여러 파일을 동시에 수정해야 하는 실제 소프트웨어 엔지니어링 워크플로를 평가할 수 있는 기준을 제공합니다.
참고할 행동
- Hugging Face에서 제공하는 SWE-Bench ProMax 데이터셋을 다운로드하여 모델 성능 테스트
- 현재 사용 중인 코딩 에이전트의 다중 파일 수정 능력을 해당 벤치마크로 검증
- 에이전트의 리팩토링 성능 향상을 위한 프롬프트 엔지니어링 전략 수립