PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

논문 ID: 2608.1979951 추천
#AI Agent#Software Engineering#Scientific Computing#Benchmark#Agent#RAG#Evaluation
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

핵심 요약

과학적 소프트웨어 엔지니어링 역량을 평가하기 위한 새로운 벤치마크인 SWE-bench Science를 제안하고 에이전트의 실패 원인을 분석함

상세 내용

과학 소프트웨어가 연구 결과의 신뢰성을 결정하는 핵심 도구가 됨에 따라, 기존의 일반적인 코딩 에이전트 평가로는 과학적 코드 수정 능력을 검증하기 어려워졌습니다. 본 논문은 20개 과학 도메인의 98개 저장소에서 추출한 119개 태스크로 구성된 SWE-bench Science 벤치마크를 도입합니다. 태스크는 이슈 기반, 전문가 탐색형, 엔지니어링 통합형의 세 가지 패러다임으로 구성됩니다. 실험 결과, 최고 성능의 에이전트조차 pass@1 성공률이 50% 미만으로 나타나 과학적 소프트웨어 엔지니어링의 난이도를 입증했습니다. 연구팀은 과학적 지식 부족, 표면적 수정, 시스템 통합 실패 등 네 가지 주요 실패 메커니즘을 식별했습니다. 최종적으로 본 벤치마크는 과학적 도메인 지식이 에이전트의 성능과 토큰 효율성에 미치는 영향을 분석하는 데 기여합니다.

주요 내용

  • 20개 과학 도메인 및 98개 저장소를 아우르는 119개 태스크 규모의 벤치마크 구축
  • 과학적 지식 부족, 잘못된 탐색, 불완전한 통합 등 에이전트의 4가지 실패 메커니즘 규명
  • 도메인 지식 제공이 에이전트의 성능과 토큰 효율성에 미치는 양면적 영향 분석

실무에서 볼 만한 점

도메인 특화 소프트웨어(과학, 의료 등)를 다루는 코딩 에이전트 개발 시, 단순 코드 작성을 넘어 전문 지식과 시스템 통합 능력을 어떻게 평가하고 결합할지에 대한 가이드라인을 제공합니다.

참고할 행동

  • 제시된 4가지 실패 메커니즘을 기반으로 현재 사용 중인 코딩 에이전트의 취약점 테스트
  • 도메인 지식(Scientific Guidance)을 프롬프트에 포함했을 때의 성능 변화 및 토큰 비용 분석
  • SWE-bench Science 데이터셋을 활용하여 에이전트의 추론 능력과 도메인 지식 간의 상관관계 실험