OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software
과학적 소프트웨어 활용 능력을 평가하기 위해 전문 워크플로우와 검증 가능한 결과물을 결합한 에이전트 벤치마크 OSWorld-Science를 제안합니다.
논문이 다루는 내용
기존의 시각 언어 모델(VLM) 기반 에이전트는 복잡한 과학적 인터페이스와 전문적인 워크플로우를 처리하는 데 한계가 있습니다. 이를 해결하기 위해 과학적 가치와 난이도를 고려하여 설계된 벤치마크인 OSWorld-Science를 도입합니다. 이 벤치마크는 분자 구조 설계, 병리 이미지 분석 등 다양한 도메인의 146개 고품질 태스크와 실행 기반의 검증 시스템을 포함합니다. 실험 결과, 최신 VLM 모델들도 전문적인 과학적 워크플로우를 완수하는 데 여전히 많은 어려움을 겪는 것으로 나타났습니다. 본 연구는 에이전트의 역량과 하네스 설계를 체계적으로 평가할 수 있는 통합 프레임워크를 제공합니다.
핵심 결과
-
과학적 도메인 특화 워크플로우(분자 설계, 통계, 시뮬레이션 등)를 포함한 146개 태스크 벤치마크 구축
-
생성된 결과물(구조, 마스크, 플롯 등)을 직접 검증하는 실행 기반의 정밀 평가 방식 도입
-
모델 어댑터, 상호작용 루프 제어, 궤적 로깅을 통합한 효율적인 에이전트 하네스 개발
실무에서 볼 만한 점
전문 소프트웨어를 사용하는 에이전트 개발 시, 단순 텍스트 응답을 넘어 실제 소프트웨어 상태와 결과물을 검증하는 데 데 필요한 프레임워크 설계 방식을 배울 수 있습니다.
읽을 때 확인할 점
-
제시된 146개 태스크 중 특정 도메인(예: 통계 컴퓨팅)에 대한 모델 성능 비교 실험
-
에이전트의 상호작용 전략(Interaction Strategy) 변화에 따른 성공률 변화 분석
-
부분 점수(Partial Credit) 시스템이 모델의 학습/평가에 미치는 영향 검토