CUA-SWE: When Computer-Use Agents Meet Visual Software Engineering
코드 수정과 GUI 상호작용을 결합하여 소프트웨어의 동작을 검증하고 수리하는 통합 에이전트 벤치마크 제안
논문이 다루는 내용
기존의 코딩 에이전트와 컴퓨터 사용 에이전트는 서로 분리되어 연구되어 왔으며, 실제 개발 과정처럼 시각적 관찰과 코드 수정을 결합하는 통합적 프로세스 연구는 부족했습니다. 런타임 오류를 해결하려면 에이전트가 시각적 피드백과 코드를 연결하고, 수정 후 다시 애플리케이션을 실행하여 검증하는 능력이 필수적입니다. 본 논문은 CUA-SWE라는 새로운 벤치마크, 환경 및 평가 파이프라인을 소개합니다. 이 벤치마크는 코드/설정 수정, 명령 실행, GUI 상호작용을 동시에 수행하며 시각적 인터페이스를 통해 사양을 파악해야 하는 과제를 포함합니다. 실험을 통해 최첨단 에이전트들이 시각적 피드백과 소스 코드 실행을 어떻게 결합하여 소프트웨어를 수정하고 검증하는지 분석했습니다.
핵심 결과
-
코드 수정과 GUI 상호작용을 결합한 통합 소프트웨어 엔지니어링 벤치마크(CUA-SWE) 개발
-
시각적 피드백을 통한 오류 진단 및 수정 후 검증 능력을 평가하는 환경 구축
-
4개 도메인에 걸친 다양한 작업과 결정론적 테스트를 통한 실행 가능한 정답 검증
실무에서 볼 만한 점
단순히 코드만 짜는 에이전트를 넘어, 실제 사용자가 소프트웨어를 조작하며 버그를 잡는 것과 같은 'End-to-End' 자동화 개발 환경을 구축하는 데 중요한 지표를 제공합니다.
읽을 때 확인할 점
-
CUA-SWE 벤치마크를 활용하여 현재 사용 중인 LLM 에이전트의 시각적 디버깅 능력 테스트
-
GUI 피드백이 코드 수정 결정에 미치는 영향력을 정량적으로 분석
-
멀티모달 모델(Vision-Language)을 활용한 자동화된 QA 에이전트 워크플로우 설계