HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents
GUI의 범용성과 CLI의 효율성을 결합하여 컴퓨터 제어 에이전트의 작업 수행 능력을 극대화하는 하이브리드 학습 프레임워크 제안
논문이 다루는 내용
기존의 컴퓨터 사용 에이전트(CUA)는 GUI에만 의존하여 비효율적이거나, 특정 API를 활용하기 위해 과도한 엔지니어링 노력이 필요한 문제가 있었습니다. 본 논문은 GUI의 범용성과 CLI의 효율성을 결합한 하이브리드 방식이 차세대 에이전트의 핵심이라고 주장합니다. 이를 위해 GUI, CLI, 그리고 두 방식이 혼합된 형태의 트래젝토리를 생성하는 데이터 파이프라인을 구축했습니다. 구축된 HybridCUA-8K 데이터를 바탕으로 SFT와 CLI 활용 능력을 높이는 RLVR(Reinforcement Learning with Verifiable Rewards)의 2단계 학습 프레임워크를 제안합니다. 실험 결과, 제안 모델은 OSWorld 및 WindowsAgentArena 벤치마크에서 기존 베이스 모델 대비 유의미한 성능 향상을 달성했습니다.
핵심 결과
-
GUI와 CLI를 상황에 맞게 교차 사용하는 하이브리드 제어 패러다임 제안
-
GUI 전용, CLI 전용, 혼합형 트래젝토리를 포함하는 HybridCUA-8K 데이터셋 구축
-
SFT와 CLI 활용 효율성을 높이는 RLVR(Reinforcement Learning with Verifiable Rewards) 결합 학습
실무에서 볼 만한 점
에이전트가 단순 화면 클릭을 넘어 터미널 명령어를 적재적소에 활용함으로써 작업 속도와 정확도를 동시에 높이는 실질적인 방법론을 제시합니다.
읽을 때 확인할 점
-
제공된 데이터 파이프라인을 활용하여 특정 도메인 특화 하이브리드 데이터셋 생성 실험
-
GUI 중심 에이전트에 CLI 명령어를 결합했을 때의 작업 시간 단축 효과 측정
-
RLVR 보상 체계가 에이전트의 CLI 오남용을 얼마나 효과적으로 제어하는지 검증