AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
실제 소프트웨어 설치 없이 이미지 생성 모델을 활용해 고품질 GUI 상호작용 데이터를 합성하는 프레임워크
논문이 다루는 내용
GUI 에이전트 학습을 위해서는 다양한 환경에서의 상호작용 데이터가 필요하지만, 실제 소프트웨어를 설치하고 실행하는 데는 비용과 복잡성이 따릅니다. 이를 해결하기 위해 본 논문은 이미지 생성 모델의 시각적 사전 지식과 플래너의 작업 지식을 결합한 AutoGUIWorld 프레임워크를 제안합니다. 이 프레임워크는 OS 환경과 인터페이스 상태를 반영한 장면을 샘플링한 후, 플래너가 액션과 그에 따른 시각적 변화를 정의하면 이미지 생성기가 반복적으로 스크린샷을 편집하며 궤적을 생성합니다. 생성된 데이터를 통해 학습한 결과, OSWorld 및 ScienceBoard와 같은 실제 데스크톱 및 과학 작업 벤치마크에서 성능이 크게 향상되었습니다. 결과적으로 실제 환경 배포 없이도 풍부한 GUI 학습 데이터를 확보할 수 있음을 입증했습니다.
핵심 결과
-
이미지 생성 모델을 활용한 가상 GUI 환경 및 상호작용 궤적 합성 기술
-
실제 소프트웨어 설치/실행 없이도 다양한 OS(Ubuntu, Windows, macOS 등) 환경 데이터 확보 가능
-
플래너와 이미지 생성기를 결합하여 액션에 따른 시각적 변화를 정교하게 모사
실무에서 볼 만한 점
GUI 에이전트 개발 시 발생하는 데이터 수집 및 환경 구축 비용을 획기적으로 줄이면서도, 합성 데이터를 통해 모델의 일반화 성능을 높일 수 있습니다.
읽을 때 확인할 점
-
제시된 플래너-이미지 생성 루프를 활용한 합성 데이터 품질 검증 실험
-
특정 도메인(예: 디자인 툴) 전용 GUI 데이터셋 생성 시나리오 테스트
-
합성 데이터로 학습된 모델과 실제 환경 간의 도메인 격차(Sim-to-Real) 측정