PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

논문 ID: 2607.2860948 추천
#Agent#VLM#Reinforcement Learning#Benchmark#Reasoning#Vision#Evaluation#Safety
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

핵심 요약

컴퓨터 사용 에이전트(CUA) 평가를 위한 표준 벤치마크 OSReward와 저비용·고성능 보상 모델 OS-Shepherd를 제안합니다.

상세 내용

컴퓨터 사용 에이전트(CUA)의 발전으로 작업 수행 여부를 검증하는 것이 중요해졌으나, 인간 대신 VLM을 판사로 사용하는 방식의 신뢰성 문제는 미해결 과제로 남아있었습니다. 본 논문은 다양한 플랫폼의 에이전트 궤적을 포함하는 고품질 적합성 벤치마크인 OSReward를 도입하여 VLM 판사의 성능을 체계적으로 분석했습니다. 연구 결과, 최신 모델들조차 실패를 성공으로 오판하는 '관용 편향(leniency bias)' 문제를 보이며 신뢰도가 낮음을 확인했습니다. 이를 해결하기 위해 연구진은 추론 주석이 포함된 10만 개의 데이터셋(OS-Shepherd-100K)을 구축하고, 이를 학습한 저비용·고성능 보상 모델인 OS-Shepherd를 공개했습니다. 결과적으로 제안된 모델은 상용 모델 수준의 성능을 유지하면서도 비용을 30~60% 절감할 수 있음을 입증했습니다.

주요 내용

  • CUA 궤적 검증을 위한 고품질 벤치마크 OSReward 및 난이도별 데이터셋(Hard, Multi) 구축
  • 기존 VLM 판사들이 가진 체계적인 관용 편향(Leniency Bias) 발견 및 분석
  • 저비용·고성능 보상 모델 OS-Shepherd(9B, 35B) 및 대규모 학습 데이터셋 공개

실무에서 볼 만한 점

에이전트 학습 시 인간의 개입 없이 자동화된 보상(Reward) 신호를 생성할 수 있는 신뢰할 수 있는 방법론을 제공합니다.

참고할 행동

  • 공개된 OSReward 벤치마크를 사용하여 현재 사용 중인 VLM 판사의 편향성 테스트
  • OS-Shepherd 모델을 기존 에이전트 RL(강화학습) 루프에 적용하여 비용 효율성 검증
  • 제공된 OS-Shepherd-100K 데이터셋을 활용한 도메인 특화 보상 모델 파인튜닝