PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

논문 ID: 2607.2380269 추천
#Reinforcement Learning#LLM Self-Improvement#Multi-Agent#Task Transformation#Agent#Reasoning#Vision#Evaluation#Inference
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

핵심 요약

검증 가능한 프록시 태스크로 변환하여 오픈 엔드 작업에서도 RLVR(검증 가능한 보상)을 적용할 수 있는 새로운 학습 패러다임 제안

상세 내용

최근 수학이나 코딩처럼 정답이 명확한 영역에서는 RLVR이 효과적이지만, 주관적인 판단이 필요한 오픈 엔드 작업에서는 보상 모델의 편향과 비용 문제가 발생합니다. 이를 해결하기 위해 본 논문은 자기주도 학습 원리를 활용하여 오픈 엔드 태스크를 검증 가능한 프록시 환경으로 변형하는 RLSVR 방식을 제안합니다. 구체적인 사례로 'SpyRL'이라는 멀티 에이전트 게임 환경을 구축하여, 투표 결과와 같은 명확한 규칙을 통해 보상을 생성하도록 설계했습니다. 실험 결과, 제안된 방식은 요약, 창의적 글쓰기 등 비검증 태스크에서 기존 방식을 앞질렀으며 수학적 추론에서도 성능 향상을 보였습니다. 결과적으로 태스크 변환을 통해 RLVR의 확장성을 주관적 영역까지 넓힐 수 있음을 입증했습니다.

주요 내용

  • RLVR의 한계를 극복하기 위해 오픈 엔드 태스크를 검증 가능한 프록시 환경으로 변환하는 RLSVR 프레임워크 제안
  • SpyRL: 비대칭 정보와 투표 규칙을 활용하여 정답이 명확히 결정되는 멀티 에이전트 자기 대결(Self-play) 환경 구축
  • 비검증 태스크(글쓰기, 요약)와 검증 가능 태스크(수학) 모두에서 성능 향상을 입증하는 범용적 학습 방식

실무에서 볼 만한 점

정답이 없는 주관적 작업(글쓰기, 대화 등)을 정답이 있는 문제처럼 변형하여 LLM을 자동 학습시킬 수 있는 새로운 방법론을 제시합니다.

참고할 행동

  • 제시된 SpyRL 환경을 활용하여 멀티 에이전트 환경에서의 LLM 협업/경쟁 로직 테스트
  • 특정 도메인(예: 법률, 의료)의 문제를 검증 가능한 게임 형태로 변환 가능한지 검토
  • 기존 Reward Model 기반 학습과 RLSVR 방식의 보상 일치도 비교 실험