PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

논문 ID: 2607.2252929 추천
#LLM#Agent#Reinforcement Learning#Self-Evolution#RAG#Reasoning#Benchmark#Evaluation
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

핵심 요약

에이전트 스킬을 동적으로 생성 및 검증하여 모델의 성능 한계를 돌파하는 자기 진화형 프레임워크

상세 내용

LLM 학습이 수동 설계에서 상호작용 기반의 자기 진화로 변화하고 있으나, 작업의 다양성과 검증의 신뢰성 사이의 트레이드오프 문제가 존재합니다. 기존 방식은 특정 도메인에 갇히거나 검증 불가능한 데이터로 인해 학습 루프가 오염되는 한계가 있습니다. 본 논문은 스킬을 매개체로 삼아 정밀한 검증과 개방형 탐색을 동시에 달성하는 Skill-SP 프레임워크를 제안합니다. Proposer, Solver, Skill Controller가 RL 루프 내에서 서로 상호작용하며 스킬 라이브러리를 확장하고 문제를 생성합니다. 실험 결과, Skill-SP는 도구 사용 및 추론 벤치마크에서 기존 모델의 성능을 끌어올리고 초기 성능이 낮은 모델의 비약적인 발전을 이끌었습니다.

주요 내용

  • 스킬(Skill)을 활용해 정밀한 검증과 광범위한 작업 다양성을 동시에 확보
  • Proposer(문제 생성), Solver(해결), Skill Controller(스킬 확장) 간의 상호 진화 루프 구축
  • RL 기반의 자기 진화(Self-play)를 통해 모델의 성능 한계를 지속적으로 확장

실무에서 볼 만한 점

에이전트가 특정 도구 사용이나 복잡한 추론 능력을 스스로 학습하고 확장할 수 있는 체계적인 방법론을 제시합니다.

참고할 행동

  • 제공된 GitHub 코드를 활용하여 특정 도구 사용(Tool-use) 태스크에 적용해보기
  • 초기 성능이 낮은 모델을 베이스라인으로 설정하여 성능 향상 폭 확인하기
  • 스킬 라이브러리 확장 방식이 모델의 일반화 성능에 미치는 영향 분석하기