논문Hugging Face
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
논문 ID: 2608.0598764 추천
#Agentic RL#Credit Assignment#Self-Distillation#Reinforcement Learning#Agent#Vision#Evaluation#Distillation
핵심 요약
희소한 보상 환경에서 에이전트의 결정적 순간을 식별하여 정교한 신용 할당(Credit Assignment)을 수행하는 재귀적 자기 증류 기법
상세 내용
장기적인 에이전트 작업에서 결과 중심의 보상은 결정적인 의사결정 순간을 정확히 식별하는 데 어려움이 있습니다. 기존의 자기 증류 방식은 국소적인 신호 제공에는 유용하지만, 순차적인 신용 할당을 어떻게 표현할지에 대한 과제가 남아있습니다. 본 논문은 별도의 Critic 없이 토큰 간 로그 확률 차이를 활용하여 턴 단위의 신용을 할당하는 AgentOPSD를 제안합니다. 이 방법은 베이지안 신념 상태를 재귀적으로 업데이트하여 희소한 결과를 턴 단위의 신용 신호로 변환합니다. 실험 결과, ALFWorld 등에서 기존 GRPO 및 자기 증류 베이스라인을 상회하는 성능을 기록했습니다.
주요 내용
- Critic 없이 토큰 수준의 로그 확률 차이를 활용한 턴 단위 신용 할당 방식 제안
- 베이지안 신념 업데이트를 통한 재귀적이고 원칙적인 신용 재가중(Reweighting) 스킴 도입
- 추가적인 Critic 모델이나 추가 롤아웃 없이 표준 정책 최적화와 호환 가능
실무에서 볼 만한 점
에이전트가 복잡한 태스크를 수행할 때 어떤 단계가 성공/실패의 핵심이었는지 명확히 구분하여 학습 효율을 극대화할 수 있습니다.
참고할 행동
- Qwen2.5와 같은 오픈 소스 모델에 GRPO와 비교 실험 수행
- 에이전트 작업의 턴 길이에 따른 신용 할당 정확도 변화 측정
- 베이지안 업데이트 파라미터가 학습 안정성에 미치는 영향 분석