PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

논문 ID: 2608.0510252 추천
#Agent#Reinforcement Learning#Credit Assignment#Search Agent#Vision#Evaluation
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

핵심 요약

정답으로부터 역추적하여 단계별 보상을 설계함으로써, 적은 데이터로도 고성능의 장기 탐색 에이전트를 학습시키는 프레임워크입니다.

상세 내용

기존의 장기 탐색 에이전트 학습 방식은 전체 경로를 동일하게 취급하여 유용한 행동과 불필요한 행동을 구분하지 못하는 문제가 있었습니다. 본 논문은 정답으로부터 중간 단서를 역추적하는 'Answer-Backtracked Clue Recovery'를 통해 희소한 결과값을 조밀한 단계별 보상으로 변환하는 ABC 프레임워크를 제안합니다. 이를 통해 실패한 경로에서도 유용한 행동은 보상하고 오류는 억제하는 정교한 신호 생성이 가능해집니다. 제안된 ABC-SFT와 ABC-GRPO를 적용하여 학습된 ABSeeker는 4B 규모의 모델임에도 불구하고 훨씬 큰 모델에 필적하는 성능을 달성했습니다. 결과적으로 정답 기반의 역추적 신호가 에이전트의 효율적인 학습에 핵심적임을 입증했습니다.

주요 내용

  • Answer-Backtracked Credit Assignment (ABC): 정답에서 역으로 단서를 복구하여 단계별 보상을 생성하는 프레임워크
  • Sparse-to-Dense: 결과 중심의 희소한 보상을 개별 스텝 단위의 조밀한 보상으로 변환
  • Efficiency: 8.5k의 적은 데이터로도 대형 모델 수준의 성능을 내는 고효율 학습 방식

실무에서 볼 만한 점

에이전트 학습 시 단순히 최종 결과만으로 보상을 주는 방식에서 벗어나, 중간 과정의 유효성을 정교하게 측정하는 방법론을 제시합니다.

참고할 행동

  • 정답 데이터가 있는 환경에서 역추적 기반의 중간 단서(Clue) 생성 로직 구현해보기
  • 기존 RL 방식과 제안된 단계별 보상 방식의 성능 차이 비교 실험
  • 적은 데이터셋(SFT) 환경에서 보상 가중치(Reweighting) 적용 실험