논문Hugging Face
AREX: Towards a Recursively Self-Improving Agent for Deep Research
논문 ID: 2607.21461115 추천
#AI Agent#Reinforcement Learning#Self-Improvement#Reasoning#Agent#Vision#Benchmark
핵심 요약
검증과 탐색의 비대칭성을 활용하여 스스로 정답을 정교화하는 재귀적 자기 개선(RSI) 연구 에이전트 프레임워크
상세 내용
심층 연구는 여러 제약 조건을 동시에 만족하는 답을 찾는 과정으로, 탐색 비용은 높지만 검증은 상대적으로 용이한 비대칭적 특성을 가집니다. 기존의 단순 검색 방식은 복잡한 문제 해결에 한계가 있어, 연구 에이전트가 중간 결과를 검증하고 이를 바탕으로 답을 개선하는 재귀적 구조가 필요합니다. 본 논문은 내적 연구 루프와 외적 자기 개선 루프를 교차 수행하는 AREX 프레임워크를 제안합니다. 특히 긴 작업 내용을 유지하기 위해 외부 모델 없이도 이력을 압축하는 자율 컨텍스트 업데이트 도구를 도입했습니다. 합성 데이터와 강화 학습을 통해 학습된 AREX는 다양한 벤치마크에서 동급 규모 모델 대비 압도적인 성능을 보여주었습니다.
주요 내용
- 검증-탐색 비대칭성을 활용한 재귀적 자기 개선(RSI) 루프 설계
- 증거와 미해결 제약 조건을 보존하며 이력을 압축하는 자율 컨텍스트 업데이트 도구 개발
- 희소 보상 문제를 해결하기 위한 결정적 단계 중심의 장기 강화 학습(RL) 전략
실무에서 볼 만한 점
단순한 RAG를 넘어, 에이전트가 스스로 작업 과정을 검토하고 오류를 수정하며 복잡한 문제를 해결하는 고도화된 워크플로우 설계 방식을 제시합니다.
참고할 행동
- 에이전트의 작업 이력을 요약/압축하는 컨텍스트 관리 로직 구현 실험
- 검증(Verification) 단계를 독립적인 모듈로 분리하여 에이전트 루프에 통합
- 중간 단계의 성공/실패를 보상으로 사용하는 강화 학습 스케줄링 테스트