Marathoner: Ultra-Long-Horizon Autonomous Intelligence
수개월간 지속 가능한 초장기 목표 달성을 위해 설계된 에이전트 모델 학습 프레임워크
논문이 다루는 내용
인간은 장기적인 목표를 위해 수개월 이상 지속적으로 작업할 수 있는 능력을 갖추고 있습니다. 기존 모델들은 이러한 초장기 실행(Ultra-Long-Horizon) 능력이 부족하다는 문제가 있었습니다. 본 논문은 대규모 코드 PR 기반의 태스크 합성 및 멀티 태스크 체이닝을 통해 고난도 학습 데이터를 생성하는 Marathoner를 제안합니다. 학습 과정에서는 거절 샘플링(Rejection Sampling)과 독립된 샌드박스 환경에서의 강화학습을 결합하여 실질적인 실행 능력을 배양합니다. 특히 실행 후반부의 유의미한 동작을 장려하는 Later Stage Bonus Reward 전략을 도입했습니다. 실험 결과, Marathoner는 10시간 이상의 지속 작업과 1000회 이상의 도구 호출이 가능한 성능을 입증했습니다.
핵심 결과
-
GitHub의 대규모 PR 및 멀티 태스크 체이닝을 활용한 초고난도 태스크 합성 기법
-
독립된 샌드박스 환경에서의 실세계 실행 기반 강화학습(RL) 프레임워크
-
실행 후반부 성과를 독려하는 Later Stage Bonus Reward 전략 도입
실무에서 볼 만한 점
단순 질의응답을 넘어, 복잡한 소프트웨어 엔지니어링 프로젝트를 자율적으로 수행하는 에이전트 개발의 이정표를 제시합니다.
읽을 때 확인할 점
-
대규모 코드 베이스를 활용한 에이전트용 합성 데이터 생성 파이프라인 구축 실험
-
장기 실행 시 모델의 성능 저하를 막기 위한 보상 설계(Reward Shaping) 테스트
-
샌드박스 환경에서의 에이전트 실행 안정성 및 격리 환경 구축 검토