논문Hugging Face
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
논문 ID: 2608.01964120 추천
#LLM-Agent#Task-Management#Workflow-Automation#Agent#Reasoning#Vision
핵심 요약
에이전트의 컨텍스트 비대화 문제를 해결하기 위해 상태 관리와 실행을 분리하여 장기 작업 성공률을 높인 프레임워크
상세 내용
LLM 에이전트가 복잡한 장기 작업을 수행할 때, 모든 실행 기록을 하나의 컨텍스트에 담는 방식은 상태 추적을 어렵게 하고 잘못된 판단이 전파되는 문제를 야기합니다. 본 논문은 장기 실행 문제를 '태스크 상태 관리' 문제로 재정의하여 LongHorizon-Harness를 제안합니다. 이 프레임워크는 관리자(Manager), 실행자(Executor), 감사자(Auditor)가 역할을 분담하는 MEA 루프를 통해 상태를 명시적으로 관리하고 환경으로부터 검증된 사실만 업데이트합니다. 또한 AgentAdapter를 통해 기존 모델과 프레임워크를 수정 없이 교체할 수 있도록 설계되었습니다. 실험 결과, WeaveBench, Terminal-Bench, OSWorld 등 다양한 벤치마크에서 기존 방식 대비 성능이 크게 향상되었습니다.
주요 내용
- 상태 관리와 실행을 분리하여 컨텍스트 오염 및 오류 전파 방지
- Manage-Execute-Audit(MEA) 루프를 통한 명시적 태스크 상태 관리
- AgentAdapter를 통한 모델 및 하네스 백엔드의 유연한 교체 지원
실무에서 볼 만한 점
에이전트가 복잡한 워크플로우를 수행할 때 발생하는 '컨텍스트 누적에 따른 성능 저하' 문제를 해결하는 실질적인 아키텍처 패턴을 제시합니다.
참고할 행동
- 기존 에이전트 루프에 MEA(관리-실행-감사) 구조를 적용하여 성능 변화 비교
- 에이전트의 작업 기록을 요약하여 상태를 관리하는 방식과 비교 실험
- AgentAdapter 구조를 모방하여 모델 교체가 용이한 에이전트 프레임워크 설계