Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents
노이즈가 많은 멀티모달 대화 기록 대신 명시적인 '증거 장부(Evidence Ledger)'를 활용하여 에이전트의 계획 능력을 극대화한 프레임워크
논문이 다루는 내용
멀티모달 에이전트는 비디오, 오디오, 웹 등 다양한 소스에서 증거를 수집해야 하지만, 누적되는 대화 기록의 노이즈가 계획 수립을 방해하는 문제가 있습니다. 연구진은 대화 기록 대신 누락된 정보, 확인된 정보, 충돌하는 정보를 기록하는 '증거 장부(Evidence Ledger)' 방식을 제안합니다. 크리틱(Critic) 모델이 노이즈를 필터링하여 유효한 정보만 장부에 기록함으로써 플래너가 압축된 컨텍스트에서 작업할 수 있게 합니다. 또한, 각 단계의 상태와 행동을 기록한 트래젝터리를 바탕으로 SFT와 RL을 수행하여 계획 능력을 고도화했습니다. 그 결과, Gemini-1.5-Pro 대비 훨씬 낮은 비용으로 SOTA 수준의 성능을 달성했습니다.
핵심 결과
-
증거 장부(Evidence Ledger) 도입: 대화 기록 대신 명시적인 증거 상태를 관리하여 컨텍스트 노이즈 제거
-
크리틱 기반 필터링: 노이즈가 섞인 관찰값에서 유효한 정보만 추출하여 플래너의 부하 감소
-
Decision-level RL: 단계별 상태와 행동을 기록하여 계획 수립 능력을 최적화하는 학습 방식 적용
실무에서 볼 만한 점
에이전트의 컨텍스트가 길어질수록 발생하는 성능 저하 문제를 해결하기 위해, 대화 기록 전체를 넘기는 대신 구조화된 상태(State)를 관리하는 설계 패턴의 중요성을 보여줍니다.
읽을 때 확인할 점
-
Long-context 에이전트 구축 시 대화 기록 대신 구조화된 JSON 형태의 '상태 장부'를 관리하는 아키텍처 실험
-
Perception 모델과 Planner 모델 사이의 정보 필터링 레이어(Critic) 성능 비교 실험
-
SFT/RL 적용을 위한 단계별 행동-결과 트래젝터리 데이터셋 구축 실험