CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents
에이전트의 능력 변화와 라우팅 전략을 동시에 최적화하여 성능과 효율성을 모두 잡은 공진화형 MoA 프레임워크
논문이 다루는 내용
기존의 Mixture-of-Agents(MoA) 방식은 쿼리 라우팅과 에이전트 미세 조정이 분리되어 있어, 에이전트의 능력이 변할 때 라우팅 전략이 이를 따라가지 못하는 문제가 있었습니다. 이를 해결하기 위해 에이전트 정책과 동적 라우터가 서로 상호작용하며 발전하는 CERA-MoA 프레임워크를 제안합니다. 중간 레이어의 은닉 상태를 활용한 '예측 친숙도 추정기'를 통해 전체 추론 과정 없이도 에이전트의 역량을 평가합니다. 또한 누적 임계값 기반의 적응형 라우팅을 통해 최소한의 에이전트만 활성화하여 효율성을 확보합니다. 실험 결과, CERA-MoA는 기존의 정적 라우팅 및 고정 워크플로우 방식보다 뛰어난 성능과 효율성을 입증했습니다.
핵심 결과
-
라우터와 에이전트 정책이 상호 보완하며 발전하는 반복적 강화학습 프레임워크 설계
-
중간 레이어 은닉 상태를 활용해 연산 오버헤드를 최소화한 에이전트 역량 평가 메커니즘
-
에이전트별 역량 차별화를 유도하는 타겟팅된 데이터 할당 및 적응형 라우팅 전략
실무에서 볼 만한 점
에이전트 모델이 업데이트될 때마다 라우팅 로직을 수동으로 재설계할 필요 없이, 자동화된 학습 루프를 통해 최적의 에이전트 조합을 유지할 수 있습니다.
읽을 때 확인할 점
-
중간 레이어 특징(Hidden States) 추출 시 발생하는 연산 비용 측정 실험
-
에이전트 수가 증가함에 따라 라우팅 효율성이 어떻게 변하는지 벤치마크 테스트
-
특정 도메인 데이터로 에이전트 전문화(Specialization)가 발생하는지 시각화 분석