Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding
분산형 멀티 에이전트 경로 탐색(MAPF)에서 샘플링 충돌 문제를 해결하기 위해 반복적 의도 정제(Iterative Intent Denoising) 방식을 도입한 프레임워크
논문이 다루는 내용
분산형 멀티 에이전트 경로 탐색(MAPF)은 부분 관측 환경에서 충돌 없이 개별 목표에 도달하는 것이 핵심입니다. 기존의 학습된 정책은 개별 에이전트의 행동 분포를 독립적으로 샘플링할 때, 유효한 개별 행동들이 결합되어 부적절한 공동 행동을 생성하는 문제가 발생합니다. 이를 해결하기 위해 DMM(Decentralized Master-Mind)은 확산 모델(Diffusion Model)의 데노이징 개념을 차용하여, 통신 라운드 동안 행동 의도를 반복적으로 정제하는 방식을 제안합니다. 에이전트들은 초기 무작위 의도를 설정한 후, 로컬 통신을 통해 서로의 선택을 결합하며 점진적으로 최적의 공동 행동을 도출합니다. 실험 결과, DMM은 높은 성공률과 낮은 비용을 달성하며 백만 개 이상의 에이전트 규모에서도 확장성을 보여주었습니다.
핵심 결과
-
분산형 환경에서 독립적 샘플링으로 인한 공동 행동 불일치 문제 해결
-
확산 모델의 데노이징에서 영감을 받은 반복적 의도 정제(Iterative Intent Denoising) 메커니즘 도입
-
MICPO(Critic-free group-relative RL)를 통한 효율적인 다중 라운드 행동 최적화
실무에서 볼 만한 점
에이전트 간의 중앙 통제 없이도 통신을 통해 어떻게 정교한 협업 행동을 생성할 수 있는지에 대한 아키텍처적 해법을 제시합니다.
읽을 때 확인할 점
-
기존의 One-shot 샘플링 방식과 DMM의 반복 정제 방식 간의 성공률 비교 실험
-
에이전트 밀도가 높아지는 환경에서의 통신 오버헤드 및 수렴 속도 측정
-
MICPO 알고리즘을 다른 멀티 에이전트 강화학습 환경에 적용하여 범용성 검증