Beyond Dyadic Memory: Interaction-Aware Multimodal Memory with Adaptive Agentic Retrieval for Multi-Party Spoken Conversations
다자간 음성 대화에서 화자 식별과 상호작용 관계를 보존하며 정보를 관리하는 멀티모달 메모리 프레임워크 제안
논문이 다루는 내용
기존의 장기 메모리 연구는 주로 1:1 텍스트나 이미지-텍스트 대화에 집중되어 있어, 다자간 음성 대화 환경에서의 메모리 관리는 미개척 영역으로 남아 있습니다. 다자간 환경에서는 대화 내용뿐만 아니라 참여자 식별 및 화자 간의 상호작용 관계를 유지하는 것이 필수적입니다. 본 논문은 Incremental Speaker ID와 상호작용/사실/참여자 프로필로 구성된 계층적 메모리를 결합한 VoxPolyMem 프레임워크를 제안합니다. 에이전트가 증거를 바탕으로 쿼리를 재작성하고 적절한 메모리 계층을 선택하는 순차적 의사결정 방식을 도입하였으며, 상호 보완적 증거 획득을 위해 Evidence-Gain GRPO(EG-GRPO)를 제안합니다. 실험 결과, 제안된 프레임워크는 새로운 벤치마크인 VoxPolyBench에서 기존 베이스라인을 크게 상회하는 성능을 기록하며 다자간 대화에서의 잠재력을 입증했습니다.
핵심 결과
-
상호작용 중심의 계층적 메모리 구조(Interaction, Fact, Participant Profiles) 설계
-
에이전트가 스스로 쿼리 및 도구를 선택하는 순차적 의사결정 기반의 RAG 메커니즘
-
상호 보완적 증거 확보를 위한 새로운 강화학습 알고리즘(EG-GRPO) 도입
실무에서 볼 만한 점
회의록 자동 생성이나 다자간 협업 에이전트 개발 시, 누가 누구에게 말했는지와 같은 복잡한 관계 정보를 관리하는 데 직접적인 영감을 제공합니다.
읽을 때 확인할 점
-
제공된 VoxPolyBench 데이터셋을 활용한 다자간 대화 시나리오 테스트
-
계층적 메모리 구조(Fact vs Interaction) 간의 정보 간섭 현상 분석
-
EG-GRPO 알고리즘을 기존 RAG 파이프라인에 이식하여 성능 변화 관찰